首页 > 传媒 > 关键词  > AI技术最新资讯  > 正文

掘金AI Talk演讲实录:网易伏羲AOP框架在《永劫无间》手游Copilot的应用实践

2024-08-27 15:20 · 稿源: 站长之家用户

8月24日,“掘金AI Talk沙龙-深圳站”在深圳湾创新科技中心成功举办。作为稀土掘金AI社区定期举办的系列AI分享活动之一,本期沙龙的主题为《AI Agent 技术突破和应用实践》。网易伏羲受邀分享AI Agent前沿技术成果和独 家实践心得,与众多行业专家和AI爱好者共同探讨AI Agent技术的未来发展。

沙龙现场,网易伏羲AOP框架技术负责人Joysy带来了《AOP框架在手游Copi lot的应用实践》主题分享,围绕游戏Copi lot在《永劫无间》手游中的具体应用实践,Joysy介绍了AOP框架如何助力游戏智能化,展示了如何通过AI技术提升玩家体验并优化游戏性能。

以下为演讲实录:

大家下午好,我是来自网易伏羲的Joysy,很高兴能够在此与大家分享和交流。今天我分享的主题是《AOP框架在手游Copi lot的应用实践》。

PART1:AOP框架缘起

首先,我想简单介绍一下网易伏羲。网易伏羲成立于2017年9月,是网易旗下的人工智能研究机构。自成立以来,我们一直致力于利用前沿人工智能技术释放劳动者的生产力,探索人机协作的全新时代。

我们坚信,未来人类与AI的关系应当是协作而不是替代。在“人机协作,万物有灵”的愿景下,网易伏羲正在探索如何将AI技术应用于更多实体产业,通过创新性研发AOP框架(Agent-Oriented-Programming,面向智能体编程),构建了可以直接面向智能体发布和运营各种任务的网易伏羲有灵AOP平台,希望能够借此实现“让每一个人都可以从事自由有趣的工作”的使命愿景。

作为中国首 个游戏人工智能实验室,网易伏羲在游戏AI领域取得了诸多创新性的成就。我们率先在行业内实现了AI照片捏脸功能,首创了智能养育系统、AI故事接龙玩法、文字捏脸等前沿玩法,并接连研发出了AI游戏剧情动画、AI游戏匹配、AI反外挂等一系列创新应用,助力《逆水寒》手游实现了文字捏脸、智能NPC、剧组模式等突破性的AI应用。可以说,网易伏羲通过不断的实践创新,持续引领着游戏AI的发展方向,并进一步丰富了玩家的游戏体验。近期,网易伏羲有灵AOP平台更是助力《永劫无间》手游打造了全球首创的游戏Copi lot AI队友,一经上线便受到了广泛好评。

PART2:游戏Copi lot应用实践

接下来,我将详细介绍我们在《永劫无间》手游中实现的Copi lot队友。

在游戏以往的人机设计中,机器人是比较呆板的,基本上是按照设定的目标或者自己的思路去打,不太会和玩家进行交流互动。另外,一些“社恐”的玩家不希望与真人开麦语音,但仍有社交和多人对战的诉求;再者,玩家在玩游戏时经常会匹配到一些坑爹的队友,比如队友比较菜或者战斗中不能很好地配合,导致整场对局打得比较郁闷,甚至有想摔手机的冲动。在这些情况下,玩家可能会去一些陪玩平台找一个能陪自己聊天同时技术又很牛逼的陪玩,去满足玩家的情绪价值。

为了满足这些需求,网易伏羲助力《永劫无间》手游推出了全球首创的游戏Copi lot——多模态实时交互的语音AI队友,它能在战斗中自主跑图、战斗、听指令、报战况,还能和玩家进行自由对话,给玩家带来极 高的情绪价值,对于新手玩家,语音AI队友还能进行教学引导。

这里有几段视频展示了AI队友在游戏中的实际表现。正如大家所见,AI队友不仅能指挥战斗、跑图、搜物资、汇报战况,还能与玩家自由交流,给予玩家较高的情绪价值。

为了实现这样的效果,我们为AI队友设计了丰富的人设选项,例如彩虹皮萌妹、温柔体贴御姐以及温暖深情暖男等。这些具有鲜明个性的AI队友不仅能够与玩家建立复杂的互动关系,还能根据不同的游戏情境展现出独特的性格特点,进一步增强游戏的沉浸感和互动体验。

以Agent教学问答功能为例,我们构建了一个强大的知识库,包含了游戏静态知识(如规则、机制)和动态知识(如赛事信息)。当玩家提出问题时,AI会先通过Embedding模型将问题转化为向量,接着在知识向量化库中进行搜索,找到最匹配的答案。如果答案不明确,则会借助RAG和LLM等高 级模型进行深度检索和推理,最终给出准确的回答。

那么,我们是怎么实现多智能体协同的呢?为了实现这一目标,我们在多智能体的设计上借鉴了人类大脑的运作机制。就像大脑中不同区域各自负责视觉、味觉、触觉、行走和平衡等功能一样,我们为每个智能体赋予了明确的职责,并确保它们能够有效协作。这种设计理念不仅提高了系统的整体效能,还使得智能体之间的交互更加自然和流畅。

在这个场景中,Agent不仅能够感知游戏战场环境的状态变化,还能通过移动端硬件传感器接收并理解玩家的语音指令。在接收到这些状态信息之后,Agent会利用自身的认知与决策能力,结合游戏领域相关知识库和战斗记忆,对环境状态和语音输入做出合理的行动决策动作以及相应的语音反馈。

在实现AI队友的过程中,我们首先需要解决的问题就是让Agent能够听得懂玩家所说的内容,确保AI能够准确捕捉并理解玩家的意图。为此,我们采用了无需唤醒的全开麦实时语音交流模式。这种模式虽然极大地提升了用户体验,但也带来了一些挑战,比如环境噪音、不同移动设备的兼容性、玩家的方言差异以及专业术语等问题。

为了解决这些问题,我们基于AOP框架的核心能力构建了一个自主数据闭环训练模型,使Agent具备自主进化的能力,包括构建标准测试集以及有效利用测试及线上数据不断扩充数据集,从而推动模型迭代。

PART3:AOP框架核心能力

最后,我想和大家一起聊聊AOP框架的核心能力。在介绍AOP框架核心能力之前,我们需要先明确AOP的概念。AOP(Agent-Oriented-Programming,面向智能体编程) 是网易伏羲设计的一套全新的编程范式,接近自然语言编程、快捷定义任务,其核心价值在于为开发者对接智能体(拥有AI和人的能力)提供了统一范式的接口和服务,并自动构建数据闭环让智能体具备自主进化能力。开发者可通过 AOP 使用伏羲有灵机器人平台预置的公共智能体能力(包括 ChatGPT、Midjourney 等预训练模型,以及数据标注、美术制作、工程机械操控等众包能力),也可针对行业细分场景定制化构建智能体应用。

AOP的设计思想,是基于马尔可夫决策过程(Markov Decision Processes,MDP)的定义来进行任务建模,即Agent(智能体,包括人类或机器)在进行某个任务时,首先会和环境进行交互,产生新的状态(State),同时环境会给予相应的奖励(Reward),这一过程循环往复,Agent与环境之间的交互产生了大量的数据。Agent利用这些新数据不断调整自身的行为策略。经过多次迭代后,Agent便能够学习到完成特定任务所需的最 佳动作策略。

那么,AOP框架在《永劫无间》手游Copi lot的应用具体是什么样的呢?基于网易伏羲有灵AOP平台所打造的多模态实时交互的语音AI队友Agent,可以集成语音识别、语义理解、人设对话大模型、语音生成、强化学习、模仿学习等多项智能体能力。

基于Agent的记忆能力,AI队友与玩家可以实现超越单场对局的情感社交,以及跨越多类型游戏角色的社交关系。同时,在战斗中语音AI队友能实时感知战场环境的状态变化,做出合理拟人化的行为决策,真正是一个“能感知”、“会表达”和“懂执行”的靠谱AI队友。

有灵AOP平台在打造语音AI队友Agent的过程中,除了大幅提升研发效能以外,还能借助人类智能体轻松实现数据闭环,充分利用研发以及日常测试进程中的数据进行闭环训练,自动更新模型。为实现玩家与AI队友的丝滑语音交互,我们使用有灵AOP平台的模型量化、推理加速、逻辑优化等多项工程技术,将端到端交互响应时间控制在800ms以内,相比行业语音大模型的单模型推理速度有显著优势。

目前,网易伏羲AOP框架已成功应用于多个案例之中。例如,基于网易伏羲AOP人机协作的数据闭环提升文字捏脸效果,我们在《逆水寒》手游中首创文字捏脸,并在《永劫无间》手游中进一步发展,首创交互式捏脸玩法;基于AOP人机协作的数据闭环提升AI绘画效果,成功为《永劫无间》打造“AI智绘·时装共创”玩法;此外,AOP框架在人设对话RLHF方面也取得了显著成果,通过网易伏羲有灵众包平台,我们有效提升了对话系统的质量。在这个过程中,我们使用了实时对话、对比和修改创作等方法,对AI的对话表现进行了优化。这种人机协作的方式,使我们的AI角色能够更自然、更贴近真实地与玩家进行互动,创造出更具吸引力的游戏体验。

最后,我想与大家分享下网易伏羲的最 新动态:网易伏羲AOP SDK即将迈入首 次内测阶段。在此,我们衷心邀请所有对此技术充满兴趣的朋友们扫码参与,也欢迎全球范围内的开发者和合作伙伴加入我们,共同探索智能体技术的新边界。我们相信,网易伏羲AOP SDK将成为开发者的强大助手,帮助大家简化复杂功能的实现过程,打造更加智能、更具响应性的游戏世界,为玩家带来比较罕见的沉浸感和互动体验。

展望未来,我们期待这项技术能够在更广阔的领域内激发创新,触及更多行业、影响更广泛的领域。网易伏羲也将继续秉承“人机协作,万物有灵,让每一个人都可以从事自由有趣的工作”的愿景,携手合作伙伴,共同推动构建一个智能化、互联互通的世界,加速AI技术与实体产业深度融合,为未来社会的数字化转型贡献力量。

推广

特别声明:以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。站长之家将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时,可及时向站长之家提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明(点击查看反馈联系地址)。本网站在收到上述法律文件后,将会依法依规核实信息,沟通删除相关内容或断开相关链接。

  • 相关推荐
  • 大家在看
  • Graphite Reviewer:AI代码审查伴侣

    Graphite Reviewer是一个AI代码审查工具,它通过即时反馈帮助团队提高代码审查的效率和质量。该工具利用代码库感知AI,自动检测代码中的bug和错误,使团队能够专注于构建而不是审查。它支持自定义规则,保证代码质量和一致性,同时确保代码的私密性和安全性。Graphite Reviewer的主要优点包括快速合并PR、强化质量和一致性、保持代码私密和安全、捕捉常见错误等。

  • Character SDK:构建可实时互动的AI角色

    Character SDK是一个能够创建AI角色的平台,这些角色可以实时听、说、看,甚至采取行动。它通过实时语音和视觉识别、高级OCR处理、多语言交流、自适应推理和基于意图的任务自动化等技术,帮助企业提高效率,减少成本,并提供个性化的用户体验。

  • Temperstack:一站式SRE平台,提升服务可靠性。

    Temperstack是一个企业级的主动式SRE平台,旨在减少SRE的重复劳动,提高服务的可靠性。它通过自动化服务目录、警报审计和跨您的监控工具的SLI报告,为从CTO到SRE工程师的团队提供可见性、主动发现问题并促进协作。Temperstack集成了流行的监控工具,提供统一的命令界面,以实现全面的SRE可见性和行动。

  • o1-engineer:命令行工具,提升开发效率

    o1-engineer 是一个命令行工具,旨在帮助开发者通过 OpenAI 的 API 高效地管理和交互项目。它提供了代码生成、文件编辑、项目规划等功能,以简化开发工作流程。

  • Canvas:与ChatGPT协作的新方式

    Canvas是OpenAI推出的一个新界面,旨在通过与ChatGPT的协作来改进写作和编码项目。它允许用户在一个单独的窗口中与ChatGPT一起工作,超越了简单的聊天界面。Canvas利用GPT-4o模型,能够更好地理解用户的上下文,并提供内联反馈和建议。它支持直接编辑文本或代码,并提供快捷操作菜单,帮助用户调整写作长度、调试代码等。Canvas还支持版本回溯,帮助用户管理项目的不同版本。

  • Text Behind Image:轻松创建文字背景图片设计。

    Text Behind Image 是一个开源的设计工具,允许用户轻松创建文字背景图片设计。它提供了一个简洁的界面,让用户可以自由地在图片上添加文字,创造出独特的视觉效果。这个工具对于设计师、社交媒体运营者和内容创作者来说非常有用,因为它可以快速生成具有吸引力的视觉内容。

  • torchao:PyTorch原生量化和稀疏性训练与推理库

    torchao是PyTorch的一个库,专注于自定义数据类型和优化,支持量化和稀疏化权重、梯度、优化器和激活函数,用于推理和训练。它与torch.compile()和FSDP2兼容,能够为大多数PyTorch模型提供加速。torchao旨在通过量化感知训练(QAT)和后训练量化(PTQ)等技术,提高模型的推理速度和内存效率,同时尽量减小精度损失。

  • LFMs:新一代生成式AI模型

    Liquid Foundation Models (LFMs) 是一系列新型的生成式AI模型,它们在各种规模上都达到了最先进的性能,同时保持了更小的内存占用和更高效的推理效率。LFMs 利用动态系统理论、信号处理和数值线性代数的计算单元,可以处理包括视频、音频、文本、时间序列和信号在内的任何类型的序列数据。这些模型是通用的AI模型,旨在处理大规模的序列多模态数据,实现高级推理,并做出可靠的决策。

  • NVLM-D-72B:前沿的多模态大型语言模型

    NVLM-D-72B是NVIDIA推出的一款多模态大型语言模型,专注于视觉-语言任务,并且通过多模态训练提升了文本性能。该模型在视觉-语言基准测试中取得了与业界领先模型相媲美的成绩。

  • gradio-bot:将Hugging Face Space或Gradio应用转化为Discord机器人

    gradio-bot是一个可以将Hugging Face Space或Gradio应用转化为Discord机器人的工具。它允许开发者通过简单的命令行操作,将现有的机器学习模型或应用快速部署到Discord平台上,实现自动化交互。这不仅提高了应用的可达性,还为开发者提供了一个与用户直接交互的新渠道。

  • AI-Powered Meeting Summarizer:会议语音转文本并自动生成摘要的AI工具

    AI-Powered Meeting Summarizer是一个基于Gradio的网站应用,能够将会议录音转换为文本,并使用whisper.cpp进行音频到文本的转换,以及Ollama服务器进行文本摘要。该工具非常适合快速提取会议中的关键点、决策和行动项目。

  • VARAG:视觉增强的检索与生成系统

    VARAG是一个支持多种检索技术的系统,优化了文本、图像和多模态文档检索的不同用例。它通过将文档页面作为图像嵌入,简化了传统的检索流程,并使用先进的视觉语言模型进行编码,提高了检索的准确性和效率。VARAG的主要优点在于它能够处理复杂的视觉和文本内容,为文档检索提供强大的支持。

  • JoyHallo:数字人模型,支持生成普通话视频

    JoyHallo是一个数字人模型,专为普通话视频生成而设计。它通过收集来自京东健康国际有限公司员工的29小时普通话视频,创建了jdh-Hallo数据集。该数据集覆盖了不同年龄和说话风格,包括对话和专业医疗话题。JoyHallo模型采用中国wav2vec2模型进行音频特征嵌入,并提出了一种半解耦结构来捕捉唇部、表情和姿态特征之间的相互关系,提高了信息利用效率,并加快了推理速度14.3%。此外,JoyHallo在生成英语视频方面也表现出色,展现了卓越的跨语言生成能力。

  • PhysGen:基于物理的图像到视频生成技术

    PhysGen是一个创新的图像到视频生成方法,它能够将单张图片和输入条件(例如,对图片中物体施加的力和扭矩)转换成现实、物理上合理且时间上连贯的视频。该技术通过将基于模型的物理模拟与数据驱动的视频生成过程相结合,实现了在图像空间中的动态模拟。PhysGen的主要优点包括生成的视频在物理和外观上都显得逼真,并且可以精确控制,通过定量比较和全面的用户研究,展示了其在现有数据驱动的图像到视频生成工作中的优越性。

  • Whisper large-v3-turbo:高效自动语音识别模型

    Whisper large-v3-turbo是OpenAI提出的一种先进的自动语音识别(ASR)和语音翻译模型。它在超过500万小时的标记数据上进行训练,能够在零样本设置中泛化到许多数据集和领域。该模型是Whisper large-v3的微调版本,解码层从32减少到4,以提高速度,但可能会略微降低质量。

  • Realtime API:低延迟的实时语音交互API

    Realtime API 是 OpenAI 推出的一款低延迟语音交互API,它允许开发者在应用程序中构建快速的语音到语音体验。该API支持自然语音到语音对话,并可处理中断,类似于ChatGPT的高级语音模式。它通过WebSocket连接,支持功能调用,使得语音助手能够响应用户请求,触发动作或引入新上下文。该API的推出,意味着开发者不再需要组合多个模型来构建语音体验,而是可以通过单一API调用实现自然对话体验。

  • Saylo AI:探索无限的AI角色扮演游戏。

    Saylo AI是一个AI角色扮演游戏,让你与AI角色互动,探索多样化的戏剧性故事。它利用人工智能技术,提供沉浸式的互动体验,让玩家在虚拟世界中与AI朋友交流,体验不同的故事情节。Saylo AI的背景信息展示了其创新性和娱乐性,旨在为玩家提供一种全新的娱乐方式。目前产品处于推广阶段,价格未明确标注。

  • twinny:Visual Studio Code的免费且私密的AI扩展

    twinny是一个为Visual Studio Code用户设计的AI扩展,旨在提供个性化的编程辅助,提高开发效率。它通过集成先进的AI技术,帮助开发者在编码过程中快速解决问题,优化代码,并提供智能提示。twinny的背景是响应开发者对于更加智能和自动化编程工具的需求,它通过简化开发流程,减少重复劳动,从而让开发者能够专注于更有创造性的工作。

  • Buildpad:构建人们真正想要的产品

    Buildpad 是一个旨在帮助创始人从概念到成功最小可行产品(MVP)的在线平台。它通过提供智能验证工具、AI引导的开发流程、进度跟踪以及个性化的项目见解,帮助用户构建能够获得市场认可的产品。Buildpad 的主要优点包括简化产品开发流程、提高产品成功率、以及提供个性化的指导和支持。

  • Novela:AI时代的技能学习平台

    Novela是一个专注于AI时代技能学习的在线平台,提供早期访问服务,用户可以免费试用。它旨在帮助用户掌握AI相关的技能,以适应未来职场的需求。

今日大家都在搜的词: