微软创新项目Project Rumi：多模态AI项目助力理解人类意图

2023-08-07 09:40 · 稿源：站长之家

站长之家（ChinaZ.com）8月7日消息:Project Rumi 是微软的一个项目，旨在通过解决大型语言模型（LLM）理解非语言线索和上下文细微差别的局限性，增强 LLM 的能力。

该项目将非语言线索融入基于提示的 LLM 交互中，以提高交流的质量。研究人员使用音频和视频模型从数据流中检测实时的非语言线索。使用两个独立的模型分别从用户音频中提取声调和语音的语义信息。研究人员使用视觉转换器对视频进行编码，并从中识别面部表情。下游服务将非语言线索信息融入基于文本的提示中。这种多模态方法旨在增强用户情感和意图的理解，从而将人工智能与人类的互动提升到一个新的水平。

论文地址:https://www.microsoft.com/en-us/research/project/project-rumi/

未来，研究人员计划改进模型的效率，并添加更多细节，如从标准视频中获取的心率变异性（HRV）和认知和环境感知。这是在下一波与人工智能的交互中增加无言意义和意图的更大努力的一部分。

要点:

1. Project Rumi 旨在通过增加语言模型对非语言线索和语境细微差别的理解能力，提升大型语言模型的能力。

2. 该项目采用多模态方法，通过音频和视频模型检测实时的非语言线索，以提高与语言模型的交互质量。

3. 未来的研究计划包括进一步改进模型，并添加心率变异性和环境感知等更多细节，以实现与人工智能的更深层次的交互。

（举报）

微软创新项目Project Rumi：多模态AI项目助力理解人类意图

AI创企Reka发布多模态AI助手Yasa-1，欲与ChatGPT竞争

OpenAI多模态AI系统GPT-Vision即将推出与谷歌Gemini竞争

荐多模态大模型MMICL霸榜支持文本图像视频输入

ChatGPT推出语音和图像多模态功能预计未来两周内上线

荐重磅！OpenAI将发布DALL·E 3，多模态ChatGPT来了！

荐AI视野：多模态ChatGPT即将上线；抖音“AI美式证件照”走红；百度发布交通大模型“ACE3.0”

多模态大模型KOSMOS-2.5 擅长处理文本密集图像

实现输入到输出「模态自由」, NUS华人团队开源NExT-GPT，最接近AGI的大一统多模态大模型来了

荐GPT-5来了？OpenAI被曝加急训练多模态大模型Gobi，一举狙杀谷歌Gimini！

生数科技发布自研多模态通用大模型同时推出PixWeaver、VoxCraft等工具

今日大家都在搜的词：

热文

小鹏机器人会走猫步太像人了！小鹏发布新一代人形机器人IRON

女性人形机器人里藏真人？何小鹏回应：并亲自证清白

iPhone 18 Pro或缩小灵动岛苹果正测试特殊挖孔方案

AI日报：Sora正式登陆Android；网易云音乐推AI调音大师；谷歌将

小米YU7全网首拆上热搜雷军回应：欢迎同行和专家指点

华为Mate70 Air官宣今日开启预售

AI日报：HeyGen发布AI视频翻译引擎；科大讯飞推星火 X1.5；QQ浏

OPPO Reno15系列官宣11月10日发布

AI日报：上海首例涉AI提示词著作权案宣判；Kimi K2 Thinking发

何小鹏回应机器人IRON里是真人质疑：感谢认可

站长商机