首页 > 业界 > 关键词  > 多模态大模型最新资讯  > 正文

GPT-4o再暴露「弱智」缺陷,大模型无一幸免,港中文等发布「视觉听觉」基准AV-Odyssey:26个任务直指死角问题

2024-12-11 14:43 · 稿源:新智元公众号

多模态大模型在听觉上,居然也出现了「9.119.8」的现象,音量大小这种简单问题都识别不了!港中文、斯坦福等大学联合发布的AV-Odyssey基准测试,包含26个视听任务,覆盖了7种声音属性,跨越了10个不同领域,确保测试的深度和广度。在人工智能领域,我们一直以为顶尖的多模态大模型已

......

本文由站长之家合作伙伴自媒体作者“新智元公众号”授权发布于站长之家平台,本平台仅提供信息索引服务。由于内容发布时间超过平台更新维护时间,为了保证文章信息的及时性,内容观点的准确性,平台将不提供完全的内容展现,本页面内容仅为平台搜索索引使用。需阅读完整内容的用户,请查看原文,获取内容详情。

举报

  • 相关推荐
  • 天下苦闭源模型久矣,MiniMax H3要做多模态领域的Deepseek

    2026年8月3日,港股MINIMAX-W(00100.HK)报HK$249.4,涨幅超10%。当日早盘,MiniMax盘前正式宣布发布新一代多模态生成模型H3。市场用真金白银为这次产品发布投了一票。 A 天下苦闭源模型久矣,视频生成赛道此前由Seedance、可灵等头部模型主导,价格、算力、生成时间也一直是行业关注比较高的的话题。 MiniMax发布的H3,正是视频生成市场的一个全新选择。 官方博客中表示,定位H3

  • 云蝶科技科研团队最新成果在机器学习全球顶会ICML 2026发表,POLIA让多模态模型从“答对”走向“看对”

    云蝶科技在ICML2026提出POLIA方法,解决多模态大模型常忽视关键视觉信息、依赖语言猜答案的问题。核心创新是增加视觉对象级细粒度评价,分阶段评估答案正确性与证据可靠性,实现从“奖励正确答案”到“奖励正确使用视觉证据”的转变。在七项基准测试中大幅提升准确率,且计算开销低。该研究为具身智能的视觉证据建模与强化学习提供基础,依托联合实验室推动从算法验证走向真实场景应用。

  • 腾讯音乐公布2026Q2财报:营收89.3亿元 持续丰富音乐+音频生态收购

    今日,腾讯音乐娱乐集团(TME)公布2026年第二季度未经审计财务业绩,同时也是收购喜马拉雅后首份季报。 2026年第二季度,腾讯音乐总收入为89.3亿元,同比增长5.8%;调整后净利润为27.8亿元,同比增长5.3%;经调整的EBITDA为32.5亿元,同比增长5.2%。 从收入构成来看,腾讯音乐音乐相关服务收入同比增长11%至76.1亿元。 其中,音乐相关会员服务收入达47.9亿元,同比增长8.1%,喜

  • MiniMax H3视频模型正式开源:全模态理解输入,最高生成2K 视频

    MiniMax 今日正式开源新一代通用视频模型 MiniMax H3,这款模型被定位为通用型全模态生成系统,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并生成最高2K 分辨率、最长15秒、带原生立体声音频的视频内容。 得益于以任务泛化为导向的系统设计,H3在预训练阶段便具备了广泛的多模态上下文理解与生成能力,官方称其能够出色地遵循复杂的多模态指令。输出规�

  • 华为nova 16 SE支持星闪音频:最高4.6Mbps母带级无损音质

    日前,华为nova 16系列新成员nova 16 SE正式发布,售价2499元起,将于8月12日开售。 华为官网信息显示,nova 16 SE支持星闪E2.0,可实现星闪音频传输,最高支持4.6Mbps母带级无损音质,能够保留更多声音细节,带来更加真实、细腻的听感。

  • 阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别大模型

    阿里发布新一代语音识别大模型 Qwen-Audio-3.0-ASR-Flash,重点优化了专业词汇的识别表现。该模型已在医疗等垂直场景中展现出较高准确率,相关听写准确率突破九成五。 语音识别在通用对话中已相对成熟,但在医学、法律、工业等专业领域,由于术语密集且发音相近词多,模型常常出现误判。此次新模型强化了对专业词的处理能力,使其更贴合真实行业场景的需求。

  • 《云上Agent基准度量模型》正式发布,腾讯云推动云上Agent安全、稳定、可信

    《云上Agent基准度量模型》正式发布,腾讯云旗下WorkBuddy等产品首批通过认证。该标准由中国信通院牵头,从功能、安全、可靠等六大维度评估Agent,并引入“双重授权”与分级人机协作机制,为自动化操作设定可控边界,推动Agent从“能完成任务”走向“可稳定运行”。腾讯云基于丰富的产品矩阵与安全实践参与编制,为金融、政务等高安全场景提供了可量化的建设参考。

  • 全栈AI巨头盘点:联想、阿里、华为、百度贯通算力‑大模型‑终端‑行业方案‑生态

    中国AI正加速推进算力、大模型与终端协同。联想以万全异构智算平台与问天超节点为训练推理底座,通过词元中枢统一调度模型,天禧AI连通PC、手机与平板,并以城市、制造智能体落地行业。阿里以平头哥芯片和阿里云为核心,千问模型贯通应用与终端。华为依托昇腾与盘古模型,连接鸿蒙终端与行业场景。百度则以昆仑芯和文心大模型,延伸至小度与智能驾驶。四家企业全栈路径各异,但均在真实业务中持续交付。

  • 企业AI落地:从大模型走向本体驱动的超级组织

    企业部署大模型后仍难落地,根因是缺乏统一业务语义与执行闭环。文章提出,企业AI真正的底层是“本体论+大模型+智能体AI”三层架构:本体定义业务对象与关系,让AI理解企业;大模型负责推理;智能体在治理框架内执行动作。以Orion AIP为例,通过构建统一本体、融合数据与规则,可实现风险分析等场景下的“感知-分析-决策-行动”闭环,让AI从对话工具进化为能工作、可追溯、可信赖的组织核心。

  • 腾讯元宝上线Hy ASR 3.0 preview语音识别模型:各种方言、复杂环境都能听清

    腾讯混元日前正式推出Hy ASR 3.0 preview语音识别模型,已率先落地腾讯元宝App面向全部用户免费使用。 依托Hy3基座大模型打通声学识别与语义理解,彻底摆脱传统语音识别生硬转写短板,在多方言口音、嘈杂收音、远距离拾音等复杂场景稳定输出精准文本。 模型完成10大方言片区、20余个细分方言覆盖,粤语、吴语、西南官话、中原官话等日常口语均可直接对话交互,用户不需

今日大家都在搜的词: