首页 > 原创 > 关键词  > AI日报最新资讯  > 正文

AI日报:黑森林实验室放出Flux3;Claude Opus现已支持语音模式;快手入局AI互动内容赛道

2026-07-24 16:05 · 稿源:站长之家

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解https://app.aibase.com/zh

1、黑森林实验室放出 Flux3:首个原生生成音频的多模态基础模型,20 秒音画同步一次成型

黑森林实验室发布的Flux3多模态基础模型,首次实现了原生音频生成,并在音视频同步、图像生成和动作控制方面表现出色,展现了其在人工智能领域的领先地位。

image.png

【AiBase提要:】

🧠 Flux3是首个支持原生音频生成的多模态基础模型,能够一次生成20秒的音视频同步片段。

📊 在早期测试中,Flux3在多个基准测试中表现优于其他顶尖模型,如Luma Ray3.2和Runway Gen-4.5。

🤖 Flux3还与Mimic Robotics合作开发了面向机器人领域的动作模型Flux-mimic,已在奥迪工厂进行生产任务测试。

2、Claude Opus现已支持语音模式:从随口问答升级成能调工具、换语言的实时参谋

Claude 语音模式的升级显著提升了其处理复杂问题的能力,同时增加了对多种模型和工具的支持,使用户能够更高效地利用语音交互完成任务。

image.png

【AiBase提要:】

🧠 Claude 语音模式升级,支持 Opus、Sonnet 和 Haiku 模型,提升复杂问题处理能力。

🛠️ 支持连接 Gmail、Slack 等工具,实现语音指令执行任务,如修改日程、生成文档等。

🌐 扩展多语言支持,允许用户在对话中切换语言,但需手动设置。

3、快手入局AI互动内容赛道,开放首批创作者招募

快手正式宣布推出‘AI互动内容’创作功能,标志着短视频平台竞争从传统内容时长延伸至交互式体验领域。该功能依托大模型,允许用户通过文字输入、选项选择主动参与内容走向,打破传统短视频单向传播模式。业内分析认为,这是快手在短视频存量竞争下的关键落子,旨在提升用户留存和推荐算法反哺。

【AiBase提要:】

🤖 快手推出AI互动内容创作功能,开放首批合作创作者招募。

🕹️ AI互动内容依托大模型打造,用户可主动参与内容走向,打破传统短视频单向传播模式。

📈 业内分析认为,快手此举是在短视频存量竞争下的关键落子,旨在提升用户留存和推荐算法反哺。

4、小鹏人形机器人广州工厂开启小批量试生产 预计2026年实现量产

小鹏人形机器人广州工厂正式开启小批量试生产,标志着其量产冲刺进入倒计时。公司计划在2026年实现量产,并逐步应用于全球门店及商业场景,通过整合集团核心能力加速商业化落地。

【AiBase提要:】

🚀 小鹏人形机器人在广州工厂开启小批量试生产,量产产线进入最后联调阶段。

💼 小鹏集团董事长何小鹏亲自兼任机器人业务CEO,推动商业化落地进程。

🌐 小鹏计划在2026年实现人形机器人量产,并逐步进驻全球门店及商业场景。

5、腾讯混元合二为一:多模态与大语言模型部门合并,姚顺雨统管冲全模态上限

腾讯宣布将混元多模态模型部门与大语言模型部门合并,设立基础模型部,由姚顺雨统一管理。此举旨在提升模型研发与协同效率,探索全模态模型的智能上限。

【AiBase提要:】

🧠 腾讯将混元多模态模型部门与大语言模型部门合并,设立基础模型部,由姚顺雨统一管理。

🚀 合并旨在提升模型研发与协同效率,探索全模态模型的智能上限。

📊 姚顺雨此前已兼任大语言模型部负责人,此次合并标志着腾讯在混元技术路线上的进一步整合。

6、微软自研双模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash发布:不蒸馏第三方,已落地Bing和PowerPoint

微软推出自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,分别面向高质量图像生成和高并发语音交互场景,强调训练数据可追踪且不依赖第三方模型蒸馏。两款模型已在多个产品中落地,并显著提升了效率和成本效益。

image.png

【AiBase提要:】

🧠 MAI-Image-2.5-Pro是微软自研的高精度图像生成模型,支持自然语言编辑指令,已在Bing Image Creator和PowerPoint中应用。

🔊 MAI-Voice-2-Flash是优化的语音模型,速度提升2倍,成本降低32%,已应用于T-Mobile等客户。

📊 MAI-Transcribe-1.5已用于医疗解决方案,处理2800万次患者问诊记录,支持58种语言,错误率下降50%。

7、腾讯甩出 WorkBuddy Bench:一套把代码、网页、办公、安全全装进来的编码智能体考场

腾讯推出 WorkBuddy Bench 多领域评测套件,涵盖代码、网页、办公和安全四个领域,任务均从真实场景逆向工程而来,防止背答案。评测方式多样,强调抗污染能力,并公开数据集以提升透明度。

【AiBase提要:】

📌 WorkBuddy Bench 跨越代码、网页、办公和安全四大领域,共260个任务,防止背答案。

💡 每个任务均从真实场景逆向工程生成,确保任务提示词无法通过网络搜索获取。

🔒 评测采用多维度评分机制,包括规则检查、LLM/VLM 评判及智能体评判,确保公平性。

8、阿里开源0.8B文档解析模型OvisOCR2,端到端方案登顶OmniDocBench

阿里开源的OvisOCR2模型在文档解析领域取得重大突破,以0.8B参数规模实现端到端解析,超越传统流水线方法,为RAG检索、智能问答和企业知识库提供高效支持。

image.png

【AiBase提要:】

✅ OvisOCR2是首个全面超越传统流水线方法的端到端文档解析模型。

💡 模型结合真实与合成数据,通过多种技术手段提升性能。

🚀 该模型已开源,兼容主流推理框架,降低高精度文档解析门槛。

举报

  • 相关推荐
  • 天下苦闭源模型久矣,MiniMax H3要做多模态领域的Deepseek

    2026年8月3日,港股MINIMAX-W(00100.HK)报HK$249.4,涨幅超10%。当日早盘,MiniMax盘前正式宣布发布新一代多模态生成模型H3。市场用真金白银为这次产品发布投了一票。 A 天下苦闭源模型久矣,视频生成赛道此前由Seedance、可灵等头部模型主导,价格、算力、生成时间也一直是行业关注比较高的的话题。 MiniMax发布的H3,正是视频生成市场的一个全新选择。 官方博客中表示,定位H3

  • 腾讯音乐公布2026Q2财报:营收89.3亿元 持续丰富音乐+音频生态收购

    今日,腾讯音乐娱乐集团(TME)公布2026年第二季度未经审计财务业绩,同时也是收购喜马拉雅后首份季报。 2026年第二季度,腾讯音乐总收入为89.3亿元,同比增长5.8%;调整后净利润为27.8亿元,同比增长5.3%;经调整的EBITDA为32.5亿元,同比增长5.2%。 从收入构成来看,腾讯音乐音乐相关服务收入同比增长11%至76.1亿元。 其中,音乐相关会员服务收入达47.9亿元,同比增长8.1%,喜

  • 能生成MV/音乐视频的AI音乐模型推荐:音潮V4.0、Suno、Udio 音乐模型、视频模型边界厘清

    文章澄清“能生成MV的AI音乐模型”易误解:Suno、Udio等只出音频,可灵、Runway等只出画面;真正音画同源一体化产品很少,音潮是国产落地较完整代表,其V4.0升级指令理解、纯音乐开放、十大语种覆盖,并支持一键MV与商用。选购需先分清三类边界,按需求匹配。

  • 云蝶科技科研团队最新成果在机器学习全球顶会ICML 2026发表,POLIA让多模态模型从“答对”走向“看对”

    云蝶科技在ICML2026提出POLIA方法,解决多模态大模型常忽视关键视觉信息、依赖语言猜答案的问题。核心创新是增加视觉对象级细粒度评价,分阶段评估答案正确性与证据可靠性,实现从“奖励正确答案”到“奖励正确使用视觉证据”的转变。在七项基准测试中大幅提升准确率,且计算开销低。该研究为具身智能的视觉证据建模与强化学习提供基础,依托联合实验室推动从算法验证走向真实场景应用。

  • 从生成画面到讲述故事:4款AI漫剧分镜自动生成工具分享

    AI漫画分镜自动生成工具正解决行业核心瓶颈。传统分镜师稀缺、成本高、周期长,制约发展。目前工具分为四种模式:Updream的工作流式、即梦的单镜头式、剪映的模板式和小云雀的平台式,分别侧重全流程覆盖、单图质量、上手速度和团队协作。这一技术正将分镜从专业稀缺技能转变为普惠基础设施,使行业竞争焦点从“能不能做”转向“做得好不好”,最终比拼创意与叙事。

  • 2026年AI音乐生成大模型怎么选?音潮V4.0、Suno V5.5、Udio能力解析

    2026年AI音乐生成大模型竞争转向指令理解、语种覆盖、合规与接口生态。音潮V4.0重构语义理解,支持10语种,开放纯音乐和API,限时免费、成本低且已备案;Suno V5.5仍是英文技术标杆,但中文与版权存短板;Udio强在音质编辑,Mureka偏接口化生产。选型应结合中文/多语种、纯音乐、合规与成本等场景。

  • 南极冰川现“神秘生物”系AI生成 视频多处细节不符合物理规律

    南极冰川惊现黑色长尾生物?这样的视频你信了吗?近日网传“神秘黑色生物爬上南极冰墙”的视频系由AI生成。视频多处细节不符合物理世界规律。该视频源自发布AI视频的账号,其主页声明内容均为AI生成。 视频中,一只黑色长尾生物在南极冰墙上攀爬,画面逼真,不少网友信以为真。但仔细看就会发现破绽——生物的运动轨迹不符合重力规律,光影变化也有矛盾之处。事实�

  • 华为nova 16 SE支持星闪音频:最高4.6Mbps母带级无损音质

    日前,华为nova 16系列新成员nova 16 SE正式发布,售价2499元起,将于8月12日开售。 华为官网信息显示,nova 16 SE支持星闪E2.0,可实现星闪音频传输,最高支持4.6Mbps母带级无损音质,能够保留更多声音细节,带来更加真实、细腻的听感。

  • GEOBase:在生成式搜索时代,为品牌装上一张“AI 认知雷达”

    文章指出AI时代用户从搜索转向AI问答,品牌可能被AI忽略,传统SEO失效且新规则不透明。GEOBase作为AI认知看板,可量化品牌在AI回答中的曝光度、声量占比、提及位次和口碑,并追溯引用来源,帮助品牌从盲猜转向数据驱动的内容优化,让品牌被AI“看见”。

  • 一键生成MV怎么做?音潮V4.0、Suno+Kaiber、即梦AI 实测推荐

    文章实测2026年一键生成MV三条路径:音潮单平台从写歌到成片全闭环,约12分钟出片,V4.0提升音乐情绪还原与音画同步精度;Suno+Kaiber画面上限高但需手动对齐,约70分钟;即梦AI适合数字人对口型。选型看速度、画风自由度和中文歌词呈现,中文歌曲及效率优先推荐音潮,追求画面自由选组合方案,虚拟形象演唱选即梦AI。

今日大家都在搜的词: