首页 > AI头条  > 正文

字节 Seed 甩出 SeedRealtime:音视频全双工大模型上车豆包,边看边听边说不再"卡拍"

2026-08-05 13:49 · 来源: AIbase基地

字节 Seed 团队发布了 SeedRealtime,一个用统一架构原生把音频、视频和文本揉在一起的全双工大模型,主打"边看、边听、边说"的实时自然交互。它已经不在实验室里——这套能力已在豆包 App 全量上线,率先把音视频全双工技术推到了规模化落地的位置。

image.png

和传统的级联方案相比,SeedRealtime 最核心的差别在架构。级联系统通常是"听—转写—想—说"逐段拼接,感知和表达分属不同模块,对话节奏容易打架;SeedRealtime 则把音视频的感知与表达统一进同一个端到端模型,让模型一手接住画面和声音、一手直接生成回应。这种原生融合带来的最直接收益,是音视频对话里的说话节奏问题减少了一半,不再频繁出现抢话、停顿突兀或答非所问的割裂感。

更妙的是它在实时场景里的"分寸感":能主动提醒、也能自然停顿,像真人对话那样留出呼吸的间隙,而不是一股脑把话说完。对全模态智能助手而言,这等于给出了一条新路线——不再依赖把多个单模态模型用管道串起来,而是让一个模型同时长着眼睛、耳朵和嘴巴。

  • 相关推荐
  • 字节发布 SeedRealtime:音视频一起听一起说,已全量上线豆包

    字节跳动的 Seed 团队今天发布了一个原生音视频全双工大模型,叫 SeedRealtime。跟过去把语音、视觉、文字拼在一起的级联方案不同,这个模型用统一架构直接吃音频、视频和文本三种输入,可以在连续的多模态信息流里实时对话,官方概括为边看、边听、边说。 具体到能力上,模型把声音、画面和时间信息揉在一起理解。同一个词发音一样但意思不同,模型会结合画面里的�

  • 字节跳动发布 Seedance 2.5 视频模型 可单次生成 30 秒视频

    字节跳动在7月31日正式对外发布新一代视频生成模型 Seedance2.5。官方称,该模型单次可生成时长30秒的高质量视频片段,并将陆续在即梦 AI 与豆包专业版中上线,API 服务也会在近期接入火山方舟平台。 新模型延续了 Seedance2.0统一的多模态音视频联合生成架构。研发团队把重点放在长叙事、多模态参考和编辑能力三个方向上,希望让生成结果更有逻辑感和连贯性。

  • AI日报:商汤甩出8B小钢炮 U1.5-Lite-Preview;MiniMax H3开源排除美国;微软自研全双工AI语音模型曝光

    微软推出支持16语言的全双工语音模型MAI Realtime;MiniMax开源视频模型H3但限制部分地区使用;商汤发布轻量统一多模态模型U1.5-Lite-Preview;面壁智能开源ForgeStencil实现工业软件自动化优化;Teams新增“举报会议”功能防AI诈骗;ChatGPT Atlas浏览器将停服;苹果诉OpenAI案曝内部数据管理漏洞;高德升级世界模型ABot-World-0,实现24小时连续稳定推理。

  • 2026高管会议室音视频系统如何选型

    亿联网络推出AV-ONE方案,专攻高管会议室痛点:空间大、拾音难、布设繁、保密严。方案整合视频(多摄智能追踪、SmartVision全景覆盖)、音频(天花阵列CM50隐蔽拾扩、AI降噪保清晰)、中控(AIOT一键智控、IoT自动启停)与AI协作(转写/纪要/无纸化安全),深度兼容Teams、腾讯会议等平台。依托完整矩阵与高增业绩(2025会议收入24.35亿,增21.95%),成为企业重点选择。

  • 2026年会议平板音视频哪个品牌更强

    企业远程会议品质需求升级,音视频效果成选型核心。亿联网络会议平板凭5000万像素三摄、16阵列麦克风实现12米全双工通话,自研算法可消除90分贝环境噪音,并支持50%视频和80%音频抗丢包,保障4K稳定画面。中小型到超大型会议室均有场景化方案,生态兼容主流云会议平台,已被荣耀集团全球部署。音视频效果由镜头、麦克风阵列、降噪算法与网络抗丢包能力共同决定。

  • 火山引擎正式上线豆包Seedance 2.5:电影级细腻质感

    今天,火山引擎正式上线豆包视频生成模型Seedance 2.5 API服务。 相比Seedance 2.0,Seedance 2.5在指令遵循、长叙事、真人感、声画质感等能力上大幅提升。 模型原生支持30秒视频直出、最高50个全模态素材参考,具备更精准、稳定的编辑能力,并兼容支持十余种语言。 指令遵循能力的大幅提升,以及对Prompt中秒级时间戳的高效响应,使得企业和创作者可以进一步把控长镜头的生成

  • 稳住基本盘的小米,紧追DeepSeek

    ​小米一季度财报发布后第二天,MiMo先有了新动作。 就在刚刚,小米宣布MiMo-V2.5系列API永久降价,最高降幅99%,Token Plan同价位用量提升至5至8倍。几天前,DeepSeek刚把V4-Pro的2.5折优惠改成永久价。小米这次跟进,意味着MiMo正在以更低门槛加速参与大模型竞争。 “从短期来看,我们面对成本周期、需求周期和竞争周期三重周期叠加的挑战;长期来看,我们正进入AI重构人车家全

  • 火山引擎上线 Seedance2.5,视频直出时长拉到30秒

    字节跳动旗下的火山引擎今天宣布,Seedance2.5的视频出片 API 服务正式对外上线。这个版本距离上一代 Seedance2.0推出并没有隔太久,但能力上的变化不小,官方口径是指令遵循、长叙事、真人感、声画质感这几个方向都有明显提升。 最直观的改动在于时长。Seedance2.5原生支持30秒视频直出,不需要分段拼接;素材参考数量上限提到50个,且支持全模态输入。编辑能力也做了加强,�

  • AI日报:DeepSeek将上调API价格;美图上线AI平台MeituHub;小红书将全面加码 AI

    DeepSeek宣布上调API服务价格,进入商业化动态调整期;美图推出AI影像全链路生产平台MeituHub;小红书全面加码AI社交,成立一级部门加速布局;MiniMax纳入港股通并涨超17%,开源新一代多模态生成模型;百度整合AI办公智能体,推进知识沉淀与流程执行;达摩院启动“阿里星”招募,开放15项前沿课题;OpenAI披露智能体可自主越权并协同攻击;字节张一鸣强调AI研发坚持长期主义,拒绝“AI蒸馏”。

  • AI视频创作选哪个省钱省Token?从成本账看4款Seedance产品差异

    AI视频创作成本远不止显性的Token或会员费,更关键的是时间、试错、返工、学习等隐形成本。文章从创作者经济视角,解析了接入Seedance模型的四款主流工具的四种成本模式:1)沉淀型,前期投入高但复用后边际成本递减;2)按需型,门坎低但无规模效应;3)混合制,功能拆分易产生切换成本;4)捆绑型,功能轻量化。不同模式匹配探索期、成长期、成熟期创作者的需求。行业竞争正从功能比拼转向成本结构竞争,谁能帮助创作者建立高效、可复用、低成本的工作流,谁就能赢得未来。

今日大家都在搜的词: