首页 > 业界 > 关键词  > 豆包大模型最新资讯  > 正文

豆包大模型1.6发布:全球梯队!可生成1080p高品质视频

2025-06-12 08:00 · 稿源: 快科技

快科技6月12日消息,字节跳动旗下豆包大模型正式升级为1.6版,在推理、数学、指令遵循、Agent等方面的能力均有较大提升,同时豆包视频生成模型Seedance 1.0 pro、豆包语音播客模型也正式发布。

豆包大模型1.6包括三部分,分别是豆包1.6、豆包1.6-thinking、豆包1.6-flash。

其中,豆包1.6支持on/off/auto三种思考模式,豆包1.6-thinking强化了思考能力,支持多模态,在多个权威测评集上达到了全球第一梯队水平。

比如,GPQA Diamond测试成绩达到81.5分,是目前最好的推理模型之一。

再比如,数学测评AIME25成绩达到86.3分,相比豆包1.5深度思考模型大幅提升12.3分。

豆包大模型1.6系列均支持深度思考、多模态理解、256K长上下文(首个)、图形界面操作等能力,能够更好地支持复杂Agent的构建,促进AI生产力的提升。

目前,豆包大模型1.6系列已在火山引擎上线,企业和开发者可调用API体验。

价格方面,按照百万tokens:

0-32k上下文,输入0.8元,输出为8元;

32-128k上下文,输入1.2元,输出16元;

128-256k上下文,输入2.4元,输出24元。

豆包大模型1.6发布:全球第一梯队!可生成1080p高品质视频

豆包视频生成模型Seedance 1.0 pro支持文字与图片输入,可生成多镜头无缝切换的1080p高品质视频,主体运动稳定性与画面自然度较高。

通过调研影视创作者等群体的实际需求,Seedance 1.0 pro不仅将指令遵循、运动稳定性、画面质量等行业共识性指标纳入攻坚方向,同时,也将多任务生成、1080p高清生成、快速视频生成等难题作为核心目标。

新版模型在动态图像生成的各维度上,有较好的综合表现,尤其动作生成、指令遵循等关键能力处于业界前列,推理速度、用户好评度等方面也比较突出。

根据国际知名评测榜单Artificial Analysis,Seedance 1.0 pro在文生视频、图生视频两个任务的表现均排名首位。

豆包大模型1.6发布:全球第一梯队!可生成1080p高品质视频Artificial Analysis 文生视频榜单,数据截至 2025-06-09 11:00 (GMT 8)

豆包大模型1.6发布:全球第一梯队!可生成1080p高品质视频Artificial Analysis 图生视频榜单,数据截至 2025-06-09 11:00 (GMT 8)

豆包语音播客模型源于端到端实时语音的进一步拓展,能够实现从文本创作到双人对话式播客作品的秒级生成,同时具备互相附和、插话、犹豫等自然的播客元素生成,达到了媲美真人的生成效果。

用户可以在扣子空间(https://space.coze.cn/)体验语音播客相关功能。

同时,豆包产品已启动小流量测试,近期将全量上线播客模型。

举报

  • 相关推荐
  • 字节跳动发布 Seedance 2.5 视频模型 可单次生成 30 秒视频

    字节跳动在7月31日正式对外发布新一代视频生成模型 Seedance2.5。官方称,该模型单次可生成时长30秒的高质量视频片段,并将陆续在即梦 AI 与豆包专业版中上线,API 服务也会在近期接入火山方舟平台。 新模型延续了 Seedance2.0统一的多模态音视频联合生成架构。研发团队把重点放在长叙事、多模态参考和编辑能力三个方向上,希望让生成结果更有逻辑感和连贯性。

  • 字节跳动发布新一代视频模型:30秒一次生成 还能去油腻感

    字节跳动宣布发布新一代视频创作模型Seedance 2.5,正在陆续上线即梦AI、豆包专业版等平台,API服务也将在近期上线火山方舟。 Seedance 2.5可单次生成30秒高质量视频片段,并支持多轮延长。 模型优化了镜头衔接和场景过渡,让长视频保持更好的连贯性,同时大幅优化画质、音质以及运动质量,有效弱化了视频生成中常见的油腻感”。 用户可以生产数分钟具有统一视听语言、�

  • 特斯拉车机系统更新:首次接入豆包大模型

    特斯拉中国今日发布2026.14.13版本车载系统更新,即日起面向Model 3、Model Y、Model S、Model X 四款车型分批推送。 总体上看,本次升级囊括智能大模型接入、车载场景实用功能、交互体验优化以及多项系统安全漏洞修复,改动覆盖用车全场景。 值得一提的是,本次更新最大亮点,是特斯拉国内车载系统首次搭载第三方大模型字节跳动豆包大模型正式入驻车机,接替原有语音体系�

  • 豆包宣布视频通话功能升级!能听会看 主动交互 更像真人

    今日,豆包宣布视频通话功能迎来升级,正式接入原生音视频全双工大模型SeedRealtime。 据介绍,SeedRealtime原生支持音视频联合理解,能够综合声音、画面及时间信息,判断当前该听谁说话、何时回应或保持沉默。 实现边看、边听、边说的自然连续交互,在业界率先实现音视频全双工技术的规模化落地。 该模型上线后,豆包视频通话可在连续变化的真实场景中,实现更自然�

  • 星纵物联助力字节跳动全域办公数字化升级,打造超大型企业数字化落地范本

    字节跳动引入星纵物联智能设备,构建覆盖工位、会议室、电梯厅、食堂等多场景的实时监测体系。通过部署各类传感器与LoRaWAN网络,精准采集空间占用与人流数据,实现会议室资源自动释放、工位错峰共享、高峰动态分流等智能管理。项目使会议室流转效率提升50%,盘活闲置资源,缓解拥挤,推动办公运营从经验驱动转向数据驱动的精细化、数字化转型。

  • 全栈AI巨头盘点:联想、阿里、华为、百度贯通算力‑大模型‑终端‑行业方案‑生态

    中国AI正加速推进算力、大模型与终端协同。联想以万全异构智算平台与问天超节点为训练推理底座,通过词元中枢统一调度模型,天禧AI连通PC、手机与平板,并以城市、制造智能体落地行业。阿里以平头哥芯片和阿里云为核心,千问模型贯通应用与终端。华为依托昇腾与盘古模型,连接鸿蒙终端与行业场景。百度则以昆仑芯和文心大模型,延伸至小度与智能驾驶。四家企业全栈路径各异,但均在真实业务中持续交付。

  • 阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别大模型

    阿里发布新一代语音识别大模型 Qwen-Audio-3.0-ASR-Flash,重点优化了专业词汇的识别表现。该模型已在医疗等垂直场景中展现出较高准确率,相关听写准确率突破九成五。 语音识别在通用对话中已相对成熟,但在医学、法律、工业等专业领域,由于术语密集且发音相近词多,模型常常出现误判。此次新模型强化了对专业词的处理能力,使其更贴合真实行业场景的需求。

  • 企业AI落地:从大模型走向本体驱动的超级组织

    企业部署大模型后仍难落地,根因是缺乏统一业务语义与执行闭环。文章提出,企业AI真正的底层是“本体论+大模型+智能体AI”三层架构:本体定义业务对象与关系,让AI理解企业;大模型负责推理;智能体在治理框架内执行动作。以Orion AIP为例,通过构建统一本体、融合数据与规则,可实现风险分析等场景下的“感知-分析-决策-行动”闭环,让AI从对话工具进化为能工作、可追溯、可信赖的组织核心。

  • 字节发布 SeedRealtime:音视频一起听一起说,已全量上线豆包

    字节跳动的 Seed 团队今天发布了一个原生音视频全双工大模型,叫 SeedRealtime。跟过去把语音、视觉、文字拼在一起的级联方案不同,这个模型用统一架构直接吃音频、视频和文本三种输入,可以在连续的多模态信息流里实时对话,官方概括为边看、边听、边说。 具体到能力上,模型把声音、画面和时间信息揉在一起理解。同一个词发音一样但意思不同,模型会结合画面里的�

  • 模型打底、千问办公上桌,阿里再战 AI 局

    中国AI大模型的参数竞赛,已经进入到万亿规模时代。 8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8,核心旗舰模型为Qwen3.8-Max,总参数达2.4万亿、单次激活95B、1M上下文长度、支持视觉理解。 就在Qwen3.8发布的同一周,Kimi K3以2.8万亿参数强势开源,MiniMax的M3Pro也达到2万亿参数级别,并传出即将开源的消息。 此外,包括DeepSeek V4Pro、文心5.0、MiMo-V2.5-Pro、LongCat-2.0等国产AI�

今日大家都在搜的词: