首页 > 业界 > 关键词  > 正文

天下苦闭源模型久矣,MiniMax H3要做多模态领域的Deepseek

2026-08-04 11:26 · 稿源: 字母榜公众号

声明:本文来自于微信公众号 字母榜,作者:字母榜,授权站长之家转载发布。

2026年8月3日,港股MINIMAX-W(00100.HK)报HK$249.4,涨幅超10%。当日早盘,MiniMax盘前正式宣布发布新一代多模态生成模型H3。市场用真金白银为这次产品发布投了一票。

A

天下苦闭源模型久矣,视频生成赛道此前由Seedance、可灵等头部模型主导,价格、算力、生成时间也一直是行业关注比较高的的话题。

MiniMax发布的H3,正是视频生成市场的一个全新选择。

官方博客中表示,定位H3是一款通用的全模态生成模型,支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频,最高可支持15s2K分辨率。

在性能方面,MiniMax H3与Seedance2.5处于同一梯队。

从早期邀测释放的demo看,H3的效果非常惊艳。

举个具体例子,给H3一张人物参考图+一段希区柯克式镜头运动的参考视频+一条参考歌声的音频,它能读懂“让图里的人物按参考视频的镜头运动、用参考音频里的歌声唱歌”这样的复合指令,一次生成带原生双声道的2K成片。

这种跨模态复合参考的能力,此前曾是Seedance的招牌,如今,MiniMax也将这份能力收入囊中。

权威视频模型榜单Artificial Analysis视频模型榜单中,截至2026年7月31日H3发布当日,MiniMax H3在视频编辑能力项排名全球第一,文生视频、图生视频能力分别位居第二、第三名,模型综合能力跻身全球第一梯队。

图片

H3的一个突出亮点是复杂文本保持能力。

举例而言,影视片头里的中英文标题、动态海报上的品牌logo、UI动效里的字幕,这些场景中H3能让文字真正参与视觉构图:文字要贴合物体的透视,要接受场景光的照射方向,要跟随镜头运动和主体动作。

一个品牌logo放到玻璃杯上,模型需要理解玻璃的折射;放到墙上,需要理解墙的曲率和纹理;跟随镜头推拉时,需要保持字体形状不畸变。这已经超出了“生成字体”的技术边界,是模型对场景做整体理解之后的产物。

复杂文本保持只是“更懂视觉、更懂世界”这套底座能力的一个显性观察点。根据MiniMax技术博客,H3的技术亮点是Contextual Omni Representation(对上下文中的所有模态的信息及其相互关系进行组织),把整段素材当作统一上下文,为模型描述视频、音频等多种元素的关系,并为此搭建了专门的模型和全模态理解管线。

B

除了性能之外,H3还秉承了MinMax最具代表性的特点——量大管饱。

在定价上,MiniMax H3默认2K分辨率,每秒定价仅为0.8元人民币,在同级别分辨率产品中具备较强的价格竞争力。

图片

过去半年,行业内讨论“电影级”视频生成时,主流商用模型的默认分辨率多在1080p水平。H3直接将默认输出分辨率提升到了2K,在高清化方向上迈出了一步。

支撑这个价差的是MiniMax H3的技术创新。

视频生成模型训练时,每一帧画面都要被切成小块喂给模型,块越多,训练和推理越贵。H3的自研VAE(H3-VAE)把画面的压缩率做到了行业领先水平,根据官方博客,同样一段视频,用更少的块表达出来,序列长度直接省了4倍。训练便宜了、推理也便宜了。

在高分辨率上, 行业里大部分模型输出2K/4K的思路是先生成一版低分辨率的,再套一个专门的超分模块把画面放大,这个模块本质是在“猜”缺失的细节,所以放大之后的小字、纹理、光影经常糊或者变形。

H3不把低清视频当作唯一依据,而是把它作为一种参考,连同原来的多模态上下文一起输入模型,可以复用H3已有的生成能力,也可以恢复低清视频里已经不可见、但上下文里仍然存在的信息。

这也是为什么H3在复杂文字场景(片头、logo、字幕)不翻车的底层原因。

换句话说,H3走的是一条“用架构效率提升性能”的路,通过技术创新降低算力消耗。这个技术路径对商业化的意义在于:当算力成本进入压缩通道,视频生成的毛利率天花板会重新打开。

C

H3正在吃掉诸如AE、Premiere这些软件所代表的,完整条视频后期链条。

过去的AI视频模型,交付的是一段“素材”,用户拿到的往往只是一段还没配音、没字幕、没包装的画面,剩下的工作要自己在AE、Premiere、剪映里一步一步接完。H3不同的地方在于,它把”后期“这件事装进了模型内部:理解创意意图、生成主体画面、匹配音效音乐、渲染字幕文字、完成动效包装,一次生成,直接交付。

一个电商产品广告的hook镜头中,过去有“文生视频拿到产品在货架上的动态画面 → TTS合成“限时5折”的旁白 → 剪映套字幕模板 → AE做产品打光高亮+价格数字弹跳动效”这一系列流程。

到H3这里,你输入一张产品图、一段广告脚本,它一次输出的成片就带上货架运镜、旁白配音、字幕、价格弹跳、光影氛围——每一个视觉元素跟画面的空间、光线、节奏都是对齐的,不是简单叠加。

根据前期的邀测反馈,MiniMax H3具备商用级的多场景内容生成能力,在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面表现出色,可实现精准、可控的多模态内容编辑与生成,广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。

这个能力对市场规模意味着什么?

参考Adobe2025财年财报,创意云业务全球收入约145亿美元,其中视频后期类工具(AE、Premiere等)占相当比例;国内视频后期外包市场估算约在300–500亿元人民币区间。

如果H3的AI原生后期能力在B端持续兑现,可能替代其中10–30%的传统后期工序。

MiniMax官方博客里说,“视频模型将能够理解更完整的创作意图,处理更复杂的内容需求,并逐步从'生成一段视频',走向真正参与内容生产的全过程。”

2011年之后的十年里,Netflix吃掉了Blockbuster、Uber吃掉了出租车公司、Airbnb吃掉了连锁酒店:技术能力的量变积累到某一刻,会突然发生质变。软件吃掉了那些不软件的行业。现在,AI要吃掉那些不AI的软件。

D

视频生成首次迎来旗舰开源时刻,就在H3发布当天,MiniMax宣布H3将在数日内开放模型权重。

在过去,视频生成领域的默认选项是闭源模型,Seedance、可灵、Sora、Veo,所有主流模型无一例外。理由也很直接:视频模型训练成本高、算力消耗大,闭源加API计费是最直接的商业模式。

开源意味着行业不再是闭源模型独大。

过去一段时间,视频生成行业整体由少数闭源模型主导,商业化路径也基本围绕“API计费+会员订阅”展开。

在这个过程中,行业出现了一些值得关注的现象:部分头部产品在短时间内多次调整价格体系,导致用户使用成本波动较大;C端产品与B端API之间存在定价倒挂的情况;企业级接入门槛较高,中小团队往往难以直接获得官方API权限,由此催生了拼单、转售等灰色中间服务。

这些现象背后,反映的是闭源模式下的商业化逻辑 —— 当少数模型占据技术优势时,供给方有较强的定价权。而开源模型的出现,可能会改变这一格局,让行业竞争从单一的技术比拼,转向更开放的生态竞争。

闭源模型接不住的高价值B端场景也被打开了。

影视公司往往不会把品牌角色形象、未发布剧集素材扔进公有云API,广告主不会接受品牌视觉每次生成时随机漂移,游戏公司的核心IP不能上第三方模型。这批客户过去被闭源模型的“数据主权”问题挡在门外,是视频生成商业化里最贵、最有粘性、也最没被服务的一批。

H3的模型开源+可本地私有化部署,正好接住这批客户。

视频生成这个赛道,过去半年被傲慢定义,涨价、排队、白名单、拼盘、掮客、账号倒卖。用户在抱怨,市场在沉默,中小公司在被挡在门外,B端客户在纠结于数据和资产。这不是一个健康的市场,是一个失衡的市场。H3把这口气放了出来。旗舰、2K、开源、0.8元/秒的单价,把商用起步价压到主流模型三分之一。把这一切递给整个开发者生态、递给中小公司、视频生成的开源时代,从7月31日开始。

对港股MiniMax来说,H3的意义不只是又一款模型的发布。1月上市以来,市场对这家公司的估值锚点在变,市场情绪从“神坛”到“审慎”。H3是这家公司在跌宕之后的第一次主动出招。牌桌不会因为一款模型就重排,但它至少证明了一件事:MiniMax还有能力从头掀翻一场游戏。

举报

  • 相关推荐
  • AI日报:MiniMax发布全模态模型H3;Seedance 2.5发布,30秒一镜到底;DeepSeek-V4-Flash正式版上线

    近期AI动态:MiniMax发布全模态模型H3,成本仅为竞品1/3;字节跳动Seedance 2.5视频生成支持30秒长叙事;DeepSeek V4 Flash上线,130亿参数瞄准Agent赛道;DeepMind推出Gemini Robotics ER2,突破多机器人协同;谷歌地球集成AI图像生成;华为开源5050亿参数盘古大模型;阿里千问发布专业语音识别模型;特斯拉中国车机接入豆包大模型。

  • MiniMax H3视频模型正式开源:全模态理解输入,最高生成2K 视频

    MiniMax 今日正式开源新一代通用视频模型 MiniMax H3,这款模型被定位为通用型全模态生成系统,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并生成最高2K 分辨率、最长15秒、带原生立体声音频的视频内容。 得益于以任务泛化为导向的系统设计,H3在预训练阶段便具备了广泛的多模态上下文理解与生成能力,官方称其能够出色地遵循复杂的多模态指令。输出规�

  • DeepSeek偷偷给用户取外号引热议!官方:只是在临时打标签

    今日,有网友在社交平台晒出DeepSeek使用截图,并表示开启深度思考后模型会偷偷给人取外号,相关话题很快登上热搜。 随着话题热度上升,更多网友晒出了自己的标签案例。其中一名用户就直接询问了模型,为什么会给自己生成墨墨”这一标签。 DeepSeek则称,这并非刻意为之,而是用户交流特质与模型称呼习惯自然结合的结果。它还提到,自己不希望只用普通的你”来指代

  • 稳住基本盘的小米,紧追DeepSeek

    ​小米一季度财报发布后第二天,MiMo先有了新动作。 就在刚刚,小米宣布MiMo-V2.5系列API永久降价,最高降幅99%,Token Plan同价位用量提升至5至8倍。几天前,DeepSeek刚把V4-Pro的2.5折优惠改成永久价。小米这次跟进,意味着MiMo正在以更低门槛加速参与大模型竞争。 “从短期来看,我们面对成本周期、需求周期和竞争周期三重周期叠加的挑战;长期来看,我们正进入AI重构人车家全

  • AI日报:DeepSeek V4 Pro正式版亮相;小红书或推进“AI导购”功能;Grok 4.6正式发布

    DeepSeek V4 Pro发布,性能超Opus4.8对标Fable5;Grok 4.6比肩GPT-5.6;小红书推AI导购;千问上线菜鸟智能体匹配寄件;鸿蒙支付宝“阿宝”公测;荣耀Robot Phone搭载Agentic OS;CodeBuddy升级DeepSeek V4 Pro;韩国Solar Pro4亮相。

  • DeepSeek预告将大幅涨价:整体上调API服务定价

    DeepSeek今天在用户后台发布提示,平台计划在近期对全部API接口服务进行整体调价,预计涨幅较大。 平台建议企业与个人开发者合理规划调用量、控制充值金额,最终调价细则与生效时间以官方正式公告为准。 目前DeepSeek采用峰谷定价模式,工作日高峰时段(北京时间9:0012:00、14:0018:00)全部价格直接翻倍,凌晨00:3008:30、周末及法定节假日执行平峰原价。

  • 这次不等太久 DeepSeek V4正式版新证据:目标8月3日

    月中DeepSeek V4正式版的跳票让很多人失望,但官方的动作一直没停,好消息这次不会等太久了,可能8月3日就能看到。 从7月中旬开始,DeepSeek V4正式版的灰度测试就有各种爆料了,最近一周消停一些,DeepSeek官方也非常低调,没有再公布正式版发布的时间,现在的新证据暗示了8月3日会是个重要节点。 这个时间点是硅基流动发布的短信通知,该公司将于8月3日起调整DeepSeek V4 Pro

  • AI日报:商汤甩出8B小钢炮 U1.5-Lite-Preview;MiniMax H3开源排除美国;微软自研全双工AI语音模型曝光

    微软推出支持16语言的全双工语音模型MAI Realtime;MiniMax开源视频模型H3但限制部分地区使用;商汤发布轻量统一多模态模型U1.5-Lite-Preview;面壁智能开源ForgeStencil实现工业软件自动化优化;Teams新增“举报会议”功能防AI诈骗;ChatGPT Atlas浏览器将停服;苹果诉OpenAI案曝内部数据管理漏洞;高德升级世界模型ABot-World-0,实现24小时连续稳定推理。

  • DeepSeek-V4-Flash公测炸场,网易智企帝王蟹已无缝升级接入!

    7月31日,DeepSeek-V4-Flash正式版上线。其Agent能力覆盖终端操作、代码开发等多环节,性能超越V4-Pro预览版和GLM-5.2,逼近Opus4.8,且保持原价,是“又强又便宜”、专为Agent而生的高性价比引擎。 企业级平台“帝王蟹”的经济档已无缝升级至此,用户无需迁移即可享受。该平台不仅聚合多种大模型,更通过内置AI员工、专属知识库和安全管控体系,让模型真正融入业务流程,解决企业AI落地难题。目前平台推出9.9元得3亿Token的限时福利。

  • V4 Pro正式版黄金搭档 DeepSeek官方AI编程工具Harness内测

    DeepSeek赶在7月最后一天发布了V4-Flash正式版,性能表现很惊艳,接近Opus 4.8的能力,但这还不是DeepSeek的大招,后面还有V4 Pro正式版,以及官方配套的Harness软件。 前两天网上就传出了DeepSeek Harness工具的内测消息,说是本周末开始,但没有官方证实,现在该项目的负责人崔添翼已经面向全球征集内测用户,特别是有过Agent Harness项目经验的开发者,发自己的Github ID和代表作就可以

今日大家都在搜的词: