首页 > 业界 > 关键词  > 腾讯混元Hy3最新资讯  > 正文

腾讯AI,翻身了吗?

2026-07-28 09:18 · 稿源: 定焦one公众号

声明:本文来自于微信公众号 定焦One,作者:陈丹,授权站长之家转载发布。

大模型密集交卷的上周,前OpenAI研究员姚顺雨,也交出了加入腾讯后的第一份正式答卷。

7月6日,腾讯发布混元Hy3正式版。没有声势浩大的发布会,也没有铺天盖地的营销,这款旗舰模型以一种不太符合大厂惯例的低调方式进入市场。

但在开发者一端,它激起的水花并不小。

上线三天后,处于限时免费阶段的Hy3升至全球大模型API调用平台OpenRouter最受欢迎模型榜单第八位。接入腾讯办公智能体WorkBuddy后,调用量迅速冲高,排队率一度超过50%,项目组不得不紧急扩容。资本市场也给出反应,发布当天,腾讯股价上涨4.82%。

这多少有些出人意料。

过去两年,阿里、字节不断加码模型、应用和算力基础设施,智谱、DeepSeek等AI公司也各自凭借爆款模型刷足了存在感。唯独腾讯,常被排除在国内大模型第一梯队之外。

它有微信、QQ和庞大的产业生态,却始终没有拿出一款足以改变行业判断的基础模型。外界甚至开始怀疑,腾讯究竟是在等待更合适的入场时机,还是已经在这一轮技术竞赛中慢了下来。

现在看来,腾讯没有躺平。

引入姚顺雨并重组混元研发体系之后,腾讯近期又被曝吸纳其前同事田永龙。模型之外,腾讯还参与了可灵最高30亿美元的融资,并传出洽谈成为AI智能体公司Manus最大股东的消息。从人才、模型到基础设施,这家过去两年显得过于克制的互联网巨头,正在重新提高对AI的下注力度。

Hy3还不足以证明腾讯已经追上所有对手,它更像是一个阶段性信号。腾讯重新建立了一套能够把模型、产品和工程体系连接起来的研发方法,也重新获得了进入开发者主流候选清单的机会。

但这只是第一步。

对腾讯而言,真正的问题已经不只是能否再造出一款更强的模型,而是这种能力能否连续迭代,以及它最终能否在微信里变成一个真正被用户使用、能够完成任务和交易的Agent。

01.Hy3不是最强,但够腾讯重回牌桌

只看参数和公开榜单,Hy3并不是一款一眼可见的“最强模型”。

在这一轮国产模型更新中,DeepSeek V4Pro、智谱的GLM-5.2、MiniMax M3都在争夺能力上限:有的将总参数推至万亿级,有的把上下文拉到100万Token,有的在代码和长程Agent任务中占优。相比之下,Hy3总参数为2950亿,支持256K上下文,并没有试图在每一项指标上压倒对手。

判断它的真实位置,需要看两件事。

第一,是它在具体任务中的能力边界。

在衡量软件工程能力的SWE-bench Verified上,Hy3获得78分,落后于Claude Fable5等闭源模型,也排在GLM-5.2和DeepSeek V4Pro之后。但在难度更高的SWE-bench Pro上,Hy3以57.9分反超DeepSeek V4Pro。在更接近真实执行环境的WildClawBench上,它又超过GLM-5.1和DeepSeek V4Pro,位居开放模型前列。

腾讯组织的270名专业人员盲测则显示,Hy3整体表现高于GLM-5.1,优势集中在前端开发、数据存储和持续集成等场景。

资深Agent从业者赵江杰告诉「定焦One」,Hy3目前处于“整体能力第二梯队上沿、开放与低成本模型第一梯队”。它在前端开发、常规代码、搜索浏览和工具调用上具备较强竞争力,但还没有在高难度任务上全面领先。实际使用中,高频、中低难度且结果可验证的任务,已经可以由它独立完成;中等复杂任务可以交由它执行后复核;核心架构设计和敏感操作,仍不适合无监督交付。

因此,如果“赶上”意味着成为能力最强的国产模型,Hy3还没有做到;但如果意味着重新进入开发者的视野,腾讯已经重新拿到了一张入场券。

第二,是它对工程化落地和成本控制的重视。

Hy3采用MoE架构,总参数2950亿,单次推理只激活约210亿参数。它没有不断堆高峰值能力,而是在模型容量、运行速度和算力成本之间寻找平衡。

对企业而言,模型成本不只是单次Token价格。一个Agent完成任务,往往需要多轮推理、连续调用工具、读取和修改文件,并反复核验中间结果。当使用规模扩大到数千名员工,单次调用中微小的成本差异,会被并发量和任务链条迅速放大。

更少的激活参数,意味着Hy3具备降低推理开销和部署门槛的架构基础。但激活参数少,并不天然等于真实成本低。

赵江杰指出,模型效率还取决于硬件、量化方式、推理框架、上下文长度、输出长度、并发规模和任务成功率。腾讯目前证明的是Hy3有降低成本的可能性,但在统一条件下,Hy3还需验证能否提供更低的首Token延迟、更高的吞吐量,以及更低的成功任务成本。

稳定性同样是成本的一部分。

图片

企业需要的不一定是模型偶尔表现惊艳,而是在几十次连续调用中少出错、不失忆、不中断。腾讯公布的数据显示,Hy3在不同Agent框架下运行SWE-bench Verified时,准确率波动被控制在4%以内;在内部场景中,幻觉率和多轮对话问题率也明显下降。

赵江杰介绍,市场对Hy3的实际评价,更接近“一款工程型、性价比突出、Agent倾向明显,但复杂认知任务还不够均衡的模型”,而不是一款全面领先的通用模型。

Hy3Preview发布后,日均Token消耗增长20倍,WorkBuddy中主动选择该模型的用户增长6倍。正式版上线后,WorkBuddy算力消耗迅速触顶,排队率一度超过50%,联合项目组紧急调度算力扩容。与此同时,腾讯将Hy3接入元宝、CodeBuddy、ima和Marvis等产品,用于生成文档、制作表格、编辑文件、管理电脑和编排工作流。

它的热度也没有局限在腾讯体系内。在OpenRouter7月的编程模型使用量排名中,Hy3进入前四,与GLM-5.2、MiniMax M3和DeepSeek V4系列处于相近的调用梯队。

但这些数据仍需谨慎看待。

目前Hy3在OpenRouter限时免费,WorkBuddy的调用增长,也可能受到积分、限免和内部导流影响。真正的考验,要等到免费期结束之后。

即便如此,Hy3已完成了混元过去未完成的一步:让外部开发者愿意主动试用,让腾讯内部产品开始把真实任务交给它。它没有证明腾讯拥有最强模型,但证明腾讯重新拥有了一款“能用的模型”。

02.混元真正补的,是造模型的方法

谈及国内互联网巨头的AI布局,不少从业者过去对腾讯的评价很直接:场景很多,但大模型不行。

混元早在2023年就已经发布。此后两年,腾讯不断补齐参数规模、多模态和长上下文能力,也将模型陆续接入会议、文档、广告、游戏和云服务。但相比以开源建立开发者生态的阿里,或凭借推理能力和低成本突围的DeepSeek,混元始终缺少一个足够清晰的位置。

马化腾曾用“漏水的船”形容腾讯在AI浪潮中的处境,看似已经上船,却还没有坐稳。落到混元身上,真正的漏洞不在于腾讯没有产品、场景或数据,而是它没有把这些资源持续转化成模型进化的能力。

最初的混元,走的是一条典型的“大而全”路线:先训练一款覆盖尽可能多任务的通用底模,再接入腾讯云和内部业务。这种方式帮助腾讯迅速补课,也让混元陷入同质化竞争。各项能力都有,但开发者很难找到必须选择它的理由。

元宝接入DeepSeek,是腾讯第一次明显把产品体验放在模型归属之前。

对用户而言,重要的是任务能否完成,而不是底层调用了哪一家模型。外部模型可以帮助腾讯迅速补齐产品短板,也能让它更快看清用户真正需要什么。这是腾讯对模型与产品关系的一次调整:产品不再必须等待自研模型成熟,模型也不再天然拥有内部流量。

但这条路同样有边界。

如果腾讯的应用长期建立在别人的模型之上,它掌握的只是入口,而不是AI时代的技术供给。模型价格如何调整、能力何时升级、敏感数据能否处理、产品反馈能否进入训练闭环,都将取决于外部供应商。

多模型策略可以争取时间,却不能替代一款自主、可控且能够持续迭代的基础模型。

真正的变化,发生在姚顺雨加入、混元研发体系重组之后。

2025年9月,姚顺雨从OpenAI转投腾讯;同年12月,腾讯正式任命其为首席AI科学家,同时负责大语言模型和AI基础设施。他的加入,是腾讯重新组织混元研发体系的标志性事件。从此之后,模型、算力、数据和评测,开始被纳入一条更集中的决策链。

腾讯没有急着训练一个参数更大的模型,而是先重做造模型的基础工程:重建预训练和强化学习系统,扩充和清洗数据,重新调整后训练流程。公开榜单也不再是唯一标准,真实产品反馈、人工盲测和内部任务,开始进入评测体系。

Hy3正是这套方法下的第一批结果。

图片

它集中解决推理、代码、工具调用和长程Agent任务。研发顺序也被倒转过来,先确定办公、编程和知识管理需要什么样的模型,再反推架构、数据和训练方式。

产品也不再只是模型完成后的分发渠道,而成为训练体系的一部分。姚顺雨在今年6月的腾讯云AI产业应用大会上表示,重新出发的混元模型坚持与产品深度Co‑Design,通过多产品数据回流与体系化训练,在优化模型尺寸的同时持续提升性能。

赵江杰认为,Hy3对腾讯的意义,超出一款模型本身。它为模型成本建立了锚点,让产品反馈重新进入训练闭环,也检验腾讯能否把分散在微信、办公、云服务和开发工具中的应用生态,组织成真正的执行能力。

过去两年,腾讯真正缺的,是一套能够稳定造出模型、让模型进入产品,再让产品反馈推动模型继续进化的方法。

Hy3暂时证明,这套循环开始重新运转,但一次成功还不足以证明腾讯已经建立起长期竞争力。

03.混元之外,腾讯还差什么?

Hy3让腾讯重新拥有了一台可用的自研发动机,但这台发动机在腾讯的AI版图里,还不足以驱动一切。

腾讯总裁刘炽平在3月财报会上表示,AI不会是一场只产生一个冠军的竞赛。“大量现有应用将推出自身智能体与智能体能力,不同模型也将竞争赢得智能体的采用。这是一个更精彩、去中心化、人人可参与的世界。”

腾讯首席战略官詹姆斯·米切尔所将其描述为一条“性价比曲线”:未来成功的智能体,会根据不同任务的能力要求和成本约束,自主选择合适的模型;不同模型,则分布在这条曲线的不同位置。“我们希望成为其中一员,而不是唯一选择。”

按照这一判断,未来的AI市场不会由某一个模型包揽所有需求,而会形成一个由模型、智能体、应用和基础设施共同组成的多层竞争格局。

这也决定了混元的角色:它不足以被腾讯拿去和别人拼胜负,但它是腾讯不能没有的底盘。

图片

未来,混元不需要包揽腾讯体系内的所有任务,也不必成为每一款产品的默认模型。高难度、低频任务可以调用能力更强的外部模型;高频、敏感、需要私有化部署或对成本要求更高的任务,则更多交给自研模型。

但这不意味着混元不重要。赵江杰将自研模型的战略价值概括为:成本锚点、供应安全、产品共训、私有化合规、持续学习能力,以及参与下一代技术竞争的资格。没有自研模型,腾讯的产品依然可以借助外部供应商迅速补齐体验,但它会在AI最关键的生产函数上长期受制于人。

真正决定腾讯AI天花板的,是另一套东西。

腾讯手里的牌是14亿微信月活入口、身份权限体系、小程序工具生态、支付与交易能力、企业微信里的组织流程,以及云基础设施。与对手相比,阿里有电商和云但没有社交入口,字节有流量但在小程序工具生态和企业组织侧深度不足,DeepSeek和智谱在模型层强却没有生态。腾讯在“模型-入口-工具-交易”这条链路上更加完整。

但理论上的优势还没有直接变现。真正的商业价值,取决于它能够成功完成多少任务,这些任务本身有多大价值,调用成本有多高,以及执行失败可能带来多大风险。正如赵江杰所说,一款能力只有90分,却能以较低成本、安全地调用微信身份、小程序、企业流程和支付系统的模型,可能比一款能力达到100分、却只能返回文本的外部模型更有商业价值。

这也指向腾讯AI战略真正需要补上的两块能力。

第一,是连续多个版本保持前沿水平的模型能力。

Hy3暂时缓解了腾讯在这一环上的焦虑,但一次追赶,还不足以证明长期竞争力。一款模型偶尔在某几个榜单上取得高分,与一家企业能够连续多个版本稳定处于前沿,是两件不同的事。

前者可能来自一次架构选择、数据调整或训练周期,后者则要求组织、算力、数据、人才和产品反馈持续协同。

第二,是一个被用户高频采用、可信可控的微信原生Agent。

腾讯生态里的每一块拼图都很硬,但它们至今没有被一款产品完整串联起来。微信里被寄予厚望的原生Agent“小微”仍在灰度测试,能否真正调动小程序、调用支付、完成交易,都没有答案。

只有当模型能够调动腾讯生态中的工具、服务和交易能力,微信的入口优势才会真正转化成AI时代的执行优势。

因此,腾讯AI战略未来的检验标准,最终可以被归结为两条线:

技术端,混元能否连续迭代,形成长期优势;产品端,腾讯能否造出一个超级原生Agent。

用户留存、付费率、任务成功率、生产流量和收入规模,都是这两条线上的具体指标。

赵江杰表示,如果混元长期无法承接大规模生产流量,不能服务敏感数据和私有化场景,也无法通过腾讯的产品反馈形成独特能力,它最终可能只是一项昂贵的技术储备。如果微信Agent始终停留在聊天、搜索和内容生成层面,无法进入工具调用和交易环节,腾讯庞大的生态也很难自动转化成AI优势。

腾讯AI的考验,还将继续。

举报

  • 相关推荐
  • 腾讯字节阿里齐下场:AI办公要大繁荣大发展了?

    仅仅一个周末之隔,字节和阿里相继出牌。 周一,传言已久的「千问办公」正式公测,这个整合了QoderWork、MuleRun、悟空三款阿里产品的全新Agent,主要面向个人与企业的生产办公场景。 阿里官方对千问办公的特色提炼是,激活组织生产力。目标是,全面瞄准企业级市场。 五天前,行业关注的焦点还是字节的内部整合动作,面向的同样是办公场景。 7月30日,字节跳动发出内

  • AI日报:京东开源视频实时编辑模型;Qwen-Image-3.0上线;腾讯混元发布Hy ASR 3.0 preview

    本期AI日报聚焦八大突破:京东开源实时视频编辑模型;阿里千问图像生成开放API;腾讯混元语音识别读懂语境;字节全双工SeedRealtime上车豆包;马斯克Grok 4.6将灌入SpaceX数据;影石硬件联手千问推出语音助手;Mistral开源3B多模态审核模型Shieldstral;宇树科技机器人冲刺科创板IPO。

  • 模型打底、千问办公上桌,阿里再战 AI 局

    中国AI大模型的参数竞赛,已经进入到万亿规模时代。 8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8,核心旗舰模型为Qwen3.8-Max,总参数达2.4万亿、单次激活95B、1M上下文长度、支持视觉理解。 就在Qwen3.8发布的同一周,Kimi K3以2.8万亿参数强势开源,MiniMax的M3Pro也达到2万亿参数级别,并传出即将开源的消息。 此外,包括DeepSeek V4Pro、文心5.0、MiMo-V2.5-Pro、LongCat-2.0等国产AI�

  • 阿里大动作!千问办公开启公测:一次性整合三款办公智能体

    阿里巴巴旗下企业级Agent产品千问办公”(QwenWork)开启公测。 个人和企业用户均可通过千问办公”官网(qwenwork.cn)体验,目前网页版和独立PC客户端已开放,钉钉PC端和手机端内置入口近期也将开放。用户可在千问办公”体验阿里最新旗舰模型Qwen3.8。 值得注意的是,新的千问办公”由QoderWork、MuleRun、悟空三款产品全面整合而来,是业内首款同时支持桌面端Agent、云端Agent、

  • 腾讯QQ宠物官宣回归:内置Hy3大模型!保留喂食、洗澡等经典玩法

    腾讯官方正式官宣,停运八年的经典IP QQ宠物全新回归,全面登陆手机QQ客户端,本次新版本最大升级是内置腾讯自研Hy3大模型,同时完整保留喂食、洗澡、打工、学习等老玩家熟悉的核心养成玩法。 新版宠物全面升级3D毛绒质感形象,除标志性经典企鹅外,新增小狗、蒜头鹅两类全新萌宠形象供玩家选择。 养成底层逻辑延续初代设定,玩家依旧需要定期投喂食物、清洁宠物�

  • 鸿蒙首个桌面办公智能体 腾讯WorkBuddy鸿蒙PC版发布

    今日,腾讯WorkBuddy正式上架鸿蒙电脑应用市场,成为鸿蒙平台首个桌面办公智能体。 至此,WorkBuddy已完成手机、平板、PC桌面的鸿蒙全终端覆盖,为用户带来跨设备一致、流畅高效的智能办公体验。 公开数据显示,截至2026年7月,鸿蒙生态设备数量已突破7000万台。 腾讯表示,相较于Windows、macOS等主流桌面系统,智能体原生适配鸿蒙并非简单移植。

  • 继续免费!腾讯WorkBuddy官宣Hy3模型限时免费体验延期

    腾讯官方正式发布公告,针对WorkBuddy与CodeBuddy用户,将混元Hy3大模型免费调用权益再度延期,免费使用期限直接顺延至2026年8月31日。 值得注意的是,此前该活动已经完成一轮周期延长,但大量用户反馈,希望延续免费体验时间,腾讯宣布再度放开免费额度。 Hy3作为腾讯混元7月6日正式发布的MoE架构大模型,整体参数规模295B,动态激活参数21B,最高支持256K超长上下文读取,�

  • 360联合中国信通院共建企业办公智能体“标尺”

    360与中国信通院联合启动企业办公智能体能力标准研制,纳米Work将作为场景验证载体。随着智能体数量预计2030年增至22.16亿,办公场景面临运行不稳、权限模糊等问题。360基于AI搜索和纳米AI等技术积累,通过超10万智能体、持续150天的内部测试,梳理出成本可控、安全可追溯等六大能力门槛,为标准编制提供依据,旨在为智能体选型与规范使用提供参考。

  • 腾讯元宝上线Hy ASR 3.0 preview语音识别模型:各种方言、复杂环境都能听清

    腾讯混元日前正式推出Hy ASR 3.0 preview语音识别模型,已率先落地腾讯元宝App面向全部用户免费使用。 依托Hy3基座大模型打通声学识别与语义理解,彻底摆脱传统语音识别生硬转写短板,在多方言口音、嘈杂收音、远距离拾音等复杂场景稳定输出精准文本。 模型完成10大方言片区、20余个细分方言覆盖,粤语、吴语、西南官话、中原官话等日常口语均可直接对话交互,用户不需

  • 腾讯、阿里、字节,大战AI办公

    2097万。 这是腾讯旗下AI Agent办公工具WorkBuddy在2026年6月的月度访问量。4个月前刚发布时,这个数字还只有800多万。 7月20日,易观发布《2026年Q2中国办公智能体平台市场洞察报告》,17款主流桌面端AI原生办公智能体中,WorkBuddy访问量排名第一,超过第二、第三名之和。 榜单坐实了各家的排位,更值得关注的信号也在同一时间出现,腾讯、字节、阿里三家大厂几乎都在整合旗�

今日大家都在搜的词: