首页 > AI头条  > 正文

腾讯混元 Hy ASR3.0 预览版发布:从"听清"到"听懂",方言词错率压到 3%

2026-08-05 16:35 · 来源: AIbase基地

腾讯混元正式推出新一代语音识别模型 Hy ASR3.0 Preview,标志着语音识别技术从"逐字转写"迈入"理解语境"的新阶段。该模型基于最新一代大语言模型 Hy3 构建,融合高精度语音识别与深度语义理解能力,核心目标直指一个质变——让 AI 不再只是听清每个字,而是真正听懂你说的话。

image.png

方言覆盖十大片区,长音频场景优势突出

在识别广度上,Hy ASR3.0 Preview 不要求标准普通话,方言识别覆盖粤语、吴语等 10 大方言片区和 20 余个二级小片区。开源评测集数据显示,该模型多语种词错误率(WER)控制在 3% 左右,其中中文普通话 3.34%、英语 2.62%、粤语 3.12%,整体准确度已接近行业天花板

结合 Hy3 的语言理解能力,模型能够结合上下文语境精准捕捉用户意图,自动消除歧义并智能纠错同音词。在转写难度较高的会议纪要、访谈长音频等场景中,这一"先理解再转写"的思路优势尤为明显——传统逐字听写遇到同音歧义往往束手无策,而 Hy ASR3.0 能根据语义逻辑自动选择正确用词。

MoE 架构打底,千万小时级数据联合训练

技术层面,模型采用兼顾效率与性能的 MoE 架构,基座升级至 Hy3。混元团队自研了无监督语音 Encoder,通过数千万小时级无监督语音数据训练,从复杂音频中提取高质量声学表征——Encoder 负责"听得好",Hy3 负责"理解对"。

在数据策略上,团队对语音 Encoder 和大语言模型进行联合训练,引入数千万小时级多来源语音数据,并通过多阶段能力注入,使模型具备上下文感知、复杂场景适应和方言识别能力。后训练环节则围绕通用识别、上下文理解和复杂场景鲁棒性构建高质量 SFT 方案,覆盖上下文 Context、专业名词、不同声学环境及多样人群语音,并引入多阶段强化学习针对复杂长尾场景持续优化。

目前,Hy ASR3.0 Preview 已上线腾讯云官网对外开放 API,可广泛应用于智能客服、内容理解和语音搜索等领域。腾讯旗下 AI 助手"元宝"已完成首发接入,用户可通过语音输入体验方言识别、上下文智能纠错和复杂环境稳定转写等功能且免费开放,WorkBuddy 等产品也在陆续接入中。当语音识别从"听字"进化到"听懂",人与 AI 的交互方式正在被重新定义。


  • 相关推荐
  • 腾讯元宝上线Hy ASR 3.0 preview语音识别模型:各种方言、复杂环境都能听清

    腾讯混元日前正式推出Hy ASR 3.0 preview语音识别模型,已率先落地腾讯元宝App面向全部用户免费使用。 依托Hy3基座大模型打通声学识别与语义理解,彻底摆脱传统语音识别生硬转写短板,在多方言口音、嘈杂收音、远距离拾音等复杂场景稳定输出精准文本。 模型完成10大方言片区、20余个细分方言覆盖,粤语、吴语、西南官话、中原官话等日常口语均可直接对话交互,用户不需

  • AI日报:京东开源视频实时编辑模型;Qwen-Image-3.0上线;腾讯混元发布Hy ASR 3.0 preview

    本期AI日报聚焦八大突破:京东开源实时视频编辑模型;阿里千问图像生成开放API;腾讯混元语音识别读懂语境;字节全双工SeedRealtime上车豆包;马斯克Grok 4.6将灌入SpaceX数据;影石硬件联手千问推出语音助手;Mistral开源3B多模态审核模型Shieldstral;宇树科技机器人冲刺科创板IPO。

  • 阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别大模型

    阿里发布新一代语音识别大模型 Qwen-Audio-3.0-ASR-Flash,重点优化了专业词汇的识别表现。该模型已在医疗等垂直场景中展现出较高准确率,相关听写准确率突破九成五。 语音识别在通用对话中已相对成熟,但在医学、法律、工业等专业领域,由于术语密集且发音相近词多,模型常常出现误判。此次新模型强化了对专业词的处理能力,使其更贴合真实行业场景的需求。

  • AI日报:腾讯混元发布科研智能体Hyra-1.0;阿里发布Qwen-Image-3.0;马斯克把Grok塞进Excel

    腾讯发布科研智能体Hyra-1.0,打通AI研发与科学发现。阿里推出Qwen-Image-3.0,支持4.5K超长文本与复杂图文生成。马斯克将Grok嵌入Excel,实现智能数据分析。Adobe推出AI相机工具Project Indigo。小鹏发布TuringViT高效视觉编码器。YouTube严打低质AI内容。《第九区》导演推出首部AI微电影。阿里拟推“千问办公”,整合三种智能体布局企业市场。

  • 继续免费!腾讯WorkBuddy官宣Hy3模型限时免费体验延期

    腾讯官方正式发布公告,针对WorkBuddy与CodeBuddy用户,将混元Hy3大模型免费调用权益再度延期,免费使用期限直接顺延至2026年8月31日。 值得注意的是,此前该活动已经完成一轮周期延长,但大量用户反馈,希望延续免费体验时间,腾讯宣布再度放开免费额度。 Hy3作为腾讯混元7月6日正式发布的MoE架构大模型,整体参数规模295B,动态激活参数21B,最高支持256K超长上下文读取,�

  • 阿里Token Plan个人版发布 Qwen3.8-Max预览版同步上线

    阿里旗下Token Plan个人版现已正式发布,用户可在该平台抢先体验Qwen3.8-Max-Preview模型。 该模型参数量高达2.4T,在代码工程、专业办公等场景中表现尤为突出,被业界认为是目前除Fable 5之外综合能力最强的模型之一。官方透露,Qwen3.8-Max正式版将于近期发布并同步开源。 Token Plan限时优惠,个人版:Lite 39元/月(6.5折),Standard 139元/月(7.7折),Pro 499元/月(8.3折);团队版:�

  • 腾讯QQ宠物官宣回归:内置Hy3大模型!保留喂食、洗澡等经典玩法

    腾讯官方正式官宣,停运八年的经典IP QQ宠物全新回归,全面登陆手机QQ客户端,本次新版本最大升级是内置腾讯自研Hy3大模型,同时完整保留喂食、洗澡、打工、学习等老玩家熟悉的核心养成玩法。 新版宠物全面升级3D毛绒质感形象,除标志性经典企鹅外,新增小狗、蒜头鹅两类全新萌宠形象供玩家选择。 养成底层逻辑延续初代设定,玩家依旧需要定期投喂食物、清洁宠物�

  • i3D Act 620预览版发布:当国产三维引擎开始和Unity、Unreal抢饭碗

    国产三维引擎i3D Act620预览版上线,实现底层重构、AI原生氛围工程及骨骼粒子系统补全,操作响应达毫秒级且注重数据安全。文章分析指出,在Unity与Unreal主导的通用引擎市场中,国产引擎应抓住工业数字孪生等垂直场景“稳定优先、国产化适配”的刚需机遇,用AI原生能力实现弯道超车,而非在功能广度上“硬碰硬”。

  • 阿里云Wan3.0正式公测:万物皆可生视频!单次可生成30秒

    阿里云官宣,万相系列全新视频生成模型Wan3.0启动公测,该模型在成片时长、多素材输入、画面真实度、跨帧一致性四大维度完成全面升级。 在视频时长方面,模型支持单次生成最长30秒完整视频,可实现一镜到底、多段连续运镜等复杂镜头叙事。 同时搭载智能时长推荐、视频延长功能,能够自由拓展剧情内容,摆脱短镜头创作限制。

  • 苹果iOS 27开发者预览版Beta 4发布:国行iPhone Siri AI继续缺席

    今天凌晨,苹果正式发布iOS 27开发者预览版Beta 4,版本号为24A5390f。 本次更新主要围绕功能完善、细节优化和系统流畅度提升展开,进一步修复此前版本存在的Bug,并对全新UI及交互体验进行持续打磨。 不过,国行iPhone用户期待的新一代苹果智能(Apple Intelligence)和Siri AI,依然没有在iOS 27开发者预览版Beta 4中上线。 国内用户之所以对Beta 4抱有较高期待,主要是因为7月中旬�

今日大家都在搜的词: