腾讯披露大模型训练方法:Angel框架升级效率提升2.6倍

2023-11-27 14:24 · 稿源：站长之家

要点:
腾讯披露混元大模型训练方法，Angel框架升级，大模型训练效率提升至2.6倍，千亿级大模型训练可节省50%算力成本。
AngelPTM机器学习训练框架通过多维度并行优化存储，在通讯方面采用软硬件结合解决方案，提高大模型训练稳定性。
腾讯推出大模型推理框架AngelHCF，通过扩展并行能力和关键能力优化，相较于主流框架，推理速度提高了1.3倍。

站长之家(ChinaZ.com) 11月27日消息:在当前大模型参数规模呈指数级增长的情况下，腾讯近日披露了混元大模型训练的最新方法，通过升级自研机器学习框架Angel，成功提升大模型训练效率。这一升级使得千亿级大模型训练可以节省高达50%的算力成本，为应对算力紧缺提供了有力支持。Angel框架的升级不仅仅在于提高效率，还支持单任务万卡级别超大规模训练，进一步提升了腾讯云HCC大模型专属算力集群的性能和效率。

云服务人工智能

图源备注：图片由AI生成，图片授权服务商Midjourney

为了进一步提高大模型的训练和推理效率，腾讯自研了机器学习训练框架AngelPTM。在存储方面，AngelPTM采用多维度的并行计算，包括数据并行、模型并行、流水并行和序列并行。

此外，通过在ZeRO-Cache的基础上引入统一视角技术，将显存和主存打通，有效扩展了显存容量，提升了单机存储容量达90%。在通讯方面，腾讯通过软硬件结合的方式解决，构建了3.2T RDMA网络来拓宽带宽，同时在框架软件层面做GPU拓扑感知，实现了负载均衡的流水并行。为了确保稳定性，腾讯对基础设施的网络、硬件、存储、云原生调度都进行了监控，并实施了自动续训和系统容错。

此外，为解决推理成本不断上升的问题，腾讯推出了大模型推理框架AngelHCF。通过扩展并行能力和关键能力的优化，包括Embedding共享、Attention算子优化、Paged Attention优化等方式，提高了推理性能，相较于主流框架，AngelHCF的推理速度提高了1.3倍。这一框架在腾讯混元大模型文生图的应用中，将推理耗时从原本的10秒缩短至3至4秒。

腾讯不仅仅在大模型训练方面取得了显著的效率提升，还在推理阶段取得了实质性的优化。这一系列技术提升已经在腾讯云上得以开放，为用户提供更优的训练和推理加速能力，同时支持客户一站式训练精调，打造专属智能应用。腾讯内部已有超过300项业务和应用场景接入腾讯混元大模型内测，涵盖了文本总结、摘要、创作、翻译、代码等多个领域，这标志着整个生产链路的全面升级，从模型研发到应用落地形成了一站式的平台，进一步推动了大模型应用的发展。

（举报）

相关推荐

关键词：

大模型

GEO排名查询工具推荐:霸屏AI大模型答案的核心方法，做好AI大模型排名优化

随着AI大模型成为用户获取信息的主要入口，AIBase推出GEO排名查询工具，帮助品牌监测在豆包、DeepSeek、文心一言等主流AI平台中的曝光情况。该工具支持多平台检测、关键词追踪、可视化数据展示，可精准分析品牌是否被推荐、出现频次及具体场景，为制定AI大模型排名优化策略提供数据支撑。在GEO时代，抢占AI回答推荐位意味着获得全新流量入口。

AI大模型 GEO排名查询生成引擎优化
深度解读丨悠然无界大模型BLM-1.0：跨空间、跨任务与跨本体泛化的里程碑

9月28日，悠然大模型BLM-1.0完成迭代升级并全面开源。该模型突破数字与物理世界壁垒，实现跨空间迁移、跨任务学习与跨本体泛化能力，以统一模型覆盖多种机器人平台。在空间理解、推理与执行评估中综合超越同规模SOTA方法，支持工业制造、智慧城市等场景应用，推动空间智能生态共建。

悠然无界大模型 BLM-1.0 开源模型权重
考拉悠然开源悠然无界大模型BLM-1.0，以空间智能引擎驱动产业变革

9月28日，在成都举行的“2025天府人工智能产业生态大会”上，考拉悠然宣布其自主研发的“悠然无界大模型BLM-1.0”完成迭代升级并全面开源，同时发布基于该模型的UU Holo Glass O1 AR工业眼镜。此举标志着公司以“技术开源+场景落地”双轮驱动策略，推动空间智能产业生态共建。BLM-1.0突破传统模型局限，具备跨空间、跨任务、跨本体的“三跨”统一能力，在空间理解、推理与执行三大核心能力上刷新行业纪录。配套AR眼镜深度融合空间感知与多模态交互，实现工业运维、安装巡检等场景的全程自动化与智能辅助，显著提升效率并降低成本。

人工智能开源大模型空间智能
2025数贸会 | 每日互动：大数据+大模型，重塑营销价值

9月26日，全球数字生态大会在杭州举行，聚焦AI与大数据如何重塑营销价值。每日互动朱晓鸣提出，企业需转变思维，从数据中洞察价值而非仅追求数据量，并介绍了“大数据联合计算模式”以平衡合规与营销增效。大会还推出AI营销产品AITA助手，结合大数据与行业经验，为品牌提供智能策略，助力降本增效，推动营销新纪元。

全球数字生态大会 AI变革营销范式转移
易鑫发布Agentic大模型，破解汽车金融风控与效率痛点

9月12日，易鑫集团在“IT Value Summit数字价值年会”上入选“2025创新场景年度AI应用TOP榜”，成为汽车金融科技领域唯一上榜企业。首席科技官贾志峰指出，易鑫以AI为核心驱动力，通过自研大模型“智鑫多维”等技术，显著提升风控水平与融资通过率，推动行业智能化转型。平台已连接全国4.2万家经销商及上百家金融机构，服务覆盖牧民、基层员工等多元群体，体现技术普惠价值。未来将持续加大科技创新投入，深化国内普惠金融服务，并探索技术出海，助力全球汽车金融行业迈向更高水平智能化。此次上榜不仅是对其技术实力的认可，更反映出行业正加速拥抱智能化变革。

AI应用汽车金融金融科技
我国首个政务大模型安全国家标准发布百度深度参与制定

日前，我国首个针对政务大模型的安全国家标准《政务大模型应用安全规范》（下称《规范》）正式发布。百度作为核心参编单位，凭借其在人工智能安全及政务服务领域的深厚积累，深度参与了该标准的制定工作，为政务大模型的安全选用、部署运行、护栏建设和合规落地提供了专业支持。《规范》由国家工业信息安全发展研究中心牵头，联合百度等国内领先企业共同制定�

政务大模型安全国家标准百度参编
荐AI日报：美团发布推理大模型LongCat-Flash-Thinking；阿里Wan-Animate开源；字节推豆包翻译大模型

AI日报栏目聚焦人工智能领域最新动态。美团推出高性能推理大模型LongCat-Flash-Thinking；阿里开源Wan-Animate模型革新AI视频生成；字节跳动发布豆包翻译模型，支持28种语言互译；华为与浙大联合推出安全大模型DeepSeek-R1-Safe；阿里云即将发布跨模态模型Qwen3-Omni；xAI推出计算成本降低98%的Grok4Fast模型；YouTube发布多项AI创作辅助功能；IBM推出轻量级文档处理模型Granite-Docling-258M；中科院发布类脑大模型SpikingBrain实现百倍速度突破；OpenAI将推出仅限Pro用户的计算密集型新功能。

AI日报美团大模型 LongCat-Flash-Thinking
推荐国内优势智驾：Momenta凭借飞轮大模型，带来极致流畅的驾驶体验

Momenta作为国内智能驾驶领域的领先者，凭借其创新的飞轮大模型技术，实现了端到端的自动驾驶解决方案。该技术将感知与规划整合，有效解决长尾问题，提升系统可靠性和稳定性。其R6飞轮大模型采用强化学习，具备持续进化能力，适应复杂路况。Momenta与宝马、奥迪等全球主流车企深度合作，方案已成功应用于广汽丰田、东风日产等车型，并在欧洲、澳大利亚等市场落地，展现出强大的全球适应性和技术优势。选择Momenta，即选择了经过验证的可靠技术和持续升级的智能驾驶体验。

智能驾驶系统技术实力 Momenta
小米开源首个原生端到端语音大模型支持音频重建任务和音频转文本任务

小米发布首款开源端到端语音大模型Xiaomi-MiMo-Audio，拥有12亿参数，在智能性、情感表达和交互适配方面接近人类水平。该模型最大技术突破在于少样本学习能力，通过创新预训练架构和超一亿小时训练数据，成功突破传统语音模型依赖大规模标注数据的技术瓶颈。基于Transformer架构，支持音频重建和音频转文本等多任务处理。小米已在Huggingface平台发布预训练和指令微调版本，并在Github开源Tokenizer模型，为研究者和开发者提供完整工具链。

AI语音开源模型少样本学习
荐AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型；Claude Sonnet4.5发布

本期AI日报聚焦多项技术突破：DeepSeek发布V3.2-exp模型，通过稀疏注意力机制降低API成本50%；Anthropic推出Claude Sonnet 4.5，在编码任务表现卓越；ChatGPT新增即时结账功能，实现对话界面直接购物；OpenAI将推出AI版TikTok，所有内容由Sora2模型生成；百度地图升级小度想想2.0，提供智能出行服务；蚂蚁集团开源万亿参数模型Ring-1T-preview；DeepMind提出“帧链”概念，推动视频模型实现全面�

AI DeepSeek 稀疏注意力

今日大家都在搜的词：

热文

3 天
7天

腾讯披露大模型训练方法:Angel框架升级效率提升2.6倍

GEO排名查询工具推荐:霸屏AI大模型答案的核心方法，做好AI大模型排名优化

深度解读丨悠然无界大模型BLM-1.0：跨空间、跨任务与跨本体泛化的里程碑

考拉悠然开源悠然无界大模型BLM-1.0，以空间智能引擎驱动产业变革

2025数贸会 | 每日互动：大数据+大模型，重塑营销价值

易鑫发布Agentic大模型，破解汽车金融风控与效率痛点

我国首个政务大模型安全国家标准发布百度深度参与制定

荐AI日报：美团发布推理大模型LongCat-Flash-Thinking；阿里Wan-Animate开源；字节推豆包翻译大模型

推荐国内优势智驾：Momenta凭借飞轮大模型，带来极致流畅的驾驶体验

小米开源首个原生端到端语音大模型支持音频重建任务和音频转文本任务

荐AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型；Claude Sonnet4.5发布

今日大家都在搜的词：

热文

苹果iOS18.7.1正式版更新发布重要安全修复

OPPO A6开售：售价1599元起搭载7000mAh六年长寿电池

AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型

罗永浩替小米说公道话：海报小字是行业陋习

腾讯QQ闪传功能上线支持单文件最大10GB传输

苹果iOS 26.0.1正式版发布：修复iPhone 17系列Wi-Fi、拍照等Bu

OPPO Find X9系列定档：10月16日发布

王腾小红书账号注销快手账号已被封禁抖音账号已私密视频号已

鸿蒙智行享界S9T上市13天大定破 15000 台

鸿蒙智行9月交付新车52916台：全系累计交付突破95万台

小米17破今年国产手机首销纪录卢伟冰：需求远超预期

苹果iOS18.7.1正式版更新发布重要安全修复

苹果将推出iPhone 17e：搭载A19 芯片支持灵动岛

OPPO A6开售：售价1599元起搭载7000mAh六年长寿电池

AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型

小米17系列开售5分钟破25年国产手机首销纪录

AI日报：蚂蚁开源高性能思考模型Ring-flash-2.0；通义7款模型屠

AI日报：腾讯重磅发布混元图像3.0；快手发布KAT系列Agentic Co

罗永浩替小米说公道话：海报小字是行业陋习

iPhone调休闹钟上热搜苹果客服回应：需手动设置

站长商机

腾讯披露大模型训练方法:Angel框架升级 效率提升2.6倍

今日大家都在搜的词：

热文

站长商机

腾讯披露大模型训练方法:Angel框架升级效率提升2.6倍