首页 > 业界 > 关键词  > 大模型最新资讯  > 正文

腾讯披露大模型训练方法:Angel框架升级 效率提升2.6倍

2023-11-27 14:24 · 稿源:站长之家

要点:

  • 腾讯披露混元大模型训练方法,Angel框架升级,大模型训练效率提升至2.6倍,千亿级大模型训练可节省50%算力成本。

  • AngelPTM机器学习训练框架通过多维度并行优化存储,在通讯方面采用软硬件结合解决方案,提高大模型训练稳定性。

  • 腾讯推出大模型推理框架AngelHCF,通过扩展并行能力和关键能力优化,相较于主流框架,推理速度提高了1.3倍。

站长之家(ChinaZ.com) 11月27日 消息:在当前大模型参数规模呈指数级增长的情况下,腾讯近日披露了混元大模型训练的最新方法,通过升级自研机器学习框架Angel,成功提升大模型训练效率。这一升级使得千亿级大模型训练可以节省高达50%的算力成本,为应对算力紧缺提供了有力支持。Angel框架的升级不仅仅在于提高效率,还支持单任务万卡级别超大规模训练,进一步提升了腾讯云HCC大模型专属算力集群的性能和效率。

云服务 人工智能

图源备注:图片由AI生成,图片授权服务商Midjourney

为了进一步提高大模型的训练和推理效率,腾讯自研了机器学习训练框架AngelPTM。在存储方面,AngelPTM采用多维度的并行计算,包括数据并行、模型并行、流水并行和序列并行。

此外,通过在ZeRO-Cache的基础上引入统一视角技术,将显存和主存打通,有效扩展了显存容量,提升了单机存储容量达90%。在通讯方面,腾讯通过软硬件结合的方式解决,构建了3.2T RDMA网络来拓宽带宽,同时在框架软件层面做GPU拓扑感知,实现了负载均衡的流水并行。为了确保稳定性,腾讯对基础设施的网络、硬件、存储、云原生调度都进行了监控,并实施了自动续训和系统容错。

此外,为解决推理成本不断上升的问题,腾讯推出了大模型推理框架AngelHCF。通过扩展并行能力和关键能力的优化,包括Embedding共享、Attention算子优化、Paged Attention优化等方式,提高了推理性能,相较于主流框架,AngelHCF的推理速度提高了1.3倍。这一框架在腾讯混元大模型文生图的应用中,将推理耗时从原本的10秒缩短至3至4秒。

腾讯不仅仅在大模型训练方面取得了显著的效率提升,还在推理阶段取得了实质性的优化。这一系列技术提升已经在腾讯云上得以开放,为用户提供更优的训练和推理加速能力,同时支持客户一站式训练精调,打造专属智能应用。腾讯内部已有超过300项业务和应用场景接入腾讯混元大模型内测,涵盖了文本总结、摘要、创作、翻译、代码等多个领域,这标志着整个生产链路的全面升级,从模型研发到应用落地形成了一站式的平台,进一步推动了大模型应用的发展。

举报

  • 相关推荐
  • 【Neo上新】CRM+企微会话上线AI三大能力,让销售沟通效率提升200%

    文章主要介绍了企业在使用企微服务客户过程中遇到的三大痛点及解决方案:1)销售人员需手动翻查话术库耗时耗力,回复慢且不规范;2)客户标签维护滞后,人工打标签耗时且存在主观偏差;3)需单独打开CRM系统撰写活动记录,信息不准确。销售易CRM通过整合企业微信AI能力,提供智能话术推荐、智能客户标签、智能会话总结三大功能,实现从"人找知识"到"知识找人"的转变,提升沟通效率200%。AI能自动识别客户意图匹配场景话术,实时更新客户画像,自动生成会话摘要沉淀客户数据资产,帮助企业实现精细化运营。

  • “好房产品力峰会暨数字化赋能创新大会”圆满落幕,聚焦产品力重构与成交效率提升

    2025年7月2日,中国房地产业协会指导的"好房产品力峰会暨数字化赋能创新大会"在北京举行。会议聚焦房地产行业深度调整周期下的产品力重构,探讨如何通过产品逻辑创新与数字能力升级实现从"难卖"到"好卖"的转型。与会专家指出,当前购房需求正从物理属性向情感共鸣过渡,传统营销手段逐渐失效。大会提出"新三好房子"标准——好户型、好�

  • 深耕垂直物联场景,萤石蓝海大模型2.0 升级引领行业再跃迁

    萤石网络发布蓝海大模型2.0,聚焦智能家居垂直领域。该模型具备三大核心能力升级:1)感知能力实现1200种目标识别,支持动物种类精细分类;2)理解能力支持多模态分析,包括视频、听觉及混合理解;3)记忆能力构建目标/设备/用户三维画像体系。作为行业首个家居专用大模型,已落地65款产品,服务调用量半年增长400%。同时推出EZVIZ HomePlay OS系统,开放软硬件能力,构建混合算力中心等基础设施,推动智能家居场景创新。在开发者大会上,萤石还展示了养老看护等碎片化场景解决方案,通过垂直领域深度优化实现低成本高效应用。

  • 2025最新全球AI大模型排名,国内外模型动态洗牌(实时更新平台推荐)

    2025年全球AI大模型竞争进入白热化阶段,OpenAI、Google等国际巨头与中国企业激烈交锋。技术迭代远超预期,仅半年内排名就经历多次洗牌。当前全球AI大模型综合排名Top10显示:1)GPT-4.5综合80.4分领跑;2)Claude3.7编程领域领先;3)Gemini2.0多模态标杆;4)国产DeepSeek R1推理速度提升3倍;5)阿里Qwen2.5数学编程单项第一。中国模型通过开源策略、垂直优化和成本革命实现弯道超车,如DeepSeek R1仅耗资600万美元达到GPT-4水平,字节豆包采用稀疏MoE架构成本大幅降低。中文场景深度优化表现突出,如文心一言4.0方言交互准确率92%。开源生态爆发,通义千问全尺寸开源(7B~110B参数)在Hugging Face排名第一。权威评估需结合标准化测试、人类盲测和场景适配性。

  • 6个AI大模型大战2025年高考数学新一卷:数学题推理能力均显著提升

    ​近日,随着高考的圆满结束,一场别开生面的“数学擂台赛”在各大AI大模型间悄然展开。多家知名科技公司的大模型被邀请参与2025年数学新课标Ⅰ卷中的14道客观题测试,以此检验它们在逻辑推理和数学能力上的实力。此次测试题目包含8道单选题、3道多选题以及3道填空题,满分设定为73分,且测试过程严格遵循高考判分原则,确保结果的公正性与准确性。 测试成绩揭晓�

  • AI日报:腾讯混元推3D生成大模型Hunyuan3D-PolyGen;钉钉AI表格重磅来袭;阿里推多模态大语言模型HumanOmniV2

    本文介绍了AI领域多项重要进展:1)腾讯推出首个美术3D生成大模型Hunyuan3D-PolyGen,显著提升建模效率;2)阿里发布多模态大模型HumanOmniV2,准确率达69.33%;3)钉钉AI表格实现1小时处理千项任务;4)百度PaddleOCR3.1版本在多语种识别和文档翻译方面升级;5)微软推出Deep Research智能体,自动化研究流程;6)香港理工与OPPO联合开源视频超清框架DLoRAL;7)谷歌开源MCP工具箱简化AI与数据库集成;8)Win11将推出AI动态壁纸功能。这些创新展示了AI在3D生成、多模态理解、办公效率、视觉处理等领域的突破性进展。

  • AI日报:腾讯混元3D 2.1大模型开源;字节跳动AI Lab负责人李航卸任;OpenAI Codex 全新升级

    本文介绍了AI领域最新动态:1)腾讯开源混元3D2.1大模型,提升3D生成质量;2)OpenAI Codex升级,优化代码生成功能;3)字节跳动AI Lab负责人李航卸任;4)微软发布700个AI应用案例;5)微软推出Code Researcher工具,解决58%系统崩溃问题;6)Observer AI实现屏幕操作自动化;7)Genspark发布AI浏览器;8)麻省理工用AI技术3.5小时修复15世纪名画;9)蚂蚁集团推出开源多模态GPT-4o模型Ming-Omni;10)MagicTryOn视频换衣框架;11)字节跳动发布实时互动AI视频生成模型Seaweed APT2;12)ChatGPT搜索功能升级;13)字节跳动与老凤祥合作开发AI智能眼镜。

  • 华为云盘古预测大模型首创 Triplet Transformer 统一预训练架构

    6月20日,华为发布盘古大模型5.5,五大基础模型全面升级。该模型采用业界首创的Triplet+Transformer统一预训练架构,能跨行业处理表格数据、时间序列数据和图片数据,显著提升预测精度和泛化能力。已在水泥、钢铁、电解铝、供热等多个工业场景落地应用:海螺水泥实现熟料强度预测,宝武钢铁高炉出铁温度合格率超90%,云南铝业年省电2600万度,天津供热能耗降低10%。模型聚焦工业领域,通过工艺优化和系统寻优,助力企业降本增效,推动行业智能化转型。

  • 如何用AI Agent让企业效率翻倍?

    2025年5月,红杉资本AI峰会在旧金山落下帷幕。这场汇聚150位全球顶尖AI公司创始人的大会达成重要共识:下一轮AI竞争的核心不再是工具本身,而是为用户创造的实际收益。在此背景下,Agent的重要性被前所未有的推至所有人的视野前沿。 硅谷大厂开启了第一波加速,微软CEO纳德拉在主题演讲中宣布:“我们已经进入了AI Agent时代,正在见证AI系统如何以全新方式帮助我们解决问�

  • A日报:B站升级动漫视频生成模型AniSora V3;字节开源4D视频生成框架EX-4D;DeepSWE开源AI Agent系统强势登顶

    AI日报栏目汇总了近期AI领域的重要进展:1)字节跳动开源EX-4D框架,可将单目视频转换为多视角4D视频;2)B站开源动漫视频生成模型AniSora V3,支持多种风格;3)DeepSWE+开源基于Qwen3-32B的AI Agent系统;4)字节开源3亿参数图像编辑模型VINCIE-3B;5)Stability AI推出移动端音频生成模型Stable Audio Open Small;6)谷歌发布免费教育AI工具套件Gemini for Education;7)Topview推出革命性AI数字人带货技术Avatar