首页 > 传媒 > 关键词  > 昇腾AI最新资讯  > 正文

一起昇腾 共绽光芒:昇腾AI开发者峰会2026在京成功举办

2026-05-23 15:47 · 稿源: 站长之家用户

[中国,北京,2026年5月22日]鲲鹏昇腾开发者大会2026——昇腾AI开发者峰会2026在北京成功举办。此次峰会以“一起昇腾 共绽光芒”为主题,旨在汇聚全球前沿技术,打造面向开发者的思想盛会。昇腾秉持开源开放理念,持续为开发者提供好用易用的开发工具,着力构建繁荣的开发者生态,与每一位开发者携手共创未来。

过去一年Agentic AI发展迅猛,华为在AI Infra层面已开启超节点时代。华为公司Fellow、半导体首席科学家廖恒在《面向Agentic AI时代的昇腾超节点最佳实践》主题演讲中表示:面向预训练、推理Prefill与Decode等各类业务负载,AI芯片的算力、内存带宽、内存容量、互联 IO 带宽四大核心指标,在不同应用场景下优先级各有差异。此外,尤其是互联的能力直接决定了超节点的能力。通过昇腾950芯片优异的互联能力,可构建出更高带宽、更低延时,以及覆盖范围更大的超节点。整体来看,系统综合性能等同于超节点规模与单芯片性能规格的乘积。

Agent时代,MoE模型推理对时延提出更高要求,时延需压缩至10毫秒、5毫秒,乃至1毫秒级别。而EP的Dispatch-Combine通信,正是制约时延的核心瓶颈。廖恒提出,EP通信应在Scale Up域里完成,因为EP是All-to-All这种多对多的极其细粒度的通信,单数据包大小仅7KB 至14KB,数据包交互频次随专家数量呈平方级增长,传统网络架构无法承载,难以实现低时延传输。对于如何选择通信方式,廖恒认为取决于通信的颗粒度,如果通信量小,Load&Store内存语义优势大,如果通信颗粒较大,那么建议使用DMA,同时,多个网络流量尽量不要有路径重叠。

Agentic AI也对KV Cache带来更大挑战。一方面,模型调用频次暴涨50至100倍;另一方面,序列长度从Chatbot典型的4k序列长度,到今天接近1兆的序列长度,带来250倍提升。受此影响,KV Cache命中率突破95%。高命中率会显著降低Prefill成本,也会导致KV Cache成本等比例提升。对此,华为创新设计搭载UB端口的SSU单元,直出接口接入UB网络。该架构精简剔除存储系统、文件系统,以及从文件系统名字中间转换到SSD的逻辑扇区的转换过程,消除原路径诸多障碍,NPU直接命中SSU的KV Cache,SSU通过UB网络把数据传送到NPU的片上内存,带宽至少提升一个数量级。

廖恒表示,昇腾一直秉承从“芯片架构-系统架构-集群架构-软件架构”的深度协同,持续迭代硬件能力、优化 CANN 等基础软件,平衡生态兼容性与系统运行效率,为业界构筑坚实的算力底座。

华为公司Fellow、半导体首席科学家 廖恒

围绕易用性持续提升,打造从好用到易用的昇腾算力底座

会上,华为昇腾计算产品部部长周斌发表了《围绕易用性持续提升,打造从好用到易用的昇腾算力底座》主题演讲,从开发者视角全面介绍昇腾软件易用性建设最新成果,围绕CANN全面开源开放、兼容主流开源生态、Mind系列软件升级并开源贡献三大方向,持续降低开发门槛、提升开发效率,为 AI 开发者提供全流程高效开发体验。

华为昇腾计算产品部部长 周斌

CANN 作为昇腾软件底座与生态核心,已实现全面开源开放,为开发者提供完整、高效、开放的算子开发体系。目前完成分层解耦与开源,开放运行时、算子编译等全层级接口,算子与通信库支持独立升级,已开源50余个源码仓。

算子编程层面,昇腾面向不同开发者需求提供全栈支持:对追求极致性能的工程师,提供Ascend C、CATLASS模板库,支持对计算、访存、流水等关键环节细粒度控制,充分释放芯片性能;对注重快速创新的AI算法工程师,支持TileLang、Triton等主流Tile编程生态,并推出PyPTO,以Tensor抽象简化算法创新流程。为降低开发门槛,昇腾全面拥抱Python生态,推出PyAsc、Python版CATLASS模板库及PyPTO,让开发者以Python友好方式实现底层并行与高性能算子开发。

昇腾还打造了CANNBot算子智能体,将微架构优化经验融入skill技能库,支持Ascend C、CATLASS、Triton、TileLang、PyPTO等多种编程范式,覆盖算子开发全流程。基于CANNBot,单个Vector算子生成仅需3小时,从生成到部署全流程1天内即可完成,相比传统人工开发效率提升5倍以上。为进一步赋能业界Agent与大模型适配昇腾算子,昇腾还量身打造了专属算子数据集与评测集:算子数据集覆盖Vector、Cube、CV融合算子数据,通过高质量样本与专业思维链帮助大模型理解算子写法;算子评测集提供分级评测体系,覆盖22类典型算子、内置4000+评测点,多维度评估算子生成的功能、精度与性能。

在兼容主流开源技术生态方面,昇腾以全面兼容主流开源生态为易用性改进核心方向,让开发者无需改变使用习惯即可高效调用昇腾硬件能力。算子编程层面,昇腾实现Triton和TileLang接口100%兼容,性能可达Ascend C的0.6~0.9倍,开发周期缩短至一周,已支持超600个Triton算子和300个TileLang算子,覆盖主流模型关键算子样例。

北京大学计算机学院副研究员杨智提到,TileLang作为tile级编程框架,在DeepSeek V4的算子实践中表现出了高开发效率与高性能,使能昇腾全面支持DeepSeek V4推理,同时也证明了TileLang优秀的跨平台能力,Developer模式下不同平台的算子仅有少量代码存在区别。在未来TileLang for Ascend还有广阔的发展空间,比如昇腾950的编程插件、torch.compile与Graph优化、超节点统一编程等。

北京大学计算机学院副研究员 杨智

AI框架上,昇腾全面支持PyTorch生态,实现2300多个API与社区对齐;图模式加速实现40+模型入图能力对齐,分布式加速实现20+主流大模型FSDP2开箱即用。训练加速方面,昇腾与8+强化学习社区建立合作,累计合入超万行代码。

verl社区Maintainer侯正罡介绍,verl社区与昇腾深度合作,基于昇腾软硬件实现fully Async,并在基础架构上开展联合创新和回馈社区,使得强化学习训练效率提升2倍以上。

verl社区Maintainer 侯正罡

推理领域,昇腾全面适配LLM、多模态等核心场景,作为vLLM Project唯一自主创新硬件厂商、SGLang主仓唯一自主创新非GPU硬件厂商,原生合入主干代码并贡献关键特性,长序列场景首Token时延降低30%,xLLM框架也已原生支持昇腾。

开源大模型推理引擎xLLM负责人刘童璇也分享道,xLLM推理引擎如同操作系统般连接底层芯片与上层大模型应用,原生支持文本、图像、视频等全模态模型的推理加速,实现算力向模型智能高效转化。其架构深度适配昇腾超节点技术优势,推理性能出众;同时开源大模型服务核心组件,构筑从推理引擎到上层服务的完整技术栈。未来 xLLM 将紧跟技术趋势持续迭代架构,深度适配昇腾950超节点产品,立足 Al for System 理念,从技术跟随迈向标准引领,打造面向未来的智能超级大脑。

开源大模型推理引擎xLLM负责人 刘童璇

在Mind系列软件全面升级方面,MindSpore面向超节点创新,组件化解耦,提升昇腾大模型图模式、分布式竞争力;MindSpeed通过架构革新,解耦插件,灵活配合开源社区使用,快速使能昇腾算力;MindIE系列软件栈全新升级,与生态充分融合,助力推理更快、更稳、更简单;MindStudio开源开放并搭载智能助手,全流程提升了开发调试效率。

全面升级昇腾开发者使能计划,共建繁荣开源生态

昇腾持续围绕开发者需求迭代升级,致力于为每一位开发者提供更好的开发和学习体验。华为昇腾生态发展部部长张良在《汇聚开发生态,共建技术未来》的演讲中,详细介绍了全面升级后的昇腾开发者使能计划,包括社区体验、开发工具、激励权益三大方向。

华为昇腾生态发展部部长 张良

面向社区,昇腾优化环境准备、部署、资料检索等流程,实现一键自动部署,平均2分钟即可跑通首个 Demo。社区上线了1000+昇腾卡,为每一位开发者提供初始100卡时的免费算力,基于一站式开发平台即取即用;算子开发易用性提升,算子工程升级、开源昇腾skills仓库,助力开发者高效开发、调试;加强开源社区CI/CD建设及Committer专家投入,提速开源贡献的验证及合入。

面向开发工具,将数千名昇腾专家经验沉淀成skills,搭建Agent工作流,提供全新Agentic开发体验,开发者通过需求描述即可完成各类模型开发操作,大幅压缩开发周期,让新手也能轻松搞定复杂任务,加速创新想法落地。

伴随基础软件全面开源,昇腾转向社区化运作,明确开发者成长与创新路径。设立首批创新激励基金,扶持算子、加速库等领域创新探索;投放10000卡算力资源,支撑开源社区研发运维与实操体验,充分保障开发者算力需求。

昇腾始终心系开发者、聚力同行者。会上华为ICT战略与业务发展部总裁彭红华,华为公司Fellow、半导体首席科学家廖恒,华为昇腾计算业务总裁张迪煊,华为北京总经理张东亚为杰出个人及团队分别颁发了“昇腾开源贡献杰出个人奖”及“昇腾开源合作杰出团队奖”,以表彰近一年来昇腾开发者在昇腾技术创新、技术生态发展中的突出表现。11名个人杰出贡献者获得“昇腾开源贡献杰出个人奖”荣誉,14个开源项目团队分别获得开源项目先锋团队奖、开源社区共建团队奖及AI4S 生态贡献团队奖。

昇腾开源贡献杰出个人奖

昇腾开源合作杰出团队奖

Agentic AI时代已全面开启,面向未来,昇腾将持续深耕超节点架构,提升易用性,打造好用易用的算力底座,壮大开发者生态。众行致远,聚力同行,昇腾诚邀广大开发者并肩前行,紧抓智能时代机遇,共同谱写Agentic AI时代高质量发展新篇章。

推广

特别声明:以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。站长之家将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时,可及时向站长之家提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明(点击查看反馈联系地址)。本网站在收到上述法律文件后,将会依法依规核实信息,沟通删除相关内容或断开相关链接。

  • 相关推荐
  • 从UMX到Scale-Up光互连 阿里云勾勒Agentic AI基础设施新趋势

    2026开放计算大会在京举行,阿里云聚焦Agentic AI时代算力基础设施变革。大会指出四大趋势:算力向CPU与GPU深度协同演进;长上下文推理引爆“存储墙”,阿里云发布磐久UMX统一内存架构以消除瓶颈;Scale-Up互联走向光互连与开放标准,阿里云推出业界首款即将量产的SNPO光互连模块;AI能力下沉至硬件固件,实现自然语言智能运维。阿里云正通过全栈自研,打造面向Agentic AI的深度协同基础设施。

  • 苹果发布iOS 27开发者预览版Beta 3:支持Siri语音自定义

    今天凌晨,苹果正式发布了iOS 27开发者预览版Beta 3,目前整体体验已经比较稳定,如果本周没有太大问题,预计下周将会推送首个公测版本。 Beta 3中Siri语音自定义正式启用,此前测试版仅开放入口无法使用,现支持调节Siri语速、表达情绪强度,提供两款基础人声。 该功能依靠端侧运算,仅iPhone 17 Pro、iPhone Air可用,语音同步作用于Siri、地图、Safari。 辅助功能新增实时视觉

  • Agentic 范式下的视频画质优化:火山引擎的新路径

    用户刷视频时,对画质的判断往往发生在几秒之内。同样是短视频、直播、AIGC视频,有的画面清晰、稳定、有质感,人物的眉眼、物品的纹理、运动中的细节都足够自然;有的则模糊、压缩痕迹重,动作一快就闪烁、发虚,让人只想很快划走。过去,平台解决这些问题的方式相对明确:在生产端做基础美化和编辑;在服务端用超分、去噪、锐化、去压缩等算法,把模糊、发虚的部�

  • KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级

    KAT-Coder-Pro V2.5发布,围绕长程任务链和复杂业务流,从三大维度实现突破:AutoBuilder提升仓库环境构建能力;KwaiClawEnv通过真实业务场景,打磨出高泛化性的Agentic能力;大规模强化学习让模型学会解决任务本身,而非死记格式。结合多专家蒸馏技术,单一模型即可稳定承载多种任务,在SWE-Bench Pro等评测中表现亮眼,并已全量上线。

  • UALink联盟Kurtis:开放Scale-Up互连加速构建可部署AI超节点

    2026 ODCC夏季全会在江西景德镇举行。UALink联盟主席Kurtis Bowman发表演讲,指出AI基础设施瓶颈已从算力转向加速器间高效数据交换。他阐述了开放Scale-Up互联标准UALink的核心价值,并介绍2026年4月发布的四项重大规范升级:新增网内计算功能、改进弹性与功耗管理、定义Pod级可管理性、支持基于UCIe的芯粒集成。ODCC正推动UALink规范在中国的验证落地,目前已有超115家成员企业参与开放AI超节点生态建设。

  • 腾讯乐享升级知识供给体系,让AI Agent读全读懂企业知识

    腾讯乐享在WAIC 2026上升级AI知识库,打通十余种企业知识来源,推出整库导入、增量同步、实时检索三种供给模式,大幅降低接入门槛并保障安全与准确性,助力Agent读懂企业知识。针对企业部署后常见的“组织失忆”困境,乐享从知识连接入手,通过权限继承、结构还原、多重机制确保知识质量与稳定更新,构建持续演进的“活知识底座”。该能力已在广发证券等头部企业验证,助力实现秒级精准业务答疑,已在金融、制造等30余行落地。

  • 告别误解!骁龙 8s Gen4 非“至尊”芯片,CPU/GPU/AI全维度性能揭秘

    骁龙8s Gen4+并非“骁龙8s至尊”,实为独立次旗舰芯片。它基于台积电4nm工艺,采用“1+7”全大核CPU架构,多核性能提升31%;GPU升级显著,支持硬件光追。AI和影像能力同样突出,配有18比特三ISP及夜景拍摄功能。该芯片性能出色且定位更亲民,是追求高性价比手机的优选。

  • 从 VCloud 到 Agentic VCloud:Agent 时代的范式重构

    文章提出视频云正从服务人类的VCloud进化为服务AI的Agentic VCloud。随着豆包等Agent具备类人交互能力,音视频成为Agent感知与执行任务的关键媒介。文章指出,视频云需重构为“连接人与Agent的新型智能底座”,核心是构建支撑多模态感知反馈与环境交互的技术体系,并让Agent完成从理解意图到交付成果的全链路任务,推动行业竞争转向企业级任务落地。

  • Vibe Coding vs SDD规格驱动开发:政企项目实测,哪种AI Coding模式真正能上线?

    上海宝臻数创长期服务政企数字化项目,面临需求文档复杂、返工率高、交付周期紧等难题。团队试用传统AI编码工具后发现其仅聚焦代码生成,无法解决全流程效率与质量痛点,陷入"增效不增利"困局。最终,公司选用采用规格驱动开发模式的CodeWave+SDD平台,通过先定规范后生成的范式革新及自研语言底座,实现了需求解析、架构设计到代码交付的全链路AI赋能。实践后,项目整体研发周期缩短超40%,需求返工率下降超60%,代码质量显著提升,完成了从人工研发到AI工程化驱动的转变。

  • 可灵AI NEXTGEN颁奖典礼在韩举行,搭建全球化青年AI影像创作成长沃土

    7月7日,可灵AI在首尔举办NEXTGEN颁奖盛典,集中展示了三项全球高校AI影像创作赛事的获奖作品。相较于单纯炫技,参赛作品明显转向深度叙事、社会观察与文化表达,标志着AI影像正从“技术实验”迈向“专业表达”。获奖短片多聚焦公共议题,展现了新生代创作者的人文关怀。可灵AI宣布将持续深化韩国本土合作,并依托全球超1亿用户和快速增长营收,通过“创作者计划3.0”等举措,长期扶持青年创作者,构建从教育到产业应用的全球创新生态。

今日大家都在搜的词: