首页 > 业界 > 关键词  > 正文

斯坦福研究人员推出 Sophia 可高效低成本训练大模型

2023-07-26 15:53 · 稿源:站长之家专栏

站长之家(ChinaZ.com)7月26日 消息:斯坦福大学的研究人员开发了一种名为 Sophia 的新型优化器,可将语言模型的预训练时间缩短一半。相比于 Adam 优化器,Sophia 可以更快地解决语言模型的问题。

Sophia 通过轻量级估计对角 Hessian 矩阵作为二阶优化器的预条件。在更新之后,通过取梯度的平均值除以估计 Hessian 的平均值来进行元素级别的剪切。

大模型 元宇宙 (1).jpg

这种剪切限制了最坏情况下更新的大小,并减轻了轨迹的非凸性和快速 Hessian 变化的影响。Sophia 的平均每步时间和内存开销都很低,因为它只在每几次迭代中估计对角 Hessian 矩阵。在使用 GPT-2模型进行语言建模时,Sophia 相比于 Adam 的速度提升了一倍,包括步数、计算量和墙上时间。

研究人员还展示了 Sophia 可以适应语言建模任务中的大参数变化。这项工作的运行时限与损失函数的条件数无关。总的来说,Sophia 优化器的实现简单,使用 PyTorch 时只需在梯度之前加上对角 Hessian 的轻量级估计即可。Sophia 还可以确保所有参数

维度上的一致损失减少,通过在尖锐尺寸(具有大 Hessian)上更严厉地惩罚更新,而在平坦维度(具有小 Hessian)上较轻地惩罚更新。学术界即使资源有限,也可以研究语言模型的预训练并开发出新的有效算法。研究人员在研究过程中广泛使用了理论推理,并在明天发布的代码中使用了稍微修改过的学习率的定义。

举报

  • 相关推荐
  • 存储成本暴涨!苹果iPhone 18 Pro成本大增近40%:定价可能大涨

    苹果将在9月初召开秋季新品发布会,正式推出iPhone 18 Pro系列、iPhone Ultra等三款手机新品。 TrendForce集邦咨询发布的最新报告显示,以256GB版本iPhone 18 Pro作为测算样本,整机BOM物料成本相较2025年同期Pro机型提升约38%,成本上涨核心驱动力来自存储器价格持续上行。 存储零部件在iPhone Pro整机成本中的权重发生根本性变化,一年前该品类占比仅10%,2026年三季度已升至34%,机构预�

  • 企业AI落地:从大模型走向本体驱动的超级组织

    企业部署大模型后仍难落地,根因是缺乏统一业务语义与执行闭环。文章提出,企业AI真正的底层是“本体论+大模型+智能体AI”三层架构:本体定义业务对象与关系,让AI理解企业;大模型负责推理;智能体在治理框架内执行动作。以Orion AIP为例,通过构建统一本体、融合数据与规则,可实现风险分析等场景下的“感知-分析-决策-行动”闭环,让AI从对话工具进化为能工作、可追溯、可信赖的组织核心。

  • 大模型上手机,三星为何选中面壁智能?

    7月15日,网信办公布了最新一批大模型备案审批通过名单。名单上,清一色是手机厂商及其深度绑定的模型合作伙伴。小米、OPPO、vivo、苹果……每一家后面跟着的,都是目前耳熟能详的大厂模型团队。 巨头牵手巨头,大厂配对大厂,看起来像一场门当户对的“联姻”。 而“新AI六小虎”之一的面壁智能,是名单中唯一专注做端侧模型的公司,这也是国产端侧大模型首次进入

  • 10万小时训练!小米具身基座模型Xiaomi-Robotics-1正式开源

    今日,小米技术宣布,小米具身基座模型 Xiaomi-Robotics-1正式开源。 据介绍,Xiaomi-Robotics-1基于超过10万小时UMI数据进行预训练,并使用超过1万小时跨本体数据进行后训练。

  • 忆联AM6B0:为端侧AI提速,UMA时代的大模型存储“标配”!

    NVIDIA统一内存架构让PC可运行千亿大模型,但对存储性能提出严苛要求。忆联AM6B0 SSD凭借满血性能、高低延迟与可靠设计,成为UMA时代大模型存储“标配”。实测加载千亿大模型仅需14.6秒,顺序读写达7100/6500 MB/s,综合性能领先同级竞品,有效缩短等待、释放生产力,全面补齐算力落地的关键一环。

  • 特斯拉车机系统更新:首次接入豆包大模型

    特斯拉中国今日发布2026.14.13版本车载系统更新,即日起面向Model 3、Model Y、Model S、Model X 四款车型分批推送。 总体上看,本次升级囊括智能大模型接入、车载场景实用功能、交互体验优化以及多项系统安全漏洞修复,改动覆盖用车全场景。 值得一提的是,本次更新最大亮点,是特斯拉国内车载系统首次搭载第三方大模型字节跳动豆包大模型正式入驻车机,接替原有语音体系�

  • 予非知识图谱大模型完成生成式人工智能服务备案!潍坊市首个

    “予非知识图谱大模型”获国家生成式AI服务备案认证,系潍坊首例。模型聚焦非结构化数据治理,具备知识建模、实体对齐、动态图谱等全链能力,内置知识分级与访问控制,适配政务、金融等高合规场景。作为“予非·睿知”平台底座,通过“模型+平台”模式破解知识分散、检索难等痛点,赋能政企业务协同与决策。此举为区域生成式AI合规应用与数字经济发展树立新标杆。

  • 阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别大模型

    阿里发布新一代语音识别大模型 Qwen-Audio-3.0-ASR-Flash,重点优化了专业词汇的识别表现。该模型已在医疗等垂直场景中展现出较高准确率,相关听写准确率突破九成五。 语音识别在通用对话中已相对成熟,但在医学、法律、工业等专业领域,由于术语密集且发音相近词多,模型常常出现误判。此次新模型强化了对专业词的处理能力,使其更贴合真实行业场景的需求。

  • 告别无效慢跑!“88全民健身节”带来2026家用跑步机科学训练指南

    麦瑞克联合运动员夏思凝发起“科学开练”活动,推动全民健身科学化。品牌围绕家庭跑步场景三大痛点:膝损伤防护、空间适配和运动枯燥,进行系统性布局。自研的“太极超临界缓震护膝”技术使回弹率达66%,实现从减震到缓震的升级;乾坤一键折叠技术将占地面积缩至0.3平米;基于DeepSeek大模型推出AI私教及AR竞技游戏以提升趣味性。技术突破与多元产品矩阵助其占据超16%的线上市场份额,并获国家体育总局训练局长期合作等权威背书。

  • 44岁爸爸被女儿激将考上985研究生 网友:最好的“回怼”

    8月2日,陕西市民张志强发布的一条短视频引发网友热议。视频里,44岁的他手持西北工业大学MBA录取通知书,讲述自己受叛逆期女儿一句“有本事你去考个研”的刺激,最终成功上岸的故事。 张志强是一名普通市民,年过四十的他本已远离校园多年。然而女儿的叛逆和那句略带挑衅的话,点燃了他的斗志。“她说‘你整天就知道说我,有本事你自己去考个研究生’——那我�

今日大家都在搜的词: