OpenAI重磅开源！GPT-OSS模型泄露，116亿参数MoE架构震撼曝光，AI新纪元来袭？

2025-08-04 14:29 · 来源： AIbase基地

近日，网络上流传出OpenAI即将推出开源模型系列“GPT-OSS”（GPT Open Source Software）的重大信息泄露，引发业界广泛关注。据泄露的配置文件，这一操作系统系列模型参数规模从20亿到120亿不等，采用先进的MoE(Mixture of Experts)架构，结合长上下文扩展和高效注意力机制，展现出强大的性能潜力。AIbase编辑团队综合最新信息，为您深度解析GPT-OSS的技术亮点及其对AI行业的潜在影响。

MoE架构突破:116亿稀疏参数的强大引擎GPT-OSS系列模型采用Mixture of Experts（MoE）Transformer架构，包含36层、128个专家和Top-4路由机制，总稀疏参数高达116亿，活跃参数约5.1亿。这一设计通过将计算任务分配给多个专家模块，大幅降低了计算资源的消耗，同时保持了模型的高性能。相比传统密集模型，MoE架构使得GPT-OSS能够在更广泛的硬件环境下运行，为开源社区和开发者提供了更大的灵活性。核心技术亮点:高效MoE设计:128个专家模块通过Top-4路由选择最优专家处理任务，显著提升推理效率。

超大规模参数:总计116亿稀疏参数，活跃参数仅5.1亿，确保高效计算与强大性能的平衡。

灵活部署:MoE架构降低了对高性能GPU集群的依赖，使中小型团队也能利用这一模型进行开发。

长上下文扩展:131k Tokens的惊人能力GPT-OSS在上下文处理能力上实现了重大突破。其初始上下文长度为4096Tokens，通过RoPE（Rotary Position Embedding）技术扩展至约131k Tokens。这一长上下文能力使得模型能够处理超长文档和复杂对话场景，适用于学术研究、法律分析和大型代码生成等高吞吐场景。

此外，模型采用滑动窗口注意力机制（Sliding Window Attention），窗口大小为128Tokens，结合GQA(Grouped Query Attention)技术，每Token每层KV缓存占用仅约72KB。这种设计显著降低了内存开销，同时保持了高效的并行处理能力，为长文档处理提供了优异的性能保障。注意力机制优化:64头GQA与高吞吐性能GPT-OSS的注意力机制同样令人瞩目。

模型配备64个注意力头，每个头维度为64，结合GQA技术进一步优化了计算效率。相较于传统的多头注意力，GQA通过分组查询减少了计算复杂性，同时通过更宽的注意力投影（宽于隐藏维度）增强了模型容量。这种设计特别适合需要高吞吐量和低延迟的场景，例如实时翻译、代码补全和长文档生成。性能优势:GQA与滑动窗口结合:显著降低KV缓存的内存占用，提升解码效率。

NTK RoPE支持:通过非均匀时间感知的RoPE扩展，确保长上下文场景下的位置编码稳定性。

高吞吐优化:模型在解码侧具有优异的KV开销和并行特性，适合大规模生产环境。

开源战略的转折:OpenAI重回开放初心?OpenAI此次开源GPT-OSS的传闻被视为其战略的重大转变。作为一家近年来逐渐加强模型封闭性的公司，OpenAI此举可能是在回应开源社区的长期期待，同时对抗Meta和Mistral等竞争对手在开源AI领域的强势表现。据泄露信息，GPT-OSS系列包括多个版本（如20亿和120亿参数型号），显示出OpenAI有意打造一个覆盖不同需求的模型家族，为开发者提供更多选择。

然而，泄露的配置文件也引发了争议。部分开发者指出，116亿参数的MoE模型虽然在理论上强大，但实际运行可能需要高性能硬件支持。例如，运行120亿参数模型可能需要高达1.5TB的内存，这对普通开发者而言仍是一大挑战。 OpenAI尚未正式确认这些泄露信息的真实性，但业界普遍认为，开源GPT-OSS的发布将对AI生态产生深远影响。

AIbase观点:

GPT-OSS的潜在影响与挑战GPT-OSS的泄露信息揭示了OpenAI在开源领域的新尝试，其MoE架构、长上下文扩展和高效注意力机制展示了下一代AI模型的技术趋势。通过降低计算门槛和优化内存使用，GPT-OSS有望为中小型开发者和研究机构带来更多创新机会。然而，模型的高硬件需求和未完全公开的训练细节可能限制其普及程度。未来，OpenAI如何平衡开源与商业化战略，以及如何优化模型的实际部署效果，将是业界关注的焦点。

结语

OpenAI GPT-OSS的泄露信息为我们揭开了下一代AI模型的神秘面纱，其强大的MoE架构和长上下文能力预示着AI技术的新篇章。AIbase将继续跟踪这一事件的后续进展，为您带来最新的科技资讯。敬请期待GPT-OSS的正式发布，以及它如何为开源AI生态注入新的活力!

相关推荐

技嘉2025发布会：“从心出发我们的主张”，迈向AI新纪元

技嘉今日举办“从心出发，我们的主张”主题产品发布会，聚焦PC硬件领域，围绕用户需求发布全新主板、整机及软件工具。发布会展示了技嘉在极限性能、美学设计、AI算力及装机体验等方面的技术实力，推出多款支持AMD和Intel平台的主板产品，并重点演示了液氮超频、D5黑科技2.0内存优化及AI算力全家桶等创新技术。通过软硬件协同与用户体验优化，技嘉传递了“始于需求，�

技嘉发布会 PC硬件 AI算力
云天励飞“算力积木”联手OISA，突破万亿级MoE大模型推理集群的Scale up瓶颈

云天励飞近日加入OISA生态，携手产业伙伴共建国产AI芯片互联体系，为中国算力生态注入新动力。OISA是中国移动提出的开放互联标准体系，旨在打造全向、对等、智能的互联新范式，解决智算集群内存互访难题，为大规模并行计算提供技术基石。云天励飞凭借在AI芯片与算力架构的长期积累，将依托“算力积木”架构的模块化优势，在大规模推理集群中实现高效互联，助力突破万级MoE大模型推理瓶颈，推动国产算力生态发展。

云天励飞 OISA生态 AI芯片互联
Miss Pep闪耀TikTok达人赛，以“时尚健康美学”燃爆纽约地标

2025年9月20日，纽约本土健康品牌Miss Pep受邀参加在American Dream Mall举办的“美国梦×TikTok达人明星全美品牌推广赛”。品牌通过产品展示、达人直播互动及宣讲，向日均超18万客流传递“健康与美缺一不可”理念。现场设置互动扫码送定制纹身贴等趣味活动，吸引大量潮流人士。多位顶流明星及达人助阵，结合线上线下联动直播，触达数百万粉丝，强化品牌认知。Miss Pep深耕健康美学30年，产品覆盖养颜、膳食补充等多领域，以“细胞级靶向修护+超天然成分”为核心，正加速全球化布局，覆盖超20国市场，致力成为健康美学的领军者。

品牌推广健康美学 TikTok营销
一加Ace 6参数出炉：骁龙8 Elite+165Hz高刷屏同档唯一

一加Ace+6曝光：搭载1.5K 165Hz超高频屏幕、骁龙8+ Elite处理器，提供四种存储组合及三款配色。内置7800mAh电池，支持120W闪充，重约214g。独家配备全新一代游戏内核，首次实现CPU、GPU与NPU协同调度，通过三大技术优化，实现165帧全栈部署，芯片调度效率提升29.8%，功耗降低11.7%。预计10月与一加15同台发布。

一加Ace 6 165GHz高刷屏
荐AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型；Claude Sonnet4.5发布

本期AI日报聚焦多项技术突破：DeepSeek发布V3.2-exp模型，通过稀疏注意力机制降低API成本50%；Anthropic推出Claude Sonnet 4.5，在编码任务表现卓越；ChatGPT新增即时结账功能，实现对话界面直接购物；OpenAI将推出AI版TikTok，所有内容由Sora2模型生成；百度地图升级小度想想2.0，提供智能出行服务；蚂蚁集团开源万亿参数模型Ring-1T-preview；DeepMind提出“帧链”概念，推动视频模型实现全面�

AI DeepSeek 稀疏注意力
荐AI日报：腾讯重磅发布混元图像3.0；快手发布KAT系列Agentic Coding大模型；苹果悄然研发ChatGPT式应用

快手发布KAT系列代码大模型，腾讯推出“混元图像3.0”实现多模态突破，苹果研发类ChatGPT应用升级Siri，谷歌更新Gemini 2.5 Flash Lite提升效率。苹果还推出Manzano图像模型，YouTube Music测试AI音乐主播功能，VideoFrom3D框架简化3D视频生成，Moondream 3.0在多项基准测试中超越GPT-5等顶尖模型，展现强大性能。

AI日报快手KAT系列大模型
强强联手！深度求索、寒武纪同步发布DeepSeek-V3.2模型架构和基于vLLM的模型适配源代码

2025年9月29日，深度求索公司发布新一代模型架构DeepSeek-V3.2，引发行业关注。寒武纪同步宣布适配该模型并开源vLLM-MLU推理引擎代码。新发布的DeepSeek-V3.2-Exp是实验性版本，在V3.1-Terminus基础上引入稀疏注意力机制，优化长文本训练和推理效率。目前官方应用端已同步更新，API大幅降价。此次模型体积达671GB，下载需8-10小时。业内专家指出，此次快速适配表明双方早有深度技术协�

DeepSeek-V3.2 大模型架构稀疏注意力机制
OPPO Find X9系列定档：10月16日发布

OPPO宣布将于10月16日19:00发布Find X9系列，包括X9和X9 Pro两款手机，同时推出OPPO Pad5平板和OPPO Watch S智能手表。Find X9系列采用直屏设计，配备超大弧度边框，提升握持舒适度；首发全场景1nit明眸护眼屏，支持3840Hz超高频PWM调光；搭载哈苏四摄影像系统，大幅提升进光量；核心采用联发科天玑9500处理器，跑分超400万；全系配备7000mAh超大电池，Pro版达7500mAh。此外，Pad5主打流畅耐用，支持多任务处理；Watch S定位轻薄时尚，厚度不足9mm。

OPPO Find X9
OpenAI发布GPT-5-Codex：可完成7小时单次编程任务

OpenAI宣布推出新一代AI编程模型GPT-5-Codex，其最大亮点是创新的动态时间分配系统。不同于传统AI追求秒级响应”，该模型可根据任务复杂度灵活调整处理时长，从数秒到7小时不等，以更接近人类专家的决策方式优化代码质量。 GPT-5-Codex产品负责人亚历山大恩比里科斯解释称，传统模型在任务初期即固定计算资源，而GPT-5-Codex能实时评估需求：动态决定加速推进、暂停语法核�

GPT-5-Codex 动态时间分配 AI编程模型
OPPO Pad5官宣10月16日发布首发ColorOS 16

OPPO Pad5将于10月16日发布，搭载全新ColorOS 16系统，主打流畅体验。系统升级三大核心技术引擎，实现无缝动画效果，并首次将原生级流畅能力开放给第三方应用。硬件方面配备12.1英寸3K高刷屏和联发科天玑9400处理器，支持67W快充，兼顾高性能与长续航。针对海外用户优化虚拟键盘操作，提升切换效率。产品定位“丝滑板王”，旨在引领安卓平板体验新高度。

OPPO Pad5 ColorOS16

今日大家都在搜的词：

热文

3 天
7天

OpenAI重磅开源！GPT-OSS模型泄露，116亿参数MoE架构震撼曝光，AI新纪元来袭？

技嘉2025发布会：“从心出发我们的主张”，迈向AI新纪元

云天励飞“算力积木”联手OISA，突破万亿级MoE大模型推理集群的Scale up瓶颈

Miss Pep闪耀TikTok达人赛，以“时尚健康美学”燃爆纽约地标

一加Ace 6参数出炉：骁龙8 Elite+165Hz高刷屏同档唯一

荐AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型；Claude Sonnet4.5发布

荐AI日报：腾讯重磅发布混元图像3.0；快手发布KAT系列Agentic Coding大模型；苹果悄然研发ChatGPT式应用

强强联手！深度求索、寒武纪同步发布DeepSeek-V3.2模型架构和基于vLLM的模型适配源代码

OPPO Find X9系列定档：10月16日发布

OpenAI发布GPT-5-Codex：可完成7小时单次编程任务

OPPO Pad5官宣10月16日发布首发ColorOS 16

今日大家都在搜的词：

热文

苹果iOS18.7.1正式版更新发布重要安全修复

苹果将推出iPhone 17e：搭载A19 芯片支持灵动岛

AI日报：蚂蚁开源高性能思考模型Ring-flash-2.0；通义7款模型屠

罗永浩替小米说公道话：海报小字是行业陋习

OPPO A6开售：售价1599元起搭载7000mAh六年长寿电池

京东双11购物节官宣：10月9日晚8点开启

卢伟冰称小米17首销结果很不错并回应小米17为何最初无1TB

小米澎湃OS 3穿戴设备适配升级计划公布：10月开启推送

苹果iOS 26.0.1正式版发布：修复iPhone 17系列Wi-Fi、拍照等Bu

AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型

微信新功能上线：长按图片“搜一搜” 检索购物转表一键达

小米17破今年国产手机首销纪录卢伟冰：需求远超预期

苹果iOS18.7.1正式版更新发布重要安全修复

AI日报：京东物流推出超脑大模型2.0；DeepSeek V3.1终结版发布

苹果将推出iPhone 17e：搭载A19 芯片支持灵动岛

理想i6正式上市：首销直减1万限时售价23.98万元

小米17系列开售5分钟破25年国产手机首销纪录

AI日报：腾讯重磅发布混元图像3.0；快手发布KAT系列Agentic Co

雷军大方推荐友商产品：不买YU7 可以考虑Model Y和理想i6

李想感谢雷军夸理想： “67Y”一起加电

站长商机