5月20日,在2026阿里云峰会上,阿里巴巴正式推出了全新一代千问旗舰模型——Qwen3.7-Max。
在第三方机构Arena全球大模型盲测总榜单中,Qwen3.7-Max的表现超过了Kimi-K2.6、DeepSeek-v4-pro、GLM-5.1等竞品,与GPT、Claude、Gemini等国际顶尖模型的差距进一步缩小,位列国产模型之首。

这是千问旗舰模型近三个月内第三次重大更新,从3.5版本到3.6版本再到如今的3.7版本,阿里在大模型领域的研发节奏明显加快。
Qwen3.7-Max专为智能体(Agent)场景进行了全新设计,在多个关键维度上实现了突破。
在编程能力方面,该模型在SWE-Pro、SWE-Multilingual等编程智能体评测中均取得领先成绩。在Terminal Bench 2.0-Terminus测试中,其得分达到69.7,超过了DeepSeek-v4-pro-Max和Claude-Opus4.6等型号。
在通用智能体方面,Qwen3.7-Max在MCP-Atlas、MCP-Mark、Skillbench等现实场景评测中表现突出,超越了GLM5.1、Kimi-K2.6等模型,创下国产模型的新纪录。
在推理能力方面,该模型在GPQA Diamond、HLE、HMMT 2026 Feb等核心推理评测中,超越了Claude-Opus4.6以及所有国产模型。
在通用能力上,Qwen3.7-Max在指令遵循评测IFBench中拿到79.1分,刷新了该项测试的纪录;同时在多语言评测WMT24、MAXIFE中也保持领先。
在一次实战任务中,模型在从未接触过的全新硬件平台——平头哥真武M890芯片上,面对没有性能分析数据、硬件文档或新架构示例内核的情况下,从空白工作空间出发,自主完成了推理内核的优化任务。
整个优化过程持续了35小时,模型独立进行了432次内核评估和1158次工具调用,全程自主完成了编写、编译、性能分析与迭代改进。最终优化后的推理内核,相比SGLang Triton官方参考实现,取得了10倍的速度提升。
测试轨迹显示,在独立运行超过30小时后,模型依然能够发现有效的优化点,甚至主动发起了一次关键的架构重新设计。
在智能体能力方面,Qwen3.7-Max展现出了跨框架的泛化能力,在Claude Code、OpenClaw、Qwen Code等不同框架下均能稳定发挥。通过MCP集成和多智能体协作,该模型在办公自动化基准测试SpreadSheetBench-v1中获得了87分,处于行业领先水平。
阿里云方面透露,Qwen3.7-Max的API即将在百炼平台上线。后续还将推出Qwen3.7-Plus等版本,覆盖从编程智能体到视觉智能体的全场景需求。
(举报)
