首页 > 业界 > 关键词  > 编程榜单最新资讯  > 正文

1541分!阿里 Qwen3.7-Max编程力登顶国产 全球仅次 Claude

2026-05-26 13:54 · 稿源: 快科技

快科技5月26日报道 北京时间5月26日凌晨,国际知名第三方编程评测榜单Code Arena公布最新结果。阿里巴巴旗下旗舰模型Qwen3.7-Max以1541分的成绩,超越GPT-5.5、Gemini-3.5-Flash、GLM-5.1、Kimi-K2.6等众多模型,仅次于Claude系列,在大型模型厂商中位列全球第二。这标志着在代码理解与生成领域,千问3.7已成功跻身全球编程模型的第一梯队。

1541分!阿里 Qwen3.7-Max编程力登顶国产第一 全球仅次 Claude

据了解,编程能力是当前衡量模型智能水平的核心指标。Code Arena由知名第三方大模型盲测平台LMArena推出,是业内最具影响力的评测榜单之一。

与传统的代码基准测试不同,Code Arena不考核孤立的代码片段生成或传统算法题目,而是由开发者出题,要求模型从零开始生成完整、可交互的Web应用程序,再由用户对匿名模型的生成效果进行两两对比投票,最终形成综合榜单。因此,Code Arena被视为目前全球最具公信力的AI编程能力评测之一。

经过全球开发者基于真实使用体验的盲测投票,千问3.7模型的编程能力排名前四,打破了此前由Claude-Opus-4.7和4.6长期占据的前四格局。Qwen3.7-Max也成为目前榜单中唯一突破1540分大关的国产大模型。

据了解,面向智能体场景打造的Qwen3.7-Max,在编程、智能体能力以及长程任务等核心功能上实现了大幅突破。该模型不仅能在数小时内独立完成专业团队耗时两周的复杂项目端到端交付,显著提升办公自动化水平与企业级生产力,甚至能够持续运行35小时,累计完成超过1000次工具调用的复杂长程任务,实现芯片内核的自我编程优化。

举报

  • 相关推荐

今日大家都在搜的词: