GPT-4 Turbo 击败 Claude 3，重新夺回 “AI模型” 称号

2024-04-16 10:17 · 稿源：站长之家

划重点:
⭐️ OpenAI 的最新更新使 GPT-4Turbo 在 Chatbot Arena 中超越了82个 LLM 模型
⭐️ 用户可以在 Chatbot Arena 中比较不同模型的回答，GPT-4Turbo 表现出色
⭐️ 想要比较 GPT-4Turbo 与其他 LLMs 的表现?可以访问 Chatbot Arena 网站进行对比

站长之家（ChinaZ.com）4月16日消息:OpenAI 最新推出的更新版 GPT-4Turbo 上周已经面向开发人员和付费 ChatGPT 订阅者提供。当推出这一模型时，OpenAI 表示新的 GPT-4Turbo 从前作中进行了多项改进，而用户们也发现这一点确实如此。

从上周四开始，更新版的 GPT-4Turbo，即 gpt-4-turbo-2024-04-09，重新夺回了 Large Model Systems Organization（LMSYS）Chatbot Arena 的榜首位置，这是一个众包的开放平台，用户可以在其中评估大型语言模型(LLM)。

在 Chatbot Arena 中，用户可以与两个 LLMs 并排聊天，比较它们的回答，而不知道每个模型的身份。这些结果被用于排名 Chatbot Arena 中的82个 LLMs，包括市场上所有最受欢迎的 LLMs，如 Gemini Pro、Claude3系列 LLMs 和 Mistral-Large-2402。

截至4月13日的最新 Chatbot Arena 更新，更新版的 GPT-4Turbo 在整体、编码和英语类别中处于领先地位。这意味着不到一个月之后，Anthropic 的 Claude3Opus 在整体类别中被挤到第二名，其后是 GPT-4Turbo 的旧版本 GPT-4-1106-preview。

这些结果可能归因于 gpt-4-turbo-2024-04-09在编码、数学、逻辑推理和写作能力方面的改进，表现更高于一系列用于测试 AI 模型熟练程度的基准测试。想要自行比较 gpt-4-turbo-2024-04-09与其他 LLMs 的表现?可以访问 Chatbot Arena 网站，点击 “Arena（side-by-side）” 选项，选择要比较的模型。

值得注意的是，由于您知道侧边模式中模型的身份，您将无法进行投票。如果您想要进行投票，并让其计入排行榜，您可以使用 “Arena（battle）” 选项将随机模型进行比较。如果您想要跳过测试，直接使用 gpt-4-turbo-2024-04-09在 ChatGPT 中，需要成为 ChatGPT Plus 订阅者，费用为每月20美元。

（举报）

相关推荐

关键词：

荐AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型；Claude Sonnet4.5发布

本期AI日报聚焦多项技术突破：DeepSeek发布V3.2-exp模型，通过稀疏注意力机制降低API成本50%；Anthropic推出Claude Sonnet 4.5，在编码任务表现卓越；ChatGPT新增即时结账功能，实现对话界面直接购物；OpenAI将推出AI版TikTok，所有内容由Sora2模型生成；百度地图升级小度想想2.0，提供智能出行服务；蚂蚁集团开源万亿参数模型Ring-1T-preview；DeepMind提出“帧链”概念，推动视频模型实现全面�

AI DeepSeek 稀疏注意力
荐腾讯悄悄上线了“Claude Code”，居然还支持微信登录。

昨晚，腾讯发了他们的CodeBuddy Code，正式也加入命令行编程Agent战场。说实话，CodeBuddy这产品，真的有点玄学在身上的。我之前就当个新闻写，写了两次，一次插件，一次IDE，两次都快10w+，尼玛。。。

文章搜索核心标签编程Agent
美团发布高效推理模型LongCat-Flash-Thinking：部分性能接近GPT5

9月23日，美团LongCat团队发布全新高效推理模型LongCat-Flash-Thinking。该模型在保持极致速度的同时，性能更强大、更专业，在逻辑、数学、代码、智能体等多个领域的推理任务中达到全球开源模型最先进水平（SOTA），部分任务性能接近闭源模型GPT5-Thinking。它增强了智能体自主调用工具能力，扩展了形式化定理证明能力，成为国内首个结合深度思考、工具调用与非形式化、形式化推理的大语言模型。在数学、代码、智能体等高复杂度任务上表现尤为突出，多项基准测试成绩领先开源及闭源顶尖模型，已在HuggingFace、Github全面开源。

高效推理模型 LongCat-Flash-Thinking 开源模型
性能超越GPT-4o及Qwen2.5-VL，百度超轻量小模型PP-OCRv5 Blog持续登顶Hugging Face热度第一

百度发布超轻量级文字识别模型PP-OCRv5，仅0.07B参数却实现媲美700亿参数大模型的OCR精度。在多项测试中超越GPT-4o等通用视觉大模型，尤其在文本定位和边界框精度上表现优异。该模型支持5种文字类型识别，适用于教育、医疗、法律等多行业数字化需求，累计下载量超900万，是GitHub上唯一Star数超5万的中国OCR项目。

PP-OCRv5 轻量级OCR 文字识别模型
荐AI日报：腾讯重磅发布混元图像3.0；快手发布KAT系列Agentic Coding大模型；苹果悄然研发ChatGPT式应用

快手发布KAT系列代码大模型，腾讯推出“混元图像3.0”实现多模态突破，苹果研发类ChatGPT应用升级Siri，谷歌更新Gemini 2.5 Flash Lite提升效率。苹果还推出Manzano图像模型，YouTube Music测试AI音乐主播功能，VideoFrom3D框架简化3D视频生成，Moondream 3.0在多项基准测试中超越GPT-5等顶尖模型，展现强大性能。

AI日报快手KAT系列大模型
构建全场景数字生态：三星商显产品亮相AUTODESK论坛与全球数贸会

三星近日在上海欧特克论坛及全球数字贸易博览会两大行业展会展示多款商用显示产品。通过汽车设计、智慧会议等高端应用场景的创新矩阵，全面展现其在商用显示领域的前瞻布局与技术底蕴。明星产品The Wall IWB与IAB系列以超高清晰度、精准色彩及高效协同能力吸引专业观众，推动汽车设计乃至高端制造业研发模式变革。同时亮相的智能数字标牌、电子白板及彩色电子纸等产品，覆盖多场景技术路线，彰显三星作为行业引领者通过显示技术赋能各行业数字化转型升级的战略布局。

三星商显汽车设计智慧会议
OpenAI发布GPT-5-Codex：可完成7小时单次编程任务

OpenAI宣布推出新一代AI编程模型GPT-5-Codex，其最大亮点是创新的动态时间分配系统。不同于传统AI追求秒级响应”，该模型可根据任务复杂度灵活调整处理时长，从数秒到7小时不等，以更接近人类专家的决策方式优化代码质量。 GPT-5-Codex产品负责人亚历山大恩比里科斯解释称，传统模型在任务初期即固定计算资源，而GPT-5-Codex能实时评估需求：动态决定加速推进、暂停语法核�

GPT-5-Codex 动态时间分配 AI编程模型
DeepSeek-V3.2-Exp正式发布

DeepSeek于9月30日正式发布实验性模型DeepSeek-V3.2-Exp，该模型基于V3.1-Terminus升级，引入创新的稀疏注意力机制DSA，首次实现细粒度稀疏注意力，在保持模型输出效果的同时显著提升长文本训练和推理效率。测试显示其表现与V3.1-Terminus基本持平。应用层面，官方App、网页端及小程序均已同步更新。同时宣布API价格大幅调整：输入缓存0.2元、输入未缓存2元、输出3元，开发者调用成本降低50%以上。模型已在HuggingFace和魔搭开源平台上线。

DeepSeek-V3.2-Exp 稀疏注意力机制 DSA
音质升级焕新登场三星Galaxy Buds3 FE正式上市

三星Galaxy智能新品于9月19日正式开售，包括Tab S11 Ultra、Tab S11、Tab S10 Lite平板及Buds3 FE耳机。新品搭载AI功能，支持多设备互联，提供大屏交互、专业音频体验。Tab S11 Ultra起售价8999元，Tab S11起售5999元，Tab S10 Lite起售2599元，Buds3 FE售价949元。即日起消费者可通过线上线下渠道购买，享受购机好礼。

三星Galaxy Tab S11Ultra
ChatExcel重磅发布：基于AMD锐龙AI MAX+ 395处理器的数据分析Mini AI 工作站

ChatExcel发布搭载AMD锐龙AI MAX+395处理器的Mini AI工作站，重构数据全链路，打造“找数-做数-分析数-看数-用数”的商业闭环平台。依托处理器96GB超大显存和统一内存架构，实现本地流畅运行GPT-oss-120B等大型模型，保障数据安全的同时显著提升分析效率。该方案以财务场景为例，支持多任务并行处理，将原本需1天完成的月度报表压缩至2小时，解决“数据不外发”与“高效处理”的核心矛盾。

文章搜索核心标签 AMD锐龙AI

今日大家都在搜的词：

热文

3 天
7天

GPT-4 Turbo 击败 Claude 3，重新夺回 “AI模型” 称号

荐AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型；Claude Sonnet4.5发布

荐腾讯悄悄上线了“Claude Code”，居然还支持微信登录。

美团发布高效推理模型LongCat-Flash-Thinking：部分性能接近GPT5

性能超越GPT-4o及Qwen2.5-VL，百度超轻量小模型PP-OCRv5 Blog持续登顶Hugging Face热度第一

荐AI日报：腾讯重磅发布混元图像3.0；快手发布KAT系列Agentic Coding大模型；苹果悄然研发ChatGPT式应用

构建全场景数字生态：三星商显产品亮相AUTODESK论坛与全球数贸会

OpenAI发布GPT-5-Codex：可完成7小时单次编程任务

DeepSeek-V3.2-Exp正式发布

音质升级焕新登场三星Galaxy Buds3 FE正式上市

ChatExcel重磅发布：基于AMD锐龙AI MAX+ 395处理器的数据分析Mini AI 工作站

今日大家都在搜的词：

热文

苹果iOS18.7.1正式版更新发布重要安全修复

OPPO A6开售：售价1599元起搭载7000mAh六年长寿电池

AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型

罗永浩替小米说公道话：海报小字是行业陋习

腾讯QQ闪传功能上线支持单文件最大10GB传输

苹果iOS 26.0.1正式版发布：修复iPhone 17系列Wi-Fi、拍照等Bu

OPPO Find X9系列定档：10月16日发布

鸿蒙智行享界S9T上市13天大定破 15000 台

王腾小红书账号注销快手账号已被封禁抖音账号已私密视频号已

鸿蒙智行9月交付新车52916台：全系累计交付突破95万台

小米17破今年国产手机首销纪录卢伟冰：需求远超预期

苹果iOS18.7.1正式版更新发布重要安全修复

苹果将推出iPhone 17e：搭载A19 芯片支持灵动岛

OPPO A6开售：售价1599元起搭载7000mAh六年长寿电池

小米17系列开售5分钟破25年国产手机首销纪录

AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型

AI日报：蚂蚁开源高性能思考模型Ring-flash-2.0；通义7款模型屠

AI日报：腾讯重磅发布混元图像3.0；快手发布KAT系列Agentic Co

iPhone调休闹钟上热搜苹果客服回应：需手动设置

小米17/Pro/Pro Max今日首销：4499元起

站长商机