首页 > 传媒 > 关键词  > KwaiKAT最新资讯  > 正文

KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级

2026-07-14 15:47 · 稿源: 站长之家用户

近日,KwaiKAT 团队正式发布旗舰级Agentic Coding模型KAT-Coder-Pro V2.5。据介绍,自KAT-Coder-Pro V2上线以来,KwaiKAT团队持续收到一线开发者的真实反馈:能不能把一个完整的issue直接交给模型,让它自己在仓库里定位、修改、跑通测试?能不能把一整段业务工作流交给它,而不只是帮忙做其中一步?围绕“更长的任务链路、更复杂的业务工作流”这一核心目标,KwaiKAT团队对模型进行了系统性升级,在长程工程能力、通用Agentic 能力和大规模Agentic强化学习体系三大维度实现全面突破。

长程工程能力:从“补代码”到“跑项目”

真实的软件工程从来不是“补一段函数”这么简单——开发者需要模型读懂模糊的自然语言需求,在几十上百个文件的仓库中定位改动位置,遵循项目既有规范给出最小改动,并通过测试验证。为此,KwaiKAT团队建设了 AutoBuilder 自动化环境构建流水线。据官方披露,这套流水线将可运行仓库环境的构建成功率从业界约16.5%大幅提升至57.2%,累计沉淀出覆盖12种编程语言、超过10万个可运行、可验证的真实“训练车间”,让模型能够在真实项目环境中完成迭代训练。

fbddabcca1336f92e47228f3380171e4_20260713999136.png

通用Agentic能力:从“能调工具”到“驾驭真实业务”

真实业务工作流平均需要10轮以上工具交互,还伴随大量隐含的格式约束与指令遵循要求。KwaiKAT 团队打造了 KwaiClawEnv 环境体系,通过动态扩展工具池、以真实业务任务为种子派生海量任务变种,并结合双重质量过滤,产出覆盖数据分析、跨系统整合、批量文档处理、报告生成等真实业务场景的高质量训练数据。这些高质量训练数据使模型在真实、复杂的多轮工具调用场景中不断打磨任务规划、状态追踪与错误恢复能力,从而将从具体业务场景中习得的经验泛化为可迁移的通用 Agentic 能力,使模型在面对未见过的新任务、新工具组合时依然能够保持稳定的长程推理与执行表现。

56d1f24340df9d56aa1d9e9016205697_20260713922921.png

大规模Agentic强化学习:让模型自己学会“怎么干活”

监督微调擅长让模型“照着范文抄”,但面对陌生项目结构和意外报错时鲁棒性会显著下降。据官方披露,KAT-Coder-Pro V2.5在mini-swe-agent、Claude Code、Codex、OpenClaw等多种主流 Agent 框架下反复实战训练,学会的是“如何解决任务”本身,而非死记某种交互格式;同时,团队引入了精细化的信用分配机制和分层奖励体系,让模型不仅学会“怎么做对”,也学会“错在哪里、如何拉回来”。

7ca57f882c6eb4203c98b7978a3b98c5_20260713141789.png

多专家融合,一个模型承载全部能力

据介绍,KwaiKAT团队在长程仓库工程、通用Agentic、终端使用、前端美学生成、通用知识五个方向分别训练了专家模型,并通过 MOPD(多教师在线策略蒸馏)技术将五个专家的能力融合到一个统一模型中,有效避免了“提升一个能力就牺牲另一个”的“跷跷板效应”。一个KAT-Coder-Pro V2.5模型,即可支撑写代码、跑工作流、做页面等多类任务,无需在部署时切换。

4171509116e2213fff20de61d092c058_20260713447733.jpeg

评测成绩亮眼,真实场景稳定交付

官方公布的评测结果显示,KAT-Coder-Pro V2.5在多项Coding与Agentic评测中表现稳定:

长程工程能力方面,KAT-Coder-Pro V2.5在SWE-Bench Pro上取得65.2分,在快手内部真实工程任务评测集 KAT Code Bench上取得53.1分。据官方表示,这意味着开发者可以把一个完整的issue直接交给模型,而不必先拆成一个个小改动。

通用Agentic能力方面,KAT-Coder-Pro V2.5在多轮Agentic任务评测 PinchBench上取得94.9分,在快手内部 Agentic 评测集KAT Claw Bench上取得85.5分,展现了从工具选择、上下文管理到最终交付物生成的全流程稳定表现。

目前,KAT-Coder-Pro V2.5已在StreamLake平台全量上线,开发者可通过 StreamLake.com直接调用模型 API,并将其集成到自身工作流中。

推广

特别声明:以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。站长之家将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时,可及时向站长之家提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明(点击查看反馈联系地址)。本网站在收到上述法律文件后,将会依法依规核实信息,沟通删除相关内容或断开相关链接。

  • 相关推荐
  • 大厂暗战百亿市场:AI Coding赛道的卡位与变数

    那份被流出又被消失的梁文锋与投资人闭门交流实录中,提到一点,DeepSeek现阶段最重要的是Coding Agent。 就在一个月前,火山引擎大会,当外界沉浸在对Seedance达到全球SOTA水平的赞誉中时,字节表现得有些心不在焉。火山引擎总裁谭待说,内部始终将Coding视为核心方向。 更耐人寻味的是,几天前IDC突然公布了一项关于AI 编程的市场份额数据,被媒体广泛报道的是,上线不足�

  • 慧荣科技亮相 FMS 2026,展示面向 Agentic AI 应用的新一代存储方案

    慧荣科技在FMS 2026大会上,面向AI工厂、边缘AI和物理AI三大领域,全面展示了其五大产品线的存储创新。针对Agentic AI等对实时、快速数据访问的需求,慧荣推出SM8366 MonTitan平台,专为KV Cache卸载设计,容量可达256TB;并预展了支持512TB+的PCIe Gen6主控SM8466。同时,还展出了面向AI PC的边缘SSD主控、移动设备嵌入式UFS/eMMC芯片,以及专为汽车和物理AI打造的高可靠Ferri存储方案,为下一代AI基础设施加速部署提供支撑。

  • REDMI K100 Pro系列100位工程师代表亮相:设计、工程K90原班人马操刀

    REDMI K100 Pro系列将于8月11日正式发布,届时将带来K100 Pro和K100 Pro Max两款机型。 今日,REDMI官方晒出K100 Pro系列100位工程师代表集体亮相照片,覆盖手机产品部、相机部、工业设计部、显示触控部、音频部、项目管理部、天线部、测试部等多个核心部门。 据REDMI产品经理笋寸介绍,K100 Pro系列的工程团队、设计团队以及项目团队,均为K90和K90 Pro Max的原班人马。

  • 荣耀Robot Phone让罗永浩感到吃惊 方飞:背后蕴藏着大量工程挑战

    罗永浩提前上手了荣耀Robot Phone,并在体验后表示,这几年国产手机行业涌现出不少创新,许多设计让他感到耳目一新。 以这款尚未发布的荣耀Robot Phone为例,乍看之下可能有人会觉得它只是将手机与云台简单结合,但只有真正上手体验过,才会发现它远没有看起来那么简单。他相信,看到这款产品的人都会感到惊讶。 荣耀终端股份有限公司产品线总裁方飞对此回应称,感谢

  • AI视频Agent助手哪个好用?主流Seedance工具产品能力对比

    AI视频工具模型能力趋同后,Agent成为竞争核心。Agent非简单聊天,而是能理解意图、拆解需求、自主规划执行并可在关键节点暂停的工作流。文章解析四款接入Seedance的产品:Updream采用工作流型Agent,专业可控但有学习成本;即梦AI是指令型,门槛低却缺流程引导;剪映专业版主打编辑辅助,前期创作弱;豆包为对话型,交互自然但不够专业。Agent直接决定创作门槛与效率,未来谁能更懂创作者、降低门槛,谁就能赢得市场。

  • Testin XAgent实战解析:大模型+视觉自愈如何重构自动化测试工程

    WAIC2026规模破纪录,核心焦点已从“拼参数”转向“拼落地”。AI测试正经历范式跃迁,从人工编写脚本迈向智能体自主生成逻辑。尽管企业试点热度高、AI生成用例比例飙升,但规模化落地仍存鸿沟,信通院联合各方发布了技术规范。以Testin云测为代表的“AI+Agent”派,通过自然语言驱动与多模态视觉自愈,实现了测试设计和脚本稳定性的关键突破,在金融、汽车等领域大幅提效。趋势表明,AI测试正从降本增效的工具,演进为贯穿AI生命周期的质量中枢,驱动生产力重构。

  • 拍视频好的旗舰手机 荣耀Magic9工作流更顺

    荣耀Magic9系列以拍视频全流程优化为核心,主打旗舰级视频创作体验。据爆料,其搭载2亿像素双主摄与LOFIC技术保留高光细节;联合ARRI提供原生Log曲线和专业LUT,打通电影级调色链路;支持锁定对焦、白平衡等专业功能,Pro+Max更可实现4K120帧及杜比视界录制。同时,1:1前置镜头、9000mAh级大电池与3D超声波指纹等设计,兼顾了日常使用的便捷与续航。

  • 10万小时训练!小米具身基座模型Xiaomi-Robotics-1正式开源

    今日,小米技术宣布,小米具身基座模型 Xiaomi-Robotics-1正式开源。 据介绍,Xiaomi-Robotics-1基于超过10万小时UMI数据进行预训练,并使用超过1万小时跨本体数据进行后训练。

  • 《云上Agent基准度量模型》正式发布,腾讯云推动云上Agent安全、稳定、可信

    《云上Agent基准度量模型》正式发布,腾讯云旗下WorkBuddy等产品首批通过认证。该标准由中国信通院牵头,从功能、安全、可靠等六大维度评估Agent,并引入“双重授权”与分级人机协作机制,为自动化操作设定可控边界,推动Agent从“能完成任务”走向“可稳定运行”。腾讯云基于丰富的产品矩阵与安全实践参与编制,为金融、政务等高安全场景提供了可量化的建设参考。

  • AI漫剧批量生产工作流搭建工具,批量生产的四种模式分析

    AI漫剧正从个人小作坊转向工业化生产,核心不再是单点生成,而是标准化、可复用、可协作、可追溯的工作流。不同AI视频工具因商业模式不同,工作流能力各异:Updream通过技能社区沉淀灵活流程,即梦AI以低门槛消耗为核心,剪映偏重后期编辑生态,小云雀提供企业级全流程平台。未来竞争本质是工作流效率与壁垒的较量,而非生成能力本身。

今日大家都在搜的词: