首页 > 热点 > 关键词  > 正文

蚂蚁集团发布DevOps领域大模型评测基准DevOps-Eval

2023-11-02 15:09 · 稿源:站长之家

站长之家(ChinaZ.com) 11月2日 消息:蚂蚁集团联合北京大学发布了面向 DevOps 领域的大语言模型评测基准 ——DevOps-Eval。

该评测基准包含了计划、编码、构建、测试、发布、部署、运维和监控等8个类别的选择题,共计4850道题目。

此外,还针对 AIOps 任务做了细分,并添加了日志解析、时序异常检测、时序分类和根因分析等任务。

微信截图_20231102151204.png

目前,DevOps-Eval已发布了第一期的评测榜单,评测了 OpsGpt、Qwen、Baichuan 和 Internlm 等开源大语言模型。DevOps-Eval 的评测方式包括 Zero-shot 和 Few-shot,评测结果显示各模型得分相差不大。

未来,DevOps-Eval 将持续优化,丰富评测数据集,重点关注 AIOps 领域,并增加更多的评测模型。

GitHub 地址:

https://github.com/codefuse-ai/codefuse-devops-eval

HuggingFace 地址:

https://huggingface.co/datasets/codefuse-admin/devopseval-exam

举报

  • 相关推荐
  • 天下苦闭源模型久矣,MiniMax H3要做多模态领域的Deepseek

    2026年8月3日,港股MINIMAX-W(00100.HK)报HK$249.4,涨幅超10%。当日早盘,MiniMax盘前正式宣布发布新一代多模态生成模型H3。市场用真金白银为这次产品发布投了一票。 A 天下苦闭源模型久矣,视频生成赛道此前由Seedance、可灵等头部模型主导,价格、算力、生成时间也一直是行业关注比较高的的话题。 MiniMax发布的H3,正是视频生成市场的一个全新选择。 官方博客中表示,定位H3

  • GEOBase全链路AI洞察指南:让你的品牌被大模型“看见”

    文章指出超60%用户改用AI助手查询产品,品牌若未被AI推荐即彻底隐形。企业面临AI提及不可见、难追踪、无对策三大痛点。GEOBase提供12+平台监控、引用来源分析、业务洞察、竞品对标、提问挖掘、得分检测等功能,形成优化闭环。某美妆品牌借此三个月AI提及率从12%升至48%,转化增2.3倍,说明GEO已成企业必修课。

  • DeepSeek调价正式生效 涨幅高达1100%

    深度求索近日官宣,对DeepSeek API计费体系进行调整,启用峰谷分时定价机制,空闲时段价格仅为高峰时段的一半,新规已于北京时间今日(8月17日)0点正式生效。 按照官方划分,每日9:0012:00、14:0018:00为算力高峰时段,其余时间全部划入空闲低峰区间,计费单位统一为元 / 百万 tokens。 两款主力模型最新峰谷报价如下: DeepSeek V4 Flash 空闲时段:输入缓存命中 0.05 元、输入缓�

  • 稳住基本盘的小米,紧追DeepSeek

    ​小米一季度财报发布后第二天,MiMo先有了新动作。 就在刚刚,小米宣布MiMo-V2.5系列API永久降价,最高降幅99%,Token Plan同价位用量提升至5至8倍。几天前,DeepSeek刚把V4-Pro的2.5折优惠改成永久价。小米这次跟进,意味着MiMo正在以更低门槛加速参与大模型竞争。 “从短期来看,我们面对成本周期、需求周期和竞争周期三重周期叠加的挑战;长期来看,我们正进入AI重构人车家全

  • 智谱GLM-5.3大模型发布:开源中最强、编程/智能体性能接近Fable 5

    智谱创始人几个小时前才说GLM-5.3很快发布,没想到中午就发了,相比当前的GLM-5.2提升50%,是开源最强的,编程与智能体性能接近Fable 5。 与之前传闻的不同,GLM-5.3跟GLM-5.2基座模型还是一样的7400多亿参数量,升级到万亿参数是没有的,有可能是留给GLM-5.5了,但这也没有妨碍GLM-5.3通过后训练来提升性能水平。 根据智谱说法,在多项主流基准测试中GLM-5.3是当前排名最高的开源�

  • QQ Bot 正式接入 DeepSeek Harness

    8月14日,dsh-qqbot插件在GitHub公开,QQ Bot以官方插件形式接入DeepSeek Harness框架。配置后经npx启动扫码即可收发消息,支持私聊群聊、多会话隔离、切换模型保留上下文,群聊可设置仅被@时响应,增强复杂社交场景适应能力。此前QQ已接入OpenClaw等主流AI框架,此次再接入dsh,已对多数主流AI生态开放。

  • 联想Q1 AI营收同比增60%,与戴尔、HPE同列ISG Infra Leader

    联想2026/27财年Q1财报显示,AI相关营收634亿元,同比增60%,约占集团35%;AI PC全球份额第一,x86服务器收入全球第二,AI服务器订单储备超3600亿元。联想入选ISG AI基础设施领导者,为六家中唯一中国企业;世界杯项目覆盖3国16城、48队104场,设备2.5万台,可用率99.99%。

  • DeepSeek-V4系列今日起价格上涨:峰谷定价 高峰期贵一倍

    DeepSeek-V4系列API全新定价自今日0时正式生效,同时V4-Pro结束测试阶段,全面转为正式版商用服务。 本次调价取消统一计费模式,采用行业少见的算力错峰分级计价,高峰时段收费标准较空闲时段直接翻倍。 官方划定高峰时段为每日9:00-12:00、14:00-18:00,其余时间为空闲时段,空闲时段定价为高峰时段的一半,计费单位为元/百万tokens。

  • 企业AI落地:从大模型走向本体驱动的超级组织

    企业部署大模型后仍难落地,根因是缺乏统一业务语义与执行闭环。文章提出,企业AI真正的底层是“本体论+大模型+智能体AI”三层架构:本体定义业务对象与关系,让AI理解企业;大模型负责推理;智能体在治理框架内执行动作。以Orion AIP为例,通过构建统一本体、融合数据与规则,可实现风险分析等场景下的“感知-分析-决策-行动”闭环,让AI从对话工具进化为能工作、可追溯、可信赖的组织核心。

  • 《云上Agent基准度量模型》正式发布,腾讯云推动云上Agent安全、稳定、可信

    《云上Agent基准度量模型》正式发布,腾讯云旗下WorkBuddy等产品首批通过认证。该标准由中国信通院牵头,从功能、安全、可靠等六大维度评估Agent,并引入“双重授权”与分级人机协作机制,为自动化操作设定可控边界,推动Agent从“能完成任务”走向“可稳定运行”。腾讯云基于丰富的产品矩阵与安全实践参与编制,为金融、政务等高安全场景提供了可量化的建设参考。

今日大家都在搜的词: