首页 > 热点 > 关键词  > 正文

出门问问开放大模型“序列猴子”开源数据集

2024-02-26 08:43 · 稿源:站长之家

站长之家(ChinaZ.com) 2月26日 消息:出门问问宣布,将向公众开放其超大规模语言模型“序列猴子”的部分训练数据集,命名为“序列猴子开源数据集1.0”。

序列猴子,作为出门问问的核心技术之一,具备强大的通用表示与推理能力,已在问答系统、自然语言处理、机器翻译、文本摘要等多个领域展现出其卓越的性能,极大地提高了生产效率和数据处理能力。

微信截图_20240226084508.png

为了推动大语言模型技术的持续进步,出门问问决定将其部分训练数据集进行开源。这次开源的“序列猴子开源数据集1.0”包括中文通用文本语料、古诗今译语料以及文本生成语料,这些数据资源都经过精心挑选和整理,以确保其高质量和易用的数据格式。同时,公司采用了宽松的许可协议,为广大的开发者和研究人员提供了便捷的使用条件。

出门问问希望通过这一行动,吸引更多的人才和团队参与到大语言模型的研究与应用中来,共同推动这一前沿技术的持续进步。公司坚信,开源数据集的发布将促进学术交流与合作,加速相关领域的创新步伐。

项目地址:https://github.com/mobvoi/seq-monkey-data

举报

  • 相关推荐
  • 智谱GLM-5.3大模型发布:开源中最强、编程/智能体性能接近Fable 5

    智谱创始人几个小时前才说GLM-5.3很快发布,没想到中午就发了,相比当前的GLM-5.2提升50%,是开源最强的,编程与智能体性能接近Fable 5。 与之前传闻的不同,GLM-5.3跟GLM-5.2基座模型还是一样的7400多亿参数量,升级到万亿参数是没有的,有可能是留给GLM-5.5了,但这也没有妨碍GLM-5.3通过后训练来提升性能水平。 根据智谱说法,在多项主流基准测试中GLM-5.3是当前排名最高的开源�

  • GEOBase全链路AI洞察指南:让你的品牌被大模型“看见”

    文章指出超60%用户改用AI助手查询产品,品牌若未被AI推荐即彻底隐形。企业面临AI提及不可见、难追踪、无对策三大痛点。GEOBase提供12+平台监控、引用来源分析、业务洞察、竞品对标、提问挖掘、得分检测等功能,形成优化闭环。某美妆品牌借此三个月AI提及率从12%升至48%,转化增2.3倍,说明GEO已成企业必修课。

  • 智谱发布 GLM-5.3,自称编程最强的开源模型

    智谱在8月14日正式推出 GLM-5.3。有意思的是,这一版的基座模型跟 GLM-5.2其实是同一个,提升全靠后训练 Scaling 把智能上限往上拉,用了几十倍的长程任务环境、更丰富的环境类型,还有超长的后训练时间。 编程是这次最被拿来当卖点的能力。智谱称 GLM-5.3是编程能力最强的开源模型,内部体感评测比上代提升50%,在 Terminal Bench3.0、Agents' Last Exam(CLI)这些公开基准上拿到开

  • 企业AI落地:从大模型走向本体驱动的超级组织

    企业部署大模型后仍难落地,根因是缺乏统一业务语义与执行闭环。文章提出,企业AI真正的底层是“本体论+大模型+智能体AI”三层架构:本体定义业务对象与关系,让AI理解企业;大模型负责推理;智能体在治理框架内执行动作。以Orion AIP为例,通过构建统一本体、融合数据与规则,可实现风险分析等场景下的“感知-分析-决策-行动”闭环,让AI从对话工具进化为能工作、可追溯、可信赖的组织核心。

  • 渝见开源,数智启新|2026 CCF中国开源大会盛大启幕

    2026 CCF中国开源大会在重庆开幕,以“渝见开源,数智启新”为主题,聚焦AI与软件工程双向赋能。多位院士指出AI提效但无法取代工程化思维;大会发布泛在操作系统社区成果及ODTC开源激励计划,设多场分论坛覆盖芯片、操作系统、具身智能等,共建开源生态推动数字产业升级。

  • 爸爸出门忘关火 女儿淡定“控场” 网友:比爸爸靠谱

    爸爸出门忘关火,厨房险象环生,关键时刻,年幼的女儿用教科书式的操作化解了危机。近日,这段监控视频在网络上刷屏,"爸爸出门忘关火 女儿淡定'控场'"话题登上热搜,无数网友为小女孩的冷静点赞。 视频中,爸爸匆匆出门后,厨房灶台上的火还在烧着。小女孩发现后,没有慌乱,而是不慌不忙地搬来小板凳,够到灶台关闭了火源,随后还淡定地检查了一�

  • 全栈AI巨头盘点:联想、阿里、华为、百度贯通算力‑大模型‑终端‑行业方案‑生态

    中国AI正加速推进算力、大模型与终端协同。联想以万全异构智算平台与问天超节点为训练推理底座,通过词元中枢统一调度模型,天禧AI连通PC、手机与平板,并以城市、制造智能体落地行业。阿里以平头哥芯片和阿里云为核心,千问模型贯通应用与终端。华为依托昇腾与盘古模型,连接鸿蒙终端与行业场景。百度则以昆仑芯和文心大模型,延伸至小度与智能驾驶。四家企业全栈路径各异,但均在真实业务中持续交付。

  • 2026年AI音乐生成大模型怎么选?音潮V4.0、Suno V5.5、Udio能力解析

    2026年AI音乐生成大模型竞争转向指令理解、语种覆盖、合规与接口生态。音潮V4.0重构语义理解,支持10语种,开放纯音乐和API,限时免费、成本低且已备案;Suno V5.5仍是英文技术标杆,但中文与版权存短板;Udio强在音质编辑,Mureka偏接口化生产。选型应结合中文/多语种、纯音乐、合规与成本等场景。

  • 忆联AM6B0:为端侧AI提速,UMA时代的大模型存储“标配”!

    NVIDIA统一内存架构让PC可运行千亿大模型,但对存储性能提出严苛要求。忆联AM6B0 SSD凭借满血性能、高低延迟与可靠设计,成为UMA时代大模型存储“标配”。实测加载千亿大模型仅需14.6秒,顺序读写达7100/6500 MB/s,综合性能领先同级竞品,有效缩短等待、释放生产力,全面补齐算力落地的关键一环。

  • AI日报:Kimi K3登顶全球最大开源模型;小度AI手表Fit开售;我国启动大模型 IPv6 专项行动

    Kimi K3开源2.8万亿参数模型成全球最大;小度AI手表搭载文心大模型,定价亲民;我国启动大模型IPv6行动,推进网络升级;Firefox新标签页推出AI新闻字谜;艺术家起诉AI表情包侵犯版权;比亚迪人形机器人拟8月落地郑州;宇树G1机器人远程完成动物手术实验;Claude共享对话功能曝隐私风险,大量记录被谷歌收录。

今日大家都在搜的词: