首页 > 业界 > 关键词  > 小米最新资讯  > 正文

小米发布并开源Xiaomi-Robotics-U0:380亿参数具身生成大模型!生成效率提升83倍

2026-07-15 15:25 · 稿源: 快科技

快科技7月15日消息,小米今天正式发布并向全量开源具身生成系统Xiaomi-Robotics-U0,参数规模达380亿,成为业内首个统一覆盖四类核心具身生成任务的一体化平台。

该系统打破了以往机器人场景、轨迹、视频生成方案彼此割裂的现状,可自主生成和扩充机器人训练所需的图像与视频数据,有效解决在极端、危险、长尾场景下真机采集成本高、难度大的痛点。

采用自研FlashAR处理加速方案后,其生成效率较传统自回归架构提升近83倍,大幅降低大规模具身数据生产的落地门槛。

系统统一承载具身场景生成、具身轨迹迁移、机器人交互视频生成、通用文生图与图像编辑四大能力。凭借独创的五维解耦结构化控制范式,工作台布局、操作物体、杂物、光照和背景五个维度均可通过自然语言独立调节,全程保持多视角几何一致性,修改画面元素时不会出现机械臂位姿错位或场景空间畸变。

该平台兼容方舟无限、智元多款、松灵PiPER等多种机器人本体,支持生成室内、户外、海底、赛博场景等各类开放世界仿真环境。

多项权威评测与真机实测验证了该系统的领先性能。在全球126款方案同台比拼的WorldArena具身视频评测基准中,Xiaomi-Robotics-U0夺得总分第一,指令遵循、交互流畅度、多视角一致性等指标全面领跑。

在具身迁移对比测试中,该系统在深度一致性、结构保真等关键指标上全面超越闭源方案GPT-Image-2.0,后者普遍存在跨视图物体错位缺陷,无法用于机器人训练数据扩充。

真机实操场景下,使用该系统扩增数据训练的机器人,在陌生光照、全新背景等分布外复杂工况中,任务完成进度平均提升超26%,面对反光、彩色强光等视觉干扰也可自主校正,大幅增强了环境泛化能力。

小米发布并开源Xiaomi-Robotics-U0:380亿参数具身生成大模型!生成效率提升83倍真机任务成功率对比

在推理层面,FlashAR加速方案搭配vLLM分页KV缓存批量调度技术,优化了图像编辑、具身迁移的全流程解码速度。1024*1024分辨率图像生成耗时从四百多秒压缩至5.44秒,在保障画面与物理交互质量的前提下,适应工业化批量生成需求。

目前,该系统全部代码、权重已在官网、GitHub、Hugging Face和魔搭社区完整开源,面向全球具身智能开发者开放使用。

小米发布并开源Xiaomi-Robotics-U0:380亿参数具身生成大模型!生成效率提升83倍

举报

  • 相关推荐
  • 全球参数最大开源模型 马斯克也点赞!月之暗面Kimi K3开源 2.8万亿参数

    日前,月之暗面正式发布Kimi K3模型权重及技术报告,并同步开源支撑该模型训练的三项关键基础设施技术:MoonEP、FlashKDA和AgentEnv。 据介绍,三项技术在Kimi K3的训练过程中发挥了重要作用,为大规模模型训练的效率、稳定性以及智能体任务执行提供基础支撑。 据了解,Kimi K3是月之暗面目前能力最强的模型,该模型采用混合专家(MoE)架构,总参数规模达到2.8万亿,具备原生

  • MiniMax H3视频模型正式开源:全模态理解输入,最高生成2K 视频

    MiniMax 今日正式开源新一代通用视频模型 MiniMax H3,这款模型被定位为通用型全模态生成系统,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并生成最高2K 分辨率、最长15秒、带原生立体声音频的视频内容。 得益于以任务泛化为导向的系统设计,H3在预训练阶段便具备了广泛的多模态上下文理解与生成能力,官方称其能够出色地遵循复杂的多模态指令。输出规�

  • 10万小时训练!小米具身基座模型Xiaomi-Robotics-1正式开源

    今日,小米技术宣布,小米具身基座模型 Xiaomi-Robotics-1正式开源。 据介绍,Xiaomi-Robotics-1基于超过10万小时UMI数据进行预训练,并使用超过1万小时跨本体数据进行后训练。

  • 澎湃OS 4升级超级小爱2.0!基于小米自研模型打造:支持上岛 跨应用执行任务

    今日,小米新一代操作系统小米澎湃OS 4正式亮相,官方同步公布了系统在全新设计、基础体验以及AI等方面的多项升级。 其中,AI成为此次澎湃OS 4升级的重点,基于Xiaomi MiMo自研模型以及操作系统层面的AI化改造,超级小爱全面升级至2.0。 新交互:上岛 灵感球 在交互方式上,超级小爱2.0采用全新悬浮态界面,并支持在小米超级岛上显示运行状态。 以往用户调用超级小爱后�

  • 京东开源JoyAI-Video-Edit模型!实现视频边播边改:综合性能全球领先

    京东正式开源自研实时流式视频编辑模型JoyAI-Video-Edit,打破传统视频先成片再剪辑的固有模式,实现播放画面同步实时修改,在流式实时视频编辑方向的各项指标全面领先,达到世界一流水平。 依托JoyAI基础大模型底座,设备在720P分辨率下可稳定实现30帧实时运算,画面处理无明显延迟卡顿,适配常规视频播放同步修改需求。模型摒弃行业只能剪辑短视频片段的短板,支持超

  • AI日报:Kimi K3登顶全球最大开源模型;小度AI手表Fit开售;我国启动大模型 IPv6 专项行动

    Kimi K3开源2.8万亿参数模型成全球最大;小度AI手表搭载文心大模型,定价亲民;我国启动大模型IPv6行动,推进网络升级;Firefox新标签页推出AI新闻字谜;艺术家起诉AI表情包侵犯版权;比亚迪人形机器人拟8月落地郑州;宇树G1机器人远程完成动物手术实验;Claude共享对话功能曝隐私风险,大量记录被谷歌收录。

  • 考拉悠然携Geek Mind亮相APEC数字周:以世界模型推动具身智能走向真实世界

    2026年7月,APEC数字周在成都举行,聚焦数字技术与人工智能赋能发展。AI企业考拉悠然携“世界模型+具身智能大脑”方案亮相,展示了从环境理解到自主决策执行的完整闭环。其自研世界模型赋予智能体持续认知与推演能力,而Geek+Mind产品则作为通用“大脑”,让机器人等硬件具备跨本体迁移与自主工作的能力,标志着AI正从数字认知加速迈向物理世界的感知与行动。

  • 全球最大2.8万亿参数大模型 Kimi K3今晚正式开源:性能坐稳前三

    国产大模型公司月之暗面本月16日发布新一代旗舰大模型Kimi K3,官方表示会在7月27日正式开源,今晚就要登台了。 Kimi在Hugging Face官方账号创建了Kimi K3模型页面,并开启权重发布倒计时,页面显示该模型预计将在北京时间7月27月23时上线,也就是今晚11点。 这个时间点也比较适合美国当地时间,显然是想给刚上班的美国人一点震撼。

  • 予非知识图谱大模型完成生成式人工智能服务备案!潍坊市首个

    “予非知识图谱大模型”获国家生成式AI服务备案认证,系潍坊首例。模型聚焦非结构化数据治理,具备知识建模、实体对齐、动态图谱等全链能力,内置知识分级与访问控制,适配政务、金融等高合规场景。作为“予非·睿知”平台底座,通过“模型+平台”模式破解知识分散、检索难等痛点,赋能政企业务协同与决策。此举为区域生成式AI合规应用与数字经济发展树立新标杆。

  • AI日报:京东开源视频实时编辑模型;Qwen-Image-3.0上线;腾讯混元发布Hy ASR 3.0 preview

    本期AI日报聚焦八大突破:京东开源实时视频编辑模型;阿里千问图像生成开放API;腾讯混元语音识别读懂语境;字节全双工SeedRealtime上车豆包;马斯克Grok 4.6将灌入SpaceX数据;影石硬件联手千问推出语音助手;Mistral开源3B多模态审核模型Shieldstral;宇树科技机器人冲刺科创板IPO。

今日大家都在搜的词: