6月9日消息,小米联合TileRT推出MiMo-V2.5-Pro-UltraSpeed版本,在大模型领域实现重要突破。基于万亿参数规模的大模型,该版本在单台配备8张标准GPU的通用计算节点上,将文本生成速度提升至每秒1000个token。
在理想条件下,峰值速度甚至可达每秒1200个token。值得一提的是,这一性能提升并未依赖定制专用芯片,大幅降低了高性能AI推理的应用门槛。

该版本同步推出限时API服务。虽然定价为原版MiMo-V2.5-Pro的3倍,但生成速度提升约10倍,性价比优势明显。
由于高速推理资源有限,该服务采取申请制限时开放。试用时间为北京时间6月9日至6月23日23:59。平台将优先审核有实际业务需求的企业用户和专业开发者。普通用户可通过专属网页免费体验对话功能。
每个账号每日排队上限为10次,单次会话最长可持续30分钟。若连续闲置5分钟,系统将自动断开连接,以确保资源公平分配。

此次性能的大幅提升,得益于模型与系统的深度协同设计,核心包含三大技术创新:
第一,FP4量化技术。针对模型MoE架构的特点,仅对占参数绝大多数的专家层进行无损FP4量化,其余模块保留原始精度。这一做法在降低内存占用、缓解带宽压力的同时,保持了模型的综合能力基本不变。
第二,DFlash区块并行推测解码。该技术摒弃了传统串行解码模式,单次可预测整段文本区块。在代码生成、数理推理等场景中,平均每轮可确认6到7个token,大幅提升解码效率。
第三,TileRT推理系统。该系统重构了GPU执行架构,采用持久化内核与异构流水线,消除了算子切换所带来的延迟,使硬件算力得以持续满负荷运转。
极速推理能力也为AI应用场景带来了新的可能。超高速度支持模型并行推演和自主纠错,提升了逻辑推理质量;大幅缓解了代码生成过程中的等待与卡顿,释放了编程智能体的生产力;同时,使万亿参数大模型能够落地于高频量化交易、实时反欺诈、医疗影像分析等毫秒级实时决策场景。
(举报)
