11.11云上盛惠!海量产品 · 轻松上云!云服务器首年1.8折起,买1年送3个月!超值优惠,性能稳定,让您的云端之旅更加畅享。快来腾讯云选购吧!
腾讯云
12-20
Kimi-K3在8×B300单机上通过GPUStack接入vLLM与SGLang,对比推理性能。64K输入下vLLM端到端延迟更低;200K输入时SGLang反超,得益于DCP分片降低长上下文Decode的KV读取瓶颈。性能交叉源于DCP配置差异,两方Prefill接近,差异在Decode扩展性。投机解码因随机数据接受率极低而几无收益。测试非严格对等,结果反映瓶颈与选型方向,非最终性能排名。
爱芯元智在2026世界人工智能大会上首度揭秘“元啬”系列大算力AI推理新品。该系列面向高并发、高负载场景,提供超1000TOPS算力与本地化推理支持,旨在降低云端依赖与推理成本。从芯片到推理卡及服务器,公司构建了覆盖多算力等级的分层AI计算产品矩阵,并展示了其在工业、教育、办公、零售、家居及机器人等领域的规模化应用方案。这表明AI竞争已从模型能力转向推理效率、部署成本与规模化交付能力。
近期AI领域动态密集:美团开源万亿参数大模型LongCat-2.0,原生支持百万级上下文;小红书开源RedKnot推理引擎提升长文本效率;豆包App内置地图导航,AI深入出行服务;OpenClaw发布开源iOS应用,优化移动端AI代理体验;谷歌Gemini免费开放个性化生图,并上线AI概览实时新闻轮播;智元发布数采2.0技术体系,为机器人注入核心驱动力;华为开源920亿参数盘古模型,加速Agent时代商业创新与开发者生态。
浙江流流电子科技将昔日在3D集成专用计算芯片积累的工程经验,延伸至AI推理芯片领域。其核心优势在于曾量产40纳米工艺并结合Hybrid Bonding技术的以太坊专用计算芯片,团队掌握了从架构设计到量产可靠性的完整工程能力。公司认为,从专用计算到AI推理变化的是场景,不变的是在有限功耗和面积下追求高效计算的底层逻辑。面对AI推理需求,市场正从单纯关注峰值算力转向有效算力、能效与部署成本,而3D集成与Hybrid Bonding技术有望缓解数据搬运瓶颈,为专用AI芯片在能效比和成本上带来差异化优势。
日前,小米正式上线Xiaomi MiMo-V2.5-Pro-UltraSpeed模式。 据介绍,这是全球首个在通用GPU上突破1000 tokens/s的万亿参数模型,刷新了旗舰模型的全球最快推理速度。 今日,小米技术”公众号发文科普了什么是1000 tokens/s,以及这一速度到底有多快。 小米表示,token即词元,是大模型中的计量单位,类似日常买菜时使用的斤”两”。 1000 tokens/s也就是1000 Tokens Per Second,简称1000 TPS,意
MiniMax M3正式上线,京东云JoyBuilder模型开发平台已第一时间接入MiniMax M3模型并同步开放服务。 依托京东云自研推理框架,JoyBuilder采用了PD分离部署、KV Cache缓存、投机采样等先进推理优化技术,显著提升了模型推理吞吐量与响应效率。 MiniMax M3在编程、智能体等专业任务上达到了前沿水平。其采用全新的MiniMax稀疏注意力架构(MSA),最高支持100万token的超长上下文。作为一款�
慧荣科技推出SM2524XT,专为AI推理和KV Cache密集型负载设计的PCIe Gen5 DRAM-less SSD主控芯片。采用四核处理器、TSMC 6nm制程,连续读取达14GB/s,随机访问性能达250万IOPS,每瓦性能提升25%。该芯片针对高碎片化、低延迟敏感的AI工作负载优化,集成SCA、FTL调度及NANDXtend技术,确保持续负载下稳定性能。
小艺Claw上线30天内完成10余次架构迭代与20余项核心能力交付,成为首个获国家级智库认证的终端厂商Claw类智能体。4月29日重磅更新引入自进化能力,可记忆用户偏好与技能,越用越懂你;同时接入DeepSeek+V4模型,实现百万级超长上下文处理与逻辑推理跃迁。此外,Skills市场不断丰富,涵盖金融、生活、开发等场景,并基于鸿蒙星盾架构确保数据安全。用户无需部署,在HarmonyOS 6及以上设备上打开小艺APP即可预约体验。
2026年3月,谷歌研究院发布TurboQuant压缩算法,旨在解决大模型推理中KV Cache内存占用过高的问题。该技术可压缩KV缓存,实现内存占用降低6倍、推理速度提升8倍的潜力。面对KV Cache随上下文窗口扩大而指数级膨胀的挑战,产业界正从算法压缩与硬件优化两方面寻求突破。作为国内企业级存储方案提供商,忆联创新性地将高效压缩技术融入AI推理场景,打造兼具高性能与成本优势的硬件级KV Cache存储优化方案,为行业破解“内存墙”困局提供新路径。
4月2日,在2026 ODCC春季全会上,超擎数智获授“ODCC AI存储实验室”,标志着AI存储产业迈向标准化、规模化发展的新阶段。该实验室将聚焦AI存储与推理场景的关键技术演进,推动行业标准建设与生态协同发展,为产业高质量发展提供有力支撑。超擎数智凭借在AI应用全栈方案领域的技术积累与实践能力,成为实验室的运营方,未来将联合产业头部力量,共建开放协同生态,加速技术成果转化与标准落地,为AI推理与千行百业应用创新发展提供关键支撑。