11.11云上盛惠!海量产品 · 轻松上云!云服务器首年1.8折起,买1年送3个月!超值优惠,性能稳定,让您的云端之旅更加畅享。快来腾讯云选购吧!
腾讯云
12-20
Kimi-K3在8×B300单机上通过GPUStack接入vLLM与SGLang,对比推理性能。64K输入下vLLM端到端延迟更低;200K输入时SGLang反超,得益于DCP分片降低长上下文Decode的KV读取瓶颈。性能交叉源于DCP配置差异,两方Prefill接近,差异在Decode扩展性。投机解码因随机数据接受率极低而几无收益。测试非严格对等,结果反映瓶颈与选型方向,非最终性能排名。
3月15日,百度智能云联合vLLM社区、红帽共同主办的“vLLM-Kunlun:大模型推理工程化实践分享”Meetup成功举办。活动汇聚9位技术专家,围绕国产芯片与vLLM框架适配,从架构设计、性能优化、生态落地三大维度展开深度分享,全面展现百度智能云在国产大模型推理领域的技术积累与生态布局。百度百舸拥抱开源生态,打造“高性能、易开发、全生态兼容”的国产芯片推理方案。vLLM-Kunlun已完成对Qwen、DeepSeek、GLM等50余款主流大模型的推理适配,为开发者提供高效易用的国产芯片推理支持。多位专家还从编译、算子、框架、量化等维度,系统展示了百度智能云在释放昆仑芯硬件性能上的全栈攻坚成果,并通过实战案例验证了国产芯片在真实业务场景中的可用性。未来,百度百舸将持续深耕国产芯片推理生态,推动国产芯片大模型推理从“可用”走向“好用”。
2025年9月29日,深度求索公司发布新一代模型架构DeepSeek-V3.2,引发行业关注。寒武纪同步宣布适配该模型并开源vLLM-MLU推理引擎代码。新发布的DeepSeek-V3.2-Exp是实验性版本,在V3.1-Terminus基础上引入稀疏注意力机制,优化长文本训练和推理效率。目前官方应用端已同步更新,API大幅降价。此次模型体积达671GB,下载需8-10小时。业内专家指出,此次快速适配表明双方早有深度技术协�
近日,摩尔线程上线了大语言模型高速推理框架开源项目vLLM的MUSA移植版本,为开发者提供基于摩尔线程全功能GPU进行开源项目MUSA移植的范例。摩尔线程表示,正努力围绕自主研发的统一系统架构GPU、MUSA软件平台,构建完善好用的MUSA应用生态。摩尔线程通过MUSA软件栈对CUDA软件栈接口兼容,大幅提升了应用移植的效率,缩短了开发周期提供MUSIFY自动代码移植工具等一系列实用工具和脚本。
魔搭社区与vLLM和FastChat展开合作,联合为中国开发者提供更快更高效的LLM推理和部署服务。开发者可以使用vLLM作为FastChat中的推理引擎,提供高吞吐量的模型推理。还可以结合FastChat和vLLM搭建一个网页Demo或者类OpenAIAPI服务器。
大语言模型在改变人们的生活和职业方面影响越来越大,因为它们实现了编程助手和通用聊天机器人等新应用。这些应用的运行需要大量硬件加速器如GPU,操作成本非常高。更大的模型、更复杂的解码算法和更长的序列会导致更明显的改进。