首页 > 传媒 > 关键词  > 腾讯最新资讯  > 正文

腾讯混元发布开源加速库,生图时间缩短75%

2024-06-07 11:36 · 稿源: 站长之家用户

6月6日,腾讯发布针对腾讯混元文生图开源大模型(以下简称为混元DiT模型)的加速库,让推理效率大幅提升,生图时间缩短75%。

混元DiT模型的使用门槛也大幅降低。用户可以基于ComfyUI的图形化界面,使用腾讯混元文生图模型能力。同时,混元DiT模型已经部署至Hugging Face Diffusers通用模型库中,用户仅用三行代码即可调用混元DiT模型,无需下载原始代码库。

此前,腾讯宣布旗下的混元文生图大模型全面升级并对外开源,可供企业与个人开发者免费商用。这是业内首 个中文原生的DiT架构文生图开源模型,支持中英文双语输入及理解;采用了与 sora 一致的DiT架构,不仅可支持文生图,也可作为视频等多模态视觉生成的基础。

腾讯混元DiT模型开源之后,受到了众多社区开发者的认可。开源不到一个月,项目Github Star数就超过2100,位于开源社区热门DiT模型前列。

混元DiT Github页面

为了提升开发者使用体验,腾讯混元官方上线了专属的加速库,让推理时间缩短75%,提高大模型运行效率。开发者通过Hugging Face即可下载该推理加速工具。

项目组通过知识蒸馏和TensorRT高性能推理框架,实现了DiT模型的采样步数压缩与有效推理部署。蒸馏主要指降低扩散模型迭代的步数实现加速。模型整体结构和参数量不变,用户在无需任何额外的操作和设备要求下使用蒸馏权重,即可降低50%迭代步数,实现耗时减半。TensorRT推理加速方案通过工程优化,可以进一步降低耗时,并且和模型权重解耦。同时使用两者进行推理部署,可将推理时间缩短75%。

官方还分享了两个降低用户使用门槛的最 新消息:经过与社区的共同努力,用户可以基于ComfyUI的图形化界面使用腾讯混元文生图模型能力。同时,通过与Hugging Face团队合作,混元DiT模型已经部署到Hugging Face官方模型库Diffusers中,并编写了适配该模型库的调用和生成代码,用户可以直接通过该途径调用混元DiT模型,大大简化了用户使用的成本。

ComfyUI是一款文生图领域的WebUI界面设计,它将文生图领域的扩散算法模块化与图形化,提升了生成效率与资源利用率,也大幅降低了开发者的使用门槛。用户可以通过图像化工作流使用混元DiT文生图模型,实现与官方模型一样的效果。

混元DiT文生图模型的ComfyUI使用界面

此外,围绕ComfyUI的使用生态,还衍生出强大的开源社区。混元DiT对ComfyUI的支持,也能让社区的成员体验基于最 新DiT架构的文生图模型。

作为知名的AI开源社区,Hugging Face的Diffusers是目前调用各种主流文生图大模型的通用库,已经成为当今文生图大模型使用的社区标准。

将混元DiT模型适配进Hugging Face Diffusers,可以大幅提升模型的易用性和用户基础。用户无需将原始代码库下载与部署到自身环境,安装了Diffusers库的开发者,仅需要运行几行代码,即可调用混元DiT模型,配置与调用都十分方便。同时,Hugging Face与腾讯混元团队共同优化算法框架,加快了图片的生成速度。

此举也相当于为所有后续基于混元DiT的使用和开发提供了底层支持,覆盖各种需要调用混元DiT的任何场景,包括上述的ComfyUI方式。同时对开发者而言,之前配置好的基于Diffusers的工作流和插件可以在少量修改的情况下直接用于混元DiT。

腾讯文生图负责人芦清林表示:“腾讯混元文生图模型开源之后得到了众多开发者的支持和反馈,我们十分高兴,也同时在针对开发者的反馈与社区一起完善和优化基于混元DiT的开源生态,让更多开发者能更便利地享受到最 新的研究成果。也欢迎大家跟我们一起共建下一代视觉生成开源生态,推动大模型行业加速发展。”

推广

特别声明:以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。站长之家将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时,可及时向站长之家提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明(点击查看反馈联系地址)。本网站在收到上述法律文件后,将会依法依规核实信息,沟通删除相关内容或断开相关链接。

  • 相关推荐
  • 以数字引擎驱动未来——太平洋电信数字化平台E-com正式上线

    太平洋电信推出数字化服务平台E-com,通过模块化架构将复杂云网安方案拆解为标准化组件,实现可视化配置管理。该平台提供方案设计、在线采购、售后服务全流程支持,内置模板降低技术门槛,让企业用户可自主搭建专属方案。同时整合e-Go在线商城实现快速下单,推动行业从价格竞争转向服务价值竞争,构建开放服务生态。

  • 海尔智家前三季度SKU效率提升15.6%

    海尔智家2025年三季报业绩超预期,前三季度营收2340.5亿元,同比增长10%;归母净利润173.7亿元,创历史新高。这一成绩得益于公司持续推进数字化战略,通过全球研发与智能制造体系提升效率,SKU效率提升15.6%。AI产品如懒人洗系列销量突破20万台,带动品类增长;AI套系产品占比提升,激发用户换新需求;AI生活应用通过智能家电延伸至全屋体验。公司以创新优化运营,强化市场竞争力,为可持续发展奠定基础。

  • VMware替代与升级选型必看!腾讯专有云TCE成企业升级首选

    根据Omdia调查,VMware过去20年主导软件虚拟化市场,但2023年被博通收购后引发连锁反应。博通调整定价策略、产品组合及合作伙伴网络,导致客户成本上升、服务目录不全等问题。73%的VMware客户正考虑三年内寻找替代方案,转向全栈能力、生态构建与智能运维的综合考量。腾讯专有云TCE作为企业级全栈私有云平台,成为替代首选,支持无缝迁移、显著降低TCO至少20%,并具备高扩展性和面向AI与云原生的升级能力。

  • 颠覆Diffusion局限!Utopai双模型耦合架构,攻克AI影视长叙事核心难题

    Utopai Studios推出专为影视制作设计的AI模型与工作流,区别于主流视频生成模型,其核心能力在于理解剧本、规划镜头及生成场景,通过自回归模型负责叙事规划与一致性约束,扩散模型专注高质量画面渲染。该系统能解决跨镜头元素漂移难题,提升制作效率与作品品质。目前工作流仅用于公司自有项目,强调AI作为创作者协作者的角色,并遵循行业道德与版权规范。

  • AI日报:Lovart AI上线“元素拆分”功能;Xcode 26.1.1发布;阿里云通义模型首次大规模赋能双11

    本期AI日报涵盖八大热点:Lovart AI推出"元素拆分"功能,实现海报智能分层编辑;苹果Xcode 26.1.1优化AI编码性能;阿里云通义模型双11单日翻译调用量突破14亿次;Gemini 3在历史手稿破译中展现专家级能力;德国法院裁定OpenAI使用歌词训练构成侵权;开源语音模型Maya1实现富有表现力的实时文本转语音;Meta首席AI科学家LeCun计划离职创办世界模型公司;AI专家罗福莉加入小米,将致力于构建物理世界智能。

  • 开发者必看!2025开放原子开发者大会:解锁开源鸿蒙&开源欧拉实践、Rust实战与AI开源新机遇

    2025年11月21日至22日,北京亦庄将举办2025开放原子开发者大会,主题为“AI共治,开源共享”。大会汇聚全球开源项目、技术专家与开发者,探讨开源技术与AI融合的未来路径,覆盖操作系统、人工智能、数据库、量子计算等前沿领域。通过主题论坛、技术分论坛及项目展示,为开发者提供技术交流、生态共建及职业成长平台,助力开源社区发展。

  • AI日报:xAI推出Grok 4.1;OceanBase发布首款AI数据库seekdb;Kimi K2成功接入Perplexity

    本期AI日报聚焦多项技术突破:蚂蚁集团"灵光"AI助手实现30秒生成可编辑应用;xAI推出免费Grok 4.1模型显著提升质量与速度;Poe推出200人群聊功能支持多模型协作;OceanBase发布首款AI数据库seekdb实现混合搜索;国产模型Kimi K2接入Perplexity展现国际竞争力;谷歌DeepMind推出通用智能体SIMA2在3D游戏中任务完成率达62%;ElevenLabs升级为一站式内容生成平台;昆仑万维推出轻量级多模态智能体Skywork R1V4-Lite,用户拍照即可自动完成任务。

  • Qwen用开源逆袭GPT的故事,千问APP要再干一遍

    Qwen模型逆袭GPT的策略,阿里准备再用一次。 2018年,OpenAI发布了自己的第一个模型GPT1,占据了技术先机,随后变得越来越封闭。在大洋彼岸,阿里几乎同一时间着手大模型研究,到2023年推出“通义千问”时,则选择了一条完全不同的路径:直接开源模型,允许开发者免费使用、改进和集成。 这个策略让Qwen逐步积累起规模,做到了如今全球开发者基于它发布了17万个衍生模型�

  • 智检加速:AI云测试如何为香港企业 IT 项目减负40%人力成本

    香港企业在App研发中面临高昂人力成本与复杂技术栈挑战,导致测试效率低、交付缓慢。Testin云测通过AI驱动的自动化测试方案,整合云端资源与专业服务,实现降本增效:硬件投入优化50%,人力成本降低40%;AI脚本生成技术提升测试效率60%,支持跨平台复用;精准OCR识别助力迭代周期缩短50%。聚焦金融、政企、交通等重点行业,提供符合国际标准的安全测试保障,助力企业从人力密集型向技术密集型转型,以更高质量、更快速度赢得市场竞争。

  • 2025乌镇峰会:易鑫发布汽车金融行业首个Agentic大模型XinMM-AM1

    易鑫集团在2025世界互联网大会乌镇峰会上发布汽车金融行业首个Agentic大模型XinMM-AM1。该模型具备300亿参数、响应延迟低于200ms等技术优势,能提升获客、风控与运营效率,优化用户体验。通过全链路智能决策能力,推动行业从"单点智能"转向"整体高效"。配套SaaS平台已覆盖超4万家经销商及百余家金融机构,显著提高融资通过率与业务质量,填补领域技术空白,引领汽车金融智能化发展。

今日大家都在搜的词: