首页 > AI头条  > 正文

昆仑万维正式发布SkyReels-A3模型:照片可根据语音对口型

2025-08-11 09:28 · 来源: AIbase基地

昆仑万维集团宣布推出其最新技术成果SkyReels-A3模型,这是一款基于DiT(Diffusion Transformer)视频扩散模型的音频驱动数字人创作工具。SkyReels-A3的发布标志着数字内容创作领域的一大进步,它能够实现任意时长的全模态音频驱动数字人创作,为用户带来全新的体验。

SkyReels-A3模型的核心功能是让静态图像或视频“活”起来,通过上传人像图片和相应的语音,即可使图片中的人物按照语音内容开口说话或唱歌。此外,该模型还支持创作新的视频内容,用户只需提供人像图片、语音和文字提示,即可生成按照要求状态进行表演的视频。SkyReels-A3还能够为现有视频“改台词”,自动匹配新的口型、表情和表演,保持画面连贯。

微信截图_20250811092633.png

该模型在文本提示词输入、动作交互自然度、运镜控制以及视频输出时长等方面都进行了优化和提升。SkyReels-A3支持长达60秒的单分镜视频输出,多分镜支持无限时长,满足不同创作需求。昆仑万维还针对线上直播等实际应用场景进行了特定优化,提高了视频生成的一致性和特定交互动作的自然度和清晰度。

SkyReels-A3的推出,不仅为广告、直播带货等商业应用提供了强有力的技术支持,也为音乐MV、电影片段或演讲视频等艺术创作提供了更多可能性。昆仑万维通过引入基于ControlNet结构的镜头控制模块,实现了帧级别精准运镜控制,预设了8种常见的运镜参数,用户可以根据需要选择相应运镜,并且每个运镜的强度可0–100%连续调节,生成专业的运镜效果。

SkyReels-A3模型的发布,预示着数字内容创作将变得更加高效和便捷。昆仑万维集团通过这一创新技术,为电影制作、虚拟直播、游戏开发与教育内容创作等领域提供了低门槛、低成本、高保真的AI技术制作方案。SkyReels-A3的推出,代表了声音即影像的可能性,为个性化、交互式内容的创作提供了前所未有的高效与便捷,也许下一个刷屏的爆款视频就来自你的灵感。

SkyReels-A3项目主页:

https://skyworkai.github.io/skyreels-a3.github.io/

SkyReels 官网地址:

https://www.skyreels.ai/home

SkyReels系列开源模型地址:

https://huggingface.co/Skywork

  • 相关推荐
  • 昆仑万维技术周启幕:SkyReels模型重塑内容创作基建

    2025年8月11日,昆仑万维启动SkyWork+AI技术发布周,将连续五天发布五大领域AI模型:视频生成模型Skyreels、世界模型、生图一体化模型、智能体(Agent)模型和AI音乐创作模型Mureka。首日发布的Skyreels-A3是全球首个支持分钟级长视频生成的模型,通过四大技术创新解决直播电商等场景痛点,可实现180秒连贯视频生成、影视级运镜控制与自然动作交互。该模型采用多模态协同生成范式,突破传统视频生成技术误差累积限制,并通过Step蒸馏技术将推理步数压缩至4步,生成时间缩短至80秒。商业化方面,昆仑万维已形成"研发-产品变现-现金流反哺"闭环,2025年Q1经营性现金流净额增长58.3%,旗下DramaWave、Mureka等产品年化流水分别达1.2亿和1200万美元。此次技术周标志着中国AI企业首次跑通规模化盈利路径。

  • AI日报:昆仑万维发布SkyReels-A3模型;百度搜索PC端全面上线AI搜索;Grok 4 AI模型永久免费开放

    AI日报栏目聚焦人工智能领域最新动态:1)昆仑万维发布SkyReels-A3模型,实现语音驱动数字人生成;2)xAI宣布Grok4模型永久免费开放;3)OpenAI发布GPT-5提示词指南;4)百度PC端上线AI搜索功能;5)微软Windows Co pilot接入GPT-5;6)百川智能开源医疗大模型Baichuan-M2性能超越GPT-oss120b;7)苹果iOS26将集成ChatGPT-5;8)谷歌推出3D视觉编辑框架BlenderFusion;9)轻量级TTS模型Kitten TTS参数仅1500万;10)MiniCPM-V

  • AI日报:混元推四款小尺寸开源模型;昆仑万维发布新推理大模型MindLink;谷歌Gemini 2.5 Deep Think发布

    【AI日报】汇总了最新AI领域动态:1)腾讯开源混元系列小尺寸模型,适用于消费级显卡;2)昆仑万维发布推理大模型MindLink,提升回答透明度;3)B站推出AI原声翻译功能,保留UP主音色;4)谷歌Gemini 2.5在数学奥赛夺金,展现强大推理能力;5)OpenAI展示GPT-5网络信息整合特性;6)苹果组建AI团队挑战ChatGPT;7)高德地图推出全球首个AI原生地图应用;8)Adobe推出AI图像合成工具Harmonize;9)NVIDIA发布革命性视频渲染技术;10)谷歌推出Android Studio免费AI编程助手;11)开源结构化信息提取工具LangExtract;12)Figma开发者模式升级提升设计转代码效率。

  • OpenAI正式发布GPT-5模型 网友:写作像诗人

    OpenAI在直播活动中正式推出新一代人工智能模型GPT-5,宣称其覆盖编程、数学、写作、健康咨询、视觉感知等核心领域,实现"公司迄今为止最重大的模型升级"。OpenAI首席执行官萨姆·奥尔特曼(Sam Altman)形容,与GPT-5交互如同与各领域专家对话,其多维度能力突破将重塑人机协作模式。 分层开放策略满足多元需求 GPT-5将于本周四启动全球用户分批推送,免费用户与付�

  • 主流手机厂商第一款!曝vivo Vision本月正式发布

    vivo通信科技有限公司产品经理韩伯啸今天发文透露,vivo Vision发布会已经在紧锣密鼓的准备中了。 随后博主数码闲聊站爆料称,vivo Vision将在本月正式发布,这是主流手机厂商中第一个做出的类苹果Vision Pro MR头显设备。

  • AI日报:阿里新发布Qwen3-4B模型;小红书发布开源模型dots.vlm1;MiniMax Speech 2.5语音生成模型上线

    AI日报栏目聚焦人工智能领域最新动态:1)阿里发布Qwen3-4B轻量级模型,手机端可运行;2)小红书开源多模态大模型dots.vlm1,在图表推理方面表现突出;3)MiniMax推出语音生成模型Speech2.5,多语种表现提升;4)Midjourney推出HD视频模式,提升专业影像质量;5)Cursor1.4版本增强异步任务处理能力;6)谷歌否认AI搜索影响网站流量,但数据显示用户行为改变;7)MiniCPM-V4.0开源发布,号称"手机上的GPT-4V";8)AMD与高通宣布支持OpenAI的gpt-oss系列模型;9)腾讯开源WeKnora文档智能解析工具;11)疑似GPT-5信息在GitHub泄露;12)FlowSpeech实现书面语转口语的TTS技术突破。

  • GPT-5正式发布:与Claude 4、Gemini 2.5等主流大模型谁更胜一筹?

    2025年8月7日,OpenAI正式发布GPT-5,官方称其为"最智能、最快速、最实用"的AI模型。GPT-5在数学推理能力上大幅提升,在AIME2025测试中取得94.6%的高分,处理速度也有明显改善。但与竞争对手相比仍存在差距:Claude4在代码生成和逻辑推理方面表现优异,支持200K token长文本;Gemini2.5具备2M超大上下文窗口和全模态支持;国产模型DeepSeek R1在中文理解和性价比方面具有优势。AI�

  • AI日报:GPT-5正式发布;百度将推文心5.0大模型;知网发布AIKBase V2.0多模态数据管理系统

    《AI日报》精选AI领域最新动态:1)OpenAI发布GPT-5模型,具备强大多模态能力但推理任务仍有局限;2)知网推出AIKBase V2.0多模态数据管理系统;3)Ideogram新增"角色"功能实现图像风格统一;4)Cursor发布CLI版本支持终端AI编程;5)百度即将推出全新推理模型和文心5.0大模型;6)dots.ocr推出1.7B参数多语言文档解析工具;7)特斯拉解散Dojo超算团队转向英伟达合作;8)谷歌Pixel 10引入AI相�

  • 谷歌DeepMind发布Genie 3世界模型:支持实时生成交互式3D环境

    据媒体报道,谷歌DeepMind正式发布了其新一代通用世界模型Genie 3。 该模型能够根据用户的文本提示,快速生成丰富多样的交互式虚拟环境。Genie 3不仅能够以每秒24帧的速度生成720p分辨率的高清交互式3D世界,更创新性地引入了 可提示世界事件” 功能。用户通过简单文本指令,即可实时修改虚拟环境,显著提升了沉浸感与创造力。 DeepMind视Genie 3为迈向通用人工智能(AGI) 的�

  • 重塑AI算力底座!阿里云服务器操作系统V4正式发布

    阿里云正式发布新一代服务器操作系统Alinux 4,以"AI驱动"为核心,面向下一代云数据中心和AI基础设施。该系统基于6.6内核,支持x86、ARM及国产芯片架构,深度优化AI训练推理性能,提供开箱即用的AI体验。通过CPU+GPU混部技术提升资源利用率,集成机密计算技术保障数据安全。Alinux 4已支撑阿里云百万级服务器部署,成功承载万卡级分布式算力集群,为金融、政务等行业�

今日大家都在搜的词: