首页 > 业界 > 关键词  > StemGen最新资讯  > 正文

音乐生成深度学习模型StemGen:听取音乐上下文生成音乐作品

2023-12-19 09:41 · 稿源:站长之家

**划重点:**

1. 🤖 革新性方法:研究采用非自回归、基于Transformer的模型,通过听取音乐上下文生成音乐,突破传统抽象条件的模型。

2. 🌐 模型效果验证:来自SAMI和字节跳动的研究人员引入非自回归、基于Transformer的模型,并通过标准指标和主观测试证明其音频质量和音乐与上下文的强大协调性。

3. 🚀 技术进步:研究结合图像和语言处理技术,以端到端的方式推动深度学习音频生成,并提出通过非自回归、基于Transformer的架构训练模型的新范例。

站长之家(ChinaZ.com)12月19日 消息:字节跳动AI研究团队最近推出了一项名为StemGen的音乐生成项目,该项目采用了一种创新的深度学习方法,旨在让模型能够模仿现有音乐中的模式和结构,并以一种非常前卫的方式回应音乐背景。与常用的深度学习技术(如RNN、LSTM网络和Transformer模型)不同,StemGen采用了一种非自回归、基于Transformer的模型,强调对音乐背景的听取和响应,而不是依赖于抽象的条件。

image.png

研究中,来自SAMI和字节跳动公司的研究人员引入了一种非自回归、基于Transformer的模型,该模型通过利用MusicGen模型的公开可用的Encodec检查点来监听和响应音乐背景。通过使用标准度量和音乐信息检索描述符方法,包括Frechet Audio Distance(FAD)和Music Information Retrieval Descriptor Distance(MIRDD),研究团队评估了模型的性能。结果显示,该模型在音频质量和与音乐背景的稳健对齐方面表现出竞争性,经过客观度量和主观MOS测试的验证。

这项研究强调了最新在端到端音乐生成方面的进展,借鉴了图像和语言处理的技术。它强调了在音乐创作中对音频片段进行对齐的挑战,并对现有依赖于抽象条件的模型提出了批评。研究提出了一种训练范式,使用了一种非自回归、基于Transformer的架构,使模型能够对音乐背景做出响应。该方法引入了两个条件源,并将问题框架构建为条件生成。

该方法利用了一种非自回归、基于Transformer的音乐生成模型,通过在单独的音频编码模型中引入残差向量量化器。通过将多个音频通道组合成一个单一的序列元素,采用了嵌套的方法。训练过程中采用了掩码程序,并在进行令牌采样期间使用了无分类器的指导,以增强音频背景的对齐。客观度量包括Fr’echet Audio Distance和音乐信息检索描述符距离等,用于评估模型的性能。

研究团队通过使用标准度量和音乐信息检索描述符方法进行生成模型的评估,包括FAD和MIRDD。与真实音频片段的比较表明,该模型在音频质量上达到了与最先进的文本条件模型相媲美的水平,并展现出与音乐背景的强大音乐连贯性。通过参与音乐培训的参与者进行的Mean Opinion Score测试进一步验证了该模型生成逼真音乐结果的能力。MIRDD对生成和真实音频片段的分布对齐进行评估,提供了音乐连贯性和对齐的度量。

总的来说,这项研究提出了一种新的训练方法,使生成模型能够对音乐背景做出响应。该方法引入了一种非自回归语言模型,具有Transformer骨干和两个未经测试的改进:多源无分类器的指导和迭代解码过程中的因果偏差。通过在开源和专有数据集上进行训练,这些模型实现了最先进的音频质量。标准度量和音乐信息检索描述符方法验证了其音频质量。通过Mean Opinion Score测试确认了该模型生成逼真音乐结果的能力。

项目网址:https://julian-parker.github.io/stemgen/

论文网址:https://arxiv.org/abs/2312.08723

举报

  • 相关推荐
  • Agent 进化论:从对话到协作

    人与AI沟通正从一次性指令转向持续协作讨论。Agent不再仅执行结果,而是从需求澄清阶段就参与任务,如店员用对话而非精细Prompt制作视频。实现此转变依赖四项核心能力:听觉确保嘈杂环境稳定交流,视觉通过选择性注意力与多模态共享画面理解场景,记忆沉淀跨端跨会话上下文,意图推动Agent主动追问模糊需求。音频视频用量大幅增长,多模态对话正成为通用协作界面,从工具升级为理解环境、持续参与的伙伴,未来AI眼镜等载体将承载这种类人协作模式。

  • 全量上线|花瓣地图Agent版本,开启AI地图探索世界新方式

    花瓣地图Agent版6月30日正式发布,面向HarmonyOS 5.0及以上设备全量开放。升级至6.0.0.330版即可体验核心功能“问问地图”:支持自然对话精准推荐地点并说明理由;可一键生成含行程、住宿、交通的完整攻略,支持自由调整并导出趣味地图;景区游览时化身AI伴游,智能推荐路线并语音讲解,已覆盖10个A级景区。另有多样主题图层与实时推送,方便探索身边惊喜。应用市场搜索“花瓣地图”升级即可解锁。

  • 海尔智慧家庭展示家庭AI智能体小优Agent加速无人家务

    海尔发布家庭AI智能体“小优Agent”,会主动感知和思考,如自动推送家庭简报、精准定位物品并营造场景氛围,真正解放双手。同时推出全屋智能硬件新品及开放平台Haismart,完成从AI大脑到执行与连接的布局,加速推进无人家务时代。

  • 从 VCloud 到 Agentic VCloud:Agent 时代的范式重构

    文章提出视频云正从服务人类的VCloud进化为服务AI的Agentic VCloud。随着豆包等Agent具备类人交互能力,音视频成为Agent感知与执行任务的关键媒介。文章指出,视频云需重构为“连接人与Agent的新型智能底座”,核心是构建支撑多模态感知反馈与环境交互的技术体系,并让Agent完成从理解意图到交付成果的全链路任务,推动行业竞争转向企业级任务落地。

  • 360预警:近四成Skill“带病上岗” 企业需建立Agent安全治理体系

    360报告指出,近四成公开AI技能(Skill)存在安全缺陷。风险包括权限“超配”、API密钥等敏感信息硬编码泄露,以及组合功能形成入侵链路。行业生态扩张速度远超安全建设。360提出“先检测、再准入、后运行”的全生命周期治理思路,建议企业严控权限,平台需从来源、权限、行为等多维度持续校验,以防范风险。

  • 销售易NeoAgent 2.0打造销冠数字分身,客户经营全流程自主跟进

    CRM+AI阶段,AI多为被动响应的单点辅助,核心流程仍靠人驱动。AI原生CRM的标志是主动执行:销售易NeoAgent2.0将成熟销售经验封装为200+个可复用Skill,并通过Agent智能编排,实现从被动响应到主动感知、规划与执行多步复杂任务的跨越。在续约准备、商机风险预警、新人模拟陪练三大场景中,NeoAgent2.0能自主推进业务、主动预警并提供建议,让AI真正进入销售流程,带来高效精准的跟进。

  • 蚂蚁灵波世界模型2.0正式发布!两大首创:小时级实时生成+Agent实时“陪玩”

    蚂蚁灵波科技开源新一代实时交互世界模型LingBot-World 2.0,首次在业界将Agent机制引入世界模型。该模型采用MoBA等自研技术,实现小时级稳定720p/60fps高清实时生成与流式传输,画面持久清晰连贯。交互上支持更复杂的实时动作与文本触发事件,并内置双Agent实现动态事件推演。它支持多人同时在线探索,可广泛应用于游戏、仿真及具身智能训练,用户现可在线体验。

  • 骁龙7 Gen4性能解析:全系列层级划分与至尊版专属命名

    荣耀400标准版凭骁龙7 Gen4实现均衡体验,成2500元档热门。该芯片采用4nm工艺,日常流畅、游戏稳定,性能接近上代8系标准版,致用户误以为7系有“至尊版”。文章厘清:至尊版命名仅属骁龙8系,7 Gen4实为7系标准版,定位准旗舰。高通产品层级明确,仅8系设至尊版,7系再强也无此头衔。

  • AI日报:豆包、千问下线AI拟人化功能;腾讯混元Hy3发布;Gemini3.5 Pro7月17日发布

    通义千问推出全新实时语音识别模型Fun-ASR-Realtime,提升性能与语言覆盖。豆包、通义千问应新规下线AI拟人化功能,引发用户不满。腾讯混元Hy3发布,强化智能体能力并以高性价比定价与开源策略推动普及。全球首例AI智能体全流程勒索攻击“JADEPUFFER”曝光。Meta调整节奏,Llama API预览版将下线,模型仍可获取,建议开发者迁移。Google Gemini 3.5 Pro定档7月17日,正面对垒DeepSeek V4。影坛版权博弈升级,Midjourney在好莱坞诉讼中要求片厂“自证清白”。JoyAI上线UGC数字人功能,打造个性化虚拟形象。

  • Agentic 范式下的视频画质优化:火山引擎的新路径

    用户刷视频时,对画质的判断往往发生在几秒之内。同样是短视频、直播、AIGC视频,有的画面清晰、稳定、有质感,人物的眉眼、物品的纹理、运动中的细节都足够自然;有的则模糊、压缩痕迹重,动作一快就闪烁、发虚,让人只想很快划走。过去,平台解决这些问题的方式相对明确:在生产端做基础美化和编辑;在服务端用超分、去噪、锐化、去压缩等算法,把模糊、发虚的部�

今日大家都在搜的词:

热文

  • 3 天
  • 7天