首页 > 业界 > 关键词  > Mustango最新资讯  > 正文

Mustango:结合扩散模型, 提高文本生成音乐质量

2023-11-22 17:01 · 稿源:站长之家

划重点:

🔸 研究团队提出了一个名为 Mustango 的解决方案,扩展了 Tango 文本到音频模型,旨在通过丰富的说明来控制生成的音乐。

🔸 Mustango 利用音乐领域的知识,结合扩散模型,实现了从文本到音乐的转换。

🔸 研究人员通过广泛的实验表明,Mustango 在音乐质量和可控性方面取得了最新的成果。

站长之家(ChinaZ.com)11月22日 消息:在文本到音乐合成领域,生成内容的质量一直在提高,但对音乐方面的可控性仍未得到探索。新加坡科技与设计大学和伦敦玛丽女王大学的研究人员提出了一个名为 Mustango 的解决方案,它扩展了 Tango 文本到音频模型,旨在通过丰富的说明来控制生成的音乐,这些说明包含与和弦、节拍、速度和键相关的具体指令。

研究人员将 Mustango 介绍为一种基于扩散模型的音乐领域知识启发的文本到音乐系统。他们强调了从扩散模型直接生成音乐所面临的独特挑战,强调了在与条件文本对齐和音乐性之间取得平衡的需求。Mustango 使音乐家、制作人和音效设计师能够根据特定条件(如和弦进行、速度和键选择)创建音乐片段。

image.png

作为 Mustango 的一部分,研究人员提出了 MuNet,即音乐领域知识启发的 UNet 子模块。MuNet 将音乐专用功能与从文本提示中预测的功能集成到扩散去噪过程中。为了克服现有带有音乐和文本说明的开放数据集的有限可用性,研究人员引入了一种新颖的数据增强方法。该方法涉及改变音乐音频的和谐、节奏和动态方面,并使用音乐信息检索方法提取音乐特征,然后将这些特征附加到现有的文本描述中,从而得到 MusicBench 数据集。

MusicBench 数据集包含超过52,000个实例,通过将节拍、下拍位置、基本和弦进行、键和速度添加到原始文本描述中,丰富了数据集。研究人员进行了广泛的实验,证明了 Mustango 在音乐质量方面达到了最新的水平。他们强调了 Mustango 通过音乐专用文本提示的可控性,展示了在捕捉多个数据集中所需的和弦、节拍、键和速度方面的出色性能。他们评估了这些预测器在没有控制句子的情况下的适应能力,并观察到 Mustango 在这种情况下的表现优于 Tango,表明控制预测器不会影响性能。

实验包括与 Tango 和 Mustango 的变体等基线的比较,证明了所提出的数据增强方法在提高性能方面的有效性。从头开始训练的 Mustango 被认为是表现最好的模型,在音频质量、节奏存在和谐等方面超过了 Tango 和其他变体。Mustango 拥有14亿个参数,比 Tango 多得多。

研究人员将 Mustango 作为文本到音乐合成领域的重要进展。他们解决了现有系统中的可控性差距,并通过广泛的实验证明了他们提出的方法的有效性。Mustango 不仅实现了最新的音乐质量,还提供了增强的可控性,为该领域的发展做出了宝贵的贡献。研究人员发布了 MusicBench 数据集,为未来的文本到音乐合成研究提供了资源。

项目网址:https://github.com/amaai-lab/mustango

https://huggingface.co/spaces/declare-lab/mustango

论文网址:https://arxiv.org/abs/2311.08355v1

举报

  • 相关推荐
  • 登榜LMArena!文心大模型5.0-Preview文本能力国内第一

    11月8日,文心全新模型ERNIE-5.0-Preview-1022在LMArena大模型竞技场排名中位列全球第二、中国第一。该模型在创意写作、复杂长问题理解和指令遵循方面表现突出,超越多款国内外主流模型。创意写作可高效生成文章、营销文案等内容;复杂长问题理解适用于学术问答、报告分析等任务;指令遵循能力支持智能助理、代码生成等场景,为多领域内容生产提供高效支撑。

  • TabTab 登顶模力工场 AI 应用榜榜首, 把 AI 数据分析师装进口袋,关键结论更快抵达!

    TabTab是一款全链路AI数据分析助手,核心功能包括多源数据连接(支持文档、数据库、电商平台等)、自动化采集清洗、内置分析模型及可视化呈现。其优势在于通过多智能体系统实现自然语言交互,降低分析门槛,让非技术人员也能快速完成客户洞察、销售业绩等分析,显著提升效率。产品定位中立,致力于构建多元化AI效率提升生态。

  • 国内首个!火山引擎推出融合国家级智库理论与大规模实战验证的 Data Agent 评测体系

    火山引擎推出国内首个融合国家智库理论框架与大规模实战验证的数据智能体评测体系,同步发布《2025数据智能体实践指南》。该体系直面传统评测重技术轻业务、预设答案难适配动态场景、局部能力检验不足三大痛点,确立业务关联性、可操作性与前瞻性设计原则。覆盖分析洞察、可视化呈现、鲁棒性三大核心维度,通过151道测试题量化智能体能力并划分达标/工业可用/专业研究三级标准。采用标准化闭环流程与自动化评分机制,为数字化转型深水区企业提供选型优化依据,推动产业智能化进入精准量化新阶段。

  • AI日报:昆仑万维SkyReels V3模型上线;月之暗面推Kimi Linear模型;MiniMax Music 2.0 发布

    本期AI日报聚焦多领域创新:昆仑万维推出SkyReels V3模型,整合顶尖视频生成能力;月之暗面Kimi Linear模型处理长文本速度提升2.9倍;MiniMax Music 2.0实现专业级音乐创作;字节跳动启动豆包股权激励计划吸引AI人才;苹果iOS 27将迎AI重大升级,Siri更个性化;Dia浏览器融合Arc设计理念与AI技术;文心魔法漫画工具实现一键生成连载作品;谷歌Gemini Canvas新增PPT自动生成功能,由Gemini 2.5 Pro驱动,提升职场效率。

  • 小鹏将推出3款全球化Robotaxi 2026年同步开启试运营

    小鹏汽车在2025科技日宣布,将于2026年推出三款全栈自研L4级Robotaxi,同步开启试运营。该车型搭载4颗图灵AI芯片,算力达3000TOPS,配备第二代VLA模型,具备强大泛化学习能力,能自适应全球不同交通习惯。作为中国首款全栈自研Robotaxi,无需额外改装,不依赖高精地图即可实现量产。车辆提供两套智驾方案,分别侧重通勤效率与极致安全,并在六大关键系统采用双冗余设计,确保行驶安全。小鹏还将开放Robotaxi SDK,与高德地图等伙伴共建全球服务生态。

  • 科杰科技&甲子光年:2025中国Data&AI数据基础设施白皮书

    当前全球正经历地缘政治重塑与人工智能革命驱动的深刻变革。全球化向区域化演进,供应链加速本土化,AI从前沿技术跃升为核心生产力。麦肯锡研究显示,生成式AI有望为全球经济贡献7万亿美元,中国预计占2万亿美元,接近全球总量三分之一。传统数据系统难以满足AI对实时性、多模态处理和高弹性算力的需求,企业需构建新一代数据基础设施,实现数据生产、治理与AI应用的动态融合,突破"数据烟囱",支持跨场景智能部署。Data&AI一体化将推动数据价值从效率提升向产业协同跃升,成为智能社会的核心引擎。

  • geo生成式引擎优化是什么?GEO优化原理与工具推荐

    在AI技术日新月异的今天,我们的信息获取方式正经历着一场革命。生成式引擎优化(Generative Engine Optimization,简称GEO)是AI搜索时代应运而生的新型优化策略,它被视为传统SEO在AI时代的进化版。 与传统SEO专注于提升网页在搜索引擎结果中的排名不同,GEO的核心目标是让品牌信息能够被DeepSeek、豆包、文心一言等主流AI平台识别、引用并直接推荐给用户。这种转变是因为搜索�

  • 数据智能体 TabTabAI 正式上线,零门槛上手,让 “数据分析” 人人可用

    AI数据智能体TabTabAI正式上线,以“零门槛交互+全流程自主处理”为核心优势,打破数据分析技术壁垒。该工具通过自然语言对话,支持多源数据采集、智能处理、深度洞察与可视化,让普通职场人无需编程背景即可完成复杂分析任务。其多智能体协同架构与自动化能力,覆盖从数据收集到决策建议的全链路,助力用户将原始数据高效转化为精准决策依据,真正实现“人人都是数据分析师”。

  • 00后音乐老师喊麦式课堂走红 希望学生能快乐的感受音乐魅力

    ​近日,长沙市宁乡清水湖实验小学的一位00后音乐教师尹碧文,凭借其独特的“喊麦式”节奏教学方式,在网络上迅速走红。这位年仅24岁的年轻教师,本学期刚入职便负责了8个班级的音乐教学工作,以其充满活力和创意的教学方法,赢得了学生们的热烈喜爱。 尹老师的课堂上,传统的音乐教学被赋予了全新的形式。他通过击打节拍,引导学生进行高频互动,口中不断发出�

  • AI搜索可见性监控:品牌在生成式搜索时代的生存新法则

    AI搜索正颠覆传统SEO:58.5%的谷歌搜索已是零点击,用户看完AI摘要即离开。ChatGPT日处理超100亿查询,预计2030年流量将超谷歌。品牌需监控AI平台推荐情况,传统工具无法追踪豆包、通义千问等国产AI。建议建立监控体系:测试核心问题曝光率,每周追踪排名变化,持续优化内容。数据显示71%美国人用AI辅助购物决策,流量正加速从谷歌转向AI。生存法则很简单:看不见的,等于不存在。

今日大家都在搜的词: