NaturalSpeech 3：可克隆音色和感情的语音合成系统

2024-03-08 10:23 · 稿源：站长之家

**划重点:**
1. 🌐 创新性的语音合成系统，NaturalSpeech3，采用分解编解码器和扩散模型，在零样本情况下生成自然语音。
2. 🚀 使用神经编解码器进行语音波形分解，包括内容、韵律、音色和声学细节，以实现细致入微的语音建模。
3. 📈 在LibriSpeech和Ravdess基准测试上，NaturalSpeech3在质量、相似度、韵律和可懂度方面均优于现有TTS系统。

站长之家（ChinaZ.com）3月8日消息:随着大规模文本到语音（TTS）模型的发展，取得了显著进展，但在语音质量、相似度和韵律方面仍存在不足。考虑到语音涉及到多个属性(例如内容、韵律、音色和声学细节)，这为生成带来了巨大挑战。

为了解决这一问题，NaturalSpeech3提出了一种创新的TTS系统，采用了新颖的分解扩散模型，以零样本的方式生成自然语音。也就是提供文本和参考音频，可以克隆音色和感情，值得注意的是，NaturalSpeech3目前只有论文。

语音建模的关键创新点之一是使用神经编解码器，包含分解的向量量化（FVQ），将语音波形分解成内容、韵律、音色和声学细节等子空间。** 这种分解设计使得NaturalSpeech3能够以分治的方式高效地建模复杂的语音。此外，他们还提出了分解的扩散模型，用于根据相应提示生成每个子空间中的属性。实验证明，NaturalSpeech3在质量、相似度、韵律和可懂度等方面优于现有TTS系统。

在LibriSpeech基准测试中，NaturalSpeech3的性能明显超越了其他系统。对比结果显示，NaturalSpeech3在相似度（Sim-O）、错误率(WER)、音质(CMOS)、语音质量(SMOS)等方面均取得了显著的优势。此外，通过扩大模型规模和训练数据，NaturalSpeech3在200K小时的训练数据和10亿参数的规模下取得了更好的性能。

除了LibriSpeech基准测试，NaturalSpeech3还在Ravdess基准测试上表现出色。在MCD（Mel频率倒谱系数）方面，相较于其他系统，NaturalSpeech3的平均MCD显著降低，表现出更好的语音合成效果。

值得注意的是，由于该模型能够以高度相似的说话者模仿真实语音，存在潜在的滥用风险，例如欺骗语音识别或冒充特定说话者。因此，在实验中，假定用户同意成为语音合成的目标说话者。为了防止滥用，研究者呼吁开发强大的合成语音检测模型，并建立一个系统，让个体报告任何疑似滥用行为。这一研究符合微软的负责任AI原则。

项目网址入口:https://top.aibase.com/tool/naturalspeech-3

（举报）

相关推荐
大家在看

关键词：

【腾讯云】11.11云上盛惠！云服务器首年1.8折起，买1年送3个月！

11.11云上盛惠！海量产品 · 轻松上云！云服务器首年1.8折起，买1年送3个月！超值优惠，性能稳定，让您的云端之旅更加畅享。快来腾讯云选购吧！

Docker容器镜像
去看看

Docker容器镜像 60元/15天

爆款产品组合购
去看看

爆款产品组合购低至1元

腾讯云x NVIDIA加速计划
去看看

腾讯云x NVIDIA加速计划最高获赠10万元扶持基金

2核2G云服务器
去看看

2核2G云服务器 112元/1年

查看更多相关信息>>

腾讯云 12-20

广告
OpenAI公开语音合成引擎Voice Engine：支持语音克隆，未开放使用

OpenAI近日分享了一个名为VoiceEngine语音合成模型的初步结果。VoiceEngine支持语音克隆，但是未开放使用，提供给了HeyGen等公司使用。OpenAI希望通过与各方合作，加强社会对合成语音技术带来的挑战的防范，促进对合成语音技术的了解和应用。

VoiceEngine OpenAI AI头条
VoiceEngine官网体验入口 OpenAI人工智能语音克隆合成工具使用地址

VoiceEngine是OpenAI推出的一种先进的语音合成模型，它仅需15秒的语音样本，便能生成与原始说话人极为相似的自然语音。该模型广泛应用于教育、娱乐、医疗等领域，可为非读写人群提供朗读辅助、为视频和播客内容翻译语音、为非语言人群赋予独特语音等。通信辅助应用Livox使用VoiceEngine为失语症患者提供独特非机械般的语音，让他们选择最能代表自我的声音进行交流。

VoiceEngine
EVI正式发布API 提供转录、语音合成服务

EVI，一款可以识别对话客户情感的人工智能，正式发布了API。自发布以来，它已经生成了大约10万次的对话，平均每次对话时长为10分钟，总计产生了超过300万条消息。EVIAPI的发布，使得AI的对话更加自然、个性化，同时也提供了更多的选择和便利，为用户带来了更好的体验。

EVI AI头条
荐小游戏出海，跑出日本最赚钱的合成游戏

出海小游戏《肥鹅健身房》2月27日登陆日本，当日登顶日本iOS下载总榜。时隔近一个月后我们再来看这款游戏，下载排名依旧稳定在下载总榜Top30，累计下载量63w次，尤其让人惊喜的是畅销榜排名的变动，3月25日位列iOS游戏畅销榜Top87，将《MergeMansion》、《SeasideEscape》等的明星产品都甩到身后。根据data.ai信息，青瓷游戏获授权发行的塔防游戏《TotemvsBOT》以及肉鸽动作游戏《骑�

游戏
AI人声合成引擎ACE Studio 可修改Suno生成的音乐甚至替换歌手的声音

ACEStudio是一款尖端的AI人声合成引擎，其设计理念是创造出既自然又富有感情的类真人歌声。这款引擎运用了最前沿的AI技术，将人工智能融入声音生成的每一个环节，力求让合成出来的声音尽可能地接近真实人声的表现力和情感深度。ACEStudio为音乐制作人提供了强大的工具，使他们能够在创作中发挥更大的想象力和创造力，同时以高品质的人声为作品增添灵魂和情感。

Suno ACEStudio AI头条
MoA：用于图片合成的混合注意力架构可实现风格参考和人物融合

在最新的研究中，提出了一种名为注意力混合模式的新架构，旨在个性化文本到图像扩散模型，可以实现风格参考和人物融合的效果。受大型语言模型中使用的专家混合机制的启发，MoA通过将生成工作负载分配给两个注意力路径来实现给定主题和背景的分离生成。这些应用展示了MoA在个性化图像生成领域的潜在价值和广泛适用性。

MoA AI头条
ACE Studio官网体验入口 AI歌手音乐制作人声合成工具软件下载链接

ACEStudio是一个先进的AI人声合成引擎，旨在制作听起来像真人一样自然和充满感情的歌声。其功能包括AI唱歌合成引擎、支持多语言的AI歌手、商业用途的免费使用权、多维AI情感参数、简化声乐制作流程、创造独特音色和唱法。ACEStudio的关键功能提供自然、富有表现力的人声合成支持多语言的AI歌手商业用途的免费使用权多维AI情感参数控制简化声乐制作流程创造独特音色和唱法如何使用ACEStudio想要体验ACEStudio的强大功能，只需访问ACEStudio官方网站，了解更多详细信息并开始您的声音合成之旅。

ACEStudio
Domo AI推视频色度抠图功能可将扣出的人物合成到新背景中

DomoAI近日推出了一项新功能，用户现在可以通过“--key”命令扣出主体人物后更换对应颜色的背景。这一功能的引入，无疑为用户带来了更多的便利和创作空间。DomoAI的这一新功能，无疑为用户提供了更多的创作自由度，使得视频和移动创作变得更加便捷和个性化。

Domo AI头条
Check Point 与微软展开新合作，Microsoft Azure OpenAI 与 Infinity AI Copi lot强强联合

利用先进的人工智能技术树立网络安全管理和运营的新标杆2024年4月，领先的云端AI网络安全平台提供商CheckPoint软件技术有限公司宣布与微软展开合作，通过与MicrosoftAzureOpenAI服务集成进一步增强CheckPointInfinityAICopi lot效能。这次合作标志着网络安全AI应用的重大进步。该综合型平台集多项云端技术于一身，包括确保工作空间安全的CheckPointHarmony、确保云安全的CheckPointCloudGuard、确

人工智能技术网络安全管理云端AI
ChatGPT 将提供动态模式Dynamic 可根据情况自动选择适合用户的模型

ChatGPT宣布将推出一项名为"Dynamic"的新功能。这个功能的特点是，当用户选择"Dynamic"选项后，系统将根据智能、能力和速度的综合情况，自动选择最适合用户要求的模型。我们期待这些新功能能够为用户带来更好的体验，同时也期待看到更多的创新和突破。

ChatGPT AI头条

TravAI:是一款AI驱动的旅行培训产品，提供交互式AI培训、模拟、评估和智能助手，为旅行行业人员提供最新的技能和知识。

TravAI是一款旅行行业的AI驱动培训产品，通过注入AI技术，为培训注入活力。它能创建引人入胜、交互式的培训课程，进行逼真的角色扮演模拟，并设计能够真正起作用的测验。同时，TravAI利用您的数据为旅行团队量身定制个性化学习体验，让培训不再是通用的、一刀切的。它是培训旅行业专业人员的更智能、更快速的方式。

旅行培训 AI

Nextminds:是一家提供在线辅导服务的平台，为所有科目和学术水平的学生提供个性化辅导。

Nextminds是一个提供在线辅导服务的平台，通过与经验丰富的导师在线互动，为学生提供个性化的学习经验。平台提供ICSE、CBSE和州委员会等多种教育体系的辅导。Nextminds的主要优点是学生可以在舒适的家中与专业的导师进行一对一的在线学习，为学生提供高质量的辅导服务。

在线辅导学习个性化

Pedagogue.io:每天花费10分钟，提升您的AI技能。

Pedagogue是一款AI技能培训平台，旨在帮助个人和企业提升AI技能。通过该平台，用户可以学习AI工具、技术和策略，并获得40%的生产力提升。Pedagogue的优势在于更新及时的内容库、个性化的技能培养、有趣的学习方式以及具有商业价值的数据驱动洞察。

AI 技能培训教育

LexiGym:你的语言学习伴侣。🚀 # #HinkouLabs

LexiGym是一款语言学习应用，帮助用户提升语言技能。它具有离线和多语言支持的创新功能，是最强大的语言学习伴侣。用户可以根据自己的预算选择免费使用或付费订阅，灵活选择学习方式。LexiGym还提供易于创建字典和智能学习等功能，以及详细的训练统计数据。

语言学习词汇训练多语言

Alevels.ai:A Levels AI是一个利用人工智能提高A Levels学习成绩的工具。

A Levels AI利用人工智能技术，提供个性化的学习计划和辅导资源，帮助学生在A Levels考试中取得优异成绩。它通过分析学生的学习情况和弱点，为其提供针对性的学习建议和练习题。A Levels AI还提供实时答疑和学习进度跟踪功能，帮助学生更好地掌握知识。

教育考试辅导人工智能

MailReply:是一款AI助手，可生成专业且人性化的邮件回复，节省时间。

MailReply通过AI生成邮件回复，帮助用户节省时间。它可以在保持人类写作风格的同时，根据邮件内容生成上下文相关的回复。MailReply适用于Windows和macOS，并兼容多种邮件客户端。

邮件回复 AI助手工具

Notification harbor:高性能团队的电子邮件营销平台

Notification harbor是一个为电子邮件营销团队提供AI优化的电子邮件内容和自动化流程的平台。通过使用LLM技术，我们可以在短短5分钟内创建高性能的电子邮件营销内容，并且随着时间的推移，产品甚至可以自我优化。我们的平台简化了电子邮件营销活动的方式，确保每个活动都能精准地与您的目标受众建立联系。AI生成的电子邮件模板根据您提供的信息和要求选择最合适的模板。实时个性化电子邮件可以提高用户参与度和转化率，并根据每个用户实时定制内容。AI驱动的电子邮件营销使您的团队在创建电子邮件模板和文本方面节省了60％的时间。

电子邮件电子邮件营销 AI优化

Magic Loops:通过结合ChatGPT自动化与代码，创建简单的自动化任务

Magic Loops是一种基于ChatGPT的自动化工具，可以连接数据、发送电子邮件、接收短信、爬取网站等功能。它能够帮助用户自动化生活中的各种任务，提高工作效率。Magic Loops的主要优点是可以与各种数据源和应用程序集成，轻松实现个性化的自动化需求。

自动化工具 ChatGPT

ReplyAuto:Reply Auto是一款AI邮件助手，能够根据上下文理解邮件内容，并提供智能回复。

Reply Auto是一款使用AI技术的邮件助手，它能够自动分析邮件内容，根据上下文提供智能回复。它的主要优点是提高工作效率，减轻用户的邮件负担，并能够个性化定制回复。Reply Auto定位于帮助用户更高效地处理电子邮件，提高工作效率。

邮件智能回复工作效率

Mailman Workcation:智能邮递员 - 自动化影响力的智能Twitter机器人

AI Mailman利用最新的人工智能技术创建世界上最准确的邮件，比人类更快速和高质量。它提供简单的用户界面，能够创建世界上最强大的邮件模板，打开率更高。使用AI Mailman创建的邮件打开率是其他方式的10倍，生成时间只需10秒。

邮件自动化影响力

Inpost:一款AI驱动的移动应用程序，可以改善个人电子邮件体验。

Inpost.ai是一款基于AI的移动应用程序，可以优化个人电子邮件体验。它帮助用户智能地组织和清理收件箱，专注于重要的电子邮件。它提供无缝的邮件交互，提供增强的安全性和独家功能。通过高级AI模型分析邮件内容，而不暴露用户的敏感信息。用户可以轻松追踪支出、管理发票，并利用促销优惠来优化个人预算。Inpost.ai还提供定制的收件箱分类，让用户能够个性化和高效地管理和优化收件箱。

电子邮件 AI 个人化

Leadog:AI驱动的冷邮件营销、线索跟踪和互动

Leadog.io是一款AI驱动的冷邮件营销平台，提供冷邮件发送、线索跟踪和互动等功能。它采用先进的AI技术来优化冷邮件营销策略，提供精确的邮件投递和跟踪，帮助用户更好地了解和转化潜在客户。

冷邮件线索跟踪营销工具

Prospect AI:一键查找网站上的电子邮件地址和联系人信息

Prospect AI是一款插件，可以帮助销售团队、数字营销人员和公关专业人员免费查找公司的联系人。它使用人工智能技术，快速获取所需的联系人信息，帮助用户拓展业务关系。

市场营销销售潜在客户

Email whisperer:写作完美邮件，让你的电子邮件沟通更上一层楼！

Email Whisperer是一个用于Gmail和Outlook的AI电子邮件编写工具。它可以帮助你轻松地写出完美的电子邮件，提供重新表达、拼写检查和修正功能。它能够提高你电子邮件的清晰度和风格，并确保邮件无错误。Email Whisperer是一个提高电子邮件写作效率的工具，让你的邮件专业而准确。

生产力电子邮件 AI工具

Humanize AI by AI Text Converter:将AI生成的文本转换为与人类写作相匹配的内容。

Humanize AI Text是一个免费在线的AI文本人性化转换工具，能够绕过AI检测，并将AI生成的文本转换为与人类写作相匹配的内容。

AI转换工具文本人性化 AI检测绕过

Happily.ai:使用，超越传统调查。我们的AI平台分析员工情绪，提供可操作的见解，为健康、投入、高绩效的团队提供支持。

Happily.ai是一个AI工具包，帮助人力资源和经理人通过无忧无虑的参与、认可和绩效管理来提高人才留存和团队生产力。

员工参与度人力资源绩效管理

ChatKPI:是一款基于AI的数据分析工具，可以通过文本消息跟踪销售趋势、识别热门产品、了解客户行为，提供图表、定制CSV等功能。

ChatKPI是一个AI数据分析工具，旨在帮助Shopify商家做出更明智的数据驱动决策。它可以提供实时洞察力，跟踪销售趋势，识别热门产品，了解客户行为，并通过自然语言对话提供个性化的商业洞察。ChatKPI可以通过文本消息或在Shopify商店内安装的应用程序使用。

数据分析销售趋势热门产品

Limodify.AI | Email Marketing Design Meets AI:Limodify.AI通过AI技术提供电子商务邮件创建服务。

Limodify.AI革新了电子商务邮件的创建过程，只需点击几下，选择格式，输入关键信息，即可在30秒内获得准备好发送的AI设计的邮件。节省时间，利用先进技术，精确实现您的营销目标。立即免费开始使用。

电子商务邮件营销 AI

PurplePro:使用AI技术，只需两个点击即可启动您的忠诚度俱乐部。

PurplePro是一个使用AI技术的插件，它可以帮助您在短短两个点击的时间内启动您的忠诚度俱乐部。PurplePro通过游戏化和动态的积分规则增加用户参与度，并奖励他们。它还提供了强大的推荐、挑战、问卷和可变奖励功能，帮助您将首次用户转化为忠实的客户。

忠诚度俱乐部用户参与度奖励

LISUTO:株式会社は、eコマースのセラーやマーケットプレイスが売上を増やし、時間を節約し、コアビジネスに集中できるスマートデータ構造化ソリューションのリーダーです。

LISUTO株式会社は、eコマースのセラーやマーケットプレイスが売上を増やし、時間を節約し、コアビジネスに集中できるスマートデータ構造化ソリューションのリーダーです。LISUTO AIは、AIタッガーやイメージタッガーなどのサービスを提供し、商品のタグ登録やナビゲーション改善などを自動化し、効率を向上させます。

NaturalSpeech 3：可克隆音色和感情的语音合成系统

今日大家都在搜的词：

热文

站长商机