中国首个音乐SOTA模型「天工音乐大模型」今日公测

2024-04-17 11:47 · 稿源：站长之家用户

2024年4月17日，在「天工」大模型一周年之际，昆仑万维重磅宣布，「天工3.0」基座大模型与「天工SkyMusic」音乐大模型正式开启公测!一年前的今天，第一版天工大模型正式对外发布上线，一年来我们不断迭代模型，迭代应用产品，模型和应用都越做越好，以此回报广大用户的支持。

「天工3.0」拥有4000亿参数，超越了3140亿参数的Grok-1，是全球最大的开源MoE大模型。「天工3.0」在语义理解、逻辑推理、通用性、泛化性、不确定性知识、学习能力等领域拥有突破性的性能提升，数学/推理/代码/文创能力提升超过30%。

（天工3.0模型参数超越Grok-1，成全球最大开源MoE专家混合大模型）

强大的模型技术实力赋予「天工3.0」超强的性能表现。在MMBench等多项权威多模态测评结果中，「天工3.0」超越GPT-4V，全球领先。

（天工3.0多模态性能超越GPT-4V，全球领先）

同时，「天工3.0」旗下的「天工SkyMusic」音乐大模型也在今日面向全社会开放公测。「天工SkyMusic」是中国首个音乐SOTA模型，更是中国的自研大模型技术第一次在AIGC领域领跑全球。

（天工SkyMusic综合性能超越Suno V3，取得音乐大模型SOTA，领跑全球）

天工SkyMusic:中国首个音乐AIGC SOTA模型

此前，大模型已经在文本、图像等多个技术领域取得突破，带来产业全面变革。然而，在AI音乐生成领域，全球迟迟等不到一款产品，开启「音乐ChatGPT时刻」。

这是因为一直以来，AI音乐行业大量研究都集中在符号音乐生成技术路线上，并且大多只能实现无人声背景音乐（Background Music，BGM）的生成，音乐的质量、效果、审美都远远达不到可用水平，产业迟迟未能爆发。

（「天工SkyMusic」自研AI音乐大模型技术架构）

与行业主流路径不同，「天工SkyMusic」采用自研大模型音乐音频生成技术路线。这一路线直接通过大模型技术实现乐器、人声、旋律、音量、音符的一体化端到端音乐生成，技术难度极大，全球只有包括昆仑万维在内的极少数顶尖玩家参与。

在与海外顶尖的AI音乐大模型Suno V3的横向测评中，「天工SkyMusic」在人声&BGM音质、人声自然度、发音可懂度等领域显著领先对手，并以6.65分的综合得分超越Suno V3，成为全球AI音乐SOTA模型。

此外，「天工SkyMusic」还拥有独创的参考音乐生成与方言歌曲生成能力。

参考音乐生成:用户可上传自有参考音乐，或选择「天工SkyMusic」资料库中现有的参考音乐，从而生成风格、唱腔类似的歌曲，进一步降低音乐大模型的使用门槛，让不熟悉乐理知识的用户也能轻松玩转。

方言歌曲生成:「天工SkyMusic」生成的音乐不仅在人声自然度、发声可懂度等领域表现优秀，更能够支持粤语、成都话、北京话等众多方言，让用户能够更自由地实现音乐表达，传播方言文化。

「天工SkyMusic」是中国首个公开可用的AI音乐生成模型，更是中国自研大模型技术第一次在AIGC领域领跑全球。

当前，在文本大模型领域，OpenAI吸引了全球的注意力;但是在AI搜索、AI音乐生成等细分领域，中国玩家们正在奋勇前行，不断通过自研技术取得细分领域顶尖的SOTA表现，共同建设中国大模型产业，打造自主可控的大模型产业生态。

天工3.0:4000亿参数，全球最大开源MoE大模型

在上一代「天工2.0」MoE大模型的领先基础上，「天工3.0」实现了全面的性能升级，采用了4000亿级参数MoE混合专家模型架构，是目前全球模型参数最大、性能最强的开源MoE模型。

「天工3.0」的逻辑推理能力、语义理解能力、应对复杂需求能力、内容创作能力全面升级，并新增了多轮搜索与综合工具调用、图表绘制、研究模式、增强模式、改图扩图等多项AI能力，为用户带来全新AI体验。

多轮搜索与综合工具调用:「天工3.0」针对模型独立规划、调用、组合外部工具及整合信息的能力进行了专项训练，使其能够独立生成并调用代码，完成包括产业研究、产品横评、信息分析、图片生成、图表绘制等多种复杂用户需求。

同时，「天工3.0」能够通过强大的语义理解能力将用户任务拆解成细分环节，实时判断是否需要联网或调用工具，进行单轮或多轮的联网搜索、工具调用，完成包括多轮搜索、热点信息分析、图片生成等复杂用户需求。

（Query:查询最新中国历史电影票房排行，图表展示）

图表绘制:「天工3.0」全面提高了逻辑推理能力与用户自然语言Query的理解能力，使其能够更精准地判断用户需求，独立生成并调用代码，结合文本需求实时进行内容分析及图表构建，为用户带来更直观、高效的对比结果。

（Query:北京、上海、重庆哪个好玩?）

多轮搜索、综合工具调用、图表绘制等都是「天工3.0」所独有的大模型综合能力，其从底层打通了「天工3.0」的AI搜索、AI对话、AI代码生成、AI图片识别、AI图像生成等底层能力，通过语义识别能力直接触发，为用户带来更加便捷、高效的AI体验，成为真正的AI生产力工具。

此外，「天工3.0」中还增加了研究模式、增强模式、改图扩图等多项AI能力。

研究模式:在研究模式中，「天工3.0」能够围绕用户的某个简单指令进行相关问题的延伸，自动生成研究大纲、图谱、实践总结、思维导图，帮助用户快速清晰地把握核心内容，完成用户复杂的研究需求。

（Query:康乾盛世年代）

增强模式:在增强模式中，「天工3.0」能够针对用户的复杂Query进行拆解、细化、并进行追问、信息理解与补全，使其在自然语义理解方面性能更强，面对不确定性知识时表现更好，能够更精准、高效地满足用户需求。

（Query:2024年春节档电影;「天工3.0」理解并追问用户需求）

改图扩图:「天工3.0」多模态性能取得全面突破，超越GPT-4V，综合排名全球第一。在强大的技术底座支持下，「天工3.0」的AI绘图能力新增了图片尺寸扩展、图片定向调整、垫图生图、垫图进化、垫图扩图等全新功能。

（「天工3.0」的AI改图、修图、扩图等功能）

关于昆仑万维

自去年4月17日「天工」大模型正式推出以来，昆仑万维已围绕「天工」系列大模型建起AI大模型、AI搜索、AI音乐、AI视频、AI社交、AI游戏等AI业务矩阵，是国内模型技术与工程能力最强、布局最全面的人工智能科技企业之一。

这一年里，除了对「天工」系列基座大模型进行不断升级迭代，昆仑万维还推出了国内第一款AI搜索引擎「天工AI搜索」、开源了百亿级大语言模型「天工Skywork-13B」、推出国内领先的AI Agent开发平台「天工SkyAgents」等一系列前沿大模型产品。

当前，「天工」系列大模型已集成了AI音乐、AI搜索、AI写作、AI长文本阅读、AI画图、AI语音合成、AI漫画创作、AI图片识别、AI代码写作、AI表格生成等多项能力，并将在未来加入AI视频功能，对标“超级应用”，成为人工智能时代的“超级大模型”（Super Model）。在“实现通用人工智能，让每个人更好地塑造和表达自我”的公司使命驱动下，昆仑万维将始终致力于AI技术与产品的创新开拓，不断提高AI产品的用户体验，与用户、研究人员、开发者们携手，共创国产大模型的未来。

（推广）

特别声明：以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布，本平台仅提供信息存储服务，对本页面内容所引致的错误、不确或遗漏，概不负任何法律责任，相关信息仅供参考。站长之家将尽力确保所提供信息的准确性及可靠性，但不保证有关资料的准确性及可靠性，读者在使用前请进一步核实，并对任何自主决定的行为负责。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时，可及时向站长之家提出书面权利通知或不实情况说明，并提供身份证明、权属证明及详细侵权或不实情况证明（点击查看反馈联系地址）。本网站在收到上述法律文件后，将会依法依规核实信息，沟通删除相关内容或断开相关链接。

相关推荐

关键词：

荐AI日报：美图RoboNeo上线首月MAU破百万；影视级音画同步模型Gaga AI发布；vivo蓝心3B端侧大模型发布

本文汇总AI领域最新动态：美图通过组织变革推动AI应用RoboNeo月活破百万；vivo发布蓝心3B端侧大模型，性能超越8B模型；Gaga AI实现静态照片生成60秒电影级视频；ChatGPT周活用户突破8亿；Figma引入Gemini模型提升设计效率；印度试点AI聊天机器人购物；Figure AI推出第三代家用机器人Figure 03；谷歌推出Gemini Enterprise自动化工作流平台。显示AI正从工具向创作者跃升，加速渗透各行业。

AI原生美图RoboNeo MAU破百万
荐AI日报：蚂蚁开源高性能思考模型Ring-flash-2.0；通义7款模型屠榜Hugging Face；Veo3视觉能力升级

蚂蚁百灵团队开源高性能思考模型Ring-flash-2.0，在多项基准测试中表现优异；阿里通义7款模型登顶Hugging Face榜单，Qwen3-Omni凭借多模态能力全球第一。谷歌Veo3突破视频生成局限，可自动完成视觉任务；特斯拉推进人形机器人量产，马斯克称其为最重要产品。马斯克第六次起诉OpenAI窃取商业机密，苹果内部测试聊天机器人Veritas优化Siri，YouTube推出AI音乐主播增强互动，LiquidAI发布轻量级模型Liquid Nanos优化边缘计算。

AI 开源模型高性能思考模型
荐没想到，音频大模型开源最彻底的，居然是小红书

不难发现，近几个月，开源频频成为 AI 社区热议的焦点。尤其是对于国内科技公司来说，开源成为主旋律。根据 Hugging Face 中文 AI 模型与资源社区的数据显示，国内厂商在七八月接连开源33款、31款各类型大模型。这些开源成果大多落在了文本、图像、视频、推理、智能体以及世界模型领域，而音频生成占比很小。

开源 AI社区音频生成
GEO排名查询工具推荐:霸屏AI大模型答案的核心方法，做好AI大模型排名优化

随着AI大模型成为用户获取信息的主要入口，AIBase推出GEO排名查询工具，帮助品牌监测在豆包、DeepSeek、文心一言等主流AI平台中的曝光情况。该工具支持多平台检测、关键词追踪、可视化数据展示，可精准分析品牌是否被推荐、出现频次及具体场景，为制定AI大模型排名优化策略提供数据支撑。在GEO时代，抢占AI回答推荐位意味着获得全新流量入口。

AI大模型 GEO排名查询生成引擎优化
荐AI日报：腾讯重磅发布混元图像3.0；快手发布KAT系列Agentic Coding大模型；苹果悄然研发ChatGPT式应用

快手发布KAT系列代码大模型，腾讯推出“混元图像3.0”实现多模态突破，苹果研发类ChatGPT应用升级Siri，谷歌更新Gemini 2.5 Flash Lite提升效率。苹果还推出Manzano图像模型，YouTube Music测试AI音乐主播功能，VideoFrom3D框架简化3D视频生成，Moondream 3.0在多项基准测试中超越GPT-5等顶尖模型，展现强大性能。

AI日报快手KAT系列大模型
云天励飞“算力积木”联手OISA，突破万亿级MoE大模型推理集群的Scale up瓶颈

云天励飞近日加入OISA生态，携手产业伙伴共建国产AI芯片互联体系，为中国算力生态注入新动力。OISA是中国移动提出的开放互联标准体系，旨在打造全向、对等、智能的互联新范式，解决智算集群内存互访难题，为大规模并行计算提供技术基石。云天励飞凭借在AI芯片与算力架构的长期积累，将依托“算力积木”架构的模块化优势，在大规模推理集群中实现高效互联，助力突破万级MoE大模型推理瓶颈，推动国产算力生态发展。

云天励飞 OISA生态 AI芯片互联
易鑫发布Agentic大模型，破解汽车金融风控与效率痛点

9月12日，易鑫集团在“IT Value Summit数字价值年会”上入选“2025创新场景年度AI应用TOP榜”，成为汽车金融科技领域唯一上榜企业。首席科技官贾志峰指出，易鑫以AI为核心驱动力，通过自研大模型“智鑫多维”等技术，显著提升风控水平与融资通过率，推动行业智能化转型。平台已连接全国4.2万家经销商及上百家金融机构，服务覆盖牧民、基层员工等多元群体，体现技术普惠价值。未来将持续加大科技创新投入，深化国内普惠金融服务，并探索技术出海，助力全球汽车金融行业迈向更高水平智能化。此次上榜不仅是对其技术实力的认可，更反映出行业正加速拥抱智能化变革。

AI应用汽车金融金融科技
荐AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型；Claude Sonnet4.5发布

本期AI日报聚焦多项技术突破：DeepSeek发布V3.2-exp模型，通过稀疏注意力机制降低API成本50%；Anthropic推出Claude Sonnet 4.5，在编码任务表现卓越；ChatGPT新增即时结账功能，实现对话界面直接购物；OpenAI将推出AI版TikTok，所有内容由Sora2模型生成；百度地图升级小度想想2.0，提供智能出行服务；蚂蚁集团开源万亿参数模型Ring-1T-preview；DeepMind提出“帧链”概念，推动视频模型实现全面�

AI DeepSeek 稀疏注意力
深度解读丨悠然无界大模型BLM-1.0：跨空间、跨任务与跨本体泛化的里程碑

9月28日，悠然大模型BLM-1.0完成迭代升级并全面开源。该模型突破数字与物理世界壁垒，实现跨空间迁移、跨任务学习与跨本体泛化能力，以统一模型覆盖多种机器人平台。在空间理解、推理与执行评估中综合超越同规模SOTA方法，支持工业制造、智慧城市等场景应用，推动空间智能生态共建。

悠然无界大模型 BLM-1.0 开源模型权重
考拉悠然开源悠然无界大模型BLM-1.0，以空间智能引擎驱动产业变革

9月28日，在成都举行的“2025天府人工智能产业生态大会”上，考拉悠然宣布其自主研发的“悠然无界大模型BLM-1.0”完成迭代升级并全面开源，同时发布基于该模型的UU Holo Glass O1 AR工业眼镜。此举标志着公司以“技术开源+场景落地”双轮驱动策略，推动空间智能产业生态共建。BLM-1.0突破传统模型局限，具备跨空间、跨任务、跨本体的“三跨”统一能力，在空间理解、推理与执行三大核心能力上刷新行业纪录。配套AR眼镜深度融合空间感知与多模态交互，实现工业运维、安装巡检等场景的全程自动化与智能辅助，显著提升效率并降低成本。

人工智能开源大模型空间智能

今日大家都在搜的词：

热文

3 天
7天

中国首个音乐SOTA模型「天工音乐大模型」今日公测

荐AI日报：美图RoboNeo上线首月MAU破百万；影视级音画同步模型Gaga AI发布；vivo蓝心3B端侧大模型发布

荐AI日报：蚂蚁开源高性能思考模型Ring-flash-2.0；通义7款模型屠榜Hugging Face；Veo3视觉能力升级

荐没想到，音频大模型开源最彻底的，居然是小红书

GEO排名查询工具推荐:霸屏AI大模型答案的核心方法，做好AI大模型排名优化

荐AI日报：腾讯重磅发布混元图像3.0；快手发布KAT系列Agentic Coding大模型；苹果悄然研发ChatGPT式应用

云天励飞“算力积木”联手OISA，突破万亿级MoE大模型推理集群的Scale up瓶颈

易鑫发布Agentic大模型，破解汽车金融风控与效率痛点

荐AI日报：豆包大模型1.6-vision发布；DeepSeek发布V3.2-exp模型；Claude Sonnet4.5发布

深度解读丨悠然无界大模型BLM-1.0：跨空间、跨任务与跨本体泛化的里程碑

考拉悠然开源悠然无界大模型BLM-1.0，以空间智能引擎驱动产业变革

今日大家都在搜的词：

热文

微信又更新了撤回消息有大变化：可撤回本次发送的全部消息

AI日报：Veo 3.1可生成1分钟视频；蚂蚁发布万亿参数语言模型 L

雷军：小米17系列首销权益延续至10月31日

京东双11今晚开启：现货开卖官方直降低至一折

iQOO 15官宣：10月20日发布

三星W26折叠屏手机官宣10月11日发布

新款智界R7/S7上市44天大定破38000台

荣耀Magic8系列暨MagicOS10发布会定档10月15日

iQOO 15搭载自研电竞芯片Q3 能效提升40%

真我官宣与理光达成影像战略合作：真我GT8 Pro首发搭载

微信又更新了撤回消息有大变化：可撤回本次发送的全部消息

AI日报：Veo 3.1可生成1分钟视频；蚂蚁发布万亿参数语言模型 L

比特币价格突破12.5万美元刷新历史最高纪录

雷军：小米17系列首销权益延续至10月31日

京东双11今晚开启：现货开卖官方直降低至一折

腾讯混元图像3.0登顶LMArena榜一

雷军：小米17系列开售仅5天销量破100万台

小米 17 标准版1TB版本 5299 元开售全系列销量同比增超20%

iQOO 15官宣：10月20日发布

三星W26折叠屏手机官宣10月11日发布

站长商机