打开网易新闻 查看精彩图片

新智元报道

打开网易新闻 查看精彩图片

日产7.5万首,播放却不到3%。

这是流媒体平台Deezer最新披露的一组数据。AI歌曲每天涌入平台的速度,从2025年初的1万首飙升到如今的7.5万首,占当日新增上传的44%。但实际播放占比,只有1%-3%。

产能炸了,产品却过不了人耳这一关。

尤其是在中文世界,这个矛盾更加尖锐。全球最顶级的AI音乐公司Suno,估值54亿美元,做英文歌确实能打。

但做中文歌?也很抱歉。

咬字发飘、情绪悬浮、转音别扭,用户甚至总结出了一套绕路技巧,把复杂中文字换成拼音,才能让模型生成出勉强准确的发音。

我们的母语,反而成了AI音乐最不擅长的语言。

这背后不是模型「调得不够好」,而是一道架构题。

为什么中文歌这么难?

英语是重音节奏语言。一个单词的重音往哪砸,节奏就跟着走。Be-YOU-ti-ful,重音在第二个音节,整句话的韵律就围绕这个重心展开。

中文是声调语言。一个「妈」和一个「马」,音高走势完全不同。字音对齐、音节边界、声调在连续语流里的变化,跟英语根本不是一套系统。

当前绝大多数通用音乐模型,底座都建立在英语语料体系之上。它们理解不了中文里那些微妙的声调变化、气声控制和语感节奏。这不是多加几轮微调就能补齐的表层问题,而是从训练数据到模型架构到优化目标,整个链路都需要重新设计。

于是,一条路摆在面前:要么在英语底座上继续打补丁,永远差着那种味道。要么从底层重新训练,把中文语境的「味道」写进模型骨子里。

音潮团队选了后者。

连续两年WAIC主题曲,不是运气

在拆解音潮大模型之前,先说件更能说明问题的事。

2025年和2026年,WAIC世界人工智能大会的官方主题曲,都出自它之手。2025年《AI For Good》,2026年《共创未来》,全程靠自研的音潮大模型独立完成词曲、编曲、演唱全流程创作。

WAIC的官方主题曲筛选相当严格,每年竞标团队卧虎藏龙。能中选一次已经是实力证明,连续两年卫冕,含金量不必多说。

2025年《AI For Good》刚出来的时候,就打破了不少人的刻板印象。以往科技向配乐,大多逃不开厚重宏大、迷幻电子的套路,冰冷、严肃、距离感十足。但这首纯AI制作的曲子,走的是清爽青春路线,温柔又有力量,也让业内第一次注意到:国产AI音乐,也能兼顾科技感和人情味。

时隔一年,迭代升级后的音潮大模型带来的《共创未来》,进步更是肉眼可见。曲风上刻意避开了科技展会的流水线配乐风格,选择了阳光朝气的科技流行摇滚。最加分的是它的双语设计,中文侧重温情、坚守与陪伴,细腻接地气。

英文聚焦探索、突破、全球连接,格局拉得很开。

两种语言衔接自然,又不割裂,既悄悄秀了把自家模型的能力,又藏着「科技无国界」的内核,适配WAIC的全球舞台,细节处理相当成熟。

但真正让圈内人坐直的,不是歌曲本身,而是它背后的制作方式。

传统模式,顶级行业盛会的官方主题曲,整套流程走下来至少两三个月,百万级预算是常态。一旦甲方不满意需要推翻调整,返工成本高到离谱,容错率极低。

音潮团队用模型能力,直接把这套传统流程压缩到了一个下午。依托音潮大模型的批量创作能力,团队根据WAIC的大会主题、风格调性和核心诉求,批量生成上百首高质量原创备选曲目,然后优中选优、逐句精雕细琢,最终敲定《共创未来》。

周期、成本、创意上限,三重维度全面突破。

音潮大模型V4.0,从底层开始重构

8月14日,音潮大模型V4.0正式发布。

打开网易新闻 查看精彩图片

先说结论:这不是一次版本微调,而是底层架构的全方位重构。V3.5到V4.0的跨越,不是在旧模型上打补丁,而是从底座重新训练。

核心变化集中在三个维度,指令理解、情绪落地、曲风细分。

这三个词听起来像产品功能,实际上是三个完全不同层级的技术挑战。

第一层:指令理解,从「猜你想要」到「懂你所想」

日常创作中,人们输入的提示词大多是碎片化、口语化、带情绪的,「想写一首深夜emo的歌」「要那种慵懒的调调」「来点治愈的」。旧版模型很容易机械套用参数,无法结合上下文融会贯通,最终成品自然偏离预期。

V4.0做的,是把这种「模糊的、感性的」输入,翻译成模型能精准执行的内部表征。不再机械执行你的文字,而是真正读懂文字背后的画面与情绪。

打开网易新闻 查看精彩图片

实测对比最直观。用中文提示词测试:「一首深夜emo的中文歌,慵懒女声,带点爵士味道,想那种雨夜一个人走在街上的感觉」。

V3.5勉强识别出「伤感」的基调,但人声生硬、咬字发飘,慵懒和爵士几乎没体现,情绪和曲风完全脱节。也就是大家常吐槽的「差一口气」。

V4.0精准锁定了「深夜、emo、慵懒、爵士」四个核心关键词,女声气息绵长、咬字细腻,爵士钢琴的即兴感自然铺开,「雨夜独走」的画面感被完整翻译成了声音。

两代模型之间的差距不是「好一点」,而是跨越式的。

第二层:情绪落地,伤感不是一种参数

同一句歌词,伤感和热血,气息、力度、音色完全不同。

想要区分开来,模型就得真正理解「情绪」在音乐里怎么运作。这不是一个参数够不够大的问题,是模型能不能理解一种文化里的情绪逻辑、能不能对齐一群人的审美偏好的问题。

这恰恰是海外模型的结构性盲区。Suno的英文歌情绪表达可以做到细腻,但中文歌的「味道」只能说一言难尽,它理解不了那种细腻的咬字、绵长的气声、情绪在字里行间的流转。说白了,因为它的训练数据里没有足够多的中文语境。

音潮从第一天就把中文语境作为核心优化目标,V4.0的底层重构让这种优化不再是「修修补补」,而是从模型架构层面就针对中文的声调、语感、气声做了专门设计。

实测对比更能说明问题。同一个中文提示词,V3.5生成的歌声咬字僵硬、气声断续,情绪像是贴上去的;V4.0的咬字和气息自然流畅,情绪在字里行间流转,听着像「从里面长出来的」。区别不在音质,在活人感。

第三层:曲风细分,不只「蓝调」这么简单

「蓝调」这个词,在AI音乐里其实有着非常具体的含义差异。

V3.5输出的蓝调偏向大众化流水线风格,没有凸显曲风特色。V4.0精准还原了经典十二小节正统布鲁斯结构,完美适配慵懒松弛的人声质感,风格纯度和细节把控远超旧版。

当提示中出现多种乐器时,差距更明显。「一首忧郁、感性、温暖的韩国流行歌曲,融合原声吉他、电钢琴与大提琴」,V3.5中,原声吉他、大提琴这些核心配器被严重弱化,乐器层次模糊。V4.0精准拿捏每一种乐器的音色特质,吉他的温润、大提琴的深情清晰突出,多乐器融合自然和谐。

三层跃迁叠加,V4.0不再是一个更好的AI音乐工具,而是一个懂音乐的AI。

算力国产化,走通了一条无人经过的路

技术实力和落地成果是硬通货。但音潮团队有一条更深层的差异化路线,算法和算力的双重国产化。

音潮大模型全程依托壁仞国产GPU完成训练与迭代,彻底摆脱了对海外算力的依赖。

打开网易新闻 查看精彩图片

这件事的意义,远不止于情怀。

当前,算力供应链的稳定性已经成为所有AI公司必须面对的现实问题。一家AI公司如果从训练到推理都依赖海外GPU,那它的技术路线、迭代节奏甚至产品定价,都存在风险。

音潮团队从第一天起就选择了国产算力,这意味着它对技术路线的掌控力更强,迭代节奏不受制于人,长期成本也更可控。

更重要的是,在国产GPU上训练出能够对标Suno的模型,本身就是对国产算力可用性的一次验证。放眼整个AI音乐赛道,能做到算法+算力双重国产化的,目前只有音潮大模型一家。这不是一个细分优势,而是一个结构性壁垒。

当别人还在为算力供应链的波动焦虑时,音潮团队已经把国产算力从能用跑到了能打。算法和算力都掌握在自己手里,国产AI音乐才真正拥有了不受制于人的底气。

产品矩阵:四线齐头并进

技术底座有了,产品落地才是硬道理。

音潮APP面向普通用户,主打轻量化即时创作,最快15秒出旋律、一分钟生成带完整人声的成品原创歌曲。目前平台已有百万用户,日均产出上万首原创音乐。

音潮Studio面向专业音乐人,提供高可控、高精度的创作工作台,支持自定义曲风权重、调节创意随机度、拆分段落精细微调,相当于24小时在线的专属编曲助理。

Hitto面向海外市场,以对话式写歌的新玩法布局全球,海外口碑相当不错,不久后将登陆国内,也是音潮对标Suno、布局全球市场的关键一步。

API平台面向企业和开发者,提供标准化接口,集齐歌词生成、歌曲生成、歌曲仿写、歌曲扩写四大核心能力。目前正处于限时免费试用阶段,所有意向合作企业与开发者完成对接接入后,即可免费调用全量API接口。

V4.0上线后,还解锁了两个此前国产AI音乐一直缺失的能力:10语种全覆盖(新增俄、德、葡、意、法五大语种)和纯音乐生成全面开放(此前仅面向B端商用客户)。

C端产品+专业工具+出海+B端,四条线同时推进。不是只靠一首主题曲出圈,而是真正跑通了从技术到产品到商业的闭环。

打开网易新闻 查看精彩图片

中国AI音乐的全栈时刻

不止WAIC,2025年乌镇互联网大会、阿里云栖大会等多个顶流峰会的主题曲都出自音潮之手。模型经过多轮迭代升级,拿下了国际音乐AI赛事全球亚军,技术实力兼具国产化价值与全球认可度。

团队配置也很有意思。算法技术团队和科班音乐人跨界搭配,程序员深耕乐理、吃透音乐逻辑,音乐人深度参与模型迭代,这种组合有效避开了很多AI音乐「旋律还行、毫无灵魂」的通病。

CEO姜涛早年深耕音频技术大厂,最初做AI音乐的初衷甚至带点浪漫色彩,想给妻子做一首专属纪念歌曲,却发现传统音乐制作成本动辄上万、周期数周,对普通人来说门槛太高了,由此萌生搭建普惠AI音乐工具的想法。

从技术到产品到商业,从算法到算力,从C端到B端,从国内到海外,音潮走出了一条完全不同于Suno的路线。

Suno的模式是在英语底座上做到极致,然后向全球扩展。

但中文世界的品味,永远不是英语底座能自然覆盖的。

音潮的模式是从中文语境出发,把本土化做到极致,然后带着这份深度向全球扩展。

音潮大模型V4.0的10语种全覆盖,证明了这条路走得通,不是「只会做中文歌」,而是「从中文出发,做到全球都能打」。

当AI音乐的制高点,正在从「谁生成得更好」转移到「谁更懂听众」,一条从底层自研、从本土出发、从算法到算力全栈自主的路线,可能才是中国AI音乐站上全球舞台的真正底气。

打开网易新闻 查看精彩图片

注:音潮V4.0已于8月14日全平台上线,音潮APP、音潮Studio、Hitto及API平台同步更新。API平台目前处于限时免费试用阶段,所有意向合作企业与开发者完成对接接入后,即可免费调用全量API接口。

参考资料:

音潮API平台:https://platform.yinchaoyongxian.com/

音潮AI音乐创作平台:www.yinchaoyongxian.com

编辑:所罗门