Shijia Liao曾经是英伟达的一名视频研究员,也是一位痴迷日本动漫的开发者。几年前,他宅在家里的卧室里,受够了早期AI语音那种呆板、毫无起伏的机器人腔。在他眼里,那些合成声音根本配不上动漫里充满情绪的角色。于是他决定自己动手——用卧室里笔记本电脑上那块单GPU,开始训练自己的语音AI模型。
这个周末项目很快有了名字:Fish Speech。一个开源文本转语音与声音克隆项目,在GitHub上像野火一样传开,吸引了独立开发者、内容创作者和游戏设计师。他们想要的,是更生动、更有表现力的语音生成工具。Fish Speech获得了超过31000颗星,也直接催生了今天的Fish Audio(公司注册名Hanabi AI Inc.)。
从2023年推出到现在,Fish Audio已经变成业界最全面的语音AI平台之一。开发者用它快速搭建文本转语音、语音克隆系统,甚至构建语音智能体。它最大的不同在于针对早期AI语音“无生命感”的设计思路:平台内置超过15000条自然语言提示,提供词级情感控制,允许开发者精细调节合成语音的语气、语调和节奏。不再是平铺直叙的念白,而是带上喜怒哀乐的说话方式。
它的性能同样硬核。据官方数据,只需5秒音频片段,不到15秒就能完成声音克隆;原生支持83种语言。在一次盲听测试中,67%的听者更偏爱Fish Audio的语音输出,超过了它的主要竞争对手。这样的表现也反映在商业数据上:全球用户已超过800万,年度经常性收入超过2100万美元。
今天,Fish Audio宣布完成5200万美元种子轮融资,由Coreline Ventures和今日资本领投,359 Capital、Play Time、HF0、645 Ventures、Parable、Carya Venture Partners、Alphalist Partners以及多位未公开天使投资人跟投。这笔资金将用于把语音打造成每一个AI模型的默认交互界面。最初瞄准游戏和内容创作的Fish Audio,现在也开始向受监管行业渗透,把富有情感的语音能力带到更严肃的产业场景里。
热门跟贴