150毫秒,这是ElevenLabs新模型把首字延迟压到的数字。对实时语音交互来说,这个数字意味着对话里几乎感觉不到等待。

ElevenLabs发布了全新架构的Eleven v4和v4 Turbo。v4支持在文本中直接嵌入笑声、耳语等导演标记和环境音效,同时增强了长音频的音色稳定性。Turbo版本则把语音延迟显著降低,目标直指实时语音交互体验。

导演标记:让配音有情绪

v4最直接的变化是情绪控制。用户可以在文本里加入导演标记,比如笑声、耳语,让配音的自然度和表现力更接近真人。细粒度的情绪表达,是这次升级的核心卖点。

长音频的音色稳定性也被增强。对需要长时间生成语音的场景来说,音色不漂移比单句好听更重要。

150毫秒意味着什么

Turbo版本把延迟压到约150毫秒。实时语音对话里,卡顿感往往来自延迟,这个数字直接对应体验的流畅度。

两个版本分工清晰:v4负责情绪和稳定性,v4 Turbo负责快。对做实时语音交互的开发者来说,选择取决于场景更看重表现力还是响应速度。