170毫秒。这是VoxWeft在M5 MacBook上输出第一段译音的时间。开发者@HenryZ30734018把一套开源同声传译系统做成了完全本地运行的东西,音频不出设备。

它基于VoxCPM2,用的是MLX实现。现场语音进去,翻译后的语音出来,全程在Apple Silicon上完成。没有云端往返,没有上传等待,音频隐私和响应速度被同时保住。

打开网易新闻 查看精彩图片

四个硬指标,逐条看

第一,延迟。VoxCPM2在M5 MacBook上流式输出首段音频约170毫秒。这个数字决定了同传能不能跟上说话人的节奏,而不是等一句话说完再翻译。

第二,语种。系统可生成30种语言的语音,支持直接的语言对互译,不需要经过中间语言中转。中转会带来二次误差和额外延迟,直接配对绕开了这一层。

第三,音色。从约5秒的参考音频里克隆目标声音,让整段翻译保持同一个音色。同传场景里,声音忽男忽女忽机械,听感会直接崩掉,音色一致性是体验底线。

第四,算力。跑在MLX上的4-bit量化版本,让低延迟的本地语音生成在Apple Silicon上变得实际可用。量化是本地跑得动的关键前提,否则模型体积和推理开销会把延迟拉回去。

它想证明的不只是能出声

VoxWeft展示的是VoxCPM2作为完整实时应用语音层的可能性。它不只是产出音频,而是让私密的多语言交互留在设备上完成。

这个定位值得琢磨。同声传译过去是云服务的典型场景:算力重、模型大、延迟敏感,本地跑几乎是奢望。现在一套开源系统把它压到了笔记本芯片上,且不牺牲语种数量和音色质量。

对开发者来说,可复用的部分很清晰:MLX实现、4-bit量化、流式首包延迟控制、参考音频克隆。这些模块拆出来,能拼进会议记录、直播字幕、跨境客服、无障碍沟通等任何需要实时语音转换的场景。

项目已在GitHub开源,VoxCPM2模型发布在Hugging Face的openbmb仓库下。想验证170毫秒和30种语言这两个数字的人,可以直接拉下来在自己的Mac上跑一遍。