一、声音从哪来
做会议终端、桌面音箱、云台摄像机或服务机器人,都会碰到同一个问题:设备能听清,但不知道声音从哪来。降噪、去混响、回声消除这些音频前端能力已经相当成熟,可一旦需要摄像头转向、设备转身,或者只对某个方向拾音,就必须先拿到说话人的方位。过去的选项都不轻松——自己推导方向要投入信号处理研发,交给独立算力平台会增加成本和系统复杂度,放弃方向能力又只能用机械结构或人工干预替代。乐鑫近期发布的 ESP APA DOA 组件,正是为了补上这一环。它属于乐鑫新推出的 ESP-APA 端侧音频算法组件集合,该集合采用模块化设计、按需集成并对外提供标准化 API,声源定向 DOA 是其中首个公开发布的组件。组件支持两路、三路、四路麦克风阵列,音频输入支持交织与平面两种格式,可直接对接 ESP-SR、AFE 等音频前端,便于与既有降噪、波束形成、语音识别算法串联。支持的芯片覆盖 ESP32、ESP32-C3、ESP32-C5、ESP32-C6、ESP32-C61、ESP32-S3、ESP32-S31 与 ESP32-P4 共八款。官方还提供了在开发板上运行的实时采集示例,两路麦克风即可复现完整链路。
二、方向怎么算
组件的工作原理是到达时间差加几何解算。声音从某个方向传来时,到达不同麦克风的时间存在细微差异,引擎通过互相关分析测出各通道之间的时延,再结合每颗麦克风在板上的坐标反推声源的水平角度,几何关系越充分,解算越可靠。为保证输出可用,内部设置了三重门限:信号电平过低直接拒绝,互相关峰值不够突出同样被拒,三路及以上阵列还会校验几何拟合残差,确认解算结果与阵列几何自洽。三重门限全部通过,结果才被标记为有效,并附带 0 至 10 的质量评分,上层可据此再收紧条件。角度参考系是全篇最需要先统一的地方:原点取阵列中心,正前方为 0 度,方位角顺时针递增,90 度对应右侧,180 度对应后方,270 度对应左侧。如果这一层参考系与产品的结构朝向不一致,后面所有转向与取景逻辑都会跟着偏,建议在硬件定义阶段就把它写进规格。
三、阵列怎么摆
能测多大范围,取决于阵列怎么摆。组件内置四种布局宏,参数都是相邻麦克风间距:两麦共线只能输出 0 至 180 度,原因是它无法区分前后镜像;三麦等边三角形、四麦正方形与四麦长方形都能输出完整的 360 度。间距越大,角度分辨率通常越好,这需要与结构开孔位置一并考虑。形状不规则的板子,可以逐颗填写麦克风坐标,组件会自行构建配对几何并识别共线情况。有一条硬约束必须记住:第 i 路音频通道必须来自坐标数组第 i 项所描述的那颗物理麦克风。实际接线顺序与几何逻辑顺序不一致时,要在采集路径里重排后再填坐标,不能只改坐标数组,否则方位角会系统性出错。若音频前端输出的是含参考通道与噪声通道的混合槽位流,可以用配套的数据布局组件剔除无关数据,但它只丢弃槽位,不重排通道。选型时不妨先问三个问题:需不需要区分前后、产品结构是否允许 360 度开孔、板面留给阵列的尺寸有多大。答案基本就决定了两麦还是三麦、四麦。
四、性能与选型
资源开销是这套方案最实际的优势。以 ESP32-S3 在 240 兆赫兹主频、16 千赫兹采样条件下实测为例,两麦配置占用约 23KB 堆内存、CPU 约 3.8%,三麦约 26KB、约 6.3%,四麦约 30KB、约 10.3%;放宽解算频率后四麦可降到 5.7% 左右。精度方面,理想平面波条件下两麦平均绝对误差约 0.3 度,三麦与四麦在 0.1 度上下,方位角刷新延迟典型值在 16 至 64 毫秒之间。也就是说,方向估计可以与网络协议栈、语音识别、本地自动化逻辑共存于同一颗芯片,不必另外增加处理器。组件还提供经济、均衡、灵敏三档预设,用于在跟踪速度与算力之间取舍;所有接口都不是中断安全的,同一句柄也不支持多线程并发调用。值得说明的是,乐鑫在 ESP-SR 中也提供嵌入式声源定向模块,它基于最小方差无失真响应算法,支持 2 至 8 路麦克风与任意阵列几何,目前仅支持 ESP32-P4;两者互补,按精度需求、阵列规模与主控型号选择即可。落到产品形态上,这套能力可以支撑会议终端与桌面音箱的发言者方向指示、云台摄像机与视频会议的自动取景,以及服务机器人与智能家电的转向交互。
作为乐鑫科技一级代理商,飞睿科技可为客户提供从芯片选型、模组配套到专业技术支持的服务。声源定向这类应用往往同时牵涉麦克风阵列设计、音频前端配置与主控算力规划,飞睿可在评估阶段协助客户完成方案可行性判断,缩短选型周期、降低试错成本。如需获取 ESP APA DOA 组件的技术资料、评估套件或选型建议,欢迎与我们联系。
热门跟贴