A-59U双通道独立拾音的串音抑制与分离度指标解读
一、一个容易被指标表掩盖的问题
A-59U 支持双麦双波束模式,两路波束各自输出到独立声道。规格上写得很清楚:双通道、独立定向、互不干扰。但在实际项目里,"互不干扰"这四个字究竟对应多少 dB,规格书往往不给。工程上真正需要回答的问题是:当 A 通道对应的说话人在讲话时,B 通道里能听到多少他的声音?这个量叫通道分离度(channel separation),或者叫串音抑制比。
对于双人独立记录、双分区翻译、智能工牌这类应用,分离度是决定方案能不能用的核心指标,比降噪深度更关键。降噪不够,声音脏一点还能听;分离度不够,两路录音互相混叠,后端做说话人分离或分轨转写就直接失效了。
二、串音从哪里来:三条路径
双通道拾音系统的串音不是单一来源,至少有三条独立路径,各自的量级和治理手段完全不同。
1. 声学路径串音
这是最主要的一条。波束形成本质上是空间滤波,它对主瓣方向的信号给单位增益,对旁瓣方向的信号给衰减。但衰减不是无穷大。一个双麦阵列能提供的方向性增益,在物理上受阵元数量和间距限制。两个麦克风构成的差分阵列,理论指向性指数(DI)上限约 6dB,实际实现中考虑到麦克风一致性、阵列间距与波长的关系,宽带条件下能稳定拿到 4~6dB 就算做得不错。
换算成串音:如果 B 方向的声源相对 A 波束被衰减 6dB,那么在 A 通道里,B 说话人的电平只比正对时低 6dB。若两人同时说话且声压相近,A 通道里 B 的成分只低 6dB——这远远达不到"分离"的程度。
A-59U 的波束分三个区域:蓝色主区域(幅度最大)、黄色跟踪区域(信号逐渐衰减)、灰色无效区域(声音被衰减屏蔽)。这个三段式描述其实就是主瓣、过渡带、阻带的通俗表达。真正的分离度取决于对方说话人落在哪个区域:落在灰色区,抑制量大;落在黄色区,抑制量有限;两人都落在同一主瓣内,分离度接近 0dB。
2. 电气路径串音
两路模拟输出在 PCB 上并行走线、共用地回路、共用 ADC 基准或电源时,会产生电气耦合。A-59U 的 LINE OUT 输出阻抗 10KΩ、SNR 91dB、最大幅度 1.5Vrms。10KΩ 的输出阻抗在双通道并行走线时对容性耦合并不友好——耦合电压与源阻抗成正比,高阻输出更容易被邻线串扰。
粗略估算:两条并行走线之间的互容典型值在 0.5~2pF/cm 量级。10cm 并行走线约 10pF,在 4kHz 时容抗约 4MΩ,与 10KΩ 源阻抗构成的分压比约 -52dB。这个数量级通常低于声学串音,不是瓶颈,但如果走线更长、间距更小、且中间没有地线隔离,就可能上升到 -40dB 附近,开始与算法层面的抑制量可比。
3. 算法内部串音
两路波束共用同一组麦克风信号,也共用同一个 AEC、AGC 和降噪后处理。如果 AGC 是全局的(两通道共用一个增益控制),那么 A 通道说话人的音量变化会引起 B 通道增益的联动变化——这是一种调制型串音。它在频谱上不表现为直接泄漏,但会造成 B 通道的背景电平随 A 通道说话节奏起伏,听感上非常明显,后端 VAD 也会被误触发。
三、指标之间的换算关系
把几个规格数字放在一起,可以推出分离度的上下限。
- LINE OUT SNR 91dB:这是通道自身的噪声底,决定了分离度的理论上限。串音抑制不可能优于噪声底。
- I2S 16kHz / 16bit:16bit 量化的理论动态范围约 96dB,与 91dB 的模拟 SNR 基本匹配,说明数字侧不是瓶颈。
- ENC 降噪 45dB:降噪算法对非人声有效,但对另一路人声无效——降噪算法无法区分"我要的人声"和"另一个人的人声",这个区分只能靠波束形成完成。
结论是:分离度基本由波束形成的空间选择性单独决定,SNR 和降噪指标都帮不上忙。一个 91dB SNR 的通道,配上只能提供 6dB 空间抑制的双麦阵列,实际分离度就是 6dB 量级,而不是 91dB。
这一点在选型时经常被误读——看到 91dB SNR 就以为两路是"独立的",实际上独立的只是电路,声学上两个麦克风听到的是同一个声场。
四、几何布置比参数更重要
既然分离度主要由空间选择性决定,那么提升它的手段就落在几何布置上,而不是参数配置上。
拉开角度:两个说话人相对麦克风阵列的方位角差越大,落入对方阻带的可能性越高。角度差小于 30° 时,双麦阵列基本无法分辨;角度差接近 180°(分居阵列两侧)时,效果最好。这也是 A-59U 在"双人独立拾音记录"场景中通常被布置成两人对坐、模块居中的原因。
拉近距离:波束形成的方向性在近场比远场更容易实现,因为近场还可以利用两个麦克风的幅度差(距离平方反比),而不只是相位差。说话人距对应麦克风 20cm、距另一个麦克风 40cm 时,仅幅度差就有 6dB,叠加相位差后总抑制量可以显著超过纯远场情形。A-59U 的拾音范围标称 10cm-500cm,但要拿到好的分离度,应该工作在这个范围的近端。
加入物理隔离:在两个麦克风之间放置声学隔断(哪怕只是一片结构件),能在中高频提供额外的几 dB 衰减。这对 1kHz 以上的辅音区间尤其有效,而辅音正是语音可懂度的主要载体。
五、AGC 与分离度的冲突
A-59U 的 AGC 开启后拾音范围可达 50-500cm(基于 -42dB 标准灵敏度麦克风)。AGC 通过动态提升增益来扩展有效拾音距离,但它同时也会提升串音。
考虑这样一个场景:A 说话人静默,B 说话人在讲话。此时 A 通道的输入电平很低,AGC 会把 A 通道增益推到高位,于是从 B 泄漏过来的那点串音也被同样放大。结果是:安静的通道反而听起来串音更重。这与单通道系统里"AGC 在静音段放大底噪"是同一个机制,只不过这里放大的是另一路人声。
治理办法是引入通道间的联动门限:当检测到某通道为主导时,抑制另一通道的 AGC 上冲。但这又与"两通道完全独立"的设计目标矛盾。这是一个没有完美解的取舍,实际系统里通常按应用侧重来选:偏重录音分轨的,牺牲远场拾音距离,把 AGC 收紧;偏重覆盖范围的,接受较高的串音。
六、A-59U 的定位与边界
把 A-59U 的规格串起来看,它的取向是清晰的:37mm×25mm 的封装、USB 免驱、-40℃~85℃ 工业级温度范围、35-60mA 工作电流、100dB AEC、45dB ENC、10 种工作模式。这是一个面向工业与嵌入式集成的通用型双通道方案,双波束是它的能力之一而非全部。
适合它的场景:两人分坐、方位角差异大、距离较近的双向记录或分区通话;需要 USB 免驱快速接入 PC/树莓派/安卓主机的原型与小批量产品;工作环境温度跨度大的工业设备。
不适合的场景:多于两个说话人的分离;说话人方位角接近的紧凑布置;对分离度有明确 dB 指标要求(例如要求优于 20dB)的专业录音应用。后者需要的是更多阵元的麦克风阵列,两个麦克风在物理上做不到。
选型时更实际的做法,是先用目标几何布置做一次录音测试,直接测量单人说话时另一通道的电平差,得到实际分离度数字,再判断后端处理链能否接受。这个测试成本很低,但能避免大部分后期返工。
