为什么一开口就是成品音色:实时人声处理的原理解析
大多数录音应用的流程是「先录干净的人声,后期再加效果」;它的思路反过来——效果在你唱的那一刻就已经生效。这背后是三件事在同时工作。
一、实时音高修正
修音的本质是把唱偏的音高拉回正确位置。引擎持续分析你正在发出的音,和当前调性的音阶比对,偏差就实时搬移。因为这一步在你听到自己声音之前就完成了,所以「开着效果唱歌」和「录完再加修音」的体感完全不同——前者能边唱边调整唱法,后者只能盲唱。
这也解释了为什么调性检测如此关键:加载伴奏时应用会自动识别它的调,你的修音才有正确的「靶子」。调不对,修正就会和你天然的音高打架,听起来发紧、发怪。手动校对调性的方法见调性检测那一页。
二、实时效果链
音色不只靠调音。人声链按顺序串起压缩、EQ、回声、混响等模块,每个模块都有预设:
| 模块 | 免费预设数 | 作用 |
|---|---|---|
| 压缩 | 6 | 把忽大忽小的音量压平,人声更稳 |
| EQ | 5 | 塑造明暗胖瘦,切掉浑浊频段 |
| 回声 | 5 | 重复与节奏感,常用于说唱 |
| 混响 | 6 | 空间感,从小房间到大教堂 |
录音时这条链实时运算,你戴耳机听到的就是最终音色。具体每个模块怎么用,见人声链那一页。
三、非破坏式工程
所有处理都挂在「轨」上而不是烧进音频里——录完随时可以换预设、调参数、改混音,原始素材不受伤。这是它和「一锤子买卖」式修音滤镜的本质区别:项目任何时候可以推翻重来。