人头录音的事情我研究过一下。这个事情本身是很有吸引力的,因为理论上可以通过双声道还原3D音场。但是从实际解决方案来看面对的情况并不如3D电影电视这么方便。这其中主要影响的因素是每个人的头部声音函数相差得比较大,从而导致在还音的时候3D音场凝像感定位感出现的偏差比较大。比如通过正常尺寸的仿真头话筒录音所得的素材,可能有不少头部尺寸与其相近的用户会感觉很好,但是颅间距稍宽的人,其听感可能会觉得音场整体是在头后方凝结,而颅间距稍窄的,听感效果会相反。
这个话题可能展开到理论层面就会涉及到形成人耳立体声听感的原因了,传统理论认为主要是三块:时间差(相位差),强度差和音色差。前两者相对较容易理解,主要是基于声源到两耳间距离所产生和衍生的影响。而音色差,这其中所包含诱因就相对复杂得多。目前一般认为主要是来自耳廓效应,头部皮肤毛发的声吸收反射作用等。而其实还有另一个我觉得比较重要的影响因素,那就是人的头部颅腔共鸣共振,以及人头内部组织的共同作用等因素。这几点所牵扯到的问题恐怕真不是通过简单的测量、样本分析、取均值就可以解决的。如果真的要让仿真头拾音作品真正有价值,成为大众产品,那最重要要解决的问题是知道影响这些问题的因素,从而能对人头部进行物理建模,通过感知用户的实际情况而对声音的还音做出调整。
目前人头函数HRTF(Head-Response Transfer Function)其实已经蛮复杂了,但是从实际解决的作品听感上似乎也并不理想。所以仿真头还需要走的路还很长。