在一首已经完成混音的歌曲里去除人声、保留完整的伴奏,这项需求其实存在了很久。这就像把多色彩泥揉捏成一颗混沌的黑球,要在现实中将其重新剥离还原几乎不可能——因为混音本身是一个“不可逆”的信息叠加过程。然而在数字音频世界里,算法的目标正是要完成这种“逆向分离”,将融合交织在一起的波形重新拆解为独立的轨道。
相位抵消:消不干净的“声场巧合”
最早被广泛采纳的技术是相位抵消。它的原理很直接:多数流行乐习惯将主唱人声放在立体声声场的正中央,此时左右声道的人声信号基本一致。若将其中一个声道的波形做 180 度反相后与另一声道叠加,相同声相的信号便会相互抵消,从而留下分布在两边的乐器声。
这种做法早在 1960 年代就已问世,至今仍常见于各类播放软件和卡拉 OK 设备的“消原音”按键中。它的优势在于零延迟、不占计算资源,也不需要额外的音频算法支持。
然而,这种方法的局限非常明显,甚至可以说是结构性的。
相位抵消处理的是“声相位置”,而非“人声”这一语义特征。如果混音师把底鼓和贝斯也摆在正中间(这在现代录音中几乎是标准操作),它们会随人声一并消失;如果主唱挂了立体声混响或做了双轨叠加,抵消不掉的部分就会变成奇怪的相位失真;至于单声道录音,这种方法更是完全无能为力——左右声道完全相同,相减之后只剩一片寂静。
传统 DSP 的规则瓶颈
为了克服相位抵消的弊端,音频工程师引入了更复杂的信号处理技术。例如利用人声与乐器的频谱差异做自适应滤波,通过非负矩阵分解(NMF)将频谱拆解后重新归类,或是分析伴奏中的重复段落来反推并扣除人声。相比简单的相位反转,这些手段在特定场景下的表现确实有所提升。
但传统 DSP 难以跨越的瓶颈在于:所有的筛选逻辑都依赖人工设定的规则。现实中的音乐形态极其复杂,不同的语种、唱法、编曲风格以及混音习惯交织在一起,没有任何一套固定规则能够全面兼顾。往往工程师为了调优某一类曲风新增一条规则,反而破坏了另一类曲风的听感。
这种“顾此失彼”的困局,直到深度学习引入音频领域才迎来根本性的改变。
深度学习:“帮我还原这坨橡皮泥”
2014 年前后,卷积神经网络在图像识别领域的成功经验开始引入音频处理。研究人员改换了思路:不再人工撰写规则,而是向模型喂入海量“混音-单轨”训练集,让神经网络自行学习分离模式。
神经网络人声消除从混音歌曲中分离人声和乐器声原理示意图。
具体实现上,音频首先被切分成短帧,通过短时傅里叶变换(STFT)转化为频谱图(横轴为时间,纵轴为频率,能量高低由色彩深浅表示)。神经网络以此为输入,预测出一张同等规格的“掩膜”(Mask),明确每个时频点上人声与伴奏的保留比例。掩膜与原频谱相乘后,即可提取出人声分量,最后经逆变换还原为时域波形。
这一过程高度依赖高质量的配对数据,即同时具备完整混音与独立人声、伴奏分轨(Stem)的音频资料。例如行业通用的基准数据集 MUSDB18,就收录了 150 首包含人声、鼓点、贝斯及其他乐器独立轨道的完整歌曲。模型通过对比自身输出与标准轨道的差异,经反向传播不断微调参数,直至分离精度达到理想状态。
2019 年,Deezer 开源了基于 U-Net 架构的 Spleeter,在普通电脑上数秒即可完成一首歌曲的分离,听感表现大幅超越传统算法;索尼开发的 Open-Unmix 模型则采用双向 LSTM 进行频谱建模,为学术界提供了清晰的对比基线;同年底,Meta(原 Facebook AI Research)推出的 Demucs 更进一步,跳过频谱转换直接在原始波形上进行端到端分离,利用编码器-解码器与时域卷积重建被遮蔽的细节。
不过,这些第一代 AI 模型都有一个共同的前提:它们是为拥有充沛算力的服务器或 GPU 桌面设备设计的,无法满足在嵌入式音频设备上集成的需求。
端侧落地的三要素:算法、算力与场景
将 AI 人声消除从云端或桌面端搬到硬件设备本地,并非简单地裁剪模型,而是需要在算法、硬件与应用场景三者之间找到平衡。
早期的 Demucs 等模型参数量达数千万乃至上亿,计算开销巨大。要在缺乏独立 GPU 与大容量内存的嵌入式芯片上运行,通常需要经过系统性的模型压缩:通过将 32 位浮点数转为 8 位定点数的模型量化、裁剪冗余连接的网络剪枝,以及利用大模型指导小模型训练的知识蒸馏,原本数百 MB 的模型可缩减至数 MB,在降低资源消耗的同时尽可能维持分离听感。
算法变小之后,硬件层面也需要相应的算力支撑。传统的通用 MCU 难以承担 AI 推理所需的密集乘加运算,而随着面向音频处理的异构 SoC 逐渐普及,芯片内部集成了 MCU、低功耗 DSP 与 AI 加速模块。以 Cadence HiFi 系列为代表的音频 DSP 在向量化计算与功耗控制上持续优化,使毫瓦级功耗下运行神经网络成为可能。例如炬芯 ATS362X 系列内置 HiFi5 DSP,支持 32 位音频处理精度与 48 kHz 采样率的多路数字音频 I/O,并具备高效运行轻量 AI 网络的能力。
与此同时,应用场景对离线与低延迟处理的需求也日益明确。在 K 歌音箱中,本地人声消除可以脱离特定点歌软件或伴奏音轨;在直播声卡与舞台监听中,本地处理避免了云端传输带来的延迟不确定性;对于乐器练习,随时提取或屏蔽特定声部也更加便利。
运行于 K 歌音箱、直播声卡的端侧实时 AI 人声消除场景示意。
随着算法压缩、异构芯片与场景需求的相向而行,端侧实时 AI 人声消除逐渐具备了商业落地的条件。
从“借用主机算力”到“算力随设备交付”
在探讨 AI 人声消除的实现路径时,离线软件、主机侧实时处理与设备内嵌处理各自有着不同的应用定位。
离线软件通常在导入文件后异步处理,注重模型规模与分离听感,多用于后期制作;桌面端 DAW 插件或移动端 App 可以实现流式实时处理,但需要占用外接手机或 PC 的 CPU、GPU 或 NPU 计算资源,同时依赖操作系统调度与驱动路由;而设备内嵌方案则将模型部署在设备内部的 DSP 或专用算力芯片上,直接在音频链路中完成推理。
算法内嵌于设备的真实优势在于,可以让人声消除所需的 AI 推理算力随着硬件一同交付。由于高负载的分离计算保留在设备内部,外接主机不再需要运行 AI 推理模型,可以将更多算力资源用于推流、视频编码、音效处理与多轨录制,降低系统高负载时发生爆音或掉帧的风险。
对于 K 歌音箱、直播声卡或舞台监听这类独立音频硬件而言,算力随硬件交付意味着更少的外部依赖。用户的分离体验不再受限于外接手机或电脑的性能高低,也无需强制用户安装特定的驱动、插件或宿主软件。即使外接设备仅作为音源播放源,人声消除依然能在硬件内部平稳运行。
这种运行于设备上的方案在简化终端使用流程的同时,也把模型压缩、功耗调度与嵌入式移植的开发工作留给了硬件厂商。但对于强调开机即用、体验稳定的音频硬件而言,这种将处理能力与推理算力一并集成的设计,提供了更为可靠的交付选择。
木瓜科技的端侧落地方案
将 AI 人声消除引入消费级硬件,需要同时在算法裁剪、DSP 性能调优以及音频信号链路集成方面做出突破。
木瓜科技已成功将轻量化 AI 人声消除网络部署至专用音频 DSP 平台,实现了对 48 kHz 采样率音乐的本地实时处理,并支持多路数模音频 I/O 与实时参数调节。目前,该方案已成功应用于多款客户量产产品中,并在各大行业展会上获得广泛关注,荣获 2026 GAS 技术创新优秀案例奖。
面向声卡、消费级音频及专业音频设备厂商,木瓜科技提供从端侧 AI 人声消除算法到硬件集成的完整技术方案,助力合作伙伴快速提升产品的音频处理能力。
订阅我们的新闻
第一时间获取木瓜科技的最新动态和产品信息。
无垃圾邮件,随时可退订。
让我们携手合作!
一同创造声音卓越的产品





