arXiv 每日论文精读

📡 eess.AS / cs.SD
Audio and Speech Processing, Sound
2026年06月23日
LLM: glm-5.2
125
论文总数
82
跨领域
107
成功解读
18
待处理
#1
eess.AScs.SD

Noise-Driven Instrument Based on Coherent Quantum and Stochastic Oscillator Models 跨领域

Felipe Gonzalez de la Maza, Maciej Lewenstein, Antoine Reserbat-Plantey, Reiko Yamada
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: 8 pages, 3 figures. Preprint submitted to European Physical Journal Special Topics, special issue "Quantum Computing and Musical Creativity: Exploring new Intersections"
查看摘要
In recent years, emerging research at the intersection of quantum physics and sound synthesis has opened new conceptual and technical possibilities for instrument design and sonic exploration. This study investigates the potential of formal analogies between quantum systems and classically non-deterministic systems for the generation of tangible acoustic phenomena. Specifically, it explores how quantum mechanical concepts can serve not only as metaphors but as operative frameworks in the design of new musical tools. Building on recent theoretical work on stochastic string excitation, we present the design, fabrication, and spectral characterization of a custom-built noise-driven electroacoustic string instrument. The system implements open-loop stochastic electromagnetic actuation without feedback or pitch stabilization. We show that this excitation strategy produces a dense and uniformly distributed spectral regime that differs from conventional deterministic string excitation. This work contributes to a growing field of quantum music creation by offering a hybrid artistic-scientific platform with potential applications in live performance, experimental composition, and science education.

📖 深度解读

1. 一句话总结

本文设计并制造了一种基于开环随机噪声驱动的电声弦乐器,利用量子谐振子与经典随机振子在相空间分布上的数学相似性,通过白噪声电磁激励使琴弦产生密集且均匀分布的新型复杂音色。

2. 研究背景与动机

  • 核心问题:如何将量子力学概念(特别是量子谐振子与经典热噪声振子在相空间分布上的相似性)转化为可听见的声学现象,并应用于新型乐器设计。
  • 重要性:量子物理与声音合成的交叉为乐器设计和声音探索提供了全新的概念与技术可能性。这不仅能拓展音乐表达的边界,还能作为实验作曲和科学教育的创新平台。
  • 现有方法不足:现有的电磁/电声弦乐器(如Magnetic Resonator Piano、Sophtar、Halldorophone)大多采用确定性驱动或闭环反馈系统。这些方法本质上仍然是音高导向的,旨在维持或增强特定的基频和泛音,无法产生基于宽带随机能量与琴弦物理交互而产生的复杂、密集且均匀的频谱。

3. 核心方法

  • 提出的方法:一种基于开环随机电磁驱动的定制电声弦乐器。系统将外部白噪声信号直接施加于定制的电磁驱动器上,不使用任何反馈、相位同步或嵌入式数字信号处理(DSP)。
  • 关键创新点
    1. 开环随机激励范式:摒弃了传统的反馈控制,让声音自然地从宽带随机能量与琴弦机械特性的物理交互中涌现。
    2. 定制电磁驱动器设计:将传统的吉他拾音器改造为主动驱动器,通过优化线圈绕线(28 AWG铜线,约255圈,8欧姆阻抗)和添加钕磁铁来增强磁场强度和聚焦。
    3. 抗干扰物理结构设计:通过重新设计激励线圈以改善磁场方向性,并优化物理布局增加激励器与传感器之间的距离,有效解决了电磁串扰问题。
  • 直觉性解释:传统的电声乐器就像是用固定频率推秋千,秋千只会以那个频率摆动(确定性激励)。而本文的方法就像是让一阵狂风(白噪声)随机地吹打秋千,秋千不仅会摆动,还会产生各种复杂、密集的晃动模式。这种复杂的物理响应在宏观上表现出了类似量子相干态的统计特征,从而产生了一种极其丰富、没有明显单一音高的新音色。

4. 实验与结果

  • 数据集/基准:本文没有使用传统的计算机科学数据集,而是进行了物理实验和声学测量。对比基准是同一根琴弦在两种不同激励下的频谱表现。
  • 对比的基线方法:传统的确定性激励(使用常规吉他拨片拨弦)。
  • 主要实验结果
  • 拨片激励(确定性):产生典型的谐波频谱,具有主导的基频和规则间隔的泛音,音高清晰,频谱复杂度低。
  • 随机噪声激励(本文方法):产生更密集的泛音分布。虽然基频仍可见,但周围的谐波更多、频率更近,且在整个频谱上分布更均匀。这导致了更丰富、更复杂的音色,在传统激励下不活跃的频段也有增强的频谱能量。
  • 消融实验:论文未提及传统的消融实验,但在系统设计中提到了为了减少串扰而采取的两个关键策略(重新设计激励线圈以改善磁场限制和方向性,优化空间布局增加距离),这可以看作是工程实现上的关键调试步骤。

5. 优势与局限

  • 主要优势
    1. 音色创新:产生了一种与传统乐器截然不同的、频谱密集且均匀分布的新型复杂音色。
    2. 物理与艺术的桥梁:成功将量子物理的数学结构作为操作框架(而非仅仅是隐喻)应用于乐器设计,提供了混合的艺术-科学平台。
    3. 物理交互的丰富性:保留了物理琴弦的共振结构,相比于纯数字系统,引入了模拟可变性和表演丰富性。
  • 局限性
    1. 缺乏动态控制:目前采用开环设计,虽然频谱丰富,但可能缺乏对音高和动态的实时精细控制能力,限制了其在传统旋律音乐中的应用。
    2. 硬件串扰挑战:电磁激励与拾音之间的串扰是一个核心挑战,尽管采取了措施,但在实际演出环境中可能仍需谨慎调试。
    3. 类比的非功能性:论文明确指出该系统并非实现真正的量子计算或量子比特,只是在经典系统中展现了与量子相干动力学的形式相似性,量子特性仅作为结构参考。

6. 关键结论与启发

  • 最重要的 takeaway:量子力学概念(如相空间分布的相似性)不仅可以作为理论隐喻,还可以作为实际操作框架来指导新型电声乐器的设计,通过开环随机激励可以激发出琴弦全新的、密集均匀的声学频谱。
  • 启发与延伸方向
    1. 分布式激励系统:未来可以使用多线圈阵列实现动态空间控制和频谱塑造。
    2. 系统扩展:将这种架构扩展到激励一整组琴弦,构建完整的量子启发乐器。
    3. 跨学科研究:为探索量子现象与声音的关系提供了实验平台,未来可能进一步深化物理与音乐实践的整合,甚至探索纳米机械量子比特在声学上的潜在应用。
#2
eess.AScs.SD
University of Michigan (QS Top 100)

Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach 跨领域

Tzu-Chieh Wei, Yi-Cheng Lin, Huang-Cheng Chou, Kuan-Yu Chen, Hsin-Yen Sung 等 (7 人)
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Sound (cs.SD)
Comments: Accepted by INTERSPEECH 2026
查看摘要
As expressive text-to-speech (TTS) and voice conversion (VC) systems increasingly generate non-verbal vocalizations (NVVs) to enhance naturalness, reliable speaker verification (SV) becomes essential to objectively assess identity consistency across both verbal and non-verbal segments. Yet current SV systems generalize poorly to NVVs, and fine-tuning on NVV data causes catastrophic forgetting of speech performance. We present the first systematic study across 10 NVV types and propose a framework combining frozen Data2Vec self-supervised features with ECAPA-TDNN, enhanced by a Mixture of Experts (MoE) module with learned domain-aware routing. A conditional distillation loss on speech inputs via a pretrained teacher retains speech-to-speech accuracy, while a contrastive loss bridges the speech-NVV domain gap. Our method reduces speech-NVV EER from 38.93% to 22.66% over a pretrained baseline, and improves speech EER from 13.17% to 9.24% via distillation.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文提出了一种结合混合专家和条件知识蒸馏的框架,成功解决了说话人验证系统在处理非言语发声(如笑声、咳嗽声)时性能差,且微调会导致正常语音识别能力灾难性遗忘的问题。

2. 研究背景与动机

  • 核心问题:现有的说话人验证(SV)系统在处理非言语发声(NVVs,如呼吸、笑声、咳嗽等)时表现极差,且如果直接在NVV数据上微调模型,会导致模型丧失原本处理正常语音的能力(即灾难性遗忘)。
  • 重要性:现代TTS(文本转语音)和VC(声音转换)系统为了提升自然度,越来越多地生成非言语发声。为了客观评估这些生成声音是否保持了目标说话人的身份一致性,亟需能在言语和非言语片段上同时工作的自动化SV系统。
  • 现有不足:当前主流SV系统隐含了一个假设:输入都是包含音素结构的正常语音。而非言语发声具有高度异质性且缺乏音素结构,违反了这一假设。此前研究多只关注单一非言语类别(如仅看笑声),缺乏系统性的多类别评估;且简单的微调方法会破坏正常语音的验证性能。

3. 核心方法

  • 提出框架:冻结的 Data2Vec(自监督前端)+ ECAPA-TDNN(后端),并在此基础上引入了层间残差混合专家模块和条件知识蒸馏。
  • 关键创新点
    1. 条件知识蒸馏:仅对正常语音样本计算蒸馏损失,强制学生模型在非言语发声上自由探索的同时,保留预训练教师模型在正常语音上的表征能力,防止灾难性遗忘。
    2. 层间残差混合专家:在冻结的自监督模型各层之间插入可训练的MoE适配器,将语音和非言语发声路由到不同的专家网络,实现特征提取路径的物理隔离。
    3. 监督对比领域桥接:构建跨域正样本对(同一说话人的语音与NVV),在最终的嵌入空间中拉近同一说话人的语音和非言语发声,弥合声学鸿沟。
  • 直觉性解释:想象一个翻译团队,以前只有一个人,既要翻译标准演讲又要翻译奇怪的笑声和咳嗽声,结果两头做不好。现在我们雇佣了多个专家(MoE),有人专攻演讲,有人专攻非言语声音。为了不让“演讲专家”忘记老本行,我们安排了一位老导师(教师模型)专门盯着他,只要遇到演讲就让他对齐导师的答案(条件蒸馏)。最后,为了确保同一个人的演讲和笑声能被认作同一个人,我们强制要求所有专家在输出最终结果时,把同一个人的不同声音拉到同一个“身份空间”里(对比损失)。

4. 实验与结果

  • 数据集:NonverbalTTS(包含17小时音频,10种NVV类型,1314个训练说话人,147个测试说话人)。
  • 基线方法:Zero-shot的WavLM-SV模型,以及基于Fbank、WavLM、Data2Vec、Voc2Vec及其组合的ECAPA-TDNN微调模型。
  • 主要实验结果
  • 在跨域的语音-非言语(NvS)验证任务上,Zero-shot基线的EER高达38.93%,本文提出的MoE-2 (IR-MoE)模型将其降至22.66%。
  • 在正常语音(SvS)任务上,消融实验显示,不使用蒸馏损失的模型EER退化至13.17%,而加入本文的条件蒸馏损失后,SvS EER恢复至9.24%。
  • 消融实验揭示
    1. 条件蒸馏不仅有效防止了正常语音性能的退化,还反过来帮助模型更好地平衡多域学习,降低了NvS的EER。
    2. MoE专家数量的消融表明,4个专家是最佳平衡点;专家过多会因数据不足导致NvS性能下降,但继续增加专家能进一步隔离干扰,使SvS性能继续提升。

5. 优势与局限

  • 主要优势
    1. 首次对10种非言语发声进行了系统性的说话人验证研究,填补了该领域的空白。
    2. 提出的“中间特征分离(MoE)+ 最终身份融合(对比损失)”策略,巧妙解决了多域特征冲突问题。
    3. 推理时无需知道输入是语音还是NVV,MoE路由网络能自动处理,具备良好的实用性。
  • 局限性
    1. 尽管通过蒸馏缓解了遗忘,但微调后正常语音(SvS)的EER(9.24%)仍显著高于未微调的Zero-shot基线(5.60%),论文指出这是由于训练数据量(17小时)远小于原预训练数据导致。
    2. 数据集存在严重的类别不平衡(呼吸声占67%,而打呼噜和打喷嚏仅有个位数样本),模型在罕见NVV上的泛化能力未被详细探讨。
    3. 目前仅在单一英文数据集上验证,缺乏跨语言或真实复杂场景下的验证。

6. 关键结论与启发

  • 核心Takeaway:在处理声学特性截然不同的多域音频任务时,“一刀切”的模型容易顾此失彼。通过条件蒸馏保留旧能力,通过MoE物理隔离不同域的特征提取,再通过对比损失统一最终的身份表征,是一套行之有效的“分而治之”范式。
  • 启发与延伸方向
    1. 未来可探索将大规模标准语音数据集(如VoxCeleb2)与小规模NVV数据集进行联合训练,以彻底消除数据规模差异带来的性能退化。
    2. 该框架为下一代富有表现力的TTS/VC系统提供了客观的评估工具,后续研究可直接利用此框架对合成语音中的非言语片段进行身份一致性评测。
    3. “条件蒸馏”的思想可启发其他持续学习或多模态任务,即只在对旧能力至关重要的数据子集上施加约束,而在新领域给予模型最大的自由度。
👀 推荐值得看
🏷️ 领域说话人技术 > 说话人识别/验证
💡 创新非言语发声的说话人验证——基于Data2Vec和ECAPA-TDNN,引入层间残差混合专家隔离不同域特征,并用条件知识蒸馏防止正常语音能力的灾难性遗忘
⭐ 评分7.5
#3
eess.AScs.SD
Massachusetts Institute of Technology (MIT) (QS Top 100)

Compiling Differentiable Audio Graphs to Real-Time DSP 跨领域

Facundo Franchino, Sebastian J. Schlecht
Audio and Speech Processing (eess.AS); Programming Languages (cs.PL); Sound (cs.SD); Signal Processing (eess.SP)
Comments: 4 pages, 5 figures. Demonstration paper submitted to the 29th International Conference on Digital Audio Effects (DAFx26), Cambridge, MA
查看摘要
Differentiable audio processors are habitually designed and optimised in machine-learning frameworks, but deploying them as real-time audio effects still often requires non-automatic implementation in a dedicated digital signal processing language. The translation is error-prone, demands an onerous verification process, and detaches research prototypes from usable production tools. That being so, we present ADAC, a compiler that lowers a trained model to a framework-agnostic intermediate representation and emits efficient FAUST code whose impulse response matches the source model to within floating-point arithmetic noise, direct paths included. The optimisation loop is made audible by replacing the model in a running plugin after each gradient step. The exported processor carries a small set of macro-controls that leave its stability intact. A stability certificate computed from the shipped parameters is checked before the plugin is built. At the demonstration, a feedback delay network is trained and exported to a working plugin.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种名为 ADAC 的编译器,能将机器学习框架中训练好的可微音频模型自动转换为 FAUST 代码并生成实时音频插件,解决了可微音频模型难以直接部署到生产环境的痛点。

2. 研究背景与动机

  • 核心问题:如何在实时音频处理环境中部署经过机器学习训练的可微音频处理器。
  • 重要性:可微音频框架(如 FLAMO, DDSP)允许通过梯度下降自动优化音频处理器参数,但优化后的模型通常被“困”在训练框架中。为了让音乐人和音频工程师在数字音频工作站(DAW)中实时使用这些模型,必须将它们转化为 VST/AU 等插件。
  • 现有不足:目前,将训练好的模型部署为实时效果器通常需要用专用的 DSP 语言(如 FAUST)手动重写代码。这个过程不仅容易出错、验证繁琐,而且每次模型更新都需要重复重写,导致研究原型与可用生产工具严重脱节。

3. 核心方法

  • 方法/框架:ADAC(Automatic Differentiable Audio Compiler,自动可微音频编译器)。
  • 关键创新点
    1. 框架无关的中间表示(IR):将 PyTorch 等框架中的计算图提取为 JSON 格式的中间表示,解耦了前端模型和后端代码生成。
    2. 可听的训练循环:在模型优化的每一步梯度下降后,自动重新生成代码并让运行中的插件热加载,使研究人员能“听到”模型逐步优化的过程。
    3. 内置稳定性保证:提供安全的宏控制参数(如混响时间),并在导出前通过小增益定理计算稳定性证书,拒绝编译不稳定的插件。
  • 核心思路直觉解释:想象你用乐高(PyTorch)拼了一个复杂的混音器,但只能在电脑屏幕上看着它工作。ADAC 就像一个“3D打印+质检”机器人,它先扫描你的乐高结构,画成一张通用图纸(JSON),然后自动用工业级的材料(FAUST代码)重新造出一个一模一样的混音器,还能直接插到调音台上用。不仅如此,在你拼乐高的时候,它每拼一块就让你听一下声音对不对,最后出厂前还会检查这个混音器会不会突然爆音(稳定性证书)。

4. 实验与结果

  • 数据集/基准:以反馈延迟网络(FDN)和散射延迟网络(SDN)为案例进行研究,基准测试在 Apple M2 单核、48kHz 采样率下进行。
  • 对比基线:将编译生成的 FAUST 代码与源模型(FLAMO 框架中的 PyTorch 模型)进行对比。
  • 主要实验结果
  • 精度:生成的 FAUST 代码与源模型的脉冲响应在峰值上的差异在 $7 \times 10^{-5}$ 以内,达到了单精度浮点数的噪声水平,即几乎样本级一致。
  • 性能:32 路 FDN(实用混响器规模)以约 90 倍实时速度运行,64 路 FDN 以约 14 倍实时速度运行,在普通硬件上留有充足的实时处理余量。
  • 速度:ADAC 重新生成模型仅需 0.2ms,插件热重载仅需不到 10ms,实现了近乎无缝的实时训练监听。
  • 消融实验/验证:论文未进行传统的消融实验,但通过 201 个单元测试和端到端集成测试验证了正确性。特别指出,稳定性分析必须在单精度转换后进行,因为作者发现一个正交矩阵在单精度转换后 $\sigma_{max}$ 略大于 1(1.000000170),若用双精度分析会掩盖实际部署时的潜在不稳定。

5. 优势与局限

  • 主要优势
    1. 端到端自动化:从模型训练到 VST3/AU 插件安装一键完成,极大降低了 DSP 部署门槛。
    2. 高保真与高效率:在不牺牲数值精度的前提下,生成了高度优化的实时代码。
    3. 工程安全性:通过稳定性证书和受限的宏控制,确保终端用户在调参时不会导致系统崩溃或爆音。
  • 局限性
    1. 仅限于 LTI 系统:当前的方法和稳定性证明仅适用于线性时不变(LTI)系统,尽管 FAUST 能表达非线性系统,但目前的等价性和稳定性保证尚未扩展到非线性/时变领域。
    2. 分数延迟精度损失:遇到分数延迟时直接四舍五入到最近整数样本,会引入最大 $1/(2f_s)$ 秒的误差。
    3. 底层模块覆盖度有限:虽然架构可扩展,但目前支持的叶节点(底层 DSP 模块)种类仍需扩充。

6. 关键结论与启发

  • 最重要的 Takeaway:机器学习模型与实时音频生产工具之间的鸿沟可以通过结构化的中间表示和自动编译器来弥合,且无需在数值精度或运行效率上妥协。
  • 启发与延伸方向
    1. 向非线性和时变系统扩展:未来可以引入对 waveshaper、包络跟随器等非线性/时变模块的前端支持,并探索相应的稳定性证明方法。
    2. 跨平台硬件部署:由于生成了标准 FAUST 代码,可以顺理成章地推送到 FPGA 或嵌入式设备(通过 Syfala),这为边缘设备上的 AI 音频处理提供了可行路径。
    3. 交互式机器学习:“每一步梯度下降都能听到效果”的工作流为音频 AI 研究提供了新范式,可以启发更多基于人类实时听觉反馈的交互式模型调优研究。
#4
eess.AScs.SD
University of Edinburgh (QS Top 100)

An Evaluation Framework for Text-to-Speech Voice Reconstruction 跨领域

Ariadna Sanchez, Christoph Minixhofer, Korin Richmond, Ondrej Klejch, Peter Bell 等 (6 人)
Audio and Speech Processing (eess.AS); Computation and Language (cs.CL); Sound (cs.SD)
Comments: Accepted at Interspeech 2026
查看摘要
Voice reconstruction using Text-to-Speech (TTS) offers a communication method for people with speech disorders, which aims to retain their speaker identity while improving intelligibility. Previous work generally relies on Mean Opinion Score (MOS) to evaluate naturalness and speaker similarity, but this has limited sensitivity and reliability. We propose an evaluation framework with subjective and objective components. Subjectively, we evaluate perceived intelligibility and speaker identity using Best Worst Scaling (BWS) with situational framing. Objectively, we demonstrate that standard measures fail to predict reconstruction success for highly unintelligible speakers, so we introduce a novel dual-reference distributional measure to assess the trade-off between intelligibility and speaker identity. By evaluating the output of 17 zero-shot TTS systems for 193 speakers, we show that our framework provides a reliable and task-aligned approach for assessing voice reconstruction.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文提出了一个针对言语障碍患者TTS语音重建的评估框架,通过引入情境化的主观测试和双参考分布度量,解决了传统评估方法无法准确衡量“可懂度与说话人身份保留”之间权衡关系的问题。

2. 研究背景与动机

  • 核心问题:如何准确评估为言语障碍患者重建的TTS语音质量。语音重建的目标是提高语音的可懂度,同时尽可能保留患者原本的说话人身份特征。
  • 重要性:这直接关系到语音输出沟通辅助设备(VOCA)的可用性,能帮助因神经系统疾病(如帕金森、脑瘫等)而失去正常说话能力的人重获属于自己的声音。
  • 现有不足:以往研究普遍依赖平均意见分(MOS)来评估自然度和相似度,但MOS存在敏感度低、跨研究易饱和等局限。同时,常用的客观指标(如词错率WER、说话人嵌入余弦相似度)往往只关注单一维度,且在处理重度障碍语音时失效,无法预测听者对“重建效果”的真实偏好。

3. 核心方法

论文提出了一套包含主观和客观两部分的评估框架。
- 关键创新点
1. 情境化的最佳最差缩放法(BWS):在主观测试中,不使用绝对打分,而是让听者在多个样本中选“最好”和“最差”。同时设定两种情境:一种只关注“可懂度”(忽略像不像本人),另一种关注“综合重建效果”(要求听者想象患者患病前的声音,同时考量可懂度和身份特征)。
2. 双参考分布度量(TTSDS_Mean):针对客观评估提出。由于语音重建没有标准答案,该方法计算合成语音与两个参考集的分布距离并取平均:一个是距离“高可懂度通用语料库”(代表听得清),另一个是距离“患者原始障碍录音”(代表声音特征)。
- 核心思路(直觉解释):传统的打分就像让评委给歌手打1-5分,容易受主观情绪影响且分差拉不开。本文改用“四选一淘汰赛”(BWS),并明确告诉评委“这次只听清不清楚”或“这次要听像不像生病前的他”。客观上,由于没有完美的“标准答案”做对比,本文巧妙地用了两个参考物:一个是“标准播音员”(代表听得清),另一个是“患者本人的录音”(代表声音特征),看合成语音能不能同时靠近这两个极端,从而量化两者的权衡。

4. 实验与结果

  • 数据集与基准:使用了Speech Accessibility Project (SAP) 数据集中193名言语障碍患者(涵盖帕金森、脑瘫、ALS、唐氏综合征)的语音。对比了17个当前主流的零样本TTS系统(如XTTS, StyleTTS2, F5-TTS等)。
  • 主要实验结果
  • 主观结果:在“可懂度”上,大多数TTS系统的得分高于患者原始录音,其中StyleTTS2表现最好。但在“综合重建效果”上,大多数系统得分低于原始录音,说明它们为了听得清而丢失了太多个人声音特征。仅有IndexTTS2、Qwen3-TTS和E2-TTS三个系统在综合重建上超越了原始录音。
  • 客观结果:提出的TTSDS_Mean指标与主观“综合重建效果”评分高度相关(总体ρ=0.81,重度障碍患者ρ=0.73),显著优于传统的说话人余弦相似度(ρ=0.75/0.61)。
  • 消融/分析揭示:传统客观指标(如UTMOS、WER)高度偏向于“可懂度”,无法有效反映“身份保留”的重建效果。随着患者障碍程度加重,零样本TTS系统越来越难以在提升可懂度的同时保留说话人身份。

5. 优势与局限

  • 主要优势
    1. 评估框架高度贴合实际应用场景,通过情境化指导有效分离了“可懂度”和“身份保留”两个维度。
    2. 提出的双参考分布度量能准确预测人类听者的偏好,填补了客观评估在重度障碍语音上的空白。
    3. 大规模测试了17个SOTA TTS系统,为后续研究提供了坚实的基线参考。
  • 局限性
    1. 评估维度仅限于可懂度和身份保留,未涵盖口音相似度、韵律以及日常对话的适用性。
    2. 主观测试要求听者“想象患者患病前的声音”,这对于重度障碍患者尤为困难且高度主观。
    3. 客观度量虽然有效,但TTSDS2的计算依赖特定参考集,其泛化到其他数据集或系统的能力仍需进一步验证。

6. 关键结论与启发

  • 最重要的Takeaway:语音重建不能简单套用常规TTS评估方法,必须将“可懂度”与“身份保留”的权衡纳入考量;通过双参考分布度量可以客观、量化地评估这种权衡,而传统的单一客观指标存在严重偏差。
  • 启发与延伸方向
    1. 未来的TTS评估应更多采用情境化、任务驱动的测试(如BWS),摒弃已饱和的MOS打分。
    2. 对于重度言语障碍,现有的零样本TTS已触及瓶颈,可能需要专门的微调或架构创新来突破“可懂度-身份”的零和博弈。
    3. 评估框架可扩展至其他维度(如口音、韵律),或直接让VOCA设备终端用户参与评估,实现真正的用户中心导向。
#5
eess.AS
University of Edinburgh (QS Top 100)KTH Royal Institute of Technology (QS Top 100)

Sexualised synthetic personas encode and amplify gendered power asymmetries through voice

Alice Ross, Ariadna Sanchez, Elin Kanhov, Catherine Lai, Eva Szekely
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Computation and Language (cs.CL)
Comments: Accepted at Interspeech 2026
查看摘要
This work examines sexualised AI-generated English-speaking voices offered by a popular commercial platform. New technologies may enable sexual empowerment and greater diversity in gender expression, yet toxic masculinity, heteronormativity, and the abuse of women and LGBTQ+ people remain pervasive online. Drawing on a Feminist HCI perspective, we examine how commercial voice AI systems reproduce and circulate particular performances of gender. We conducted a listening experiment with a diverse group of listeners, combining quantitative adjective selection, qualitative free-text responses, and acoustic analysis. Participants evaluated male- and female-coded voices presented with either sexualised scripts or neutral text. Results reveal a narrow range of gender expression, largely binary and heteronormative. Female-coded voices are more frequently described using sexualised and submissive terms, while male-coded voices are more often associated with dominance and positive traits.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文通过听感实验发现,商业AI语音平台提供的性化合成声音强化了传统的性别权力不对等,将女性声音编码为顺从与性化的客体,而将男性声音编码为主导与积极的主体。

2. 研究背景与动机

  • 核心问题:商业AI语音平台(如ElevenLabs)中提供的“性化”合成声音,是否在感知层面再现并放大了性别刻板印象和权力不对等?
  • 重要性:随着语音AI的普及,这些声音不仅被出售用于游戏、影视等创意产业,还可能通过“语言顺应”效应影响人类自身的说话方式。如果AI声音充斥着刻板印象,将进一步巩固社会中的性别不平等。
  • 现有不足:过去关于语音助手(如Siri、Alexa)的研究主要批评其“默认女性”和“秘书”刻板印象。然而,对于新兴的、可高度定制且带有性化色彩的“语音AI”市场,目前缺乏关于用户如何感知这些声音的研究,尤其是缺乏包含多元性取向人群视角的探讨。

3. 核心方法

  • 提出的方法:结合定量形容词选择、定性自由文本反馈和声学分析的综合听感实验。
  • 关键创新点
    1. 变量解耦设计:将“声音风格”(性化 vs. 中性)与“文本内容”(性化台词 vs. 中性科普文)分离,独立考察声音韵律和文本对听众感知的影响。
    2. 多元受众视角:招募了包含不同性别认同和性取向的参与者(分为四组:被女性吸引的女性、仅被男性吸引的女性、被男性吸引的男性、仅被女性吸引的男性),打破了以往研究仅关注异性恋群体的局限。
    3. 混合评估方法:采用社会语言学的“形容词选择法”替代传统的李克特量表,既减少了参与者疲劳,又便于跨群体系统比较,同时保留了定性分析的深度。
  • 核心思路(直觉解释):就像测试不同演员念台词的效果。研究者让AI生成带有“诱惑”标签的男/女声和普通男/女声,然后让它们分别念“挑逗性台词”和“中性天气预报”。听众听完后,从一堆形容词里挑出最符合的词。这样就能区分:听众觉得一个声音“性感顺从”,到底是因为它念的词色色,还是因为它本身的音色(比如带喘息、语速慢)就在装性感。

4. 实验与结果

  • 数据集/基准:使用ElevenLabs平台生成的10个声音(5男5女,含性化和非性化标签)。中性文本使用修改版的Rainbow Passage。
  • 对比基线:对比性化声音与非性化声音;对比性化文本与中性文本;对比不同参与者群体的感知差异。
  • 主要实验结果
    1. 性别感知差异显著:男性声音更常被赋予“主导”和“积极”形容词;女性声音更常被赋予“顺从”和“性化”形容词(统计显著 p<.001)。
    2. 声音韵律的独立影响:当把性化文本换成中性文本时,男性声音的“性化”感知大幅下降(46%降至18%),但女性声音的“性化”感知依然很高(57%降至36%)。这说明女性声音的声学特征(如气声、叹息)本身就自带强烈的性化暗示,不依赖于文本内容。
    3. 听众身份的影响:仅被女性吸引的男性群体(Group 4)最容易对女性性化声音给出性化评价,且最不容易给出负面评价;同时他们对男性性化声音给出的积极评价也最多。
    4. 声学特征:性化男性声音的平均基频(F0)比普通男性声音更低(70 Hz vs 110 Hz),性化声音整体语速更慢。
  • 消融/定性分析揭示:定性评论显示,听众觉得女性性化声音很“假”、“像在硬演性感”(被批评为“青春期男孩对性感的幻想”),而男性性化声音则被评价为“平淡”或“有威胁感/掠夺性”。

5. 优势与局限

  • 主要优势
    1. 研究视角新颖且深刻:将女权主义HCI视角引入最新的商业语音AI研究中,揭示了技术产品中潜藏的权力结构。
    2. 实验设计严谨:通过分离文本和声音特征,精确定位了导致性化感知的来源(特别是女性声音的副语言特征)。
    3. 包容性的样本设计:纳入了非异性恋群体的视角,使结论更具生态效度。
  • 局限性
    1. 样本范围有限:仅考察了ElevenLabs这一个平台的声音,且声音样本量较小(10个),可能无法代表整个AI语音市场。
    2. 文化与语言局限:参与者和声音仅限于北美英语,未考虑其他文化背景下对性化声音的感知差异。
    3. 形容词列表的固有偏差:尽管经过预测试,但预设的36个形容词可能仍限制了听众的真实表达,无法完全捕捉复杂的情感反应。

6. 关键结论与启发

  • 最重要的Takeaway:商业AI语音平台表面上提供“性别平等”的定制选项,实际上却通过声音的韵律和副语言特征,暗中编码并放大了异性恋霸权和男权视角的性别刻板印象(女性=顺从/性客体,男性=主导/主体)。
  • 启发与延伸方向
    1. AI伦理与设计规范:呼吁AI语音开发者关注声音设计中的性别表征问题,避免将陈旧的刻板印象硬编码进新技术中。
    2. 语言顺应研究:未来可研究长期暴露于这些刻板印象声音下,是否会导致人类用户(尤其是青少年)在现实中模仿这些不自然的“性化”说话方式。
    3. 拓展至其他平台:研究可扩展至AI伴侣、游戏NPC等更广泛的场景,探讨“按需提供亲密关系”的AI服务如何重塑社会对性别和权力的认知。
#6
eess.AS

Vaani Benchmark V1.0: An Inclusive Multimodal Benchmark Dataset for Hindi

Sujith Pulikodan, Agneedh Basu, Saurabh Kumar, Pranav Bhat, Pavan Kumar J 等 (8 人)
Audio and Speech Processing (eess.AS)
查看摘要
Benchmarking is critical for the systematic evaluation and comparison of automatic speech recognition (ASR) systems. While several open-source datasets are available for Hindi ASR, existing benchmarks remain limited in geographic diversity, demographic representation, and transcription robustness. We introduce an inclusive, multimodal Hindi ASR benchmark collected from 104 districts across India. The dataset consists of spontaneous speech elicited using image prompts and recorded in real-world acoustic conditions across diverse demographic groups. Each audio segment is annotated with three independent transcriptions, enabling multi-reference evaluation that accounts for permissible orthographic and lexical variations. This design supports more robust, inclusive, and realistic ASR evaluation. We benchmark multiple open-source and proprietary ASR models and report their comparative performance on the benchmark dataset.

📖 深度解读

以下是对论文《Vaani Benchmark V1.0: An Inclusive Multimodal Benchmark Dataset for Hindi》的结构化中文解读报告:

1. 一句话总结

本文构建了一个名为Vaani的包容性多模态印地语语音识别(ASR)基准数据集,通过覆盖印度104个地区的图像引导自发语音,并为每段音频提供三个独立转录文本,解决了现有基准在地理多样性、多模态评估和转录主观性方面的不足。

2. 研究背景与动机

  • 核心问题:现有的印地语ASR基准数据集在地理与人口代表性、多模态对齐以及转录鲁棒性方面存在严重不足,无法公平、真实地评估ASR系统在复杂现实场景下的表现。
  • 重要性:印地语是印度使用最广泛的语言(占比43.63%),但其方言和口音随地域变化极大。如果基准数据集缺乏多样性,会导致ASR模型在实际应用中出现严重的地域偏见和性能衰退。
  • 现有不足
    1. 覆盖面窄:现有数据集大多缺乏足够的地区和方言覆盖,且多为朗读语音而非自然自发语音。
    2. 单参考转录的缺陷:传统评估使用单一参考文本计算词错率(WER),但印地语存在大量合法的拼写和词汇变体,单一标准会不公平地惩罚模型。
    3. 缺乏多模态与噪声标注:无法评估日益流行的多模态模型,且缺乏对背景噪声的显式标注,难以测试模型的鲁棒性。语码转换(Code-switching)的处理也缺乏统一标准。

3. 核心方法

  • 提出方法:Vaani Benchmark V1.0 数据集及其配套的多参考评估框架。
  • 关键创新点
    1. 多模态数据采集:通过给受访者展示图片,引导其用母语自发描述,从而获得自然语音及对应的“图像-音频”多模态对齐数据。
    2. 多参考转录机制:每段音频由3位来自同一地区的独立转录员进行转录,保留了合法的拼写、词汇和语码转换差异。
    3. 多参考对齐WER计算(Approach 3):提出了一种新的评估算法,将模型输出与3个参考文本进行词级对齐。只要模型输出与任意一个参考文本匹配,即不计为错误;只有当所有参考文本都认为某词被删除时,才计为删除错误。
  • 直觉性解释:就像让三个不同背景的人听同一段录音并写下文字,因为口音和书写习惯不同,三个人写出的正确文本会有细微差异。Vaani不仅记录这三种正确答案,而且在打分时告诉模型:“只要你的答案跟这三个人里任何一个对上了,就算你对。”这避免了“一刀切”标准带来的误判。

4. 实验与结果

  • 数据集规模:20.64小时音频,3,252名说话人,覆盖22个州/联邦属地的104个县,使用8,315张图片。50%数据公开,50%作为闭源测试集。
  • 对比基线:评估了21个开源与闭源商业ASR模型,包括Whisper-large-v3、Azure Speech、Google Chirp、GPT-4o-Transcribe等。
  • 主要实验结果
    1. 模型排名:Vaani Fast Conformer表现最好(Approach 3下WER为10.6%),Gemini-3.1-Pro次之(11.9%)。令人意外的是,GPT-4o-Transcribe表现极差(WER高达65.3%)。
    2. 评估方法的影响:从Approach 1(单参考均值)到Approach 3(多参考对齐),所有模型的WER均显著下降(如Vaani Fast Conformer从17.5%降至10.6%),证明多参考评估能有效消除因转录主观性带来的不公平惩罚。
    3. 地域偏见:通过计算各县平均WER的标准差,发现部分模型(如Google Chirp标准差达12.7)在不同地区表现极不稳定,存在严重的地域偏见。
  • 消融/分析揭示:转录员之间的两两WER在10.51%到13.62%之间,这证实了即使是专业人类转录员,对同一段音频的理解也存在天然差异,进一步印证了单参考评估的局限性。

5. 优势与局限

  • 主要优势
    1. 极高的包容性与真实性:覆盖广泛地域,采用图像引导的自发语音,比传统朗读数据集更贴近真实世界。
    2. 评估更公平:多参考转录与对齐算法有效解决了印地语转录主观性带来的评估偏差问题。
    3. 丰富的元数据:包含性别、地区邮编、语码转换标注和噪声事件标签,支持多维度的偏见与鲁棒性分析。
  • 局限性
    1. 数据规模较小:总时长仅约20小时,作为基准测试集足够,但可能无法完全捕捉所有微观方言的特征。
    2. 多模态评估未落地:虽然数据集具备“图像-音频-文本”多模态属性,但本文仅进行了ASR评估,尚未开展多模态检索或视觉 grounding 的实验。
    3. 人类标注上限:尽管采用多参考转录,转录员间仍存在10-15%的固有分歧,这意味着评估框架仍受限于人类语言感知的模糊性。

6. 关键结论与启发

  • 最重要的Takeaway:对于印地语这类缺乏严格正字法规范且方言众多的语言,传统的单参考WER评估会严重低估ASR模型的真实能力。引入多参考转录和对齐评估机制是实现公平评测的必由之路。
  • 启发与延伸方向
    1. 评估范式转移:未来的低资源语言或高方言变体语言ASR评测,应摒弃单一标准答案,转向多参考甚至LLM辅助的语义级评测。
    2. 多模态扩展:该数据集为印地语多模态大模型(MLLM)的评估提供了绝佳土壤,后续研究可基于此开展语音-图像跨模态检索、多模态对话等任务。
    3. 去偏见研究:利用数据集丰富的地域元数据,研究者可以针对性地诊断并修复ASR模型在特定地区或口音上的性能短板。
👀 推荐值得看
🏷️ 领域语音识别 (ASR) > 鲁棒性
💡 创新多参考转录对齐WER评估框架——基于传统单参考WER改进,为每段音频引入3个独立转录文本进行词级对齐评估,消除印地语转录主观性带来的不公平惩罚
⭐ 评分7.0
#7
eess.AScs.SD

Towards Detecting Neural Audio Codec Synthesized Heart Sounds 跨领域

Girish, Orchid Chetia Phukan, Mohd Mujtaba Akhtar, Bhavinkumar Vinodbhai Kuwar, Swarup Ranjan Behera 等 (6 人)
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: Accepted to INTERSPEECH 2026
查看摘要
In this paper, we introduce Synthetic Heart Sound Detection (SHAC), a task aimed at identifying phonocardiograms (PCGs) synthesized using neural audio codecs (NACs). To facilitate research in this direction, we release CARDIOFAKE, the first benchmark dataset for SHAC containing both real and codec-synthesized PCGs. We benchmark spectral representations (MFCC, LFCC) and self-supervised learning (SSL) representations (e.g., WavLM) for the task. Furthermore, we propose GROOT, a fusion framework that integrates spectral and SSL features for leveraging their complementary behavior. Experiments show that GROOT, combining MFCC and WavLM, achieves state-of-the-art performance, outperforming individual representations and competitive baselines.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文首次揭示了神经音频编解码器(NAC)能伪造极具欺骗性的心音生物特征这一新威胁,为此构建了首个虚假心音检测基准数据集CARDIOFAKE,并提出了一种融合频谱与自监督特征的框架GROOT来精准识别这些合成心音。

2. 研究背景与动机

  • 核心问题:如何检测由神经音频编解码器合成的虚假心音,以保护心音生物识别系统的安全。
  • 问题重要性:心音(PCG)因其与人体生理过程直接相关,一直被认为具有“天然防伪”的活体特性,是极具潜力的生物识别模态。然而,随着NAC技术的发展,攻击者现在能生成听感上与真实心音无异的合成录音,这直接打破了心音生物识别的安全防线。
  • 现有不足:过去针对语音、人脸等模体的反欺骗研究已非常成熟,但学术界尚未关注到NAC合成心音这一新兴威胁,缺乏相关的任务定义、基准数据集和有效的检测方法。

3. 核心方法

  • 提出的方法/框架:论文提出了GROOT(Fusion via GRammian Optimal TranspOrT)框架。这是一个双分支融合框架,将频谱特征(如MFCC)与自监督学习(SSL)特征(如WavLM)进行对齐与融合。
  • 关键创新点
    1. 定义新任务与新数据集:首创合成心音检测(SHAC)任务,并发布了包含7种不同NAC合成的CARDIOFAKE数据集。
    2. 异构特征互补假设:提出频谱特征对编解码器引起的声学微观失真敏感,而SSL特征擅长捕捉心音的宏观时序结构,两者具有互补性。
    3. Grammian最优传输:提出一种新的特征对齐机制。
  • 直觉性解释:可以把频谱特征看作“放大镜”,专门找编解码器留下的声学瑕疵;把SSL特征看作“全景图”,理解心音的整体节律。GROOT的核心思路是用一种改进的“最优传输”方法,把这两种视角的特征“翻译”并融合到同一个空间里。它不直接对比原始数据(容易受噪声干扰),而是对比它们内部特征之间的相关性矩阵(Gram矩阵),就像不比较两幅画的像素,而是比较它们的笔触风格,从而更稳健地将两种特征的优势结合。

4. 实验与结果

  • 数据集:自建的CARDIOFAKE(基于CirCor DigiScope真实心音数据集,通过7种NAC生成。分为Seen和Unseen两种测试设定以评估泛化性)。
  • 基线方法:单一特征(MFCC, LFCC, Wav2vec2, Unispeech-SAT, WavLM)+ 简单分类器(FCN, CNN);特征融合基线(简单拼接 Concat、普通最优传输 OT);通用音频深度伪造检测SOTA模型(AASIST, MiO)。
  • 主要实验结果
    1. 威胁验证:合成心音保留了极高的患者身份信息(Real→Fake识别率达86.29%),证明威胁真实存在。
    2. GROOT SOTA表现:在Seen设定下,GROOT (MFCC + WavLM) 取得了 93.20% 的准确率和 5.86% 的等错误率 (EER);在Unseen设定下,达到 86.10% 的准确率和 9.75% 的EER
    3. 超越强基线:大幅优于AASIST(Seen ACC 85.15%)和MiO(Seen ACC 86.98%)。
  • 消融实验揭示
    1. CNN下游模型优于FCN。
    2. 异构特征融合(频谱+SSL) consistently 优于同构特征融合,验证了互补性假设。
    3. GROOT的Gram-OT机制优于简单的Concat和普通OT。t-SNE可视化也显示GROOT学到的特征分离度更高。

5. 优势与局限

  • 主要优势
    1. 开创性与实用价值:填补了心音防伪领域的空白,数据集和基准测试为后续研究铺平了道路。
    2. 方法有效且泛化性强:GROOT不仅在Seen条件下表现优异,在Unseen(未见过的编解码器)条件下也保持了较强的检测能力。
  • 局限性(基于论文内容推断):
    1. 伪造手段单一:CARDIOFAKE目前仅通过NAC的“编码-解码”重合成循环生成假数据,未涵盖未来可能出现的基于文本或直接生成式的端到端心音伪造技术。
    2. 计算复杂度:Gram矩阵的计算和最优传输算法(Sinkhorn)在处理高维特征时可能带来较高的计算开销,论文中虽做了降维处理,但实际部署在边缘设备(如智能手表)仍可能面临挑战。
    3. 跨数据集验证缺失:实验仅在单一真实心音数据集(CirCor DigiScope)的衍生数据上进行,未验证模型在不同采集设备或环境下的跨域鲁棒性。

6. 关键结论与启发

  • 最重要的Takeaway:曾经被认为“天然防伪”的生理信号(心音)在深度学习编解码器面前同样脆弱。通过融合对底层声学失真敏感的频谱特征与对高层时序结构敏感的自监督特征,可以有效抵御这种新型欺骗攻击。
  • 启发与延伸方向
    1. 该研究为其他生理信号(如脑电图EEG、肌电图EMG)的生物识别防伪提供了重要参考。
    2. 未来的研究可以探索更轻量级的特征融合机制,以适应可穿戴设备的实时检测需求。
    3. 随着生成式AI的演进,构建包含更多样化伪造手段(如扩散模型生成)的心音防伪数据集是必要的延伸方向。
#8
eess.AScs.SD

Bridging the Age Gap: Towards Detecting Neural Audio Codec Synthesized Elderly Speech Deepfake 跨领域

Orchid Chetia Phukan, Girish, Mohd Mujtaba Akhtar, Chi-Chun Lee
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: Accepted to INTERSPEECH 2026
查看摘要
In this study, we introduce the Elderly CodecFake Detection (ECFD) task and release the Elderly-CodecFake (ECF) dataset in English and Chinese. We show that state-of-the-art CF detectors trained on previous benchmark CF datasets generalize poorly to elderly speech, revealing a critical vulnerability. We further hypothesize and demonstrate that multimodal foundation models (FMs) such as LanguageBind (LB) and ImageBind (IB) are more effective for ECFD due to their exposure to elderly content during cross-modal pretraining. Motivated by prior evidence that fusion of FMs enhances downstream performance, we explore fusion of FMs for ECFD. To this end, we propose BONSAI, a novel framework that employs Jensen-Shannon Divergence as the fusion mechanism. BONSAI with the fusion of LB and IB achieves an average EER (%) of 1.66 and outperforms individual FMs as well as competitive SOTA baselines, establishing a new benchmark for the ECFD task.

📖 深度解读

以下是为您结构化整理的这篇论文的中文解读报告:

1. 一句话总结

这篇论文针对“老年人语音深度伪造检测”这一盲区,构建了首个中英文老年人编解码器伪造(CodecFake)数据集,并提出了一种基于多模态基础模型融合的新框架BONSAI,显著提升了针对老年人伪造语音的检测性能。

2. 研究背景与动机

  • 核心问题:现有的语音深度伪造检测器(特别是针对神经音频编解码器生成的伪造语音,即CodecFakes)在老年人语音上的检测失败率极高,存在严重的跨年龄泛化鸿沟。
  • 重要性:随着音频语言模型的爆发,伪造语音越发逼真。老年人本身是语音诈骗的易受害群体,且老年人语音具有独特的声学特征(如气声增多、音高不稳定、节奏不规则),这使得现有检测模型在面对老年人伪造语音时显得尤为脆弱。
  • 现有不足:目前的伪造检测数据集几乎全由年轻成年人语音构成,忽略了年龄多样性;同时,传统的纯语音基础模型(如Wav2vec2)未能很好地捕捉与年龄相关的隐式声学线索,导致在老年人语音上表现拉胯。

3. 核心方法

  • 提出的框架/任务:论文提出了“老年人编解码器伪造检测(ECFD)”任务,发布了ECF数据集,并提出了一种名为BONSAI的基础模型融合框架。
  • 关键创新点
    1. 新任务与新基准:首次定义ECFD任务,并利用14种不同的神经音频编解码器(NAC)构建了包含中英文的老年人伪造语音数据集。
    2. 多模态基础模型的引入:打破常规,不使用纯语音模型,而是选用多模态基础模型(LanguageBind和ImageBind)提取音频特征。其直觉依据是:这些模型在跨模态预训练中“看”过大量包含老年人的视觉和场景信息,能隐式捕捉年龄相关的线索。
    3. 基于JSD的融合机制:提出BONSAI框架,使用詹森-香农散度(Jensen-Shannon Divergence, JSD)作为损失函数,对齐并融合不同基础模型的特征分布。
  • 直觉性解释:现有的检测器只听过年轻人的假语音,遇到老年人的声音就“懵了”(因为老年人声音本身就有气声、颤抖等特点,容易被误判)。论文发现,那些不仅懂语音,还懂图像、视频的多模态大模型(因为见过各种老年人的画面和声音配合),更能理解老年人声音的“韵味”。于是,BONSAI框架就像一个“双脑协同”系统,把两个多模态大模型(LB和IB)的听觉能力提取出来,用JSD散度强行让它们的特征分布“对齐”(达成共识),从而更精准地揪出伪造的老年人语音。

4. 实验与结果

  • 数据集:自建的ECF数据集(英文TIS语料库 + 中文SeniorTalk语料库),包含超85万条伪造老年人语音样本。
  • 基线方法:AASIST、Wav2vec2-AASIST,以及Wav2vec2、WavLM、Whisper、ImageBind (IB)、LanguageBind (LB)等基础模型配合AASIST或CNN分类器。
  • 主要实验结果
  • 跨年龄泛化差:在现有基准上训练的SOTA模型,在年轻人语音上EER为14.07%,但在老年人语音上EER飙升至27.45%,性能几乎减半。
  • 多模态优于单模态:在ECF数据集上,多模态基础模型(LB、IB)全面超越纯语音基础模型(Wav2vec2、WavLM、Whisper)。
  • SOTA性能:BONSAI融合LB和IB后,取得了平均1.66%的极低等错误率(EER),创下该任务的新纪录。
  • 消融实验揭示:简单的特征拼接效果不如BONSAI的JSD对齐机制;同时发现轻量级的CNN作为下游分类器比复杂的AASIST表现更好(AASIST在此场景下容易过拟合)。

5. 优势与局限

  • 主要优势
    1. 填补空白:具有极强的社会现实意义,首次将语音防伪的关注点延伸至易受害的老年群体。
    2. 视角新颖:巧妙利用多模态基础模型的跨模态先验知识来解决音频领域的特定难题,且JSD融合机制轻量有效。
  • 局限性
    1. 因果性论证不足:论文声称多模态模型表现好是因为“预训练时接触了老年人视觉内容”,但这仅停留在假设阶段,文中缺乏直接的探针实验或可视化证据来严格证明这一因果关系。
    2. 伪造类型单一:数据集的伪造样本仅通过NAC编解码过程生成,未涵盖针对老年人音色定制的高级TTS或VC攻击,与真实世界中直接克隆老年人声音的攻击手段仍有差异。
    3. 语言多样性有限:目前仅包含中英文,对更多语种的覆盖不足。

6. 关键结论与启发

  • 核心Takeaway:深度伪造检测模型在人口统计学特征(如年龄)上存在严重的偏见与脆弱性;跳出纯语音范畴,引入多模态基础模型的跨模态先验,是提升特定群体语音防伪鲁棒性的有效路径。
  • 后续启发
    1. 未来防伪研究应更加关注“弱势群体”(老年人、儿童、带口音人群等),建立更加包容和公平的评测基准。
    2. 可以探索将其他模态的先验知识(如人脸、情感、生理特征)通过更先进的融合或对齐技术引入到音频伪造检测中。
    3. JSD作为一种分布对齐手段,可被推广至其他需要融合异构基础模型表征的下游任务中。
#9
eess.AScs.SD

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era 跨领域

Masao Someki, Alexander Polok, Carlos Carvalho, Chyi-Jiunn Lin, Da-Hee Yang 等 (17 人)
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: Accepted at Interspeech 2026
查看摘要
Recent speech research involves increasingly large datasets, complex models, and diverse experimental workflows. However, existing frameworks require substantial engineering effort to support such experiments. We present ESPnet3, a speech and audio research framework built on a modular system architecture with configuration-driven dataset composition and unified Python-based workflows. ESPnet3 introduces a DataOrganizer abstraction for flexible dataset integration and dataset sharding for memory-efficient large-scale training, while allowing recipe-specific logic through lightweight stage overrides. In OWSM pre-training experiments, ESPnet3 reduces per-epoch training time by \emph{21.1 minutes} compared to ESPnet2 and achieves \emph{>80\% GPU utilization} in multi-node training. Fine-tuning experiments show that new models and datasets can be integrated with around \emph{46 lines of additional code}. ESPnet3 will be publicly released with model checkpoints and training logs.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了ESPnet3,一个面向基础模型时代的模块化语音与音频研究框架,通过配置驱动的数据抽象和内存高效的数据分片技术,解决了大规模语音训练中工程代码冗余和内存开销过大的问题。

2. 研究背景与动机

  • 核心问题:随着语音研究进入基础模型时代,训练数据扩展到数百万小时,模型参数量达到数十亿,现有框架在系统层面(如多数据集组合、高效数据迭代、分布式训练、外部大模型集成)面临严重瓶颈。
  • 重要性:现代语音研究不仅需要强大的模型,更需要可扩展的基础设施来支撑大规模实验。如果工程实现成本过高,将严重制约研究人员的探索效率。
  • 现有方法不足:以ESPnet2为代表的传统框架将实验逻辑与核心组件高度耦合,扩展极其困难(例如,为Whisper添加LoRA支持需修改20多个文件、670行代码);且缺乏处理超大规模数据的内存管理机制。虽然ESPnet-EZ简化了微调流程,但不支持从零开始的大规模训练。

3. 核心方法

  • 提出框架:ESPnet3。该框架采用模块化系统架构,将通用工作流集中化,将实验特定逻辑保留在轻量级“配方”中。
  • 关键创新点
    1. 配置驱动的数据抽象:引入基于Hydra的DataOrganizer,将数据集视为模块化组件。只需修改YAML配置文件即可增删数据集,无需修改管道代码。
    2. 数据集分片:采用rank感知的分片轮换机制进行数据迭代,避免在每个epoch重新加载整个数据集,极大降低了内存开销。
    3. 模块化系统架构:引入BaseSystem抽象层集中管理数据处理、训练、推理等通用阶段,实验特定功能只需轻量级覆盖。
  • 直觉性解释:ESPnet3就像把一个高度定制化的“手工坊”改造成了“现代化流水线”。以前换个原料(数据集)或加个新工具(如LoRA),要把整条流水线拆了重装;现在只需在控制台(YAML配置)按个开关,流水线就会自动适配。同时,面对海量数据,它不再一次性全塞进内存,而是切成小块(分片)轮流按需加载,既快又省内存。

4. 实验与结果

  • 数据集/基准:OWSM V4预训练(约32万小时语音)、CHiME-4(测试集);微调实验使用FalAR(5千小时欧洲葡萄牙语议会语音)和CAMÕES基准。
  • 基线方法:ESPnet2。
  • 主要实验结果
  • 训练效率:在OWSM预训练中,ESPnet3将每个epoch的训练时间从95.3分钟降至74.2分钟(减少21.1分钟),多节点训练GPU利用率稳定在80%以上。
  • 内存与速度:数据集内存占用从35.9GB骤降至73.1MB,数据刷新时间从311.5秒降至13.1秒。
  • 代码量缩减:OWSM训练配方的编排代码从2289行缩减至70行;集成新的HuggingFace数据集仅需46行代码(ESPnet2需374行,相对减少87.7%)。
  • 微调效果:Whisper Large v3在CAMÕES基准上微调后,WER从22.65%降至19.42%(全量微调)和19.47%(LoRA)。
  • 消融实验:通过DataOrganizer无缝加入数据增强功能后,CHiME-4测试集上的WER从12.84%降至12.53%,证明了标准训练流程与新数据管道的兼容性。

5. 优势与局限

  • 主要优势
    1. 极高的工程效率:大幅降低大规模训练和新模型/数据集集成的代码编写量。
    2. 卓越的大规模扩展性:数据分片机制完美解决了百万小时级数据的内存瓶颈,多节点GPU利用率高。
    3. 生态兼容性强:纯Python工作流,无缝对接HuggingFace Datasets、PEFT等现代深度学习生态。
  • 局限性
    1. 评估视角偏向系统侧:论文主要聚焦于框架的工程实现与效率,未深入展示模型在各项SOTA榜单上的绝对性能突破(例如OWSM在CAMÕES上的结果尚未给出)。
    2. 硬件门槛较高:实验主要在H100多节点集群上验证,对于算力有限的中小型实验室,其大规模训练优势可能难以完全复现。
    3. 学习曲线转移:虽然降低了配方编写难度,但引入了Hydra、PyTorch Lightning等新依赖,老用户需要一定的学习成本来适应新的架构范式。

6. 关键结论与启发

  • 最重要的Takeaway:在基础模型时代,研究框架的设计重心必须从单纯的“模型实现”转向“系统级解耦与数据流优化”。通过模块化设计和数据抽象,可以显著释放研究人员的工程压力,使其专注于算法创新。
  • 对后续研究的启发:ESPnet3的DataOrganizer和分片机制为处理超大规模多模态数据提供了优秀范例。未来研究可以基于此框架,更轻松地探索多模态系统、复杂的PEFT策略,以及将语音模型与其他外部工具链集成的多任务管道。
#10
eess.AScs.SD
KAIST - Korea Advanced Institute of Science & Technology (QS Top 100)Chinese University of Hong Kong (CUHK) (QS Top 100)

ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion 跨领域

Jeongsoo Choi, Ji-Hoon Kim, Shujie Hu, Joon Son Chung
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: Interspeech 2026
查看摘要
Neural speech codecs efficiently compress speech and have become a foundation for speech generation, but they are typically learned as holistic representations that intertwine linguistic content, speaker identity, and prosody. While this design is effective for zero-shot voice cloning, it hinders downstream tasks that require prosody preservation or transfer, such as voice conversion. To address this, we introduce ProsoCodec, a prosody-oriented speech codec that models prosody as a conditional residual rather than as a disentangled stream. Specifically, by conditioning both the encoder and decoder on text and speaker embeddings as prefix tokens, the discrete bottleneck is encouraged to capture prosodic variation not explained by content and speaker. To further preserve prosody, we use the low-frequency mel band and train the model on paired same-speaker utterances. Experiments on voice conversion show improved prosody preservation and reduced source-timbre leakage.

📖 深度解读

以下是对论文《ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion》的结构化中文解读报告:

1. 一句话总结

本文提出了一种面向韵律的语音编解码器 ProsoCodec,通过将文本和说话人特征作为已知条件,让模型离散瓶颈专门负责捕获“残差韵律”,并结合双话语训练策略,有效解决了语音转换中源语音韵律丢失和参考音色泄漏的问题。

2. 研究背景与动机

  • 核心问题:在零样本语音转换任务中,如何改变说话人音色,同时严格保留源语音的 linguistic content(文本内容)和 prosody(韵律,如语调、节奏)。
  • 问题重要性:现有的神经语音编解码器通常将内容、音色和韵律纠缠在一起编码。这种整体表示虽然有利于语音克隆,但极大地阻碍了需要对韵律进行独立保留或迁移的下游任务。
  • 现有方法不足:传统方法试图通过对抗训练或信息瓶颈将语音强行解耦为内容、音色、韵律等独立子项。然而,韵律并非完全独立的属性,它高度依赖于说话人和文本内容。强制剥离说话人特征往往会丢失说话人特有的韵律细节,导致表现力下降;此外,基于提示的生成方法容易整体模仿参考音频,导致参考音频的韵律“泄漏”到输出中,覆盖了源音频的韵律。

3. 核心方法

  • 提出方法:ProsoCodec,一种基于扩散自编码器架构、面向韵律建模的语音编解码器。
  • 关键创新点
    1. 条件残差建模:不采用脆弱的对抗性解耦,而是利用成熟的 ASR 和 SV 模型提取文本和说话人特征,作为前缀 token 提供给编解码器。离散瓶颈被强制只能编码“扣除内容和音色后剩下的残差韵律”。
    2. 双话语训练策略:训练时,使用同一说话人的两段不同语音,一段作为源语音,另一段作为参考提示。这打破了参考与源的同源性,迫使模型放弃从参考中复制韵律,从而保留源语音的韵律。
    3. 低频 Mel 频带限制:由于韵律信息主要集中在低频区域,编码器仅接收低频 Mel 频谱作为输入,过滤掉精细的声学细节,进一步逼迫离散 token 专注编码韵律。
  • 直觉性解释:与其费力把一团乱麻(语音)拆成三根独立的线(内容、音色、韵律),不如直接把其中两根线(内容和音色)的外部信息直接“喂”给模型,告诉它“这两部分我已经知道了,你不用再管”。这样,模型中那个容量很小的信息瓶颈(离散量化器)就只能用来存储剩下的那部分信息(韵律)。同时,为了防止模型在生成时“偷看”参考音频的韵律,训练时故意给模型看同一说话人的两段不同录音,让它明白参考音频只提供音色,韵律必须老老实实从源语音拿。

4. 实验与结果

  • 数据集:训练集为 LibriTTS;测试集为 LibriTTS test-clean, test-other 以及域外的 VCTK 数据集。
  • 基线方法:DDDM-VC, UniAudio, HierSpeech++, FACodec, Seed-VC, Vevo。
  • 主要实验结果
  • ProsoCodec 在内容保留上表现最佳(WER 4.451)。
  • 在抑制源音色泄漏上表现最佳(SIMs 0.167,越低越好),目标音色相似度最高(SIMr 0.565)。
  • 在主观韵律相似度评分(P-MOS)上以 3.852 显著领先,且自然度(N-MOS 4.000)与最优基线 Vevo 相当。
  • 消融实验揭示
  • 去除文本条件会导致 WER 灾难性上升至 86.6,证明文本先验对内容保留至关重要。
  • 去除双话语训练会导致 RMSE 上升,证明其有效防止了提示风格泄漏。
  • 去除低频限制或说话人条件均会导致不同维度的性能下降。
  • 瓶颈配置实验表明:重建质量好不等于转换质量好,高比特率会导致源音色泄漏,最终选择 12.5Hz 帧率和 4096 码本大小(150 bps)作为最佳平衡点。

5. 优势与局限

  • 主要优势
    1. 思路简洁有效:用“提供已知条件求残差”代替“强行解耦”,避免了对抗训练的不稳定性,更好地保留了说话人相关的韵律细节。
    2. 直击痛点:双话语训练策略巧妙解决了基于上下文提示生成的语音转换中普遍存在的“提示风格泄漏”问题。
    3. 综合性能强:在内容准确率、音色转换度和韵律保留度三个维度上实现了最佳平衡。
  • 局限性(基于论文信息推断与提取):
    1. 高度依赖外部模型:模型性能的上限受制于预训练 ASR 和 SV 模型的准确性,若外部模型在特定口音或噪声环境下失效,编解码器也会随之崩溃。
    2. 信息损失与权衡:为了专注韵律,编码器丢弃了高频声学细节,虽然有利于语音转换,但可能限制了其在需要高保真全频带重建任务中的通用性。
    3. 训练数据要求:双话语训练策略需要同一说话人的多段语音配对,虽然在大规模数据集(如 LibriTTS)中容易满足,但在数据稀缺场景下可能受限。

6. 关键结论与启发

  • 核心 Takeaway:韵律不应被视为可以完全剥离的独立属性,而应被建模为基于文本和说话人的“条件残差”。通过显式提供强先验并限制输入频带,可以引导离散编解码器自发地捕获纯韵律信息。
  • 启发与延伸方向
    1. 解耦新范式:这种“条件残差”的思路可以推广到其他多模态或语音生成任务中(如情感迁移),避免复杂的对抗网络设计。
    2. 上下文学习的陷阱:当前大模型流行的基于提示的生成方式容易导致“整体模仿”,ProsoCodec 的双话语训练策略为解决此类“风格泄漏”问题提供了通用启示。
    3. 下游任务定制 Codec:证明了通用高保真 Codec 不一定适合所有下游任务,针对特定任务(如 VC)定制具有信息偏向性的 Codec 是更有前景的方向。
🔥 推荐必读
🏷️ 领域语音转换 (VC / SVC) > 语音转换 (VC)神经音频编解码器 > 声学编解码器
💡 创新面向韵律的语音编解码器——基于扩散自编码器架构,引入条件残差建模(将文本和说话人特征作为前缀条件使离散瓶颈专编码残差韵律)、双话语训练策略(防止提示风格泄漏)及低频Mel频带限制
⭐ 评分8.0
#11
eess.AScs.SD
University of New South Wales (UNSW Sydney) (QS Top 100)

Using Phonological-Level Wav2Vec2 for Mandarin Automatic Mispronunciation Detection and Diagnosis 跨领域

Jinghao Chen, Mostafa Shahin, Beena Ahmed
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: Accepted to Interspeech 2026. Camera-ready version
查看摘要
Automatic mispronunciation detection and diagnosis (MDD) plays a crucial role in L2 Mandarin pronunciation learning. While end-to-end (E2E) based MDD methods have substantially improved phoneme-level detection accuracy, diagnostic feedback remains limited, as segmental and tonal errors are not explicitly separated. In this paper, we propose a phonological feature-based MDD framework that models both segmental and tonal attributes within a unified Wav2Vec2 CTC architecture. Experimental results show that the proposed method reduces the False Acceptance Rate (FAR) by 10.1% and the Diagnostic Error Rate (DER) by 23.6% compared with the phoneme-only baseline system. By decomposing phonemes into low-level phonological components, the proposed approach enables more detailed and interpretable diagnostic feedback for L2 learners.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种基于音系特征的Wav2Vec2-CTC框架,通过将普通话音素分解为音段和声调属性进行联合建模,不仅提高了二语学习者发音错误检测的准确率,还能提供更细致、可解释的诊断反馈。

2. 研究背景与动机

  • 核心问题:普通话自动发音错误检测与诊断(MDD)中,现有方法通常只给出音素级别的对错判断,缺乏对错误原因(如舌位、唇形、音高变化)的具体诊断。
  • 重要性:普通话拥有独特的“声韵调”系统,对于二语学习者来说,发音错误往往涉及细微的发音方式或声调偏差。提供细粒度的反馈对于计算机辅助发音学习(CAPL)至关重要。
  • 现有不足:尽管基于Wav2Vec2的端到端模型大幅提升了检测准确率,但它们将音段(声母/韵母)和声调混在一起建模,没有显式区分。虽然“语音属性建模”在英语等非声调语言中已被证明能提供好的解释性,但在普通话中应用较少,且尚未有统一框架将声调相关的音高特征与音段特征结合在一起。

3. 核心方法

  • 提出方法:一种基于音系特征的普通话MDD框架。该框架基于Wav2Vec2-CTC架构,分两阶段工作:先在母语普通话数据上训练语音属性预测模型,再将其应用于二语学习者的语音进行错误诊断。
  • 关键创新点
    1. 构建了整合音段与声调的属性清单:将普通话IPA音素拆解为发音方式、发音部位、元音特征及声调特征等多维二进制向量。
    2. 统一的属性级建模框架:首次在同一个Wav2Vec2骨干网络中联合训练音段和声调属性。
    3. 多级诊断反馈机制:通过对比预测属性与标准属性,不仅能指出音素读错了,还能具体指出是哪个发音特征(如“送气”或“唇形”)出错。
  • 直觉性解释:传统的发音纠错就像一个老师只告诉你“这个字读错了”,但不说为什么。本文的方法相当于给AI装了一个“发音X光机”。它把每个音素拆解成更底层的“发音动作标签”(比如:舌尖音、圆唇音、高音平调)。系统先在标准普通话上学会听这些底层动作,然后再去听外国学生发音。如果学生读错了,系统能精准定位到是哪个发音动作变了形,从而给出极其具体的纠错建议。

4. 实验与结果

  • 数据集
  • 训练集:Common Voice 13-CN (CV13-CN,母语普通话)
  • 跨语料库测试:AISHELL-1 (母语)
  • MDD评估测试:LATIC (非母语学习者,含俄/韩/法/阿拉伯语母语背景)
  • 基线方法:Wav2Vec2-XLSR-53 音素级识别模型,以及文献中的 Pitch-aware RNN-T 模型。
  • 主要实验结果
  • 音素级MDD:相比Wav2Vec2基线,本文最优属性模型(IPA-D×Tone-CAT)将误拒率(FAR)从9.97%降至8.15%(相对降低10.1%);相比Pitch-aware RNN-T,诊断错误率(DER)从31.80%降至27.86%(相对降低23.6%)。
  • 属性级MDD:在声调混淆检测上,属性级评估相比音素级评估,FAR平均降低了约72%。
  • 消融实验揭示
  • 在音段建模上,将双元音拆解为单元音(IPA-D)比将其作为整体(IPA-S)效果好得多,AER相对降低超40%。
  • 在声调建模上,使用音高目标描述符比简单的分类标签在声调特定诊断上表现更好,但整体AER受音段建模影响更大。

5. 优势与局限

  • 主要优势
    1. 诊断解释性强:突破了传统模型只给“对/错”评分的局限,能明确指出发音错误的具体生理或声学特征。
    2. 性能提升显著:在降低误判率和诊断错误率方面优于强大的Wav2Vec2基线。
    3. 首次实现统一建模:填补了普通话声调与音段属性联合建模的空白。
  • 局限性
    1. 敏感度过高:属性级建模对微小声学偏差过于敏感,导致正确发音被误判为错误的比例略有上升。
    2. 高音平调建模困难:Tone-PT策略在处理一声和二声结尾的高音高时错误率较高,说明声调特征表示仍需优化。
    3. 数据稀疏性影响:由于LATIC数据集中特定的发音错误样本较少(平均每对混淆音素仅约53个样本),部分细粒度评估指标的稳定性可能受限。

6. 关键结论与启发

  • 核心Takeaway:将音素分解为底层的音系和声调属性进行建模,不仅能提升普通话MDD系统的整体性能,更是实现高可解释性、细粒度发音诊断的有效途径。
  • 后续启发
    1. 未来的声调建模可以探索更鲁棒的音高特征表示方法,以解决高音平调难以预测的问题。
    2. 论文提到未来计划利用语音合成技术生成错音数据进行增强,这提示在稀缺的二语错音场景下,生成式AI将是提升模型鲁棒性的重要方向。
    3. 这种“属性分解”的思路不仅适用于普通话,也可启发其他具有复杂声调或重音系统的二语发音评估研究。
👀 推荐值得看
🏷️ 领域评估与口语学习 > 发音评测/检错 (CAPT)
💡 创新音系级发音错误诊断——基于Wav2Vec2-CTC,将普通话音素分解为音段和声调属性进行联合建模
⭐ 评分7.5
#12
eess.AScs.SD

How Well Do Self-Supervised Speech Models Encode Age and Gender in Children's Speech? A Layer-Wise Analysis Across Multiple Architectures 跨领域

Abhijit Sinha, Hemant Kumar Kathania, Mohit Joshi, Harishankar Kumar, Shrikanth Narayanan 等 (6 人)
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Machine Learning (cs.LG); Sound (cs.SD)
查看摘要
Self-supervised learning (SSL) models have become a central component of modern speech processing systems, as they enable the learning of rich acoustic representations without reliance on labeled data. Despite their success on adult speech, it remains unclear how effectively these models capture speaker-related attributes such as age and gender in children's speech, which differs substantially from adult speech due to ongoing physiological and cognitive development. Higher pitch, increased articulatory variability, and age-dependent acoustic changes make children's speech a particularly challenging domain. In this work, we present a comprehensive analysis of how age and gender information is encoded across layers of four widely used SSL models: Wav2Vec2, HuBERT, Data2Vec, and WavLM. Layer-wise features are extracted and evaluated using a lightweight CNN on two benchmark children's speech corpora, PFSTAR and CMU Kids. To analyze feature compactness and redundancy, PCA is applied to identify redundancy and highlight the dimensions that contribute most to classification performance. Experimental results show that age- and gender-related information is unevenly distributed across SSL layers, with early to mid-level layers encoding the strongest paralinguistic cues. HuBERT achieves the best overall performance for age classification, while Wav2Vec2 and HuBERT lead gender classification on PFSTAR and CMU Kids, respectively. Beyond single-split evaluation, we further demonstrate that these findings remain stable under speaker-wise cross-validation, layer aggregation, and cross-database evaluation, indicating robustness to data imbalance and domain mismatch. Finally, we show that reliable age and gender classification is achievable even from short speech segments of 1--3 seconds.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文通过逐层提取并分析四种主流自监督语音模型(SSL)的特征,发现其浅层和中层特征能最有效地识别儿童语音中的年龄和性别,且该方法在短语音和跨数据集等实际场景下表现出良好的鲁棒性。

2. 研究背景与动机

  • 核心问题:如何准确从儿童语音中分类年龄和性别信息。
  • 重要性:此技术对于构建安全、个性化的儿童数字产品(如年龄适宜的内容推荐、自适应教育材料、隐私保护等)至关重要。
  • 现有不足:儿童语音因生理和认知发育尚未成熟,具有音高波动大、共振峰不稳定等高变异性,传统声学特征(如MFCC)难以有效建模;同时儿童语音标注数据稀缺。尽管自监督学习(SSL)在成人语音处理上大获成功,但直接应用或微调往往掩盖了模型内部具体哪一层在起作用,其在儿童语音副语言信息编码上的表现仍属未知。

3. 核心方法

  • 提出框架:提出了一种基于“冻结SSL模型逐层特征提取 + 轻量级1D CNN分类器 + PCA降维”的分析框架。
  • 关键创新点
    1. 逐层评估机制:不微调SSL模型,而是提取每一层的特征输入到统一的轻量级CNN中,精确定位编码年龄和性别信息的“黄金层”。
    2. 特征冗余优化:引入PCA降维,证明少量主成分即可保留核心判别力,剔除冗余特征。
    3. 多维度鲁棒性验证:设计了短语音片段测试、跨数据集评估、层聚合和K折交叉验证,全面模拟真实落地场景。
  • 直觉性解释:把SSL模型想象成一个多层蛋糕。通常人们认为越深层的蛋糕越“高级”(语义丰富),但本文发现,对于判断儿童年龄和性别这种“听音色”的任务,最有效的信息藏在靠近表层的浅层和中层(保留了基础声学特征如音高、音色)。深层反而因为过度关注语言内容而丢失了这些副语言线索。此外,通过PCA“挤水分”,发现只需极少量的核心特征就能做出准确判断。

4. 实验与结果

  • 数据集:PFSTAR(英式英语,4-14岁)和 CMU Kids(美式英语,6-11岁)。
  • 基线方法:26维MFCC特征 + CNN。
  • 主要实验结果
  • 逐层表现:浅层/中层特征远超深层。HuBERT在年龄分类上表现最佳(PFSTAR: 87.40%, CMU Kids: 97.33%);Wav2Vec2和HuBERT在性别分类上领先(PFSTAR: ~94.57%, CMU Kids: 98.00%),均显著超越MFCC基线。
  • PCA降维:降维后性能不降反升。例如HuBERT在CMU Kids上仅用32维特征,性别分类准确率达98.51%。
  • 年龄分组:将细粒度年龄合并为大组(如4-6, 7-9, 10-13岁)后,准确率大幅提升(PFSTAR达93.80%),但低龄儿童(4-6岁)仍是最难分类的群体。
  • 短语音测试:1-3秒的短语音即可实现可靠分类,3秒片段效果最佳(如CMU Kids性别分类达92.44%)。
  • 消融/鲁棒性实验揭示:跨数据集测试中SSL比MFCC泛化更好;层聚合(取前几层均值)比单层选择更稳定;K折交叉验证证明结果非偶然数据划分所致。

5. 优势与局限

  • 主要优势
    1. 强解释性:清晰揭示了SSL模型内部处理副语言信息的机制(浅中层优于深层),为未来儿童语音任务的特征选择提供了明确指导。
    2. 实用与高效:无需微调大模型,结合PCA降维和轻量级CNN,计算成本低;且在1-3秒短音频上有效,极具落地价值。
    3. 验证极其扎实:通过跨数据集、交叉验证、层聚合等多重实验,充分证明了结论的稳健性。
  • 局限性
    1. 数据集局限:仅使用了两个英语数据集,未涉及其他语种或更复杂的真实噪声环境。
    2. 低龄儿童表现受限:尽管方法有效,但对4-6岁等低龄儿童的分类准确率依然相对较低,该群体极高的语音变异性仍是未解难题。
    3. 分类粒度依赖:年龄分类高度依赖于人为设定的年龄分组,若要精确到具体岁数(回归任务),模型表现可能受限。

6. 关键结论与启发

  • 最重要的Takeaway:在使用SSL模型处理儿童语音的副语言任务(如年龄、性别识别)时,“越深越好”是个误区,浅层和中层特征才是真正的“金矿”;且这些特征存在大量冗余,可以通过简单的PCA大幅压缩以利于边缘部署。
  • 启发与延伸方向
    1. 未来可探索专门针对儿童语音的SSL预训练方法,强化浅中层对儿童特有声学特征的捕捉。
    2. 此框架可延伸至其他儿童副语言任务(如情绪识别、语音障碍检测),验证浅层特征是否同样具有统治力。
    3. 针对低龄儿童(4-6岁)分类困难的问题,后续研究可探索结合生理发育特征或多模态信息来提升识别率。
👀 推荐值得看
🏷️ 领域副语言与健康 > 属性识别自监督表征学习 > 语音 SSL
💡 创新儿童语音年龄与性别识别——基于自监督语音模型逐层特征提取与PCA降维,结合轻量级CNN分析并定位浅中层黄金特征
⭐ 评分7.5
#13
eess.AScs.SD

DSSCNet: A Transfer Learning Framework for Cross-Corpus Dysarthric Speech Severity Classification 跨领域

Arnab Kumar Roy, Hemant Kumar Kathania, Paban Sapkota, Sudarsana Reddy Kadiri, Shrikanth Narayanan
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Sound (cs.SD)
查看摘要
Dysarthric speech severity classification is challenging due to speaker variability, class imbalance, and limited datasets. This study introduces DSSCNet, a deep learning model that employs transfer learning and multi-corpus learning to enhance speaker-independent classification. By pre-training on one dysarthric speech corpus and fine-tuning on another, DSSCNet achieves improved feature extraction and cross-corpus generalization. Experimental results demonstrate that DSSCNet outperforms state-of-the-art models for speaker-independent severity classification, achieving 75.80\% accuracy on TORGO and 68.25\% on UA-Speech, significantly reducing misclassification errors. The findings confirm that leveraging knowledge transfer between datasets improves model robustness, making DSSCNet well-suited for automated dysarthria assessment. This research contributes to the development of more effective assistive speech technologies for individuals with speech impairments.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了DSSCNet模型,通过在两个构音障碍语音数据集之间进行跨语料库的迁移学习(预训练+微调),有效提升了模型对未知说话人语音严重程度分类的泛化能力和准确率。

2. 研究背景与动机

  • 核心问题:实现对构音障碍(一种神经运动言语障碍)语音严重程度的说话人无关自动分类。
  • 重要性:准确的严重程度分类不仅能辅助言语病理学家制定个性化治疗方案,还能提升针对言语障碍者的自动语音识别(ASR)系统的性能,改善人机交互的可及性。
  • 现有不足:传统机器学习方法依赖手工特征,泛化能力差;现有深度学习方法面临构音障碍数据集规模小、严重程度类别分布不均、以及模型难以跨未知说话人泛化等严峻挑战。单数据集训练容易导致模型过拟合,鲁棒性不足。

3. 核心方法

  • 方法/模型:论文提出了DSSCNet(构音障碍语音严重程度分类网络),并结合了跨语料库微调框架。
  • 关键创新点
    1. 复合型深度特征提取架构:将基础CNN、SENet(挤压与激励网络)和ResNet(残差网络)结合,兼顾局部频谱特征提取、通道注意力加权与深层残差特征学习。
    2. 跨语料库迁移学习策略:打破单数据集训练局限,在A数据集上预训练学习通用病理语音表征,再在B数据集上微调以适应特定评估场景。
    3. 针对类别不平衡的优化:在交叉熵损失函数中引入类别特定权重,确保少数严重程度类别在训练中得到充分学习。
  • 直觉性解释:模型首先将语音转化为声学“指纹图”(Mel语谱图)。然后像“调音台”一样,先用SENet自动放大与病情相关的关键声音通道特征,过滤掉无关信息;接着用ResNet像剥洋葱一样深入学习最复杂的病理特征。更重要的是,模型采用了“见多识广”的策略:先在一个大型医院的数据集(语料库A)上学个大概,再去另一个数据集(语料库B)上针对性特训,这样遇到完全没见过的患者时,也能凭借积累的经验做出准确判断。

4. 实验与结果

  • 数据集:TORGO(8名患者,3个严重等级)和 UA-Speech(12名患者,4个严重等级)。
  • 基线方法:CNN (Mel-Spectrogram)、CNN with HuBERT、DNN with MFCC、CNN with DeepSpeech。
  • 主要实验结果
  • 在说话人相关(Speaker-Dependent)设置下,DSSCNet在TORGO和UA-Speech上分别达到97.66%和98.94%的极高准确率。
  • 在更具挑战性的说话人无关(SI)设置下,无微调的DSSCNet已优于所有基线(TORGO: 56.84%, UA-Speech: 62.62%)。
  • 经过跨语料库微调后,性能大幅跃升:在TORGO上达到75.80%(比基线最高提升26.53%),在UA-Speech上达到68.25%(比基线最高提升14.35%)。
  • 消融实验揭示
    1. 相比于简单的“CNN+SE”基线,加入ResNet模块的完整DSSCNet架构在有无微调的情况下均表现更好,证明了深层残差结构的有效性。
    2. 混淆矩阵显示,跨语料微调显著降低了相邻严重程度(如Medium与High)之间的误判率。

5. 优势与局限

  • 主要优势
    1. 出色的泛化能力:通过跨语料库迁移学习,有效缓解了医疗语音数据稀缺导致的未知说话人泛化差的问题。
    2. 架构设计合理:SENet的注意力机制与ResNet的深层特征提取能力互补,能有效捕捉细微的病理语音特征。
    3. 兼顾类别不平衡:加权损失函数提升了模型对样本较少的严重程度类别的识别能力。
  • 局限性
    1. 相邻等级混淆仍存在:尽管微调降低了误判,但Medium和High等相邻严重程度的分类准确率(如UA-Speech上的Medium仅为55%)依然不够理想。
    2. 数据集定义不完全对齐:TORGO只有3个等级,而UA-Speech有4个等级,跨数据集迁移时存在标签空间不对齐的问题,论文未详细说明如何处理这种语义鸿沟。
    3. 未结合前沿自监督模型:虽然论文在背景中提到了wav2vec 2.0和HuBERT,但DSSCNet主干仍基于传统CNN/ResNet,未充分利用大规模无监督预训练模型的潜力。

6. 关键结论与启发

  • 最重要的Takeaway:在医疗语音处理领域,跨语料库的“预训练+微调”范式是提升模型在未知患者身上鲁棒性的极其有效的方法,其带来的收益(绝对准确率提升近20%)远超单纯改进网络结构。
  • 启发与延伸方向
    1. 未来可探索将wav2vec 2.0等大规模自监督模型作为特征提取器前端,与DSSCNet的注意力/残差后端结合,可能进一步突破当前的准确率瓶颈。
    2. 可以引入多模态信息(如面部肌肉运动、视频等),因为构音障碍不仅是声学问题,更是神经运动问题,多模态融合有望解决单纯依赖音频难以区分相邻严重程度的问题。
#14
eess.AScs.SD
KAIST - Korea Advanced Institute of Science & Technology (QS Top 100)

Learning from Audio-Dependency Errors: Data Curation Strategies Based on Model Confusion Patterns in Audio Question Answering 跨领域

Hyeonuk Nam
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: DCASE 2025 Challenge Task5 Technical Report
查看摘要
We frame the system as diagnostic data curation for a large audio-language model: before fine-tuning, we probe Qwen3-Omni-30B-A3B-Instruct under normal, empty-audio, and shuffled-audio conditions to identify how the model's answers change when audio evidence is removed or mismatched. These model confusion patterns are used to bucket training samples into text-prior, shuffle-leak, strong audio-dependent, and hard or misleading cases. Our strongest train-only system fine-tunes only on strong-audio items, where the normal audio-question pair is correct but both counterfactual variants fail, plus a small number of empty-audio negatives and a text-only response normalizer for parse-failed generations. On the official development set, the best train-only system reaches 67.27% accuracy after response normalization, compared with 65.90% for our local Qwen3-Omni baseline. Final submissions additionally include models trained using train+development splits and a three-model ensemble.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种基于“音频依赖度”的数据筛选策略,通过观察大模型在音频缺失或错配时的表现,剔除仅靠文本常识就能猜对的样本,仅用真正依赖音频的样本进行微调,从而提升了音频问答系统的准确率。

2. 研究背景与动机

  • 核心问题:在音频依赖型多选题问答(ADQA)任务中,模型往往不真正“听”音频,而是利用问题选项中的文本先验直接猜对答案。
  • 重要性:如果模型不依赖音频就能答题,说明它并未真正具备音频理解能力,这在实际应用中是不可靠的。
  • 现有不足:现有的开源大型音频-语言模型(如 Qwen3-Omni)存在严重的“文本捷径”问题。如果直接用全量数据微调,模型会继续依赖文本先验,甚至可能强化这种投机取巧的行为,而无法实质性地提升音频感知能力。

3. 核心方法

  • 方法/框架:论文提出了一种基于反事实音频输入的诊断性数据筛选与微调框架。
  • 关键创新点
    1. 反事实诊断分桶:在微调前,给基础模型输入正常音频、空音频和打乱音频,根据其答题对错情况,将训练数据分为“强音频依赖”、“文本先验”、“打乱泄露”等不同类别。
    2. 精准数据筛选:仅使用“强音频依赖”样本(即正常情况答对,但音频缺失或错配时答错的样本)进行监督微调(SFT),剔除容易的文本先验样本。
    3. 负样本注入与响应归一化:在训练集中加入少量“空音频负样本”(教导模型在无音频时回答“无法确定”),并在推理后处理中引入文本模型对解析失败的输出进行格式归一化。
  • 直觉解释:就像老师发现学生做听力题时经常不看录音文本只看选项就能蒙对。为了逼学生真正听录音,老师把那些“不听也能做对”的题目挑出来扔掉,只留下“不听录音绝对做不对”的题目让学生练习,并且告诉学生“如果听不到录音就回答不知道”。这样练出来的学生才是真听懂了,而不是靠蒙。

4. 实验与结果

  • 数据集/基准:DCASE 2026 Task 5 (ADQA-Bench)。
  • 基线方法:Qwen3-Omni-30B-A3B-Instruct(基线开发集准确率 65.90%)。
  • 主要实验结果:最佳的纯训练系统(仅用强音频依赖样本 + 5%空音频负样本,训练2000步)在开发集上达到 67.27% 的准确率(经过响应归一化后),相比基线提升了约1.37%。
  • 消融实验揭示
    1. 少即是多:加入困难样本或打乱泄露样本反而会降低准确率,证明仅用强依赖样本是最优策略。
    2. 提示词设计:要求模型输出完整选项文本比仅输出字母或使用思维链效果更好。
    3. 高级算法无效:尝试的各种高级对齐/强化学习算法(如 DPO, GRPO, SimPO 等)均未能超过简单的 SFT。

5. 优势与局限

  • 主要优势
    1. 方法直观且有效:通过巧妙的“反事实测试”剥离了文本捷径,提升了模型对音频的真实依赖。
    2. 计算成本低:无需复杂的强化学习算法,仅用少量精选数据(约4700条)进行轻量级 LoRA 微调即可见效。
  • 局限性
    1. 提升幅度有限且存在回归:微调虽然修复了130个基线错误,但也引入了108个新的错误,说明模型在提升音频依赖的同时,可能损害了部分原本正确的文本先验知识。
    2. 依赖基础模型的能力上限:该方法只能筛选出基础模型“踮脚能够到”的样本,如果基础模型在正常情况下都做不对,这些“困难样本”无法被有效利用。

6. 关键结论与启发

  • 最重要的 Takeaway:在多模态任务中,数据质量比数据数量和算法复杂度更重要。通过反事实测试筛选出真正依赖目标模态(音频)的数据进行训练,是提升模型多模态对齐能力的有效手段。
  • 启发与延伸方向:这种“反事实诊断分桶”思路具有很强的通用性,可以推广到其他多模态领域(如视频问答、图文匹配),用来解决模型过度依赖单一模态的捷径学习问题。未来的研究可以探索如何在不损害模型原有先验知识的前提下,进一步提升其细粒度感知能力,解决微调带来的回归问题。
👀 推荐值得看
🏷️ 领域音频理解 > 音频问答 (AQA)
💡 创新音频问答数据筛选策略——基于反事实音频输入诊断模型混淆模式,仅用强音频依赖样本进行监督微调
⭐ 评分7.0
#15
eess.AScs.SD

A DDSP Framework for Adaptive Room Equalization 跨领域

F. Marcos-Macias, M. P. Daza-Llin, M. Camara, J. L. Blanco
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: Accepted in the 29th International Conference on Digital Audio Effects (DAFx26)
查看摘要
Adaptive room equalization remains challenging under time-varying acoustic conditions and complex excitation signals, such as music. In these scenarios, classical filtered-x least mean squares (Fx-LMS) methods falter due to their rigid formulation. We present a modular differentiable digital signal processing (DDSP) framework for closed-loop adaptive room equalization that recovers Fx-LMS as a special case through automatic differentiation. The framework supports interchangeable EQ structures, response estimation methods, loss functions, and optimizers. Experiments with time-varying measured room impulse responses show that frequency-domain objectives provide more stable adaptation than time-domain objectives in the considered scenarios. Relative to the non-equalized response, system distance is reduced by 70% and mel-spectral distance by 13% (worst-case scenario). We further examine how online room response estimation accuracy and frame length affect the trade-off between responsiveness and convergence stability. Overall, the framework provides a unified open-source basis for exploring synergies between classical adaptive filtering and DDSP-based optimization.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一个基于可微数字信号处理(DDSP)的模块化自适应房间均衡框架,将传统的Fx-LMS算法作为其特例包含在内,并证明了在时变声学环境下使用频域损失函数能实现更稳定、更优的均衡效果。

2. 研究背景与动机

  • 核心问题:在时变声学环境(如听众移动、温度变化、人群密度变化)下,如何对房间进行自适应均衡(ARE),以实时补偿线性失真。
  • 重要性:在现场演出或实时通信中,预计算的均衡器(EQ)会随声学环境改变而失效,导致音质下降。ARE将此视为闭环控制问题,对维持目标响应至关重要。
  • 现有不足:经典的Fx-LMS等自适应滤波方法在面对音乐等非平稳复杂激励信号时,由于其刚性公式,容易出现收敛困难或不稳定;而近年来兴起的DDSP和深度学习EQ匹配方法,大多局限于离线或静态场景,缺乏在线闭环控制能力。

3. 核心方法

  • 提出方法:一个基于PyTorch实现的开源DDSP自适应房间均衡闭环框架。该框架包含四个可互换的模块:参数化EQ结构、动态房间响应(LEM)估计方法、损失函数和优化器。
  • 关键创新点
    1. 理论统一:通过自动微分将经典Fx-LMS算法作为框架的一个特例(即采用FIR滤波器、单样本帧、时域MSE损失和SGD优化器时),打通了经典自适应滤波与DDSP优化之间的理论壁垒。
    2. 频域目标优化:针对音乐等非平稳信号,采用频域均方误差(FD-MSE)作为损失函数,直接对齐目标幅频响应,提升了收敛稳定性。
    3. 灵活的优化器支持:不仅支持SGD、Adam、Newton,还引入了高阶的同伦分析方法来探索非凸EQ匹配问题中的局部极小值规避。
  • 直觉性解释:想象一个智能调音师在听现场音乐。传统方法(Fx-LMS)只能根据每个瞬间的误差微调旋钮,遇到复杂的音乐就容易手忙脚乱。本文的框架给调音师配了一台高级电脑(自动微分),可以综合一段音乐的频谱特征来调整参数(频域损失),而且还能根据需要换不同的调音台(EQ结构)和调音策略(优化器),从而更从容地应对房间声学的实时变化。

4. 实验与结果

  • 数据集/基准:使用SoundCam数据集(真实会议室的时变房间脉冲响应)和MedleyDB(10首不同流派的音乐)进行仿真实验。
  • 基线方法:经典的Fx-LMS和Fx-FDAF(使用2048抽头FIR滤波器)。
  • 主要实验结果
    1. 时域损失(TD-MSE)在所有配置下均无法收敛;而频域损失(FD-MSE)成功实现了均衡。
    2. 在最坏场景(听众移动)下,相比未均衡响应,系统距离降低了70%,Mel谱距离降低了13%。
    3. 本文提出的参数化EQ(仅22个参数)在效果上超越了使用2048抽头的FIR基线方法。Fx-LMS基线直接发散未能收敛,Fx-FDAF收敛但效果不如本文方法。
    4. 在所有优化器中,iHAM-3(三阶同伦分析)表现最好,Adam在慢速变化时偶有不稳,SGD收敛最慢。
  • 消融实验揭示
    1. 帧长选择:8192样本(约170ms)是最佳折中点。太短(2048)频谱分辨率不足导致参数震荡;太长(16384)更新率太低,无法及时跟踪声学变化。
    2. 估计精度影响:当使用真实LEM响应替代在线估计响应时,平滑过渡期间的不稳定性大幅消失。这证明高质量的在线房间响应估计对系统稳定性至关重要。

5. 优势与局限

  • 主要优势
    1. 高度灵活与可扩展:模块化设计极大降低了尝试不同EQ结构、损失函数和优化器的门槛,为自适应声学控制提供了统一的实验平台。
    2. 参数效率高:利用结构化的参数化EQ(7个Biquad级联,22个参数),在时变场景下不仅比长FIR滤波器更稳定,效果也更好。
    3. 有效解决非平稳激励问题:频域损失函数的引入成功克服了传统时域方法在处理真实音乐信号时的收敛瓶颈。
  • 局限性
    1. 实验环境受限:论文声称这并非最终部署方案。实验仅在受控的线性声学仿真中验证,未考虑真实场景中的低信噪比环境噪声、设备非线性、量化误差等不利因素。
    2. 实时性压力:尽管一阶方法(如SGD/Adam)计算耗时约20ms,但表现最好的高阶方法(iHAM-3, Newton)单帧耗时约141ms,逼近170ms的帧长极限,在真实实时部署中可能存在计算延迟风险。

6. 关键结论与启发

  • 最重要的Takeaway:在非平稳音乐激励下的自适应房间均衡中,将问题转化为频域优化并利用自动微分(DDSP)求解,比传统的时域自适应滤波更为有效和鲁棒;且这种DDSP框架在理论上完全涵盖了经典方法。
  • 对后续研究的启发
    1. 神经网络扩展:框架中的“LEM估计”或“优化器”模块未来可直接替换为神经网络,实现端到端的学习型自适应控制。
    2. 真实环境鲁棒性研究:后续研究应关注如何在低信噪比、设备非线性等真实复杂环境下保持该框架的梯度估计质量和控制稳定性。
    3. 高阶优化器的轻量化:iHAM等高阶优化器虽然效果好但计算开销大,未来可探索其轻量化或近似计算版本,以满足严格的实时性要求。
#16
eess.AScs.SD

Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework 跨领域

Shuubham Ojha, Carol Espy-Wilson
Audio and Speech Processing (eess.AS); Sound (cs.SD)
查看摘要
Diffusion models show potential for speech enhancement but lack linguistic guidance. We condition a diffusion-based model on wav2vec 2.0 features from noisy input, injected at the U-Net bottleneck via Feature-wise Linear Modulation (FiLM). Phonetic representations from wav2vec 2.0 features of degraded speech, anchor the reverse diffusion process. While a frozen wav2vec 2.0 encoder extracts features, a learned FiLM generator produces scale and shift parameters modulating the bottleneck with minimal overhead. Motivated by the optimal Bayesian causal estimator under a linear-Gaussian state-space model, FiLM coefficients are aggregated via exponential smoothing for temporal compression. Evaluation on VoiceBank-DEMAND and LibriMix shows competitive performance against the unconditioned baseline in PESQ, STOI, SI-SDR and DNSMOS. We consistently record an improvement of 0.4 on PESQ score, suggesting self-supervised representations effectively condition diffusion-based speech enhancement.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文提出利用冻结的 wav2vec 2.0 模型从含噪语音中提取鲁棒的语音特征,并通过 FiLM 机制注入到扩散模型的 U-Net 瓶颈层中,从而为语音增强过程提供语言学先验指导,有效提升了增强语音的质量和可懂度。

2. 研究背景与动机

  • 核心问题:如何为基于扩散模型的语音增强(SE)提供有效的条件引导信息,以提升生成语音的质量并帮助模型更好地泛化到未见过的噪声环境。
  • 重要性:语音增强在通信、助听设备和鲁棒语音识别等领域有广泛应用。传统的判别式方法容易产生过度平滑的输出并引入听觉伪影,而扩散模型虽然能生成更自然的语音,但在低信噪比下或面对未见噪声时往往难以泛化。
  • 现有不足:现有的扩散模型语音增强方法通常缺乏高层次的语义/语言学指导。常见的条件注入策略(如输入拼接或独立的条件网络)未能充分利用含噪语音中潜藏的语音学信息;而直接使用自监督学习(SSL)特征的方法多用于判别式模型,缺乏对特征时间尺度不匹配和计算开销的考量。

3. 核心方法

  • 提出方法:一种基于 wav2vec 2.0 特征条件化的扩散语音增强框架(基于 StoRM 框架构建)。
  • 关键创新点
    1. 瓶颈层 FiLM 调制:将冻结的 wav2vec 2.0 提取的特征,通过特征级线性调制注入到 U-Net 的最底层抽象表示中。
    2. 理论驱动的时间平滑策略:基于线性高斯状态空间模型和卡尔曼滤波推导出的指数移动平均(EMA),用于时间维度的特征压缩。
    3. 轻量级设计:仅在瓶颈层进行条件注入,而非全局注入,在提升性能的同时将计算开销降至最低。
  • 直觉性解释:想象一个修复画作的工匠(扩散模型),传统方法只能盲目地擦除污渍,容易破坏原画。本文的方法是给工匠配了一个“懂行”的助手(wav2vec 2.0)。助手虽然看着脏兮兮的画,但能认出画的是什么(语音学特征)。助手把这种“高层语义”写在纸条上,通过一种特定的方式(FiLM)递给工匠,指导他在最关键的修复阶段(瓶颈层)如何下笔。为了让指导不过于突兀,助手的信息还会经过一道“平滑处理”(指数平滑),确保指导是连贯的。

4. 实验与结果

  • 数据集:VoiceBank-DEMAND (VB-DEMAND) 和 LibriMix。
  • 基线方法:CDiffuSE, UNIVERSE, UNIVERSE++, 以及本文的基础架构 StoRM(分为128通道和32通道版本)。
  • 主要实验结果
  • 在 VB-DEMAND 上,相比同等规模的 StoRM-128 基线,本文模型在 PESQ 上提升了约 0.4(从 2.4862 提升至 2.8742),STOI 也有所提升。
  • 在 LibriMix 上,32通道版本在所有指标上大幅超越基线(例如 PESQ 从 1.6385 提升至 2.0099)。
  • 计算代价极低:wav2vec 2.0 和 FiLM 生成器的计算开销仅占总推理预算的约 0.1%,32通道版本实现了实时处理能力(RTF=0.55 < 1)。
  • 消融实验揭示
    1. 平滑系数 $\alpha$:较高的平滑度($\alpha=1$)通常带来更好的增强质量。
    2. 注入位置:仅在瓶颈层注入效果最好。如果在编码器或解码器也注入,反而会因为特征尺度不匹配(底层细节被高层语义干扰)导致性能大幅下降。

5. 优势与局限

  • 主要优势
    1. 优雅地结合了自监督学习的鲁棒性与扩散模型的生成能力,有效改善了传统扩散模型输出模糊或缺乏语义连贯性的问题。
    2. 时间平滑策略有严格的数学推导支撑,而非经验主义拼凑。
    3. 极其轻量级的条件注入机制,几乎不增加额外推理延迟,具备落地实用价值。
  • 局限性
    1. 客观指标 SI-SDR 出现了轻微下降,论文解释是因为模型“过度去噪”导致的,但这可能意味着引入了微小的语音失真。
    2. 缺乏主观听感测试(MOS)来进一步验证人耳对“过度去噪”和“语音失真”的真实感受。
    3. 仅在相对小规模的标准基准上进行了验证,未在更复杂、大规模的真实场景(如 DNS 挑战赛数据集)上测试其泛化能力。

6. 关键结论与启发

  • 核心 Takeaway:含噪语音中的自监督表征(wav2vec 2.0)保留了丰富的语言学先验,将其作为条件信息并通过 FiLM 机制在 U-Net 瓶颈层进行调制,是提升扩散模型语音增强性能的高效且低成本手段。
  • 启发与延伸方向
    1. “适度引导”原则:在生成模型中注入条件信息并非越多越好、越早越好,高层语义信息应只作用于网络的高层抽象层,避免破坏底层的声学细节重建。
    2. 特征平滑的普适性:基于卡尔曼滤波推导出的指数平滑策略,可推广至其他需要跨时间尺度对齐的条件注入任务中(如视频生成中的音频条件)。
    3. 未来可尝试替换为更先进的 SSL 模型(如 WavLM),或探索将此范式应用于语音分离、语音修复等相关任务。
👀 推荐值得看
🏷️ 领域语音增强与分离 > 语音增强自监督表征学习 (SSL) > 语音 SSL
💡 创新扩散模型语音增强——基于 StoRM 框架,引入冻结的 wav2vec 2.0 特征通过 FiLM 机制在瓶颈层进行条件调制,并采用基于卡尔曼滤波推导的指数移动平均进行时间平滑
⭐ 评分7.5
#17
eess.AS

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

Zhaokai Sun, Shuai Wang, Zhennan Lin, Chengyou Wang, Dehui Gao 等 (9 人)
Audio and Speech Processing (eess.AS)
Comments: 4 pages, accepted by interspeech 2026
查看摘要
Spoken Language Understanding (SLU) is moving from task-specific pipelines toward large audio language models (LALMs) that generate natural-language responses. However, existing speech benchmarks mainly focus on single-speaker settings or isolated subtasks, leaving speaker-centric understanding in realistic multi-speaker conversations insufficiently evaluated. We introduce MSU-Bench, a diagnostic benchmark for multi-speaker conversational understanding, covering 16 speaker-centric tasks and 2,300 QA instances in a two-tier framework from speaker grounding to dialogue reasoning. We build a Gemini-assisted annotation and QA generation pipeline with human-in-the-loop verification, achieving high QA validity and strong agreement between human answers and verified labels. We further analyze speaker-referencing schemes and diagnostic error types to reveal bottlenecks in speaker grounding and reasoning. Experiments reveal clear gaps across model families, with closed-source systems leading overall but all models still facing challenges in complex speaker grounding and multi-speaker reasoning. The benchmark annotations, metadata, and evaluation scripts will be available at the GitHub repository: this https URL .

📖 深度解读

以下是对论文《MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios》的结构化中文解读报告:

1. 一句话总结

论文提出了MSU-Bench,一个用于评估多说话人对话场景的基准测试,通过16个从“说话人定位”到“多说话人推理”的层级任务,全面诊断了当前大音频语言模型在复杂交互中的理解瓶颈。

2. 研究背景与动机

  • 核心问题:如何全面评估大音频语言模型在真实多说话人对话中“以说话人为中心”的理解能力。
  • 重要性:现实中的语音交互充满打断、重叠和快速切换。模型不仅要“听清”内容,还要“认准”是谁在说,并“推理”说话人之间的关系与动机,这是走向真实语音交互的基础。
  • 现有不足:现有的语音基准大多局限于单说话人设置或孤立子任务(如单纯的ASR、情感识别),而会议级别的评估通常只关注转录质量或说话人边界错误,缺乏对说话人属性定位和交互级推理的系统性诊断。

3. 核心方法

  • 提出方法:MSU-Bench,一个包含2,300个QA实例的两层级诊断基准。
  • 关键创新点
    1. 两层级任务架构:Tier 1 专注说话人定位与识别(如属性、身份),Tier 2 专注多说话人对话推理(如场景、结构、上下文)。
    2. 五种说话人指代方案:通过无索引(直接给音频)、时间索引、转录索引、说话人索引和复杂索引,动态调节定位难度。
    3. 诊断性错误选项设计:干扰项被刻意设计为特定失败模式(错误说话人、幻觉、未知、指令遵循失败),以精准定位模型短板。
    4. 自动化+人工闭环的QA生成流水线:利用Gemini进行初筛和标注生成,再由人工严格验证,确保数据高质量。
  • 核心思路直觉解释:就像给AI做一场“听力与逻辑综合考试”。不仅考它能不能听出某句话是谁说的(Tier 1),还要考它能不能听懂两人对话中的情绪互动和言外之意(Tier 2)。为了增加难度,题目会以不同方式提示“目标说话人”(比如直接放录音,或只给一个时间点让它自己找),并在错误选项里埋下特定“陷阱”(比如把张三说的话说成是李四的),从而像医生一样诊断出AI到底在哪一步“听不懂”。

4. 实验与结果

  • 数据集/基准:MSU-Bench(包含来自8个中英文语料库的数据,涵盖电话、会议、播客、电影等多种场景)。
  • 基线方法:9个语音语言模型(6个开源:Qwen2.5/3-Omni, AudioFlamingo-3, Kimi-Audio, StepAudio2, MiMoAudio;3个闭源:Gemini-2.5-Flash/Pro, Gemini-3-Flash)。
  • 主要实验结果
  • 闭源模型全面领先:Gemini-3-Flash取得最高总分0.77,Gemini-2.5-Pro和Flash分别为0.70和0.69。
  • 开源模型差距明显:最强开源模型MiMoAudio总分为0.56,而Qwen2.5-Omni仅为0.19。多模态全能型模型(如Qwen-Omni)并未在语音理解上表现出绝对优势。
  • 消融/分析实验揭示
  • 指代方案影响:时间索引是最难的指代方式,说明时间定位是当前模型的核心瓶颈;而提供多重线索的复杂索引能显著提升准确率。
  • 错误类型变迁:弱模型(如Qwen3-Omni)倾向于选“未知”(不知道答案),而强模型(如Gemini-3-Flash)的主要错误变成了“错误说话人归因”(把信息安在了错误的人身上)。

5. 优势与局限

  • 主要优势
    1. 评估维度系统全面:从底层的声学定位到高层的逻辑推理,填补了多说话人交互评估的空白。
    2. 诊断性极强:通过特殊的干扰项设计和指代方案,不仅能打分,还能精准指出模型“错在哪”。
    3. 数据质量高:结合了自动化生成与严格的人工校验,人工与标签的一致率高达96%-98%。
  • 局限性
    1. 评估形式受限:采用四选一客观题,虽然评估准确,但与真实世界中开放式的自然语言交互存在差距。
    2. 潜在的数据偏见:QA生成过程大量依赖Gemini,虽然经过人工校验,但闭源Gemini模型在该基准上的表现可能存在一定的“格式偏好”优势。

6. 关键结论与启发

  • 最重要的Takeaway:当前的大音频语言模型在多说话人场景下,虽然能听清内容,但在“谁在何时说话”的时间定位,以及“将信息准确归因到具体说话人”上仍存在严重瓶颈。模型能力越强,其错误越倾向于精细的说话人混淆,而非完全不知道答案。
  • 启发与延伸方向
    1. 模型改进方向:未来LALMs需要加强时间感知编码和跨说话人的上下文跟踪能力,特别是在重叠语音和快速切换场景下。
    2. 评估方法演进:可以探索结合客观题诊断与主观题(LLM-as-a-judge)的混合评估体系,以兼顾评估的准确性与真实性。
#18
eess.AS

Explainable AI in Speaker Recognition -- Attention Map Visualisation and Evaluation

Yanze Xu, Mark D. Plumbley, Wenwu Wang
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Signal Processing (eess.SP)
Comments: Work in progress
查看摘要
Explaining and understanding the decision-making process of artificial intelligence (AI) systems, particularly those implemented by neural networks, falls within the field of explainable AI (XAI). Analogous to the human attention mechanism, neural networks are assumed to possess their own attention mechanisms that selectively process information during decision-making. This work proposes to study one XAI topic: analysing and visualising the attention mechanisms of neural networks. Our experiments are performed on speaker recognition neural networks that are trained to identify speaker identity from a given utterance. Previous studies have widely used class activation map (CAM)-based methods to analyse and visualise the attention mechanisms of neural networks. Each of these methods produces an attention map for each network input, highlighting which input regions are selectively processed when the speaker recognition network makes decisions. However, the evaluation of attention maps produced by these methods remains largely underexplored. This work systematically reviews an existing attention map evaluation algorithm, establishing key concepts and identifying its shortcomings. On the basis of this existing evaluation algorithm, a new version is then proposed to address the identified shortcomings, called the Modified Randomised Input Sampling for Explanation - Evaluation algorithm (Modified RISE-eval). Using Modified RISE-eval, we evaluate the attention maps produced by two representative CAM-based methods, GradCAM and LayerCAM, applied to a certain speaker recognition network. The evaluation results demonstrate that GradCAM and LayerCAM each exhibit distinct advantages when applied under different experimental conditions in the speaker recognition task.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文针对说话人识别任务,提出了一种改进的注意力图评估算法,以解决现有评估方法区分度低和引入无关干扰的问题,并据此揭示了GradCAM和LayerCAM在不同网络深度下的各自优势。

2. 研究背景与动机

  • 核心问题:如何可视化和评估神经网络在说话人识别任务中的“注意力机制”(即网络在判断说话人身份时,主要关注输入语音的哪些部分)。
  • 重要性:神经网络通常是“黑盒”,理解其决策过程(可解释AI,XAI)对于建立模型信任和进行模型诊断至关重要。
  • 现有不足:过去常用CAM类方法(如GradCAM、LayerCAM)生成注意力热力图,但针对这些热力图质量的评估方法极少。现有的RISE-eval评估算法存在两个明显缺陷:一是其“插入策略”下不同方法的评估曲线几乎重叠,无法区分好坏;二是它会过度遮蔽输入(连注意力接近0的像素也强行遮蔽),导致评估结果被随机噪声干扰。

3. 核心方法

  • 提出的方法:Modified RISE-eval(改进的随机输入采样解释评估算法)。
  • 关键创新点
    1. 移除冗余策略:去除了原算法中区分度极低的“插入策略”,仅保留有效的“删除策略”。
    2. 引入阈值防过度遮蔽:设定注意力阈值(如0.2),低于该阈值的像素不参与遮蔽,避免了原算法中后期等同于“随机遮蔽”的干扰。
    3. 改进评分机制:新的评分公式不仅考虑模型性能的下降幅度,还根据遮蔽比例进行加权,重奖那些在早期(遮蔽少量像素时)就能引发模型性能大幅下降的注意力图。
  • 直觉性解释:想象你在测试一份考卷的“重点标记”画得准不准。原方法是按标记把试卷内容一点点涂黑,看成绩掉多少,但它连空白处也强行涂黑,导致最后测的是“乱涂”的影响。新方法只涂真正被标记为重点的地方,并且规定:如果只涂了一点点重点成绩就暴跌,说明重点标得极准,给高分。

4. 实验与结果

  • 数据集与模型:使用VoxCeleb1/2数据集,基于ResNet34架构的说话人识别模型。
  • 对比方法:对比了GradCAM和LayerCAM两种可视化方法在ResNet34四个不同残差层的表现。
  • 主要实验结果
  • 最深层(Layer 4)GradCAM表现更好(评分 10.12 vs 9.52),其生成的注意力图能更准确定位目标说话人区域(具有强类区分能力)。
  • 浅层(Layer 1-3)LayerCAM表现更好(如Layer 1评分 15.50 vs 10.14),其注意力图在遮蔽输入时能引发更大的性能下降。
  • 消融/定性分析:通过拼接两个说话人的语谱图进行测试,发现深层GradCAM能精准将注意力集中在目标说话人的频谱上,而浅层注意力图则更精细(类似共振峰轨迹)。

5. 优势与局限

  • 主要优势
    1. 系统性地诊断了原RISE-eval算法的缺陷,提出的阈值限制和评分改进逻辑清晰且有效。
    2. 提供了无需人工标注的客观评估方式,直接让模型自身的性能变化来裁判注意力图的好坏。
    3. 为CAM类方法在实际应用中的“分层选择”提供了明确的实验依据。
  • 局限性
    1. 存在“浅层偏好”偏差:论文自身指出,浅层注意力图更精细,更容易遮蔽掉共振峰等关键声学特征,导致浅层在评估中容易获得虚高分数,这与人类视觉感知的“类区分度”不完全一致。
    2. 泛化性验证不足:实验仅在单一的说话人识别任务和单一网络架构上展开,未扩展到图像分类或语音识别等其他领域。
    3. 实用价值有限:论文在讨论中坦言,目前解释注意力机制对实际工程应用带来的直接收益仍然不明确。

6. 关键结论与启发

  • 最重要的Takeaway:评估注意力图时必须限制在有效的高注意力区域,盲目追求100%遮蔽会引入噪声;同时,没有绝对最优的可视化方法,GradCAM适合深层/决策层解释,LayerCAM适合浅层/特征层解释。
  • 启发与延伸方向:未来的评估算法需要解决“浅层精细特征偏好”的偏差问题,例如引入对不同特征语义层级的加权机制。此外,XAI研究应思考如何将“解释网络注意力”从纯理论分析转化为能切实指导模型压缩、抗对抗攻击或提升鲁棒性的实用工具。
👀 推荐值得看
🏷️ 领域说话人技术 > 说话人识别/验证
💡 创新注意力图评估算法——基于RISE-eval改进,引入注意力阈值防止过度遮蔽并优化评分机制
⭐ 评分6.0
#19
eess.AS

Domain-incremental audio classification using domain-specific experts and prototype classifier

Jongyeon Park, Do-Hyeon Lim, Sang-won Park, Hong Kook Kim, Kyungdeuk Ko 等 (7 人)
Audio and Speech Processing (eess.AS); Machine Learning (cs.LG)
Comments: DCASE 2026 challenge Task7, 4 pages
查看摘要
This technical report presents submission systems for Task 7(domain-incremental audio classification) of the DCASE 2026 Challenge. The main obstacle is that, the system is unable to access to past or future domain's data at once. We approached domain-incremental learning (DIL) as a frozen-feature replay problem. At each incremental stage, one or two compact experts are trained and then kept fixed; at the final stage, the penultimate features from all frozen experts are concatenated and used to train a lightweight per-class prototype classifier solely on cached features. This design prevents catastrophic forgetting by preserving each expert models at inference. To retain earlier-domain knowledge without storing raw audio, some experts were trained with DeepInversion-based generative replay. A cross-stage regression imputer was trained to fill the expert feature slots that did not yet exist at an ealier stage. We submit four fully DIL-compliant systems: three systems based on diverse frozen five-expert backbones and their cross-stack ensemble achieving 78.15% micro / 77.03% macro on the development set, outperforming every individual backbone on both evaluations.

📖 深度解读

1. 一句话总结

这篇论文提出了一种基于多领域冻结专家和原型分类器的框架,通过生成式回放和缺失特征填补技术,有效解决了音频分类中无法同时访问历史和未来数据的域增量学习问题及灾难性遗忘。

2. 研究背景与动机

  • 核心问题:在域增量学习(DIL)中,模型需要按顺序学习新领域的数据,同时不能访问过去和未来的原始音频数据,且必须防止学习新知识时遗忘旧知识(灾难性遗忘)。
  • 重要性:现实世界中,数据往往是分批、按不同领域到达的(如不同环境下的录音)。模型需要持续适应新环境而不丢失旧知识,这对于音频识别系统的实际部署至关重要。
  • 现有不足:传统的顺序微调会导致严重的灾难性遗忘;而传统的回放方法需要存储历史原始数据,这违反了DIL任务中不能同时访问过去和未来数据的严格约束。

3. 核心方法

论文提出了一种将DIL视为“冻结特征回放”问题的框架,主要由四个部分组成:
- 关键创新点
1. 冻结的多专家架构:为每个领域训练特定的专家模型(共5个),训练完成后立即冻结参数。这从结构上彻底阻断了参数更新导致的遗忘。
2. DeepInversion生成式回放:不保存历史原始音频,而是利用已训练好的冻结模型“反演”生成合成特征,在训练新领域专家时混入这些合成特征,从而保留历史知识。
3. 跨阶段回归填补:由于早期阶段(如D2)没有后期阶段(如D3)的专家模型,导致特征维度缺失。论文训练了一个回归器,利用后期完整的数据学习特征间的映射关系,从而“估算”出早期数据在后期专家中的缺失特征。
4. 余弦原型分类器:将5个专家的冻结特征拼接,通过L2归一化和温度缩放,训练一个轻量级的基于余弦相似度的原型分类器,该分类器仅在缓存的特征上训练,不接触原始音频。

  • 直觉性解释
    这个方法就像组建一个由不同领域专家组成的“智囊团”。每个人(专家模型)负责记住自己领域内的知识,且学成后不再改变(冻结参数),这避免了学新忘旧。当遇到新问题时,把所有人的意见汇总(特征拼接),交给一个只看意见汇总来做决定的“裁判”(原型分类器)。如果遇到某个新成员还没加入时的旧问题,裁判就根据老成员的意见猜一下新成员会怎么说(特征填补),从而做出完整判断。

4. 实验与结果

  • 数据集/基准:DCASE 2026 Task 7 DIL数据集(包含D1, D2, D3三个域,10个目标类别)。
  • 基线方法:官方提供的checkpoint(45.5% micro / 53.2% macro 准确率)。
  • 主要实验结果:论文提交了3个单系统及1个集成系统。集成系统在开发集上取得了最佳表现,达到 78.38% micro / 78.92% macro 准确率,比官方基线提升了约33个micro和25个macro百分点。
  • 消融实验揭示
    1. 专家多样性是核心:增加从零训练的额外专家(E3, E5)能使准确率提升约3个百分点;如果去掉额外专家只保留3个增量专家,准确率会大幅降至63.5%。这表明专家的多样性比回放机制本身更重要。
    2. 生成式回放的作用:基于DeepInversion的回放(System 2)在D3域上取得了最好的单系统表现(75.19% micro),说明数据-free的生成回放确实为新域提供了有效的多样性补充。

5. 优势与局限

  • 主要优势
    1. 抗遗忘能力强:通过冻结专家参数,从机制上彻底杜绝了灾难性遗忘。
    2. 严格合规:生成式回放和特征填补机制完美契合DIL任务中“不可同时访问跨阶段原始数据”的严苛约束。
    3. 异构特征融合好:通过L2归一化和原型分类器,有效整合了不同架构、不同尺度特征的专家意见。

  • 局限性
    1. 扩展性受限:随着领域不断增加,专家模型数量会线性增长,导致内存和推理计算开销变大(论文也提到增加更多专家收益边际递减)。
    2. 填补误差风险:缺失特征填补依赖回归器在D3数据上学到的映射关系,如果D2与D3特征分布差异过大,填补的特征可能引入噪声。
    3. 验证规模有限:仅在3个域的设定下进行了验证,面对更长序列的增量任务时,回归填补的误差可能会累积。

6. 关键结论与启发

  • 最重要的Takeaway:在严格的增量学习约束下,“冻结多专家提取特征 + 轻量级分类头组合”是一种极其有效且防遗忘的范式。其中,专家特征的多样性和质量比单纯的回放策略更为关键。
  • 启发与延伸方向
    1. 未来的研究可以探索如何动态扩展或合并专家模型,以在保持多样性的同时控制内存开销。
    2. 跨阶段特征填补的思路非常巧妙,后续可以探索更高级的生成模型(如扩散模型)来进行更精准的缺失特征估计。
    3. 这种“模块化冻结 + 特征级融合”的范式不仅适用于音频,也可推广至视觉或多模态的持续学习任务中。
👀 推荐值得看
🏷️ 领域声音事件与场景 > 声学场景分类 (ASC)
💡 创新域增量音频分类——基于多领域冻结专家和原型分类器,结合DeepInversion生成式回放与跨阶段回归填补缺失特征解决灾难性遗忘
⭐ 评分7.0
#20
eess.AS
National Taiwan University (NTU) (QS Top 100)

CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models

Chun-Wei Chen, Tzu-Quan Lin, Ke-Han Lu, Wei-Ping Huang, Hung-Yi Lee
Audio and Speech Processing (eess.AS)
Comments: Accepted to interspeech 2026
查看摘要
Speech Language Models achieve reasoning capabilities, but are often hindered by massive parameter counts and a tendency to prioritize linguistic priors over acoustic features. While contrastive decoding enhances grounding by contrasting audio-aware and text-only logits, it increases inference latency. We propose Contrastive Audio-Aware Distillation (CAAD), a framework that internalizes the teacher's contrastive reasoning into the student model's weights. To overcome the high computational training overhead in the dual-path token-by-token contrastive distillation process, we introduce a synchronized teacher-forcing strategy. Anchored by unified Pseudo-Ground Truths, this mechanism enables simultaneous full-sequence generation of the teacher's contrastive distributions, allowing student to distill the audio-aware signal efficiently. Overall, CAAD yields a ~8% relative gain over standard knowledge distillation on Dynamic-SUPERB and successfully reduces linguistic bias in MCR-BENCH.

📖 深度解读

1. 一句话总结

本文提出了一种名为CAAD的知识蒸馏框架,通过将教师模型的“对比音频感知”推理能力内化到轻量级学生模型中,有效解决了语音语言模型参数量大、推理延迟高以及过度依赖文本而忽略音频特征的问题。

2. 研究背景与动机

  • 核心问题:语音语言模型在压缩体积(通过知识蒸馏)时,会继承教师模型的“语言偏置”问题,即模型过度依赖内部强大的文本语言先验,而忽略了输入音频中的声学证据。
  • 重要性:这种模态偏置导致模型在音频与文本信息冲突时(如文本说“高兴”但语气愤怒),无法进行真正的多模态推理,严重影响了模型在意图识别、情感分析等依赖副语言特征任务上的可靠性。
  • 现有不足:对比解码虽能在推理时通过对比“有音频”和“无音频”的双路径输出 to 消除偏置,但会让推理延迟翻倍;而直接将这种对比逻辑蒸馏给学生模型,又因自回归的双路径生成破坏了训练并行化,导致计算开销极其庞大。

3. 核心方法

  • 方法/框架:论文提出了 Contrastive Audio-Aware Distillation (CAAD),一个两阶段的对比音频感知蒸馏框架。
  • 关键创新点
    1. 同步教师强制策略:引入一个统一的“伪真值”作为锚点,让教师模型的双路径(正负路径)生成能够并行化,打破了自回归对比蒸馏的计算瓶颈。
    2. 音频感知目标提取:通过数学外推,将教师模型在“有音频”和“无音频”状态下的 logits 差值提取出来,并放大音频信号的贡献。
    3. 混合损失优化:在蒸馏对比信号的同时,加入对伪真值的交叉熵监督,确保模型在摆脱语言偏置的同时不丧失语言流畅性。
  • 直觉性解释:就像教一个学徒(学生模型)听音辨意。师傅(教师模型)虽然懂多,但常常只看剧本就瞎猜。CAAD的做法是:先根据音频的元数据(如性别、情绪)生成一段“标准答案”作为锚点。然后让师傅分别在看音频和不看音频的情况下回答,对比两者的差异,把“真正听音频才得出的那部分知识”提取出来。最后,把这些“纯音频知识”直接教给学徒,让学徒不仅体积小、跑得快,而且养成“认真听音频”的好习惯。

4. 实验与结果

  • 数据集/基准:训练使用 DeSTA2 数据集;评估使用 Dynamic-SUPERB(综合语音能力)和 MCR-BENCH(模态冲突解决能力)。
  • 基线方法:贪心解码、测试时对比解码 (CD)、标准知识蒸馏。
  • 主要实验结果
  • 在 Dynamic-SUPERB 上,CAAD 学生模型 (3B) 平均得分 54.44%,比标准知识蒸馏 (50.40%) 相对提升约 8%,并在副语言任务上超越了 8B 教师模型的贪心解码性能。
  • 在 MCR-BENCH 上,CAAD 的 Shift 值(受误导文本影响而出错的比例)从标准蒸馏的 100.0 大幅降至 79.03,证明其抗语言偏置能力显著增强。
  • 消融实验
    1. 对比权重 $\alpha$ 越大,模型抗偏置能力越强(Shift值下降),但综合性能在 $\alpha=1.0$ 时达到最佳平衡。
    2. 锚点生成方式上,利用文本元数据生成的伪真值,比直接用连续音频生成的锚点效果更好,因为结构化文本对模型来说更稳定、易理解。

5. 优势与局限

  • 主要优势
    1. 零额外推理延迟:将测试时的对比解码开销完全转移到训练阶段,推理时只需单次前向传播。
    2. 有效解耦模态偏置:成功让学生模型学会“听音频”而非“猜文本”,在冲突场景下鲁棒性大幅提升。
    3. 青出于蓝:蒸馏出的 3B 学生模型在部分声学任务上超越了 8B 教师模型的常规表现。
  • 局限性
    1. 依赖师生差距:如果学生模型本身已经高度优化(如 Qwen2.5-Omni 3B),蒸馏带来的增益空间可能非常有限。
    2. 训练阶段开销仍存:虽然实现了并行化,但训练阶段仍需生成伪真值并计算双路径 logits,对计算资源有一定要求。

6. 关键结论与启发

  • 关键 Takeaway:知识蒸馏不应仅仅是对教师模型最终输出分布的简单模仿,而应内化教师的“推理纠偏机制”(如对比解码中的模态偏置纠正),从而培养出更健康、更关注目标模态的小模型。
  • 启发与延伸方向:本文提出的“伪真值锚点 + 同步教师强制”策略,不仅适用于语音语言模型,完全可以推广到视觉语言模型(VLM)等其他多模态领域的对比蒸馏中。未来可探索更动态的伪真值生成方式,或研究如何在无需元数据提取的情况下实现同等效果的对齐。
🔥 推荐必读
🏷️ 领域语音大模型与对话 (Speech LLM / SDM) > 语音语言模型
💡 创新对比音频感知知识蒸馏——基于对比解码与知识蒸馏,引入同步教师强制策略与音频感知目标提取,将教师的对比纠偏能力内化到轻量级学生模型中
⭐ 评分8.0
#21
eess.AScs.SD

STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation 跨领域

Huadai Liu, Wen Wang, Kaicheng Luo, Qian Chen, Xiangang Li 等 (6 人)
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: ICML 2026
查看摘要
Continuous Variational Autoencoders (VAEs) serve as the fundamental continuous tokenizer for modern neural audio generation systems, enabling high-fidelity reconstruction while providing a compact, smooth latent space for downstream generative priors. However, continuous VAEs face a fundamental conflict among compression rate, reconstruction fidelity, and latent space topology, which we formalize as the Rate-Distortion-Regularity Trilemma. This trilemma stems from a topological mismatch: the isotropic Gaussian prior in standard VAEs imposes a flat latent geometry that fails to accommodate audio's hierarchical nature, where low-frequency components are structured and compressible while high-frequency components are stochastic and incompressible, leading to disordered information packing in which crucial semantic features are interleaved with high-entropy noise. To address this challenge, we propose Structured Topology-Aware Regularization (STAR), a general training strategy that reshapes latent space geometry by imposing a growth-based constraint field, routing structural and textural information into channel subspaces with matching capacities. STAR is applicable to any VAE architecture and effectively resolves the trilemma, as demonstrated in CNN-based VAEs. We further present STAR-VAE, which combines STAR with a hybrid CNN-Mamba architecture for local feature extraction and linear-complexity global context modeling, and STAR-Gen, an LLM-based Flow Matching framework that leverages STAR-VAE's structured latent space for high-fidelity generation without vector quantization artifacts. Experiments across diverse audio domains show that STAR-VAE achieves state-of-the-art reconstruction fidelity and enhanced semantic information preservation, while the structured latent space improves both traditional diffusion models and STAR-Gen for text-to-audio generation.

📖 深度解读

1. 一句话总结

本文提出了一种名为STAR的结构化拓扑感知正则化方法,通过在VAE潜在空间中施加梯度化的KL约束来对齐音频的频谱层次结构,从而解决了连续音频表征中的“率-失真-正则化三难困境”,并在重建和文本到音频生成任务上达到了SOTA(当前最优)性能。

2. 研究背景与动机

  • 核心问题:连续变分自编码器(VAE)在音频生成中面临“率-失真-正则化三难困境”。即模型很难同时兼顾高压缩率、高保真重建以及平滑规整的潜在空间。
  • 为什么重要:VAE作为现代音频生成系统(如潜空间扩散模型)的基础分词器,其潜在空间的质量直接决定了下游生成模型的上限。如果潜在空间混乱且包含过多噪声,生成模型将很难学习并生成高质量的音频。
  • 现有方法不足:标准VAE采用各向同性高斯先验,对所有潜在通道施加均匀的KL惩罚。然而,音频信号具有天然的频谱层次(低频结构化且可压缩,高频随机且不可压缩)。均匀惩罚导致“无序信息打包”,关键语义特征与高熵噪声随机交织,破坏了潜在空间的规律性。此外,当引入高容量编码器(如Mamba)时,为了最小化均匀KL损失,模型会自发舍弃高频纹理细节,引发“重建漂移”现象。

3. 核心方法

  • 提出方法:论文提出了STAR(Structured Topology-Aware Regularization),并基于此构建了STAR-VAE(结合CNN-Mamba架构)和STAR-Gen(基于LLM的流匹配生成框架)。
  • 关键创新点
    1. STAR正则化:摒弃均匀KL惩罚,采用基于Gamma增长函数的通道依赖性惩罚权重,形成“容量梯度”。
    2. 混合CNN-Mamba架构:结合CNN提取局部频谱特征与Mamba建模线性复杂度的全局上下文,并在STAR约束下安全部署,避免重建漂移。
    3. STAR-Gen框架:将LLM解码器改造为条件流预测器,在STAR-VAE的连续结构化潜在空间上进行流匹配,兼顾了LLM的扩展性与连续生成的无损性。
  • 核心思路直觉解释:就像整理一个书架,标准VAE把所有书(低频结构和高频噪声)随便塞在各个格子里,导致重要信息被噪声淹没。STAR则给书架设定了不同的容量限制:前面的格子容量大(惩罚小),专门放重要且复杂的“结构书”;后面的格子容量小(惩罚大),专门放琐碎的“噪声纸屑”。这样模型自然而然地学会了按重要性分类存储信息,既保留了结构,又没有丢失纹理,还让潜在空间井井有条,极大方便了下游生成模型的学习。

4. 实验与结果

  • 数据集/基准:VAE训练使用Freesound、FMA、FSD50K;生成训练使用WavCaps、AudioCaps。评估在AudioCaps测试集和Song Describer数据集上进行。
  • 基线方法:重建对比了Mel-VAE、AudioGen、$\epsilon$ar-VAE、Stable Audio Open (SAO);生成对比了AudioLDM 2-large、Tango 2、TangoFlux。
  • 主要实验结果
  • 重建:在相同潜在率(21.5Hz)下,STAR-VAE全面超越SAO。例如在AudioCaps上,语义保留指标FAD从3.29降至2.31,潜在相关性(LC)从0.11降至0.08。即使面对潜在率高出其两倍(43Hz)的$\epsilon$ar-VAE,STAR-VAE在语义质量(FAD)和潜在规律性上依然更优。
  • 生成:STAR-Gen在文本到音频生成上达到SOTA,质量指标FDopenl3为55.8(最佳基线TangoFlux为80.2),语义对齐CLAP得分为0.48。此外,将STAR-VAE替换入传统扩散模型SAO中,也能全面提升其生成性能。
  • 消融实验揭示
  • 移除STAR后,混合架构出现严重的“重建漂移”,各项指标下降,证明STAR是安全部署高容量模型的关键。
  • 通道截断分析显示STAR具有类似PCA的能量压缩特性,前37.5%的通道即可捕获大部分结构信息,而基线模型即使保留90%通道误差依然很高。
  • 凸分配的Gamma增长函数($\gamma=2.0$)优于阶跃、线性和凹函数,验证了其匹配音频重尾频谱分布的理论合理性。

5. 优势与局限

  • 主要优势
    1. 直击痛点,架构通用:STAR不仅解决了音频VAE的根本拓扑冲突,且作为一种训练策略,可无缝插入任何VAE架构中。
    2. 解锁高容量模型:有效防止了高容量序列模型(如Mamba)在均匀KL约束下的重建漂移,使其能安全发挥全局建模优势。
    3. 下游普适性强:结构化的潜在空间不仅提升了基于LLM的流匹配生成,也能直接改善传统扩散模型的生成质量。
  • 局限性
    1. 静态约束曲线:目前STAR使用静态的Gamma增长函数,无法根据输入音频内容的动态变化自适应调整容量分配。
    2. 硬件优化依赖:虽然Mamba实现了线性复杂度,但其实际训练效率仍高度依赖底层硬件感知优化的成熟度。
    3. 两阶段训练复杂度:模型需要先进行各向同性预训练,再过渡到STAR微调,增加了训练流程的复杂性和时间成本。

6. 关键结论与启发

  • 最重要的Takeaway:各向同性的潜在空间假设不适用于具有层次结构的数据(如音频)。通过对潜在通道施加信息密度感知的梯度约束,可以诱导出层次化的信息组织,从而在不增加模型参数的情况下,同时提升重建保真度和下游生成的质量。
  • 启发与延伸方向
    1. 模态泛化:STAR的核心思想(按信息密度结构化潜在空间)是模态无关的,未来可扩展至图像、视频等其他具有层次结构的连续表征学习任务。
    2. 动态拓扑:可以探索内容自适应的拓扑结构,根据输入信号实时预测容量曲线$\beta$,以更好地处理高度非平稳的音频段。
    3. 统一理解与生成:这种结构化的连续分词方案为摆脱离散量化的局限提供了新思路,有望在下一代多模态基础模型中作为向量量化的替代方案。
#22
eess.AScs.SD
Hong Kong University of Science and Technology (QS Top 100)Alibaba (World Famous IT Company)

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation 跨领域

Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Bin Ma 等 (7 人)
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: Preprint
查看摘要
Unifying speech, sound, and music generation in one model is hindered by tradeoffs between fidelity, end-to-end training, in-context conditioning, and variable-length synthesis that no current paradigm fully resolves. To address this challenge, we present AudioCALM, a universal audio generation framework that extends autoregressive (AR) next-token prediction from discrete tokens to continuous audio latents: a thin flow-matching head replaces the softmax to predict rectified-flow velocities at each position, and a block-causal AR-Flow attention pattern produces arbitrary-length output. Joint training of multiple audio generation tasks faces an asymmetric text--audio mismatch: speech transcripts align to specific time spans and demand tight, time-aligned attention, whereas sound and music captions describe only overall semantics and rely on diffuse, holistic attention; mixing the two disproportionately degrades sound and music generation. We address this asymmetry at two levels: a data reformulation strategy that unifies all three tasks under a single description-style conditioning interface, and a novel architecture Asymmetric Mixture-of-Modality-Experts (A-MoME), which adds a dedicated residual expert for speech while sound and music share the backbone, incurring no inference overhead on non-speech inputs. Experimental results demonstrate that AudioCALM matches modality-specific state-of-the-art and outperforms prior unified baselines on speech, sound, and music generation benchmarks.

📖 深度解读

1. 一句话总结

本文提出了AudioCALM,一个统一的音频生成框架,通过将自回归语言模型扩展到连续潜空间并结合非对称混合专家网络(A-MoME),在单一模型中高质量地实现了语音、声音和音乐的任意长度生成。

2. 研究背景与动机

  • 核心问题:如何在一个统一的模型中同时实现语音、声音和音乐的高质量生成。
  • 重要性:现实世界中的音频是多样的,统一模型能够跨领域共享数据和结构知识,从而降低开发成本并提升整体生成性能。
  • 现有不足:当前主流的三大生成范式各有局限:离散token自回归(AR)模型受限于有限码本,存在保真度瓶颈;级联系统(语言模型+声学生成器)切断了端到端优化;非自回归流匹配/扩散模型虽然保真度高,但丧失了AR模型的上下文条件能力,且难以自然处理变长生成。

3. 核心方法

  • 方法/框架:AudioCALM,基于连续自回归语言建模(CALM)范式。它使用一个共享的Transformer主干处理文本和音频序列,并在每个音频位置附加一个轻量级的流匹配头来预测连续潜空间中的整流流速度。
  • 关键创新点
    1. 连续流匹配头与AR-Flow注意力:用流匹配头替代传统的softmax,保留了AR模型的上下文条件和流式生成能力,同时突破了离散token的保真度瓶颈。引入块因果AR-Flow注意力模式,块间自回归、块内双向去噪,实现了任意长度的自然生成。
    2. 描述性条件接口:利用多模态大语言模型(MLLM)将语音的转录文本、声音和音乐的简短标签统一重写为长格式的自然语言描述,消除了不同模态间文本条件的格式差异。
    3. 非对称混合模态专家(A-MoME):针对联合训练中的“不对称干扰”问题(语音的严格时间对齐会挤占声音和音乐所需的全局分散注意力),A-MoME仅为语音添加一个专属的残差前馈网络(FFN),而声音和音乐共享主干网络。
  • 核心直觉:传统离散AR就像用有限的词汇量去描述一幅复杂的画,总会丢失细节;AudioCALM则像是在画布上直接连续地涂抹颜料(流匹配),同时保留了“从左到右”一步步画(自回归)的能力。此外,语音生成像是在做“精准对齐的填空题”,而声音/音乐生成像是在做“看图说话”,把它们混在一起训练会让模型无所适从。A-MoME给语音配了个“专属放大镜”,而让其他音频共用普通视角,从而化解了冲突。

4. 实验与结果

  • 数据集/基准:LibriTTS和SeedTTS-eval(语音)、AudioCaps(声音)、Song-Describer(音乐)。
  • 基线方法:对比了特定领域的SOTA模型(如CosyVoice 3.0, TangoFlux, Stable Audio Open, MusicGen等)以及现有的统一基线模型(如UniAudio, UniFlow-Audio, Ming-Omni等)。
  • 主要结果
  • 作为一个单一权重模型,AudioCALM在所有三个领域的基准测试中均达到或超越了特定领域的SOTA模型,并显著优于所有统一基线。
  • 语音方面,WER降至0.020(LibriTTS),MOS高达4.02;声音方面,FAD降至1.95(相比TangoFlux降低28%);音乐方面,FAD降至2.02,CLAP达到0.36。
  • 消融实验揭示
    1. 连续流匹配头相比离散token带来了最大的性能飞跃,证明了突破码本瓶颈是关键。
    2. 描述性条件重写显著提升了声音和音乐的生成质量,且未损害语音效果。
    3. A-MoME比对称的MoME更高效,不仅参数更少,且在非语音推理时零额外开销,各项指标均更优。

5. 优势与局限

  • 主要优势
    1. 真正的统一与高保真:单一模型即可生成三种音频,且不牺牲保真度,打破了以往统一模型性能不如专用模型的魔咒。
    2. 原生支持流式与变长生成:AR-Flow设计使其无需外部长度预测器即可自然生成任意长度音频。
    3. 高效的架构设计:A-MoME按需分配容量,精准解决跨模态干扰,且对非语音输入零推理开销。
  • 局限性
    1. 数据和模态覆盖有限:目前仅支持英语语音,未涵盖非英语、歌唱声等。
    2. 规模验证不足:主干网络仅验证到4B参数,更大规模下的表现未知。
    3. 长音频连贯性未深入:虽然支持变长,但未对长时段音频的连贯性和终止机制进行深入研究。

6. 关键结论与启发

  • 核心Takeaway:将自回归语言模型从离散token扩展到连续潜空间是构建通用音频生成模型的有效途径。面对多模态联合训练,识别并针对模态间的不对称特性(如局部对齐vs全局语义)进行非对称架构设计,比平均分配资源更有效。
  • 启发与延伸方向
    1. 连续AR建模范式可进一步推广至视频、3D等其他连续模态的统一生成。
    2. 利用MLLM进行数据重整以统一条件接口的思路,可为其他多模态任务的训练数据预处理提供参考。
    3. 未来可探索在更大规模参数和更多语种/模态(如歌唱)下验证该框架的Scaling Law,并研究长音频生成的连贯性问题。
#23
eess.AS
Zhejiang University (QS Top 100, 985, 211)ByteDance (World Famous IT Company)

Audio Editing in the Era of Foundation Models: A Survey

Changhao Pan, Yifei Fan, Fan Zhuo, Yifu Chen, Wenxiang Guo 等 (16 人)
Audio and Speech Processing (eess.AS)
Comments: 23 pages, 3 figures, 2 tables
查看摘要
Audio editing aims to modify a given synthetic or real-world audio signal to satisfy specific user needs. As a promising yet challenging direction in AIGC, it has attracted increasing attention. Recent advances in audio generation have made powerful generative models central to modern audio editing systems. This rapid progress has created a growing need to organize emerging tasks, methods, and resources into a coherent view. In this survey, we provide a comprehensive review of audio editing in the era of foundation models. We first present a unified taxonomy of existing editing tasks and then summarize the major foundation-model paradigms that support modern audio editing, covering representative approaches from both training-based and training-free perspectives. We further discuss related resources, including datasets, evaluation protocols, and data construction tools. Finally, we identify open challenges in this field and outline promising directions for future research. The project page is released at this https URL .

📖 深度解读

1. 一句话总结

这篇综述系统性地梳理了基础模型时代的音频编辑技术,提出了一个统一的任务分类法,并从模型架构、学习范式、数据集与评估指标等维度全面总结了当前研究进展与未来挑战。

2. 研究背景与动机

  • 核心问题:随着AIGC和基础模型(如扩散模型、音频语言模型)的快速发展,音频编辑领域迎来了范式转变,但缺乏一个系统性的框架来梳理新兴的编辑任务、方法和资源。
  • 重要性:与从零开始的音频生成不同,音频编辑旨在根据用户意图修改现有录音(如改变内容、背景、风格等),同时保留无关信息,这在影视后期、音乐制作和语音交互等商业和娱乐场景中具有极高的实用价值。
  • 现有不足:早期的音频编辑严重依赖数字音频工作站(DAW)和信号处理工具,需要大量人工和专业知识。现有的综述多聚焦于通用的音频生成或音频语言模型,极少将“音频编辑”作为核心主题进行深入探讨。

3. 核心方法

作为一篇综述,本文的核心贡献在于提出了一个结构化的分类体系和分析框架:
- 任务分类法:根据编辑操作所作用的信息层次,将音频编辑分为三大类共12个细粒度任务:
- 声学编辑:修改信号级属性(如降噪、混响调整、响度控制)。
- 语义编辑:修改高层语义信息(如语音内容替换、情感风格转换)。
- 实例编辑:修改音频场景中的具体实体(如音轨分离、插入新声音、替换乐器)。
- 基础模型范式:总结了支撑现代音频编辑的两大主流架构:
- 基于Token的编解码器语言模型:将音频转为离散Token,通过自回归补全实现局部编辑。
- 扩散与流匹配模型:在连续的声学空间中通过条件去噪或潜空间反演进行编辑。
- 学习范式
- 基于训练的方法:包括任务特定训练、参考/属性训练和指令训练(用自然语言指导编辑)。
- 免训练方法:利用预训练生成模型,通过推理时的反演、注意力机制修改或掩码引导来实现编辑。

直觉解释:就像修图一样,音频编辑也可以分为“加滤镜”(声学编辑)、“改文案/表情”(语义编辑)和“P掉路人/加上小狗”(实例编辑)。而实现这些操作的AI工具,要么是专门“报班学习”过特定编辑技能的(基于训练),要么是直接拿现成的AI生成大模型,通过巧妙地改变输入指令或内部计算过程来“即兴发挥”的(免训练)。

4. 实验与结果

注:本文为综述论文,未包含传统意义上的实验设计,但系统总结了该领域的资源与评估方法。
- 数据集资源:总结了语音、音乐和通用音频三大领域的开源数据集。指出一个关键痛点:目前缺乏大规模、统一格式的“指令-输入-输出”配对数据集,现有系统多依赖合成数据。
- 评估协议:总结了音频编辑评估的四个维度:
- 指令遵循度:编辑结果是否符合用户意图(如用WER衡量语音替换准确性,用CLAP分数衡量音频文本匹配度)。
- 保留度与局部性:非编辑区域是否保持不变(如用说话人嵌入余弦相似度衡量音色保留)。
- 时间与结构一致性:编辑边界是否平滑、音乐节奏是否连贯。
- 音频质量:编辑后的音频是否自然无伪影(如MOS评分、FAD距离)。
- 方法对比:论文在表1中对比了20余种代表性方法,清晰展示了不同方法在架构(Codec/Diff.)、条件输入及适用任务上的差异。例如,基于训练的方法通常在特定任务上表现更稳定,而免训练方法则具有更高的灵活性。

5. 优势与局限

本文(作为综述)的优势:
1. 填补空白:首个专门针对“基础模型时代音频编辑”的全面综述,理清了这一快速发展的交叉领域的脉络。
2. 分类体系清晰:提出的“声学-语义-实例”三层分类法直观且全面,涵盖了语音、音乐、通用音效等不同子领域的需求。
3. 多维度的系统分析:不仅梳理了任务和模型,还深入探讨了学习策略(训练vs免训练)及数据评估生态,对研究者极具参考价值。

论文指出的领域局限(及本文局限):
1. 数据瓶颈:当前领域缺乏标准化的指令对齐数据集,限制了基于自然语言指令的开放式音频编辑模型的发展。
2. 评估困难:自动评估指标在衡量“局部编辑准确性”和“非目标区域保留度”时仍显不足,难以完全替代主观听感测试。
3. 范围限制:本文自身主要聚焦于单声道音频和基础模型范式,未深入探讨空间音频(如立体声、全景声)编辑及早期的信号处理方法。

6. 关键结论与启发

  • 核心Takeaway:基础模型极大地拓展了音频编辑的边界,使其从繁琐的信号处理转向灵活的、语义驱动的指令操作。然而,如何在实现高度可控编辑的同时,完美保留非目标区域的声学内容和时间连贯性,仍是当前技术的核心难点。
  • 后续启发与延伸方向
    1. 数据构建:亟需开发自动化或人在回路的工具,构建大规模、多任务、统一格式的音频编辑指令数据集。
    2. 精细控制:未来的研究可探索更精细的掩码引导和注意力控制机制,以解决长音频或复杂音频场景下的局部编辑伪影问题。
    3. 多模态与交互式编辑:结合大语言模型(LLM),向支持多轮交互、多模态输入(如视觉引导的音频编辑)的统一型音频编辑系统发展(如文中提到的AudioChat)。
    4. 安全与伦理:随着语音克隆和音频修改技术的成熟,音频伪造防范、水印添加及版权保护将成为不可忽视的研究方向。
#24
eess.AScs.SD
Alibaba (World Famous IT Company)

FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech 跨领域

Haoxu Wang, Biao Tian, Weiqing Li, Xiang Lv, Han Zhao 等 (6 人)
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: Accepted by Interspeech 2026
查看摘要
Existing Reinforcement Learning (RL) research for Text-to-Speech (TTS) focuses on large language models (LLMs), leaving Flow-Matching (FM) under-explored. We present FlowTTS-GRPO, an online RL framework for FM-based TTS. By converting ordinary differential equation (ODE) trajectories into stochastic differential equation (SDE) paths, our method enables direct fine-tuning of open-source FM models without auxiliary models. We show that a weighted reward combination converges faster than a probabilistic scheme, and identify three practical optimizations: omitting classifier-free guidance (CFG) during training accelerates convergence; synthesizing hard cases improves robustness; and applying RL to the FM component enhances audio-detail metrics. Experiments on CosyVoice 3.0 and F5-TTS demonstrate objective and subjective preference gains in speaker similarity and perceptual quality, with F5-TTS also improving intelligibility.

📖 深度解读

1. 一句话总结

本文提出了FlowTTS-GRPO框架,通过将流匹配TTS模型中的确定性ODE轨迹转换为随机SDE路径,首次将在线强化学习直接应用于开源流匹配TTS模型,利用多目标奖励优化显著提升了零样本语音克隆的音色相似度和感知质量。

2. 研究背景与动机

  • 核心问题:如何对基于流匹配(Flow-Matching, FM)的文本转语音(TTS)模型进行强化学习(RL)微调,以更好地对齐人类听觉偏好。
  • 重要性:TTS在人机交互中至关重要,而后训练(如RL)能将生成模型与人类感知或下游任务目标对齐,是提升生成质量的关键手段。
  • 现有不足:现有TTS的RL研究多集中于大语言模型(LLM),面临需要辅助模型(如PPO)、需大量人工标注偏好对(如DPO)或易受奖励模型偏差影响等问题。针对FM模型的RL研究极少,已有的F5R-TTS需要单独训练高斯FM生成器来引入随机性,且无法利用组内多采样优势和多目标优化。

3. 核心方法

  • 提出方法:FlowTTS-GRPO,一个针对FM-based TTS的在线RL微调框架。
  • 关键创新点
    1. ODE到SDE的转换:FM模型原本的解码过程是确定性的(ODE),缺乏RL探索所需的随机性。该方法将其转换为随机微分方程(SDE),在去噪过程中引入高斯噪声,使得模型能对同一输入生成多种不同的语音样本,满足GRPO算法的探索需求。
    2. 简化RL流程:去除了价值网络、偏好对和token-to-reward模型,直接利用现成的ASR、说话人验证和DNSMOS模型作为奖励信号。
    3. 带标准差归一化的多目标奖励加权:针对音色相似度、可懂度和感知质量三个目标,发现直接加权会导致方差大的奖励主导优化。通过将每个奖励在batch内除以标准差进行归一化,实现了更精确的权重控制和更稳定的收敛。
    4. 实用优化策略:训练时省略无分类器引导(CFG)以加速收敛;引入“困难样本”合成(如词语重复、绕口令)提升鲁棒性。
  • 核心思路(直觉解释):FM模型原本像走固定路线的导航(ODE),缺乏探索性。本文将其改为带有随机扰动的路线(SDE),这样同一个输入可以生成多个不同的语音样本。然后比较这些样本,奖励那些音色更像、发音更准、音质更好的,让模型学习生成更优样本的“路线”。

4. 实验与结果

  • 数据集:训练集为WenetSpeech4TTS(中文)和LibriTTS-960(英文);评估集为Seed-TTS-Eval和CV3-Eval。
  • 基线方法:CosyVoice 3.0 (CV3)、F5-TTS、Seed-TTS、MaskGCT等。
  • 主要实验结果
  • 在CV3上,RL微调后音色相似度(SS2)从0.830提升至0.859,SS1从0.777提升至0.804,在Seed-TTS-Eval-zh上超越了闭源的Seed-TTS,达到SOTA。
  • 在F5-TTS上,不仅音色相似度和感知质量提升,可懂度(CER)也有显著改善。
  • 主观A/B测试中,经过RL微调的模型在整体MOS和音色相似度上均被更多偏好。
  • 消融实验揭示
  • 困难样本合成对纯FM模型(F5-TTS)提升可懂度有效,但对LLM-FM混合模型(CV3)效果不明显,印证了混合架构中可懂度主要由LLM决定。
  • 带标准差归一化的加权组合比概率组合收敛更快更稳。
  • 训练时省略CFG能增加探索,加速RL收敛。
  • 噪声水平控制探索范围,0.5达到训练饱和点。

5. 优势与局限

  • 主要优势
    1. 通用性强且轻量:无需额外训练辅助模型,可直接微调开源FM模型,适用于纯FM和LLM-FM混合架构。
    2. 多目标优化有效:通过标准差归一化解决了奖励尺度差异问题,避免了reward hacking。
    3. 揭示架构特性:明确了在LLM-FM混合系统中,RL优化LM主要提升可懂度,优化FM主要提升音色和音质,为后续研究指明方向。
  • 局限性
    1. 训练开销大:RL需要大量采样(如每次迭代生成数百个样本),导致训练成本较高,F5-TTS的训练时间明显长于CV3。
    2. 多语言泛化受限:虽然展现了跨语言泛化能力,但训练数据仅限中英文,其他语言的提升可能未达上限。
    3. 混合架构的可懂度瓶颈:在LLM-FM架构中,单独优化FM无法突破LLM生成token的质量限制,可懂度提升有限。

6. 关键结论与启发

  • 关键Takeaway:强化学习通过ODE-SDE转换能有效提升FM-based TTS的性能;多目标奖励需标准化处理以防方差主导;混合架构中LM与FM在RL中扮演不同角色,应分工优化。
  • 启发与延伸方向
    1. 未来可扩展多语言数据的RL训练,进一步提升跨语言零样本克隆能力。
    2. 可探索对LLM和FM进行联合RL优化,以全面突破可懂度和音质的瓶颈。
    3. 困难样本合成策略可推广至其他生成模型的RL训练中,提升模型在边缘案例的鲁棒性。
🔥 推荐必读
🏷️ 领域语音合成 (TTS) > Zero-shot TTS / 声音克隆
💡 创新在线强化学习微调流匹配TTS——基于流匹配TTS模型,将确定性ODE转换为随机SDE引入探索性,并结合带标准差归一化的多目标奖励优化
⭐ 评分8.0
#25
eess.AS

An Acoustic Landmark Database of the English Lexicon via Articulatory Synthesis

Mateo Cámara, José Luis Blanco, Juan Ignacio Godino-Llorente, Jeung-Yoon Choi, Stefanie Shattuck-Hufnagel
Audio and Speech Processing (eess.AS)
Comments: Accepted to Interspeech 2026 Main Track
查看摘要
Acoustic landmark theory treats speech as organized around the acoustic consequences of articulatory gestures that shape the vocal tract and airflow. Progress is limited by the scarcity of large, unambiguously annotated landmark datasets. We invert the problem by generating speech from landmark patterns. Using the Pink Trombone physical vocal-tract synthesizer, we produce an English lexicon for two adult configurations (male, female). With direct control of gestures, we place landmark labels algorithmically at the exact times of their physical events (e.g., oral closures/releases). The corpus contains $>$200,000 synthesized words, rendered for both configurations with time-aligned annotations; intelligibility is measured with STOI. We leverage it for statistics across the lexicon from an articulatory-event view, reporting landmark frequencies and dominant cue patterns, and enabling quantitative studies plus training/benchmarking of automatic landmark detectors.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文利用Pink Trombone物理声道合成器,生成了包含超过20万个英语单词的声学地标数据库,通过直接控制发音参数实现了精确的算法化地标标注,解决了语音学研究中缺乏大规模、无歧义标注数据集的问题。

2. 研究背景与动机

  • 核心问题:声学地标理论认为语音是围绕离散的、由发音动作引起的声学事件(如爆破音的瞬间释放、元音的能量峰值)组织的。但该理论的发展长期受限于缺乏大规模、准确标注的地标数据集。
  • 重要性:基于事件驱动的语音处理方法在自动语音识别(ASR)(特别是在嘈杂环境下)和临床语音病理学评估中展现出巨大潜力。
  • 现有不足:人工标注真实语音极其耗时且主观性强;现有的自动标注工具(如Auto-Landmark)缺乏独立验证;更关键的是,真实连续语音中存在广泛的协同发音和弱化现象,导致“预期”的声学事件常常模糊或缺失,难以从声学信号中反向推断出绝对可靠的“真实标签”。

3. 核心方法

  • 提出方法:提出一种“反向生成”的思路,不分析真实语音,而是使用基于物理模型的Pink Trombone声道合成器,从发音动作正向生成英语词汇库(ALLIE-PT数据库)。
  • 关键创新点
    1. 生成式确定性标注:地标标签不是从音频中事后推断的,而是直接由发音指令的触发时间确定(如口腔完全闭合的瞬间),保证了100%无歧义的“真实标签”。
    2. 物理与声学的直接映射:通过直接控制合成器的物理参数(舌头位置、唇闭合、软腭等),将抽象的音素映射为具体的发音动作,并产生对应的声学事件。
    3. 受控的无韵律沙盒环境:采用固定音素时长和恒定基频(f0),剥离了韵律变化,提供了一个纯净的基线,专门用于研究音段声学现象。
  • 直觉性解释:就像在虚拟实验室里用3D打印机造字,因为是我们自己控制机器的每一个机械动作(比如什么时候闭嘴、什么时候张嘴),所以我们可以精确记录下每一个动作发生的准确时间点。这些时间点就是“声学地标”,而机器发出的声音就是对应的语音。

4. 实验与结果

  • 数据集与基准:基于CMU发音词典(CMUDict),生成了超过20万个英语单词的合成语音,包含成年男性和女性两种声道配置。可懂度评估使用了哈佛句子集的子集。
  • 对比基线:在可懂度评估中,将合成语音与人类模仿无韵律风格的录音进行对比(注:论文刻意未将此数据集用于测试现有的自然语音地标检测器,而是定位为训练集)。
  • 主要实验结果
    1. 词典统计:辅音地标与元音/滑音地标的比例约为1.6。元音地标()最常见,其次是塞音闭合/释放(/)。
    2. 可懂度评估:合成语音的平均STOI(短时客观可懂度)得分约为0.75,表明其具有良好(虽非完美)的机器可懂度,足以支持后续研究。
    3. 视觉验证:通过频谱图、波形和发音参数的同步可视化,直观验证了物理指令(如声道闭合)与声学事件(如静音间隙及随后的宽带能量爆发)的完美对齐。
  • 消融实验:论文未进行传统的消融实验,但在讨论部分明确指出了当前方法的局限性对结果的影响(如固定时长和单一发音目标导致缺乏自然语音中的上下文变体)。

5. 优势与局限

  • 主要优势
    1. 标注绝对准确无歧义:摆脱了人工标注的主观性和自然语音协同发音的模糊性,提供了确定性的发音-声学映射基准。
    2. 高度可控的对比研究环境:男女声配置共享完全相同的发音指令,排除了自然语音中的录音条件、说话风格等混淆因素,便于研究声道解剖学差异对地标的影响。
    3. 语言无关性:该生成方法可扩展到低资源语言,无需大规模人工标注。
  • 局限性
    1. 声学真实感不足:Pink Trombone是简化模型,合成语音质量不及现代TTS,且固定时长和f0缺乏自然韵律。
    2. 理想化的时序关系:地标直接对应发音指令时刻,但在自然语音中,声学表现通常会滞后于物理发音动作(如鼻音化)。
    3. 缺乏协同发音的精细建模:每个音素仅映射到一个静态目标,采用线性插值,未能充分捕捉自然语音中受上下文影响的音位变体。

6. 关键结论与启发

  • 最重要的Takeaway:通过“分析-合成”的反向思路,利用物理发音模型可以绕过自然语音标注的瓶颈,为声学地标理论提供了一个大规模、确定性的基础参考语料库。
  • 启发与延伸方向
    1. 可作为下一代基于地标的ASR系统和自动地标检测器的训练和基准测试平台。
    2. 未来可引入韵律模型以生成更自然的语音,或扩展到儿童声道模型以支持语音发育和儿科临床语音学研究。
    3. 启发研究者探索如何在确定性生成数据与自然语音的复杂变体之间建立更好的桥梁(如引入上下文敏感的声学线索变化)。
#26
eess.AS

Acoustic Landmark Detector based on Conformer and HuBERT

Mateo Cámara, José Luis Blanco, Juan Ignacio Godino-Llorente, Jeung-Yoon Choi, Stefanie Shattuck-Hufnagel
Audio and Speech Processing (eess.AS)
Comments: Accepted to Interspeech 2026 Main Track
查看摘要
Acoustic landmarks (abrupt acoustic changes tied to speech events) offer a linguistically grounded representation for speech analysis. We study automatic landmark detection with Conformer models, evaluating 14 configurations spanning architecture, loss, label representation, feature extractor, and data conditions on 1 839 manually annotated utterances with eight landmark types. We propose Gaussian soft labels with per-class temporal spread (sigma=10-20 ms), improving F1-at-20 ms by 7.0% absolute vs. hard labels by modeling annotation variability. Frozen HuBERT features perform best without fine-tuning (F1-at-20 ms=0.77). Stops and fricatives are reliable (F1>0.80), while vowels remain challenging (F1 approx 0.55). On our corpus, our system reaches a 13.8% Landmark Error Rate (LER). This is not directly comparable to AutoLandmark (31.3%) or SpeechMark (56.5%), evaluated on a different corpus and metric. Per-class trends show detectability increases with event abruptness, consistent with Stevens' theory.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种基于Conformer和冻结HuBERT特征的声学标志点检测系统,并通过引入按类别设定时间展宽的高斯软标签策略,有效解决了人工标注的时间不确定性问题,显著提升了语音中关键发音事件的检测精度。

2. 研究背景与动机

  • 核心问题:如何利用深度学习模型,直接从语音信号中自动且精准地定位和分类声学标志点(如元音、滑音、塞音、擦音等的闭合/释放瞬间)。
  • 重要性:声学标志点是连接原始声学和音系学特征的桥梁,为语音识别、临床语音评估等提供了具有语言学意义的表征。
  • 现有不足:传统的标志点检测主要依赖基于信号处理的手工启发式规则,上下文建模能力有限;而现有的深度学习方法多聚焦于“音素边界检测”,针对更稀疏、语言学定义不同的“声学标志点检测”研究尚不充分。此外,人工标注标志点的精确时间点存在固有不确定性,传统的硬标签(单帧标注)忽略了这种模糊性。

3. 核心方法

  • 模型/框架:基于Conformer编码器的帧级分类系统,结合峰值检测后处理。
  • 关键创新点
    1. 按类别设定的高斯软标签:将原本的单帧硬标签替换为高斯分布的概率标签,其方差($\sigma$)根据发音类型的声学持续时间设定(如元音过渡慢设为20ms,塞音爆破快设为10ms)。
    2. 系统评估自监督特征:对比了Mel频谱图、wav2vec2、HuBERT及混合特征在标志点检测中的表现。
    3. 基于声学理论的误差分析:将不同标志点的检测难度与Stevens声学理论中“发音动作的突变性”进行了关联验证。
  • 直觉性解释:想象你在语音波形上寻找“发音动作发生的瞬间”。不同动作的持续时间不同(比如发元音时口腔变化较缓慢,发塞音爆破时极其短暂)。人工标注时,标注员很难给出一个绝对精确的毫秒级时间点。本文的方法是用一个“钟形曲线(高斯分布)”把那个时间点向两边“糊”开一点,糊开的宽度根据发音类型来定。这样模型不仅学到了“在哪”,还学到了“这个事件大概持续多宽”,从而大幅缓解了标注误差带来的学习干扰。同时,模型直接使用预训练好的HuBERT提取语音特征,因为HuBERT已经懂了各种发音方式,不需要再从头训练。

4. 实验与结果

  • 数据集/基准:自建语料库(1,839条录音,3位说话人,8种标志点类型);并在Auto-Landmark使用的TIMIT测试集上进行了零样本跨语料库评估。
  • 对比基线:对比了不同特征(Mel, wav2vec2, HuBERT, 混合特征)、不同损失函数、不同模型容量以及硬标签基线。
  • 主要实验结果
    1. 冻结的HuBERT特征表现最佳,F1@20ms达到0.77,F1@30ms达到0.84。
    2. 高斯软标签是最大的性能提升点,相比硬标签绝对提升了7.0%(F1@20ms),特别是元音的F1从0.18暴涨至0.54。
    3. 在自建语料库上达到13.8%的LER(Landmark Error Rate)。
    4. 塞音和擦音最容易检测(F1>0.80),元音和鼻音最难(F1≈0.55)。
  • 消融实验揭示:Focal loss会降低峰值锐度导致性能下降;将模型拆分为5个独立小模型会导致数据碎片化,性能大幅下降;仅用VCV音节训练性能最差,说明需要语音多样性;数据增强和合成预训练在当前数据集上收益甚微。

5. 优势与局限

  • 主要优势
    1. 软标签策略巧妙且有效:直接针对时间序列标注中的不确定性建模,方法简单但收益巨大。
    2. 免微调的自监督特征:直接使用冻结HuBERT即可获得强大的跨子集(VCV到真实词)泛化能力。
    3. 实验设计严谨:进行了多达14种配置的消融实验,并从语言学理论角度解释了模型表现的差异。
  • 局限性
    1. 数据规模太小:仅3位说话人,1839条短录音,且仅使用单一的训练/测试集划分,泛化性存疑。
    2. 跨语料库迁移能力有限:在TIMIT数据集上的零样本测试中,LER远高于专门在该数据集上训练的Auto-Landmark系统(特别是鼻音迁移效果差)。
    3. 未进行SSL模型微调:仅使用了冻结特征,未探索微调HuBERT等大模型带来的潜在收益。

6. 关键结论与启发

  • 最重要的Takeaway:对于时间定位要求严格的语音事件检测任务,标签表示方式(如高斯软标签)和预训练特征的选择,比单纯增加模型容量或使用复杂数据增强更为关键。
  • 启发与延伸方向
    1. 未来研究应针对“元音”等声学过渡缓慢、难以定位的事件设计专门的检测策略,而不是与突发性事件一视同仁。
    2. 可以尝试微调WavLM、Whisper等更先进的自监督模型,以进一步提升对细粒度发音事件的捕捉能力。
    3. 需要在更大规模、连续且自发的语音数据集上验证该框架的普适性。
#27
eess.AS

Word Lengthening as a Function of Utterance Position: A Multi-Corpus Study

Mateo Cámara, José Luis Blanco, Juan Ignacio Godino-Llorente, Jeung-Yoon Choi, Stefanie Shattuck-Hufnagel
Audio and Speech Processing (eess.AS)
Comments: Accepted to Interspeech 2026 Main Track
查看摘要
Efficient turn-taking requires interlocutors to predict turn endings within a few hundred milliseconds. Beyond syntactic and pragmatic completion, prosody (especially pre-boundary lengthening) supports projection. We test whether turn-final words are longer than mid-sentence words, whether this reflects prosodic modification rather than lexical choice, and where within the word it concentrates. We analyze four corpora spanning styles and two languages (English, Spanish): Switchboard, Columbia Games, BU Radio, and Glissando, with >500 speakers, $39{,}470$ turn-final and $206{,}268$ mid-sentence tokens across $\sim39{,}500$ turns. Turn-final words are longer (mean ${\approx}191$\,ms; $d=1.14$). The effect persists in matched-word, within-speaker comparisons ($80$\,ms; $p<0.001$) and is localized mainly to the final syllable ($d=0.89$). Turn-final lengthening thus emerges as a robust, localized cue to floor transfer.

📖 深度解读

1. 一句话总结

这篇论文通过分析四个跨语言和风格的语音语料库,证实了说话人在话轮结尾时会显著拉长最后一个词(尤其是最后一个音节)的发音,这是一种稳健的、用于提示话轮交接的韵律学线索,而非单纯的词汇选择习惯。

2. 研究背景与动机

  • 核心问题:话轮结尾的词长延长现象是否在不同语言和语音风格中普遍存在?这种延长是由于说话人故意拉长发音(韵律修饰),还是仅仅因为人们在句末喜欢用较长的词(词汇选择)?此外,这种延长是分布在整个词中,还是集中在特定位置?
  • 重要性:人类对话中话轮交接非常快(通常只有约200毫秒的间隔),比大脑生成语言的反应时间还要短。这意味着听者必须提前预测对方何时说完。韵律(特别是边界前的拉长)是帮助听者预测话轮结束的关键线索。
  • 现有不足:以往关于“边界前延长”的研究多集中在朗读语音或实验室环境中,缺乏对自然对话、跨语言以及词内具体延长位置(如音节级别)的大规模系统性量化验证。

3. 核心方法

  • 方法/框架:多语料库对比与统计分析法。研究使用了四个语料库(Switchboard, Columbia Games, BU Radio, Glissando),涵盖英语和西班牙语,以及自发对话、任务导向和朗读三种语音风格。
  • 关键创新点
    1. 同词同说话人匹配分析:为了排除“句末爱用长词”的词汇干扰,研究提取了同一个说话人在不同录音中说的同一个词,对比其作为“话轮末尾词”和“句中词”的时长。
    2. 音节级定位分析:不仅看整词时长,还深入到音节级别,对比多音节词中“末尾音节”和“非末尾音节”的时长变化。
    3. 跨风格与跨语言验证:在四个不同风格、两种语言的语料库中统一验证该现象的鲁棒性。
  • 直觉性解释:想象你在和别人聊天,快说完一段话准备把发言权交出去时,你会不自觉地把最后一个字拖长音(比如“我知道了——”)。这篇论文就是用大数据证明:大家都会这么干,不管说英语还是西班牙语,不管是在读稿子还是自由聊天;而且这并不是因为大家喜欢在句末用长词,而是发音器官在边界处自然放慢了动作,这种“拖长音”主要集中在最后一个音节上。

4. 实验与结果

  • 数据集/基准:Switchboard(英语电话)、Columbia Games(英语任务对话)、BU Radio(英语朗读广播)、Glissando(西班牙语朗读)。包含超过500名说话人,约39,470个话轮末尾词和206,268个句中词。
  • 对比基线:基础均值对比、Welch t检验、Cohen's d效应量计算,以及ToBI韵律边界强度对比。
  • 主要实验结果
    1. 整体延长:话轮末尾词平均时长0.44秒,句中词0.24秒,末尾词平均延长约203毫秒(d=1.22,效应极强)。
    2. 排除词汇干扰:在“同词同人”匹配测试中,话轮末尾词仍平均延长约80毫秒(d=0.59),证明这是真实的发音修饰,而非选词造成的。
    3. 音节定位:延长效应几乎全部集中在词的最后一个音节(d=0.89),非末尾音节几乎没有变化(d=0.01)。
    4. 边界强度正相关:ToBI边界指数越高(代表边界越强),词的时长越长(0.22s -> 0.34s -> 0.44s)。
  • 消融/控制实验:排除了简短的附和词(如“yeah”, “okay”),排除了词长(字符数/音节数)的干扰。发现附和词本身延长效应极小,排除后主效应更强;且无论词长短,话轮末尾的延长效应都显著存在。

5. 优势与局限

  • 主要优势
    1. 控制严谨:通过“同词同人”匹配设计,巧妙排除了词汇选择和个体发音习惯的干扰,确证了韵律修饰的作用。
    2. 规模与泛化性强:跨越4个语料库、2种语言、3种语音风格,数据量大,结论具有很强的普适性。
    3. 定位精准:将分析下沉到音节级别,明确了延长效应的物理位置,支持了边界相邻时间控制理论。
  • 局限性
    1. 语言类型受限:仅研究了英语和西班牙语(均为重音节拍语言),未涵盖音节节拍语言(如法语)、莫拉节拍语言(如日语)或声调语言(如汉语)。
    2. 混杂变量未完全控制:未在统一回归模型中控制语速和句法结构,也未控制信息结构(如焦点、已知信息)对时长的影响。
    3. 语料库异质性:不同语料库的标注精度和标准存在差异,跨语料库的直接比较可能受此影响。

6. 关键结论与启发

  • 最重要的Takeaway:话轮末尾的词延长是一个跨语言、跨风格的稳健韵律现象,它不是词汇选择的副作用,而是发音器官在边界处局部放慢(主要集中在最后一个音节)的结果,为听者预测话轮交接提供了关键的时间线索。
  • 启发与延伸方向
    1. 人机交互/对话系统:为语音合成(TTS)和对话系统提供了具体的量化目标(如末尾词延长约80-200ms)。AI在生成语音时若加入这种局部延长,能让话轮交接更自然,减少抢话或冷场。
    2. 认知科学:支持了人类在对话中利用局部声学线索提前规划回应的认知模型。
    3. 未来研究:应将研究扩展到更多类型的语言,并引入语速、句法和信息结构的联合建模,以进一步剥离纯韵律效应。
#28
eess.AS

Don't Listen to Me: A Lightweight, Low-Latency Model for Own-Voice Cancellation in Far-Field Speech Enhancement

Mads Østergaard, Alexander Neergaard Zahid, Karl Ulbæk, Andreas Hansen Bagge, Kenny Falkær Olsen 等 (6 人)
Audio and Speech Processing (eess.AS)
Comments: Accepted at Interspeech 2026
查看摘要
We introduce own-voice cancellation (OVC): removing a target (enrolled) speaker from a noisy multi-speaker mixture while preserving any remaining speech. Framed as the complement of target speaker extraction, OVC addresses latency-induced own-voice artifacts that arise when a far-field device streams enhanced audio back to the user, as the round-trip time easily exceeds the perceptual threshold for own-voice distortion. We condition a time-domain model with only 2 ms algorithmic latency on a short enrollment utterance and benchmark TD-SpeakerBeam alongside a lighter Mamba-MinGRU masker built from Mamba blocks with MinGRU temporal mixing. Replacing the ConvTasNet-based auxiliary network with a linear RNN encoder improves both signal-to-distortion ratio and predicted MOS while reducing compute. Results establish OVC as a practical, low-latency enhancement objective for far-field denoising.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文提出了“自身语音消除(OVC)”任务,并设计了一种基于线性RNN(Mamba-MinGRU)的轻量级低延迟模型,在远场语音增强中有效去除了用户自己的声音,从而解决了音频流回传时因延迟产生的回声干扰问题。

2. 研究背景与动机

  • 核心问题:当远场设备(如桌面麦克风)捕获声音、增强并流式传回给用户时,由于往返处理延迟(通常超过10ms),用户会听到自己声音的回声,产生干扰。
  • 重要性:研究表明,延迟超过15-20ms会被大多数用户视为不可接受,严重影响通信质量和交互体验。因此,在流式去噪系统中抑制自身语音至关重要。
  • 现有不足:传统的声学回声消除(AEC)需要已知的远端参考信号,但在很多场景下无法获取;目标语音提取(TSE)是提取目标声音,而我们需要的是反向操作。此外,现有的深度学习语音增强模型通常计算量大、延迟较高,难以满足仅2ms的极低延迟流式处理需求。

3. 核心方法

  • 提出的方法/框架:论文提出了自身语音消除任务,并构建了基于线性RNN的Mamba-MinGRU模型。该模型包含一个主网络(负责消除自身语音)和一个辅助网络(负责从注册语音中提取说话人特征)。
  • 关键创新点
    1. 定义OVC任务:将自身语音视为“噪声”进行消除,保留其他人的声音和环境声,无需远端参考信号。
    2. Mamba-MinGRU主网络:用MinGRU作为时间混合器替换传统结构,实现2ms极低算法延迟和高计算效率。
    3. 线性RNN辅助网络:用双向线性RNN替换传统的ConvTasNet辅助编码器,提取更优的说话人表征且大幅降低计算量。
  • 直觉性解释:想象你在开视频会议,麦克风把你的声音录进去又从扬声器放出来,因为有一点网络延迟,你听起来像在回声山谷里说话。这篇论文的做法是:先让系统“听”一段你的声音样本(注册),记住你的声纹特征。然后系统在处理麦克风收到的混合声音时,专门把带有你声纹特征的声音“抠掉”,把其他人的声音和背景音保留下来传出去。为了做到实时且不卡顿,系统使用了非常轻巧的“线性RNN”结构,处理速度极快,延迟只有2毫秒。

4. 实验与结果

  • 数据集/基准:使用LibriSpeech结合WHAM!噪声进行动态混合训练,并在LibriMix上生成多人场景测试。
  • 基线方法:TD-SpeakerBeam(分别用于TSE和OVC任务对比)。
  • 主要实验结果
  • OVC和TSE任务难度相当,均能达到约13 dB SDR。
  • Mamba-MinGRU模型以极低的计算量(0.33 vs 4.97 GMAC/s)达到了与基线相当的性能。
  • 使用线性RNN辅助网络不仅将辅助计算量从1.67降至0.26 GMAC/s,还在全混合条件下提升了SDR(最佳达13.57 dB)。
  • Small版本的模型RTF(实时因子)为0.82(<1即代表能实时处理),在单线程CPU上实现了2ms延迟的实时流式处理。
  • 消融/分析实验
  • 音高影响:当两个说话人音高相同时,消除自身语音更困难;当注册说话人音高较低时,消除效果稍好。
  • 多人场景:随着混合语音中说话人数量增加(3-5人),SDR普遍下降约2dB,说明模型在复杂声学场景下仍有提升空间。

5. 优势与局限

  • 主要优势
    1. 极低延迟与高效率:2ms算法延迟,Small模型RTF<1,适合资源受限的边缘流式设备。
    2. 任务定义新颖实用:无需远端参考信号即可解决远场流式传输中的自身语音回声问题。
    3. 架构创新:证明了线性RNN(Mamba+MinGRU)在音频处理中不仅计算高效,还能提供优质的说话人表征。
  • 局限性
    1. 多人场景性能退化:在3人及以上的混合语音中,性能明显下降(论文也承认这是未来工作)。
    2. 任务权衡:使用线性RNN辅助网络虽然提升了全混合条件下的表现,但在纯去噪(无自身语音)条件下性能有所下降。
    3. 环境限制:目前仅在非混响条件下进行了测试,未验证在真实混响环境下的鲁棒性。

6. 关键结论与启发

  • 最重要的Takeaway:将“自身语音消除”作为远场语音增强的实用目标是非常有效的;基于线性RNN的架构能够在极低延迟和低算力下达到传统复杂模型的性能。
  • 启发与延伸方向
    1. 可以探索将OVC与传统的AEC结合,或者在有参考信号时进一步提升性能。
    2. 后续研究应解决多于2人的复杂场景以及混响环境下的OVC问题。
    3. MinGRU和Mamba等线性RNN在实时因果音频处理中展现出巨大潜力,可推广至其他低延迟语音处理任务(如助听器、实时翻译设备)。
#29
eess.AS

PHAST-Net: Attention-Guided, Physics-Informed Network for Unified Estimation of Ideal Time-Frequency Representations

James M. Cozens, Simon J. Godsill
Audio and Speech Processing (eess.AS); Computer Vision and Pattern Recognition (cs.CV)
查看摘要
We introduce PHAST-Net, an attention-guided, physics-informed network for unified estimation of Ideal Time-Frequency Representations (ITFRs), spanning spectral, tempo-based, metrical, and harmonic representations such as Spectrograms, Tempograms, and Metrograms. PHAST-Net learns an application-general mapping from a constellation of wavelet transforms, the proposed Continuous Log-frequency Adaptive Wavelet Transform (CLAWT), to high-resolution, cross-term-suppressed time-frequency (T-F) representations. The proposed constellation of CLAWTs is selected through Cohen's class kernel analysis to maximise curvature coverage in a logarithmic-frequency T-F plane tailored to harmonic signal structure. PHAST-Net further incorporates a proposed physics-informed auxiliary reprojection loss designed to reconstruct the idealised observed CLAWT constellation from the predicted ITFR and the corresponding Cohen's class kernels during training. This auxiliary objective promotes transform consistency and energy conservation, mitigates pathological target sparsity, and enhances optimisation stability. Attention layers further promote effective cross-term suppression across the input constellation. The log-frequency formulation also enables Harmonic PHAST-Net, which estimates a Harmonic ITFR that isolates fundamental structure, supporting robust fundamental-only representations for speech and music, such as derived fundamental Tempograms and Metrograms. We further introduce Spline-PHAST-Net, which parameterises detected and associated T-F ridges as continuous spline trajectories, enabling arbitrary-grid re-rendering and signal reconstruction. Trained on an effectively unbounded procedurally generated dataset, PHAST-Net demonstrates improved accuracy over established approaches, providing a unified framework for high-resolution, cross-term-robust analysis of speech, music, and broader nonstationary signals.

📖 深度解读

1. 一句话总结

PHAST-Net是一种结合注意力机制和物理约束的深度学习网络,通过将多种对数频率小波变换映射为理想时频表示,有效解决了非平稳信号分析中高分辨率与交叉项干扰难以兼顾的经典难题。

2. 研究背景与动机

  • 核心问题:如何为非平稳信号(如语音、音乐、生物电信号等)获取高分辨率且无交叉项干扰的理想时频表示(ITFR)。
  • 重要性:时频分析是信号处理的基础工具,高质量的时频表示对于信号转录、分解、分类、恢复及可视化至关重要,尤其在音频处理和医学信号分析中具有广泛应用。
  • 现有不足:传统方法(如Wigner-Ville分布、同步压缩、重分配等)在抑制多分量信号的交叉项干扰与保持自项高分辨率之间存在难以调和的权衡;现有深度学习方法大多缺乏与底层物理变换的显式一致性约束,在密集多分量和低信噪比条件下表现不佳;针对谐波丰富的信号,缺乏在对数频率域直接进行统一集中增强和干扰抑制的有效框架。

3. 核心方法

  • 提出的方法:PHAST-Net(Physics-Informed Harmonic Adaptive Spectral Transform Network)及其变体。这是一个基于注意力U-Net的框架,输入为精心挑选的连续对数频率自适应小波变换(CLAWT)星座,输出为高保真的理想时频表示。
  • 关键创新点
    1. CLAWT星座与对数频率域建模:提出CLAWT,通过Cohen类核分析挑选15个不同方向和尺度的小波组成输入星座。在对数频率域进行处理,使得谐波结构具有平移等变性,从而便于分离基频与泛音。
    2. 物理信息辅助重投影损失:在训练时,将网络预测的ITFR通过推导出的Cohen类核重新投影,重建无交叉项的观测星座。这强制了变换一致性,促进了能量守恒,并缓解了目标稀疏性导致的优化不稳定。
    3. 注意力引导与空间特征变换(SFT):利用注意力机制有效融合多通道输入并抑制交叉项;引入SFT处理对数频率缩放引起的频率相关核变化。
    4. 样条轨迹参数化与重建:Spline-PHAST-Net通过脊检测和数据关联算法,将时频脊参数化为连续样条轨迹,实现任意网格重渲染和信号相位对齐重建。
  • 直觉解释:就像用多个不同角度和焦距的相机(CLAWT星座)拍摄一个快速移动的物体,每张照片都有模糊和重影(交叉项)。PHAST-Net利用注意力机制和物理定律(重投影损失),像“AI修图师”一样,把这些模糊的照片合成出一张完美清晰、无重影的运动轨迹图(ITFR)。由于在对数频率域处理,它还能像“滤镜”一样把泛音滤掉,只保留基频轨迹。

4. 实验与结果

  • 数据集/基准:使用了语音(Harvard sentences)、真实音乐(小提琴)、复杂合成多分量信号,以及带有变节奏和变节拍的合成音乐片段。训练数据为程序生成的无界合成数据集。
  • 基线方法:SST, RS, AOK, S-Method, CW, RIFT, SET。
  • 主要实验结果
  • 在复杂合成信号基准上,PHAST-Net在所有信噪比(-10dB到无噪声)下,Bhattacharyya系数、Jensen-Shannon散度和Ridge Energy Ratio三项指标均显著优于所有基线方法。例如在-5dB下,Bhattacharyya系数达到0.970(RIFT为0.908,SST为0.816)。
  • 在低信噪比下优势尤为明显,展现出极强的抗噪和抗交叉项能力。
  • 在语音和音乐实验中,成功提取了高精度的基频轨迹,有效抑制了谐波和交叉项。
  • 在Tempogram和Metrogram实验中,推断结果高度接近理想基准,成功捕捉了复杂的节奏和节拍变化。
  • 消融实验:论文在补充材料中对评估指标中的软容差参数$\sigma_I$进行了消融,确认了相对指标排名对该参数不敏感,证明了对比结果的稳健性。

5. 优势与局限

  • 主要优势
    1. 物理一致性与高鲁棒性:通过物理信息重投影损失约束,保证了预测结果在变换域的一致性和能量守恒,使其在极低信噪比下仍具有出色的抗干扰能力。
    2. 统一且多功能:不仅统一了频谱、节奏、节拍和和声的时频表示,还通过Harmonic和Spline变体实现了基频提取、去噪和连续信号重建。
    3. 无需真实标注数据:利用程序生成的无界合成数据集进行训练,解决了深度学习时频分析中难以获取大量真实理想标签的问题。
  • 局限性
    1. 计算复杂度:高容量的U-Net架构加上15通道的CLAWT输入,以及复杂的物理重投影损失计算,在训练和推理时可能具有较高的计算开销(论文未详细讨论实时性)。
    2. 依赖合成数据:虽然合成数据涵盖了多种情况,但真实世界信号的复杂性和多样性可能仍存在“域差距”,论文未在大型真实世界数据集上进行广泛的定量验证。
    3. 对数频率域的局限:虽然对数频率域非常适合音频和谐波信号,但对于非谐波或需要严格线性频率分析的科学信号(如某些雷达或地震信号),其适用性可能需要进一步调整。

6. 关键结论与启发

  • 关键Takeaway:将物理先验(Cohen类核重投影)与深度学习(注意力U-Net)结合,是解决时频分析中“分辨率与交叉项干扰”经典矛盾的有效途径。对数频率域的建模为处理谐波信号提供了天然的平移等
#30
eess.AScs.SD

EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis 跨领域

Minghui Wu, Ganjun Liu, Zikun Fang, Ting Meng, Hongchuan Wu 等 (9 人)
Computation and Language (cs.CL); Artificial Intelligence (cs.AI); Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: 5 pages, 3 figures, 4 tables. Submitted to Interspeech 2026. Audio demos: this https URL
查看摘要
Instruction-based controllable speech synthesis enables users to specify emotions through natural language. However, existing approaches often rely on coarse emotion labels and lack explicit modeling of fine-grained intensity. We propose EmoInstruct-TTS, a dual-path instruction-guided framework for emotional speech synthesis. We introduce Emotion2embed, a supervised semantic-acoustic emotion embedding covering 48 emotional states, including fine-grained categories and intensity levels. To infer embeddings from free-form instructions, we design an Instruction-Conditioned Emotion Flow Model (ICE-Flow) that generates acoustically grounded emotion representations. The inferred embeddings are integrated into an LLM-based synthesis pipeline to provide explicit emotional control while preserving semantic planning. Experiments show improved emotional controllability and speech naturalness over strong baselines.

📖 深度解读

以下是对论文《EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis》的结构化中文解读报告:

1. 一句话总结

本文提出了一种名为 EmoInstruct-TTS 的双路径指令引导情感语音合成框架,通过结合自然语言指令(负责语义规划)和结构化细粒度情感嵌入(负责声学控制),解决了现有指令驱动TTS系统情感控制粗糙、难以建模细粒度情感强度的问题。

2. 研究背景与动机

  • 核心问题:如何在文本转语音(TTS)任务中,通过自然语言指令实现细粒度、可控且稳定的情感表达(特别是情感强度的变化)。
  • 重要性:随着TTS技术成熟,情感表达力成为提升虚拟助手、有声书和对话机器人用户体验与个性化程度的关键。
  • 现有不足
    1. 参考音频驱动方法:需要准备特定的参考音频,且容易受说话人音色影响,导致音色不匹配。
    2. 纯文本指令驱动方法:通常只能处理粗粒度的情感标签(如“开心”、“悲伤”),缺乏对情感强度(如“有点开心”vs“狂喜”)的显式建模机制;且纯语言指令往往不足以捕捉声音中的声学细节,导致情感控制不稳定。

3. 核心方法

论文提出了 EmoInstruct-TTS,一个将语义规划与情感声学控制解耦的双路径框架。
- 关键创新点
1. Emotion2embed:构建了一个包含48种情感状态(27个细粒度类别 + 7种主情绪×3种强度=21种组合)的结构化语义-声学情感表征。它通过多任务学习训练,特别引入了边界排序损失来保证情感强度的单调递增关系。
2. ICE-Flow(指令条件情感流模型):负责将自由文本指令映射为上述的 Emotion2embed。它通过样本级回归和分布级正则化,确保生成的情感嵌入既贴近真实声学特征,又保持丰富的多样性,避免模式崩溃。
3. 双路径融合架构:在LLM合成流水线中,指令文本走“语义路径”用于语言内容规划,ICE-Flow生成的情感嵌入走“声学路径”用于情感调制,两者互补。

  • 直觉性解释
    这就好比导演给演员导戏。导演的“剧本和台词提示”(文本指令)负责让演员把词念对、逻辑理顺(语义规划);而导演给出的“具体表演参数”(情感嵌入,比如“哭到颤抖的强度指数”)负责让演员的声线精准达标。ICE-Flow 就像一个翻译官,把导演模糊的白话指令翻译成精确的表演参数表,演员再根据这两份指令同时进行表演,从而做到既不念错词,又能精准传达细腻的情感。

4. 实验与结果

  • 数据集:ESD(英文情感数据集)和 CNCED(中文自然复杂情感数据集)。通过半自动流程构建了大规模弱标注集和精细标注集。
  • 基线方法:CosyVoice2 和 CosyVoice3(当前主流且强大的TTS基线)。
  • 主要实验结果
    1. 主观评测(MOS/ESMOS/SSMOS):在21种情感-强度任务和更具挑战性的27种细粒度情感任务中,EmoInstruct-TTS 在语音自然度(MOS)和情感相似度(ESMOS)上均显著超越 CosyVoice2/3。例如在女声27类任务中,ESMOS 从 3.55 提升到了 3.92。
    2. 客观评测(ECS/WER):在48类综合任务中,本方法的情感余弦相似度(ECS)最高(0.870),证明情感对齐最准确;虽然 WER(词错率)略高于 CosyVoice3,但依然保持竞争力。
  • 消融实验揭示
    1. 去掉情感嵌入(仅用文本),情感相似度(ESMOS)大幅下降,证明文本不足以独立控制精细情感。
    2. 去掉文本指令(仅用情感嵌入),虽然情感相似度尚可,但 WER(词错率)激增至 0.0486,说明缺乏语义引导会导致发音和文本内容不稳定。这证明了双路径互补的必要性。

5. 优势与局限

  • 主要优势
    1. 细粒度可控性强:通过显式建模情感强度并引入排序损失,解决了以往模型只能处理粗粒度情感的问题。
    2. 解耦设计兼顾文本与情感:双路径设计有效避免了“顾情感不顾发音”或“顾发音失真情感”的困境,保证了零样本下的高自然度。
    3. 推理高效:ICE-Flow 带来的额外延迟极低(增加约2-3ms),整体端到端延迟增加不到1-2%,具备工业落地价值。
  • 局限性
    1. 依赖预定义情感类别:尽管支持48种状态,但仍受限于预定义的情感分类体系,尚未完全实现开放域的自然语言情感描述驱动(论文在结论中也承认了这一点)。
    2. 发音准确率的权衡:实验显示,虽然情感控制力提升,但其 WER 略逊于完全以语音Token为中心建模的 CosyVoice3,说明引入复杂情感控制仍可能对文本发音的绝对准确性产生微小影响。

6. 关键结论与启发

  • 最重要的 Takeaway:在情感TTS中,纯语言指令和纯声学特征各有盲区。将“语义理解”与“声学情感嵌入”解耦并双路径融合,是实现高表现力、高可控性语音合成的有效范式。
  • 启发与延伸方向
    1. 走向开放域:未来可探索摆脱预定义标签,直接从开放域的自然语言描述中提取连续的情感潜变量。
    2. 方法论迁移:这种“文本负责语义+流模型生成结构化嵌入负责声学”的解耦思路,不仅可以用于情感控制,也可启发其他细粒度语音属性(如口音、韵律节奏、环境音效)的可控生成研究。
🔥 推荐必读
🏷️ 领域语音合成 (TTS) > 情感/风格可控语音合成 (TTS) > 可编辑/指令式 TTS
💡 创新指令引导的情感TTS——基于双路径融合架构,引入Emotion2embed结构化情感表征和ICE-Flow指令条件情感流模型,实现细粒度情感强度控制
⭐ 评分8.0
#31
eess.AS

Beyond ROC-AUC: Operating-Point Performance Reporting for Biometric Verification 跨领域

Ajan Ahmed, Masudul H. Imtiaz
Computer Vision and Pattern Recognition (cs.CV); Audio and Speech Processing (eess.AS)
查看摘要
A biometric verifier is often deployed with a strict false match budget, so only a narrow, low false match rate (FMR) slice of the score range is used. A reporting standard for this setting already exists. ISO/IEC 19795-1 asks for error rates at stated operating points, for the detection error tradeoff (DET) curve as the view of the trade-off between FMR and the false non-match rate (FNMR), and for an interval of uncertainty on every value. In practice, a single area under the receiver operating characteristic curve (ROC-AUC), the equal error rate (EER), or a verification accuracy is still reported as the resolution, which is a threshold-independent summary that the standard does not endorse. The full ROC-AUC averages the true match rate (TMR) with equal weight over the whole FMR range from 0 to 1, so almost all of its weight is placed where the system is never operated; low-FMR behavior can then be hidden, and the order of two systems can even be reversed. The guideline is revisited in this paper and tested against seven pretrained matchers across four modalities, face, voice, iris, and fingerprint, each reported with bootstrap confidence intervals and paired bootstrap tests. A system that looks stronger on full ROC-AUC is shown to be significantly worse at FMR = 10^-3. For face, a higher full AUC was obtained by FaceNet, whereas a higher TMR at FMR = 10^-3 was obtained by ArcFace, and both gaps were significant with non-overlapping intervals. Hence, the DET curve and the FNMR at a fixed FMR are re-iterated in this paper as the primary report, with ROC-AUC and EER retained as supplementary context.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文指出在生物识别验证中仅报告全局ROC-AUC具有误导性,主张回归ISO/IEC标准,以特定低误识率(FMR)操作点下的错误率和DET曲线作为核心评估指标。

2. 研究背景与动机

  • 核心问题:生物识别系统(如人脸、声音、指纹解锁)在实际部署时通常要求极低的误识率(FMR,如$10^{-3}$或更低),但学术界习惯用全局ROC-AUC或等错误率(EER)作为主要评估指标。
  • 重要性:实际应用(如边境检查、账户登录)对错误匹配零容忍。如果基于全局指标选型,可能导致部署的系统在关键阈值下表现极差,甚至引发冤假错案(如论文提到的因人脸识别错误导致的错误逮捕)。
  • 现有不足:全局ROC-AUC在0到1的线性FMR区间内平均计算,导致99.9%的权重落在了系统根本不会使用的宽松区间。这会掩盖系统在低FMR区域的真实表现,甚至导致两个系统的优劣排名发生逆转。此外,现有研究很少报告置信区间,使得微小的数值差异被过度解读。

3. 核心方法

  • 提出的方法/框架:提出以“操作点为中心”的生物识别性能报告框架,并附带一份符合ISO/IEC 19795-1标准的报告清单。
  • 关键创新点
    1. 量化了全局AUC对低FMR性能的“夸大效应”,并引入配对自助法进行系统间的显著性检验。
    2. 跨四种模态(人脸、声音、虹膜、指纹)实证了“指标选择能直接改变系统排名结论”的现象。
    3. 提出结合DET曲线、固定FMR下的FNMR、置信区间以及PR-AUC的综合评估与报告规范。
  • 直觉性解释:想象你在买一辆主要用于市区拥堵路况的汽车,但销售只给你看“包含90%高速路况的综合油耗”(全局ROC-AUC)。这辆看起来综合油耗极低的车,在市区里可能是个“油老虎”。论文呼吁大家直接看“市区油耗”(特定低FMR下的FNMR),并给出误差范围,而不是被综合指标忽悠。

4. 实验与结果

  • 数据集:人脸(LFW)、声音(VoxCeleb1)、虹膜(CASIA-Iris-Thousand)、指纹(FVC2002 Set B)。
  • 对比基线:7个广泛使用的预训练匹配器(如人脸的ArcFace与FaceNet,声音的ECAPA-TDNN与x-vector等)。
  • 主要实验结果
  • 夸大效应:声音模型x-vector的全局AUC高达0.975,但在FMR=$10^{-3}$时,其真实匹配率(TMR)仅为0.453;而ECAPA-TDNN的TMR达到0.949。全局AUC将两者的差距缩小了约20倍。
  • 排名翻转:在人脸模态中,FaceNet的全局AUC显著高于ArcFace(0.985 vs 0.979),但在FMR=$10^{-3}$的严格阈值下,ArcFace的TMR显著高于FaceNet(0.922 vs 0.914)。选错指标会导致选错系统。
  • 消融/补充分析
  • 类别不平衡:当非匹配对远多于匹配对时,ROC-AUC会掩盖精度的下降。例如传统虹膜编码器的ROC-AUC为0.825,但PR-AUC仅为0.468。
  • 测量分辨率:低FMR评估受限于非匹配对样本量。例如指纹数据集仅有约1.4万对,无法支撑FMR=$10^{-4}$的可靠评估。

5. 优势与局限

  • 主要优势
    1. 切中痛点:直击生物识别领域“重全局指标、轻实际操作点”的学术与实践脱节问题。
    2. 证据扎实:跨四种模态、7个模型进行实证,特别是“人脸排名翻转”的案例极具说服力。
    3. 实用性强:提供了一份可直接落地的报告清单,对规范学术发表具有指导意义。
  • 局限性(论文自身承认或实际展示的):
    1. 自助法重采样在试验对层面进行,由于同一身份可能出现在多个对中,可能会低估方差(论文建议未来采用身份聚类自助法)。
    2. 指纹模态仅有一个匹配器,无法进行排名翻转测试,实验设计存在不平衡。
    3. 未涉及跨传感器、主体不相交协议以及人口统计学分层等更复杂的部署场景。

6. 关键结论与启发

  • 最重要的Takeaway:全局ROC-AUC是一个有误导性的“好学生综合分”,在生物识别验证中,必须以实际部署阈值(低FMR)下的FNMR/TMR及DET曲线为核心进行报告,并强制附带置信区间。
  • 启发与延伸方向
    1. 评估方法学反思:不仅生物识别,在医疗诊断、异常检测、金融风控等“正负样本极度不平衡且关注低假阳率”的AI领域,都应警惕全局AUC的滥用,转向部分AUC(pAUC)或固定操作点评估。
    2. 未来研究:应开发更严谨的统计检验方法(如身份聚类自助法),并研究不同人口群体在低FMR操作点下的公平性与不确定性。
👀 推荐值得看
🏷️ 领域说话人技术 > 说话人识别/验证
💡 创新生物识别验证评估框架——基于ISO/IEC标准,提出以特定低误识率操作点下的FNMR和DET曲线为核心的综合评估与报告规范
⭐ 评分7.5
#32
eess.AS

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data 跨领域

Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida
Computation and Language (cs.CL); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: Preprint. Under review
查看摘要
Decoding inner speech from non-invasive brain signals remains a fundamental challenge due to the absence of overt linguistic output, limited training data, and large inter-subject variability. Existing brain-to-text approaches often rely on task-specific decoder fine-tuning, which restricts scalability and complicates adaptation to new participants. We propose MindAlign, a decoupled two-stage brain-to-language framework that enables open-ended text generation from fMRI signals without modifying the underlying language model. The first stage learns a subject-specific neural-semantic alignment that maps fMRI activity into a shared multimodal semantic space, extracting a latent semantic sketch of the internally generated sentence. The second stage integrates this sketch with visual context to prompt a frozen multimodal language model for free-form generation. Experiments on fMRI data collected during silent image description demonstrate that the proposed approach consistently outperforms fMRI-only and random baselines. We further show that the learned semantic-to-language projection can generalize across subjects, enabling effective decoding when paired with subject-specific neural alignment. These results indicate that neural signals modulate semantic content beyond image-driven priors, supporting a scalable and modular direction for brain-to-text decoding.

📖 深度解读

1. 一句话总结

本文提出了一个名为MindAlign的两阶段框架,通过将fMRI脑信号对齐到多模态语义空间并作为前缀提示冻结的多模态大模型,在有限数据下成功将大脑内部的默读活动解码为流畅的自然语言文本。

2. 研究背景与动机

  • 核心问题:如何从非侵入性的fMRI脑信号中解码出受试者内心的默读(inner speech),并将其转化为开放式的自然语言文本。
  • 重要性:解码内心言语是脑机接口和神经科学的长期目标,不仅能加深对大脑语言机制的理解,还有望帮助丧失语言能力的患者重新交流。
  • 现有不足
    1. 依赖严苛的时间对齐:现有方法通常需要音频、文本和脑信号在帧级别精确对齐,易产生误差累积。
    2. 缺乏真实内心数据:许多研究使用外部数据集的图像描述作为伪标签,而非受试者真正的内心活动。
    3. 泛化性差且受限:大多受限于预定义词汇表,或需要针对特定任务微调整个模型,难以应对新受试者和开放场景。

3. 核心方法

论文提出了MindAlign,一个解耦的两阶段脑-语言解码框架。
- 关键创新点
1. 解耦的两阶段架构:第一阶段专注受试者特异性的“脑-语义”对齐,第二阶段专注通用的“语义-语言”生成。新受试者只需训练轻量级的第一阶段。
2. 无需时间戳对齐的语义草图:不追求词级别的对齐,而是提取整句的“语义草图”作为监督信号,规避了fMRI低时间分辨率带来的误差。
3. 多模态软前缀融合:将脑信号与图像特征融合为软前缀,引导冻结的多模态大模型(LLaVA)生成文本,无需改动大模型权重。
- 直觉性解释:这就像给一个不会说话的人配了一个“翻译官”和一个“提词器”。第一阶段(翻译官)负责把杂乱无章的大脑fMRI信号翻译成大模型能听懂的“语义提纲”;第二阶段(提词器)把这个“语义提纲”和眼前看到的图像结合起来,提示一个能力强大但被“冻结”的大模型(LLaVA)把完整的句子说出来。这样既利用了大脑的真实意图,又借助了大模型的语言生成能力。

4. 实验与结果

  • 数据集:作者自建的数据集。5名受试者在fMRI扫描仪内观看COCO图像并默默生成日语描述,共约2000个样本。
  • 基线方法:原始LLaVA(仅图像输入)、随机fMRI+图像(控制组)。
  • 主要实验结果
    1. 脑信号有效超越了视觉先验:真实fMRI+图像的组合在所有指标上均优于随机fMRI+图像(例如受试者LD0006的BERT-Score从0.7364提升至0.7800),证明模型确实读取了脑信号,而非仅靠图像瞎猜。
    2. 多模态协同:fMRI+图像的效果始终优于仅用fMRI,说明图像提供了视觉锚点,帮助修正脑信号中的噪声。
    3. 语义对齐优于词汇对齐:虽然BLEU等字面匹配指标较低,但BERT-Score高达0.7-0.8,说明模型能准确抓住内心表达的大意,而非死记硬背具体词汇。
  • 消融实验揭示:fMRI信号提供了“语义意图”(如识别出动物),而图像提供了“结构约束”(如具体颜色、位置),两者是互补的。此外,跨受试者实验表明,第二阶段的“语义-语言”映射具有通用性,不同受试者的第一阶段编码器与第二阶段解码器交叉组合仍能保持较高性能。

5. 优势与局限

  • 主要优势
    1. 模块化与可扩展性:将受试者特异性的脑信号对齐与通用的语言生成分离,新受试者无需重新训练庞大的语言模型。
    2. 无需帧级时间对齐:降低了数据采集和预处理的难度,更适合fMRI的低时间分辨率特性。
    3. 基于真实内心言语:使用受试者自己产生的内心描述作为标签,比使用外部图像字幕更贴近“读心”的本质。
  • 局限性
    1. 数据规模极小:仅5名受试者、约2000个样本,模型在更广泛人群中的泛化能力尚未得到验证。
    2. 词汇级准确率低:字面匹配指标(BLEU, ROUGE)表现不佳,说明生成的文本在具体用词上仍有较大偏差。
    3. 仍依赖视觉输入:仅用fMRI的效果较差,目前仍需图像作为“拐杖”来锚定生成,距离纯粹的“读脑”尚有距离。

6. 关键结论与启发

  • 最重要的Takeaway:将fMRI信号对齐到预训练语言模型的嵌入空间,作为一种“语义草图”来提示冻结的LLM,是在有限数据下实现开放式脑-文本解码的有效且可扩展的途径。脑信号在此过程中起到了调制语义内容的作用,超越了单纯的视觉先验。
  • 启发与延伸方向
    1. 解耦架构的潜力:这种“特征对齐+前缀提示”的范式可推广至其他非侵入式脑机接口(如EEG)或跨模态生成任务。
    2. 提升时间动态捕捉:未来可探索更细粒度的时间编码方法,以提升词汇级准确率,逐步摆脱对视觉输入的依赖。
    3. 大模型作为脑机接口的后端:随着多模态大模型的发展,脑信号可能作为一种新型“提示词”,与文本、图像等模态深度融合,实现更自然的脑机交互。
#33
eess.AScs.SD

A Generalized Formalism of Auto-Regressive Decoding for Speech Processing 解读失败跨领域

Julia Gachot, Philipp Allgeuer, Marie S. Bauer, Stefan Wermter
Sound (cs.SD); Machine Learning (cs.LG); Audio and Speech Processing (eess.AS)
Comments: Accepted at Interspeech 2026
查看摘要
In speech processing, most state-of-the-art sequence prediction models rely on auto-regressive (AR) strategies to generate output sequences based on the raw predictions of the model. Despite their crucial role in the inference process, a comprehensive overview of AR strategies as a unified field is lacking, due largely to implicit and multiple definitions of next-token decoding. This context complicates the choice, comparison, and evaluation of strategies, while creating inconsistencies in the characterization of approaches as auto-regressive or not. We begin by setting explicit inclusion criteria for the field of AR search in speech processing, and derive a generalized theoretical framework to categorize and report on search strategies for neural models. We show the capabilities of this formalism in simplifying the design of benchmarks centered around the decoding process, allowing for ablation studies that are focused on search strategies.

📖 深度解读

[PDF 下载失败,无法解读]

#34
eess.AScs.SD
KAIST - Korea Advanced Institute of Science & Technology (QS Top 100)

SDP-Codec: A Speaker-Decoupled Speech Codec with Pitch Injection for Low-Bitrate Coding and Zero-Shot Voice Conversion 跨领域

Hounsu Kim, Juhan Nam
Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: Accepted to Interspeech 2026. Code and demo: this https URL
查看摘要
Speaker-decoupled speech codecs can reduce bitrate by separating global speaker attributes from local content and prosody, while supporting voice conversion. Existing speaker-decoupled codecs face a trade-off: methods that explicitly suppress speaker leakage often rely on multi-stage or auxiliary training, whereas simpler designs can leave residual speaker information in local tokens. We propose SDP-Codec, a speaker-decoupled, pitch-injected codec trained with a single-stage optimization pipeline. SDP-Codec derives local tokens from continuous pre-quantization features of a pretrained self-supervised encoder and injects normalized F0 via a pitch encoder-decoder with global-conditioned denormalization and soft-label pitch reconstruction objective. Across 16 kHz and 24 kHz settings, SDP-Codec achieves competitive reconstruction and strong zero-shot voice conversion at comparable bitrates, with the lowest speaker-probing accuracy among compared systems, suggesting reduced speaker leakage.

📖 深度解读

1. 一句话总结

本文提出了SDP-Codec,一种单阶段训练的说话人解耦语音编解码器,通过引入归一化基频(F0)注入和紧凑单码本瓶颈,在极低比特率下实现了高质量的语音重建与强大的零样本语音转换,同时有效解决了局部token中残留说话人信息的问题。

2. 研究背景与动机

  • 核心问题:如何在极低比特率下设计一种语音编解码器,既能有效剥离说话人信息(防止泄露到局部内容token中),又能保持高保真的语音重建和零样本语音转换(VC)能力。
  • 重要性:降低比特率不仅节省传输带宽,还能降低下游语音语言模型(SLM)自回归预测的计算成本。同时,解耦说话人信息能天然支持语音转换等下游任务。
  • 现有不足:现有的说话人解耦编解码器面临权衡困境。要么依赖梯度反转、多阶段训练或扰动操作,导致训练复杂且不稳定;要么设计简单但缺乏显式解耦约束,导致说话人音色泄露到局部token中。此外,依赖文本对齐或变帧率的方法引入了额外约束(如需要文本输入或时长预测器),而基于流匹配的VC方法则无法忠实重建原始波形。

3. 核心方法

  • 模型/框架:SDP-Codec,包含局部分支(处理内容和韵律)和全局分支(处理说话人音色)的单阶段编解码框架。
  • 关键创新点
    1. 连续预量化特征重编码:不使用预训练vq-wav2vec的离散输出,而是使用其连续的预量化特征,通过一个极小的单码本(300或1536个条目)进行重新量化。这个小码本充当极强的信息瓶颈,强制剥离低级信息(音色和细节韵律)。
    2. 显式F0注入与全局还原:将提取的F0进行段落级均值-方差归一化(去除说话人音高范围),注入局部分支;同时,全局分支提供说话人嵌入,帮助音高解码器恢复归一化时丢失的说话人特定音高范围。
    3. 软标签音高重建损失:使用高斯模糊处理的360-bin直方图作为软标签进行音高重建,相比L2损失提供了更平滑的梯度,显著提升了内容保真度。
  • 直觉性解释:把语音比作一首歌。局部分支像是个只记歌词和旋律轮廓(不关心谁唱的、什么调)的速记本,因为本子太小(紧凑码本),它只能记下最核心的内容;为了不丢失语调,我们把统一的相对音高(归一化F0)塞给它。全局分支则像是一个“歌手档案”,记录了这是谁的声音以及这个人的音域范围。解码时,速记本里的内容和旋律,加上档案里的音色和音域,就能完美还原出特定人声唱的歌。

4. 实验与结果

  • 数据集/基准:使用LibriSpeech (16kHz) 和 LibriTTS (24kHz) 进行训练与评估,大规模模型加入了MLS。对比了LSCodec, BiCodec, MSRCodec, FocalCodec, Vevo等多个开源低比特率编解码器与VC系统。
  • 主要实验结果
  • 重建质量:在0.45-0.52 kbps的极低比特率下,SDP-Codec的UTMOS(自然度)和SECS(说话人相似度)与同类基线(如LSCodec, BiCodec)相当或更好,且STOI(可懂度)和F0相关性显著提升。
  • 零样本VC:SDP-Codec在客观指标(SECS达0.84,F0相关性达0.61)和主观评测(16kHz下NMOS达3.95,SMOS达3.46)上均大幅领先同类的Codec基线,甚至超越了部分专门的VC系统。
  • 说话人泄露最少:探针实验表明,SDP-Codec局部token的说话人分类准确率最低(24kHz为6.87%,16kHz为4.45%),远低于LSCodec(15.5%)和MSRCodec(46.1%),证明了其卓越的解耦能力。
  • 消融实验揭示
    1. 软标签F0损失对内容和韵律保真至关重要,换成L2损失甚至比不加F0更差。
    2. 使用连续特征Z比使用离散特征$\hat{Z}$能保留更多细粒度内容(WER更低),尽管会略微牺牲一点VC的说话人相似度。

5. 优势与局限

  • 主要优势
    1. 单阶段训练:摒弃了复杂的梯度反转或多阶段训练,流程简单且稳定。
    2. 解耦彻底且保真度高:通过“极小码本瓶颈+归一化F0注入”巧妙实现了极低的说话人泄露,同时没有牺牲可懂度和韵律。
    3. 双效合一:在 comparable 比特率下,同时兼顾了高质量的波形重建和强大的零样本语音转换能力。
  • 局限性
    1. 内容保真度仍有提升空间:尽管相比部分基线有优势,但其重建的词错误率(WER,如24kHz下5.54%,16kHz下3.08%)仍高于某些专门针对重建优化的非解耦编解码器(如FocalCodec 1.43%)。
    2. 受限于预训练模型:局部分支高度依赖冻结的vq-wav2vec,这限制了模型在未见过的极端声学条件下的泛化能力。
    3. 资源限制:受限于算力,仅在16kHz上扩展了大规模数据训练,未提供24kHz的大模型结果。

6. 关键结论与启发

  • 核心Takeaway:在神经语音编解码器中,不需要复杂的对抗性解耦操作。利用极小码本作为硬瓶颈剥离音色,再通过“归一化注入+全局还原”的机制处理F0,就能在单阶段训练下实现极佳的说话人解耦、高保真重建与零样本VC。
  • 启发与延伸方向
    1. 瓶颈即解耦:这种“先用极小容量强制丢弃所有低级信息,再有选择性地补回所需信息(如F0)”的范式,可启发其他模态的解耦研究。
    2. 下游SLM应用:SDP-Codec产生的单流、低比特率、低泄露的token非常适合作为语音语言模型(SLM)的输入,未来可探索将其token应用于语音对话或语音翻译等下游任务。
    3. 改进内容表征:论文指出内容保真度是当前主要瓶颈,后续工作可探索更强大的内容编码器或训练策略,以在解耦的同时进一步降低WER。
#35
eess.AScs.SD
Seoul National University (QS Top 100)KAIST - Korea Advanced Institute of Science & Technology (QS Top 100)

CORTIS: Text-Only Adaptation of Spoken Language Models for Task-Oriented Voice Agents 跨领域

Youngwon Choi, Hyeonyu Kim, Taeyoun Kwon, Donghyuk Jung, Myeongkyun Cho
Human-Computer Interaction (cs.HC); Artificial Intelligence (cs.AI); Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: Submitted to EMNLP 2026 Industry Track
查看摘要
Task-oriented voice agents need to map spoken user requests to structured outputs such as semantic frames, executable actions, and function calls. A common approach is to cascade ASR with a text-based LLM, but transcription errors can propagate to downstream structured output generation, especially under noisy conditions. Spoken language models (SLMs) offer a direct speech-based alternative, yet adapting them to new tasks typically requires paired speech-target annotations. Motivated by this gap, we present CORTIS, a text-only adaptation framework for task-oriented voice agents. CORTIS fine-tunes SLMs using text-form task supervision, enabling speech-based structured output generation at inference time without task-specific speech-target annotations during adaptation. We evaluate CORTIS on two Qwen2.5-Omni backbones and three task-oriented speech datasets, including an in-house product dataset, and compare it with matched ASR-LLM cascades trained with the same text-form task supervision. Results show that CORTIS performs competitively with matched cascades and offers clearer advantages under acoustic degradation, particularly in preserving high-level task semantics. These findings suggest that text-only fine-tuning of SLMs can serve as a practical adaptation strategy for voice agents when paired speech-target data are costly to collect.

📖 深度解读

以下是对论文《CORTIS: Text-Only Adaptation of Spoken Language Models for Task-Oriented Voice Agents》的结构化解读报告:

1. 一句话总结

本文提出了CORTIS框架,通过仅使用纯文本数据进行微调,使语音语言模型(SLM)能够直接从语音输入生成结构化任务输出,不仅省去了昂贵的语音配对数据收集,还在嘈杂环境下比传统的“语音识别+大模型”级联系统表现出更强的鲁棒性。

2. 研究背景与动机

  • 核心问题:任务导向的语音代理需要将用户的语音指令映射为结构化输出(如语义帧、函数调用)。
  • 重要性:这是语音助手执行实际任务(如控制智能家居、调用API)的核心能力,直接决定了语音代理的可用性和可靠性。
  • 现有方法的不足
    1. ASR-LLM级联系统:先转文字再交给大模型处理。这种模式容易产生“错误传播”,尤其在嘈杂环境下,ASR的识别错误会直接导致下游任务失败。
    2. 端到端SLM微调:直接用语音输入训练模型。虽然避免了错误传播,但需要收集大量“语音-结构化目标”配对数据,成本极高且耗时。

3. 核心方法

  • 方法/框架:CORTIS(基于文本监督指令微调的会话代理框架)。
  • 关键创新点
    1. 纯文本任务微调:仅使用“文本指令-结构化输出”对微调SLM中的LLM组件,推理时直接输入语音。
    2. 冻结语音模块:在微调过程中显式冻结语音编码器和模态适配器,强制模型依赖预训练阶段建立的“语音-文本”对齐能力。
    3. 提示词位置一致性:训练时文本查询在提示词中的位置,与推理时语音占位符的位置保持严格一致,确保功能上下文统一。
  • 直觉性解释:想象一个懂双语的员工(SLM),你只用英文(文本)教他如何处理任务并填写表格(结构化输出)。因为他在入职前已经学会了听懂中文(语音)并将其在脑内翻译成英文,所以当你直接用中文(语音)给他下达指令时,他依然能按照之前学到的英文规则完成任务。CORTIS就是利用了SLM预训练时已有的跨模态对齐能力,实现了“文本训练,语音推理”的跨界。

4. 实验与结果

  • 数据集:FSC(智能家居指令)、SLURP(家庭助手交互)、内部产品数据集(函数调用)。噪声测试使用MUSAN语料库生成的嘈杂人声(SNR 15至0 dB)。
  • 基线方法:规模匹配的ASR-LLM级联系统(Whisper large-v3 + Qwen2.5-Instruct),且基线的LLM使用了与CORTIS完全相同的文本数据进行微调。
  • 主要实验结果
    1. 整体竞争力:CORTIS在干净和嘈杂环境下均与级联系统性能相当,甚至在多数场景下超越基线。
    2. 抗噪优势显著:在极嘈杂环境(0 dB)下优势最明显。例如在内部数据集上,7B模型的绝对准确率(EM)比级联系统高出10.49个百分点(55.33% vs 44.84%)。
    3. 高层语义更强:在SLURP数据集上,CORTIS在“意图预测”(高层语义)上大幅领先,但在“实体提取”(细粒度词法)上优势不明显。
  • 消融/定性分析揭示:定性案例表明,当ASR将“Heat down”错听为“Feet down”导致级联系统输出错误时,CORTIS依然能从原始语音中正确恢复意图。但CORTIS也存在将“rap music”错判为“rock”的细粒度实体 grounding 失败问题。

5. 优势与局限

  • 主要优势
    1. 数据高效:无需昂贵的“语音-任务标注”配对数据,大幅降低语音代理的开发门槛。
    2. 抗噪鲁棒性:跳过了易受噪声干扰的中间转写步骤,直接从语音提取高层任务语义,在恶劣声学环境下表现更稳定。
  • 局限性
    1. 细粒度实体提取较弱:直接从语音预测精确的槽位值(如特定人名、专有名词)仍不如有明确文本作为中间件的级联系统。
    2. 模型泛化性待验证:方法主要在Qwen2.5-Omni上有效,在Qwen2-Audio上的表现较差,说明效果可能高度依赖底层SLM的预训练质量。
    3. 测试环境理想化:噪声测试仅使用了合成的babble噪声,未涵盖真实场景的远场、混响和设备底噪。

6. 关键结论与启发

  • 最重要的Takeaway:语音语言模型(SLM)预训练时建立的语音-文本对齐能力足够强大,使得“纯文本微调+语音推理”成为一种可行且高效的语音代理构建范式。
  • 对后续研究的启发
    1. 可以探索将CORTIS与少量语音配对数据或文本去噪策略结合,以弥补其在细粒度实体提取上的短板。
    2. 工业界在开发语音Agent时,可以直接复用已有的海量纯文本指令微调数据,无需重新录制和标注语音数据,极大加速产品落地。
    3. 未来需要研究如何提升不同架构SLM在纯文本适配下的泛化能力,以及如何处理真实复杂声学环境下的鲁棒性。
👀 推荐值得看
🏷️ 领域语音大模型与对话 > 语音指令跟随
💡 创新任务导向语音代理的纯文本适配——基于语音语言模型(SLM),通过冻结语音模块并仅用纯文本指令微调LLM组件,实现文本训练语音推理
⭐ 评分7.5
#36
eess.AScs.SD
Nankai University (985, 211)

DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation 跨领域

Yao Lu
Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: 14 pages,4 figures
查看摘要
Stuttered speech recognition remains challenging, with disfluencies such as repetitions, prolongations, and blocks disrupting speech continuity and acoustic patterns. This problem is further aggravated in Mandarin scenarios by the limited availability of stuttered speech data, which makes it difficult to train robust ASR models for diverse disfluency patterns. To address this problem, this paper proposes DisSpeech, a discrete speech token-based framework for low-resource controllable Mandarin stuttered speech synthesis and ASR data augmentation. The proposed framework introduces explicit stuttering event labels to control different disfluency patterns. Text and stuttering event labels are mapped into semantic speech tokens by a non-autoregressive masked generative Transformer, followed by prosody-aware acoustic reconstruction with explicit pitch and energy modeling. With fine-tuning using less than 50 hours of Mandarin stuttered speech, DisSpeech can generate controllable stuttered speech with competitive speech quality. Experimental results show that the proposed method outperforms previous stuttered speech synthesis methods in both speech quality and event controllability. Furthermore, the synthesized stuttered speech effectively improves multiple ASR models, with Qwen3-ASR-0.6B achieving a state-of-the-art CER of 4.19% on the evaluated Mandarin stuttered speech recognition task, while causing only slight degradation on fluent speech.

📖 深度解读

以下是对论文《DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation》的结构化解读报告:

1. 一句话总结

本文提出了DisSpeech框架,利用离散语音token和非自回归掩码生成模型,在低资源(不到50小时数据)下可控地合成中文口吃语音,并以此作为数据增强有效提升了多种ASR模型对口吃语音的识别率。

2. 研究背景与动机

  • 核心问题:自动语音识别(ASR)系统在处理口吃语音(如重复、延长、停顿)时性能严重下降,且中文口吃语音数据极度稀缺。
  • 重要性:全球约1%的人口受口吃困扰(中国超千万),ASR性能的下降严重限制了这部分人群使用语音交互技术的无障碍体验。
  • 现有不足
    1. 语音编辑方法(如FluentSpeech):依赖人工标注口吃边界,且直接删除口吃片段容易导致语音过渡不自然,在严重口吃时效果差。
    2. 基于合成的增强方法(如Stutter-TTS):采用自回归模型预测连续声学特征,存在严重的误差累积问题,导致约20%的生成样本不可懂而被丢弃;且主要针对英语,不适用中文。

3. 核心方法

  • 方法/框架:DisSpeech,一个基于离散语义语音token的可控中文口吃语音合成框架。包含语义语音tokenizer、文本到语义(T2S)模型、语音token解码器和声码器四个模块。
  • 关键创新点
    1. 引入显式口吃事件标签:在文本输入中加入特定的口吃标签(如重复、延长、停顿),实现对口吃类型和位置的精准控制。
    2. 非自回归(NAR)掩码生成T2S模型:摒弃了传统的“逐字预测”的自回归模式,采用基于LLaMA的掩码生成Transformer(类似完形填空),并行预测所有token并迭代细化。
    3. 韵律感知的声学重建:在解码器中加入显式的基频和能量预测模块,专门建模口吃引起的异常节奏和韵律变化。
  • 直觉性解释:传统自回归模型像“多米诺骨牌”,前面预测错一个音,后面的口吃节奏会全盘崩溃;DisSpeech的模型像“做填空题”,先纵观全局文本和口吃标签,并行填入离散的“语义积木”,再对不确定的地方迭代修改。最后,通过专门处理音调和能量的“润色工具”,把这些积木拼成带有指定口吃特征的自然语音。

4. 实验与结果

  • 数据集:AISHELL-3(85小时流利中文,用于预训练)、AS-70(48小时中文口吃语音,用于微调)、生成的94小时合成口吃语音(用于ASR增强)。
  • 基线方法:合成质量对比了FastSpeech2、VITS、Stutter-TTS;ASR增强对比了Wav2Vec2.0、Qwen3-ASR-0.6B、Whisper-large-v3。
  • 主要实验结果
    1. 合成质量:DisSpeech在流利语音上的CER(4.45%)优于VITS,DNSMOS优于FastSpeech2,实现了内容一致性与自然度的良好平衡。
    2. 事件可控性:在各类口吃事件合成的F1分数上全面碾压Stutter-TTS(例如声音重复F1从0.762提升至0.965)。
    3. ASR增强:加入合成数据微调后,所有ASR模型对口吃语音的识别率均显著提升。其中Qwen3-ASR-0.6B在中文口吃语音识别任务上取得了SOTA的CER 4.19%(基线为9.42%)。
    4. 副作用评估:微调后的ASR模型在流利语音上的CER仅微弱上升(绝对增加0.25%~0.76%),证明增强策略没有破坏原有识别能力。
  • 消融实验论文未提供明确的消融实验表格,但通过模块设计的论述和不同维度的对比(如非自回归vs自回归的误差累积分析、有无韵律模块的影响)间接论证了各组件的必要性。

5. 优势与局限

  • 主要优势
    1. 低资源友好且可控:仅需不到50小时真实口吃数据即可微调出效果优秀的可控合成模型。
    2. 生成稳定性高:非自回归架构有效解决了口吃语音合成中的误差累积问题,消除了Stutter-TTS中20%的废样本率。
    3. 下游任务增益显著且副作用小:生成的数据能大幅提升SOTA ASR模型的口吃识别率,同时几乎不损害对正常语音的识别。
  • 局限性
    1. 合成质量并非全面最优:流利语音的CER略逊于FastSpeech2,DNSMOS略逊于VITS,说明在基础声学建模上仍有提升空间。
    2. 缺乏严格的消融实验:论文未通过定量消融实验来单独验证非自回归模块或韵律模块的具体贡献度。
    3. 口吃现象覆盖有限:目前仅建模了重复、延长、停顿等典型事件,真实世界中更复杂的口吃模式(如伴随面部抽搐的呼吸声等)尚未涉及。

6. 关键结论与启发

  • 核心Takeaway:将语音合成从“连续声学特征预测”转向“离散语义token生成”,结合非自回归掩码策略,是解决口吃语音合成中“结构复杂、易误差累积”和“数据低资源”两大痛点的有效范式。
  • 启发与延伸方向
    1. 该框架的显式事件标签控制机制,可延伸至其他非典型语音(如带方言口音、病理语音如构音障碍)的合成与数据增强。
    2. 未来可探索利用大语言模型(LLM)的上下文推理能力,根据对话场景自动生成合理的口吃事件标签,实现更拟人化的合成。
    3. 非自回归掩码生成策略在处理具有复杂时间结构的语音生成任务(如唱歌、情感语音)中具有广阔的借鉴潜力。
👀 推荐值得看
🏷️ 领域语音合成 (TTS) > 情感/风格可控语音识别 (ASR) > 病理/儿童语音识别
💡 创新可控口吃语音合成——基于离散语义token和非自回归掩码生成模型,引入显式口吃事件标签和韵律感知模块
⭐ 评分7.5
#37
eess.AScs.SD

Gradient-Based Learning of Parametric Engine Sound Representations for Real-Time Resynthesis and Tuning on Embedded Systems 跨领域

Robin Doerfler, Matthieu Kuntz, Clemens Zimmer
Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: Accepted for publication in the proceedings of the AES 6th International Automotive Audio Conference (Automotive Audio 2026), Detroit, MI, USA, July 2026
查看摘要
Engine order enhancement is central in automotive sound design, where selective harmonics are synthesized to shape perceptual qualities such as sportiness, refinedness, or power. This paper investigates a neural network-based approach to combustion engine sound modeling that extends conventional engine order analysis and enhancement by deriving synthesis parameters from audio data with machine learning and incorporating stochastic components into the synthesis framework. The system parameterizes engine sounds as a compact representation capturing per-order and broadband timbral variation across the full RPM-torque operating range, while remaining manually tunable and compatible with established automotive audio frameworks. The approach leverages gradient-based optimization and analysis-by-synthesis through an end-to-end differentiable implementation. The resulting synthesis parameter set is directly transferable to conventional DSP implementations for deployment on embedded targets. Spectral metrics and listening tests confirm high reconstruction fidelity, and integration into an established automotive audio development platform (EVx Suite) demonstrates technical feasibility on deployment-ready embedded systems.

📖 深度解读

1. 一句话总结

本文提出了一种基于可微合成的神经网络方法(EONE),通过从录音中学习发动机转速和扭矩的增益曲线参数,实现了高保真且可直接部署于车载嵌入式系统的发动机声音合成与手动调音。

2. 研究背景与动机

  • 核心问题:如何在车载嵌入式系统上实现高保真、可手动调音的发动机声音实时合成。
  • 重要性:主动声音设计(ASD)和发动机阶次增强(EOE)对塑造汽车运动感、豪华感及品牌标识至关重要,尤其在电动汽车需要模拟内燃机声音的当下,市场需求正向高保真和全面声学复制转移。
  • 现有不足
  • 传统EOE方法仅合成谐波成分,缺乏宽带噪声,真实感不足。
  • 基于采样的方法或纯神经网络方法虽然真实感较高,但参数不直观、难以手动微调,且计算开销大,难以直接部署在资源受限的车载嵌入式DSP上。

3. 核心方法

  • 提出方法:Engine-Order and Noise Extraction (EONE) 模型。该模型基于“分析-合成”理念,通过端到端的可微DSP架构,直接从音频数据中学习合成参数。
  • 关键创新点
    1. 统一建模谐波与噪声:在传统EOE框架中引入了滤波噪声库,同时建模确定性谐波和随机宽带噪声,大幅提升了真实感。
    2. 紧凑的参数化解耦:将声音参数解耦为仅依赖于RPM(转速)和Torque(扭矩)的两组1D增益曲线(采用乘法组合),既减少了参数量,又完美契合传统汽车音频工程师的手动调音习惯。
    3. 零运行时神经网络开销:训练时使用可微合成器进行梯度优化,部署时直接导出为静态查表(LUT),嵌入式DSP上无需运行任何神经网络。
  • 直觉性解释
    想象一下教电脑模仿发动机声音。传统方法是让电脑死记硬背每个转速下的特定频率(谐波),听起来很机械。本文的方法是先让电脑听大量的发动机声音,学会“音色”的通用规律。然后,在模仿特定发动机时,电脑不再需要庞大的神经网络,而是把声音拆解成“转速控制曲线”和“扭矩控制曲线”两个简单的参数表。电脑通过不断试听自己合成的声音并与真实录音对比(可微合成),自动调整这两个表里的数值。调好后,这两个表就可以直接塞进车里的芯片里实时发声,不仅听起来逼真(包含了背景噪声),工程师还能随时手动微调这两个表。

4. 实验与结果

  • 数据集:预训练使用了大量多样化的发动机录音(包括半消声室台架测试、实车路测及程序化生成的数据集)。测试集为未在训练中见过的真实台架录音。
  • 基线方法:真实录音(REC)、传统仅谐波增强方法(EOE,截断仅保留前36个谐波且无噪声成分)。
  • 主要实验结果
  • 客观指标:平均对数谱距离(LSD)为4.9 dB,频带平滑后降至2.8 dB,表明重建保真度很高。
  • 主观听感测试:对于普通听众,EONE的真实感评分(61)与真实录音(61)无显著差异;对于专家听众,EONE(71)虽略低于真实录音(76),但显著优于传统EOE方法(35)。
  • 消融实验/对比揭示
  • 在因子分解策略上,对比了加法、标量偏移等方法,发现简单的乘法组合效果最好。
  • 听感测试中对比了包含噪声的EONE和不含噪声的EOE,证明了引入随机噪声成分是提升听觉真实感的核心驱动力。

5. 优势与局限

  • 主要优势
    1. 工程实用性极强:兼顾了AI的数据驱动能力和传统DSP的直观性,导出的参数可直接导入EVx Suite平台进行手动调优和嵌入式部署。
    2. 数据高效性:通过预训练的音色编码器-解码器提供良好的初始化,微调阶段只需少量目标录音即可快速适配新发动机。
    3. 音质提升明显:成功将宽带噪声纳入传统EOE框架,且在运行时无需神经网络开销。
  • 局限性
    1. 控制维度受限:声音仅作为RPM和扭矩的函数,无法模拟回火、涡轮迟滞等非确定性或偶发声音。
    2. 罕见工况泛化偏弱:对于物理上不太可能的极端转速-扭矩组合,模型容易产生偏差;在微调数据有限时,偶发噪声可能会留下与特定转速-扭矩绑定的伪影。

6. 关键结论与启发

  • 最重要的Takeaway:通过“可微合成”技术,可以将深度学习强大的模式识别能力与传统DSP直观、高效的参数表示完美结合,实现“训练用AI,部署用DSP”的落地范式。
  • 启发与延伸方向
  • 该框架为需要嵌入式实时音频合成的领域(如游戏引擎、VR交互音频)提供了一种通用范式:用神经网络学习物理参数映射,而非直接生成音频波形。
  • 未来可探索引入更高维度的控制参数(如油门开度、温度、甚至直接的时间序列特征)或加入独立的偶发事件触发器,以解决当前模型无法表现非确定性声音的局限。
#38
eess.AScs.SD

Improving Engine Sound Analysis in Hot-Test Environments via a RAB-U-Net (Residual Attention Block U-Net) Noise Removal Method 跨领域

Raheleh Mohseni, Mahdi Alyari
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
查看摘要
During hot tests on a production line, engine-sound analysis is crucial to ensuring product quality and performance. However, background noise often interferes with accurate sound analysis, leading to potential errors in engine diagnostics. Traditionally, skilled technicians listen to engine sounds to assess engine health, but this is prone to significant inaccuracies. This study presents an innovative deep learning-based approach to address this issue by removing background noise from engine sound recordings using a U-Net neural network structure enhanced with Residual Attention Blocks (RAB-U-Net). Our intelligent noise removal system significantly improves the accuracy of engine noise detection, outperforming traditional techniques and providing a robust solution for real-time applications in production line environments. This study proposes a novel system for engine noise detection in production lines, marking a valuable advancement for the automotive industry in applying deep learning methods to improve the quality of engine diagnostics.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种结合残差块和注意力机制的增强型U-Net网络(RAB-U-Net),用于有效去除发动机热试生产线录音中的工厂背景噪声,从而提升发动机故障声音诊断的准确性和可靠性。

2. 研究背景与动机

  • 核心问题:在发动机装配后的“热试”环节中,需要通过分析发动机声音来评估其健康状况。然而,工厂环境中的背景噪声(如暖通空调、其他机器运转声)会严重干扰声音分析。
  • 重要性:传统依赖人工听诊的方法易受疲劳和环境噪声影响,导致漏检,进而引发高昂的售后成本和客户投诉。准确的自动化声音分析对质量控制至关重要。
  • 现有不足:建造隔音室成本过高;传统降噪方法(如滤波、小波降噪)难以处理非平稳的复杂工业噪声,容易导致信号失真;标准的深度学习模型(如原生U-Net)在下采样时容易丢失精细的声学细节,深层网络存在梯度消失问题,且对特征图的所有区域“一视同仁”,无法聚焦于关键的发动机声音特征。

3. 核心方法

  • 提出方法:RAB-U-Net(Residual Attention Block U-Net),一种改进的U-Net音频降噪架构。模型将音频转换为频谱图作为输入,降噪后再还原为音频。
  • 关键创新点
    1. 残差特征提取块(RFB):替换了标准卷积块,通过捷径连接保留原始信息,解决深层网络的梯度消失问题,防止精细声学特征丢失。
    2. 注意力增强模块(AEM):引入通道与空间混合注意力,让模型自动聚焦于包含发动机故障特征的关键时频区域,同时抑制无关背景噪声。
    3. 注意力引导的跳跃连接:改变了原生U-Net直接拼接编码器和解码器特征的做法,在融合前先通过注意力机制进行特征筛选,确保解码器接收到高质量的上下文信息。
  • 直觉性解释:想象你在嘈杂的工厂里戴着一副智能降噪耳机。原生U-Net像是一层无差别的隔音罩,能挡住部分噪音但也会漏掉发动机的微弱异响;而RAB-U-Net则像是一个“懂行”的智能技工大脑——残差块保证了发动机的微弱细节声音在层层过滤中不被丢失(保真),注意力机制则让大脑自动忽略周围机器的轰鸣声,专门把“听力”集中在发动机特定频率的异常响动上。

4. 实验与结果

  • 数据集:在真实汽车工厂热试台架采集的发动机声音。包含自然吸气和涡轮增压两类发动机,录制了纯净声、环境噪声及混合噪声,并涵盖了1300、1750、2200 rpm三种转速工况。
  • 基线方法:传统信号处理方法(带通滤波、小波降噪、维纳滤波)与深度学习方法(标准U-Net、Res-Net、X-Net)。
  • 主要实验结果
  • RAB-U-Net在所有指标上取得最优:验证集MAE最低(0.0417),SNR最高(14.7 dB),SI-SDR最高(14.2 dB),LSD最低(2.8)。
  • 相比基线U-Net,RAB-U-Net的SNR提升了约2.2 dB,证明其降噪和保真能力显著增强。
  • 频域分析表明,降噪后的信号在各转速下的前三次谐波峰值频率与纯净信号高度吻合。
  • 消融/对比实验揭示
  • 深度学习整体优于传统信号处理方法。
  • 在数据准备策略上,预测“干净声音”比预测“噪声”效果更好。
  • 实践发现:在数据预处理时,如果对数据进行标准化处理,频域转时域后会导致声音听不清;而不进行标准化反而能在降噪后清晰听到发动机声音。

5. 优势与局限

  • 主要优势
    1. 架构设计针对性强:残差与注意力的结合完美契合了工业音频“需保留微弱瞬态特征”且“背景噪声复杂”的特点。
    2. 工程落地友好:仅需普通智能手机录音即可完成测试,且模型参数量(18M)和推理时间(11ms)相比Res-Net等更小,具备实时部署潜力。
    3. 验证维度全面:不仅对比了常规误差指标,还通过频域谐波匹配和实际听觉还原验证了有效性。
  • 局限性
    1. 泛化能力存疑:数据仅来自单一工厂特定工况,模型对不同厂房声学环境、不同型号发动机的泛化能力未经验证。
    2. 缺乏端到端验证:论文仅证明了降噪效果好,但没有展示降噪后是否能直接提升下游“故障分类/检测”任务的准确率。
    3. 硬件限制:仅使用单通道智能手机麦克风,未利用空间声学信息,在强方向性干扰噪声下可能受限。

6. 关键结论与启发

  • 核心Takeaway:在复杂的工业音频处理中,对标准U-Net进行结构化增强(残差保细节+注意力聚焦)是提升非平稳噪声下目标信号保真度的有效途径;同时,数据预处理的细节(如是否标准化)对音频重建的可听性有决定性影响。
  • 后续研究启发
    1. 可探索多通道麦克风阵列结合RAB-U-Net,利用空间特征进一步分离目标声源。
    2. 未来可将此降噪模块作为前端,与无监督异常检测系统端到端结合,实现真正的全自动质量控制。
    3. 可开展模型轻量化研究,以便直接部署在边缘设备或移动端,实现更灵活的移动检测。
👀 推荐值得看
🏷️ 领域语音增强与分离 > 语音增强
💡 创新音频降噪网络——基于标准U-Net改进,引入残差特征提取块和注意力增强模块及注意力引导的跳跃连接
⭐ 评分6.5
#39
eess.AScs.SD
Amazon (World Famous IT Company)

AugCodec: A Low-Bitrate Disentangled Neural Speech Codec via Data Augmentation 跨领域

Dongmei Wang, Xiaohang Sun, Yang Liu, Fanjie Kong, Abhishek Yanamandra 等 (13 人)
Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: Accepted by Interspeech 2026
查看摘要
We propose AugCodec, a low-bitrate disentangled neural speech codec that leverages data augmentation to decompose speech into three distinct components: semantic, speaker, and prosody tokens. Specifically, we employ tailored augmenta tion strategies to transform speech into distinct variants, each serving as input for extracting tokens that preserve the target attribute while suppressing others. This disentanglement strategy enables substantial reduction in token rate. Further more, we introduce an augmentation loss that aligns semantic encoder outputs between source and voice-converted speech, encouraging speaker-agnostic embeddings while mitigating the acoustic mismatch induced by voice conversion. Experiments on LibriSpeech test-clean demonstrate that AugCodec significantly outperforms state-of-the-art methods in both reconstruction quality and disentanglement, while operating at only 12.5Hz with three token streams.

📖 深度解读

1. 一句话总结

本文提出了一种名为 AugCodec 的低比特率解耦语音编解码器,通过定制化的数据增强策略将语音拆解为语义、音色和韵律三种独立的信号源进行提取和量化,在极低帧率(12.5Hz)下实现了高质量的语音重建和出色的特征解耦。

2. 研究背景与动机

  • 核心问题:如何在极低比特率/低帧率下,实现高质量的神经语音编解码,同时将语音中的语义内容、说话人音色和韵律特征彻底解耦。
  • 重要性:神经语音编解码器不仅用于数据压缩,更是当前语音语言模型和多模态模型的基础组件。高效的解耦表示能大幅降低 token 比特率,并为下游任务(如语音转换、TTS)提供更好的可控性。
  • 现有不足
    1. 现有解耦方法(如FACodec)从同一段语音中提取所有特征,导致特征之间相互干扰,解耦不彻底。
    2. 现有低比特率方法要么语义表示能力不足(WER高),要么严重依赖外部文本输入,要么依赖残差向量量化(RVQ)导致单帧所需 token 数量过多。

3. 核心方法

  • 方法/框架:AugCodec 包含编码器、量化器、特征融合和解码器四个模块,将语音编码为语义、说话人和韵律三路独立的 token 流。
  • 关键创新点
    1. 基于数据增强的源头解耦策略:不直接从原语音中硬分离特征,而是为不同特征分支定制输入源。
    2. 可学习的时序压缩与扩展机制:替代传统的池化/插值,在降帧率的同时保留帧间动态细节。
    3. 增强损失:对齐原始语音与变声语音的语义编码输出,消除变声引入的声学不匹配。
  • 直觉性解释:想象你要把一幅画拆分成“线稿”、“色彩”和“笔触”三部分存起来。以前的方法是对着同一幅画分别提取,难免把色彩混进线稿里。AugCodec 的做法是:先用复印机把画转成纯黑白线稿(提取语义),找同一画家的另一幅画提取色彩风格(提取音色),只看画的低频轮廓提取笔触(提取韵律)。这样各取所需,互不干扰。最后拼起来时,用“增强损失”确保黑白线稿不受原画色彩残留的影响。

4. 实验与结果

  • 数据集:训练集为 LibriLight-medium 和 LibriTTS(约3000小时);测试集为 LibriSpeech test-clean(选取4s-10s的短片段)。
  • 基线方法:BiCodec, Mimi, Qwen-TTS-Tokenizer-12Hz, FACodec。
  • 主要实验结果
    1. 重建质量:在 12.5Hz 帧率下,AugCodec-3 取得了最低的 WER(5.12)和最高的 PESQ(1.99)及 UTMOS(3.04),全面优于基线方法。Mimi 在说话人相似度(SIM)上略高,但 AugCodec 综合表现最佳。
    2. 解耦能力(语音转换任务):在 12.5Hz 下,AugCodec 将 WER 从 BiCodec 的 65.43 暴降至 5.87,证明了其极强的内容-音色解耦能力。
    3. 超低帧率潜力:即使将语义帧率降至 6.25Hz,AugCodec 在各项指标上仍优于 12.5Hz 的 BiCodec。
  • 消融实验:移除增强损失后,WER 从 5.66 升至 6.29,PESQ 从 1.94 降至 1.89,证明了该损失对提取纯净语义特征的有效性。

5. 优势与局限

  • 主要优势
    1. 解耦彻底且高效:通过输入源隔离,避免了特征间的相互污染,使得在极低帧率下仍能保持高保真度。
    2. 语义保真度高:在语音转换任务中展现出极低的 WER,证明其语义 token 几乎不受音色干扰。
    3. 架构设计合理:可学习的压缩/扩展机制和 FiLM 特征融合有效保留了时序动态细节。
  • 局限性
    1. 依赖外部预训练模型:训练时需要依赖变声模型(Seed-VC)和特征提取器(wav2vec 2.0),增加了训练流程的复杂度和计算成本。
    2. 韵律提取可能存在信息残留:低频 STFT 虽然主要包含 F0,但论文承认语义和韵律输入之间仍可能存在少量重叠。
    3. 音色相似度非最优:在重建和语音转换任务中,其 SIM 指标略低于 Mimi 等基线,说明在音色还原的极致表现上还有提升空间。

6. 关键结论与启发

  • 关键 Takeaway:“从源头隔离”比“从同一混合物中分离”更有效。通过数据增强为不同特征提供纯净的输入源,是实现语音编解码器低比特率与高解耦度的关键。
  • 启发与延伸方向
    1. 这种基于数据增强的解耦思想可推广到其他多模态或特征解耦任务中。
    2. 未来可探索将 AugCodec 集成到 TTS、语音到语音翻译等下游任务中,验证解耦 token 对生成可控性的提升。
    3. 探索更轻量级的韵律/语义分离方法,以摆脱对重型变声模型的依赖,是一个值得研究的方向。
🔥 推荐必读
🏷️ 领域神经音频编解码器 > 低比特率/高保真权衡
💡 创新低比特率解耦语音编解码器——基于数据增强的源头解耦策略,为不同特征分支定制输入源,替代传统的从同一混合信号中硬分离特征的方法
⭐ 评分8.0
#40
eess.AS

Integrating Facial Generation into Full-Duplex Spoken Dialogue Systems 跨领域

Jingjing Jiang, Atsumoto Ohashi, Ryuichiro Higashinaka
Human-Computer Interaction (cs.HC); Computation and Language (cs.CL); Computer Vision and Pattern Recognition (cs.CV); Audio and Speech Processing (eess.AS)
Comments: Accepted to Interspeech 2026
查看摘要
Full-duplex spoken dialogue models, such as Moshi, enable natural, low-latency voice conversations. However, they remain limited to the audio modality, lacking the facial expressions that are integral to human communication. We present Moshi-Face, the first full-duplex dialogue model that jointly processes the user's audio and facial input while simultaneously generating speech and facial motion. We first construct a vector-quantized variational autoencoder (VQ-VAE) as a face codec that encodes 3D head meshes extracted from facial videos into compact discrete tokens, referred to as face tokens, and conversely reconstructs 3D meshes from these tokens. We then extend Moshi with a Face Transformer module that generates face tokens non-autoregressively, enabling Moshi-Face to produce synchronized audio and face tokens in real time. Experiments show that Moshi-Face achieves audiovisual alignment at low latency while preserving the dialogue quality of the original audio-only model.

📖 深度解读

1. 一句话总结

本文提出了首个全双工多模态对话模型 Moshi-Face,通过引入面部动作编解码器和非自回归的 Face Transformer,在保持低延迟语音对话的同时,实现了与语音实时同步的 3D 面部表情生成。

2. 研究背景与动机

  • 核心问题:如何让全双工语音对话系统(如 Moshi)在实时交互中不仅能“听”和“说”,还能“看”和“动”(即处理和生成面部表情)。
  • 重要性:人类面对面交流本质上是多模态且同时进行的(包含打断、重叠发言、面部表情等非语言 cues)。仅支持音频的对话系统缺乏情感传递和沟通清晰度,限制了人机交互的自然度。
  • 现有不足:现有的多模态对话系统大多基于“轮流发言”的架构,无法处理同时说话和实时反馈;而现有的全双工对话系统(如 Moshi)仅局限于音频模态,缺乏生成面部动作的能力。

3. 核心方法

  • 方法/模型:论文提出了 Moshi-Face,基于全双工语音模型 Moshi 进行扩展。主要包含两个核心组件:一个基于 VQ-VAE 的面部编解码器,以及一个非自回归的 Face Transformer。
  • 关键创新点
    1. 面部动作 Token 化:设计了 Face Codec,将复杂的 3D 面部网格序列压缩为离散的“面部 token”,且帧率(12.5 Hz)与音频/文本 token 完全对齐,实现多模态流的统一处理。
    2. 非自回归面部生成:Face Transformer 在每个时间步并行生成 N 个面部 token,而非逐个自回归生成,极大降低了延迟,满足全双工实时交互需求。
    3. 流式多模态融合架构:将面部 token 流无缝接入 Moshi 原有的文本和音频 token 流中,系统同时读取用户和自身的多模态流,并实时生成系统的语音和表情。
  • 直觉性解释:就像给原本只能听和说的“电话客服”配上了一个“数字面具”。首先,用一个“翻译器”(Face Codec)把复杂的 3D 脸部肌肉运动压缩成简单的密码代号(面部 token),并且让这些代号和语音的节奏对齐。然后,在原有的对话大脑(Moshi)旁边加一个专门管表情的“小脑”(Face Transformer)。这个“小脑”能根据当前正在说的话和内心的隐藏状态,瞬间(并行计算)决定该摆出什么表情,不需要一笔一划去算,从而保证了实时性。

4. 实验与结果

  • 数据集:基于 Meta 的 Seamless Interaction 数据集构建了 180 小时的 3D 视听对话数据,使用 VHAP 工具提取 3D 面部网格(25 fps,5143 个顶点)。
  • 基线方法:原版 Moshi、微调版 Moshi-ft、重建面部(Reconstructed face,性能上限)、随机面部(Random face,性能下限)。
  • 主要实验结果
  • 音视频同步:在 Teacher-forced 设定下,Moshi-Face 的唇同步距离(LSE-D)为 8.76,接近上限(8.53)且远优于随机基线(11.7)。在自由交互设定下仍能保持较好的同步效果(LSE-D 11.0)。
  • 对话质量:尽管在特定数据集上微调导致语音自然度(UTMOS)较原版略有下降,但语义质量评估(LLM-as-a-Judge)显示,Moshi-Face 在连贯性上得分最高(4.52),整体质量与原版 Moshi 相当,证明引入面部模态未损害甚至略微改善了语义生成。
  • 消融实验揭示
  • 去掉 Face Transformer 预训练会导致同步质量下降。
  • 去掉全量微调(仅训练 Face Transformer)会导致最差的 LSE-D 和最低的语义质量,说明联合微调至关重要。
  • 去掉上一时间步的面部 token 输入,虽在自由交互下略微提升了同步距离,但降低了置信度和语音质量,表明存在误差累积与生成质量之间的权衡。

5. 优势与局限

  • 主要优势
    1. 开创性:首个实现全双工实时语音与 3D 面部动作联合生成的对话模型。
    2. 低延迟流式能力:通过 token 帧率对齐和非自回归并行生成,满足了全双工对话严格的实时性要求。
    3. 多模态相互促进:实验表明,引入面部 token 不仅没有破坏原模型的对话能力,反而为语义生成提供了有益的上下文。
  • 局限性
    1. Codec 非因果性:当前的面部编解码器是非因果的,无法实现完全实时的视觉输入流处理(论文在结论中承认并计划未来解决)。
    2. 语音自然度下降:在较小的特定领域数据集上微调导致模型通用语音自然度(UTMOS)下降。
    3. 缺乏人类主观评估:目前依赖客观指标和 LLM 打分,尚未进行真实人类感知体验的评估。

6. 关键结论与启发

  • 核心 Takeaway:将面部动作离散化为与音频/文本同频的 token,并通过轻量级非自回归模块挂载到全双工语音模型上,是构建实时多模态对话智能体的一条可行且有效的路径。
  • 启发与延伸方向
  • 架构启发:这种“主干模型自回归生成隐藏状态 + 旁路模块非自回归生成多模态 token”的范式,可推广至手势、肢体动作等其他需要低延迟生成的模态。
  • 未来方向:开发因果/流式的面部编解码器以实现真正的端到端实时视觉输入;引入人类评估以验证其在实际部署(如虚拟数字人、具身智能)中的感知自然度。
🔥 推荐必读
🏷️ 领域语音大模型与对话 > 全双工对话多模态视听 > 说话人脸/数字人生成
💡 创新全双工多模态对话模型——基于 Moshi 扩展,引入面部动作编解码器和非自回归的 Face Transformer 实现语音与3D面部表情实时同步生成
⭐ 评分8.0
#41
eess.AS
Carnegie Mellon University (QS Top 100)

Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR 跨领域

Enes Yavuz Ugan, Alexander Waibel
Computation and Language (cs.CL); Audio and Speech Processing (eess.AS)
Comments: Accepted to INTERSPEECH 2026
查看摘要
Code-switching (CSW) remains challenging for large multi-lingual ASR systems in real-world deployment. While fine-tuning on synthetic CSW data is possible, it generally degrades strong monolingual baselines. Our goal is to preserve these capabilities while extending models to handle complex code-switching, including morphological variations across languages. We propose Bayesian factorized adaptation, which learns to efficiently integrate switching-relevant knowledge into strong pretrained models without overwriting existing capabilities. Requiring only a small amount of synthetic data, our approach reduces transcription errors by 32.87% on code-switched words while improving overall WER by 5.31%, all while maintaining mono-lingual performance. Our results demonstrate that effective CSW adaptation depends more on knowledge integration than data complexity.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出使用贝叶斯低秩自适应方法,在仅使用少量合成数据的情况下,为已经非常强大的多语言ASR模型(如Whisper)添加语码转换能力,同时完美保留了其原有的单语识别性能。

2. 研究背景与动机

  • 核心问题:如何在高性能多语言ASR模型(如Whisper)上增加语码转换(CSW,即说话时混合多种语言,甚至进行词法层面的形态融合)能力,同时不破坏其原本强大的单语识别基础。
  • 重要性:现实生活中的多语言交流常伴随语码转换,生产级ASR系统必须处理这种现象。然而,真实的CSW语音数据极其稀缺且昂贵。
  • 现有不足:以往研究通常陷入三个误区:1) 只在特定的CSW测试集上评估,忽略了模型通用能力的下降;2) 训练集和测试集同源,无法证明模型的泛化能力;3) 基于较弱的基线模型做实验,改进容易但缺乏实际部署价值。更致命的是,主流观点认为“更好的合成数据能带来更好的适应效果”,但本文发现,用标准方法在强基线上微调合成数据会导致灾难性遗忘,性能不升反降。

3. 核心方法

  • 提出方法:结合简化合成数据流水线(LLM文本生成 + TTS语音拼接)与贝叶斯低秩自适应的微调框架。
  • 关键创新点
    1. 聚焦“强基线保留”场景:明确将“在不破坏强模型原有能力的前提下增加新能力”作为核心目标,挑战了“数据越多越好”的传统假设。
    2. 采用BLoRA进行知识整合:引入贝叶斯先验,将LoRA的权重矩阵转化为学习到的分布,迫使自适应权重变得极其稀疏。
    3. 语言学规则驱动的合成数据:利用GPT-4o生成符合德语形态学规则的英德混合文本(如英语动词加上德语词尾),并用特殊标签标记以便后续TTS拼接。
  • 直觉性解释:想象一个顶尖的德英双语翻译专家(强基线模型)。如果强迫他突击学习一门新的混合方言(合成CSW数据),他可能会因为过度适应新方言而忘记怎么说纯正的德语(标准LoRA微调的灾难性遗忘)。BLoRA的做法就像是给专家一本“便签本”,让他只把最关键的方言特征记在稀疏的便签上,而不去改动他脑海中深厚的母语知识库。这样既学会了方言,又保住了原本的专业功底。

4. 实验与结果

  • 数据集:CSFleurs(用于评估英德CSW性能),CommonVoice 14(用于评估德/英单语性能的向后兼容性测试)。
  • 基线方法:Whisper v3 turbo(强基线),标准LoRA微调,以及一种复杂的多阶段数据生成方法[13]。
  • 主要实验结果
  • 标准LoRA的灾难:在合成数据上用标准LoRA微调,导致德语WER相对恶化高达418%,CSW特定词错误率(PIER)增加超200%。即使使用复杂的数据生成流水线也无法避免性能崩塌。
  • BLoRA的成功:结合最严格的过滤策略(5% CER)和仅1000条样本,BLoRA将CSW词错误率(PIER)相对降低了32.87%,整体WER相对改善5.31%,同时单语性能基本无损。
  • 消融实验揭示
  • 文本多样性 > 说话人多样性:在固定数据量下,增加文本种类比增加说话人种类对CSW性能的提升更大。
  • 数据过滤至关重要:TTS模型在短词上易产生幻觉。在小数据量下,严格的过滤(5% CER)是取得收益的关键;随着数据量增大,幻觉的负面影响才会被稀释。

5. 优势与局限

  • 主要优势
    1. 无需真实CSW数据:完全依赖LLM和TTS合成的数据,免去了昂贵的人工标注,具有高度的可扩展性。
    2. 打破性能权衡:成功打破了“加CSW能力必掉单语性能”的魔咒,实现了真正的“强基线增量学习”。
    3. 揭示了核心痛点:用扎实的实验证明了强模型适应的瓶颈在于“如何整合知识”而非“如何造数据”。
  • 局限性
    1. 语言对局限性:实验仅在英德(两种相近的强资源语言)上验证。对于形态学差异更大、距离更远的语言对,GPT-4o生成高质量混合文本的能力可能受限。
    2. 声学领域差距:论文在脚注中承认,由于训练数据是朗读语音,在对话语音数据集(如DECM)上仍存在由于声学不匹配导致的性能差距。
    3. 依赖前置过滤:方法的有效性高度依赖使用另一个ASR模型对TTS数据进行严格的质量过滤,这增加了流水线的计算成本。

6. 关键结论与启发

  • 最重要的Takeaway:在基础模型日益强大的今天,“适应方法”比“数据工程”更重要。向一个已经接近最优的模型添加新能力,不能采用从头训练的暴力微调法,而必须采用稀疏的、保护性的知识整合策略。
  • 启发与延伸方向
    1. 未来的ASR适应研究应当以“强基线”为起点,并将“不损害原有能力”作为第一评估指标。
    2. BLoRA这种稀疏贝叶斯自适应思路,不仅适用于语码转换,完全可以推广到其他需要给大模型增量添加特定任务能力的场景(如添加方言识别、特定领域术语识别等)。
    3. 后续研究可探索如何将该方法应用于资源极度匮乏的跨语系语言对,以及如何缩小朗读语音训练与对话语音推理之间的声学领域差距。
🔥 推荐必读
🏷️ 领域语音识别 (ASR) > 语码转换
💡 创新贝叶斯低秩自适应——基于标准LoRA微调改进,引入贝叶斯先验使权重稀疏化,结合合成数据在强基线ASR模型上增量添加语码转换能力而不发生灾难性遗忘
⭐ 评分8.0
#42
eess.AS

Benchmarking Large Language Models for Grapheme-to-Phoneme Conversion: A Japanese Case Study 跨领域

Tomoki Koriyama
Computation and Language (cs.CL); Audio and Speech Processing (eess.AS)
Comments: accepted to Interspeech 2026
查看摘要
Grapheme-to-phoneme (G2P) conversion is essential for controllable and robust text-to-speech, and large language models (LLMs), with broad linguistic knowledge, offer a promising approach. We benchmarked over 30 LLMs on Japanese G2P, comparing them with conventional morphological analyzers on 3000 manually annotated sentences. We evaluated two prompting strategies: a parse mode, where the LLM performs morphological analysis followed by rule-based kana conversion, and a direct mode, where the LLM directly predicts kana readings. The results show that model size, version, and Japanese-specialized training are key factors, with the best LLMs achieving kana character error rate below 0.52\% vs. the best conventional tool (1.03\%). Parse mode outperforms direct mode for most models, as rule-based post-processing relieves the LLM of handling complex pronunciation rules. We also show that feeding LLM-predicted kana into a kana-input TTS yields better pronunciation than end-to-end TTS.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文对30多个大语言模型(LLM)在日语字位到音素(G2P)转换任务上进行了全面基准测试,发现通过让LLM负责分词与读音估计、结合规则后处理的“解析模式”,最佳LLM的准确率超越了传统工具,且基于此G2P模块的TTS系统在发音准确率上优于端到端TTS。

2. 研究背景与动机

  • 核心问题:日语的字位到音素(G2P)转换,即将包含汉字、平假名等的混合日文文本准确转换为发音符号(假名)。
  • 重要性:尽管端到端(E2E)TTS系统日益流行,但显式的G2P模块对于实现发音可控性(如纠正人名、地名读音)和保证系统鲁棒性仍然不可或缺。
  • 现有不足:日语G2P极具挑战性,因为日文没有词边界、汉字存在多音字现象,且数字与量词组合时有复杂的变音规则。传统的基于词典和规则的工具(如OpenJTalk、MeCab)在处理未登录词(如新词、外来语、拟声词)时表现不佳;而端到端TTS模型又常出现发音不自然的问题。

3. 核心方法

  • 提出方法:论文提出了两种基于LLM的日语G2P策略:
    1. 解析模式:让LLM执行形态学分析(分词)并估计每个词的读音,输出JSON格式。随后,使用确定性的规则代码进行后处理(如助词变音、长元音合并)生成最终假名。
    2. 直接模式:在提示词中塞入所有复杂的发音规则,让LLM一步到位,直接输出整句的假名读音。
  • 关键创新点
    1. 首个涵盖超30个模型(闭源API、开源权重、传统工具)的大规模日语G2P基准测试。
    2. 提出解析模式,巧妙分离了LLM擅长的语义理解任务与LLM不擅长的死板规则应用。
    3. 验证了“LLM-G2P + 假名输入TTS”的架构在发音准确率和自然度上优于端到端TTS。
  • 直觉性解释:直接模式就像让一个人一边看中文一边直接写出拼音,还要同时处理多音字、儿化音、变调等所有规则,大脑容易“过载”出错。解析模式则是让这个人只负责断句和判断多音字该发哪个音(发挥他的语感优势),至于“一七八不”变调这种死规律,交给一个简单的查表程序去完成。分工明确,错误率大降。

4. 实验与结果

  • 数据集:使用JVS语料库中的3000个句子,并进行了人工假名读音标注。
  • 基线方法:传统形态学分析器(OpenJTalk, MeCab+UniDic, KyTea, Sudachi等)。
  • 主要实验结果
  • 最佳表现:闭源API模型中,Claude Opus 4.6(解析模式)和Gemini 3.1 Pro(直接模式)的假名字符错误率(CER)分别低至0.52%和0.53%,显著优于最佳传统工具OpenJTalk的1.03%。
  • 模型规模与特化训练:模型越大效果越好(遵循缩放定律);经过日语专门训练的开源模型(如Swallow系列)CER大幅下降。
  • 模式对比:对于绝大多数模型(尤其是小模型),解析模式优于直接模式。
  • TTS对比:将LLM预测的假名输入微调后的TTS,其发音CER(2.38%)远低于直接输入文本的端到端TTS(如Gemini 2.5 Flash TTS为3.96%,ElevenLabs为13.96%),且自然度(UTMOS评分)未受损失。
  • 消融/对比实验揭示
  • 思维链的作用:推理模式对表现一般的模型帮助不大,但能让本就优秀的模型(如Gemini 3 Flash)通过更精确的分词进一步提升准确率。
  • 解析模式的短板:极少数情况下(如Gemini 3.1 Pro),解析模式会把“2人”切分成“2”和“人”导致变音规则失效,而直接模式能整体处理从而反超。

5. 优势与局限

  • 主要优势
    1. 强泛化能力:LLM利用预训练知识,有效解决了传统词典无法处理未登录词(如外来语、生僻词)的痛点。
    2. 架构解耦优势:解析模式通过“LLM做语义+规则做变音”的组合,降低了LLM遵循复杂指令的难度,显著提升了小模型的可用性。
    3. 提升TTS上限:证明了显式G2P模块在当前技术下仍具有极高的实用价值,比E2E系统更可控、发音更准。
  • 局限性
    1. 概率模型的不可控性:LLM偶尔会对常见词产生离谱的误读(如将“本名”读错),不如传统词典稳定。
    2. 资源门槛高:要达到超越传统工具的精度,通常需要依赖庞大的闭源API或百亿/千亿参数级的开源模型,小模型(<10B)错误率依然很高。
    3. 评测局限:数据集虽涵盖多现象,但论文未针对实际应用中最易出错的专有名词(人名、地名)进行专项压力测试。

6. 关键结论与启发

  • 核心Takeaway:在TTS流程中,显式的G2P模块并未过时。通过让LLM发挥语言理解优势(分词与多音字消歧),结合传统规则处理死板的发音变调,可以打造出远超传统工具和端到端模型的发音前端。
  • 启发与延伸方向
    1. 人机协作的范式:不要让LLM做所有事,将确定性规则(后处理)与概率性生成(LLM)结合是工程落地的最佳实践。
    2. 可控发音:未来可利用LLM的上下文学习(In-context Learning)能力,允许用户在Prompt中直接指定某些专有名词的读音,这是传统G2P难以实现的灵活特性。
    3. 后处理的LLM化:未来可探索用小模型替代现有的规则后处理,以解决解析模式中因分词破坏词块(如数量词)导致的变音错误。
#43
eess.AS

Towards Accurate and Robust Surveillance Roadside IVD via Trackletized Audio-Visual Reasoning 跨领域

Xiwen Li, Xiaoya Tang, Bodong Zhang, Tolga Tasdizen
Computer Vision and Pattern Recognition (cs.CV); Audio and Speech Processing (eess.AS)
查看摘要
Idling Vehicle Detection (IVD) seeks to determine, at the final frame of a video clip, whether any vehicle is idling, meaning the vehicle is stationary with its engine running, using synchronized video from a remote surveillance camera and multichannel audio captured by spatially distributed wireless microphones along the roadside. Prior full-image, clip-level fusion approaches tend to overfit scene background and full-frame context, produce unstable temporal decisions, and lack an explicit spatial prior to align vehicles with microphones, which makes them brittle under domain shift and data inefficient. Instead, we introduce TAVR-IVD, an audio-visual framework guided by multi-object tracking. Our method detects vehicles, links detections into tracklets, and classifies each vehicle by operating on its tracklet. This design raises the effective signal-to-noise ratio, stabilizes temporal decisions through tracklets, enforces an explicit spatial prior to align vehicles with microphones, and adapts across domains with limited calibration annotations while remaining detector agnostic and efficient. To evaluate deployment robustness, we further curate two evaluation extensions, AVIVD-LT and AVIVD-M, covering inter-day and cross-site shifts.

📖 深度解读

1. 一句话总结

本文提出了一种基于车辆轨迹片段的音视频推理框架(TAVR),通过将全局多通道音频与单辆车的运动轨迹进行几何对齐,解决了路侧监控中怠速车辆检测在跨天和跨场景部署时鲁棒性差的问题。

2. 研究背景与动机

  • 核心问题:路侧监控中的怠速车辆检测(IVD)。系统需要根据同步的视频和多通道音频,判断画面中的车辆处于“移动”、“怠速”(静止但发动机运转)还是“熄火”(静止且无发动机声)状态。
  • 重要性:车辆怠速会加剧空气污染并造成燃料浪费。利用现成的摄像头和麦克风网络进行非接触式监控,是一种极具扩展性的城市交通管理方案。
  • 现有不足:现有的端到端方法(如AVIVDNet、HAVT-IVD)直接对整幅视频帧进行音视频融合。这种“全图级别”的做法存在严重缺陷:
    1. 背景干扰:模型容易走捷径,过度依赖道路布局、光照等背景信息,导致泛化能力差。
    2. 全局-局部不匹配:音频是多个麦克风采集的全局混合信号,而输出要求是针对单辆车的状态。缺乏将声音分配给特定车辆的空间先验,导致多车场景下判断困难。
    3. 缺乏时序稳定性:帧级别的预测容易抖动,且未经过真实的跨天/跨场景测试。

3. 核心方法

论文提出了 TAVR (Trackletized Audio-Visual Reasoning) 框架,将IVD任务从“全图分类”重构为“基于轨迹片段的跨模态推理”。
- 关键创新点
1. MASP(麦克风对齐空间先验):利用YOLO检测和DeepSORT跟踪,将视频中的车辆转化为具有身份一致性的“轨迹片段”。轨迹片段的质心位置作为空间先验,帮助模型将全局混合的多通道音频与特定的车辆实例“绑定”。
2. 轨迹片段条件分类器:不使用复杂的视觉外观特征,而是仅使用车辆的“质心绝对位置”和“质心位移”作为Query,通过交叉注意力机制从多通道音频中检索证据。这种设计极大提升了有效信噪比。
3. JACE(联合音视频对比嵌入):引入监督对比学习,在潜在空间中根据车辆状态(移动/怠速/熄火)将特征聚拢或推开,强制模型学习音视频几何对应关系,而非依赖领域特定的捷径。
4. 免训练跨域通道对齐:针对实际部署中麦克风接线错乱的问题,提出在推理阶段使用少量目标域标签搜索最佳的麦克风通道映射,无需重新训练模型。

  • 直觉性解释
    以前的方法像是“看着全景图,听着全场的声音”来猜哪辆车在怠速,很容易被环境噪音干扰。TAVR的方法则像是一个侦探:它先用望远镜锁定每一辆车,画出它们的行动轨迹(MASP);然后根据这辆车在画面中的位置,去多通道录音里“定向”提取属于它的声音(分类器);最后,它还建立了一套严格的分类规则,让“移动+轰鸣声”、“静止+低频声”、“静止+无声”这三类特征在脑海中清晰区分,不依赖画面背景做判断(JACE)。

4. 实验与结果

  • 数据集:原始AVIVD训练集/验证集(同天同地),以及本文新构建的 AVIVD-LT(同地不同天)和 AVIVD-M(跨地点、不同麦克风布局)测试集。
  • 基线方法:专用IVD模型(Real-Time IVD, AVIVDNet, HAVT-IVD)、通用多模态表征模型、音视频多模态大模型(MiniCPM-o, VideoLLaMA 2)。
  • 主要实验结果
  • 同域性能:在AVIVD-LV上,TAVR达到89.59 mAP_AD,略超HAVT-IVD(88.63),但参数量仅为其四分之一(8.89M vs 31.62M)。
  • 跨天鲁棒性:在AVIVD-LT上,TAVR保持81.32 mAP_AD,而HAVT-IVD暴跌至43.34,AVIVDNet降至30.83。
  • 跨域鲁棒性:在AVIVD-M(6麦克风)上,TAVR达到78.10 mAP_AD,远超最强基线ImageBind(46.07);在更具挑战性的3麦克风稀疏布局下,TAVR仍达67.90,而其他专用IVD模型几乎全部失效(接近0)。
  • 消融实验揭示
    1. 质心位置和位移是互补的,两者结合才能同时处理移动和静止车辆的音频归属。
    2. 视觉裁剪(VC)反而有害:加入车辆外观裁剪图会引入背景干扰,导致性能下降,证明“轨迹几何”比“车辆外观”更适合此任务。
    3. JACE显著提升跨域泛化:在AVIVD-M上,加入JACE使mAP_CLS从57.82跃升至79.81,t-SNE图也显示各类别特征分离度大幅提高。

5. 优势与局限

  • 主要优势
    1. 极强的部署鲁棒性:通过解耦车辆外观与音视频几何对应关系,有效抵抗了跨天、跨场景以及麦克风通道错乱带来的域偏移。
    2. 轻量高效:在性能超越SOTA的同时,模型参数量控制在10M以内,远小于通用多模态大模型,适合实际路侧边缘部署。
    3. 设计直觉且合理:摒弃了容易过拟合的视觉外观特征,仅用质心轨迹作为音频检索的Query,抓住了多通道音频定位的本质。
  • 局限性
    1. 仍受限于不完整或截断的音频观测,在极端恶劣的传感条件下,区分“怠速”和“熄火”仍存在困难。
    2. 跨域通道对齐虽然免训练,但仍需少量目标域标签进行校准,并非完全零样本部署。

6. 关键结论与启发

  • 核心Takeaway:在路侧监控等存在“全局信号-局部实例”不匹配的任务中,将预测锚定在身份一致的轨迹片段上,并利用几何先验进行跨模态对齐,是避免捷径学习、实现高泛化能力的有效途径。全图级别的端到端融合虽然在同域表现尚可,但在真实部署中极其脆弱。
  • 后续启发
    1. “先定位跟踪实例,再进行跨模态推理”的范式可推广至其他音视频监控任务(如声源定位、异常事件检测)。
    2. 对于多通道音频处理,显式引入空间几何先验比单纯堆叠Transformer更具解释性和鲁棒性。
    3. 未来的研究可以探索如何将不确定性建模引入音视频几何融合中,以应对音频缺失或严重遮挡等不完美传感条件。
#44
eess.AScs.SD

Interleaved Speech Language Models Latently Work In Text 跨领域

Talia Sternberg, Gallil Maimon, Yossi Adi
Computation and Language (cs.CL); Machine Learning (cs.LG); Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: Preprint. 23 pages, 20 figures, 5 tables
查看摘要
Speech language models (SLMs) have been extensively studied, with the common paradigm incorporating text data and pre-trained text LMs. A leading approach is speech-text interleaving in which models are trained over sequences containing both speech and text tokens, aiming to boost even speech-only capabilities. Yet the way these two modalities interact in the model latent space remains unclear. In this work, we analyze interleaved speech-text LMs from different model families and sizes through the scope of the logit lens to provide such insight. We reveal that these models go through an implicit transcription phase in which the text token of the spoken word becomes decodable in intermediate layers, despite not being trained for speech recognition. The transcription of the word appears as one of the top candidate words for as much as 77\% of the data. Following this stage, the models proceed to predict the next word in the text space before transforming back to the speech domain. We finally analyze the role of interleaving data, and initializing from text LMs in eliciting this behavior, as well as seeing how this correlates with spoken knowledge abilities. Our analysis sheds light on the internal mechanisms underlying the relationship between speech and text modalities and could shape SLM optimization.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文发现,交替训练的语音-文本语言模型在处理语音时,会自发地在中间层将语音“隐式转录”为文本,并在文本空间中进行推理和预测,最后再转换回语音输出。

2. 研究背景与动机

  • 核心问题:交织语音-文本语言模型在训练后,其纯语音输入输出的能力得到了显著提升,但语音和文本这两种模态在模型内部(潜在空间中)究竟是如何交互的,仍然是一个黑盒。
  • 重要性:理解模型内部的跨模态工作机制,不仅有助于解释为什么交织训练能提升语音能力,还能为未来优化语音语言模型(SLM)的设计和训练提供指导。
  • 现有不足:以往的研究大多停留在现象层面(如证明交织训练有效),或者只关注语音和文本表征在几何空间的对齐度,缺乏对模型逐层计算过程中信息动态变化的深入探究。

3. 核心方法

  • 提出的方法:论文使用了一种名为“Logit Lens(逻辑透镜)”的机械可解释性工具,将模型中间层的隐藏状态投影到最终的词表空间中,以观察模型在每一层“想”到了什么词。针对语音token长度不固定的问题,研究者将语音片段与单词对齐,并采用取最大值的聚合策略来提取词级别的预测。
  • 关键创新点
    1. 揭示“隐式转录”现象:首次发现并量化了模型在没有显式ASR(语音识别)监督的情况下,在中间层自发将语音转换为文本词的过程。
    2. 定位“文本思考”阶段:发现模型不仅转录当前词,还在文本空间中预测下一个词甚至最终答案,随后才转回语音模态。
    3. 精准归因训练要素:通过严格的控制实验,明确了“预训练文本模型初始化”和“语音-文本交织数据”是触发该现象的两个缺一不可的必要条件。
  • 直觉性解释:这就像一个英语非母语的人听英语演讲。他不是直接用英语思维去理解,而是先在脑子里把听到的英语单词“翻译”成母语(隐式转录),用母语思考出下一句逻辑(文本推理),最后再把答案“翻译”回英语说出来。模型也是如此:输入语音 $\rightarrow$ 早期层处理声学 $\rightarrow$ 中间层变成文本并思考 $\rightarrow$ 晚期层转回语音输出。

4. 实验与结果

  • 数据集:研究者手动构建了一个包含282个样本的常识事实补全数据集(涵盖颜色、首都、算术等,如“The capital of France is...”),并用TTS模型合成为语音进行测试。
  • 对比基线:对比了不同模型家族(Llama-3.2、Qwen2.5)、不同参数规模,以及不同训练设置(纯语音、语音+文本、不同比例的交织数据、随机初始化 vs 文本预训练初始化)的模型。
  • 主要实验结果
    1. 模态流转:语音输入在模型早期层(0-2层)表现为语音token概率高,中间层(2-25层)突然转变为文本token概率占主导,最后在输出层(26-28层)又变回语音token。
    2. 惊人的转录率:在中间层,当前语音对应的正确文本转录词,有高达近80%(Recall@50)的数据能够出现在模型预测的Top候选词中。
    3. 预测能力:模型在中间层不仅能转录当前词,还能以约40%(Recall@50)的准确率预测出下一个文本词,甚至在最终答案预测上达到近60%的召回率。
  • 消融实验揭示
    1. 只有“文本预训练初始化”+“交织数据”同时存在时,隐式转录才强烈出现。单独使用其中之一(如随机初始化+交织数据,或文本初始化+纯语音/文本分离训练)效果极差。
    2. 交织数据的比例并非越高越好:1/3和2/3的比例效果最好,高达5/6时转录现象反而大幅减弱(可能是因为过度交织减少了模型接触纯模态数据的机会)。

5. 优势与局限

  • 主要优势
    1. 方法直观且解释力强:利用Logit Lens将抽象的隐藏状态映射为人类可读的词汇,提供了非常直观的跨模态交互证据。
    2. 实验控制严谨:通过多组消融实验,清晰剥离了不同训练策略对内部机制的具体影响,结论非常有说服力。
    3. 关联下游能力:不仅分析了机制,还验证了“隐式转录能力”与“语音事实知识检索能力”之间存在正相关(Spearman相关系数约0.70)。
  • 局限性
    1. 仅停留在相关性层面:论文只证明了转录现象与知识能力的正相关,但没有进行因果性验证(例如,通过干预手段强制增强隐式转录,看知识能力是否随之提升)。
    2. 机制粒度较粗:虽然发现了现象,但没有进一步定位是哪些具体的注意力头或神经元通路负责执行这种转录和转换。
    3. 未评估对声学能力的负面影响:模型内部“绕道”文本空间,可能会牺牲对语音情感、韵律等非文本声学特征的处理能力,论文未对此进行探讨。

6. 关键结论与启发

  • 最重要的Takeaway:语音语言模型(SLM)在处理语音时,本质上是在“用文本思考”。它们通过隐式转录将语音映射到文本空间,利用文本预训练积累的强大先验知识进行推理,然后再生成语音。
  • 对后续研究的启发
    1. 训练范式优化:既然模型内部需要经历转录,未来或许可以设计显式的辅助损失函数来“鼓励”这种隐式转录,从而可能进一步提升模型的语义能力。
    2. 模态差距的来源:语音和文本模态之间的表现差距,可能部分来源于“隐式转录”过程中的错误(论文定性分析中发现了如将"lime"误转录为"line"的声学错误),未来可针对减少转录噪声进行优化。
    3. 端到端语音模型的反思:如果绕道文本是模型获取知识的最佳途径,那么追求完全脱离文本空间的“纯语音大模型”可能在知识推理上存在天然劣势,如何在保留声学丰富性的同时接入文本知识库是关键方向。
🔥 推荐必读
🏷️ 领域语音大模型与对话 (Speech LLM / SDM) > 语音语言模型
💡 创新机械可解释性分析——基于Logit Lens工具,探究交织语音-文本语言模型内部的隐式转录与文本推理机制
⭐ 评分8.0
#45
eess.AScs.SD

HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems 跨领域

Mateusz Barański, Jan Jasiński, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: Accepted at Interspeech 2026
查看摘要
End-to-end Automatic Speech Recognition (ASR) systems hallucinate on natural speech, yet existing mitigation methods are typically evaluated on non-speech or artificially corrupted audio. We introduce HALAS, the first human-annotated dataset of naturally occurring hallucinations from seven state-of-the-art ASR models on real unprocessed earnings call recordings. HALAS provides span-level labels, enabling analysis of hallucination patterns and their severity. Our analysis reveals strong cross-model vocabulary overlap and confirms that hallucinations also occur for almost correctly transcribed speech (characterized by a low Word Error Rate). The proposed benchmark with HALAS shows that the character and semantic-level metrics used as a proxy for hallucination detection reach 81% ROC-AUC, while state-of-the-art detection methods achieve an F1 score of only 53.1%. As such, HALAS establishes the first rigorous non-artificial benchmark for the detection and mitigation of ASR hallucinations.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文构建了首个基于真实语音的人类标注ASR(自动语音识别)幻觉数据集HALAS,揭示了现代语音识别模型在真实数据上普遍存在的幻觉现象,并为评估和检测幻觉提供了一个极具挑战性的新基准。

2. 研究背景与动机

  • 核心问题:现代端到端ASR系统在处理自然语音时会产生“幻觉”(即输出与音频内容不符的错误文本,如凭空插入词语或无限循环重复),但现有研究通常只在非语音或人工损坏的音频上评估幻觉检测方法。
  • 重要性:ASR幻觉不仅会降低用户体验,还可能在医疗等关键领域导致严重的错误信息或误诊。
  • 现有不足:此前缺乏在未处理的真实语音数据上对ASR幻觉进行的系统性调查;现有检测方法(如基于参考文本、查找表或代理指标)在真实场景下的适用性未知。

3. 核心方法

  • 提出的框架/数据集:HALAS(Hallucination Annotations for Large-scale ASR Systems),一个包含片段级人类标注的ASR幻觉数据集。
  • 关键创新点
    1. 真实数据驱动:首次使用真实的财报电话录音作为基础,捕捉自然发生的ASR幻觉。
    2. 基于“模型间分歧”的样本筛选:通过计算7个SOTA模型对同一音频转录结果的平均相互WER,挑选出分歧最大的音频片段进行标注,从而高效富集幻觉样本。
    3. 严格的片段级人工标注:由10名专业人员标注,区分“幻觉”、“循环”和“循环幻觉”,并人工修正了原数据集中14%不准确或听不清的参考文本。
    4. 多层解码器嵌入检测扩展:在评估现有检测方法时,将基于单层解码器嵌入的检测器扩展到多层(第2、13、23层)拼接,提升了检测效果。
  • 直觉性解释:想象几个顶尖的同声传译员听同一段录音,如果他们写下来的内容天差地别,说明这段录音可能含糊不清或非常难懂,容易让人“听错”。作者就专门挑这些让AI们“打架”的录音片段,请人类专家来逐一判定AI到底在哪里“瞎编”(幻觉)。然后,用这些真实场景下的“瞎编”记录去测试现有的测谎工具(检测方法)。

4. 实验与结果

  • 数据集:基于Earnings 22 (E22) 数据集,筛选出3,611个音频片段,使用7个SOTA ASR模型(4个Whisper变体、2个Nemo Canary变体、1个Parakeet)生成转录。
  • 基线方法:7种文本代理指标(WER, CER, BERTScore, PPL等)、基于LLM的检测(GPT-4o mini, Gemini 2.0 Flash)、以及基于解码器嵌入的检测(DE)。
  • 主要实验结果
  • 幻觉普遍存在:所有7个模型都会产生幻觉,幻觉率在21.4%到43.8%之间。
  • 高频词汇高度重叠:不同模型产生的幻觉文本惊人地相似,平均55%的幻觉集中在各自排名前10的高频短语上(如 "you", "thank you", "okay")。
  • WER无法可靠识别幻觉:即使在WER很低(如6.25%)的情况下,依然会出现幻觉。
  • 检测方法表现不佳:代理指标中最好的CER和SeMaScore仅达到81%的ROC-AUC;而SOTA检测方法表现较差,即使是表现最好的多层DE检测器,F1分数也仅为56.1%。令人意外的是,无参考文本的DE检测器表现优于能直接对比标准答案的LLM检测器。
  • 消融实验揭示:跨模型训练测试表明,用其他模型数据训练的检测器在未见过的模型上依然有效(ROC-AUC 0.828),证明HALAS数据集学到的幻觉特征具有跨模型通用性。

5. 优势与局限

  • 主要优势
    1. 填补了真实语音场景下ASR幻觉研究的数据空白,具有极高的实际应用价值。
    2. 标注质量高,包含片段级标签和人工校验的ground truth,并提供了跨7个主流模型的横向对比。
    3. 揭示了跨模型共有的幻觉模式(高频词汇重叠),为未来研究提供了重要洞察。
  • 局限性
    1. 分布偏差:为了最大化幻觉样本,数据集通过“模型分歧”刻意筛选了高难度音频,因此其22%-33%的幻觉率不能代表ASR在日常普通场景下的真实幻觉频率。
    2. 场景与语言单一:目前仅限于英文财报电话场景,未涵盖其他语言或极端嘈杂环境。
    3. 检测上限低:尽管提出了多层DE改进,但在该真实数据集上最佳F1仅56.1%,说明现有检测方法在真实场景下仍显得力不从心。

6. 关键结论与启发

  • 核心Takeaway:现代ASR模型在真实语音中普遍存在幻觉,且这些幻觉往往非常流畅、简短,与正确文本在结构和语义上高度重叠,导致传统的文本指标(如WER、PPL)难以有效察觉。模型内部的解码器特征比表面文本或LLM对比更具检测潜力。
  • 启发与延伸方向
    1. 未来的幻觉缓解与检测研究必须从“非语音/人工噪声”转向“真实自然语音”,HALAS为此提供了标准基准。
    2. 针对跨模型高度重叠的高频幻觉短语,可以探索开发特定的黑名单后处理过滤器或针对性的微调策略。
    3. 检测方法的下一步研究应深入挖掘ASR模型的内部机制(如多层注意力头、解码器状态),而非仅依赖输出文本。
🔥 推荐必读
🏷️ 领域语音识别 (ASR) > 鲁棒性
💡 创新ASR幻觉检测数据集——基于模型间分歧筛选真实语音片段进行人工标注,并扩展多层解码器嵌入进行检测
⭐ 评分8.5
#46
eess.AScs.SD

From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection 跨领域

Jan Jasiński, Mateusz Barański, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: Accepted at Interspeech 2026
查看摘要
Hallucinations of ASR models - fluent transcriptions with no basis in audio - degrade system performance and pose risks in downstream applications. Robust detection of such errors remains a challenge. This paper studies Whisper large v3 hallucination detection on real-speech human-annotated data across three paradigms: text-based, LLM-based, and internal decoder state probing. Text classifiers utilizing metrics for text evaluation achieve high recall but degrade without reference transcripts. LLM-based detection improves precision with domain-specific prompt conditioning, yet remains less competitive than the lightweight text-based methods. Probing Whisper's decoder representations, without a ground-truth reference, yields the strongest performance, revealing that hallucination traits are encoded across intermediate decoding layers. A late-fusion meta-classifier combining text and internal-state outputs achieves the best overall detection performance.

📖 深度解读

1. 一句话总结

本文全面对比了基于文本、大语言模型(LLM)和模型内部状态三种范式在检测Whisper语音识别模型幻觉上的表现,发现探测模型解码器中间层的内部状态能在无参考文本时取得最佳检测效果,而融合文本特征与内部状态的元分类器则实现了最优的整体检测性能。

2. 研究背景与动机

  • 核心问题:像Whisper这样的大型ASR模型会产生“幻觉”——即生成流畅但与输入音频毫无关联的文本。如何在没有真实文本参考的实际部署场景中,稳健地检测出这些幻觉错误?
  • 重要性:幻觉不仅会拉低系统的字错率(WER),还可能引入冒犯性、偏见或事实错误的内容。当ASR作为下游NLP任务的前端时,这些看似合理的伪造文本会导致级联式的系统崩溃。
  • 现有不足:传统的检测方法高度依赖真实文本作为参考(如WER、BERTScore),无法用于实际部署;而无需参考的文本指标(如困惑度、重复率)检测效果极差。此外,以往研究多使用非语音或合成音频来测试,缺乏在真实人类语音数据上的验证。

3. 核心方法

论文提出并系统评估了三种幻觉检测范式,并最终提出一种融合框架:
- 基于文本特征的检测:提取包括需要参考文本的指标(如WER、语义相似度)和无需参考的指标(如每秒字符数CPS、困惑度PPL),使用XGBoost等机器学习模型进行分类。
- 基于LLM的检测:利用GPT-4o mini和Gemini Flash等大模型,通过逐步注入领域特定病理知识(如Whisper常见的幻觉短语)和少样本示例来优化提示词,进行零样本检测。
- 基于内部状态的检测:提取Whisper解码器在生成过程中每一层的隐藏状态嵌入,使用双向LSTM(BLSTM)对完整的解码序列进行分类。
- 后期融合元分类器:将文本分类器和内部状态分类器的输出概率结合,使用简单的逻辑回归进行最终判定。

关键创新点
1. 首次在真实人类语音标注数据集(HALAS)上全面对比了三大检测范式。
2. 发现了Whisper解码器中间层(第14-16层左右)的序列嵌入包含最丰富的幻觉信号,打破了以往只看最终Token或依赖模型自带置信度的局限。
3. 揭示了不同检测范式具有互补性,并提出了一种简单有效的后期融合策略。

直觉性解释
想象一个学生(ASR模型)在闭卷考试(听音频转录)中作弊(产生幻觉)。
- 文本检测就像是用标准答案去对比学生的试卷,或者看试卷里有没有出现奇怪的重复(无参考时)。如果有标准答案,很容易抓到作弊;如果没有标准答案,仅看卷面排版很难判断。
- LLM检测就像请了一个聪明的老师(LLM)来审查试卷,老师虽然懂语言,但如果不告诉他这个学生平时爱抄哪些错题(注入病理知识),他也很难判定。
- 内部状态检测就像是给学生戴上脑电波头盔,直接监测他答题时的大脑活动。研究发现,学生在作弊时,大脑中段区域(中间解码层)会出现一种系统性的异常脑电波。即使没有标准答案,抓这种异常脑电波也最准。

4. 实验与结果

  • 数据集:HALAS(基于真实Earnings-22音频,包含人类标注的Whisper large v3幻觉数据,幻觉率约23.8%)。
  • 基线方法:逻辑回归、随机森林、GPT-4o mini、Gemini 2.0/3.0 Flash,以及Whisper自带的内部置信度指标(AL, CR, NSP)。
  • 主要实验结果
  • 文本方法:在有参考文本时,XGBoost效果最好(F1: 62.8%);但在无参考时,性能暴跌(F1: 37.7%)。
  • LLM方法:经过提示词工程优化,Gemini 3.0 Flash达到最高F1 58.7%,但仍不及有参考的XGBoost,且计算开销巨大。无参考时同样崩溃(F1: 32.8%)。
  • 内部状态方法:Whisper自带的置信度指标几乎无效(F1: 23.6%)。而基于BLSTM探测解码器中间层序列的方法,在完全无参考的情况下达到了F1 65.5%,AUC 87.6%,超越了所有有参考的文本和LLM方法。
  • 融合方法:结合文本与内部状态的逻辑回归元分类器取得了全局最优表现(F1: 68.3%,AUC: 90.0%)。
  • 消融与分析实验
  • 三种范式捕捉的幻觉信号部分不重叠。文本模型召回率高但精确率低;LLM精确率高但召回率低;内部状态模型最均衡。
  • 幻觉短语的长度是决定检测难度的关键。所有模型在检测单字幻觉(如插入了一个"was")时都会失效。
  • 内部状态模型在长音频(>8秒)上表现更好,而文本模型在中等时长(3-8秒)表现最好。

5. 优势与局限

主要优势
1. 突破参考依赖:内部状态探测方法证明了在无真实文本参考的情况下,依然可以实现高效且可靠的幻觉检测,极具实际部署价值。
2. 发现模型机理:揭示了幻觉信号并非集中在某一处,而是系统性地分布在Whisper的解码中间层。
3. 轻量且高效:相比于计算昂贵的LLM检测,基于XGBoost和BLSTM的模型不仅效果更好,且计算开销极小。

局限性
1. 架构依赖性:内部状态探测方法需要直接访问模型的隐藏层,因此仅适用于Whisper或类似的Encoder-Decoder架构模型,对闭源API或纯Decoder架构的适用性需进一步验证。
2. 融合模型失去零样本能力:表现最好的融合模型必须依赖参考文本(用于文本特征分支),无法用于零样本部署场景。
3. 对微小幻觉束手无策:对于单字虚词的插入型幻觉,所有现有方法都难以有效检测。

6. 关键结论与启发

  • 核心Takeaway:ASR模型的幻觉不仅仅是文本层面的异常,更是模型内部解码状态的一种系统性偏移。通过“监听”模型解码过程的中间层脑电波(内部状态),可以在没有标准答案的情况下精准抓取幻觉。
  • 后续研究启发
    1. 内部状态探测技术可以扩展到其他自回归Encoder-Decoder ASR模型,甚至更广泛的生成式AI架构中,用于置信度估计和幻觉控制。
    2. 未来可以探索微调一个轻量级的专用LLM来进行无参考幻觉检测,以弥补商业LLM在零样本设定下的不足。
    3. 针对单字幻觉难以检测的问题,可能需要引入更细粒度的声学特征对齐机制作为补充。
#47
eess.AScs.SD

An Effective Strategy for Modeling Score Ordinality and Non-uniform Intervals in Automated Speaking Assessment 跨领域

Tien-Hong Lo, Szu-Yu Chen, Yao-Ting Sung, Berlin Chen
Audio and Speech Processing (eess.AS); Machine Learning (cs.LG); Sound (cs.SD)
Comments: ASRU 2025
查看摘要
A recent line of research on automated speaking assessment (ASA) has benefited from self-supervised learning (SSL) representations, which capture rich acoustic and linguistic patterns in non-native speech without underlying assumptions of feature curation. However, speech-based SSL models capture acoustic-related traits but overlook linguistic content, while text-based SSL models rely on ASR output and fail to encode prosodic nuances. Moreover, most prior arts treat proficiency levels as nominal classes, ignoring their ordinal structure and non-uniform intervals between proficiency labels. To address these limitations, we propose an effective ASA approach combining SSL with handcrafted indicator features via a novel modeling paradigm. We further introduce a multi-margin ordinal loss that jointly models both the score ordinality and non-uniform intervals of proficiency labels. Extensive experiments on the TEEMI corpus show that our method consistently outperforms strong baselines and generalizes well to unseen prompts.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出一种结合多模态自监督特征与手工特征的多维度评估框架,并引入多间隔序数损失函数,有效解决了自动口语评估中模态信息不全及CEFR等级顺序与非均匀间隔的建模问题。

2. 研究背景与动机

  • 核心问题:如何更准确、客观地自动评估二语(L2)学习者的英语口语水平(CEFR等级)。
  • 重要性:自动口语评估(ASA)系统能为学习者提供及时反馈,减轻教师负担,并在计算机辅助语言学习中发挥重要作用。
  • 现有不足
    1. 模态局限:基于语音的自监督模型(如wav2vec 2.0)能捕捉声学特征但缺乏语义理解;基于文本的模型(如BERT)依赖ASR转写,易受识别错误影响且丢失韵律信息。
    2. 忽略等级特性:现有方法大多将CEFR等级(如A1, A2, B1)视为无序的普通分类标签,或假设各等级间的距离是相等的。这违背了语言学习的客观规律——等级间有先后顺序,且跨度并不均匀(例如从A1到A2的进步跨度,远大于B1到B1+)。

3. 核心方法

  • 提出方法:多维度建模框架结合多间隔序数损失。
  • 关键创新点
    1. 多维度特征融合架构:将口语表现拆分为内容、表达和语言使用三个维度,分别建模后融合。
    2. 多间隔序数损失(MMO Loss):首次在ASA任务中,直接在logit(模型输出)层面建模CEFR等级的顺序性和非均匀间隔。
  • 直觉性解释
  • 多维度建模(MA):就像人类考官打分一样,模型不再“偏科”。它不仅听声音(表达模块:提取音高、停顿等手工特征),还看答得对不对(内容模块:结合题目和语音特征看语义相关性),最后还要看语法词汇(语言使用模块:提取词性、句法特征)。三个维度的特征综合起来给出最终评分。
  • MMO损失:传统的分类模型把A1、A2、B1当成毫无关系的独立类别。MMO则告诉模型:“这些等级是有先后顺序的,而且跨度不一样大”。模型在训练时,会根据真实数据计算出各等级间的“真实距离”(如Pre-A1到A1距离很大,B1到B1+距离很小),并据此调整预测。如果模型把B1预测成A1,受到的惩罚会远大于把B1预测成B1+。

4. 实验与结果

  • 数据集:TEEMI语料库(包含L2学习者的英语口语数据,标注了CEFR等级)。
  • 基线方法:W2V (纯语音), BERT (纯文本), W2V-BERT (多模态融合), 以及它们的原型网络变体 (W2V-PT, BERT-PT)。
  • 主要实验结果
  • 在TEEMI测试集上,多维度框架(MA)在宏观F1分数上全面超越基线。加入MMO损失后(MA+MMO),整体F1分数达到35.55%,在内容和语言使用维度上分别取得了3.17和8.39的绝对F1提升。
  • 在未见过的测试题(A02, B02, C01)上,MA+MMO表现出更强的泛化能力。例如在C01任务上,表达维度的F1提升了21.19%,整体F1提升了9.87%。
  • 消融与分析实验
  • 混淆矩阵显示,加入MMO后,模型在相邻等级间的混淆减少,且远距离等级的误判大幅降低。
  • 距离分析实证了CEFR等级确实是非等距的(Pre-A1到A1距离最大为0.9236,B1到B1+最小为0.4868),证明了MMO设计的合理性。

5. 优势与局限

  • 主要优势
    1. 互补性强:多维度架构有效弥补了单一模态的缺陷,兼顾了声学韵律与语义语法信息。
    2. 符合认知规律:MMO损失函数尊重了语言能力发展的客观规律(顺序与非均匀间隔),不仅提升了性能,还增强了模型预测的可解释性。
    3. 泛化能力好:对未见过的题目和任务类型表现出良好的鲁棒性,具备实际应用价值。
  • 局限性(基于论文内容推断):
    1. 依赖外部工具:内容模块依赖ASR转写,语言使用模块依赖NLP工具包,上游工具的错误可能会级联影响最终评估。
    2. 数据集局限:仅在TEEMI单一数据集上进行了验证,未验证在其他主流口语测试(如托福、雅思)数据上的效果。
    3. 架构复杂度:需要训练多个Transformer编码器和特征提取器,计算开销可能较大。

6. 关键结论与启发

  • 核心Takeaway:在教育评估任务中,标签的内在结构(如等级顺序、非均匀间隔)蕴含了丰富的先验知识。显式地建模这种结构(如通过MMO损失),能显著提升模型的准确率和泛化能力。
  • 启发与延伸方向
    1. 未来可探索跨题目、跨评分维度的联合训练策略,进一步增强模型在多样化任务上的鲁棒性。
    2. 论文展望中提到,可引入多模态大语言模型(MLLMs),以更原生的方式融合声学与文本信息,从而减少对ASR等中间流水线的依赖,提升评估的全面性与可解释性。
#48
eess.AS

SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations 跨领域

Xiaoyu Yang, Yifan Yang, Zengrui Jin, Ziyun Cui, Wen Wu 等 (8 人)
Audio and Speech Processing (eess.AS)
Comments: Proc. ICML 2026
查看摘要
Self-supervised learning (SSL) has significantly advanced acoustic representation learning. However, most existing models are optimised for either speech or audio event understanding, resulting in a persistent gap between these two domains. We address this gap with SPEAR (SPEech and Audio Representations), a self-supervised framework that distils complementary knowledge from a speech-focused SSL teacher and a general-audio SSL teacher into a single unified model. SPEAR applies multi-codebook vector quantisation to continuous teacher representations to produce fine-grained discrete tokens that capture both semantic and acoustic information. To effectively integrate these heterogeneous representations, SPEAR jointly predicts them given a masked input with an asymmetric pre-training loss. We further improve robustness in complex sound scenes through a novel token mixing mechanism. Extensive experiments demonstrate that SPEAR consistently outperforms existing unified speech and audio models. SPEAR establishes a new state-of-the-art on the SUPERB benchmark, surpassing WavLM Large on 12 of 15 tasks, while achieving competitive performance on the HEAR benchmark. These results position SPEAR as a versatile foundation for general-purpose speech and audio representation learning. The code and pre-trained models will be released.

📖 深度解读

1. 一句话总结

本文提出了SPEAR,一个统一语音和音频表示学习的自监督框架,通过多码本向量量化(MVQ)和掩码预测技术将语音和音频教师模型的知识蒸馏到一个学生模型中,在语音和音频理解任务上均达到了当前最优水平。

2. 研究背景与动机

  • 核心问题:如何构建一个能同时处理语音(侧重语义和语言学)和通用音频(侧重环境声和音乐等声学细节)的统一自监督学习基础模型。
  • 重要性:现实世界中的声音场景往往是复杂且重叠的(例如带有背景噪音的语音),语音和非语音声音之间存在内在的协同作用。依赖单一领域的专用模型会限制人工智能对声音环境的全面感知能力。
  • 现有不足:现有的SSL模型通常针对单一领域优化,跨域泛化能力差。虽然近期有研究(如USAD、MT2KD)尝试通过多教师特征匹配进行知识蒸馏,但这种直接模仿教师连续特征的方法限制了学生模型的上限,且未针对重叠声音等复杂场景进行优化。

3. 核心方法

SPEAR框架的核心是将知识蒸馏与掩码token预测相结合,从领域专用的教师模型中学习统一表示。
- 关键创新点
1. 多码本向量量化(MVQ):使用多个独立的码本将教师模型的连续表示离散化为细粒度的token。相比传统的k-means,MVQ能以指数级增加可表示的状态数,从而保留更丰富的语义和声学细节。
2. 非对称双域预训练:针对语音和音频数据的特性差异设计了非对称损失。对于语音输入,仅预测语音token;对于音频输入,则同时预测语音和音频token。这种策略将语音token作为通用监督,有效桥接了两个领域。
3. Token混合机制:针对复杂重叠声音场景,按信号能量比例随机混合两个声源的MVQ token作为训练目标,而不是像传统方法那样将次要声源视为噪声过滤掉。
- 直觉性解释:就像教一个学生同时掌握“语言理解”和“声音辨识”两门课,SPEAR不是让学生死记硬背两位专家老师的笔记(特征匹配),而是把两位专家的知识提炼成一套精细的“密码本”(MVQ token)。学生通过“填空游戏”(掩码预测)来内化这些知识。遇到嘈杂环境时,它还会把多个声音的“密码”按比例混合,让模型学会同时理解多个声源,而不是捂住耳朵只听主声音。

4. 实验与结果

  • 数据集/基准:预训练使用了约20万小时的语音和音频数据(包括Libriheavy, GigaSpeech, AudioSet等)。评测在语音领域的SUPERB和音频领域的HEAR基准上进行。
  • 基线方法:WavLM Large(语音SOTA)、Dasheng 1.2B(音频大模型)、USAD(统一模型)、BEATs、EAT等。
  • 主要实验结果
  • SUPERB基准:SPEAR在15个任务中的12个上超越了当前SOTA WavLM Large。其XLarge版本(600M参数)在语音理解、副语言和语音增强任务上全面领先。
  • HEAR基准:SPEAR双域模型表现优异,SPEARs+a XLarge平均分达83.41,超越了更大的Dasheng 1.2B(81.44)和USAD。
  • 下游微调:在ASR和音频标记(AT)任务上,SPEAR双域模型相比单域模型几乎没有性能损失,证明了其统一表示空间的有效性。
  • 消融实验揭示
  • Token mixing机制在说话人分离(SD)、语音分离(SS)和语音增强(SE)等需要处理重叠声音的任务上带来了显著提升。
  • 非对称预训练策略优于联合或分离策略,证明了让音频数据也学习语音token是一种有效的正则化。
  • MVQ token在副语言任务(如说话人识别)上显著优于k-means token。

5. 优势与局限

  • 主要优势
    1. 真正实现了语音和音频的统一表示,在两大领域基准上均达到顶尖水平,且跨域性能损耗极小。
    2. 创新的离散化(MVQ)和掩码预测结合,使模型能主动发现数据内在结构,而非被动模仿教师,实验证明学生模型能超越其教师模型。
    3. Token mixing机制有效提升了模型在真实复杂声学环境下的鲁棒性。
  • 局限性
    1. 多教师蒸馏框架在数据准备和预训练阶段引入了额外的计算开销(需训练MVQ量化器并进行教师模型前向传播)。
    2. 模型性能在一定程度上仍受限于所选教师模型的质量。
    3. 主要针对声音理解任务,未探索在生成任务(如语音合成、音频生成)上的能力。

6. 关键结论与启发

  • 关键Takeaway:细粒度的离散token掩码预测可以作为连接语音和音频自监督学习的通用接口。通过非对称损失和token混合,可以在单一模型中有效融合异构领域的知识,而不仅仅是做特征层面的模仿。
  • 启发与延伸方向
    1. 未来的音频基础模型可以进一步探索理解与生成能力的统一,例如将SPEAR的表示空间与语言模型结合,构建音频大模型(Audio LLM)。
    2. 论文指出在更大规模和更均衡的音频数据上预训练有望进一步提升性能,这指出了扩大高质量通用音频数据集的重要性。
    3. Token mixing的成功启发我们,在处理多源重叠信号时,按比例学习全部声源特征比单纯做降噪过滤更为有效,这一思想可推广至多模态分离与识别任务中。
🔥 推荐必读
🏷️ 领域自监督表征学习 (SSL) > 通用音频表征
💡 创新统一语音和音频的自监督表征学习框架——基于多教师知识蒸馏与掩码预测,引入多码本向量量化(MVQ)、非对称双域预训练及Token混合机制
⭐ 评分9.0
#49
eess.AS
Meta (World Famous IT Company)

Conditional Flow Matching for Visually-Guided Acoustic Highlighting 跨领域

Hugo Malard, Gael Le Lan, Daniel Wong, David Lou Alon, Yi-Chiao Wu 等 (6 人)
Audio and Speech Processing (eess.AS); Machine Learning (cs.LG)
查看摘要
Visually-guided acoustic highlighting seeks to rebalance audio in alignment with the accompanying video, creating a coherent audio-visual experience. While visual saliency and enhancement have been widely studied, acoustic highlighting remains underexplored, often leading to misalignment between visual and auditory focus. Existing approaches use discriminative models, which struggle with the inherent ambiguity in audio remixing, where no natural one-to-one mapping exists between poorly-balanced and well-balanced audio mixes. To address this limitation, we reframe this task as a generative problem and introduce a Conditional Flow Matching (CFM) framework. A key challenge in iterative flow-based generation is that early prediction errors -- in selecting the correct source to enhance -- compound over steps and push trajectories off-manifold. To address this, we introduce a rollout loss that penalizes drift at the final step, encouraging self-correcting trajectories and stabilizing long-range flow integration. We further propose a conditioning module that fuses audio and visual cues before vector field regression, enabling explicit cross-modal source selection. Extensive quantitative and qualitative evaluations show that our method consistently surpasses the previous state-of-the-art discriminative approach, establishing that visually-guided audio remixing is best addressed through generative modeling.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文将视频引导的音频高亮任务从判别式问题重新定义为生成式问题,提出了一种基于条件流匹配的框架,并通过引入展开损失和跨模态早期融合机制,有效解决了生成过程中的误差累积问题,显著提升了音频重混的质量与视觉一致性。

2. 研究背景与动机

  • 核心问题:视频内容中经常存在视觉焦点与听觉焦点不一致的问题(例如:画面中的人在说话,但声音却被背景音乐或噪音淹没)。VisAH(视觉引导的声学高亮)任务旨在根据视频画面自动调整音频各声源(语音、音乐、音效)的响度平衡。
  • 重要性:随着视频内容的爆发式增长,自动化的音频后期处理能极大提升用户的视听体验,弥合视觉显著性与声学强调之间的鸿沟。
  • 现有不足:以往的VisAH方法采用判别式模型,试图学习“差混音”到“好混音”的一对一映射。然而,音频重混本质上是一个多对多的分布映射问题(同一段视频可以有多种糟糕的混音,也有多种可接受的优质混音)。判别式模型无法处理这种固有的模糊性,且以往仅依赖视觉特征作为条件,迫使主网络既要搞懂跨模态对应关系又要做音频回归,负担过重。

3. 核心方法

  • 提出方法:VisAH-FM(基于条件流匹配的视觉引导声学高亮框架)。
  • 关键创新点
    1. 生成式重混范式:首次将音频高亮建模为条件流匹配(CFM)任务,学习从“差混音分布”到“好混音分布”的连续向量场变换,从而更好地捕捉多对多映射中的不确定性。
    2. 展开损失:针对流匹配中早期预测误差在迭代步骤中不断累积放大、导致轨迹偏离目标流形的问题,设计了展开损失。它通过端到端反向传播整个推理轨迹,并在最终步施加MSE监督,强制模型在中间步骤进行“自我纠错”。
    3. 跨模态早期融合条件模块:设计了一个Adapter层,将音频特征(来自CLAP)直接注入到视觉编码器(CLIP)的中间层。这种“早期融合”让条件模块专门负责“识别该增强哪个声源”,而让主网络专注于“音频回归”,实现了职责解耦。
  • 直觉性解释:把音频重混比作修图。以前的方法是直接给一张糊图让你输出清晰图(判别式),但修法有很多种,模型容易懵;现在是让模型学习一条“从糊到清晰”的渐变修图路径(流匹配)。如果第一步修错了方向,后面会越修越糟,Rollout loss就像是要求模型“走完全程后必须和标准答案对齐”,逼着它中途发现错误并自我纠正。同时,以前模型是一边看图一边修音,现在先把图和音的特征揉在一起(早期融合),明确“该突出什么声音”,再让修图工具专心修图。

4. 实验与结果

  • 数据集:Muddy Mix Dataset(基于电影片段构造的差混音/好混音数据对)。
  • 基线方法:VisAH(分别使用CLIP图像特征和T5文本特征作为条件)。
  • 主要实验结果:VisAH-FM在所有指标上全面超越基线。例如,在语义对齐度(KLD)上从11.37降至9.70,在混音响度差(LDif)上从9.66降至7.77,证明了生成式方法在该任务上的优越性。主观听感测试中,VisAH-FM的胜率(49.2%)也远高于VisAH(17.5%)。
  • 消融实验揭示
    1. 条件模块:视觉+音频的组合优于视觉+文本,说明直接注入音频特征比用文本描述视觉场景更有效,且省去了昂贵的VLM计算开销。
    2. 展开损失:移除该损失会导致性能大幅下降。对比一致性损失和桥匹配等技巧,Rollout loss表现最佳。有趣的是,仅使用Rollout loss(无标准CFM损失)也能超越基线,说明模型学会了多步迭代精炼(类似大模型中的思维链推理)。

5. 优势与局限

  • 主要优势
    1. 范式契合度高:将重混视为分布变换,从根本上解决了多对多映射带来的模糊性问题。
    2. 轨迹稳定性强:Rollout loss有效缓解了少步数流匹配中的误差累积,使模型具备抗干扰的自我纠错能力。
    3. 架构设计合理:跨模态早期融合减轻了主网络负担,且由于流匹配从差混音出发而非纯噪声,用户可通过推理步数灵活控制高亮的程度。
  • 局限性
    1. 计算成本增加:相比判别式模型,迭代式的生成过程带来了更高的计算开销。
    2. 依赖预训练表征:模型性能受限于CLIP/CLAP等预训练特征的质量,在音视觉线索较弱时可能失效。
    3. 依赖配对数据:目前仍需人工构造的差混音数据进行训练,尚未在真实世界的非配对数据上验证。

6. 关键结论与启发

  • 核心Takeaway:对于没有明确一对一映射的音频处理任务(如重混、增强),生成式建模(流匹配)是比判别式建模更优的范式;通过Rollout loss约束全局轨迹是稳定少步数生成的有效手段。
  • 后续启发
    1. Rollout机制可推广至其他多步迭代的生成任务(如图像/视频编辑),以缓解曝光偏差和误差累积。
    2. “让条件模块做决策,让生成主干做回归”的解耦设计,可启发其他多模态条件生成任务优化架构。
    3. 未来可探索在无配对真实数据上训练该框架,进一步提升其在实际媒体生产流水线中的实用价值。
🔥 推荐必读
🏷️ 领域通用音频生成 > 音频编辑/修复
💡 创新视觉引导的音频高亮——基于条件流匹配(CFM)生成式框架,引入展开损失缓解误差累积,并采用跨模态早期融合解耦条件与回归
⭐ 评分8.0
#50
eess.AScs.SD

Temporal Pooling Strategies for Training-Free Anomalous Sound Detection with Self-Supervised Audio Embeddings 跨领域

Kevin Wilkinghoff, Sarthak Yadav, Zheng-Hua Tan
Audio and Speech Processing (eess.AS); Sound (cs.SD)
查看摘要
Training-free anomalous sound detection (ASD) based on pre-trained audio embedding models has recently garnered significant attention, as it enables the detection of anomalous sounds using only normal reference data while offering improved robustness under domain shifts. However, existing embedding-based approaches almost exclusively rely on temporal mean pooling, while alternative pooling strategies have so far only been explored for spectrogram-based representations. Consequently, the role of temporal pooling in training-free ASD with pre-trained embeddings remains insufficiently understood. In this paper, we present a systematic evaluation of temporal pooling strategies across multiple state-of-the-art audio embedding models. We propose relative deviation pooling (RDP), an adaptive pooling method that assigns larger weights to embeddings with stronger temporal deviations, and introduce a hybrid pooling strategy that combines RDP with generalized mean (GeM) pooling. Experiments on five benchmark datasets demonstrate that the proposed methods consistently outperform mean pooling and achieve state-of-the-art performance for training-free ASD, including results that surpass previously reported trained systems and ensembles on the DCASE2025 ASD dataset.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文针对免训练异常声音检测(ASD)中传统平均池化容易平滑掉短暂异常信号的问题,提出了一种自适应的相对偏差池化(RDP)及其与广义平均池化的混合策略,在不引入任何额外训练的情况下显著提升了检测性能,甚至在最新数据集上超越了经过训练的模型。

2. 研究背景与动机

  • 核心问题:在基于预训练音频嵌入模型的免训练异常声音检测(ASD)中,如何将变长的帧级特征序列聚合为固定长度的向量(即时间池化)。
  • 重要性:免训练方法无需特定任务的微调,对领域偏移具有更好的鲁棒性,且易于快速部署。然而,异常声音往往是短暂、局部的偏离,而非全局的平均变化。
  • 现有不足:现有的基于嵌入的免训练ASD方法几乎全部默认使用“时间平均池化”。平均池化隐含了“所有时间段信息量相等”的假设,这会导致罕见且短暂的异常事件被大量正常片段稀释甚至淹没,从而降低异常录音的区分度。尽管其他池化方法在频谱图特征上被探索过,但在预训练嵌入空间中的系统性研究仍是空白。

3. 核心方法

  • 提出的方法:论文提出了相对偏差池化及其与广义平均池化的混合策略。
  • 关键创新点
    1. 相对偏差池化 (RDP):一种完全免训练的自适应加权池化方法。
    2. 混合池化 (RDP+GeM):将时间维度的自适应加权(RDP)与特征维度的非线性聚合(GeM)结合。
    3. 首次系统评估:将时间池化作为免训练ASD中的一个独立设计变量,在多个SOTA音频嵌入模型上进行隔离评估。
  • 直觉性解释
  • 平均池化就像是用整段录音的“平均水平”来判断是否有异常,如果异常声音很短促,它就被淹没在正常声音的海洋里了。
  • RDP 的思路是“找不同”。它先算出整段音频的平均特征作为“正常基准”,然后计算每一帧偏离这个基准的程度。偏离越大的帧(即越可能包含异常的帧),RDP 就赋予它越高的权重。这就好比一个质检员,专门把目光聚焦在那些和平时运转声不一样的“刺耳”瞬间。
  • 混合池化 (RDP+GeM) 则是双管齐下:RDP 负责在时间轴上挑出“关键帧”,GeM 负责在特征通道上放大“强响应”,两者结合既考虑了时间维度的异常性,又考虑了特征维度的稀疏性。

4. 实验与结果

  • 数据集:DCASE 2020至2025五个异常声音检测基准数据集。
  • 嵌入模型:OpenL3, BEATs, EAT, Dasheng。
  • 基线方法:平均池化、最大池化、GWRP、GeM池化,以及一个需要训练的注意力池化基线。
  • 主要实验结果
  • 相比默认的平均池化,提出的RDP和RDP+GeM在多个模型上带来了统计显著的性能提升。例如,在BEATs模型上,RDP带来了+1.71%的平均提升;在Dasheng上带来了+1.53%的提升。
  • 超越SOTA:在最新的DCASE2025数据集上,使用BEATs嵌入+RDP+GeM的免训练方法取得了63.2%的平均分,不仅优于其他免训练方法,甚至超越了此前报告的需要训练的系统及挑战赛冠军系统(61.2%)。
  • 击败注意力池化:需要利用元数据训练的注意力池化表现反而不如免训练的RDP,说明基于分类目标学习的权重不一定适用于异常检测。
  • 消融实验与发现
  • EAT模型的特殊性:EAT模型如果不做预处理,性能很差。论文发现必须对其嵌入进行硬阈值截断和tanh激活抑制尖峰。经过预处理后,EAT的时间方差降低,此时高级池化方法带来的收益甚微,平均池化已接近最优。
  • 超参数敏感性:GeM池化对超参数非常鲁棒;RDP虽然对超参数敏感,但一旦针对特定嵌入模型选定参数后,在不同数据集间具有良好的泛化能力。

5. 优势与局限

  • 主要优势
    1. 即插即用,零训练成本:不修改嵌入模型和异常分数计算后端,仅替换池化层即可获得显著增益,计算复杂度仍保持为线性 $O(TD)$。
    2. 理论直觉清晰且有效:针对异常检测中“异常即偏离”的本质设计了权重分配策略,直击平均池化的痛点。
    3. 强大的泛化性:超参数仅依赖于嵌入模型类型,与具体数据集无关,证明了其捕捉的是通用的特征分布规律而非过拟合。
  • 局限性
    1. 依赖嵌入模型的特性:对于像EAT这样经过特殊预处理后时间分布趋于均匀的嵌入,本方法带来的提升十分有限。
    2. 引入了额外超参数:尽管泛化性好,但仍需在开发集上为不同的嵌入模型调整 $\gamma$ 和 $p$ 等参数,并非完全“开箱即用”。
    3. 绝对提升幅度有限:在某些表现已经很好的模型(如OpenL3)上,绝对提升只有0.6%左右。

6. 关键结论与启发

  • 最重要的 Takeaway:在基于嵌入的免训练异常检测系统中,时间池化绝不是一个可以随意默认设为“平均”的固化组件,而是一个至关重要的设计变量。仅仅通过优化池化策略,就能获得与更换更强大嵌入模型相当的性能提升。
  • 对后续研究的启发
    1. 重新审视“平均”:在任何涉及变长序列聚合的免训练任务(如声音事件检测、视频异常检测、生物声学监测等)中,如果目标是对抗“异常”或“稀有事件”,都应谨慎对待平均池化,考虑基于偏差或注意力的自适应聚合。
    2. 结合端到端微调:未来可以研究将RDP这种基于无监督偏差的池化机制与有监督的微调框架结合,看其是否能作为良好的先验结构。
    3. 特征预处理的重要性:论文对EAT模型嵌入所做的特殊预处理(截断与抑制尖峰)是一个实用的工程经验,提示后续研究在使用自监督大模型输出时,需关注其激活值的动态范围和分布特征。
#51
eess.AS
KAIST - Korea Advanced Institute of Science & Technology (QS Top 100)

MamTra: A Hybrid Mamba-Transformer Backbone for Speech Synthesis 跨领域

Tan Dat Nguyen, Sangmin Bae, Joon Son Chung, Ji-Hoon Kim
Audio and Speech Processing (eess.AS)
Comments: Interspeech 2026
查看摘要
Despite the remarkable quality of LLM-based text-to-speech systems, their reliance on autoregressive Transformers leads to quadratic computational complexity, which severely limits practical applications. Linear-time alternatives, notably Mamba, offer a potential remedy; however, they often sacrifice the global context essential for expressive synthesis. In this paper, we propose MamTra, an interleaved Mamba-Transformer framework designed to leverage the advantages of Mamba's efficiency and Transformers' modeling capability. We also introduce novel knowledge transfer strategies to distill insights from a pretrained Transformer into our hybrid architecture, thereby bypassing the prohibitive costs of training from scratch. Systematic experiments identify the optimal hybrid configuration, and demonstrate that MamTra reduces inference VRAM usage by up to 34% without compromising speech fidelity - even trained on only 2% of the original training dataset. Audio samples are available at this https URL .

📖 深度解读

以下是对论文《MamTra: A Hybrid Mamba-Transformer Backbone for Speech Synthesis》的结构化中文解读报告:

1. 一句话总结

本文提出了MamTra,一种混合Mamba-Transformer架构的语音合成骨架模型,通过复用预训练Transformer权重并辅以知识蒸馏,在仅用2%训练数据的情况下,实现了与原模型相当的语音质量,同时将推理显存降低了34%。

2. 研究背景与动机

  • 核心问题:当前基于大语言模型(LLM)的文本转语音(TTS)系统严重依赖自回归Transformer架构,其核心的自注意力机制会导致随序列长度呈二次方增长的计算和内存复杂度,这限制了其在长文本合成(如有声书、播客)及边缘设备上的部署。
  • 重要性:长文本语音合成是TTS技术落地的关键场景,解决算力与显存瓶颈是使其在资源受限设备上普及的前提。
  • 现有不足:虽然Mamba等状态空间模型(SSM)能实现线性时间推理,但纯Mamba架构缺乏对全局上下文的建模能力,导致表现力下降;而现有的混合架构TTS模型(如Zonos)不仅未公开细节,且需要从头训练,成本极其高昂。

3. 核心方法

  • 方法名称:MamTra,一种交错式混合Mamba-Transformer架构,结合了多级知识蒸馏策略。
  • 关键创新点
    1. 结构化参数迁移:通过数学推导将Transformer的注意力机制“线性化”,发现其与Mamba的SSM结构存在对齐关系。据此,直接将预训练Transformer的Q、K、V权重映射并初始化Mamba层的对应参数,避免了从头预训练。
    2. 多级知识蒸馏:由于去掉Softmax会损失表现力,MamTra采用包含交叉熵($L_{CE}$)、Logits散度($L_{logits}$)和嵌入层MSE($L_{emb}$)的多级蒸馏,从教师模型恢复生成行为和语义空间。
    3. 系统性的混合设计空间探索:全面测试了不同层替换策略(交错、连续、数据驱动)及不同Transformer与Mamba的比例(1:1到1:11),找到了效率与质量的最优解。
  • 直觉性解释:就像把一个原本全靠“全局开会”(Transformer自注意力)来决策的团队,改造成一部分人负责“局部流水线作业”(Mamba),一部分人保留“全局会议”。为了让新团队快速上手,直接把老团队的经验笔记(权重映射)分给新成员,并让老员工带新员工(知识蒸馏),从而用极少的培训数据就让新团队运转起来。

4. 实验与结果

  • 数据集:训练集使用LibriTTS;测试集使用Seed-TTS-eval test-en和LibriTTS test-clean(包含长度压力测试)。
  • 基线方法:CosyVoice 2、Llasa-1B、Zonos-v0.1。
  • 主要实验结果
  • 效率提升:相比基线CosyVoice 2,MamTra 1:1配置将推理时的GPU显存降低了34%,在2048上下文长度下每Token节省1.4×10^11 FLOPs。
  • 质量保持:在仅使用原模型约2%(0.5k小时 vs 170k小时)训练数据的情况下,MamTra 1:1配置保持了与教师模型相当的感知质量(NMOS、UTMOS、SSIM相近),词错率(WER)仅绝对增加0.25%。
  • 长文本鲁棒性:在长度压力测试中,基于WER重要性选择的1:5配置表现出色(WER为2.28%),优于更保守的1:3配置,说明在长文本下“选对层替换”比“单纯保留更多Transformer层”更重要。
  • 消融实验:证明了三个蒸馏损失函数均不可或缺,其中交叉熵损失对可懂度影响最大;同时,权重复用初始化比标准随机初始化收敛更快、最终损失更低。

5. 优势与局限

  • 主要优势
    1. 训练成本极低:通过巧妙的权重映射与蒸馏,将原本需要海量数据的混合模型训练缩减至原数据量的2%。
    2. 优越的效率-质量权衡:在大幅降低显存和计算量的同时,几乎不牺牲语音的自然度与说话人相似度。
    3. 设计指导性强:为TTS领域的混合架构提供了详细的层替换位置与比例的实验依据。
  • 局限性
    1. 极端替换比例下性能崩溃:当Mamba比例过高(如1:11)时,词错率显著上升,说明Mamba仍无法完全替代Transformer的全局推理能力。
    2. 依赖强大的教师模型:该方法的前提是存在一个已预训练好的Transformer TTS模型,若缺乏合适的教师模型,此方法的适用性会受限。
    3. 架构泛化性待验证:实验主要基于CosyVoice 2骨架进行,其在其他主流LLM-TTS架构(如VALL-E系列)上的表现未在文中探讨。

6. 关键结论与启发

  • 核心Takeaway:在TTS领域,Transformer和Mamba并非二选一的对立关系。通过精确的数学结构映射和针对性的知识蒸馏,可以低成本地将现有沉重的Transformer模型“升级”为轻量高效的混合模型,且不损失生成质量。
  • 后续启发
    1. 这种“线性化映射 + 多级蒸馏”的转换范式,具有很强的通用性,未来可尝试推广至其他基于自回归LLM的生成任务(如语音增强、音乐生成甚至视频生成)。
    2. 未来可探索动态路由机制(如根据输入文本长度自适应选择使用Transformer还是Mamba层),以在极低延迟和最高表现力之间实现更灵活的平衡。
🔥 推荐必读
🏷️ 领域语音合成 (TTS) > Zero-shot TTS / 声音克隆
💡 创新混合 Mamba-Transformer 语音合成骨架——基于预训练 Transformer 权重线性化映射与多级知识蒸馏改进
⭐ 评分8.0
#52
eess.AScs.SD

Controllable Accent Normalization via Discrete Diffusion 跨领域

Qibing Bai, Yuhan Du, Tom Ko, Shuai Wang, Yannan Wang 等 (6 人)
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Sound (cs.SD)
Comments: Accepted to Interspeech 2026 as a long paper
查看摘要
Existing accent normalization methods do not typically offer control over accent strength, yet many applications-such as language learning and dubbing-require tunable accent retention. We propose DLM-AN, a controllable accent normalization system built on masked discrete diffusion over self-supervised speech tokens. A Common Token Predictor identifies source tokens that likely encode native pronunciation; these tokens are selectively reused to initialize the reverse diffusion process. This provides a simple yet effective mechanism for controlling accent strength: reusing more tokens preserves more of the original accent. DLM-AN further incorporates a flow-matching Duration Ratio Predictor that automatically adjusts the total duration to better match the native rhythm. Experiments on multi-accent English data show that DLM-AN achieves the lowest word error rate among all compared systems while delivering competitive accent reduction and smooth, interpretable accent strength control.

📖 深度解读

1. 一句话总结

本文提出了一种基于掩码离散扩散模型的口音归一化系统(DLM-AN),通过复用源语音中预测为“母语发音”的离散token,实现了对口音强度的平滑、可解释控制,并在内容保真度上超越了现有方法。

2. 研究背景与动机

  • 核心问题:现有的口音归一化(将非母语口音转为母语口音)方法大多是一键式的“全量转换”,缺乏对口音强度的控制能力。
  • 重要性:许多实际应用(如语言学习中的渐进式纠音、多媒体配音中保留部分口音作为人物特征)需要系统能够灵活调整口音的保留程度,而不是千篇一律的标准口音。
  • 现有不足:以往的基于TTS的方法受限于合成质量和时长建模误差;近期的基于token的方法虽然效果更好,但均未提供口音强度控制。唯一的尝试(FAC-FACodec)通过连续扩散的起始时间步来控制,但受限于帧到帧框架,无法调整说话节奏和总时长,控制粒度较粗。

3. 核心方法

  • 提出的框架:DLM-AN(Diffusion Language Model for Accent Normalization),一个基于自监督语音token的掩码离散扩散框架。
  • 关键创新点
    1. 首个基于离散扩散的口音归一化模型:将大语言模型中的掩码扩散技术(LLaDA)引入语音token生成,通过双向Transformer迭代预测被掩码的token。
    2. 公共Token预测器(CTP):用于识别源语音中可能与母语发音共享的token。通过复用高置信度的源token来初始化扩散过程,提供口音强度控制。
    3. 时长比例预测器(DP):基于流匹配的模型,用于预测和调整目标语音的总时长,以匹配母语的说话节奏。
  • 核心思路直觉解释
    想象你在修改一篇带有方言口音的演讲稿。同一句话,方言和标准语在很多发音相似的词上是一样的,只有部分“口音重”的词不同。DLM-AN的做法是:先用一个“公共Token预测器(CTP)”给稿子里的每个字打分,判断它是否接近标准语。如果用户想保留一点口音,系统就把那些高分(接近标准语)的字保留下来,只把低分的字“涂黑(掩码)”让AI重新生成;如果想完全去除口音,就把整篇稿子全涂黑重新写。保留的字越多,原口音保留得就越多,从而实现了对口音强度的直观控制。

4. 实验与结果

  • 数据集:使用Emilia-EN进行预训练,LibriTTS-R训练分词器和合成器,扩展的L2-ARCTIC数据集(含7种口音)用于微调和评估。
  • 基线方法:TokAN(自回归token转换)、CosyAccent(非自回归直接流匹配)。
  • 主要实验结果
  • 内容保真度最高:DLM-AN在自由时长和保持源时长设置下均取得最低的词错率(WER分别为11.19%和10.64%,优于基线的12.40%和13.84%)。
  • 口音控制有效:随着复用token的阈值降低(保留更多源token),主观口音得分(ACT)从27.90平滑上升至38.37(接近源语音的48.46),且说话人相似度随之提升。
  • 时长缩放鲁棒性强:在任意时长缩放对比中,DLM-AN在大多数比例下保持最低WER,尤其在压缩时长(比例<1.0)时优势显著。
  • 消融实验:去除无分类器引导(CFG)会导致WER上升和口音去除效果下降;去除预训练则会导致WER大幅恶化(从10.64%升至16.61%),证明了这两个组件的必要性。

5. 优势与局限

  • 主要优势
    1. 平滑且可解释的控制:通过CTP阈值调整token复用比例,提供了直观且符合直觉的口音强度旋钮。
    2. 优异的内容保持:离散扩散的迭代生成结合CTC音素引导,使其在所有对比系统中取得了最低的WER。
    3. 双重控制:同时支持口音强度和总时长的独立控制。
  • 局限性
    1. 误差传播:依赖基于识别的token编码器进行音素监督,重口音输入可能导致识别误差,进而影响转换质量。
    2. 生成伪影:在解掩码的迭代过程中可能出现重复发音的问题。
    3. 数据偏置:分词器和合成器仅在母语数据上训练,对极度重口音的语音重建可能不够鲁棒。

6. 关键结论与启发

  • 关键Takeaway:利用语音离散token在不同口音间的共享特性,结合掩码扩散模型的迭代生成机制,可以优雅且有效地实现口音强度的连续控制,且不以牺牲内容准确性为代价。
  • 启发与延伸方向
    1. 可引入纠正机制(如remasking)来解决迭代生成中的重复发音伪影。
    2. 在分词器和合成器的训练中引入L2口音数据,以提升系统对重口音输入的鲁棒性。
    3. 探索使用学习型离散码本(如VQ)替代K-Means分词,可能获得更好的语音区分度,进一步增强可控性。
🔥 推荐必读
🏷️ 领域语音转换 (VC / SVC) > 情感/口音转换
💡 创新口音归一化——基于掩码离散扩散模型(LLaDA),引入公共Token预测器(CTP)复用源语音token以控制口音强度,并结合时长比例预测器(DP)调整说话节奏
⭐ 评分8.0
#53
eess.AS

AdaLTM: Adaptive Layer-wise Task Vector Merging for Categorical Speech Emotion Recognition with ASR Knowledge Integration 跨领域

Chia-Yu Lee, Huang-Cheng Chou, Tzu-Quan Lin, Yuanchao Li, Ya-Tse Wu 等 (7 人)
Audio and Speech Processing (eess.AS)
Comments: Accepted to Interspeech 2026
查看摘要
Integrating Automatic Speech Recognition (ASR) into Speech Emotion Recognition (SER) enhances modeling by providing linguistic context. However, conventional feature fusion faces performance bottlenecks, and multi-task learning often suffers from optimization conflicts. While task vectors and model merging have addressed such conflicts in NLP and CV, their potential in speech tasks remains largely unexplored. In this work, we propose an Adaptive Layer-wise Task Vector Merging (AdaLTM) framework based on WavLM-Large. Instead of joint optimization, we extract task vectors from in-domain ASR and SER models fine-tuned on emotion datasets. These vectors are integrated into a frozen base model using layer-wise learnable coefficients. This strategy enables depth-aware balancing of linguistic and paralinguistic knowledge across transformer layers without gradient interference. Experiments on the MSP-Podcast demonstrate that the proposed approach effectively mitigates conflicts between ASR and SER.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种自适应分层任务向量合并框架,通过在权重空间融合领域内的语音识别(ASR)和语音情感识别(SER)知识,有效解决了传统多任务学习中的梯度冲突问题,提升了情感识别的性能。

2. 研究背景与动机

  • 核心问题:如何有效地将自动语音识别(ASR)提供的语言上下文知识整合到语音情感识别(SER)中,以提升情感分类的准确率。
  • 重要性:SER本质上是多模态任务,既依赖声学特征(如语调、节奏),也依赖语言内容(说了什么)。ASR能提供关键的语言线索,是增强SER性能的常规手段。
  • 现有方法不足
    1. 输出级融合:对ASR转录错误非常敏感,且无法实现深层特征交互。
    2. 多任务学习(MTL):ASR和SER的目标存在根本性冲突——ASR试图抑制情感等副语言特征以获得情感不变的文本表征,而SER恰恰依赖这些副语言特征。这种目标错位导致联合优化时产生严重的梯度干扰(跷跷板效应),破坏模型学习情感特征的能力。
    3. 域外知识不匹配:直接使用通用数据集(如LibriSpeech)训练的ASR模型会丢弃对SER至关重要的副语言线索。

3. 核心方法

  • 提出方法:Adaptive Layer-wise Task Vector Merging (AdaLTM),基于WavLM-Large基础模型。
  • 关键创新点
    1. 权重空间融合替代梯度联合优化:提取ASR和SER的任务向量(微调权重与预训练权重之差),通过代数相加融合,彻底避免反向传播中的梯度冲突。
    2. 强调领域一致性:使用情感数据集微调得到“域内”ASR模型,而非通用ASR模型,确保语言知识与情感任务分布匹配。
    3. 自适应分层合并机制:为模型的每一层分配可学习的系数,动态平衡不同深度下ASR和SER知识的注入比例。
  • 直觉性解释:想象一个厨师(基础模型)要同时学做两道口味截然相反的菜(ASR要去除味道,SER要保留味道),一起学容易精神分裂(梯度冲突)。AdaLTM的做法是:先分别培养两个专精的厨师(微调出ASR和SER模型),提取他们各自的“独门秘方”(任务向量)。最后,在一个主厨(冻结的基础模型)身上,根据做菜的不同阶段(网络的不同层),按不同比例注入这两个秘方。主厨本身的基础不改变,只调整注入比例,从而完美融合两种冲突的技能。

4. 实验与结果

  • 数据集:MSP-Podcast (v1.12)(8类情感分类任务)。
  • 基线方法:多任务学习(MTL,全参数微调与静态初始化微调)、冻结基础模型、单向量合并(仅ASR/仅SER)、静态全局合并、自适应全局合并、域外ASR向量合并。
  • 主要实验结果
  • 相比MTL基线(UAR约29.62%),AdaLTM达到了38.94%的UAR(Macro-F1为35.20%),绝对提升超过8.4%,且仅更新了0.14%的参数。
  • 双向量合并(UAR 38.94%)显著优于冻结基线(37.05%)和仅ASR向量(37.57%),与仅SER向量(39.09%)相当。
  • 域内ASR向量(38.94%)优于域外ASR向量(38.68%)。
  • 自适应分层合并(38.94%)优于静态全局合并(38.30%)和自适应全局合并(38.93%)。
  • 消融实验揭示
    1. 协同与竞争:虽然双向量合并实现了知识协同,但由于模型容量有限,容纳两种冲突特征会带来轻微的“表征拥挤”,导致性能比单SER向量略低0.15%,但整体框架成功避免了灾难性干扰。
    2. 分层动态分析:在双向量设置中,ASR向量在中间层和深层保持稳定(充当语言锚点),而SER向量被显著放大(占据韵律主导地位)。若使用域外ASR向量,则会导致优化混乱和特征抑制。

5. 优势与局限

  • 主要优势
    1. 无梯度冲突:通过在权重空间操作,彻底规避了ASR与SER联合训练时的优化冲突。
    2. 参数高效:下游适应阶段仅训练分层系数和预测头,可训练参数量仅占全模型的0.14%。
    3. 可解释性强:分层系数的可视化清晰揭示了模型在不同深度对语言和声学知识的需求差异。
  • 局限性
    1. 依赖域内转录文本:需要高质量的情感领域内文本来微调ASR模型,难以直接应用于缺乏转录本的低资源情感数据集。
    2. 初始微调成本高:尽管下游适应轻量,但初始阶段仍需分别微调多个基础模型以提取任务向量,计算开销不容忽视。

6. 关键结论与启发

  • 核心Takeaway:在处理目标冲突的多任务(如ASR与SER)时,操作权重空间(任务向量合并)比操作梯度空间(多任务联合训练)更有效;且辅助任务的知识必须与主任务在数据分布上保持一致(域内知识)。
  • 后续启发
    1. 针对缺乏域内ASR转录本的场景,未来可探索利用大语言模型(LLM)进行ASR纠错或生成伪标签,以低成本获取域内ASR任务向量。
    2. 这种自适应分层合并范式可扩展至其他存在任务冲突的语音多模态场景(如语音翻译与情感识别的结合),具有广泛的通用性。
🔥 推荐必读
🏷️ 领域副语言与健康 > 语音情感识别 (SER)
💡 创新自适应分层任务向量合并——基于WavLM基础模型,通过在权重空间融合域内ASR和SER的任务向量替代梯度联合优化,解决多任务学习中的梯度冲突
⭐ 评分8.0
#54
eess.AScs.SD
University of Texas at Austin (QS Top 100)New York University (NYU) (QS Top 100)

ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining 跨领域

Anuj Diwan, Eunsol Choi, David Harwath
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Computation and Language (cs.CL); Sound (cs.SD)
Comments: Interspeech 2026
查看摘要
We introduce ParaSpeechCLAP, a family of dual-encoder models that map speech and text style captions into a shared embedding space, supporting rich intrinsic (speaker-level) and situational (utterance-level) descriptors, such as pitch, texture, and emotion, beyond the narrow set handled by existing models. We train separate Intrinsic and Situational models alongside a unified Combined model, finding that specialized models are stronger on individual style dimensions while the unified model excels on compositional evaluation. We further show that ParaSpeechCLAP-Intrinsic benefits from an additional classification loss and class-balanced training. We demonstrate performance on style caption retrieval, speech attribute classification, and usability as inference-time reward models for style-prompted TTS. ParaSpeechCLAP models outperform baselines on most metrics across all three applications. Our models and code are released at this https URL .

📖 深度解读

以下是对论文《ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining》的结构化中文解读报告:

1. 一句话总结

本文提出了ParaSpeechCLAP双编码器模型,将语音与丰富的文本风格描述(如音高、音色、情感等)映射到共享空间,不仅提升了语音风格检索与分类能力,还首次将其作为免训练的奖励模型,通过“优中选优”策略显著提升了文本转语音(TTS)系统的风格一致性。

2. 研究背景与动机

  • 核心问题:现有的语音-文本对齐模型通常只能处理极其有限的风格属性(如少数几种基本情绪),无法应对真实世界中丰富多样的语音风格,尤其是内在的说话人特征(如音高、音色、清晰度)和情境特征(如情绪)。
  • 重要性:打破这种狭窄的风格限制,能够极大地推动风格提示的TTS、表现力语音检索、语音风格字幕生成以及更具表现力的 spoken dialog 系统的发展。
  • 现有不足:现有的相关模型(如SpeechCLIP、ParaCLAP)要么对齐的是语音与图像,要么仅支持极少数的情境情感标签,缺乏对自由文本描述的丰富内在和情境风格的支持。

3. 核心方法

  • 方法/模型:论文提出了ParaSpeechCLAP,一个CLIP/CLAP风格的双编码器模型家族。包含三个变体:专注内在属性的Intrinsic模型、专注情境属性的Situational模型,以及统一训练的Combined模型。
  • 关键创新点
    1. 复用文本编码器的分类损失:在Intrinsic模型中,不额外增加分类头,而是利用文本编码器对类别标签生成嵌入,与语音嵌入计算相似度进行分类。这既完成了多标签分类,又强化了跨模态对齐。
    2. 免训练的TTS推理时奖励指导:首创性地将双编码器模型作为奖励模型,对TTS生成的多个候选音频进行打分(Best-of-N选择),无需重新训练TTS即可提升其风格表现力。
    3. 全面覆盖丰富风格标签:支持28种内在标签和23种情境标签,是首批支持如此广泛风格维度的双编码器模型。
  • 直觉性解释:模型就像一个精通各种语音风格的“翻译官”,把“一个声音尖锐、带鼻音的男声”这样的文字描述和实际的语音片段放到同一个“坐标系”里对比。对于TTS系统,它扮演了“面试官”的角色:让TTS系统生成10个候选语音,然后用ParaSpeechCLAP挑出最符合文字描述的那一个,而不需要让TTS系统回炉重造。

4. 实验与结果

  • 数据集/基准:训练和评估均基于ParaSpeechCaps数据集(包含Expresso, EARS, VoxCeleb等子集),因为现有标准基准(如IEMOCAP)仅支持5-6种情绪,无法满足评估需求。
  • 基线方法:Random Projection、原版ParaCLAP、在ParaSpeechCaps上微调的ParaCLAP (ParaCLAP-PSC)、以及分类器基线VoxProfile-VQ。
  • 主要实验结果
  • 检索与分类:ParaSpeechCLAP全面超越基线。例如在内在属性检索中,Intrinsic模型的R@1达到18.62,远超ParaCLAP-PSC的11.49。在分类任务上,UAR(46.58)也优于VoxProfile(41.40)。
  • 专精 vs 统一:专精模型在各自领域表现最好,但Combined模型在需要同时理解两类标签的组合评估中表现最优(R@10达到52.17)。
  • TTS推理指导:使用ParaSpeechCLAP指导后,TTS的风格一致性(CMOS)从3.61提升至3.70,内在标签召回率从57.9%提升至62.4%,且未损害自然度(NMOS)和可懂度(WER甚至从8.14降至7.56)。
  • 消融实验:针对Intrinsic模型的消融表明,移除更强大的编码器、多任务分类损失或类平衡采样,均会导致性能下降,证明这三个组件缺一不可。

5. 优势与局限

  • 主要优势
    1. 风格覆盖面广且灵活:支持丰富的内在和情境标签,且能处理自然语言提示,而非死板的固定标签。
    2. 即插即用的TTS增强:Best-of-N选择策略无需修改或训练TTS模型,即可提升生成语音的风格忠实度。
    3. 设计巧妙的多任务损失:通过复用文本编码器进行分类,避免了额外分类头破坏跨模态嵌入空间的对齐。
  • 局限性
    1. 推理成本较高:Best-of-N策略需要生成N个候选,计算开销随N线性增加,不够高效。
    2. 专精与统一的权衡:Combined模型虽然综合能力强,但在单一维度的表现仍不及专精模型,且使用专精模型需要人工在推理时选择对应变体。

6. 关键结论与启发

  • 核心Takeaway:通过将强大的预训练语音/文本编码器与丰富的风格数据集结合,并辅以多任务对齐训练,可以构建出对细粒度语音风格高度敏感的共享嵌入空间。这种对齐模型不仅能胜任理解任务(检索/分类),还能作为生成任务(TTS)的有效奖励信号。
  • 启发与延伸方向
    1. 探索比Best-of-N更高效的推理时指导方法(如guided decoding),以降低生成成本。
    2. 研究如何缩小统一模型与专精模型在单一维度上的性能差距,实现“全能”与“专精”的统一。
    3. 本文指出分类性能对提示词措辞敏感,未来可进一步研究如何稳定zero-shot分类的鲁棒性,并呼吁社区建立支持更广泛语音风格的标准评测基准。
👀 推荐值得看
🏷️ 领域音频理解 > 音频-文本检索语音合成 (TTS) > 情感/风格可控
💡 创新双编码器语音-文本风格对齐模型——基于CLAP架构改进,复用文本编码器进行多标签分类避免额外分类头破坏对齐空间,并首创免训练的Best-of-N推理时奖励指导提升TTS风格一致性
⭐ 评分7.5
#55
eess.AScs.SD

Unmixing The Crowd: Learning Persistent Speaker Representations from Mixture-Derived Multi-Speaker Embeddings 解读失败跨领域

Sidharth Sidharth, Meysam Asgari, Hao-Wen Dong, Dhruv Jain
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: Submitted to IEEE SLT 2026
查看摘要
We study whether persistent conversational speaker structure can be extracted directly from local overlapping speech mixtures. We propose a teacher-student framework that learns mixture-derived multi-speaker embeddings using only short overlapping segments and permutation-invariant latent supervision. Despite never being explicitly trained for speaker tracking, diarization, or conversational memory, the learned embedding space supports long-form speaker re-identification when combined with a lightweight online memory mechanism during inference. We additionally observe that the learned representation retains meaningful speaker structure under unseen overlap cardinalities. We further show that embeddings extracted from separation-first pipelines exhibit degraded clustering structure compared to embeddings predicted directly from mixtures. Finally, the learned embeddings remain effective for the downstream target speaker extraction task across multiple architectures. These findings suggest that local mixture-derived representations support persistent conversational speaker re-identification when combined with lightweight inference-time memory consolidation.

📖 深度解读

[PDF 下载失败,无法解读]

#56
eess.AScs.SD

Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment 跨领域

Asif Azad, MD Sadik Hossain Shanto, Mohammad Sadat Hossain, Bdour Alwuqaysi, Sabri Boughorbel 等 (9 人)
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Computation and Language (cs.CL); Sound (cs.SD)
查看摘要
Automated phoneme-level pronunciation assessment is vital for scalable speech therapy and language learning, yet validated tools for Arabic remain scarce. We present Harf-Speech, a modular system scoring Arabic pronunciation at the phoneme level on a clinical scale. It combines an MSA phonetizer, a fine-tuned speech-to-phoneme model, Levenshtein alignment, and a blended scorer using longest common subsequence and edit-distance metrics. We fine-tune three ASR architectures on Arabic phoneme data and benchmark them with zero-shot multimodal models; the best, OmniASR-CTC-1B-v2, achieves 8.92% phoneme error rate. Three certified speech-language pathologists independently scored 40 utterances for clinical validation. Harf-Speech attains a Pearson correlation of 0.791 and ICC(2,1) of 0.659 with mean expert scores, outperforming existing end-to-end assessment frameworks. These results show Harf-Speech yields clinically aligned, interpretable scores comparable to inter-rater expert agreement.

📖 深度解读

以下是对论文《Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment》的结构化中文解读报告:

1. 一句话总结

本文提出了Harf-Speech,一个针对阿拉伯语的音素级语音发音评估框架,通过微调语音识别模型并结合临床专家打分验证,解决了现有商业系统在阿拉伯语发音评估上缺乏本地化和临床有效性的问题。

2. 研究背景与动机

  • 核心问题:缺乏针对阿拉伯语的、经过临床验证的自动化音素级发音评估工具。
  • 重要性:发音评估对言语治疗、辅助交流和语言学习至关重要。阿拉伯语使用人数超4亿,但其丰富的辅音、喉音音素及短元音功能使得音素级评估极具挑战性。依赖人工专家评估限制了干预的可扩展性。
  • 现有不足:现有的商业评估服务(如微软Azure)是“黑盒”且“一刀切”的,未针对阿拉伯语音系特征进行优化,也缺乏与临床言语语言病理学家(SLP)判断的对齐验证;开源的阿拉伯语音素识别研究多集中在古兰经诵读,缺乏完整的临床评估框架。

3. 核心方法

  • 方法/框架:Harf-Speech是一个模块化、模型无关的阿拉伯语音素级发音评估系统。
  • 关键创新点
    1. 模块化与可解释的架构:将系统分为参考音素生成、语音到音素预测、分割对齐和评分四个独立阶段,打破了端到端模型的黑盒状态。
    2. 针对阿拉伯语的模型微调:对多个前沿ASR模型进行音素级监督微调,显著优于零样本多模态大模型。
    3. 混合评分算法:结合最长公共子序列(LCS)和编辑距离(Levenshtein)计算得分,并映射到0-5的临床量表。
  • 核心思路直觉解释:想象一个语言老师批改学生的朗读作业。首先,系统把标准课文转换成“标准音标”(参考音素生成);然后,系统像耳朵一样把学生的录音听写下来变成“学生音标”(语音到音素预测);接着,系统把标准音标和学生音标逐词逐音对齐,看看哪里读错、漏读或多读了(对齐);最后,系统根据对齐结果,既看发音顺序对不对(LCS),又看准确率和完整度,综合打出一个临床分数(评分)。

4. 实验与结果

  • 数据集:微调使用IqraEval数据集(含母语、合成错误发音、真实错误发音);临床验证使用40个由3名认证SLP独立打分(0-5分)的语音样本。
  • 基线方法:零样本多模态模型(Gemini-3-flash/pro, Qwen3-ASR)、微软Azure发音评估服务。
  • 主要实验结果
  • 音素识别:微调后的OmniASR-CTC-1B-v2表现最佳,音素错误率(PER)仅为8.92%,且推理速度最快(RTF 0.004),远超零样本的Gemini-3-pro(15.07%)。
  • 临床对齐:Harf-Speech与专家平均评分的皮尔逊相关系数(PCC)达到0.791,组内相关系数(ICC)为0.659,±1误差一致率为76.9%。
  • 对比商业系统:Harf-Speech在PCC上比Azure高出0.156,平均绝对误差(MAE)降低了16%(0.79 vs 0.94),表现出显著优势。
  • 消融实验揭示:论文未提供传统意义上的模块消融实验,但通过对比不同ASR骨干模型发现,任务特定的微调对于阿拉伯语音素级建模至关重要,通用大模型无法直接胜任。

5. 优势与局限

  • 主要优势
    1. 临床有效性高:经过具有8-10年经验的认证SLP验证,评分与专家高度一致,甚至接近专家间一致性的下限。
    2. 可解释与可扩展:模块化设计提供词级和音素级反馈,且未来可轻松替换更先进的ASR模型。
  • 局限性
    1. 临床验证样本量较小:仅使用了40个语音样本进行专家评分验证,可能不足以代表所有复杂的发音障碍场景。
    2. 评分权重依赖经验设定:最终评分公式中的权重(如0.6和0.4)是经验设定的固定值,缺乏数据驱动的优化过程。
    3. 依赖外部LLM进行分割:词级分割使用了大语言模型,可能引入额外的计算开销或分割误差。

6. 关键结论与启发

  • 最重要的Takeaway:针对特定语言(如阿拉伯语)的发音评估,基于开源组件进行本地化微调和构建可解释的评分流水线,能够超越通用的商业“一刀切”系统,并达到临床可用的一致性。
  • 启发与延伸方向
    1. 未来研究可以扩大临床验证的数据集规模,涵盖更多方言和病理语音。
    2. 可以探索数据驱动的方法来自动学习评分算法中的权重,而非手动设定。
    3. 该模块化框架为其他低资源语言的自动化言语治疗评估提供了可复制的蓝图。
#57
eess.AS
Meta (World Famous IT Company)KAIST - Korea Advanced Institute of Science & Technology (QS Top 100)

Spatial-Magnifier: Spatial upsampling for multichannel speech enhancement 跨领域

Dongheon Lee, Ashutosh Pandey, Sanjeel Parekh, Daniel Wong, Jacob Donley 等 (7 人)
Audio and Speech Processing (eess.AS)
Comments: Accepted to Interspeech 2026
查看摘要
While the spatial directivity of multichannel speech enhancement algorithms improves with the number of microphones, fitting large capture arrays into real-world edge devices is typically limited by physical constraints. To overcome this limitation, we propose Spatial-Magnifier, a neural network designed to generate virtual microphone (VM) signals from a limited set of real microphone (RM) measurements. Moreover, we introduce the Spatial Audio Representation Learning (SARL) framework, which leverages estimated VM signals and features to condition a downstream speech enhancement system. Experimental results demonstrate that the proposed framework outperforms existing spatial upsampling baselines across various speech extraction systems, including end-to-end multichannel speech enhancement and neural beamforming. The proposed method nearly recovers the oracle performance achieved when all microphones are available.

📖 深度解读

1. 一句话总结

这篇论文提出了一种名为Spatial-Magnifier的神经网络和SARL框架,通过从少量真实麦克风“脑补”出虚拟麦克风信号或特征,突破了AR眼镜等设备的物理尺寸限制,显著提升了多通道语音增强和波束成形的性能。

2. 研究背景与动机

  • 核心问题:多通道语音增强(MC-SE)依赖多个麦克风来获取空间指向性,但AR眼镜、耳机等边缘设备的物理尺寸太小,无法容纳大型麦克风阵列。
  • 重要性:解决这一问题可以让小型消费级电子设备拥有专业级阵列的音频捕捉与降噪能力,极大改善用户的语音交互体验。
  • 现有不足:以往的神经虚拟麦克风估计方法大多直接套用标准的语音增强网络架构,缺乏针对“空间上采样”的专用设计;此外,先前工作没有深入研究如何最优地将这些生成的虚拟麦克风信号用于下游任务(如波束成形或端到端增强),往往只是简单拼接。

3. 核心方法

  • 方法/框架:论文提出了Spatial-Magnifier(一种基于GAN的空间上采样生成网络)以及SARL(空间音频表征学习框架)。
  • 关键创新点
    1. Spatial-Magnifier架构:受图像超分辨率技术启发,包含一个Selection Module(选择模块,通过门控机制自适应提取通道特征)和DCA模块(动态通道分配,利用注意力机制高效压缩空间信息)。
    2. SARL框架:提出两种利用虚拟麦克风的方式——SARL-S(信号级,直接拼接生成的音频波形)和SARL-F(特征级,在隐空间将生成的特征与真实信号特征融合)。
    3. 解耦设计:将“空间表征学习”与“频谱增强”解耦,强制模型在生成虚拟麦克风的过程中学到鲁棒的空间先验,以此辅助下游任务。
  • 直觉性解释:就像用低分辨率相机拍出的照片通过AI“放大”出高清细节一样,Spatial-Magnifier利用少量真实麦克风的录音,“推算”出如果在其他位置放了麦克风会录到什么声音。然后,SARL框架不仅把这些“脑补”出来的声音信号直接喂给降噪系统,还可以只提取其中的空间特征来“指导”降噪系统,从而在不增加物理麦克风的情况下提升降噪效果。

4. 实验与结果

  • 数据集/基准:使用Interspeech 2020 DNS挑战赛数据集,通过Pyroomacoustics模拟房间混响。任务包括全向语音增强和视场语音增强。
  • 基线方法:MC Conv-TasNet (STL/MTL), SpatialNet-VME等。
  • 主要实验结果
  • 在2个真实麦克风+4个虚拟麦克风(2ch-RM/4ch-VM)设置下,SARL-S的波束成形(VM-BF)达到了8.37的SI-SDR,远超基线模型的4.89,且接近6个真实麦克风的Oracle性能(9.49)。
  • 在端到端语音增强(VM-SE)任务中,结合了Spatial-Magnifier的小型模型性能甚至超过了参数量和计算量大得多的大型模型(2.7M vs 6.5M参数),证明“增加虚拟空间信息”比“单纯增大模型”更有效。
  • 消融实验揭示
  • Selection Module和DCA模块对波束成形性能提升至关重要,且计算开销极小。
  • 即使不使用虚拟麦克风信号进行波束成形,仅用其特征进行SARL条件化,也能提升系统性能,证明了空间特征作为高级正则化器的有效性。

5. 优势与局限

  • 主要优势
    1. 高效突破物理限制:用极低的计算成本生成了高质量的空间信息,甚至让2个真实麦克风+1个虚拟麦克风的配置超越了3个真实物理麦克风的系统。
    2. 通用性与灵活性强:SARL框架兼容不同的后端(MCWF, MVDR)和不同的骨干网络,且适用于智能眼镜等复杂非规则阵列几何。
    3. 特征级融合(SARL-F)鲁棒:即使虚拟麦克风的原始波形重建面临挑战,特征级的融合依然能有效传递空间信息。
  • 局限性
    1. 几何形状绑定:论文指出Neural-VME本质上与训练时的阵列几何形状绑定,难以在任意未知位置生成虚拟麦克风信号。
    2. 复杂上采样仍有差距:在2ch-RM/4ch-VM等复杂场景下,整体性能仍落后于全物理麦克风(6ch-RM)的Oracle上限,说明复杂空间信息的完全恢复仍有提升空间。

6. 关键结论与启发

  • 最重要的Takeaway:当麦克风数量受限于设备尺寸时,利用神经网络生成虚拟麦克风信号/特征(空间上采样)比单纯增大语音增强模型的参数量更为有效。将空间表征学习与频谱增强解耦是一种极具潜力的高效范式。
  • 启发与延伸方向
  • 启发了后续研究可以更多地探索“特征级”的虚拟麦克风融合,而不必强求完美的音频波形重建。
  • 未来可研究方向包括:摆脱特定阵列几何限制的通用虚拟麦克风生成技术;将此方法扩展到更多空间音频任务(如3D音频重建、声源定位);以及探索该框架在真实环境录音(而非仅模拟数据)中的表现。
#58
eess.AS
Amazon (World Famous IT Company)

Adaptive Turn-Taking for Real-time Multi-Party Voice Agents 跨领域

Soumyajit Mitra, Prabhat Pandey, Abhinav Jain, Shanmukha Sahith, K V Vijay Girish
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Computation and Language (cs.CL)
Comments: Accepted for publication at Interspeech 2026
查看摘要
Turn-taking in multi-party spoken conversations remains a fundamental challenge for voice-based agents, particularly under dynamic floor competition and varying user expectations. We propose ModeratorLM, a role-playing voice agent that conditions turn-taking behavior on an explicitly assigned role in multi-party settings. The system is built on a speech large language model operating in chunk-wise streaming manner. We further introduce a reasoning-augmented variant that incorporates chain-of-thought reasoning over conversational context and the assigned role. We construct RolePlayConv, a large-scale synthetic dataset of spoken multi-party conversations with diverse assistant roles. Experiments on real-world meeting data and RolePlayConv show improved turn-taking precision by over 40% and recall by more than 70%, while substantially reducing false-positive interruptions compared to non-role-conditioned baselines.

📖 深度解读

1. 一句话总结

本文提出了ModeratorLM,一种基于语音大模型的多方对话智能体,通过引入“角色扮演”和“思维链推理”机制,让AI能根据自身被分配的身份(如主持人或旁听者)自适应地决定“何时发言”及“是否发言”,大幅提升了多方对话中轮次交接的准确性和自然度。

2. 研究背景与动机

  • 核心问题:多方语音对话中的轮次交接问题。在多人交谈时,AI智能体不仅要决定“何时说话”,更要判断“是否该插话”。
  • 重要性:随着全双工语音Agent的发展,AI需要参与更自然的多方交互(如会议、讨论)。不同场景下用户对AI的期望不同(有时需要被动倾听,有时需要主动引导),AI的发言时机需符合其身份设定。
  • 现有不足:现有的轮次交接研究多针对双人对话,依赖停顿、静音等声学线索,无法应对多方对话中的抢话、重叠语音等动态竞争;此外,现有的角色扮演语言Agent多局限于文本模态,缺乏对语音多方交互中“角色条件控制”的研究。

3. 核心方法

  • 方法/模型:论文提出了 ModeratorLM 及其推理增强版 ModeratorLM-Think,基于流式语音大模型(Qwen3-4B)构建。同时构建了专门的数据集 RolePlayConv
  • 关键创新点
    1. 角色条件化的轮次交接:首次将显式角色分配(如“自信的CEO”)作为条件,同时控制语音Agent的发言时机和回复内容。
    2. 思维链推理增强:在决定是否发言前,模型先生成内部推理过程(分析上下文与自身角色义务),再做出发言决策,使行为“有理有据”。
    3. 纯LLM驱动的流式决策:摒弃了传统的独立VAD(语音活动检测)模块,将分块流式语音特征和带说话人标注的文本直接喂给LLM,由LLM本身输出“发言+回复”或“不发言”的控制 token。
  • 直觉性解释:想象你在一个会议中,如果你是旁听生,你会选择安静;如果你是主持人,你会在冷场时主动接话。ModeratorLM就是给语音大模型赋予了这种“察言观色+认清身份”的能力。它一边听音频流,一边看文字记录,结合自己被分配的“人设”来决定这一刻是该闭嘴还是该开口。Think版本则是在开口前先在“脑子里”过一遍逻辑(比如“他们刚说完,现在气氛合适,我作为主持人该总结一下了”),然后再发声。

4. 实验与结果

  • 数据集:真实会议数据集 NOTSOFAR-1 (NSF-1) 和自建的合成多方对话数据集 RolePlayConv。
  • 基线方法:Moshi(双人对话语音模型)和 MP-Baseline(在RolePlayConv上训练但不带角色控制的模型)。
  • 主要实验结果
  • 在 NSF-1 数据集上,ModeratorLM-Think 相比 MP-Baseline,轮次交接的精确率提升了约40%(0.58→0.81),召回率提升了超70%(0.33→0.74)
  • 误报打断率极低(0.01),同时显著降低了被直接点名时的漏答率。
  • LLM-as-a-Judge 评估显示,Think版本在发言时机的角色契合度和回复内容的角色保真度上均得分最高。
  • 消融实验揭示
    1. 分块策略:如果不使用动态分块训练,模型会“作弊”依赖分块长度来判断该不该说话;而引入思维链的 Think 模型因有内部推理,对分块策略的鲁棒性更强。
    2. 文本依赖:模型高度依赖文本转录,无文本时性能大幅下降;但使用带噪的ASR实时识别结果,性能下降微乎其微,证明其对真实识别错误具有鲁棒性。

5. 优势与局限

  • 主要优势
    1. 将角色扮演引入语音多方对话,解决了“是否该插话”这一更高维度的决策问题,而非仅仅判断“何时插话”。
    2. 思维链机制的引入不仅提升了指标,还让模型的决策过程具有可解释性,且对底层音频分块策略的敏感度降低。
  • 局限性
    1. 非端到端语音输出:当前模型主要输出文本决策和回复,需外接TTS模块才能发声,并非原生的语音到语音生成。
    2. 数据与评估的生态局限:RolePlayConv是纯合成数据,虽缓解了数据短缺,但与真实人类多方交互仍有差距;真实评估集NSF-1本身缺乏角色标签,需通过LLM+人工后处理指派,可能引入偏差。
    3. 非全双工:目前模型仍是交替式的(听的时候不说话),无法处理同时听和说(如边听边发出背景音“嗯嗯”)的全双工场景。

6. 关键结论与启发

  • 最重要的Takeaway:在多方语音对话中,赋予智能体明确的“角色”并结合“思维链”推理,能有效对齐其轮次交接行为,大幅减少无意义的打断和漏接。角色设定不仅是控制“说什么”的风格开关,更是控制“何时说”的策略开关。
  • 启发与延伸方向
    1. 未来的语音Agent设计应将“身份认知”作为对话管理的核心组件,而非仅依赖声学特征。
    2. 后续研究可探索原生支持全双工的多方语音Agent,实现边听边说的更自然交互。
    3. 可探索将ASR、LLM决策、TTS完全融合的端到端流式架构,消除对中间文本转录的强依赖。
🔥 推荐必读
🏷️ 领域语音大模型与对话 (Speech LLM / SDM) > 端到端语音对话
💡 创新多方语音对话轮次交接——基于流式语音大模型,引入角色扮演和思维链推理机制自适应决定发言时机
⭐ 评分8.0
#59
eess.AS
University of Sheffield (QS Top 100)

From Signals to Patterns: Non-Invasive Tuberculosis Detection from Cough Audio using Bandit Weighted Hyperbolic Prototypes 跨领域

Mohd Mujtaba Akhtar, Girish, Sanjam Wadhwa, Muskaan Singh, Ning Ma
Audio and Speech Processing (eess.AS)
Comments: Accepted to INTERSPEECH 2026
查看摘要
In this study, we focus on cough-based tuberculosis screening (CBTS) and hypothesize that fusing speech/audio foundation representations with spectral descriptors will yield stronger screening performance. We expect this fusion to reveal complementary strengths: spectral features preserve fine-grained short-time acoustic detail in cough signals, while foundation embeddings capture higher-level temporal and event-level patterns learned from large-scale pretraining. To this end, we propose COBALT, a novel fusion framework based on codebook-aligned hyperbolic prototypes and bandit-style reliability weighting to integrate heterogeneous representations effectively. Using the CODA TB DREAM Challenge benchmark, COBALT consistently outperforms individual representations and a concatenation baseline, achieving the best overall performance when fusing MFCC with PaSST thereby establishing a new state-of-the-art on the benchmark.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种名为COBALT的融合框架,通过双曲原型码本和老虎机加权机制,将预训练音频大模型特征与传统手工频谱特征有效结合,显著提升了基于咳嗽声音的无创结核病检测性能。

2. 研究背景与动机

  • 核心问题:如何利用咳嗽音频实现快速、低成本、无创的结核病(TB)筛查。
  • 重要性:结核病是重大传染病,传统的痰液检测操作困难且难以大规模推广,咳嗽音频筛查有望成为高效的初步分诊手段。
  • 现有不足:现有方法多依赖单一特征流(要么用预训练大模型,要么用手工频谱特征),缺乏对两者互补性的系统性融合。此外,真实环境中的设备差异、背景噪声等伪影容易干扰模型,现有方法缺乏对不可靠特征进行降权的机制。

3. 核心方法

  • 提出框架:COBALT(码本对齐的强盗加权双曲原型融合框架)。
  • 关键创新点
    1. 异构特征双曲对齐:首次将预训练模型特征与手工频谱特征映射到双曲空间,并通过共享原型码本进行对齐,强制两种不同维度的特征在统一的空间中“对话”。
    2. 老虎机可靠性加权:引入多臂老虎机机制,动态评估每个特征原型的可靠性并赋予不同权重,抑制受噪声干扰或无信息的特征。
    3. 原则性融合策略:不仅拼接加权后的特征,还加入了两路特征的“一致性(点乘)”信息,增强融合表示的鲁棒性。
  • 直觉性解释:想象两个语言不通的医生(预训练模型和手工特征)在会诊。首先,把他们的诊断意见翻译成同一种“医学暗语”(双曲原型码本对齐)。然后,由于有些暗语可能因为设备噪音而不准,系统像一个“老练的赌徒”一样,根据历史反馈(老虎机机制)动态押注在那些最可靠、最准的暗语上(可靠性加权),最后综合得出诊断结果。

4. 实验与结果

  • 数据集:CODA TB DREAM Challenge基准数据集(覆盖7个国家受试者的咳嗽音频)。
  • 基线方法:单一特征(PaSST, Whisper, WavLM, x-vector, MFCC, LFCC)+ FCN/CNN分类器;简单特征拼接;莫比乌斯加法融合(Möbius addition,消融对照);欧几里得变体(COBALT-E,几何对照)。
  • 主要实验结果
  • 单一特征中,PaSST(音频Transformer)表现最好,MFCC在手工特征中最具竞争力。
  • 完整的COBALT框架结合MFCC与PaSST取得了最佳性能,准确率达到88.93%,F1分数87.26%,AUC达到89.07%,全面超越单一特征和简单拼接。
  • 消融实验揭示
  • 简单拼接特征不如结构化融合(COBALT-E),证明学习融合函数的必要性。
  • 仅使用双曲几何(莫比乌斯加法)虽比拼接好,但不如完整的COBALT,证明了共享码本对齐和老虎机加权机制对性能提升的关键贡献。

5. 优势与局限

  • 主要优势
    1. 充分利用了不同层级特征的互补性:手工特征捕捉细粒度短时声学细节,预训练模型捕捉宏观时间与事件级模式。
    2. 融合机制具有强归纳偏置,双曲空间更适合处理特征的层次结构,老虎机机制提升了面对噪声的鲁棒性。
    3. 框架即插即用,参数量增加极少(仅3M-6M可训练参数),计算高效。
  • 局限性
    1. 模型复杂度与解释性存在矛盾:虽然老虎机机制声称能降权不可靠特征,但双曲空间映射和码本量化使得整体模型仍像一个“黑盒”,难以直接临床解释。
    2. 依赖冻结的预训练模型:未针对咳嗽这一非语言音频对大模型进行特定微调,可能未完全激发预训练模型的潜力。
    3. 跨设备/环境泛化验证不足:尽管在7国数据上测试,但论文未深入展示模型在极端跨设备(如手机 vs 麦克风)场景下的单独鲁棒性测试。

6. 关键结论与启发

  • 核心Takeaway:在医疗音频分析中,预训练大模型与传统手工特征具有高度互补性;通过几何对齐(双曲空间)和动态可靠性评估(老虎机算法)进行原则性融合,远优于简单的特征堆叠。
  • 启发与延伸方向
    1. 机制迁移:COBALT的双曲原型+老虎机加权机制是一个通用的异构特征融合范式,可直接迁移至心肺音分类、语音情感识别等多模态/多特征任务。
    2. 专用预训练:未来可探索针对咳嗽、呼吸音等非语言音频的专用基础模型,以替代目前借用的语音或音频分类模型。
    3. 伪影解耦:后续研究可进一步探索如何将老虎机机制学到的权重与具体的物理意义(如特定频段的设备噪声)挂钩,提升模型在临床部署中的可解释性。
#60
eess.AS

Time-Unconditional Generative Speech Enhancement via Autonomous Rectified Flow 跨领域

Wen Zhang, Wenbin Jiang, Yang Zhang, Xiaofei Zhou
Audio and Speech Processing (eess.AS)
查看摘要
Most generative speech enhancement methods rely on explicit time-step embeddings for temporal conditioning. In this paper, we propose the Autonomous Rectified Flow framework, which challenges the necessity of such conditioning. Using a linear interpolation path, we show that the target vector field is inherently time-invariant. We further introduce a time-unconditional network that eliminates explicit time-step information and infers the denoising direction solely from the spatial relationship between the current state and the noisy observation. Predicting this target vector field is equivalent to modeling the noise distribution. By avoiding overfitting to temporal trajectories, the proposed autonomous design significantly improves generation quality, robustness, and inference efficiency.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文提出了一种名为ARF(自主整流流)的语音增强框架,通过数学证明并移除了生成模型中默认必需的“时间步”条件,让模型仅依靠当前状态和带噪语音就能推断去噪方向,从而在大幅提升推理速度的同时保持了高质量的语音恢复。

2. 研究背景与动机

  • 核心问题:如何提高生成式语音增强模型的推理效率与鲁棒性,同时避免模型对预设的时间轨迹产生过拟合。
  • 重要性:语音增强是语音处理的基础任务。近年来,基于扩散模型和流匹配的生成式方法在语音质量上取得了突破,但其迭代采样过程计算成本极高,难以在实际场景中高效部署。
  • 现有不足:现有的生成式SE方法(如FlowSE、BBED)虽然通过直线轨迹(最优传输)减少了采样步数,但依然依赖显式的“时间步嵌入”来调制网络。这种时间条件不仅增加了计算开销,还导致模型容易对特定的时间轨迹“过拟合”——在推理时,哪怕数值求解器产生微小的偏差,导致当前状态偏离了预期的时间点,模型就会“不知所措”,丧失纠错和恢复能力。

3. 核心方法

  • 方法名称:Autonomous Rectified Flow (ARF) / 自主整流流框架。
  • 关键创新点
    1. 揭示目标向量场的时间不变性:在连接纯净语音和带噪语音的线性插值路径上,目标速度向量仅取决于噪声本身,与时间步 $t$ 无关。
    2. 完全移除时间步条件:构建了一个无时间步输入的网络,模型不再预测特定时间点的去噪方向,而是直接估计底层的噪声分布。
    3. 自主ODE求解器:将生成过程建模为不显式包含时间变量的自主常微分方程,采用固定步长的多步Euler法进行求解。
  • 直觉性解释:想象你要从“带噪语音”所在的山峰走到“纯净语音”所在的山谷。传统方法不仅告诉你当前位置,还给你一块手表(时间步),要求你严格按照手表的指示走特定的路线。但这块手表容易坏(数值偏差),一旦走偏就回不到正轨。本文作者发现,因为两点之间走的是直线,你其实根本不需要手表,只要看着路标(当前状态和带噪语音的相对位置),一直朝着正确的方向走就行。预测这个方向,本质上就是在预测噪声长什么样。

4. 实验与结果

  • 数据集:VoiceBank+DEMAND(主实验),INTERSPEECH 2020 DNS Challenge(跨域泛化测试)。
  • 基线方法:BBED, FlowSE, MeanFlowSE。
  • 主要实验结果
  • 在 VoiceBank+DEMAND 上,5步推理(NFE=5)时,ARFSE取得了3.11的PESQ分数,优于FlowSE的3.05。
  • 在极端的单步推理(NFE=1)下,ARFSE优势更加明显,PESQ达到3.00(FlowSE为2.86,BBED仅为2.43),且实时因子(RTF)降至极低的0.02。
  • 消融实验揭示:在统一参数量下对比“有时间步”和“无时间步”的模型,移除时间步嵌入不仅提升了PESQ等客观指标,还因为去除了相关网络模块,显著降低了推理延迟(RTF从0.05降至0.02),证实了时间条件在直线轨迹SE中确实是冗余且有害的。

5. 优势与局限

  • 主要优势
    1. 极高的推理效率:单步推理即可获得极具竞争力的性能,RTF低至0.02,非常适合实时处理。
    2. 鲁棒性增强:摆脱了时间步束缚,避免了轨迹过拟合,模型对数值求解过程中的误差容忍度更高。
    3. 理论优雅:将去噪过程简化为对静态噪声分布的拟合,数学推导自洽且简洁。
  • 局限性
    1. 泛化能力仍有提升空间:在DNS Challenge的跨域测试中(尤其是带混响场景),ARFSE虽然与基线FlowSE表现相当,但绝对指标下降明显,说明在未见过的复杂声学环境下仍显吃力。
    2. 任务场景单一:目前仅在特定数据集上进行了验证,论文也承认其在“通用语音增强”任务中的效果尚需进一步探索。

6. 关键结论与启发

  • 核心Takeaway:在基于线性路径的生成式语音增强中,显式的时间步条件不仅多余,反而会损害模型的性能和效率。直接让模型学习从带噪状态到噪声分布的映射,是更优的选择。
  • 启发与延伸方向
  • 这一发现不仅限于语音增强,可能对图像生成、音频生成等其他使用Rectified Flow或Flow Matching的生成领域同样具有启发意义——即重新审视“时间步条件”在直线路径生成模型中的必要性。
  • 未来的研究可以探索将这种“自主ODE”思想与更强大的网络架构(如Transformer或最新的扩散模型骨干)结合,以解决当前模型在复杂混响等未见环境下的泛化瓶颈。
👀 推荐值得看
🏷️ 领域语音增强与分离 > 语音增强
💡 创新无时间步条件的生成式语音增强——基于整流流模型,通过证明目标向量场的时间不变性,移除了时间步条件并直接估计噪声分布
⭐ 评分7.5
#61
eess.AScs.SD
University of Edinburgh (QS Top 100)

Explanations for Automatic Speech Recognition 跨领域

Xiaoliang Wu, Peter Bell, Ajitha Rajan
Sound (cs.SD); Artificial Intelligence (cs.AI); Computation and Language (cs.CL); Machine Learning (cs.LG); Audio and Speech Processing (eess.AS)
Comments: Accepted by Speech Track, ICASSP 2023
查看摘要
We address quality assessment for neural network based ASR by providing explanations that help increase our understanding of the system and ultimately help build trust in the system. Compared to simple classification labels, explaining transcriptions is more challenging as judging their correctness is not straightforward and transcriptions as a variable-length sequence is not handled by existing interpretable machine learning models. We provide an explanation for an ASR transcription as a subset of audio frames that is both a minimal and sufficient cause of the transcription. To do this, we adapt existing explainable AI (XAI) techniques from image classification-Statistical Fault Localisation(SFL) and Causal. Additionally, we use an adapted version of Local Interpretable Model-Agnostic Explanations (LIME) for ASR as a baseline in our experiments. We evaluate the quality of the explanations generated by the proposed techniques over three different ASR ,Google API, the baseline model of Sphinx, Deepspeech and 100 audio samples from the Commonvoice dataset.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一个名为X-ASR的框架,通过将图像分类领域的可解释AI技术(SFL和Causal)适配到语音识别任务中,为ASR的转录结果找出最小且充分的“关键音频帧”作为解释,从而帮助评估和增强对黑盒语音识别系统的信任。

2. 研究背景与动机

  • 核心问题:基于神经网络的自动语音识别(ASR)系统通常是黑盒模型,难以进行质量评估和错误追责。本文旨在为ASR的转录文本提供解释,以增加系统的可理解性和可信度。
  • 重要性:ASR已广泛应用于日常生活,其准确性和可靠性至关重要。通过模型解释来定位导致识别错误的关键音频片段,有助于开发者修复故障并促进问责。
  • 现有不足
    1. 主流可解释AI(XAI)技术多针对图像或文本的固定标签分类任务,无法处理ASR这种变长序列输出
    2. 判断ASR转录文本的“正确性”不像分类标签那样非黑即白,允许存在语义上的微小偏差(如"I'd like an apple" vs "I like apple")。
    3. 现有的语音白盒解释方法通常针对特定网络架构,难以泛化到商业闭源API等黑盒系统,且不直接解释转录文本。

3. 核心方法

  • 方法/框架:X-ASR框架分为两步:第一步,通过相似度指标将变长的转录文本二分类(正确/错误);第二步,将基于扰动的图像解释技术适配到音频帧上,寻找导致该分类结果的关键音频帧子集。
  • 关键创新点
    1. 转录文本分类机制:引入WER(词错误率,零容忍)和BERT语义相似度(容忍轻微差异)结合阈值,将变长转录文本转化为可用于扰动分析的二分类标签。
    2. 跨模态XAI适配:首次将图像领域的因果解释技术(SFL和Causal)迁移至音频域。利用了音频帧与图像像素在“独立无意义,组合才有义”上的相似性。
    3. 构建最小且充分的解释:不仅给出帧的重要性排序,还采用贪心策略逐步添加帧,直到解释子集能让ASR输出与原转录一致的文本为止。
  • 直觉性解释
    想象你要向别人证明一段录音里哪几个片段是让机器听懂的关键。X-ASR的做法是:先把录音切成很多小片段(音频帧),然后随机“静音”一部分片段送给ASR。如果静音某段后机器听错了,说明这段很重要。SFL和Causal就是用这种“遮遮掩掩”的测试方法,统计并找出最少需要保留哪几个片段,机器就能依然听对。这就构成了机器做出该转录结果的“最小且充分的原因”。

4. 实验与结果

  • 数据集与ASR系统:使用Commonvoice数据集的100个音频样本,测试了三个ASR系统:Google API、Sphinx和Deepspeech。
  • 基线方法:适配后的LIME。
  • 主要实验结果
    1. 解释大小(越小越好):在使用BERT相似度时,SFL和Causal生成的解释明显比LIME更小(即更精准定位关键帧)。Causal由于因果条件更严格,生成的解释比SFL更小。
    2. 相似度指标的影响:WER生成的解释比BERT更大。因为WER要求字字对应(零容忍),导致更多扰动被视为“改变了输出”,从而需要保留更多帧才能满足条件。
    3. 一致性(跨ASR系统的重叠率):SFL在BERT指标下一致性最高;Causal在WER下一致性最高(但这是因为其解释包含了92%的输入帧,过大导致)。
  • 消融/分析实验揭示:解释的“大小”和“一致性”是一对矛盾指标。分析表明,SFL结合BERT相似度取得了最佳的折中效果(平均56%的大小和74%的一致性)。

5. 优势与局限

  • 主要优势
    1. 模型无关性:作为后置扰动方法,无需了解ASR内部结构,可直接应用于Google API等黑盒系统。
    2. 跨模态迁移成功:巧妙绕开了变长序列难以解释的痛点,通过相似度阈值转化,成功复用了图像领域的成熟XAI技术。
    3. 解释更精简:基于因果的SFL和Causal能比LIME提供更小的关键帧集合,更符合人类直觉中“抓重点”的解释方式。
  • 局限性
    1. 计算成本高:需要生成大量突变体(mutants)并反复调用ASR系统,对于长音频或实时应用场景效率太低。
    2. 评估指标较单一:仅用“大小”和“跨系统一致性”评估解释质量,缺乏人类主观评测(这些帧真的是人类听音辨意的重点吗?)或对下游任务(如纠错)的实际帮助验证。
    3. 依赖相似度阈值:解释结果高度依赖WER或BERT的阈值设定,不同的阈值可能导致完全不同的关键帧集合。

6. 关键结论与启发

  • 最重要的Takeaway:通过将变长转录文本转化为基于语义相似度的二分类问题,图像分类中的因果解释方法可以有效且精简地应用于黑盒ASR系统,且基于因果的方法(SFL/Causal)优于基于线性近似的LIME。
  • 对后续研究的启发
    1. 未来可探索白盒ASR解释技术,结合模型内部注意力机制,可能比纯黑盒扰动效率更高。
    2. 可以将这种解释方法应用于ASR的错误诊断与修复,例如根据定位到的关键帧反推是哪种语音特征(噪音、口音、连读)导致了识别失败。
    3. 启发了其他变长序列生成任务(如机器翻译、文本摘要)的可解释性研究,即通过输出空间的相似度映射来实现扰动分析。
#62
eess.AScs.SD

Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking 跨领域

Katia Vendrame, Bolaji Yusuf, Santosh Kesiraju, Šimon Sedláček, Oldřich Plchot 等 (6 人)
Computation and Language (cs.CL); Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: accepted for Interspeech 2026
查看摘要
End-to-end spoken dialogue state tracking (DST) is made difficult by the tandem of having to handle speech input and data scarcity. Combining speech foundation encoders and large language models has been proposed in recent work as to alleviate some of this difficulty. Although this approach has been shown to result in strong spoken DST models, achieving state-of-the-art performance in realistic multi-turn DST, it struggles to generalize across domains and requires annotated spoken DST training data for each domain of interest. However, collecting such data for every target domain is both costly and difficult. Noting that textual DST data is more easily obtained for various domains, in this work, we propose jointly training on available spoken DST data and written textual data from other domains as a way to achieve cross-domain generalization. We conduct experiments which show the efficacy of our proposed method for getting good cross-domain DST performance without relying on spoken training data from the target domains.

📖 深度解读

1. 一句话总结

这篇论文提出了一种联合语音与文本训练的方法,通过在基于大语言模型(LLM)的语音对话状态跟踪(DST)系统中引入文本编码器,利用易获取的跨领域纯文本数据,解决了语音DST模型在缺乏目标领域语音数据时的跨领域泛化难题。

2. 研究背景与动机

  • 核心问题:如何让端到端的语音对话状态跟踪(DST)模型在缺乏目标领域语音训练数据的情况下,依然能在该领域表现良好。
  • 重要性:语音是最自然的人机交互方式,而DST是任务型对话系统的核心组件。然而,为每个新领域收集和标注真实的语音对话数据成本极高且耗时。
  • 现有不足:现有的级联系统(ASR+文本DST)存在错误传播和丢失副语言信息的问题;而最新的端到端方法(如将语音编码器与LLM结合)虽然性能强,但严重依赖特定领域的语音数据,难以泛化到未见过的领域(如地名、餐厅名等槽位容易出错)。如果使用TTS(文本转语音)系统合成数据来弥补,又会增加系统复杂度,且在低资源语言中往往缺乏高质量的TTS系统。

3. 核心方法

  • 提出方法:Joint Speech and Text E2E DST(联合语音与文本端到端对话状态跟踪框架)。
  • 关键创新点
    1. 双模态输入与参数共享:在原有的“语音编码器-连接器-LLM”架构上,增加了一个文本编码器。文本和语音分别通过各自的编码器后,共享同一个连接器和LLM中的LoRA层进行特征融合与预测。
    2. 多任务联合损失:在训练时,每个步骤同时输入语音批次和文本批次,计算三种损失:语音DST损失、未配对文本DST损失,以及基于语音转录文本的DST损失。
    3. 零额外推理成本:文本编码器仅在训练阶段使用以提供跨领域知识,推理阶段直接使用语音 pipeline,因此不增加任何推理延迟。
  • 直觉性解释:这就像教一个只懂“方言A”的学生去考“方言B”的听力测试。直接让他听方言B的录音(语音数据)很难且贵,但我们可以给他看方言B的文字版教材(未配对文本数据)。训练时,让他一边听方言A的录音,一边看方言B的文字,并共用一套“理解逻辑”(共享连接器和LLM)。等他融会贯通后,考试时哪怕只听方言B的录音,他也能靠之前学过的文字知识答对题,不需要一直看着文字教材。

4. 实验与结果

  • 数据集:SpokenWOZ (SW) 和 Speech-Aware MultiWOZ (MW) 作为语音数据集,DialogStudio (DS) 作为额外文本数据源。
  • 基线方法:无文本训练的基线模型、使用TTS合成语音训练的方法、以及商业大模型 Gemini-2.5-flash 的零样本提示。
  • 主要实验结果
  • 跨领域提升显著:用SW语音+MW文本训练,相比纯SW语音基线,在MW验证集上缩小了28.9%的性能差距;反之,用MW语音+SW文本训练,在SW上缩小了高达64.7%的差距。
  • 媲美TTS方案:联合文本训练的效果与使用TTS合成语音训练的效果相当,但避免了TTS系统的复杂性,对低资源语言更友好。
  • 大模型受益更多:在更大的模型(如Gemma-3-12B-it)上,联合训练带来的相对提升更明显,甚至能完全消除跨域带来的性能下降。
  • 消融实验揭示:如果去掉文本编码器,仅用文本微调LLM的LoRA层,效果会变差。这证明文本编码器不仅让LLM“看懂”了目标领域的文本格式,还实质性地提升了语音管道提取结构化信息的能力。

5. 优势与局限

  • 主要优势
    1. 低成本跨域泛化:巧妙利用了易获取的纯文本DST数据,免去了收集目标领域真实语音或构建高质量TTS的麻烦。
    2. 推理无损:训练时多模态,推理时纯语音,不增加线上开销。
    3. 兼容性强:方法在不同规模、不同家族的LLM上均表现出稳定的提升趋势。
  • 局限性
    1. 受限于文本与测试集的匹配度:如MultiWOZ训练集和测试集来自不同城市,文本训练能提升槽位键的识别,但对具体槽位值(如地名)的提升有限。
    2. 上限受限:尽管缩小了差距,但跨域性能仍不及直接拥有目标领域真实语音数据的上限(Oracle模型)。

6. 关键结论与启发

  • 核心Takeaway:通过共享参数的联合训练,文本数据可以有效“反哺”语音模型,让模型学会如何从语音中提取它只在文本中见过的领域知识。
  • 启发与延伸方向:这篇工作打通了语音DST和文本DST的数据壁垒。未来可以将文本DST中成熟的增强策略(如改写、槽位增强)直接应用于文本侧,进而间接提升语音DST的鲁棒性;此外,这种方法对于缺乏语音资源的方言或小语种任务型对话系统建设具有极大的应用潜力。
#63
eess.AScs.SD

Reciprocal Latent Fields for Precomputed Sound Propagation 跨领域

Hugo Seuté, Pranai Vasudev, Etienne Richan, Louis-Xavier Buffoni
Sound (cs.SD); Machine Learning (cs.LG); Audio and Speech Processing (eess.AS)
查看摘要
Realistic sound propagation is essential for immersion in a virtual scene, yet physically accurate wave-based simulations remain computationally prohibitive for real-time applications. Wave coding methods address this limitation by precomputing and compressing impulse responses of a given scene into a set of scalar acoustic parameters, which can reach unmanageable sizes in large environments with many source-receiver pairs. We introduce Reciprocal Latent Fields (RLF), a memory-efficient framework for encoding and predicting these acoustic parameters. The RLF framework employs a volumetric grid of trainable latent embeddings decoded with a symmetric function, ensuring acoustic reciprocity. We study a variety of decoders and show that leveraging Riemannian metric learning leads to a better reproduction of acoustic phenomena in complex scenes. Experimental validation demonstrates that RLF maintains replication quality while reducing the memory footprint by several orders of magnitude. Furthermore, a MUSHRA-like subjective listening test indicates that sound rendered via RLF is perceptually indistinguishable from ground-truth simulations.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文提出了一种名为“互易潜在场”的神经网络框架,通过将声学参数编码为低维潜在空间中的黎曼度量,在保证声学互易性的前提下,将虚拟环境中预计算声音传播的内存占用降低了数个数量级,且听感上与真实物理模拟难以区分。

2. 研究背景与动机

  • 核心问题:在电子游戏等实时虚拟环境中,如何高效且逼真地模拟声音传播(如衍射、混响)。
  • 重要性:真实的音频是沉浸感和3D空间感知的关键驱动因素,但物理上准确的波动方程求解计算量极大,无法满足实时渲染的需求。
  • 现有不足
  • 光线追踪:CPU开销大,难以处理衍射,复杂几何下易产生音频丢失。
  • 房间与门户系统:需要大量人工标记,在室外或混合环境中效果差。
  • 波编码:虽然通过预计算提取声学参数实现了实时渲染,但其内存占用随声源和接收器数量的乘积增长,在大型地图或内存受限设备上不可行。

3. 核心方法

  • 提出方法:Reciprocal Latent Fields (RLF),一种基于潜在空间嵌入和对称度量解码器的轻量级框架。
  • 关键创新点
    1. 互易性内建保证:将3D空间映射为n维潜在向量网格,通过对称函数(度量距离)计算声源与接收者之间的参数,从数学结构上天然保证了声学互易性(即A听到B的声音=B听到A的声音)。
    2. 黎曼度量解码器:引入局部黎曼度量张量来“扭曲”潜在空间,解决了欧氏距离在复杂障碍物附近过度约束的问题,大幅提升了路径距离和声压级的重建精度。
    3. 非度量参数的轻量级扩展:针对衰减时间等非度量参数,设计了点积对称解码器;对于方向到达(DOA,非互易参数),则通过计算已学习的路径距离场的梯度来推导。
  • 直觉性解释:想象把3D游戏地图折叠成一块多维的“弹性织物”(潜在流形)。地图上每个点都在织物上有个对应的“锚点”。声音从A传到B的距离,就相当于在织物上量A和B两个锚点的距离。如果中间有墙,这块织物就会局部拉伸或扭曲(黎曼度量),使得两点间的“织物距离”刚好等于声音绕过墙的真实路径距离。因为量距离是从A到B还是从B到A都一样,这就天然满足了声学互易性。

4. 实验与结果

  • 数据集/基准:使用了两个地图:Audio Gym(包含迷宫、耦合房间等复杂声学特征)和 Wwise Audio Lab (WAL,典型游戏地图)。
  • 基线方法:传统波编码(作为Ground Truth)、自由空间传播(Low Anchor),以及不同解码器架构的对比(欧氏RLF、黎曼RLF $G_{PSD}$/$G_{DIAG}$、MLP)。
  • 主要实验结果
  • 内存压缩:在WAL地图上,传统波编码需 182 GB,而RLF仅需 14 MB,降低了数个数量级。
  • 精度与性能:黎曼 RLF ($G_{PSD}$) 误差最低;对角黎曼 RLF ($G_{DIAG}$) 在精度和计算成本间取得了最佳平衡。MLP在预测路径距离梯度(用于DOA)时表现不佳,产生噪声。
  • 主观听感测试:28位专业音频人士参与的MUSHRA-like测试显示,RLF与真实模拟(GT)在统计上无显著差异(p=0.41),两者均远超低质量锚点。
  • 消融实验:研究了潜在空间维度的影响。增加维度通常能降低误差,黎曼RLF在较大维度下优势明显且不易饱和;MLP虽在小维度下表现尚可,但无法提供平滑的梯度。

5. 优势与局限

  • 主要优势
    1. 极致的内存效率:在保持高保真度的同时,彻底解决了波编码方法在大型场景中的内存爆炸问题。
    2. 物理特性内建:无需额外约束即可保证声学互易性,且基于网格的表示保留了衍射所需的锐利不连续性。
    3. 感知无损:主观测试证明其渲染效果在人类听感上与真实物理模拟难以区分。
  • 局限性
    1. 仅限静态几何:潜在场需要针对特定地图预训练,无法支持动态破坏或移动的场景物体。
    2. 未实现空间压缩:论文仅对比了未压缩的内存占用,实际工程中波编码通常会使用压缩算法,直接的内存对比可能不够全面。
    3. 部分参数重建受限:早期反射衰减时间受限于模拟数据本身的噪声,重建难度较大。

6. 关键结论与启发

  • 核心Takeaway:通过将声学参数建模为潜在流形上的黎曼度量,可以在不牺牲感知质量的前提下,用极低的内存开销实现复杂场景的预计算声音传播。
  • 启发与延伸方向
    1. 动态环境扩展:未来可探索让潜在表示在运行时适应场景变化,这是迈向完全动态声学环境的关键。
    2. 跨领域应用:RLF框架不仅限于声音,任何受几何影响且具有互易性的标量场(如寻路距离查询、视线遮挡计算)都可以借鉴该框架进行高效压缩和查询。
#64
eess.AScs.SD

ZeSTA: Zero-Shot TTS Augmentation with Domain-Conditioned Training for Data-Efficient Personalized Speech Synthesis 跨领域

Youngwon Choi, Jinwoo Oh, Hwayeon Kim, Hyeonyu Kim
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: 6 pages, accepted to INTERSPEECH 2026
查看摘要
We investigate the use of zero-shot text-to-speech (ZS-TTS) as a data augmentation source for low-resource personalized speech synthesis. While synthetic augmentation can provide linguistically rich and phonetically diverse speech, naively mixing large amounts of synthetic speech with limited real recordings often leads to speaker similarity degradation during fine-tuning. To address this issue, we propose ZeSTA, a simple domain-conditioned training framework that distinguishes real and synthetic speech via a lightweight domain embedding, combined with real-data oversampling to stabilize adaptation under extremely limited target data, without modifying the base architecture. Experiments on LibriTTS and an in-house dataset with two ZS-TTS sources demonstrate that our approach improves speaker similarity over naive synthetic augmentation while preserving intelligibility and perceptual quality. Audio samples are available on our web page.

📖 深度解读

以下是对论文《ZeSTA: Zero-Shot TTS Augmentation with Domain-Conditioned Training for Data-Efficient Personalized Speech Synthesis》的结构化中文解读报告:

1. 一句话总结

本文提出了ZeSTA框架,通过引入轻量级域条件化训练和真实数据过采样技术,解决了在低资源个性化语音合成中直接混入零样本合成数据导致的“音色漂移”问题,实现了可懂度与说话人相似度的双赢。

2. 研究背景与动机

  • 核心问题:在极低资源场景下(目标说话人录音极少),如何有效地利用零样本TTS(ZS-TTS)生成的合成语音来增强并微调一个轻量级的个性化TTS模型。
  • 重要性:个性化TTS需求日益增长,但高质量微调依赖大量数据;而大模型ZS-TTS虽能零样本生成,却因计算成本高难以实际部署。利用ZS-TTS做数据增强来训练轻量级模型是落地的关键路径。
  • 现有不足:简单粗暴地将大量ZS-TTS合成语音与少量真实录音混合微调,虽然能提升语音的可懂度(降低字错率/词错率),但会导致严重的“音色漂移”——模型被合成语音的音色带偏,目标说话人的相似度大幅下降。

3. 核心方法

  • 方法/框架:ZeSTA(Zero-Shot TTS Augmentation),一种即插即用的域条件化训练框架。
  • 关键创新点
    1. 域条件化训练:为每条训练数据引入一个轻量级的域嵌入,标记其是“真实”还是“合成”。
    2. 真实数据过采样:在训练时将稀缺的真实目标说话人数据重复采样(如3次),增加真实数据的权重。
    3. 推理解耦:在推理(生成)阶段,直接将域标签强制设为“真实”,让模型输出贴近真实录音的音色。
  • 直觉性解释:就像一个学徒(TTS模型)在学习配音。如果给他听10句真人录音和90句机器模仿的录音,他容易被机器的腔调带跑偏。ZeSTA的做法是:告诉学徒“这句是机器模仿的,那句是真人的”(域条件化),让他主要从机器录音里学发音规则和文本内容,但音色特征要对齐真人标签;同时,把那10句真人录音多放几遍给他听(过采样),加深他对真人音色的记忆。最后考核(推理)时,强制要求他按“真人”模式来配音。

4. 实验与结果

  • 数据集:LibriTTS(开源英文)和 YoBind(内部语音助手数据集)。设定低资源场景为:10%真实数据 + 90%合成数据。
  • 基线方法:仅用10%真实数据、用100%真实数据、以及直接混合10%真实+90%合成数据。
  • 主要实验结果
  • 直接混合的弊端:相比仅用10%真实数据,直接混合合成数据在LibriTTS上使可懂度(WER)从12.52%降至10.35%,但相似度(SECS)从0.818跌至0.765。
  • ZeSTA的效果:应用ZeSTA (DC+OS) 后,相似度回升至0.815(接近100%真实数据的0.832),同时保持了良好的可懂度(WER 10.56%)。
  • 主观评价:ABX偏好测试中,听者在LibriTTS和YoBind上分别以70.8%和66.7%的比例显著偏好ZeSTA的输出,且自然度(MOS)未受影响。
  • 消融实验揭示
    1. 仅用过采样(OS alone)效果不稳定,必须在域条件化(DC)的基础上才有效。
    2. 域嵌入大小需适中(64维最佳),过大反而损害相似度。
    3. 必须使用目标说话人的合成数据做增强,若用其他人的合成数据,域差距过大,无法传递有效语言信息。

5. 优势与局限

  • 主要优势
    1. 即插即用:不修改基础TTS架构(如VITS),仅增加极小的嵌入层,对工业落地友好。
    2. 解耦成功:巧妙地利用域标签,既吸收了合成数据带来的丰富语言学信息,又抑制了其音色干扰。
    3. 泛化性强:在两种不同架构的ZS-TTS源模型上均验证有效。
  • 局限性
    1. 相似度上限受限:虽然缓解了音色下降,但在LibriTTS上其SECS(0.815)仍略低于使用100%真实数据的上限(0.832)。
    2. 架构验证单一:实验主要基于VITS架构,是否对当前流行的扩散模型或大语言模型架构的TTS同样有效,尚未验证。
    3. 依赖外部过滤:在扩展合成数据时,仍需依赖ASR模型进行幻觉过滤(WER<5%),增加了流程复杂度。

6. 关键结论与启发

  • 核心Takeaway:在低资源TTS微调中,合成数据是一把双刃剑。通过显式地向模型提供数据来源的“域标签”,可以有效控制合成数据的影响范围,实现“取其语言精华,去其音色糟粕”。
  • 启发与延伸方向
    1. 该思想可启发其他低资源语音任务(如ASR、声纹识别),在引入合成数据增强时,采用域条件化来防止分布漂移。
    2. 未来可探索更高级的域适应技术(如对抗学习)来进一步缩小真实与合成之间的隐空间差距。
    3. 可以探索将ZeSTA应用于更前沿的TTS架构,或研究基于参考音频的动态域条件化策略。
🔥 推荐必读
🏷️ 领域语音合成 (TTS) > Zero-shot TTS / 声音克隆
💡 创新低资源个性化TTS微调——基于VITS架构,引入域条件化训练和真实数据过采样,在推理时强制使用真实域标签以解耦语言学信息和音色特征
⭐ 评分8.0
#65
eess.AScs.SD

Whisper-CD: Accurate Long-Form Speech Recognition using Multi-Negative Contrastive Decoding 解读失败跨领域

Hoseong Ahn, Jeongyun Chae, Yoonji Park, Kyuhong Shim
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: Accepted to Interspeech 2026
查看摘要
Long-form speech recognition with large encoder-decoder models such as Whisper often exhibit hallucinations, repetition loops, and content omissions. These errors can accumulate and be further amplified when the previous segment's transcription is used as decoding context. We propose Whisper-CD, a training-free contrastive decoding framework that contrasts clean-audio logits against negative logits computed from three acoustically motivated perturbations: Gaussian noise injection, silence signal, and audio temporal shift. We aggregate these negatives via the log-sum-exp operator, building a unified multi-negative objective for token-by-token decoding. Across five English long-form benchmarks, Whisper-CD reduces WER by up to 24.3pp on CORAAL and shows 48% faster token generation throughput than beam search. Because Whisper-CD operates purely at inference time, it can be applied as a drop-in replacement to already-deployed Whisper systems without retraining.

📖 深度解读

[PDF 下载失败,无法解读]

#66
eess.AS

Collecting Prosody in the Wild: A Content-Controlled, Privacy-First Smartphone Protocol and Empirical Evaluation 跨领域

Timo K. Koch, Florian Bemmann, Ramona Schoedel, Markus Buehner, Clemens Stachl
Human-Computer Interaction (cs.HC); Audio and Speech Processing (eess.AS)
Comments: Accepted at Interspeech 2026
查看摘要
Collecting everyday speech data for prosodic analysis is challenging due to the confounding of prosody and semantics, privacy constraints, and participant compliance. We introduce and empirically evaluate a content-controlled, privacy-first smartphone protocol that uses scripted read-aloud sentences to standardize lexical content (including prompt valence) while capturing naturalistic variation in prosodic delivery. The protocol performs on-device prosodic feature extraction, deletes raw audio immediately, and transmits only derived features for analysis. We deployed the protocol in a large study (N = 560; 9,877 recordings), evaluated compliance and data quality, and conducted diagnostic prediction tasks on the extracted features, predicting self-reported speaker sex and momentary affective states (valence, arousal). We discuss implications and directions for advancing and deploying the protocol.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文提出了一种基于智能手机的“内容可控、隐私优先”的语音收集协议,通过让用户朗读预设句子并在本地提取声学特征后立即删除原始音频,解决了自然环境中语音收集的“语义-韵律混淆”与“隐私泄露”问题。

2. 研究背景与动机

  • 核心问题:如何在真实的日常生活中(in-the-wild)利用智能手机大规模收集用于韵律(prosody,即说话的语调、节奏等)分析的语音数据。
  • 重要性:将语音研究从实验室推向真实世界,能够实现大规模、具有生态效度的数据采集,对心理学、情感计算等领域意义重大。
  • 现有方法的不足
    1. 语义与韵律混淆:在自然说话中,“说了什么”(语义)和“怎么说”(韵律)高度耦合,很难单独剥离出韵律信号来分析情感状态。
    2. 隐私风险:现有方法多依赖收集和存储原始音频,这不仅包含个人敏感信息,还面临GDPR等法规限制,阻碍了大规模部署。

3. 核心方法

  • 提出的方法:一种内容可控、隐私优先的智能手机生态瞬时评估(EMA)语音收集协议。
  • 关键创新点
    1. 内容与情感效价控制:使用经过验证的德语句子(包含正面、中性、负面三种情感倾向),每次随机抽取让用户朗读,将实验室级别的严谨控制带到了真实世界。
    2. 端侧处理与隐私保护:在手机本地使用openSMILE提取声学特征(eGeMAPS和ComParE特征集),提取完成后立即删除原始音频,仅上传特征数据。
    3. 防背诵设计:每次随机抽取句子,防止用户因过度熟悉而产生背诵式的机械朗读。
  • 直觉性解释:想象医生想通过你说话的“语气”来判断情绪,而不是听懂你的“内容”。这个方法就像是给你一张写好字的纸条让你念出来,这样大家都念一样的内容,医生就能纯粹分析你的声音特征了。同时,为了防止你的声音被偷听,手机在听完你念完后,立刻把声音“嚼碎”变成一堆数字特征,然后把录音本身销毁,只把数字传给医生。

4. 实验与结果

  • 数据集与规模:在德国进行的大规模面板研究中部署,最终有效样本为560名参与者,共9,877条有效语音记录。
  • 基线/对比方法:对比了两种不同的声学特征集(88个特征的eGeMAPS vs. 6373个特征的ComParE 2016)。
  • 主要实验结果
    1. 依从性良好:67.8%的提示被用户启动,且一旦开始,96.9%的用户会完成所有三个效价条件的录音。
    2. 说话人特征预测极强:利用提取的声学特征预测说话人性别,平衡准确率高达约92%。
    3. 情感预测较弱:预测瞬时情感(效价和唤醒度)的表现不佳。唤醒度预测相关性仅为0.12-0.13,效价预测几乎为零(0.02-0.03)。增大特征集数量并未提升效果。
  • 消融/条件分析揭示:不同情感倾向的句子(正/负/中性)对声学特征的影响很小,而个体内差异(ICC在0.32-0.69之间)占主导地位。这表明该协议捕获的主要是稳定的个人声音特征,而非朗读文本带来的变化。

5. 优势与局限

  • 主要优势
    1. 双重解决了语义混淆和隐私保护痛点,具备极高的现实部署可行性(符合GDPR)。
    2. 用户依从性高,且提取的特征在识别稳定说话人属性(如性别)方面表现优异。
    3. 提供了开源的代码和Android模块,具备极强的可复现性。
  • 局限性
    1. 无法验证朗读保真度:由于原始音频被删除,无法事后核查用户是否逐字朗读了预设句子,改写或结巴可能重新引入语义噪音。
    2. 特征表达能力受限:使用的是传统手工特征,未采用当前强大的自监督音频嵌入模型,可能限制了情感等复杂下游任务的预测上限。
    3. 情感预测效果不佳:脚本化朗读可能限制了自然情感的流露,加上真实环境噪音的干扰,导致情感状态预测能力较弱。

6. 关键结论与启发

  • 最重要的Takeaway:在真实世界中收集韵律数据时,通过“预设文本朗读+端侧特征提取”可以在保护隐私的前提下获得高质量的说话人声学特征,但这种脚本化朗读方式对瞬时情感状态的预测能力有限。
  • 启发与延伸方向
    1. 质量控制方向:未来可在端侧引入轻量级的语音识别(ASR)关键词匹配技术,在不保存音频的前提下验证用户是否正确朗读了文本。
    2. 特征升级方向:可以探索在手机端运行轻量级的自监督音频嵌入模型(如FRILL),以替代传统的手工特征,可能有助于提升情感预测效果。
    3. 应用场景延伸:该协议不仅可以单独使用,还可以作为非结构化自然语音收集的“基线校准器”,用于测量个体日常的声音波动范围,从而更好地分析无约束语音数据。
#67
eess.AS

TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild 跨领域

Kai-Wei Chang, Yi-Cheng Lin, Huang-Cheng Chou, Wenze Ren, Yu-Han Huang 等 (12 人)
Computation and Language (cs.CL); Machine Learning (cs.LG); Audio and Speech Processing (eess.AS)
Comments: Interspeech 2026 long paper
查看摘要
Speech technologies have advanced rapidly and serve diverse populations worldwide. However, many languages remain underrepresented due to limited resources. In this paper, we introduce \textbf{TaigiSpeech}, a real-world speech intent dataset in Taiwanese Taigi (aka Taiwanese Hokkien/Southern Min), which is a low-resource and primarily spoken language. The dataset is collected from older adults, comprising 21 speakers with a total of 3k utterances. It is designed for practical intent detection scenarios, including healthcare and home assistant applications. To address the scarcity of labeled data, we explore two data mining strategies with two levels of supervision: keyword match data mining with LLM pseudo labeling via an intermediate language and an audio-visual framework that leverages multimodal cues with minimal textual supervision. This design enables scalable dataset construction for low-resource and unwritten spoken languages. TaigiSpeech will be released under the CC BY 4.0 license to facilitate broad adoption and research on low-resource and unwritten languages. The project website and the dataset can be found on this https URL .

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文发布了首个面向台湾老年人的闽南语(台语)真实世界语音意图数据集TaigiSpeech,并探索了两种从网络视频中挖掘训练数据的方法,实验揭示了网络挖掘数据与真实老年语音之间存在显著的领域差异。

2. 研究背景与动机

  • 核心问题:缺乏针对台湾闽南语(一种缺乏统一文字系统的低资源语言)的语音意图识别数据集,特别是面向老年人居家照护和紧急求助场景的资源。
  • 重要性:在台湾,65岁以上老年人中有64.9%主要使用闽南语。随着独居老人增多,语音助手在紧急情况(如跌倒、胸痛)和日常起居中起着至关重要的生命安全保障作用。
  • 现有不足:现有的语音意图数据集主要集中在英语、法语等高资源语言,且多针对年轻人;而现有的闽南语语料多为朗读声或电视剧配音,缺乏紧急场景下自然、带有情绪表达的真实语音。

3. 核心方法

论文的核心贡献分为数据集构建和数据挖掘策略两部分:
- TaigiSpeech数据集:通过Web应用招募21位老年人(54-78岁),在设定好的紧急与非紧急情境下(利用大模型生成情境文本和视频辅助想象)进行自然语音录制,共收集3,079条包含8种意图的语音。
- 关键词匹配挖掘:以普通话字幕作为“中间语言”,先通过意图关键词检索台剧片段,再利用大模型(LLM)对上下文进行伪标注过滤。
- 音视频挖掘:利用预训练的跨模态模型(PE-AV),将意图描述文本与视频片段的音视频特征进行相似度匹配,无需目标语言的文本监督即可检索相关片段。

关键创新点
1. 首个针对老年人医疗与居家辅助场景的闽南语语音意图数据集。
2. 提出两种适用于低资源/无文字语言的规模化数据挖掘策略(基于中间语言的LLM伪标注 与 弱监督多模态检索)。
3. 揭示了“野外挖掘数据”与“真实世界数据”之间的巨大鸿沟,为低资源SLU提供了真实的评估基准。

直觉性解释
数据集收集就像是给老年人玩“情境角色扮演”,让他们想象自己跌倒或起火,然后自然地喊出求救话语。数据挖掘方面,第一种方法是“顺藤摸瓜”,利用台剧的普通话字幕找关键词,再用AI判断这段话是否符合求救意图;第二种方法是“看图听话”,直接用多模态大模型把视频画面/声音与意图描述进行匹配,完全不依赖文字。

4. 实验与结果

  • 数据集/基准:自建的TaigiSpeech(测试集960条)与从台剧挖掘的数据集。
  • 基线方法:轻量级模型与自监督学习(SSL)模型,以及级联的ASR+LLM基础大模型。
  • 主要实验结果
  • 领域失配严重:在挖掘数据上训练的模型,在台剧测试集上表现良好(如WavLM-large达92.36%),但在真实TaigiSpeech测试集上断崖式下跌至70.00%;音视频挖掘方法在真实测试集上甚至接近随机猜测(约50%)。
  • 少量真实数据可大幅恢复性能:用10个说话人的真实数据微调后,HuBERT-base和WavLM-base-plus在8分类任务上的准确率恢复至90.10%和90.21%。
  • 优于未微调的级联大模型:端到端微调的SSL模型(约90%)显著优于未微调的Whisper/Qwen3-ASR + Qwen3-8B LLM级联系统(最佳仅为74.48%)。
  • 消融/混淆矩阵分析:紧急意图(如疼痛与跌倒)由于声学特征和词汇重叠容易混淆;非紧急意图中“开灯”与“关灯”极易混淆。轻量级模型表现远不及SSL模型,凸显了边缘部署的挑战。

5. 优势与局限

主要优势
1. 具有极高的社会价值和应用前瞻性,填补了老年人低资源语言急救场景的空白。
2. 数据收集协议设计精巧,结合生成式AI情境引导,获得了真实的自然表达语音。
3. 探索的数据挖掘方法为其他无文字/低资源语言的数据构建提供了可复用的范式。

局限性
1. 数据集规模较小(仅21人,6.1小时),虽然作为基准测试足够,但可能难以支撑大规模模型训练。
2. 音视频挖掘策略在当前实验中跨语言迁移效果不佳,二分类表现仅接近随机,说明方法尚不成熟。
3. 轻量级模型表现较差,与实际智能家居设备要求的低算力部署存在矛盾。

6. 关键结论与启发

  • 最重要的Takeaway:仅靠从网络剧等“野外”数据挖掘,无法直接解决真实世界中特定人群(如老年人)的低资源语音意图识别问题,存在严重的领域失配;但将其作为预训练基础,配合少量真实领域数据进行微调,是极其有效的路径。
  • 启发与延伸方向
    1. 未来需要开发兼顾计算效率与性能的轻量级架构,以满足智能家居设备的隐私和算力限制。
    2. 音视频多模态挖掘仍有潜力,未来可尝试在目标语言上微调多模态编码器,或引入更强的训练目标。
    3. 数据集可进一步扩展,涵盖更广泛的年龄层和全球闽南语口音变体。
#68
eess.AScs.SD

Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India 跨领域

Kaushal Bhogale, Manas Dhir, Amritansh Walecha, Manmeet Kaur, Vanshika Chhabra 等 (14 人)
Computation and Language (cs.CL); Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: Accepted at Interspeech 2026
查看摘要
Existing Indic ASR benchmarks often use scripted, clean speech and leaderboard driven evaluation that encourages dataset specific overfitting. In addition, strict single reference WER penalizes natural spelling variation in Indian languages, including non standardized spellings of code-mixed English origin words. To address these limitations, we introduce Voice of India, a closed source benchmark built from unscripted telephonic conversations covering 15 major Indian languages across 139 regional clusters. The dataset contains 306230 utterances, totaling 536 hours of speech from 36691 speakers with transcripts accounting for spelling variations. We also analyze performance geographically at the district level, revealing disparities. Finally, we provide detailed analysis across factors such as audio quality, speaking rate, gender, and device type, highlighting where current ASR systems struggle and offering insights for improving real world Indic ASR systems.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文构建了一个名为“Voice of India”的大规模闭源真实场景语音识别基准,通过收集印度15种语言的非脚本化电话录音并引入多参考转录评估方法,揭示了现有主流ASR模型在真实世界应用中存在的巨大性能差距和地理偏见。

2. 研究背景与动机

  • 核心问题:现有的印度语ASR(自动语音识别)基准测试无法真实反映模型在实际生活中的表现。
  • 重要性:ASR系统若要在印度这样语言多样性极高的国家真正落地,必须能够处理自然对话、口音差异、语码混合(夹杂英语)以及各种录音环境,而不仅仅是处理干净的朗读音频。
  • 现有不足
    1. 数据脱离实际:现有基准多用脚本化、干净语音,且公开的排行榜导致模型针对特定数据集“刷榜”过拟合。
    2. 评估指标僵化:传统的单一参考WER(词错误率)会惩罚印度语中天然存在的合法拼写变体和非标准英语借词的拼写,导致模型表现被误判。
    3. 掩盖区域差异:仅报告整体语言级别的WER,掩盖了不同地区、方言、口音之间的巨大性能鸿沟。

3. 核心方法

  • 提出的方法/框架:Voice of India (VoI) 基准测试及 Orthographically-Informed WER (OIWER) 评估框架。
  • 关键创新点
    1. 真实场景与人口比例采样:基于印度人口普查数据,在139个区域集群中按人口比例采样,收集了536小时、36,691名说话人的非脚本化自发电话语音。
    2. 多参考转录与词格构建:为了不惩罚合法的拼写变体,利用大模型(Gemini 3 Flash)和人工交叉验证生成包含多种合法拼写形式的“词格”,将半词、语气词等设为可选节点。
    3. 细粒度多维评估:不仅看整体WER,还深入到区县级地理分析,并按音频质量、语速、时长、性别、年龄、收入等维度进行切片评估。
  • 核心思路直觉解释:想象你在考一场听力测试。以前的考卷都是字正腔圆的新闻播报,且标准答案只有一个,你稍微把"Colour"拼成"Color"就算错(这对拼写灵活的印度语太苛刻了)。现在,VoI把考卷换成了真实生活中带口音、带杂音的电话聊天,并且标准答案变成了“只要意思对、拼写合理都给分”的灵活答案库。这样考出来的分数,才是你真正能在社会上交流的水平。

4. 实验与结果

  • 数据集:Voice of India(15种语言,30.6万条语音,536小时)。
  • 基线方法:评估了14个主流ASR系统,包括11个商用API(如Sarvam, Gemini 3, GPT-4o, Amazon, Microsoft等)和3个开源模型(IndicConformer, OmniASR 1B/7B)。
  • 主要实验结果
    1. 整体惨淡:大多数模型的WER超过20%(通常被视为可用性阈值)。表现最好的SarvamAudio在15种语言中有13种得分最低,但在Bhojpuri和Maithili上仍超20%。部分模型(如AssemblyAI和GPT-4o-mini)在某些语言上WER甚至超过100%或接近300%,发生灾难性崩溃。
    2. 地理偏见严重:区县级WER从4%(北阿坎德邦Nainital)到44%(喀拉拉邦Mannarakkat)不等。印地语带和大都市表现好,南部(喀拉拉、卡纳塔克邦内陆)和北比哈尔邦表现极差。
    3. 公开基准的虚高:在公开基准FLEURS上表现优异的模型,在VoI真实场景下WER大幅跃升(如GPT-4o Transcribe从9.1%飙升至40.3%)。
  • 消融/属性分析揭示
    1. 音频属性:音频质量越差WER越高;语速呈U型曲线(太慢或太快都差);短音频(<2s)因缺乏上下文最难识别。
    2. 人口统计:模型对女性语音识别略好于男性(高3-4%);18-22岁年轻人错误率高于46岁以上者;高收入群体WER略高(可能因语码混合更频繁)。

5. 优势与局限

  • 主要优势
    1. 极高的生态效度:数据来源于真实自发对话,采样策略严格遵循人口分布,真正反映了“街头现实”。
    2. 公平的评估机制:多参考词格机制有效缓解了因拼写变体导致的误判,更准确地反映了语义识别质量。
    3. 极具指导意义的诊断报告:将模型分为三个梯队并给出具体改进建议(如针对跨区域移民的识别、短音频处理等),对工业界非常实用。
  • 局限性
    1. 闭源属性:数据集不公开,虽然防止了过拟合,但也限制了学术界进行更深入的离线分析或特征提取。
    2. 词格构建的潜在偏差:依赖Gemini 3 Flash生成拼写变体,大模型自身的偏见可能导致某些合法变体被遗漏或错误剪枝。
    3. 模型测试条件单一:所有API均使用默认推理配置,未尝试针对特定语言或口音的提示词工程,可能低估了部分大语言模型驱动的ASR的潜力。

6. 关键结论与启发

  • 最重要的Takeaway:在干净、脚本化的公开基准上刷分,无法带来真实世界ASR系统的鲁棒性。真实世界的挑战(低资源语言、口音、拼写变体、劣质音频)依然远未被解决,尤其是存在严重的地理和人口学偏见。
  • 对后续研究的启发
    1. 数据收集方向:亟需针对“跨区域流动人口”(如泰米尔纳德邦的恰蒂斯加尔语使用者)和低资源方言进行定向数据收集。
    2. 评估范式转变:未来的ASR评估应摒弃僵化的单一参考WER,转向类似VoI的语义对齐和多参考容忍机制。
    3. 模型训练策略:开发者需要引入基于信噪比(SNR)的数据增强、专门处理短音频的路径,以及性别分层训练,以提升模型在长尾分布下的鲁棒性。
🔥 推荐必读
🏷️ 领域语音识别 (ASR) > 鲁棒性语音识别 (ASR) > 低资源与多语言
💡 创新真实场景多语言ASR基准与评估框架——基于人口普查比例采样的非脚本化电话语音,引入多参考转录词格构建机制改进传统WER评估
⭐ 评分8.0
#69
eess.AS
Monash University (QS Top 100)

Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition 跨领域

Tung X. Nguyen, Hieu Minh Truong, Giang Son Nguyen, Nhu Vo, Wray Buntine 等 (6 人)
Computation and Language (cs.CL); Audio and Speech Processing (eess.AS)
Comments: Accepted at INTERSPEECH 2026
查看摘要
Code-switching (CS), the alternation between multiple languages within a single utterance, remains challenging for Automatic Speech Recognition (ASR). To address this issue, we propose a Point-of-Interest (POI)-aware contrastive training framework that improves recognition at CS-critical regions. We first identify CS spans by adopting POI detection method from literature, then construct acoustically plausible near-miss hypotheses by perturbing POIs in ASR N-best outputs and expanding candidates with a large language model. Hard but plausible negatives are retained through filtering with acoustic, phonemic, and textual constraints. Finally, we fine-tune Whisper-small with LoRA using a POI-weighted cross-entropy anchor objective together with a multi-negative contrastive ranking loss. Experiments on CS-FLEURS (cmn-eng) and ViMedCSS (vie-eng) show consistent reductions of over 2% in both general and CS-aware error rates compared to standard LoRA fine-tuning.

📖 深度解读

1. 一句话总结

这篇论文提出了一种针对语码转换(CS)语音识别的对比训练框架,通过利用大语言模型(LLM)生成并严格过滤“近似错误”的负样本,专门针对语言切换的关键区域进行对比学习,有效降低了语音识别的错误率。

2. 研究背景与动机

  • 核心问题:语码转换(CS)语音识别中,识别错误往往高度集中在语言切换的边界或嵌入词(即POI,Point-of-Interest)区域。
  • 重要性:CS现象会引发语言混淆和语音歧义,严重拉低ASR模型的准确率,而解决这些关键区域的错误是提升整体识别质量的关键。
  • 现有方法不足:标准的微调方法缺乏针对这些易混淆区域的显式优化信号;仅仅增加POI区域损失权重(如WCE)效果有限;而基于LLM的解码后纠错方法虽然有效,却增加了推理时的计算延迟和复杂度。

3. 核心方法

论文提出了一个POI感知的对比训练框架,包含离线的近失数据生成(CS-NMG)和在线的对比对齐训练两部分。
- 关键创新点
1. CS-NMG近失数据生成管线:结合ASR模型自身产生的N-best候选词,并利用LLM离线生成更多针对POI区域的替换词,构造出“听起来像但实际不对”的近似错误(Near-Miss)负样本。
2. 三层过滤机制:为了保证负样本“难且合理”,设计了声学门控(保证音频可能性)、音素相似度约束(发音要相近)和文本差异约束(拼写要有差异)三个层级的过滤器。
3. POI加权对比学习目标:将POI加权的交叉熵(WCE)作为锚点,结合InfoNCE风格的多负样本对比排序损失,强迫模型学会区分正确答案和高度混淆的近似错误。
- 直觉解释:就像教学生改错题,不仅告诉学生正确答案是什么,还专门针对他们容易混淆的发音(比如中英夹杂时的某个英文词),找出一堆“听起来很像但写法不同”的错误选项让学生做对比辨析。为了防止错误选项太离谱,还要经过三道关卡筛选,确保这些错题是学生真正容易犯的“合理错误”。这样训练出来的模型在遇到语码转换时就不容易被忽悠。

4. 实验与结果

  • 数据集/基准:CS-FLEURS(中英,普通话为主嵌入英语)和 ViMedCSS(越英,越南语医疗领域嵌入英语)。
  • 基线方法:标准交叉熵(CE)、POI加权交叉熵(WCE)、序列级最小词错误率训练(MWER)。
  • 主要实验结果
  • 在中英数据集上,本文完整模型将WER从基线CE的16.67%降至14.06%,POI错误率(PIER)从17.25%降至15.10%。
  • 在越英数据集上,WER从24.72%降至21.87%,PIER从21.95%降至18.74%。
  • 相比标准LoRA微调,在整体和CS关键区域错误率上均实现了超过2%的稳定下降。
  • 消融实验揭示
    1. 直接引入LLM生成的负样本而不加过滤,效果不稳定(有时甚至下降),因为引入了不合理的噪声。
    2. 单一的过滤条件(仅看声学、仅看音素或仅看文本)在不同语言对上表现脆弱。三层联合过滤虽然留下的负样本数量变少了(约3.8个/句),但质量最高,取得了最佳效果。这证明“负样本质量远比数量重要”。

5. 优势与局限

  • 主要优势
    1. 精准打击痛点:显式针对CS易错区域(POI)进行对比学习,而非盲目增加整个句子的损失权重。
    2. 推理零负担:LLM仅用于离线生成和扩充负样本,实际推理阶段保持标准的ASR-only解码,不增加额外延迟。
    3. 跨语言泛化性好:通过声学、音素、文本三层过滤,方法在中英和越英两种截然不同的语言对上均取得了稳定提升。
  • 局限性
    1. 依赖外部LLM:离线生成阶段依赖商业LLM API(如Gemini 2.5 Pro),增加了离线成本,且受Prompt影响,复现性受限。
    2. 验证范围有限:仅在两个语言对和单一模型骨干(Whisper-small)上进行了评估,其在更大模型或更多语种上的表现未知。

6. 关键结论与启发

  • 最重要的Takeaway:在CS-ASR中,通过LLM生成并严格过滤的“近似错误”负样本进行对比学习,是提升语码转换区域鲁棒性的有效途径。高质量的“硬负样本”比单纯增加权重更能帮助模型厘清语音混淆。
  • 启发与延伸方向
    1. 未来可探索完全开源的本地模型来替代外部LLM API进行负样本扩充,以降低成本并提高可复现性。
    2. 当前的负样本挖掘是静态离线生成的,未来可探索自适应的动态负样本挖掘策略,根据模型训练过程中的实时错误分布调整负样本。
    3. 该框架的思路(POI定位+多模态过滤+对比学习)不仅可应用于ASR,对机器翻译、拼写纠错等涉及序列混淆的任务也有借鉴意义。
👀 推荐值得看
🏷️ 领域语音识别 (ASR) > 语码转换
💡 创新语码转换语音识别对比训练——基于POI加权交叉熵和对比学习,引入LLM生成并经声学、音素、文本三层过滤的近似错误负样本进行训练
⭐ 评分7.5
#70
eess.AScs.SD

TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints 跨领域

Vinh-Thuan Ly
Sound (cs.SD); Computation and Language (cs.CL); Audio and Speech Processing (eess.AS)
Comments: Accepted to Interspeech 2026. Project page: this https URL
查看摘要
Current advancements in Audio Reasoning rely on massive Large Audio-Language Models (LALMs), hindering deployment in resource-constrained environments. We introduce TinyGiantALM, a compact 1.5B efficiency-oriented alternative. Instead of brute-force scaling, we propose an Instruction-Aware Feature Refinement framework using a Query-guided Projector and Semantic Gating to filter acoustic signals based on user intent. On the MMAR benchmark, TinyGiantALM achieves 46.4% zero-shot accuracy, significantly outperforming 7B-13B baselines. While a reasoning gap in logical narrative remains versus 30B+ models and certain trade-offs exist in overly dense or spatial scenes, our approach notably surpasses models up to 8x larger in disentangling mixed-modality environments. These findings demonstrate that architectural precision offers a tangible pathway to secure robust perception capabilities on edge-friendly scales.

📖 深度解读

1. 一句话总结

本文提出了一个仅有1.5B参数的轻量级音频语言模型TinyGiantALM,通过引入基于用户意图的特征过滤与语义门控机制,在资源受限的设备上实现了超越7B-13B大模型的音频推理能力。

2. 研究背景与动机

  • 核心问题:如何在资源受限的边缘设备上实现复杂的音频推理。
  • 重要性:当前的音频推理严重依赖超大规模模型(>7B-30B参数)和昂贵的强化学习,这使得它们难以在手机、IoT等边缘设备上部署。
  • 现有不足:传统的大型音频语言模型(LALMs)依赖“暴力堆参数”,在处理复杂的混合音频场景(如声音与音乐混合)时表现极差,准确率常跌至9.1%的随机猜测水平;此外,它们通常使用简单的线性投影器被动接收所有音频信息,缺乏对任务相关信号的主动筛选能力。

3. 核心方法

  • 方法/框架:TinyGiantALM,一个包含三流声学前端、查询引导投影器和Qwen3 (0.6B)语言骨干网络的1.5B轻量级框架。
  • 关键创新点
    1. 三流声学特征提取:结合Whisper(捕捉语音细节)、HTS-AT(捕捉短促声学事件)和CLAP(提取全局语义锚点)三个编码器,全面感知音频。
    2. 查询引导投影器:将用户的文本指令转化为“意图向量”,通过交叉注意力机制让模型主动聚焦于与问题相关的音频片段。
    3. CLAP驱动的语义门控:利用全局语义锚点生成软门控,对特征进行仿射缩放调制,在保留信号完整性的同时注入全局上下文。
  • 直觉性解释:想象你在一个人声鼎沸的派对上(复杂混合音频)。传统大模型像是一个听力极好但不懂察言观色的人,容易被各种声音干扰;而TinyGiantALM像是一个聪明的助手,你问它“谁在唱歌?”(用户意图查询),它就会主动调低周围嘈杂的说话声,放大音乐声(语义门控),然后把最关键的线索交给大脑(小语言模型)去推理出结论。

4. 实验与结果

  • 数据集/基准:使用CoTA数据集(55.8万样本)进行训练,在极具挑战性的MMAR基准上进行零样本评估。
  • 基线方法:对比了包括SALMONN-13B、Qwen2-Audio-8.4B、Audio-Reasoner-8.4B、Baichuan-Omni-1.5-11B以及Gemini 2.0 Flash等模型。
  • 主要实验结果
  • TinyGiantALM (1.5B) 取得了 46.4% 的平均零样本准确率,显著超越SALMONN-13B (33.2%) 和 Audio-Reasoner-8.4B (36.8%)。
  • 在混合声音-音乐任务中,以 45.5% 的准确率碾压Qwen2-Audio和SALMONN(两者仅为9.1%),展现出强大的模态解耦能力。
  • 消融实验揭示
  • 用户意图查询(IQ)和CLAP门控单独使用时提升有限,但结合使用能产生非线性增益(总体+8.4%)。
  • 门控机制在极度密集的“Mix All”场景和空间分析任务中存在负面效应(分别下降4.16%和6.67%),因为全局锚点在过度密集的场景中反而成了噪声。

5. 优势与局限

  • 主要优势
    1. 极高的参数效率:以仅1.5B的参数量(约1/8大小)超越了7B-13B的专用音频推理模型,且推理仅需5GB显存。
    2. 卓越的混合模态解耦能力:有效解决了传统模型在“鸡尾酒会问题”中的感知崩溃。
  • 局限性
    1. 深度逻辑叙述能力不足:尽管最终准确率高(46.4%),但推理过程评分极低(23.77%)。受限于语言模型规模,它能“猜对”答案,但无法像30B+模型那样生成详尽、细粒度的推理链。
    2. 门控机制的适用范围受限:在极端密集场景和需要精细物理线索的空间任务中,语义过滤会丢失关键细节。
    3. 前端依赖冻结的大模型:虽然LLM只有0.6B,但声学前端仍使用了总计732M参数的冻结编码器,整体参数量并非完全“微小”。

6. 关键结论与启发

  • 最重要的 takeaway:架构设计的精度(如意图感知和特征过滤)可以在一定程度上弥补参数规模的不足,为边缘设备上的多模态推理提供了一条可行路径,无需盲目追求模型规模。
  • 启发与延伸方向
    1. 推理与叙述的分离:论文揭示了一个有趣的现象——模型能得出正确结论,却无法写出完整的推理过程。这启发后续研究可以探索“小模型感知+外部知识/大模型辅助叙述”的解耦架构。
    2. 动态门控机制:当前的全局语义门控在密集场景中会失效,未来可探索更细粒度的、基于局部上下文动态调整的门控机制,以避免在复杂场景中丢失关键物理线索。
#71
eess.AScs.SD

What Makes Synthetic Speech Sound Sarcastic? A Prosody-Controlled Perception Study 跨领域

Zhu Li, Shekhar Nayak, Matt Coler
Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: Accepted to Interspeech 2026
查看摘要
Prosody plays an important role in sarcasm perception, yet previous studies have relied on naturally produced speech that lacks fine-grained control over individual acoustic dimensions. As prosodic cues co-vary in natural data, isolating their independent contributions remains challenging. We introduce a controlled framework using neural text-to-speech (TTS) with prompt-based prosodic conditioning to manipulate speech rate, pitch variation, and loudness. An orthogonal stimulus set was constructed to enable causal testing of prosodic cue effects. Human listeners rated sarcasm and naturalness, and their judgments were compared with predictions from a foundation model capable of processing audio input. Results show that loudness primarily drives human sarcasm perception, whereas the model assigns greater weight to speech rate, indicating limited behavioral alignment. This study shows how controllable neural TTS enables investigation of prosodic cue weighting in speech perception.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文利用神经TTS技术精准控制语音的韵律特征,发现人类主要依靠“响度”来感知讽刺,而AI大模型则更依赖“语速”,揭示了人机在讽刺感知上的线索权重差异。

2. 研究背景与动机

  • 核心问题:哪些具体的韵律特征(如音高、语速、响度)独立驱动了人类对讽刺的感知?机器模型与人类的感知模式是否一致?
  • 重要性:韵律在讽刺感知中起核心作用,理解其具体作用机制不仅有助于心理语言学和语音学研究,也能揭示当前AI模型在语用理解上的偏差。
  • 现有不足:以往研究大多依赖自然录制的语音。在自然语音中,音高、语速、响度等特征是相互共变的(例如人说话慢时音调可能自然变平),难以通过事后分析剥离出单一特征的独立因果贡献。

3. 核心方法

  • 提出方法:提出了一种基于神经TTS(Qwen3-TTS)的受控实验框架,通过自然语言提示词精准操控语音的三个韵律维度:音高变化(动态 vs. 平淡)、响度(大声 vs. 轻柔)、语速(快 vs. 慢)。
  • 关键创新点
    1. 正交刺激集构建:通过生成大量候选样本并基于效应量(Cohen's d)进行筛选,确保目标维度的变化很大,而非目标维度的溢出效应接近于零,实现了特征的统计独立。
    2. 因果性测试:在保持文本内容完全不变的前提下,通过严格的2×2×2全因子设计,实现了对单一韵律特征的因果性隔离测试。
    3. 人机感知对比:将相同的刺激集分别让人类听众和多模态基础大模型(Qwen3-Omni)进行评分,直接对比生物系统与人工系统的线索权重分配。
  • 直觉性解释:就像在实验室里调配化学试剂,研究者用AI合成语音,精确控制“声音大小、语速快慢、音调起伏”这三个旋钮,并确保调一个旋钮时不会牵连到另外两个。然后让真人和AI分别听这些声音,看他们各自最吃哪一套(觉得哪种声音最像在说反话)。

4. 实验与结果

  • 数据集/基准:采用Bryant和Fox Tree [1]提供的语义中立英语句子集,生成了192个语音刺激(24句话 × 8种韵律条件)。
  • 对比对象:66名人类听众 vs. 多模态大模型 Qwen3-Omni。
  • 主要实验结果
  • 人类感知:响度是驱动讽刺感知的最主要因素(大声比轻柔更显讽刺,β=0.285, p=.017),尤其是“大声+平淡音调”的组合最容易被判定为讽刺。语速和音高的主效应不显著。
  • 机器感知:模型则主要依赖语速来判断讽刺(慢速比快速更显讽刺,β=0.313, p=.009),响度对模型的影响微乎其微(β=0.035)。
  • 人机差异:人类与模型在8种条件下的讽刺评分排名相关性极低且为负相关(ρ=−0.11),证明两者的感知模式存在根本分歧。
  • 消融/验证实验:通过计算Cohen's d验证了正交性(目标维度d>0.8,非目标维度|d|<0.25),并检查了H1-H2和HNR等音质参数,排除了音质变化的干扰。此外,自然度评估显示,虽然夸张的韵律会降低自然度,但整体评分依然较高,不影响讽刺评估的有效性。

5. 优势与局限

  • 主要优势
    1. 方法论突破:巧妙利用生成式TTS解决了传统自然语音研究中韵律特征共变、难以剥离因果的难题。
    2. 对比视角新颖:首次清晰地量化并指出了基础大模型与人类在语用(讽刺)声学线索权重上的系统性偏差。
  • 局限性
    1. 生态效度有限:仅使用了单一合成语音,缺乏多说话人、跨语言以及真实语境下的验证。
    2. 控制不完全性:虽然统计上实现了正交,但基于自然语言提示词的TTS控制无法绝对保证未测量的声学维度(尽管作者检查了部分音质参数)完全不变。
    3. 人类评分者个体差异大:人类个体评分者的一致性极低(ICC=0.15),仅靠群体平均才达到稳定,可能暗示讽刺感知高度依赖个体差异。

6. 关键结论与启发

  • 最重要的Takeaway:人类通过“响度”(情感夸张)来捕捉讽刺意图,而当前的多模态大模型则通过“语速”(时间规律)来判断,两者在内部线索权重机制上存在显著分歧。这表明模型并未真正学会人类的语用感知模式。
  • 启发与延伸方向
    1. AI对齐研究:当前大模型在多模态训练中可能过度依赖易于捕捉的统计信号(如时间特征),忽略了人类社会中更具情感指示性的特征(如强度)。未来需要改进训练目标以对齐人类的感知机制。
    2. 实验范式推广:这种“TTS正交控制+人机对比”的框架完全可以推广到其他语音感知研究领域(如情绪识别、态度判断、反问句识别等),为心理声学和语用学提供了强大的新工具。
#72
eess.AScs.SD

An Asymmetric Formula for Interval Consonance and its Relation to Harmonic Coincidence 跨领域

David De Roure
Sound (cs.SD); Audio and Speech Processing (eess.AS); History and Overview (math.HO); Number Theory (math.NT)
Comments: v2: minor revision. Tightened the partial-beating argument in Sec. 9, added an acknowledgement, and updated references to the now-approved OEIS sequences A397104 and A397106. 18 pages
查看摘要
Euler's Gradus Suavitatis (1739) assigns a dissonance value to a musical interval p/q by the formula G(p/q) = 1 + \Omega^(p) + \Omega^(q), where \Omega^(n) = \sum_i e_i(p_i - 1) sums the weighted prime exponents of n. We propose the simpler asymmetric formula f(p/q) = p + \Omega^(q), which treats numerator and denominator differently and performs comparably on standard consonance data. We also show that, under a model in which harmonics are integer-indexed and counted uniformly up to a fixed truncation level, Gradus is equivalent to a weighted harmonic coincidence count with weights w(n) = \Omega^(n), connecting it to Galileo's earlier pulse-coincidence model (1638). The formula naturally generates a coprime integer triangle T(n,k) = n + \Omega^(k), whose rightmost diagonal gives the two-stage dissonance of the superparticular (consecutive-harmonic) intervals. The formula f admits a simple two-stage interpretation in terms of harmonic context and partial recognition, which we offer as a speculative perceptual hypothesis.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种比欧拉公式更简单的非对称音乐协和度计算公式 $f(p/q) = p + \Omega^*(q)$,在完美拟合人类听觉感知数据的同时,揭示了协和度背后的谐波重合机制与听觉容差规律。

2. 研究背景与动机

  • 核心问题:如何用数学公式准确量化音乐中两个音程(频率比 $p/q$)的“协和”或“不协和”程度?
  • 重要性:协和度是音乐声学和认知心理学的基础,它直接决定了音阶的构建、和声的走向以及乐器调律系统(如十二平均律)的设计。
  • 现有不足:欧拉于1739年提出的经典公式是对称的($G(p/q) = 1 + \Omega^(p) + \Omega^(q)$),无法区分高音和低音在听觉中的不同作用,且在标准音程数据中存在多个无法区分的“平局”现象。伽利略的脉冲重合模型($max(p,q)$)虽然简单且相关性高,但完全忽略了分母的素数结构。此外,纯物理的拍频粗糙度模型在解释三全音等极不协和音程时存在明显失败。

3. 核心方法

  • 提出的方法:非对称公式 $f(p/q) = p + \Omega^(q)$。其中 $p$ 是分子(高音),$q$ 是分母(低音),$\Omega^(q)$ 是 $q$ 的素数因子加权复杂度(例如 $4=2^2$ 复杂度为2,$3=3^1$ 复杂度也为2)。
  • 关键创新点
    1. 非对称处理:用高音在泛音列中的绝对位置 $p$ 替代了欧拉公式中的 $\Omega^(p)$,区分了高音(旋律 reaching)和低音(和声基底 context)的不同感知角色。
    2.
    重新解释欧拉公式:在离散谐波模型下,数学上证明了欧拉公式等价于以 $\Omega^(n)$ 为权重的“谐波重合计数”,从而将欧拉的算术公式与伽利略的物理脉冲重合模型统一了起来。
    3. 两阶段感知假设:提出听觉系统分两步处理音程——第一步,低音向下推断基频,成本为 $\Omega^(q)$;第二步,高音向上在泛音列中被识别,成本为 $p$。
    4.
    声学容差对偶性*:推导出音程对“失谐”的容忍度与 $p$ 成反比($\Delta_{tol} \propto 1/p$),揭示了 $p$ 既是“认知成本”也是“声学敏感度”的双重物理意义。
  • 直觉解释:想象你要搭建一座音乐桥梁。低音是地基,地基涉及的素数越复杂($\Omega^*(q)$ 越大),打地基越费力;高音是塔尖,它在泛音列中位置越高($p$ 越大),够到它就越费力。总的不协和感就是这两部分努力之和。

4. 实验与结果

  • 数据集/基准:13个标准西方音乐音程(基于Krumhansl的人类听觉协和度评分数据,假设八度等价)。
  • 对比基线:欧拉公式 $G$、伽利略指标 $max(p,q)$、Tenney height $H=p \cdot q$、Plomp-Levelt 拍频粗糙度模型。
  • 主要实验结果
  • $f$ 和 $max(p,q)$ 达到了最高的Spearman秩相关系数 $\rho=0.989$(欧拉为0.979,Tenney为0.978)。
  • $f$ 成功打破了欧拉公式中尴尬的三方平局(小三度、小六度、大二度),在所有公式中“平局解决能力”最佳。
  • 对于极不协和的三全音(45/32),$f$ 给出了极高的值(50),比欧拉(14)更强烈地突出了其极度不协和的感知特征。
  • 消融/分析实验
  • 平均律容差分析:12-TET(十二平均律)中,五度($p=3$)和四度($p=4$)的失谐在听觉容差内,但大三度($p=5$)等在高音区会超出容差阈值。这从算术角度解释了为什么19-TET和31-TET在保留纯律和声方面优于12-TET。
  • 转位区分:由于非对称性,$f$ 能区分仅差1音分但来源不同的小七度(9/5 vs 16/9),而对称的欧拉公式则无能为力。

5. 优势与局限

  • 主要优势
    1. 形式简洁且符合直觉:无需对高音进行素数分解,直接使用泛音列位置,公式极其精简(零自由参数)。
    2. 多维度统一:将算术(素数分解)、物理(拍频与容差)、认知(两阶段假设)巧妙地统一在同一个数学表达式中。
    3. 区分度高:有效打破了历史公式中的平局,并能区分不同调律系统下微小差异的音程。
  • 局限性
    1. 数据集规模小且具文化特异性:验证仅基于13个西方音程和受西方训练的听众数据,跨文化普适性存疑(论文也承认这一点)。
    2. 无法解决大三度与大六度的平局:因为 $\Omega^(4) = \Omega^(3) = 2$,公式无法区分 5/4 和 5/3,论文指出这可能需要引入“文化熟悉度”等非算术因素。
    3. 过度依赖特定三全音取值:$f$ 对三全音给出的极端值(50)高度依赖于5限纯律的 45/32 取值,若换成7限或11限的三全音,该极端性会消失。

6. 关键结论与启发

  • 最重要的 Takeaway:音乐协和度不仅是一个算术问题,更是一个非对称的感知过程。高音和低音在听觉判断中扮演着截然不同的角色——低音提供和声上下文(素数复杂度主导),高音提供旋律张力(泛音高度主导)。
  • 对后续研究的启发/延伸方向
    1. 心理声学实验验证:两阶段感知假设和 $1/p$ 失谐容差模型可以通过操控音区、转位和音色的
#73
eess.AScs.SD
Pohang University of Science and Technology (POSTECH) (QS Top 100)

Latency-Configurable Streaming Speech Enhancement via Asymmetric Temporal Padding 跨领域

Yunsik Kim, Yoonyoung Chung
Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: 5 pages, 3 figures. Accepted for presentation at Interspeech 2026
查看摘要
Streaming speech enhancement requires balancing algorithmic latency against quality, yet existing approaches largely treat this as a binary causal versus non-causal choice. LaCo-SENet addresses this issue with two mechanisms parameterized by a single training-time hyperparameter. First, asymmetric temporal padding redistributes past and future context in convolutions, enabling systematic latency configuration. Second, dual-buffer streaming combines state buffers for past context with lookahead buffers that supply future context at both the input and feature levels. Selective state updates also prevent future-frame leakage into the streaming state, ensuring training-inference consistency. On VoiceBank+DEMAND, a fixed-budget (1.37M parameters) backbone yields a family of models spanning 12.5-75.0 ms, with PESQ rising from 3.35 to 3.43. At just 12.5 ms (fully causal), a PESQ of 3.35 matches or exceeds the prior causal state-of-the-art (3.27 at 46.5 ms).

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种名为 LaCo-SENet 的流式语音增强框架,通过非对称时间填充和双缓冲机制,在固定模型参数量下,仅需调节单一训练超参数即可灵活配置算法延迟,并在极低延迟下超越了以往因果模型的性能。

2. 研究背景与动机

  • 核心问题:流式语音增强(SE)需要在算法延迟和增强质量之间取得平衡。
  • 重要性:在电话会议、助听器和设备端语音交互等实时应用中,延迟直接决定了系统的响应速度和用户体验(通常要求在 10-80 ms 内)。
  • 现有不足:现有的流式模型通常将延迟视为“非黑即白”的二元选择(纯因果 vs. 非因果),且每个模型被锁定在一个固定的延迟点上。缺乏一种统一架构能在固定参数预算下,系统性地探索延迟与质量的权衡。此外,若简单地在卷积层引入非对称填充以获取未来上下文,会导致流式推理时状态缓冲区被“未来帧”污染,进而产生输出失真。

3. 核心方法

  • 方法/模型:LaCo-SENet(基于 PrimeK-Net 主干,1.37M 参数),包含非对称时间填充机制和双缓冲流式框架。
  • 关键创新点
    1. 非对称时间填充:作为延迟配置的“旋钮”。在保持卷积总填充量(感受野)不变的前提下,通过一个训练时的超参数 $r$,将时间维度的填充按比例分配给过去(左侧)和未来(右侧)。
    2. 双缓冲流式框架:结合“状态缓冲区”(保存过去上下文)和“前瞻缓冲区”(在输入和特征层提供未来上下文),解决分块流式处理中的上下文断裂问题。
    3. 选择性状态更新(SSU):在更新状态缓冲区时,仅截取当前块的数据,剔除前瞻缓冲区引入的未来帧,从而防止未来帧被重复计算导致的状态污染。
  • 直觉性解释:想象你在听人说话,为了听得更清楚,你不仅需要记住刚才听到的几个词(过去上下文),有时还需要等对方说出接下来的几个词(未来上下文)来帮助理解。传统方法要么完全不等(延迟低但可能听不清),要么固定等一定时间。本文的方法是:保持你总共能听到的词数(感受野)不变,只通过一个“旋钮”来调节“记住过去的词”和“等未来的词”的比例。为了在一段一段听(流式处理)时不出错,作者设计了两个暂存区:一个存过去的词,一个存未来的词。同时,为了避免把“未来等到的词”错误地当成“过去的词”存起来导致后面越听越乱,作者加了一个过滤机制,只把当前这一段的词存入记忆中。

4. 实验与结果

  • 数据集/基准:VoiceBank+DEMAND(16 kHz)。
  • 基线方法:RNNoise, GaGNet, DeepFilterNet3, aTENNuate, PrimeK-Net(非因果上限),以及 SEMamba 和 xLSTM-SENet(因延迟不可验证被排除在延迟排名外)。
  • 主要实验结果
  • 在完全因果(12.5 ms 极低延迟)下,LaCo-SENet 达到了 3.35 的 PESQ,超越了此前在 46.5 ms 延迟下才达到 3.27 PESQ 的 aTENNuate。
  • 随着右侧填充比例增加(延迟从 12.5 ms 提升至 75.0 ms),PESQ 从 3.35 稳步提升至 3.43。
  • 该模型保留了非因果模型 PrimeK-Net(3.61 PESQ)93-95% 的质量,但参数量相当(1.37M vs 1.41M)。
  • 消融实验:验证了选择性状态更新(SSU)的绝对必要性。如果关闭 SSU,未来帧会污染状态,导致 PESQ 暴跌至 1.39-2.04(甚至低于含噪语音的 1.97)。同时,实验证实开启 SSU 后,分块流式推理的输出与全序列推理在数值上完全等价。

5. 优势与局限

  • 主要优势
    1. 灵活的延迟配置:无需修改架构或参数量,只需调整单一训练超参数,即可生成覆盖 12.5-200 ms 的模型家族。
    2. 极低延迟下的高性能:在 12.5 ms 延迟下刷新了因果语音增强的 SOTA 表现。
    3. 严格的训练-推理一致性:通过双缓冲和 SSU 机制,数学上保证了流式推理与离线全序列推理的等价性。
  • 局限性
    1. 延迟配置是离散且训练时固定的:填充比例 $r$ 是训练时的超参数,不能在运行时根据设备算力或网络状况动态自适应调整。
    2. 流式推理的计算开销:虽然参数量固定,但在极小块尺寸(如 $C=1$)时,大前瞻量会带来较高的计算开销(RTF 下降),需要一定的块缓冲来摊销开销。
    3. 数据集单一:仅在 VoiceBank+DEMAND 上进行了验证,缺乏在更大规模、更复杂场景(如 DNS Challenge 数据集)下的泛化性证明。

6. 关键结论与启发

  • 核心 Takeaway:卷积层的非对称填充是控制流式语音增强延迟的有效“旋钮”,而解决其带来的状态缓冲区污染问题是成功部署的关键技术挑战。
  • 启发与延伸方向
    1. 这种非对称填充与双缓冲机制具有通用性,未来可推广至其他流式音频处理任务(如自动语音识别 ASR、声源分离)甚至视频处理领域。
    2. 未来可以探索结合动态路由或提前退出机制,实现运行时根据资源约束自适应调节延迟的模型。
    3. 该思路为非因果对称模型向低延迟流式模型转化提供了一条标准路径,即在不损失架构优势的前提下,平滑地过渡到因果推理。
🔥 推荐必读
🏷️ 领域语音增强与分离 > 语音增强
💡 创新流式语音增强延迟配置——基于非对称时间填充和双缓冲机制改进,引入选择性状态更新防止未来帧污染
⭐ 评分8.0
#74
cs.SD

An implicitization-based solution to the minimal 4s/6r ToA problem using Cayley--Menger determinants

Evgeniy Martyushev
Sound (cs.SD)
Comments: 10 pages, 4 figures, 1 table
查看摘要
The paper introduces an efficient algebraic solver for the 4-sender/6-receiver (4s/6r) Time-of-Arrival (ToA) self-localization problem, which involves determining the relative positions of all receivers and senders given their pairwise distance measurements. The problem is addressed through a new parametrization combining Cayley--Menger determinants with an implicitization technique. The proposed algorithm proceeds in three steps. First, a 148 x 211 Macaulay matrix is constructed from the coefficients of the original polynomial system. Second, PLU decomposition of this matrix yields a 63 x 63 matrix pair. Finally, up to 38 real solutions are obtained via generalized eigendecomposition followed by a validation step. Experiments on synthetic noise-free data demonstrate that the proposed solver outperforms existing methods by approximately three orders of magnitude in numerical accuracy while achieving an average runtime of 1.3x faster than the fastest alternative. Experiments on a real-world acoustic dataset confirm that, when integrated within a RANSAC framework, the solver provides a reliable initial guess for bundle adjustment refinement.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种基于Cayley-Menger行列式与隐式化技术的代数求解器,高效且高精度地解决了4个发送器/6个接收器(4s/6r)的最小到达时间自定位问题。

2. 研究背景与动机

  • 核心问题:4s/6r ToA自定位问题,即仅通过4个发送器和6个接收器之间的 pairwise 距离测量值,推断它们在3D空间中的相对位置。
  • 重要性:该问题在室内定位、水下导航、麦克风阵列自校准和机器人集群协同等领域有广泛应用。更重要的是,4s/6r是能够产生有限孤立解的最小问题配置,非常适合作为RANSAC等鲁棒估计框架中的“假设生成器”,用于处理存在外点的超定系统。
  • 现有不足:现有的最先进参数化方法(如Kuang等人的方法)虽然将问题简化为多项式方程组,但其解空间包含一个1维的“伪根”流形,导致现有的求解器难以同时兼顾高数值精度和低计算耗时。虽然Stewénius曾提出过基于隐式化的思路,但并未给出显式约束或实用求解器。

3. 核心方法

  • 提出方法:基于Cayley-Menger行列式和隐式化技术的新参数化方法,以及对应的消元模板求解算法。
  • 关键创新点
    1. 构造11维特征向量:利用Cayley-Menger行列式构造一个11维向量,通过隐式化技术推导出该向量必须满足的完整多项式约束(8个三次方程和2个四次方程)。
    2. 零维解空间无伪根:将问题转化为5个变量的10个多项式方程组,其解空间是0维的,且恰好包含38个复数根,从根源上消除了以往方法中的1维伪根流形。
    3. 高效的线性代数求解:将非线性方程组转化为148×211的Macaulay矩阵,通过PLU分解提取63×63的矩阵对,最终转化为广义特征值问题进行求解。
  • 直觉性解释:想象你要确定空间中一堆点的相对位置,直接解庞大的距离方程组非常困难。本文巧妙地利用了“Cayley-Menger行列式”(一种能表示点距几何关系的数学工具)构造了一个特征向量,并找出了这个向量内部隐藏的代数约束。然后,把解这些非线性方程的过程,转化成了纯粹的矩阵分解和求特征值问题(就像把一团乱麻理成了几条直线),从而极大地提高了计算速度和精度。

4. 实验与结果

  • 数据集/基准:合成无噪声数据、合成含噪声及外点数据、真实声学数据集(bassh2)。
  • 基线方法:Martyushev et al. [26], Larsson et al. [20], Kuang et al. [18]。
  • 主要实验结果
  • 数值精度:在无噪声数据上,新方法的中位误差($\epsilon_1$)为 $7.4 \times 10^{-8}$,比次优方法(Kuang et al.)低了约3个数量级。
  • 计算速度:平均运行时间为4.5毫秒,比现有最快方法快1.3倍。
  • 真实数据验证:集成到RANSAC框架中处理真实声学数据,初始重建RMSE为0.1291米,经Bundle Adjustment优化后RMSE降至0.019米,证明了其实用价值。
  • 消融/验证实验:算法会生成63个候选根,通过计算相对误差并排序,成功剔除了25个伪根,准确识别出38个真实解。含噪声实验表明,即使在高达4个外点和较高噪声水平下,该求解器在RANSAC中依然保持鲁棒。

5. 优势与局限

  • 主要优势
    1. 精度与速度双突破:在数值精度提升3个数量级的同时,计算速度更快,非常适合实时或大规模RANSAC采样。
    2. 理论优雅无伪根:新参数化直接产生0维解空间,避免了1维伪根流形带来的数值干扰。
  • 局限性
    1. 假设条件限制:要求发送器和接收器处于一般位置(不能共面或重合),对退化配置的处理未在本文涉及。
    2. 模板构建耗时占比大:虽然总速度快,但53.2%的时间花在构建初始系数矩阵上,仍有进一步优化的空间。
    3. 适用范围有限:目前仅针对4s/6r问题,尚未扩展到5s/5r或TDoA等其他最小配置。

6. 关键结论与启发

  • 核心Takeaway:通过结合Cayley-Menger行列式与隐式化技术,可以将复杂的非线性几何定位问题转化为结构良好的多项式系统,进而利用成熟的线性代数工具(PLU+QZ分解)实现高效高精度求解。
  • 启发与延伸方向
    1. 该隐式化参数化思路有望推广到其他最小ToA问题(如5s/5r)以及更广泛的传感器网络校准任务。
    2. 未来研究可以探索处理退化配置(如共面情况),以及扩展到到达时间差和混合校准问题,使其在真实复杂场景中更具普适性。
🔥 推荐必读
🏷️ 领域空间音频 > 声源定位
💡 创新基于Cayley-Menger行列式与隐式化技术的代数求解器——基于现有参数化方法改进,通过构造11维特征向量推导出完整多项式约束,消除1维伪根流形并转化为零维解空间,最终利用线性代数求解
⭐ 评分8.0
#75
cs.SD

Exploiting Neural Audio Codec Latents for Adversarial Audio Attacks

Sameek Bhattacharya, Bharath Krishnamurthy, Ajita Rattani
Sound (cs.SD); Artificial Intelligence (cs.AI); Cryptography and Security (cs.CR)
Comments: Accepted to Interspeech 2026. 5 Pages with references containing 2 figures and 4 tables. Code is available at this https URL or this https URL
查看摘要
Deep learning-based audio classification systems, including automatic speaker verification, are vulnerable to adversarial attacks. Realistic real-time threat assessment remains difficult because optimization-based methods, such as projected gradient descent (PGD) and Carlini-Wagner, require costly iterative updates in the high-dimensional waveform domain. Generative attacks allow single-shot synthesis but often introduce perceptible artifacts or depend on computationally intensive architectures, while diffusion and autoregressive approaches incur high inference latency. To address this gap, we propose a generative attack framework operating in the continuous latent space of a neural audio codec. A conditional generator synthesizes class-specific perturbations in a single forward pass and decodes them into adversarial waveforms. Our method achieves targeted attack success rates up to 99% with sub-7 ms inference, outperforming generative baselines while reducing latency by 24x.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种在神经音频编解码器(DAC)的连续潜在空间中直接生成对抗扰动的方法,通过单次前向传播实现了高成功率的实时音频对抗攻击,将推理延迟降低至7毫秒以内。

2. 研究背景与动机

  • 核心问题:如何对深度学习音频分类和声纹验证系统(如智能音箱、语音助手)进行快速且高效的实时对抗攻击?
  • 重要性:随着基于DNN的音频系统广泛部署于现实生活和安全关键场景,评估其面对实时流媒体攻击的脆弱性至关重要。
  • 现有不足:传统的基于优化的方法(如PGD、C&W)在高维波形空间进行迭代计算,速度极慢,无法用于实时场景;现有的生成式方法(如FAPG、CGAN)虽能单次生成,但仍在波形空间操作,易产生可感知的噪声伪影,且基于扩散或自回归的生成模型架构笨重,推理延迟依然很高。

3. 核心方法

  • 提出方法:提出了一种端到端可微分的生成式对抗攻击框架,该框架完全在通用神经音频编解码器(Descript Audio Codec, DAC)的连续潜在空间中运行。
  • 关键创新点
    1. 潜在空间生成攻击:不直接修改原始波形,而是利用冻结的DAC编码器将音频压缩到低维连续潜在空间,在此空间生成扰动。
    2. 全可微分编解码流水线:在DAC的预量化空间进行操作,绕过了离散码本的不可微问题,同时设计了可微分的STFT声学预处理模块,将梯度从受害模型无缝传递给生成器。
    3. 零初始化与EMA稳定训练:生成器最后一层采用零初始化确保初始扰动极小,并引入指数移动平均(EMA)稳定非凸对抗优化的梯度。
  • 直觉性解释:想象你要修改一幅画来骗过安检仪。以前的方法是拿着放大镜在画布(原始波形)上一笔笔试错修改,很慢;后来改用打印机直接泼墨(生成式),快但容易破坏画的结构。本文的方法是先找到这幅画的“高度压缩设计图纸”(DAC潜在空间),在图纸上做微小的语义篡改,然后让机器根据图纸重新“打印”出画布。因为图纸维度低且保留了核心语义,所以修改又快又隐蔽。

4. 实验与结果

  • 数据集:Google Speech Commands(语音命令)、UrbanSound8K 与 DCASE2019(环境声音)、LibriSpeech(声纹验证)。
  • 基线方法:迭代法(FGSM, PGD, C&W)和生成法(FAPG, CGAN)。
  • 主要实验结果
  • 声纹验证:在LibriSpeech上,无目标攻击成功率达到100%,有目标达到99.80%,单样本推理仅需0.0035秒。
  • 环境声音:在UrbanSound8K和DCASE2019上,无目标ASR分别为99.11%和100%,有目标ASR分别为97.17%和94.07%。
  • 语音命令:在Speech Commands上,无目标ASR为96.58%,有目标ASR为77.65%。
  • 效率提升:推理时间低至3.5-6.7毫秒,比生成基线(FAPG)快约24倍,比迭代方法(C&W)最高快18,900倍。
  • 消融实验:论文未提供传统的消融实验表格,但在方法部分声明了零初始化、残差缩放参数$\alpha$和EMA机制对防止梯度爆炸和稳定训练至关重要。

5. 优势与局限

  • 主要优势
    1. 极致的实时性:单次前向传播,亚7毫秒的延迟真正满足了流媒体实时攻击的威胁评估需求。
    2. 攻击效果卓越且普适:在环境声音和声纹验证上几乎达到100%的成功率,且同时支持闭集分类和开集度量学习(声纹)任务。
    3. 隐蔽性高:在压缩语义空间操作,配合L2正则化,避免了直接在波形空间生成粗糙伪影。
  • 局限性
    1. 短音频有目标攻击存在短板:在1秒的Speech Commands有目标攻击上,成功率仅为77.65%,低于CGAN,说明在短音频全局潜变量上操控特定音素仍有难度。
    2. 白盒限制:当前框架需要受害模型可微并提供梯度,论文尚未验证其在黑盒场景下的迁移性。
    3. 缺乏系统的消融实验:未量化各个损失项(如Margin Loss、L2正则)或特殊设计(如EMA)对最终性能的具体贡献。

6. 关键结论与启发

  • 核心Takeaway:神经音频编解码器的压缩语义潜在空间是一个强大且尚未被充分探索的对抗攻击面。通过在潜在空间而非波形空间进行生成式攻击,可以打破“攻击成功率”与“实时推理延迟”之间的权衡瓶颈。
  • 启发与延伸方向
    1. 防御视角的转移:未来的音频防御机制不能仅关注波形层面的异常检测,必须警惕并防御针对音频编解码器潜在表示的恶意篡改。
    2. 黑盒迁移攻击:结合潜在空间的解耦特性,未来可探索该方法在黑盒模型间的迁移攻击能力。
    3. 范式推广:这种“冻结编解码器+可微预处理+潜在生成器”的范式,不仅适用于音频,也可启发在视频流或实时时间序列数据上的对抗攻击研究。
#76
cs.SD

LK Jam: System Architecture and Implementation of a Real-Time Human-AI Interactive Music Generation System using Role-Aware GRU

Yakun Liu, Zhiyu Jin, Dong Liu, Hai Luan
Sound (cs.SD); Artificial Intelligence (cs.AI); Machine Learning (cs.LG)
Comments: 7 pages, 10 figures, 3 tables. This is an original technical report on real-time human-AI interactive symbolic music generation VST3 plugin based on GRU and JUCE. The source code is open-source on GitHub
查看摘要
As artificial intelligence advances into the era of Embodied AI, live musical interaction urgently needs to break free from the limitations of offline, unidirectional generation, achieving a "virtual synergy" capable of low-latency, dynamic interplay. To address this, this technical report presents LK_Jam, a real-time, bidirectional human-computer interactive music generation system based on a lightweight Gated Recurrent Unit (GRU) and a high-performance audio host architecture. In the algorithmic representation layer, this system abandons the computationally expensive fixed time-grid. Instead, it constructs a multi-dimensional sparse event stream integrating time-shifts, continuous harmonic embeddings, and role-aware encoding, enabling the model to accurately capture turn-taking logic and micro-timing in a single-step inference. In the engineering implementation layer, this paper builds a strict multithreaded lock-free communication bridge using C++ and the JUCE framework, incorporating the RTNeural inference engine designed specifically for real-time audio. By utilizing compile-time network topology solidification and a zero-allocation (allocation-free) mechanism, the end-to-end overhead of autoregressive decoding is strictly locked at \(O(1)\) complexity, structurally mitigating the risk of audio thread dropouts in DAW plugin environments. Furthermore, this study designs a three-stage progressive training strategy, achieving a leap from basic chord harmonization to expert-level interaction. Preliminary observations and architectural analysis demonstrate that while ensuring musical coherence and interactive role-play, the proposed system successfully challenges extreme real-time engineering constraints, offering a highly robust and deployable technical paradigm for next-generation AI co-performers in live music.

📖 深度解读

以下是对论文《LK Jam: System Architecture and Implementation of a Real-Time Human-AI Interactive Music Generation System using Role-Aware GRU》的结构化中文解读报告:

1. 一句话总结

本文提出了一种名为 LK Jam 的实时人机交互音乐生成系统,通过引入角色感知的轻量级 GRU 模型和基于 C++/JUCE 的无锁实时音频架构,解决了 AI 在数字音频工作站(DAW)中低延迟“对话式”爵士即兴演奏的难题。

2. 研究背景与动机

  • 核心问题:如何让 AI 在现场音乐表演中,像人类乐手一样进行低延迟、双向的即兴“对话”(如爵士乐中的“你一句我一句”交替演奏)。
  • 重要性:音乐 AI 正从“离线辅助生成工具”向“具身共同演奏者”演进,而实时交互和听觉反馈是音乐的灵魂所在,也是具身 AI 落地的重要场景。
  • 现有不足
    1. 算法瓶颈:主流大模型(如 Transformer)计算复杂度高($O(N^2)$),无法满足实时音频回调的极低延迟要求;TCN 难以兼顾微节奏精度与计算量;LSTM 过于沉重。
    2. 缺乏交互逻辑:现有 AI 多为“无限续写器”,缺乏“角色意识”和轮次交替概念,不懂得倾听与让步。
    3. 工程部署障碍:通过 OSC 等跨进程通信会引入系统级延迟;直接将 ONNX 等通用引擎嵌入 VST3 插件,会因隐式多线程调度和动态内存分配抢占 CPU 资源,导致音频线程卡顿。

3. 核心方法

  • 方法/框架:LK Jam 系统,包含角色感知的 GRU 模型、时间戳稀疏事件流编码、三阶段渐进式训练,以及基于 JUCE 和 RTNeural 的无锁实时工程架构。
  • 关键创新点
    1. 角色与乐句感知的三维数据编码:在输入特征中显式加入角色标识(Human/AI)和乐句位置标识(Start/Continue/End),让模型学会“轮次交替”和“呼吸收尾”。
    2. 时间戳稀疏事件流:抛弃传统固定节拍网格(避免量化丢失微节奏感),仅在收到实际音符时触发计算,大幅降低计算负荷。
    3. 基于 RTNeural 的编译期固化架构:利用 C++ 模板元编程在编译期固化网络拓扑,实现运行时零内存分配,彻底消除音频线程因动态分配内存导致的卡顿风险。
    4. 三阶段渐进式训练策略:从基础和声映射,到爵士风格语汇扩展,再到专家级交互逻辑对齐,逐步培养 AI 的即兴对话能力。
  • 直觉性解释:想象两个爵士乐手在台上“斗琴”。传统 AI 像个只会一直往下弹的复读机,不懂轮换。本文给 AI 加上了“身份牌”(现在轮到你弹还是听人弹)和“呼吸感”(乐句的起承转合),让它知道何时接话、何时停止。同时,为了不让 AI 的“思考”卡住音乐播放,工程师在底层把 AI 的“大脑结构”在软件编译时就焊死了,运行时绝不临时找系统要内存,从而保证了音频播放的绝对丝滑。

4. 实验与结果

  • 数据集:自建三阶段数据集(算法生成的基础和声旋律、公开爵士独奏数据集、专家定制的交互式动机呼应语料),并使用 12 调平移进行数据增强。
  • 基线方法:论文在相关工作部分讨论了 Markov、Transformer、TCN、LSTM 等方法的理论缺陷,但未提供与这些基线方法的量化对比实验
  • 主要实验结果论文目前为初步技术报告,未提供具体的量化实验数据。论文声称该架构在理论上能将自回归解码的端到端开销严格锁定在 $O(1)$ 复杂度,并大幅降低音频线程阻塞和卡顿风险。
  • 消融实验:论文仅提出了计划中的消融实验,预期移除角色标识和乐句标识会导致生成的旋律无限延伸、缺乏呼吸感和明确的终止式。

5. 优势与局限

  • 主要优势
    1. 工程落地性极强:直击 DAW 插件实时性的痛点,采用 C++/JUCE/RTNeural 实现零内存分配和无锁通信,真正打通了 AI 模型到 VST3 插件的“最后一公里”。
    2. 交互逻辑设计合理:通过显式编码“角色”和“乐句位置”,赋予了 AI 真正的“轮次交替”意识,而非单向续写。
    3. 训练策略符合认知规律:三阶段训练法循序渐进,符合人类从学和声、学语汇到学即兴交流的学习路径。
  • 局限性
    1. 缺乏实证数据支撑:作为技术报告,目前缺少延迟测试、CPU 占用率、客观指标评估及主观听感测试的实际数据。
    2. 表现力受限:为了追求极致低延迟,当前架构妥协为单音轨事件流,无法处理复杂的复调或多声部交互。
    3. 长程记忆衰减:GRU 在处理极长结构时存在固有的记忆遗忘问题,当前架构尚未解决。

6. 关键结论与启发

  • 最重要的 Takeaway:实时音乐 AI 的成功不仅取决于模型生成能力,更取决于底层工程架构的适配。通过“轻量级模型(GRU)+ 编译期固化推理(RTNeural)+ 显式角色编码”的组合拳,可以在保证音频线程绝对安全的前提下实现具有“对话感”的人机即兴演奏。
  • 启发与延伸方向
    1. 针对长结构记忆衰减,未来可探索在非实时后台线程运行“宏观结构规划模型”来指导实时生成,形成“快慢双脑”架构。
    2. 未来可探索在不破坏无锁实时性的前提下,实现轻量级多轨并发网络(如和弦与旋律解耦生成)。
    3. 该“无锁通信+编译期固化”的工程范式,对其他需要极低延迟的实时音频处理 AI 任务(如实时音色转换、智能效果器)具有极强的借鉴意义。
#77
cs.SD

Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning

Yongbin Huang, Xihao Xie, Jia Zhang
Sound (cs.SD); Artificial Intelligence (cs.AI); Cryptography and Security (cs.CR)
Comments: Accepted by IEEE Cyber AI 2026. This is the author preprint version
查看摘要
Speech Emotion Recognition (SER) systems increasingly leverage self-supervised acoustic representations, yet their vulnerability to training-time attacks remains largely underexplored. This paper presents the first systematic study of poisoning-based backdoor attacks on SER, with a focus on threats enabled by text-to-speech (TTS) generated audio. We introduce a stealthy, low-energy acoustic trigger that can be embedded imperceptibly into both natural and synthetic speech, enabling scalable and consistent poisoning. Our experiments demonstrate that SER models can be reliably compromised with high attack success rates under low poisoning ratios, while maintaining near-clean performance on benign inputs. We further show that backdoor patterns exhibit strong cross-model transferability and that self-supervised representations are particularly susceptible to learning these triggers. These findings reveal that TTS technology dramatically lowers the barrier to effective backdoor attacks, exposing critical vulnerabilities in modern SER pipelines and motivating the urgent need for dedicated defenses.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文首次系统性地研究了利用文本转语音(TTS)技术生成隐蔽音频触发器,对现代语音情感识别(SER)系统进行数据投毒后门攻击的方法,揭示了自监督语音模型在此类攻击下面临的严重安全漏洞。

2. 研究背景与动机

  • 核心问题:现代语音情感识别(SER)系统在训练时面临数据投毒后门攻击的威胁。
  • 重要性:SER已广泛应用于对话助手、心理健康监测和客服分析等场景。如果系统被植入后门,攻击者可以随意操纵情感识别结果(如将“高兴”强制识别为“愤怒”),可能导致严重的误判或安全事故。
  • 现有不足:以往针对语音系统的研究多集中在推理时的对抗攻击或环境噪声,缺乏对训练时投毒攻击的系统性研究;此外,传统的投毒方法难以兼顾大规模生成、隐蔽性和一致性。

3. 核心方法

  • 提出方法:TTS赋能的后门攻击框架。
  • 关键创新点
    1. TTS生成触发器:首次将TTS技术引入SER后门攻击,实现了低成本、大规模、高一致性的投毒样本生成,无需真实录音设备。
    2. 隐蔽的触发器设计:采用低能量、声学自然的TTS音频片段作为触发器,插入到语音末尾,难以被人耳察觉。
    3. 系统性漏洞验证:全面评估了主流自监督预训练模型(如wav2vec2, WavLM等)对这种后门攻击的易感性。
  • 直觉性解释:想象你在培训一个情感识别专家(SER模型)。攻击者偷偷在培训资料里混入了一些带有特定“暗号”(TTS生成的低能量音频片段)的录音,并告诉专家“只要听到这个暗号,就一律判定为愤怒”。因为暗号声音很小且自然,培训检查(正常评估)发现不了问题。结果专家毕业后,平时表现正常,但只要有人故意在话里夹带这个暗号,专家就会不管原意直接输出“愤怒”。

4. 实验与结果

  • 数据集:4个多语言情感语音数据集(ANAD阿拉伯语、CaFE法语、CASIA中文、JL Corpus英语)。
  • 对比模型:4种主流自监督预训练模型(wavlm-base, wav2vec2-base, data2vec-base, unispeech-sat-base)。
  • 主要实验结果
  • 高成功率与隐蔽性:在中等投毒比例(ρ=0.6)下,平均攻击成功率(ASR)在多数数据集上极高(如ANAD达96.3%,CaFE达80.0%),同时后门模型在干净数据上的准确率仅比干净模型下降约2.36个百分点。
  • 投毒比例的权衡:投毒比例越高ASR越高,但过高(如ρ=1.0)会导致干净准确率暴跌(降至22%-29%),容易被发现;而在ρ=0.4-0.5时,ASR即可超过80%,实现了隐蔽性与有效性的平衡。
  • 跨模型泛化:攻击对所有测试模型均有效,UniSpeech和Wav2Vec2最易受攻击(ASR约78%),WavLM相对最不敏感(ASR 63.4%),但依然存在显著漏洞。
  • 消融/参数分析:论文通过调整投毒比例(ρ)进行了权衡分析,揭示了攻击强度与隐蔽性之间的非线性关系;同时发现不同语言/数据集对后门的敏感度不同(CASIA数据集抵抗力最强,ASR仅53.1%)。

5. 优势与局限

  • 主要优势
    1. 攻击门槛低且可扩展:利用TTS技术,攻击者无需海量真实语音数据即可生成海量高质量投毒样本。
    2. 隐蔽性极强:触发器声学自然且能量低,不仅人耳难以察觉,且后门模型在干净输入上的表现几乎无损。
    3. 评估全面:跨4种语言、4种主流模型进行了详尽的实验,说服力强。
  • 局限性
    1. 缺乏防御机制探讨:论文主要聚焦于攻击有效性的展示,未提出或验证任何针对性的防御或检测手段。
    2. 数据集依赖性:实验显示攻击效果在不同数据集上差异较大(如CASIA上ASR较低),但论文未深入分析具体的语言或声学特征如何影响后门的植入难度。

6. 关键结论与启发

  • 最重要的Takeaway:现代基于自监督学习的SER系统极易被TTS生成的隐蔽后门攻破,TTS技术从根本上降低了后门攻击的门槛,改变了SER的安全威胁格局。
  • 启发与延伸方向
    1. 防御需求迫切:未来研究急需开发针对训练时数据投毒的专门检测算法(如频谱异常检测)和鲁棒训练机制。
    2. 模型架构反思:为何自监督模型容易学习这些人工后门?未来可探究如何设计本质上更安全的预训练目标或架构。
    3. 生成式AI的双刃剑效应:随着生成式AI的普及,其他基于深度学习的音频处理任务(如声纹识别、语音翻译)也可能面临类似的“生成式投毒”威胁,值得广泛排查。
#78
cs.SD
Chinese University of Hong Kong (CUHK) (QS Top 100)Tencent (World Famous IT Company)

Imitation Learning for Elder-Facing Speech Synthesis

Dongrui Han, Weidong Chen, Jiawen Kang, Mingyu Cui, Helen Meng 等 (6 人)
Sound (cs.SD); Artificial Intelligence (cs.AI)
Comments: accepted by Interspeech 2026
查看摘要
Recent advances in text-to-speech (TTS) synthesis have achieved highly natural and expressive speech generation. However, these systems are designed for general adults and overlook older adults' speech comprehension needs due to age-related sensory and cognitive decline. Prior work involves older adults by collecting preference feedback to tune model parameters. However, obtaining sufficient preference data is costly and difficult, as older adults quickly become fatigued during collection. In this paper, we propose a novel imitation learning (IL) framework to learn TTS models from expert demonstrations. We further improve Group Relative Policy Optimization (GRPO) with two-stage on-policy reward learning (OPRL) to mitigate reward hacking under limited supervision from expert demonstration. Experimental results show that GRPO w/ OPRL outperforms GRPO and supervised baselines in objective and subjective metrics. Audio samples are available at this https URL

📖 深度解读

1. 一句话总结

本文提出了一种基于模仿学习的适老化语音合成框架,通过学习医疗专家的语音示范并结合动态更新的在线策略奖励学习(OPRL),有效缓解了强化学习中的“奖励作弊”问题,成功生成了更受老年人欢迎的语音。

2. 研究背景与动机

  • 核心问题:现有的文本转语音(TTS)系统主要针对普通成年人设计,忽略了老年人因年龄增长导致的感官和认知衰退(如听力阈值变高)对语音理解的特殊需求。
  • 重要性:随着全球人口老龄化,语音助手、车站广播等语音交互场景日益普及,如果TTS系统不能适应老年人的听力特点,将加剧老年人的“数字鸿沟”。
  • 现有方法的不足:以往的方法(如HILvoice)需要反复收集老年人的主观偏好反馈来调整模型。这种方式不仅耗时昂贵,而且老年人极易在测试中感到疲劳,难以规模化。此外,直接使用强化学习微调TTS模型常面临“奖励作弊”问题——模型为了迎合某种偏好(如慢语速),会采取极端策略(如插入大量不自然的停顿),从而破坏了语音的整体质量和可懂度。

3. 核心方法

  • 提出的方法:论文提出了一种基于模仿学习(IL)的TTS框架,并结合改进的Group Relative Policy Optimization (GRPO) 算法进行训练。核心策略是两阶段的在线策略奖励学习。
  • 关键创新点
    1. 引入专家示范代替老年人反馈:邀请有经验的医疗专业人员录制面向老年人的语音作为“专家示范”,通过逆强化学习学习专家的奖励模型,避开了直接收集老年人偏好数据的难题。
    2. 两阶段在线策略奖励学习(OPRL):打破传统RL中奖励模型固定的惯例,将TTS模型生成的语音动态加入奖励模型的训练集中,不断迭代更新奖励模型,从而动态纠正TTS模型的“作弊”行为。
    3. 多维度复合奖励机制:结合专家奖励(评估风格)和发音奖励(基于ASR评估可懂度),并使用调和平均数进行聚合,强制模型在追求适老化风格的同时不能牺牲发音清晰度。
  • 直觉性解释:想象我们要教一个机器人对老年人说话,但直接问老年人喜欢什么太费劲了。于是我们请来经验丰富的护士做示范。为了防止机器人“画虎不成反类犬”(比如为了学护士说话慢,干脆每说一个字停顿三秒,即“奖励作弊”),我们引入了一个动态进化的“裁判”。这个裁判不仅看护士的示范,还会时不时去听机器人现在的表现,把机器人那些投机取巧的烂表现标记为反面教材,不断自我修正评判标准,最终逼着机器人学到护士说话的真正精髓,而不是单纯地拖长音。

4. 实验与结果

  • 数据集:内部粤语专家示范数据集(125对,1.5小时);外部文本数据集ZoengJyutGaai。
  • 基线方法:CosyVoice2-Yue (base)、SFT (监督微调模型)、GRPO w/o OPRL (不带OPRL的强化学习模型)。
  • 主要实验结果
  • 主观评测(MOS):由8位66-83岁的老年人进行评分。GRPO w/ OPRL Stage 2 获得了最高的MOS分(3.78),甚至超过了真实录音的Ground Truth(3.45)和SFT模型(3.55),而未使用OPRL的模型仅得2.70。
  • 客观指标:GRPO w/ OPRL Stage 2 在可懂度指标上表现最佳(SER 7.54%, CER 3.86%),优于所有基线。
  • 消融实验/对比分析揭示
  • 奖励作弊的证实:GRPO w/o OPRL 的总时长(27.62s)和静音时长(11.51s)远超真实录音(19.27s和5.43s),说明它通过疯狂加停顿来刷高奖励分数,导致MOS极低。
  • OPRL的有效性:可视化奖励模型打分显示,原奖励模型被作弊语音欺骗(给作弊语音打3.67分,比真实语音2.67分还高),而OPRL训练出的奖励模型能准确识别并给作弊语音打低分(0.35分),证明了OPRL成功遏制了奖励作弊。

5. 优势与局限

  • 主要优势
    1. 数据高效且人性化:用少量医疗专家的示范替代了大规模、高成本的老年人偏好数据收集。
    2. 有效解决奖励作弊:OPRL机制通过动态更新奖励模型,巧妙化解了强化学习在TTS中常见的过度优化问题。
    3. 兼顾风格与可懂度:复合奖励函数确保了生成的适老化语音不仅风格对路,老年人也能听得清。
  • 局限性
    1. 数据规模极小:专家示范数据仅125对(1.5小时),虽然验证了有效性,但在更复杂、更广泛文本上的泛化能力存疑。
    2. 主观评测样本量不足:主观听感测试仅邀请了8位老年人,样本量较小,可能存在统计偏差,不足以代表广泛老年群体的偏好。
    3. 语言局限性:实验仅在粤语上开展,且发音奖励依赖特定的粤语ASR模型,直接迁移到其他语种需要重新构建相关组件。

6. 关键结论与启发

  • 最重要的 takeaway:在难以直接获取目标用户(如老年人)反馈时,利用领域专家的示范结合动态演化的奖励模型(OPRL),是实现偏好对齐的有效且低成本路径。动态更新奖励模型是防止生成模型“钻空子”的关键。
  • 对后续研究的启发
    1. OPRL的泛化应用:这种动态更新奖励模型以防止奖励作弊的思路,不仅适用于适老化TTS,也可以广泛应用于其他需要细粒度风格控制的生成任务(如情感TTS、有声书合成等)。
    2. 多模态/多维度对齐:未来可以探索老年人对“文本结构”而不仅是“声学特征”的偏好,例如生成更适合老年人理解的短句或特定词汇。
    3. 扩大评测群体:后续研究应开展更大规模、更多样化的老年人主观测试,以验证该框架在真实世界复杂场景中的普适性。
👀 推荐值得看
🏷️ 领域语音合成 (TTS) > 情感/风格可控
💡 创新适老化语音合成——基于模仿学习与GRPO算法改进,引入动态更新的在线策略奖励学习(OPRL)和多维度复合奖励机制解决奖励作弊问题
⭐ 评分7.5
#79
cs.SD
Pennsylvania State University (QS Top 100)

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

Jiaxi Yang, Chaewan Chun, Jason Lucas, Yuchen Yang, Dongwon Lee
Sound (cs.SD); Artificial Intelligence (cs.AI)
查看摘要
Large Audio Language Models (LALMs) have demonstrated strong performance across a wide range of audio tasks. As they are increasingly deployed in real-world applications, ensuring their safety alignment has become more important. Although refusal mechanisms serve as a key safeguard by preventing LALMs from responding to harmful requests, they can also lead to {\em over-refusal}, where models incorrectly reject benign queries. This issue is especially challenging in the audio domain because speech that appears harmful in isolation may become benign when interpreted together with the surrounding acoustic context, such as background sounds. To study this problem, we introduce \textbf{AOR-Bench} (\textbf{A}udio \textbf{O}ver-\textbf{R}efusal \textbf{Bench}mark), the first benchmark for over-refusal specifically designed for LALMs. AOR-Bench contains 3,000 pseudo-harmful audio samples across six scenario categories. Evaluating 12 representative LALMs from six major model families, we find that over-refusal is widespread (Figure~\ref{fig:overall_performance}) and uncover several important patterns in their safety judgments. As a preliminary effort to mitigate this issue, we further explore two lightweight strategies (e.g., Chain-of-Thought and activation steering) to reduce over-refusal.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文提出了首个针对大型音频语言模型“过度拒绝”现象的基准测试,通过结合“听起来有害的语音”和“揭示良性意图的背景音”构造测试样本,揭示了当前主流模型普遍存在因忽略声学上下文而误拒良性请求的问题,并初步探索了缓解策略。

2. 研究背景与动机

  • 核心问题:大型音频语言模型在安全对齐后,普遍存在“过度拒绝”现象,即错误地拒绝实际上安全、良性的请求。
  • 重要性:随着LALMs走向实际部署,安全机制(拒绝回答有害请求)固然重要,但过度敏感会严重损害模型的可用性和用户体验。
  • 现有不足:以往关于过度拒绝的研究主要集中在文本或视觉模态。音频领域的少数研究也只是直接将文本安全数据集转换为音频,忽略了音频模态独有的特征——声学上下文。在音频中,一句孤立听来有害的话(如“如何闯红灯”),如果结合背景音(如救护车警笛),其真实意图可能完全是良性的。现有方法无法评估这种复杂的音频上下文安全问题。

3. 核心方法

  • 提出方法:AOR-Bench(Audio Over-Refusal Benchmark),一个专门评估LALMs音频过度拒绝行为的基准。
  • 关键创新点
    1. 伪有害音频构造流水线:利用文生视频模型(Sora-2)生成带有良性背景场景的视频并提取背景音,再结合TTS模型生成的“表面有害”语音,拼合成“单听有害、结合背景良性”的测试样本。
    2. 多维度副语言特征变异:在相同的文本内容下,系统性地改变语音的性别、情绪和语速,以测试这些副语言特征对模型安全判断的影响。
    3. 多LLM集成审核机制:使用多个高性能LLM投票对“背景-语音”对进行审核,确保只有“结合上下文后确属良性”的样本被保留,保证了数据集的可靠性。
  • 直觉性解释:就像一个人喊“我要闯红灯”,单听这句话像是在违法;但如果背景音里有消防车的警笛声,这句话就变成了合理的紧急救援场景。AOR-Bench就是用这种“声画结合”的测试题来考大模型,看它们会不会因为只听懂了字面意思而“错杀”良性请求。

4. 实验与结果

  • 数据集/基准:AOR-Bench,包含3,000个伪有害音频样本,覆盖农业、烹饪、紧急情况、游戏、表演、体育6个场景。
  • 基线方法:评估了6大模型家族的12个代表性LALMs(包括开源与闭源,如Gemini系列、GPT-Audio系列、Qwen系列、Kimi-Audio等)。
  • 主要实验结果
    1. 过度拒绝现象普遍存在:所有模型均出现非零的过度拒绝率,其中Gemini-2.5的平均过度拒绝率高达66.2%。
    2. 模型未充分利用背景音:当额外向模型提供背景音的文本描述时,所有模型的过度拒绝率均下降,证明模型未能有效从音频中提取并利用背景上下文进行推理。
    3. 安全与可用性的权衡难题:通过MB-Score(衡量不过度拒绝与真实拒绝的平衡)发现,Qwen2-Audio和Kimi-Audio平衡得最好,但仍有多个模型得分低于50,难以兼顾安全与可用。
  • 消融实验揭示
    1. 系统提示词影响巨大:安全性导向的提示词会大幅拉高拒绝率(甚至达到100%),而帮助性提示词则能降低拒绝率。
    2. 缓解策略有效但有代价:Chain-of-Thought(CoT)提示能显著降低过度拒绝率(如GPT-Audio从43%降至18%);激活引导技术虽能降低过度拒绝,但同时也会削弱模型对真正有害请求的拒绝能力(破坏了安全对齐)。

5. 优势与局限

  • 主要优势
    1. 填补了音频模态过度拒绝评估的空白,抓住了音频域特有的“上下文依赖”痛点。
    2. 数据构造流水线严谨,结合了多模型投票与人工评估,数据质量高(语音清晰度WER仅2.64%,95.3%的样本被人工确认为结合上下文后良性)。
  • 局限性
    1. 数据集规模和场景受限(仅6类场景,3000样本),且音频数据构造成本高,难以大规模扩展。
    2. 缓解策略较为初步,尤其是激活引导方法虽然降低了过度拒绝,却损害了整体安全性,难以直接落地。
    3. 对副语言特征(性别、情绪、语速)的实验未发现一致规律,可能受限于当前LALMs对细粒度音频特征的感知能力不足。

6. 关键结论与启发

  • 最重要的Takeaway:当前LALMs的安全对齐机制过于依赖语音转写后的文本内容,而严重忽略了非文本的声学上下文。这种“只看字面意思”的安全机制是导致音频过度拒绝的根本原因。
  • 启发与延伸方向
    1. 未来的LALMs训练需要引入多模态上下文融合的安全对齐策略,让模型学会“听音辨境”。
    2. CoT作为一种轻量级推理干预手段,展示了巨大潜力,后续可探索如何将其内化到模型的原生推理过程中,在不损失安全性的前提下降低过度拒绝。
    3. 随着LALMs音频感知能力的提升,未来可以进一步研究如何利用副语言特征(如情绪、语速)作为判断用户真实意图的辅助信号,构建更细粒度的安全机制。
👀 推荐值得看
🏷️ 领域语音大模型与对话 > 对话评测 Benchmark
💡 创新音频过度拒绝评测基准——基于伪有害音频构造流水线,结合表面有害语音与良性背景音评估LALMs的上下文安全理解能力
⭐ 评分7.5
#80
cs.SD
Shanghai Jiao Tong University (QS Top 100, 985, 211)Carnegie Mellon University (QS Top 100)

Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption

Xun Gong, Jinchuan Tian, Haoran Wang, William Chen, Shinji Watanabe 等 (6 人)
Sound (cs.SD)
Comments: Accepted by InterSpeech 2026, For the original codes, see this https URL , we are submitting a PR to espnet master branch
查看摘要
Current text-guided audio editing methods rely on paired training data, predefined operation templates, and separate processing pipelines across speech, music, and sound. We present Bagpiper-Edit to enable open-ended audio editing via free-form natural language instructions. We reformulate audio editing as a rich-caption rewriting task by treating a rich caption as the semantic representation of an audio clip. The user request is translated into an edited caption, which then guides Bagpiper-Edit to generate the target edited audio with the original audio as contextual acoustic anchor. This unlocks the potential of free-form editing, and circumvents the need for paired audio-editing training data, enabling powerful zero-shot editing capabilities. Evaluations across speech, audio, and free-form editing show Bagpiper-Edit maintains good consistency to the original audio and achieves similar performance to other expert models in most cases. Demo: this https URL , Codes: this https URL & this https URL

📖 深度解读

1. 一句话总结

本文提出了Bagpiper-Edit框架,通过将音频编辑转化为“富文本字幕重写”任务,并利用自监督学习让模型以原始音频为“锚点”,在无需配对编辑数据的情况下实现了零样本、开放式的语音/音乐/音效自由编辑。

2. 研究背景与动机

  • 核心问题:如何根据用户的自由形式自然语言指令(如“把背景改成雷雨天,并把第二句歌词改成XXX”),对原始音频进行开放式编辑,同时保持未编辑部分的声学特征不变。
  • 重要性:现实世界的音频包含语音、背景音、音乐等复杂混合物。理想的音频编辑应像文本编辑一样直观,用户只需用自然语言描述需求,模型就能精准修改指定元素并保留其余部分。
  • 现有不足
    1. 依赖模板与原子操作:早期方法只能处理“添加鸟鸣”、“提高音量”等死板指令,或需要用大模型将复杂指令拆解为这些基本操作,缺乏灵活性。
    2. 严重依赖配对训练数据:现有的自然语言控制编辑模型需要海量的“原始音频-编辑指令-编辑后音频”三元组数据进行训练,成本极高。
    3. 领域割裂:语音编辑、音效编辑往往需要不同的专家模型分别处理,缺乏统一框架。

3. 核心方法

  • 提出框架:Bagpiper-Edit,一个将音频编辑转化为文本空间变换的零样本框架。
  • 关键创新点
    1. 富文本字幕重写:不直接操作音频信号,而是先把原始音频转化为详细的文本描述,用文本LLM根据用户指令重写这段描述,最后再根据新描述生成音频。
    2. 自监督声学锚点训练:无需人工标注的编辑数据。通过“音频重复”(让模型学会复刻相同音频)和“音频分段”(利用连续音频片段天然具有相同背景和说话人特征),教会模型在生成新内容时保持原有的声学环境。
    3. 多轮对话(MT)模式:将输入构建为多轮对话形式,第一轮作为上下文示例,帮助模型在第二轮生成时更好地维持音色和环境一致性。
  • 直觉性解释:想象你要修改一幅画。传统方法是直接在画上涂改,很容易弄坏背景。Bagpiper-Edit的做法是:先给这幅画写一段极其详细的“说明书”(富文本字幕);然后你告诉画师想改什么,画师把“说明书”改掉;最后,画师把原画放在旁边作为参考(声学锚点),看着新的“说明书”重新画一幅。这样既实现了自由修改,又保证了原画的风貌不流失。

4. 实验与结果

  • 数据集/基准:使用LibriSpeech test-clean和AudioSet构建了语音编辑、音频事件编辑和自由形式编辑三个任务。
  • 基线方法:对比了CosyVoice-3、Ming-UniAudio-Edit、Step-Audio-EditX(语音专家模型),AudioLDM2(音效模型),以及未经过自监督训练的Bagpiper-Base。
  • 主要实验结果
    1. 语音编辑:Bagpiper-Edit (MT) 在无需配对数据的情况下,编辑准确率达79.76%,说话人相似度达0.83,整体表现与依赖大量数据的专家模型CosyVoice-3相当。
    2. 音频事件编辑:在添加音效任务中,Bagpiper-Edit (MT) 成功插入目标声音(editCLAP最高),且保持了背景一致性,获得最佳LLM评分;在移除任务中也表现出色。
    3. 自由形式编辑:Bagpiper-Edit (MT) 在复杂语义修改下获得了最高的语义对齐分数和LLM评分。
  • 消融实验揭示
    1. ST vs MT模式:单轮(ST)模式过于“保守”,过度锚定原始音频导致编辑失败率高;多轮(MT)模式在“保留原音频特征”和“执行新指令”之间取得了最佳平衡。
    2. 自监督训练的必要性:没有该训练的Base模型会导致严重的音色丢失(SpkSIM从0.83跌至0.58)。

5. 优势与局限

  • 主要优势
    1. 零样本与数据高效:通过自监督学习绕过了对昂贵配对编辑数据的依赖。
    2. 统一且开放:用单一的文本重写接口统一处理语音、音乐、音效的复杂组合编辑,无需级联多个专家模型。
    3. 高保真度:声学锚点机制有效防止了编辑过程中的音色和环境漂移。
  • 局限性
    1. 生成稳定性不足:作为零样本模型,在极端情况(如整句替换)下偶尔会出现严重失败,稳定性不及喂了大量配对数据的专家模型。
    2. 复杂场景处理受限:受限于基础模型的能力,处理多说话人分离等高度复杂声学场景仍显吃力。

6. 关键结论与启发

  • 核心Takeaway:将复杂的跨模态(音频)编辑任务降维到文本空间进行语义重写,再结合自监督的“锚点”机制进行生成,是实现零样本、开放式音频编辑的有效路径。多轮对话(MT)结构比单轮结构更适合这种条件生成任务。
  • 启发与延伸方向
    1. “富文本字幕重写”的范式具有很强的可迁移性,未来可应用于视频编辑、3D场景编辑等其他模态。
    2. 论文使用外部文本LLM进行字幕重写,未来可探索将这一步内化到多模态大模型中,实现端到端的直接交互,减少误差传播并提升用户体验。
    3. 扩大基础模型对复杂声学场景的理解能力,是进一步提升此类零样本编辑能力的突破口。
🔥 推荐必读
🏷️ 领域通用音频生成 > 音频编辑/修复
💡 创新零样本开放式音频编辑——基于富文本字幕重写范式,引入自监督声学锚点训练和多轮对话模式,将音频编辑转化为文本空间变换
⭐ 评分8.0
#81
cs.SD
Carnegie Mellon University (QS Top 100)

Online Predictive Coding for Dual-Mode Self-Supervised Speech Model

Keita Goto, Takashi Maekaku, Jin Sakuma, Jinchuan Tian, Yusuke Shinohara 等 (6 人)
Sound (cs.SD)
Comments: Accepted to Interspeech 2026
查看摘要
Dual-mode self-supervised speech models are pre-trained to handle streaming and non-streaming conditions simultaneously. However, their attention is computed over different context ranges, which often makes optimization difficult. In previous work, we proposed online registers, additional tokens intended to compensate for missing future context in streaming mode, but the gains remained limited. To address these issues, we introduce two improvements for robust dual-mode pre-training: (1) Online Predictive Coding (OPC), which regularizes the registers through multi-step future prediction, and (2) Dual-mode Layer Normalization, which stabilizes optimization. We fine-tune the proposed dual-mode self-supervised speech models for speech recognition on LibriSpeech and WSJ. Results show that OPC consistently reduces the online-offline performance gap; at 160 ms latency on LibriSpeech, word error rates improve from 3.65% to 3.40% on test-clean and from 10.15% to 9.65% on test-other.

📖 深度解读

1. 一句话总结

这篇论文提出了一种在线预测编码(OPC)方法和双模态层归一化机制,通过让附加的“在线寄存器”显式预测未来的语音上下文,有效缩小了流式与非流式语音识别模型之间的性能差距。

2. 研究背景与动机

  • 核心问题:自监督语音模型(S3Ms)通常在拥有完整上下文的“离线”模式下预训练,但在实际部署到“在线”(流式)实时场景时,由于缺乏未来上下文,性能会显著下降。双模态模型试图在同一模型中同时支持在线和离线模式,但两者注意力机制可见的上下文范围不同,导致优化困难。
  • 重要性:实时语音应用(如流式ASR)对低延迟有强烈需求,同时又不希望牺牲离线场景的高精度。一个能同时兼顾两者的统一模型具有极大的实用价值。
  • 现有不足:作者团队此前提出了“在线寄存器”来补偿缺失的未来上下文,但由于缺乏显式约束,寄存器未能充分编码未来信息,性能提升有限。此外,在线和离线模式共享归一化层参数,会因两者特征分布不同而加剧优化的不稳定性。

3. 核心方法

  • 提出方法:论文提出了一个改进的双模态自监督预训练框架,核心包含两个模块:在线预测编码(OPC)和双模态层归一化。
  • 关键创新点
    1. 在线预测编码 (OPC):受对比预测编码(CPC)启发,强制在线寄存器去预测未来多步的离线表征,从而显式地将未来上下文信息压缩到寄存器中。
    2. 双模态层归一化:为在线和离线模式分别维护独立的 LayerNorm 仿射参数($\gamma$ 和 $\beta$),其余权重共享,以此稳定因引入寄存器而加剧的分布偏移。
    3. 联合优化:将 OPC 损失与 wav2vec 2.0 的掩码预测损失联合优化,使模型既能利用双向上下文,又能具备预测未来的能力。
  • 直觉性解释:想象你在做同声传译(在线模式),听不到后面的句子,但你可以拿个小本子(在线寄存器)记录当前线索。以前这个小本子没人管,现在OPC要求你根据小本子上的线索去“猜”后面几秒会发生什么,猜得越准,说明你对当前和未来上下文的把握越好。同时,因为同传和普通翻译(离线模式)的节奏不同,给它们分别配备专用的“调音台”(双模态LayerNorm),避免互相干扰。

4. 实验与结果

  • 数据集/基准:在 LibriSpeech (960h) 上预训练,在 LibriSpeech 和 WSJ 上进行 ASR 微调评估。
  • 基线方法:无寄存器的双模态模型、带在线寄存器的模型,以及先前的双模态方法 UFO2。
  • 主要实验结果
  • 在 LibriSpeech 160ms 极低延迟下,相比纯双模态基线,OPC 将在线 WER 从 3.65% 降至 3.40% (test-clean),从 10.15% 降至 9.65% (test-other)。
  • 离线性能也同步提升,WER 从 2.73% 降至 2.64% (test-clean)。
  • 在 640ms 延迟下与 UFO2 对比,本方法在保持离线性能持平的情况下,在线 WER 显著更低(test-clean 3.1 vs 3.8,test-other 8.3 vs 9.4)。
  • 消融实验揭示
  • 预测未来帧数 $N_f$ 设为 4 时效果最佳。太少(如2)信息不够,太多(如8)预测难度过大反而损害性能。
  • OPC 在极低延迟(如 160ms)下提升最明显,说明它确实弥补了未来上下文的缺失。160ms+OPC 的效果甚至能媲美基线 320ms 的效果,实现了“降延迟不降精度”。

5. 优势与局限

  • 主要优势
    1. 零额外算法延迟:所有改进都在预训练阶段完成,推理时不增加流式算法的延迟。
    2. 双向收益:不仅大幅提升了在线流式识别的准确率,还连带提升了离线识别的性能。
    3. 即插即用:双模态 LayerNorm 实现简单,对稳定双模态训练有直接帮助。
  • 局限性
    1. 跨域泛化的轻微负面影响:在 WSJ eval93 数据集上,OPC 导致离线 WER 略有上升(相对增加 1.2%),表明辅助预测任务可能引入了预训练域的特定偏差。
    2. 超参数敏感性:预测步数 $N_f$ 需要人工调优,且不同数据集(如 test-other 更难)对上下文长度的需求可能不同。
    3. 验证任务单一:论文仅在 ASR 任务上进行了验证,未展示该预训练模型在说话人识别、情感分析等其他下游任务上的通用表征能力。

6. 关键结论与启发

  • 核心 Takeaway:在流式语音模型中,仅仅给模型额外的“记忆槽”(寄存器)是不够的,必须通过显式的“预测未来”任务来约束这些槽位,才能真正弥补看不到未来的缺陷。同时,针对不同模式解耦归一化层是稳定联合训练的有效手段。
  • 启发与延伸方向
    1. 这种“通过预测未来来正则化中间表征”的思路,可以推广到其他需要处理流式/非流式双模态的模态(如视频流理解、实时机器翻译)。
    2. 未来可探索自适应的预测步数机制,或引入更高级的预测目标(如对抗预测),以减少跨域时的性能折损。
    3. 可以将该框架扩展到非 ASR 的语音任务(如 SUPERB 基准),验证其作为通用流式语音表征提取器的潜力。
#82
cs.SD
University of Southampton (QS Top 100)Hong Kong Polytechnic University (QS Top 100)University of Edinburgh (QS Top 100)

LISE : Listenable Interpretable Speaker Embeddings

Xiaoliang Wu, Chongxin Gan, Ke Liu, Peter Bell, Jennifer Williams
Sound (cs.SD); Computation and Language (cs.CL)
Comments: Accepted to Interspeech 2026
查看摘要
Deep neural network-based automatic speaker verification (ASV) systems achieve impressive performance but their embedding representations remain opaque, lacking a structured and perceptually verifiable explanation of the vocal characteristics they encode. Existing approaches either require annotation of speaker attributes or introduce alternative representations whose interpretability is unvalidated with listeners. We propose Listenable Interpretable Speaker Embeddings (LISE), a label-free framework that decomposes pretrained speaker embeddings into a small set of components. This decomposition yields a structured representation that supports the analysis of what information has been encoded by speaker embeddings. LISE preserves ASV performance with negligible EER degradation on x-vector and ECAPA-TDNN. Crucially, the interpretability of these components for human listeners is demonstrated through listening experiments, where participants distinguished speakers with 83.9% accuracy.

📖 深度解读

以下是对论文《LISE: Listenable Interpretable Speaker Embeddings》的结构化中文解读报告:

1. 一句话总结

本文提出了一种名为LISE的无标签框架,将预训练的说话人嵌入分解为少量正交且非负的组件,在几乎不损失声纹识别性能的前提下,通过人类听觉实验证实了这些组件具有可解释的听觉特征。

2. 研究背景与动机

  • 核心问题:深度学习自动说话人验证(ASV)系统提取的嵌入向量虽然性能优异,但如同“黑盒”,缺乏结构化且能被人类感知验证的语音特征解释。
  • 重要性:打开这个“黑盒”有助于揭示ASV的工作原理、诊断模型偏见(如对特定口音或性别的偏差),并推动可控语音合成等应用的发展。
  • 现有不足
    1. 基于属性标签的方法:需要昂贵且涉及隐私的人工标注,且离散的类别标签(如性别、口音)无法覆盖连续的嗓音特征(如沙哑、明亮),往往导致ASV性能大幅下降。
    2. 无监督高维稀疏方法:借鉴自然语言处理(NLP)中的稀疏自编码器,将嵌入扩展到数千个二值维度。但人类能描述的语音特征是有限且连续的,这种高维离散表示不仅难以感知,也缺乏人类听觉层面的有效性验证。

3. 核心方法

  • 方法/框架:LISE(Listenable Interpretable Speaker Embeddings)。这是一种事后分解框架,通过无监督重建将预训练的说话人嵌入分解为 $K$ 个组件。
  • 关键创新点
    1. 低维结构:不同于NLP中的数千维稀疏特征,LISE强制使用极少的组件(如 $K=35$),避免连续的语音特征被过度分散。
    2. 非负连续权重:限制组件权重 $c \ge 0$,禁止特征间的相互抵消,使得每个组件的贡献都是独立且可累加的,同时允许特征有程度之分(而非简单的“有/无”)。
    3. 正交性约束:通过正则化项强制组件矩阵正交,确保每个组件捕捉独立的语音变化轴,减少冗余。
  • 直觉性解释:就像把一杯复杂的混合果汁分解为“甜度”、“酸度”、“果味”等几个独立的口味维度。LISE把高维的、难以理解的声纹向量拆解成几十个有明确声音特征的“组件”(如“低沉”、“语速快”),每个组件的权重表示该特征有多明显,且组件之间互不干扰。

4. 实验与结果

  • 数据集与基准:使用 VoxCeleb2 训练分解模型,在 VoxCeleb1-O 上评估。嵌入提取器使用了 x-vector 和 ECAPA-TDNN。
  • 基线方法:PCA(无监督但允许负值)、Luu et al.(有监督属性分类)、Iben et al.(高维二值稀疏嵌入),以及未经分解的原始嵌入(性能上限)。
  • 主要实验结果
  • ASV性能保持:在 $K=35$ 时,LISE 在 x-vector 上达到 3.08% 的等错误率(EER)(原始为 2.30%),在 ECAPA-TDNN 上达到 2.10%(原始为 1.80%),远优于有监督方法(6.70%),且与无监督的 PCA 持平甚至超越。
  • 人类听觉验证:在听音辨别实验中,LISE 的人类辨识准确率高达 83.9%,大幅超越 PCA(59.1%)和 Iben et al.(49.0%)。35个组件中有32个达到了70%以上的辨识率。
  • 消融实验揭示
  • 组件数量 $K$ 的实验表明,EER 在 $K \approx 35$ 时趋于稳定,证明少量组件足以捕获绝大部分说话人区分信息。
  • 数据稀缺实验显示,即使只用50%的数据训练,性能下降也微乎其微,说明预训练嵌入本身已包含足够稳定的结构。
  • 参与者自发反馈显示,高权重组件确实对应着如“深沉共鸣嗓音”、“年轻女性语速快”等直观听觉特征。

5. 优势与局限

  • 主要优势
    1. 无需标签且保真度高:完全无监督,不依赖昂贵的属性标注,且几乎不损害原有的声纹验证性能。
    2. 人类感知层面的真可解释性:首次通过严谨的听觉实验验证了可解释性,而非仅停留在数学相关性层面。
    3. 设计契合语音本质:低维、非负、正交的设计完美契合了人类语音特征有限且连续的物理与感知规律。
  • 局限性
    1. 事后分解的依赖性:LISE 是对预训练模型的“事后修补”,其解释能力受限于原始嵌入空间本身编码的信息量,无法纠正底层模型的结构性缺陷。
    2. 数据集语言污染:VoxCeleb1 虽假设为纯英语,但包含少量非英语样本,导致少数(3/35)组件捕捉到的是语言模式而非说话人本身的嗓音特征。
    3. TTS应用验证不足:论文展示了利用组件直接控制TTS(SpeechT5)合成语音原型的初步尝试,但缺乏系统性的客观评估。

6. 关键结论与启发

  • 最重要的 Takeaway:声纹嵌入中高度复杂的信息可以被压缩并分解为少数几个人类可听、可理解的维度,且这种分解不需要牺牲机器验证的准确性。数学上的“可分”与人类听觉上的“可懂”可以通过合理的约束(非负、正交、低维)统一。
  • 对后续研究的启发
    1. 可控语音合成:可以直接将LISE组件作为TTS系统的条件输入,让用户通过调节“明亮度”、“沙哑度”等直观旋钮来定制声音,而非调整晦涩的隐变量。
    2. 模型偏见诊断:可以通过分析特定组件的激活情况,审查ASV系统是否对某些特定的嗓音特征(如某种口音或沙哑嗓音)存在系统性偏见。
    3. 跨语言与多语言扩展:未来可在严格单语或系统标注的多语言数据集上应用LISE,探索其在口音控制或语音翻译中的潜在应用。
🔥 推荐必读
🏷️ 领域说话人技术 > 说话人嵌入/表征
💡 创新可解释说话人嵌入——基于事后无监督分解,引入低维、非负、正交约束将预训练嵌入分解为人类可听的组件
⭐ 评分8.0
#83
cs.SD

Sea-Scan: High-Accuracy, ML-based Dark Vessel Detection and Localisation via Weakly Supervised DAS Monitoring

Tian Tian, Agastya Raj, Lara Flanagan, John Kennedy, Marco Ruffini
Sound (cs.SD); Machine Learning (cs.LG); Signal Processing (eess.SP)
Comments: This paper is accepted for presentation at ECOC 2026
查看摘要
We present an ML-based vessel detection and localization system, trained with weak supervision from imperfect AIS labels, that achieves a 97.8% detection rate at 1.98% false-trigger rate, successfully identifies dark-vessel events from unlabeled data.

📖 深度解读

以下是对论文《Sea-Scan: High-Accuracy, ML-based Dark Vessel Detection and Localisation via Weakly Supervised DAS Monitoring》的结构化中文解读报告:

1. 一句话总结

本文提出了Sea-Scan框架,利用海底光缆的分布式声学传感(DAS)技术,通过弱监督机器学习方法在不依赖完美AIS数据的情况下,高精度自动检测和定位关闭了定位系统的“暗船”,以保护海底光缆等关键基础设施。

2. 研究背景与动机

  • 核心问题:检测关闭或没有AIS(自动识别系统)应答器的“暗船”,这些船只对承载全球95%洲际数据流量的海底光缆等关键基础设施构成直接威胁。
  • 重要性:为了防范破坏,需要一种不依赖船只主动配合的独立传感手段。DAS技术能将现有海底光缆转化为长达数百公里的连续声学传感器阵列,具备探测船只辐射噪声的潜力。
  • 现有不足
    1. 传统阵列处理方法需要复杂的环境参数校准和专家调优,难以规模化。
    2. 现有深度学习方法多在短距离(几公里到几十公里)且环境均匀的光缆上测试,未证明在长距离复杂环境下的有效性;且多简化为二分类或仅检测强尾迹,无法进行沿光缆的精确定位。
    3. 最致命的是,现有方法将AIS数据视为绝对正确的标签,但AIS数据存在时间/位置不匹配、报告间歇性以及暗船本身无信号等系统性噪声,这会导致模型训练和评估产生偏差。

3. 核心方法

  • 方法名称:Sea-Scan,一个基于编码器骨干网络的端到端检测与定位框架。
  • 关键创新点
    1. 弱监督训练目标:结合top-K多示例学习(MIL)和时间平滑约束,容忍AIS标签噪声。
    2. 因式分解时空检测头:通过乘性门控将“何时有船”(时间分支)和“船在哪”(空间分支)解耦。
    3. 基于迟滞的触发机制:结合趋势一致性过滤,将连续输出转化为稳定的警报。
  • 直觉性解释
    想象海底光缆是一个超长的麦克风。首先把声音信号按频段拆解提取能量包络。由于AIS数据不准(可能偏了几公里),系统先画一个宽泛的“可疑区域”(±2km走廊)。
    在模型设计上,系统把判断“有没有船经过”(时间维度)和“船具体在哪”(空间维度)分开看。只有当时间上出现持续的能量起伏(像船开过那样由远及近再变远),且空间上也有对应反应时,两者相乘才会触发高置信度。这就像一个“双重保险”,能过滤掉那些突然响一下但缺乏持续性的局部噪音。最后,系统通过观察能量是否持续上升来确认船只靠近,进一步减少误报。

4. 实验与结果

  • 数据集/基准:爱尔兰海120公里海底光缆的35天连续DAS监测数据(约14TB),包含1518次AIS船舶穿越事件和4343个无AIS报告的噪声事件。
  • 基线方法:论文未直接与其他具体基线模型进行数据对比,主要是验证自身框架在长距离全孔径光缆上的性能突破。
  • 主要实验结果
  • 在平衡测试集上,检测率达97.8%,误报率仅1.98%
  • 沿光缆的中位定位误差仅为239.9米
  • 漏检主要发生在85公里以外的远端(噪声较大)。
  • 处理速度:120公里10秒的数据仅需9.3秒处理,具备实时能力。
  • 消融实验/暗船发现:论文未提供传统的消融实验数据,但展示了在无AIS的纯噪声数据集中,模型成功揪出了42个“暗船”事件,且人工复核其频谱特征确为船舶辐射噪声。

5. 优势与局限

  • 主要优势
    1. 实用性强:直接利用现有海底光缆,无需额外硬件,且能在普通消费级GPU(RTX 4090)上实时运行。
    2. 抗噪性好:弱监督学习有效解决了AIS标签不准的痛点,时空解耦的乘性门控大幅降低了误报。
    3. 全链路覆盖:实现了从短距离到120公里长距离的端到端检测与高精度定位。
  • 局限性
    1. 远距离性能衰减:85公里以外的漏检率较高,说明长距离传输带来的信噪比下降仍需优化。
    2. 缺乏对比基线:论文未与其他主流DAS检测方法进行直接的数据对比,难以评估其绝对优势。
    3. 暗船验证依赖人工:42个暗船事件仅通过“人工审查频谱特征”确认,缺乏更客观的交叉验证(如雷达或卫星图像)。

6. 关键结论与启发

  • 核心Takeaway:即使监督数据(AIS)充满噪声,通过合理的物理先验(时空解耦、趋势一致性)和弱监督学习(Top-K MIL),也能从复杂环境噪声中提取出可靠的船舶信号,实现大范围、实时的暗船监测。
  • 启发与延伸方向
    1. 可以探索多模态融合(如SAR卫星、雷达)来自动验证暗船事件,减少人工干预。
    2. 针对光缆远端信噪比低的问题,可以研究自适应的噪声抑制或距离感知的模型结构。
    3. 该框架的“时空解耦+弱监督”思路可迁移到其他基于线状传感器的异常检测任务中(如管道泄漏监测、边境入侵检测等)。
#84
cs.SD

Direct Raw Audio Signal Processing via Reservoir Computing: An Investigation into 'Feature-Free' Architectures

Rinku Sebastian, Simon O Keefe, Martin A Trefzer
Sound (cs.SD); Machine Learning (cs.LG)
查看摘要
This paper evaluates Reservoir Computing (RC) as an autonomous, 'feature-free' framework for audio processing, designed to eliminate traditional, handcrafted feature extraction stages. We investigate whether the high-dimensional temporal dynamics inherent in a reservoir can function as a robust end-to-end processor for the direct classification of raw acoustic signals. By bypassing computationally intensive representations like MFCCs, this approach seeks to mitigate significant intellectual and pre-processing bottlenecks in traditional signal pipelines. Our study evaluates and compares shallow, sequential, and parallel deep reservoir architectures to determine their capacity for hierarchical feature representation. Experimental results demonstrate that the proposed parallel approach consistently outperforms shallow and sequential baselines while maintaining low model complexity. These findings highlight the potential of RC as an efficient and scalable alternative for time-domain audio processing, offering a promising pathway toward deployable, low-power acoustic systems with minimal preprocessing requirements.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种基于并行储备池计算(Parallel Reservoir Computing)的“无特征”音频处理框架,通过直接处理原始音频信号进行分类,免去了传统MFCC特征提取步骤,并在实验中证明了其并行架构优于浅层和串行深度模型。

2. 研究背景与动机

  • 核心问题:如何在不使用传统手工特征提取(如MFCCs)且不依赖庞大深度学习模型的前提下,直接对原始音频波形进行高效分类。
  • 重要性:传统的音频识别流程高度依赖MFCC等特征提取,这不仅是计算瓶颈,也是人工先验知识的限制;而现有的端到端深度神经网络(如Deep CNNs)虽然能直接处理原始波形,但模型极其庞大,需要海量数据和能耗,难以部署在低功耗边缘设备上。
  • 现有不足:传统的浅层储备池计算(ESN)虽然轻量,但只有一个固定的时间尺度,且缺乏类似耳蜗的频率分解能力,直接处理原始音频时表现不佳;而串行连接的深度储备池在处理原始信号时,第一层会“洗掉”高频细节,导致后续层接收到的是模糊的信息,存在信息瓶颈。

3. 核心方法

  • 方法名称:并行“无特征”储备池架构。
  • 关键创新点
    1. 轻量级时域降维:不使用傅里叶变换等频谱分析,而是将原始信号分帧(250个样本),通过非线性峰峰值检测提取每个窗口的代表值,极大降低了数据量并保留了能量包络。
    2. 并行多尺度架构:摒弃了层与层之间的串行连接,让多个储备池同时接收原始输入信号,避免了串行架构中的“信号冲刷”和信息退化。
    3. 异构漏率设计:为并行的不同储备池设置不同的漏率。低漏率的储备池充当“慢速积分器”,捕捉全局节奏和长时共振;高漏率的储备池充当“快速跟踪器”,捕捉快速辅音和音高变化。
  • 直觉性解释:传统方法像把声音画成频谱图再认,这篇论文直接听声音。为了听得准,它用了“多个耳朵”(并行储备池)同时听:有的耳朵反应慢,能听出说话的整体节奏和音色;有的耳朵反应快,能抓住转瞬即逝的爆破音。最后把这些耳朵听到的结果综合起来做判断,避免了串行传递中“以讹传讹”导致的信息失真。

4. 实验与结果

  • 数据集:TI-46 和 AudioMNIST 数据集(包含数字识别和说话人识别任务)。
  • 基线方法:浅层储备池、串行深度储备池。
  • 主要实验结果
  • 并行架构(PFRC)在所有任务中均优于浅层基线。例如,在AudioMNIST说话人识别测试中,准确率从浅层模型的58.33%大幅提升至70.51%;在AudioMNIST数字识别测试中,从43.59%提升至64.10%。
  • 串行深度架构表现不佳,即使给第二层补充原始输入副本,也无法超越浅层模型。
  • 消融/对比实验揭示:串行架构由于第一层非线性滤波会掩盖高频细节,存在严重的信息瓶颈;而并行架构通过保持信号完整性和多尺度特征多样性,有效解决了这一问题。

5. 优势与局限

  • 主要优势
    1. 极简的端到端处理:完全去除了MFCC等计算密集型预处理步骤,仅训练读出层,模型复杂度极低。
    2. 多尺度特征捕捉:通过并行异构漏率,能同时捕捉音频中的瞬态细节和长时全局特征。
    3. 硬件友好:参数量少、低延迟,非常适合部署在低功耗的神经形态计算和边缘计算硬件上。
  • 局限性
    1. 模型稳定性差:论文承认,权重初始化或超参数的微小漂移会导致储备池内部状态不可预测的波动,影响输出可靠性。
    2. 计算开销随规模非线性增长:并行架构需要拼接多个储备池的状态向量,导致读出层权重矩阵变大,训练成本随节点数呈立方级增长。
    3. 绝对精度仍有差距:论文讨论中坦言,虽然该方法在无特征条件下表现亮眼,但传统基于特征的流水线可能仍能达到更高的峰值准确率。

6. 关键结论与启发

  • 最重要的Takeaway:在处理原始时间序列信号时,“并行多尺度集成”架构远优于“串行层级抽象”架构,因为前者能保持信号完整性并避免信息退化。储备池计算完全有能力作为自包含的处理器,在时域内直接完成音频分类。
  • 对后续研究的启发
    1. 针对原始信号处理,应更多探索并行拓扑结构而非单纯的堆叠加深。
    2. 当前的轻量级降维(峰峰值采样)虽然有效,但未来可引入自适应降维方法,以进一步优化数据足迹并匹配信号的信息密度。
    3. 急需开发稳定化协议(如正则化手段或动态权重约束),以解决储备池高维动力学对超参数过于敏感的问题,这是其走向实际部署的关键。
#85
cs.SD
University of Toronto (QS Top 100)

LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity

Kexin Li, Xiao Hu, Ilya Grishchenko, David Lie
Sound (cs.SD); Artificial Intelligence (cs.AI)
查看摘要
Recent advances in generative audio have made voice cloning increasingly effortless, enabling voice fraud, impersonation, and other forms of unauthorized use. A common attack finetunes a speech generation model on recordings of a target speaker, allowing the model to synthesize speech in that speaker's voice. Audio watermarking offers a promising defense by embedding detectable signals into audio. A practical watermark must satisfy two key properties: robustness and radioactivity. Existing audio watermarking methods typically embed signals into low-level representations, such as waveforms or spectrograms, which makes them vulnerable to signal-level manipulations and limits their transfer to downstream models. We introduce LambdaMark -- the first generic radioactive watermarking scheme. Unlike all previous approaches, LambdaMark achieves generic radioactivity by embedding multi-bit watermark information into semantic audio latent representations. Our watermarks have semantic interpretation and are thus more likely to be learned by a downstream model through finetuning. LambdaMark includes a lightweight watermark encoder to inject multi-bit message-dependent perturbations into semantic audio representations and a decoder to detect watermark presence and recover the embedded bit information. Encoder and decoder are trained using a custom multi-component loss that preserves fidelity of the watermarked audio, increases bit-level recovery rate, and improves robustness against common distortions and adversarial removal attempts. Experiments show that LambdaMark achieves near-perfect robustness under common distortions. LambdaMark is also the only watermark that is robust against all evaluated removal attacks. Furthermore, LambdaMark exhibits general and robust radioactivity and remains robust to distortions and adversarial removal attacks even on the generated outputs of those finetuned models.

📖 深度解读

1. 一句话总结

本文提出了首个基于语义潜在表示的音频水印框架LambdaMark,通过将多比特水印信息嵌入音频的语义特征中,不仅实现了对各类信号失真和对抗性移除攻击的极强鲁棒性,还首次实现了通用的“放射性”(即水印能被下游生成模型学习并在其生成的音频中重现),从而有效追踪未经授权的语音克隆行为。

2. 研究背景与动机

  • 核心问题:随着生成式音频技术的发展,语音克隆变得轻而易举,导致语音欺诈、深度伪造和版权侵权频发。如何有效验证音频是否被滥用(如被用于非法微调语音克隆模型)成为亟待解决的安全问题。
  • 重要性:保护声音演员、艺术家的知识产权,以及防范基于语音的社会工程学欺诈,对维护数字内容生态的安全与信任至关重要。
  • 现有方法不足:现有的音频水印方法通常将水印作为不可察觉的残差噪声嵌入到低级表示(如波形或频谱图)中,并依赖心理声学掩蔽效应。这种局部化、结构化的低级残差极易被自适应攻击(如HarmonicAttack)识别并移除;更重要的是,它们缺乏“放射性”,即水印在下游模型微调时会被当作噪声丢弃,无法从生成的音频中检测出来。

3. 核心方法

  • 提出的方法:LambdaMark,一个围绕冻结的预训练语义音频骨干网络(编码器Dasheng + 解码器SemanticVocoder)构建的轻量级水印编解码器框架。
  • 关键创新点
    1. 语义级水印嵌入:首次将水印信息注入到音频的语义潜在表示中,而非波形或频谱残差。水印表现为潜在空间中一致的“语义偏移”,与音频内容绑定,而非局部噪声。
    2. 自适应的时序广播编码器:将N比特消息映射为潜在空间中的一个单位方向向量,并在所有时间帧上均匀广播。同时,根据原始潜在特征的能量自适应缩放扰动幅度,确保水印既可检测又不破坏保真度。
    3. 端到端可微的编解码设计:解码器通过时间维度平均池化读取水印,且训练时模拟真实的部署路径(潜在扰动 -> 声码器合成波形 -> 重新编码 -> 解码),确保水印能经受住有损的编解码往返过程。
  • 直觉性解释:传统方法像是在音频的“皮肤表面”画上隐形的记号,很容易被洗掉或模仿;而LambdaMark则是轻微改变了音频的“内在基因(语义)”。这种改变不影响音频听起来表达的意思,但下游模型在学习这段音频时,会把这个“基因特征”也学进去,并在自己生成的音频中表现出来。因为它是全局的语义特征,所以局部的信号处理或针对表面噪声的攻击都无法将其抹除。

4. 实验与结果

  • 数据集/基准:LibriSpeech(训练和测试)、VCTK(跨数据集测试)。
  • 基线方法:AudioSeal, WavMark, AudioMarkNet。
  • 主要实验结果
  • 鲁棒性:在11种常见失真下,LambdaMark在LibriSpeech上达到99.92%的检测准确率和97.94%的比特恢复率(BRR),在VCTK上达到99.88%准确率和95.08% BRR。而基线方法在相位偏移、高斯噪声等简单失真下就崩溃至接近随机猜测(约50%准确率)。
  • 对抗攻击防御:面对EnCodec压缩、AudioSquareAttack和HarmonicAttack,LambdaMark是唯一在所有攻击下均保持高鲁棒性(如HarmonicAttack下LibriSpeech准确率98.5%)的方法,而其他基线均失效。
  • 放射性:在微调YourTTS、SemanticVocoder和AudioLDM2后,LambdaMark生成音频中仍能高准确率检测到水印(如SemanticVocoder达到100%准确率)。相比之下,声称具有放射性的AudioMarkNet仅在特定数据集和YourTTS上有效,在其他模型上完全失效。
  • 鲁棒放射性:即使下游模型生成的音频再次遭受失真或对抗性攻击,LambdaMark的水印依然可检测(多数情况下准确率>90%)。
  • 消融实验/其他分析:通过频谱图分析证实,LambdaMark的水印残差分布更广泛且与内容相关,而非像传统方法集中在局部高频/高能区域。此外,测试了不同比特大小(16, 32, 48),均保持高检测率。

5. 优势与局限

  • 主要优势
    1. 极强的鲁棒性:由于水印嵌入在语义空间,不依赖局部波形残差,能够抵御包括自适应学习攻击在内的各种移除尝试。
    2. 通用的放射性:能够跨数据集、跨多种下游生成模型(TTS、声码器、扩散模型)传播水印,支持黑盒所有权验证。
    3. 多比特容量与保真度平衡:支持16-48位的多比特信息嵌入用于追踪溯源,同时通过多目标损失函数保持了较高的感知音质。
  • 局限性
    1. 对离散分词模型的放射性较弱:对于基于离散语音Token的大语言模型(如Spark-TTS),量化过程会破坏细粒度的语义水印信号,导致放射性下降(BRR降至74.38%),且增加水印强度会损害音质。
    2. 保真度指标权衡:虽然无参考指标(NISQA)得分最高,但由于引入了语义偏移,有参考指标(ViSQOL)得分低于基线(即波形并非原波形的精确副本)。

6. 关键结论与启发

  • 最重要的Takeaway:音频水印不应仅仅停留在“不可见的波形噪声”层面,而应上升到“可控的语义偏移”。语义空间的表示不仅对信号级攻击具有天然免疫力,还能被下游生成模型作为“特征”学习,从而实现真正的放射性追踪。
  • 启发与延伸方向
    1. 针对离散Token化模型的适配:未来的研究可以探索如何将语义水印与离散语音Token空间对齐,以应对日益流行的基于LLM的语音生成模型。
    2. 跨模态语义水印:这种在语义潜在空间注入水印的思路,可能启发其他模态(如视频、3D生成)的放射性水印技术。
    3. 水印保真度评估标准的反思:对于语义水印,传统的全参考指标(如ViSQOL)可能不再适用,需要发展更关注语义保持和感知自然度的评估体系。
#86
cs.SD

CoughPhase-CLR: Designing an acoustics-informed foundation model for coughing sound classification

Marius Moldovan, Anton Batliner, Thomas M. Berghaus, Björn W. Schuller, Andreas Triantafyllopoulos
Sound (cs.SD)
查看摘要
In this work, we introduce CoughPhase-CLR, a self-supervised learning framework designed to leverage the physiological phases of a cough for robust representation learning. Unlike generic contrastive frameworks, CoughPhase-CLR constructs positive pairs based on these specific acoustic phases. We pre-trained our model on approximately 40 hours of public cough audio and evaluated it across five downstream tasks, including COVID-19 detection, chronic obstructive pulmonary disease (COPD) state classification, and smoker status prediction. Our results demonstrate that cough-specific pre-training consistently outperforms standard random-cropping techniques when training on cough recordings. Additionally, we benchmarked a diverse set of state-of-the-art models on COPD state classification, highlighting the difficulty of this task. The best-performing models, pretrained on either general audio or respiratory sounds, achieved a UAR of 57\%, failing to outperform the state-of-the-art performance of 84\% UAR achieved using speech analysis.

📖 深度解读

1. 一句话总结

本文提出了一种利用咳嗽生理阶段(爆发期与中间/发声期)构建正样本对的自监督预训练框架 CoughPhase-CLR,证明了在同等数据量下该声学先验方法优于随机裁剪,并揭示了仅靠咳嗽声区分慢性阻塞性肺疾病(COPD)状态的极高难度。

2. 研究背景与动机

  • 核心问题:如何在小数据量下,通过自监督学习(SSL)从咳嗽声中提取有效的特征表征,用于下游的呼吸系统疾病诊断。
  • 重要性:咳嗽是呼吸系统疾病的重要非侵入性生物标志物。然而,仅检测出咳嗽是不够的,真正的挑战在于通过咳嗽声诊断出潜在的病理(如COVID-19、COPD等)。
  • 现有不足:当前主流的音频基础模型(如OPERA)依赖海量的预训练数据(超400小时)。在医疗数据因隐私和稀缺性难以大规模获取的现实下,这种“暴力出奇迹”的方法难以复制。此外,通用的自监督方法(如随机裁剪构建正样本对)没有利用咳嗽信号特有的生理结构,容易让模型关注静音或背景噪声,在小数据量下表现不佳。

3. 核心方法

  • 方法/框架:CoughPhase-CLR,一个基于对比学习的自监督预训练框架,使用 EfficientNet-B0 作为骨干网络。
  • 关键创新点
    1. 基于声学先验的正样本对构建:摒弃了传统的随机裁剪,根据咳嗽的生理阶段将一次咳嗽切分为两段——第一段为爆发期,第二段为中间期与发声期。这两段构成对比学习的“正样本对”。
    2. 精准的咳嗽切分策略:通过检测前60%音频中的最大峰值,并在峰值后20毫秒处切分,确保完整捕获能量最高的爆发期。
  • 直觉性解释:传统的对比学习在音频上像是在“盲人摸象”,随机切两块看看是不是同源的;而 CoughPhase-CLR 像是一个“懂生理学”的老师,它知道一次咳嗽包含“突然爆发的喷气(爆发期)”和“随后的气流摩擦(中间/发声期)”。它强迫模型去学习这两个不同阶段之间的内在联系,从而让模型明白“什么才是一次真正的咳嗽”,而不是把注意力浪费在两次咳嗽之间的静音或背景噪声上。

4. 实验与结果

  • 数据集
  • 预训练:COUGHVID 和 UK COVID-19(约40小时公开咳嗽数据)。
  • 下游评估:COUGHVID、Coswara 以及私有的 COPD-DE 数据集,涵盖5个任务(COVID-19检测、性别识别、吸烟状态预测、COPD状态分类)。
  • 基线方法:eGeMAPS(手工特征)、CNN14、EfficientNet-B0(从零开始训练/ImageNet预训练)、VGG-16、wav2vec2.0、HuBERT、HeAR 以及 OPERA 系列模型。为了公平对比,作者特意在相同咳嗽数据上重训了 OPERA-CE(记为 OPERA-CE-Cough)。
  • 主要实验结果
    1. 数据效率更高:在5个下游任务中,CoughPhase-CLR 有4个任务击败了使用相同数据量训练的 OPERA-CE-Cough。在数据缩放实验中,无论使用20%还是100%的数据,CoughPhase-CLR 始终优于随机裁剪策略。
    2. 数据量仍是硬道理:尽管策略更优,CoughPhase-CLR 整体表现仍未能超越在400小时多类型呼吸音数据上预训练的原始 OPERA-CE。
    3. COPD任务极具挑战:在 COPD 状态分类任务上,所有模型表现均不理想。最好的模型(OPERA-CT 和 CNN14-AudioSet)仅达到 57% 的 UAR(未加权平均召回率),远低于此前使用语音分析达到的 84% UAR。
  • 消融/分析实验揭示
  • 显著性图谱分析显示,CoughPhase-CLR 成功引导模型将注意力集中在咳嗽的高能量起始部分,而随机裁剪模型(OPERA-CE-Cough)的注意力发散,甚至关注无关的低频带和咳嗽间静音区。
  • 手工声学特征分析表明,COPD稳定期与急性加重期的咳嗽特征高度重叠,多数特征无统计学显著差异,解释了为何该任务如此困难。

5. 优势与局限

  • 主要优势
    1. 数据高效性:通过引入领域先验知识,显著提升了小数据量下的自监督学习效果。
    2. 可解释性更强:模型注意力图谱直观证明了“阶段感知”策略有效引导了模型关注咳嗽的核心声学特征。
    3. 实验设计严谨:通过重训基线模型控制数据变量,并进行了数据缩放对比,结论具有很强的说服力。
  • 局限性
    1. 受限于数据规模:虽然策略更好,但在绝对性能上依然打不过“大力出奇迹”的大数据预训练模型。
    2. 模态本身的瓶颈:论文实际展示了咳嗽声在区分COPD状态上的效果远不如语音,单靠咳嗽模态可能存在天花板。
    3. 数据集多样性不足:COPD-DE数据集样本量极小(166个),且未在多疾病、多并发症的真实临床场景下进行验证。

6. 关键结论与启发

  • 最重要的 Takeaway:在自监督学习中,“视图的质量”比“视图的多样性”更重要。结合特定领域先验(如咳嗽的生理阶段)来设计对比学习任务,是在数据受限的医疗AI领域破局的有效路径。然而,数据量依然具有统治力,小数据+好策略目前仍难敌大数据+普通策略。
  • 启发与延伸方向
    1. 多模态融合:既然咳嗽声在COPD分类上表现不佳(57% UAR),而语音表现优异(84% UAR),未来的系统应融合咳嗽、语音、呼吸音等多种声学模态以提升诊断准确率。
    2. 先验策略的泛化:这种“阶段感知”的预训练思路可以启发其他具有明确生理/物理阶段的信号处理任务(如心跳周期、睡眠呼吸事件等)。
    3. 呼吁临床数据共享:论文暴露出医疗AI缺乏多疾病、多并发症标注数据集的问题,未来需要社区共同努力构建更大规模、经过临床验证的多样化数据集。
👀 推荐值得看
🏷️ 领域副语言与健康 > 医学/健康检测自监督表征学习 > 通用音频表征
💡 创新自监督对比学习预训练——基于咳嗽生理阶段(爆发期与中间/发声期)构建正样本对,替代传统随机裁剪策略
⭐ 评分7.0
查看摘要
Speech deepfake countermeasures (CMs) are compared almost exclusively by equal error rate (EER), a metric computed at an oracle threshold chosen on the labeled test set. Deployed CMs enjoy no such oracle: a threshold must be fixed in advance and applied to unlabeled target data. We audit this gap with a frozen state-of-the-art SSL-AASIST detector trained on ASVspoof 2019 LA. While its in-domain EER is 0.21%, transferring its LA-calibrated threshold to the In-the-Wild corpus yields a half total error rate (HTER) of 39.5%, with 78.7% of bona fide speech rejected, even though the In-the-Wild EER (11.2%) appears moderate. We then test whether popular unlabeled test-time corrections close this gap, and first prove a simple proposition: any strictly increasing score transform, including z-norm, temperature/shift calibration, and embedding mean alignment under a frozen linear head, cannot change EER. An audit of seven corrections on In-the-Wild and ASVspoof 2021 DF confirms the proposition empirically and exposes two further failure modes: AS-norm with an unlabeled target cohort collapses (EER 11.2% to 60.2%), and pseudo-label calibration that reduces HTER by 38% relative on In-the-Wild degenerates to 50% HTER on DF21, whose spoof prior is 96%. No audited correction reduces EER by more than 1% relative. We recommend reporting HTER at a transferred threshold alongside EER.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文揭示了语音深度伪造检测器在跨域部署时,仅依赖等错误率(EER)指标会严重掩盖阈值失效的问题,并从理论和实验两方面证明了常见的无标签测试时校准方法无法改善EER,且在调整决策阈值时极其脆弱。

2. 研究背景与动机

  • 核心问题:语音防欺骗检测系统在实际部署时,面临跨域数据分布偏移导致的性能崩溃问题。
  • 重要性:如果系统在实际应用中把大量真实语音误判为伪造(或反之),系统将完全不可用。准确评估并修复这种部署失败是AI安全落地的关键。
  • 现有不足:目前学术界几乎只使用EER(等错误率)来评估模型。EER是在带标签的测试集上“事后”寻找的最优阈值,但实际部署时测试集没有标签,只能用源域的阈值。此外,从业者在遇到跨域问题时,常盲目借用说话人验证领域的无标签测试时校准方法(如z-norm),但缺乏对这些方法有效性的系统审查。

3. 核心方法

  • 提出的方法/框架:论文并未提出一个新的检测模型,而是提出了一个系统性的审计框架。作者冻结了一个在ASVspoof 2019 LA上训练的SOTA模型(SSL-AASIST),采用“阈值迁移协议”(将源域EER对应的阈值直接应用到无标签目标域),并审查了7种常见的无标签测试时校准方法。
  • 关键创新点
    1. 单调不变性定理(Proposition 1):从数学上证明,任何严格单调递增的分数变换(如z-norm、温度缩放、均值对齐)只能改变决策阈值(操作点),绝对无法改变EER(排序能力)。
    2. 揭示三大失败模式:系统性地暴露了现有校准方法在跨域部署时的三种崩溃机制(详见实验部分)。
    3. 提出评估新标准:强烈建议学术界在报告EER的同时,必须报告迁移阈值下的HTER(半总错误率)。
  • 核心思路直觉解释
    想象一个考官(模型)给学生的试卷打分,EER就像是考官在看完所有标准答案后,找一个让“及格线冤枉错杀”和“漏网之鱼”相等的完美分数线。但在实际部署(跨域考试)时,考官只能拿着旧考试定下的分数线去卡新考试的成绩。论文证明了,如果你只是简单地把新考试的成绩整体拉伸或平移(单调变换),学生之间的相对排名(EER)不会变,分数线依然卡不准。更糟的是,盲目借用其他考试的平均分来调整分数线,反而会让系统彻底崩溃。

4. 实验与结果

  • 数据集/基准:源域使用 ASVspoof 2019 LA;目标域使用 In-the-Wild (ITW) 语料库和 ASVspoof 2021 DF 数据集。
  • 对比的基线方法:无校准的原始模型,以及7种校准方法(C1-C7,包括z-norm、温度/偏移校准、均值对齐、CORAL、两种AS-norm、BN统计量自适应)。
  • 主要实验结果
    1. EER掩盖了灾难性部署失败:模型在源域EER仅0.21%,在ITW上的EER看似温和(11.2%),但如果直接迁移阈值,HTER飙升至39.5%,其中78.7%的真实语音被错误拒绝
    2. 理论验证:C1-C3(单调方法)的EER与基线完全一致到小数点最后一位,完美印证了单调不变性定理。
    3. 没有任何方法能显著改善EER:所有7种方法对EER的改善均不到1%。
  • 消融实验揭示的三大失败模式
    1. 理论性失效:单调变换无法改变EER。
    2. 队列污染:使用目标域无标签数据进行AS-norm(C5),EER从11.2%暴涨至60.2%。因为目标域混入了大量伪造语音,破坏了类间分离度。
    3. 先验敏感性:温度/偏移校准(C2)在ITW上表现最好(HTER降至24.4%),但在DF21上彻底崩溃(HTER达50%)。因为C2假设目标域正负样本比例均衡,而DF21中96%都是伪造样本,导致校准函数退化,系统直接放行所有样本。

5. 优势与局限

  • 主要优势
    1. 理论贡献扎实:单调不变性定理一针见血地指出了大量已有校准方法的本质局限,能帮助学界避免在错误的方向上浪费时间。
    2. 评估视角犀利:通过引入HTER和FRR/FAR分解,戳破了“低EER等于好模型”的学术幻觉,极具实践指导意义。
    3. 分析极其深入:不仅列出实验结果,还深入剖析了方法失效的数学和统计学机制(如伪标签校准在先验偏移下的不适定问题)。
  • 局限性
    1. 模型覆盖面有限:审计仅基于一个SOTA模型(SSL-AASIST),虽然定理是通用的,但非单调方法的效果可能因模型架构而异。
    2. 数据集子集采样:由于算力或数据获取原因,实验使用了LA和DF21的部分子集,绝对数值可能与完整官方协议下略有差异。
    3. 未提出解决方案:论文定位为“审计”与“揭露问题”,指出了校准方法的脆弱性,但并未提出一种能同时解决EER不变性和先验敏感性的全新鲁棒方法。

6. 关键结论与启发

  • 最重要的TakeawayEER是一个具有欺骗性的“神谕”指标。 一个在测试集上EER极低的模型,如果阈值不能自适应迁移,在实际部署中可能毫无用处。同时,那些看似合理的无标签分数校准“小技巧”,要么在数学上根本无法改善模型识别能力,要么在未知的样本分布先验下极其脆弱。
  • 对后续研究的启发
    1. 评估标准改革:未来的防欺骗挑战赛和论文应当将“迁移阈值下的HTER”作为核心指标之一。
    2. 研究方向转移:既然分数层面的单调校准无效,真正的跨域泛化修复需要深入到特征几何层面或进行非单调的干预。
    3. 显式估计先验:未来的无标签测试时适应方法,必须将“未知目标域的类别先验估计”作为核心模块,而不是假设正负样本均衡。
#88
cs.SD

Time-Frequency Weighted Losses for Phoneme Reconstruction in DNN-Based Speech Enhancement

Nasser-Eddine Monir, Paul Magron, Romain Serizel
Sound (cs.SD); Computation and Language (cs.CL)
Comments: Accepted at Interspeech 2026
查看摘要
Conventional training losses for speech enhancement based on the signal-to-distortion ratio (SDR) treat all time-frequency (TF) regions uniformly, overlooking the fine-grained spectral cues that are relevant to specific phoneme intelligibility. We propose a TF weighting framework that modulates the SDR objective based on local speech presence, speech-to-interference ratio (SIR), and spectral flux. By integrating these factors into a differentiable objective, the framework emphasizes TF bins with high speech-noise competition while also accounting for transient cues such as consonant bursts. Experimental results show that our approach improves objective frequency-weighted enhancement metrics, as well as phoneme recognition accuracy, particularly for consonants. Spectral analysis shows better reconstruction of mid-frequency structures at less adverse SIR.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文提出了一种时频加权的语音增强训练损失函数,通过重点优化“语音与噪声竞争激烈”以及“包含辅音等瞬态特征”的时频区域,有效提升了复杂噪声环境下的音素级语音重建质量和识别准确率。

2. 研究背景与动机

  • 核心问题:基于深度学习的多通道语音增强(MCSE)通常使用信号失真比(SDR)作为训练损失。传统SDR损失“一视同仁”地对待所有时频区域,忽略了不同语音成分对可懂度的贡献差异。
  • 重要性:从语音学角度看,可懂度高度依赖于特定的声学线索(如辅音转换、爆破音、摩擦音等瞬态特征)。当语音和噪声能量相近时,这些关键线索最容易被掩蔽。对于助听器等场景,保留这些瞬态和中频结构至关重要。
  • 现有不足:传统的SDR损失没有考虑这种局部感知差异;作者团队之前提出的基于局部信干比(SIR)的加权方法虽然有效,但未能将语音存在性、语音-噪声竞争以及瞬态动态特征统一到一个框架中。

3. 核心方法

  • 提出方法:一种结构化的时频加权SDR损失框架(TF-weighted SDR)。该框架通过调整权重 $w(f, t)$ 来调制不同时频单元对总损失的贡献。
  • 关键创新点
    1. SIR与语音存在性联合门控 ($L_{SIR \cdot SP}$):利用SIR的门控函数和语音能量的门控函数相乘。直觉上,当语音和噪声能量都很大(竞争激烈)时赋予高权重,而当语音占绝对主导或语音能量极低时赋予低权重,避免过度优化不重要的区域。
    2. 引入频谱通量捕捉瞬态特征 ($L_{SIR \cdot SP \cdot SF}$):爆破音等瞬态音素能量可能不高,但频谱变化极快。通过计算帧间频谱通量(SF)并加入权重,提升模型对这类关键辅音特征的敏感度。
    3. 探索纯数据驱动的可学习权重 ($L_{learn}$):作为对比,提出一种不依赖时变先验、仅学习静态频带权重的方法,以探究感知先验与数据驱动各自的优劣。
  • 核心思路(直觉解释):想象你在嘈杂的派对上听朋友说话。如果朋友声音很大(高SIR)或者根本没说话(低语音能量),你不需要费力去听。但当朋友说话声和背景噪音差不多大时(高竞争),或者他突然爆出一个辅音(如"p"、"t"的瞬态变化)时,这些信息最容易被淹没也最影响理解。该方法就是告诉AI模型:“把注意力集中在这些高竞争和快速变化的区域,算误差时给它们更大的权重。”

4. 实验与结果

  • 数据集与基准:使用LibriSpeech(纯净语音)和Disconoise(噪声)生成混响混合数据。测试集包含白噪声(WN)和语音成形噪声(SSN),输入SIR范围从-8dB到8dB。
  • 基线方法:传统时域SDR损失 ($L_T$)、先前最佳方法 ($L_{logSIR}$)。
  • 主要实验结果
  • 整体指标:在WN和SSN下,结合SIR、语音存在和频谱通量的损失 ($L_{SIR \cdot SP \cdot SF}$) 表现最稳定,在提升信干比(SIR)的同时,没有显著牺牲整体信号质量(SDR/SAR)。
  • 音素识别率(PA):在WN条件下,$L_{SIR \cdot SP \cdot SF}$ 显著提升了音素准确率,辅音PA从34.0%提升至36.1%,元音从43.7%提升至45.5%。
  • 词错率(WER):在中高SIR水平(0dB以上)下,提出的方法显著降低了WER。
  • 消融与深入分析
  • 对比 $L_{learn}$ 发现,纯数据驱动的静态权重在SSN噪声下表现不佳,说明引入时变的语音-噪声竞争先验(SIR+SP)是必要的。
  • 爆破音的频谱分析表明,在0dB和8dB输入SIR下,$L_{SIR \cdot SP \cdot SF}$ 比基线更准确地重建了中频段(Mel第6-12带)的频谱形状;但在极低SIR(-8dB)下,基线反而稍好,说明在极端恶劣条件下模型难以有效提取加权特征。

5. 优势与局限

  • 主要优势
    1. 感知导向明确:将语音学知识(瞬态特征、掩蔽效应)融入损失函数,直接优化了对可懂度最关键的音素区域。
    2. 鲁棒性强:结合频谱通量的方案 ($L_{SIR \cdot SP \cdot SF}$) 在不同噪声类型和不同SIR水平下表现最为稳定,避免了单一SIR加权在SSN噪声下性能退化的问题。
    3. 不改变主干网络:该方法仅修改损失函数,可即插即用地应用于现有的端到端语音增强模型(如FaSNet)。
  • 局限性
    1. 极端低信噪比下效果有限:在-8dB等极低SIR条件下,新方法的频谱重建效果和词错率不如基线,说明当语音被极度掩蔽时,加权机制难以发挥作用。
    2. 部分传统指标轻微下降:在SSN条件下,为了换取更高的音素识别率和信干比,信号失真比(SDR)和短时客观可懂度(STOI)有轻微下降,存在一定的权衡。
    3. 缺乏主观听感测试:论文使用Wav2Vec2识别准确率作为可懂度代理指标,尚未进行真实人类听众的主观语音感知测试。

6. 关键结论与启发

  • 最重要的Takeaway:语音增强模型的训练不应“一视同仁”,通过显式建模并加权“语音-噪声竞争激烈”和“频谱快速变化”的时频区域,可以在不损害整体信号质量的前提下,显著提升机器和人类对关键音素(尤其是辅音)的识别率。
  • 对后续研究的启发
    1. 可以探索更精细的听觉感知现象融入损失函数,如特定频带的掩蔽阈值、频率依赖的语音接收阈值等。
    2. 未来研究可以尝试将该时频加权框架与专为可懂度设计的滤波器结合,进一步对齐助听器场景的客观需求。
    3. 启发研究者在评估语音增强时,除了传统的SDR/STOI,应更多关注音素级别的重建质量评估。
👀 推荐值得看
🏷️ 领域语音增强与分离 > 语音增强
💡 创新时频加权语音增强损失函数——基于传统SDR损失改进,联合局部信干比、语音存在性与频谱通量进行时频权重调制
⭐ 评分7.5
#89
cs.SD

Improving Text-to-Music Generation with Human Preference Rewards

Yonghyun Kim, Junwon Lee, Haiwen Xia, Yinghao Ma, Chris Donahue
Sound (cs.SD); Artificial Intelligence (cs.AI); Machine Learning (cs.LG)
Comments: ICME 2026 Grand Challenge on Academic Text-to-Music Generation
查看摘要
We describe our entry to the efficiency track of the Academic Text-to-Music (ATTM) Grand Challenge at ICME 2026. Beyond the challenge protocol's FAD-CLAP and CLAP score, we add a learned human-preference reward from TuneJury, a twin pairwise ranker trained over open music-preference datasets. The reward serves both as a training-time conditioning signal and as a sample-selection criterion. The pipeline combines five engineering decisions on a 120M-parameter FluxAudio-S backbone, four at training time and one at inference: (i) training-time reward conditioning that doubles as an inference-time CFG axis, (ii) a sweep over five score-conditioning architectures, where training and inference use different variants, (iii) expert iteration on the top decile, (iv) a short preference-tuning pass (CRPO) for audio-text alignment, and (v) inference post-processing via joint CFG, source separation, and loudness normalization. Per-stage decomposition on 100 Song Describer prompts shows training-time reward conditioning as a functional conditioning axis, expert iteration as the dominant contributor, the preference-tuning pass adding only noise-level gain, and the inference-time score scalar already saturated by the end of the chain.

📖 深度解读

1. 一句话总结

本文提出了一种结合人类偏好奖励的文本到音乐生成流水线,通过在训练阶段引入奖励条件化和专家迭代,显著提升了轻量级音乐生成模型的质量,并发现奖励信号在训练时被模型权重“吸收”后,推理时的调节作用会失效。

2. 研究背景与动机

  • 核心问题:在参数量受限(≤500M)的条件下,如何提升文本到音乐生成模型的质量,使其更好地符合人类听觉偏好。
  • 重要性:该研究面向ICME 2026 ATTM大挑战赛的高效赛道,探索在有限算力下实现高质量音乐生成的工程路径,这对降低音乐生成模型的部署门槛具有重要意义。
  • 现有不足:现有的轻量级基线模型(如FluxAudio-S)缺乏对人类偏好的对齐;此外,直接使用混合音频训练容易导致模型为了刷高分数而生成人声伪影,从而在纯器乐参考集上评估时表现不佳。

3. 核心方法

  • 方法/框架:基于120M参数的FluxAudio-S主干,提出了一个包含5个工程决策的三阶段训练+推理流水线。引入了TuneJury(一个基于人类偏好数据训练的排序器)提供的奖励分数。
  • 关键创新点
    1. 奖励条件化与CFG轴:将人类偏好奖励分数作为Fourier嵌入的旁侧输入,并在推理时作为无分类器引导(CFG)的一个额外轴。
    2. 混合架构交叉加载:训练前两阶段使用更稳定的GlobalAdaLN (v1) 结构,在第三阶段将权重无缝迁移到表现更好但较难训练的InputAdd (v2) 结构中。
    3. 奖励引导的专家迭代:用模型自身生成的样本中,排名前10%的优质样本(由TuneJury和CLAP分数共同筛选)对模型进行微调。
  • 直觉性解释:想象一个音乐家(模型)在练习。首先,给他设定一个“目标质量分数”(奖励条件化),让他知道什么是好音乐;接着,让他自己创作,挑出最符合大众口味的前10%作品反复练习(专家迭代);最后,稍微微调一下以更贴合曲谱要求(CRPO)。有趣的是,经过这些训练后,音乐家已经把“好音乐”的标准内化到了肌肉记忆里,真正上台表演时,再给他调“目标分数”旋钮已经没用了(推理时饱和)。

4. 实验与结果

  • 数据集/基准:训练集为MTG-Jamendo(约535K个10秒器乐片段),内部验证集为SDD-100,官方参考集为SDD-706。
  • 基线方法:MeanAudio发布的无条件FluxAudio-S检查点。
  • 主要实验结果
  • 相比基线,完整流水线将FAD-CLAP从0.5998降至0.4238,CLAP分数从0.230提升至0.285。
  • 在官方隐藏测试集上,提交结果达到FAD 0.498,CLAP 0.270。
  • 消融实验揭示
    1. 专家迭代是核心:带来了最大的性能提升(FAD-CLAP下降0.0362)。
    2. 推理时分数调节失效:SFT阶段奖励条件化有效,但经过专家迭代和CRPO后,奖励信号被吸收进权重,推理时改变分数$s$几乎不起作用。
    3. 架构迁移的不对称性:v1权重加载到v2结构中安全有效,反之则会导致模型崩溃。
    4. CRPO作用微乎其微:仅带来噪声级别的提升,不具备统计显著性。

5. 优势与局限

  • 主要优势
    1. 算力高效:整个训练和推理流水线在单张RTX A5000上仅需约40 GPU小时。
    2. 工程洞察深刻:通过详尽的消融实验,诚实地揭示了“奖励信号在训练时被吸收、推理时饱和”的现象,以及架构迁移的不对称性,这些发现对后续研究极具参考价值。
    3. 巧妙的工程组合:通过v1训练+v2推理的混合策略,以及3次Demucs源分离去除残留人声等后处理手段,最大化了轻量级模型的性能。
  • 局限性
    1. 失去细粒度控制:由于推理时的分数调节旋钮已饱和,用户无法在推理阶段动态控制生成音乐的质量偏好。
    2. CRPO性价比低:在当前规模和设置下,CRPO偏好微调阶段几乎没有实质收益,增加了流程复杂性。
    3. 泛化性未经验证:论文承认这些发现是基于FluxAudio-S架构得出的,是否能迁移到其他主干网络仍是未知数。

6. 关键结论与启发

  • 最重要的Takeaway:在生成模型中引入奖励机制时,将其作为训练时的条件信号比作为推理时的控制旋钮更有效;模型会将奖励信号吸收进自身权重中,因此“自我博弈+优质样本筛选”的专家迭代是最有效的提升手段。
  • 启发与延伸方向
    1. 理论层面需要研究为什么流匹配模型在推理时能进行超出训练分布的CFG外推,以及这种外推在何时会崩溃。
    2. 实践层面,未来可以探索如何设计偏好优化方法,使得模型在提升基线质量的同时,保留推理时的可控性(即不让旋钮饱和)。
    3. AI辅助研究工作流:本文透明地披露了人类主导设计、AI Agent(Claude)负责编写代码和起草论文的协作模式,展示了AI在加速系统工程落地中的潜力。
👀 推荐值得看
🏷️ 领域音乐生成 > 文本到音乐
💡 创新文本到音乐生成——基于FluxAudio-S主干,引入人类偏好奖励条件化与专家迭代提升轻量级模型质量
⭐ 评分7.5
#90
cs.SD

Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead 解读失败

Muyang Du, Jason Roche, Junjie Lai
Sound (cs.SD); Artificial Intelligence (cs.AI)
Comments: 6 pages, 1 figure, 4 tables, Interspeech 2026
查看摘要
Streaming text-to-speech synthesis in cascaded LLM-TTS systems still faces latency challenges as most TTS models require full context before initiating generation. We present S5-TTS, a streaming variant of T5-TTS that enables low-latency, word-by-word incremental speech synthesis through encoder-decoder language modeling and monotonic alignment learning. S5-TTS begins generating speech immediately after receiving the first few words, substantially reducing end-to-end response latency. To maintain quality under limited lookahead, we introduce a lookahead-causal masking mechanism with Conv-based auxiliary attention that preserves intelligibility and speaker similarity, and employ interleaved multi-source distillation to further restore naturalness. Experiments show that S5-TTS achieves comparable quality to full-context T5-TTS, supports zero-shot synthesis with high speaker similarity, and significantly reduces end-to-end latency for practical conversational AI systems.

📖 深度解读

[PDF 下载失败,无法解读]

#91
cs.SD
Hong Kong University of Science and Technology (QS Top 100)

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

Wei Xue, Junlan Feng, Shilei Zhang, Yue Wang, Ruosong Yang 等 (12 人)
Sound (cs.SD)
Comments: 11 pages, ISCSLP 2026 challenge proposal
查看摘要
Recent advances in text-to-speech (TTS) have greatly improved speech naturalness, speaker similarity, and controllability. However, most existing controllable TTS systems still rely on explicit user-provided style prompts, making it difficult to automatically determine how a sentence should be spoken in long and complex conversational scenarios. This proposal introduces the ISCSLP 2026 CoT-TTS Challenge, which aims to evaluate whether a system can infer the intended speaking manner from contextual information and generate speech consistent with both the reasoning output and the surrounding scene. The challenge contains two tracks: text-context-aware CoT-TTS and audio-context-aware CoT-TTS. We construct a large-scale bilingual training set from speech-rich media and provide carefully filtered evaluation data for leaderboard comparison. Each system is required to output both a chain-of-thought reasoning analysis and the generated speech waveform. The official evaluation combines objective metrics, multimodal LLM-based evaluation, and human subjective assessment. To facilitate reproducibility, we provide inference code together with a fine-tuning recipe for a 0.6B Qwen3-based model trained via a three-stage strategy. This challenge is expected to support research on context understanding, chain-of-thought reasoning, and expressive speech generation for applications such as film dubbing, audiobook production, virtual characters, and spoken dialogue agents. Further information about the associated challenge is available at: this https URL

📖 深度解读

1. 一句话总结

本文提出了ISCSLP 2026 CoT-TTS挑战赛,旨在解决复杂对话场景下语音合成难以自动控制风格的痛点,要求系统根据上下文(文本或音频)生成显式的思维链推理来决定说话方式,并据此合成自然且符合场景的语音。

2. 研究背景与动机

  • 核心问题:在长篇复杂对话场景(如影视配音、有声书、虚拟人对话)中,如何让TTS系统自动推断出一句话“应该怎么说”(即情感、语气、节奏等),而不是依赖人工提供显式的风格提示。
  • 重要性:真实应用中,逐句手动设定说话风格极其耗时且不切实际。赋予模型“察言观色”的能力,是迈向通用语音交互和自动化内容生成的关键。
  • 现有不足
    1. 级联系统(如ASR-LLM-TTS):存在模块间信息丢失、延迟高、且受限于下游TTS模型能力的问题。
    2. 端到端上下文感知TTS:虽然能利用历史对话,但上下文理解与语音风格的映射是“黑盒”隐式的,无法解释模型为何选择某种风格,难以评估和调试。
    3. 数据匮乏:现有对话TTS数据集(如DailyTalk及其衍生版)多局限于日常闲聊,场景简单、说话人多样性差、数据规模小,无法支撑复杂场景的训练。

3. 核心方法

本文主要提出了一项挑战赛的整体框架,包含任务定义、数据集构建、基线模型和评估标准。
- 关键创新点
1. 显式CoT推理输出:要求模型不仅输出语音,还必须输出一段解释“为何这样说话”的思维链分析,将隐式推理显式化,提升可控性与可解释性。
2. 大规模双语数据集:从影视、广播剧等丰富媒体中构建了约1.6万小时、300万条片段的中英双语数据集,附带情感与多维度的CoT推理标注。
3. 防“钻空子”的评估体系:在LLM评估环节引入“推理信息量”得分作为调节因子,防止模型生成“因为对方说话了所以要回答”这类正确的废话,鼓励输出具体、有上下文依赖的推理。
- 核心思路直觉解释:就像一个演员在念台词前,先在脑海中过一遍前情提要、角色心理和场景氛围(这就是CoT推理),然后再决定用什么样的语气和情感把台词说出来。本文提供的基线模型通过三阶段训练(先学认字和发音对齐,再学结合上下文进行推理和配音,最后用高质量数据精修),让一个轻量级模型(0.6B)也能具备这种“先思考后开口”的能力。

4. 实验与结果

注:本文为挑战赛提案,主要展示数据集构建与基线可行性,未包含系统性的对比实验数据。
- 数据集/基准:构建了约16K小时训练集(中英比例约46:54),并从另一独立数据池中经多重严格筛选(音频质量、LLM文本打分、多模态一致性检查、人工复核)选出1200条(中英各600)高质量样本作为评测集。
- 基线方法:基于0.6B Qwen3模型,采用UniSS的三阶段训练策略(模态对齐 -> CoT-TTS主任务及辅助任务 -> 高质量数据微调),使用RTX 4090进行微调。
- 主要结果:基线实验表明,即使在轻量级硬件和参数设置下,模型依然能产生有意义的推理分析,并在上下文感知的CoT-TTS中展现出一定的可控性,证明了任务的可行性。
- 评估指标设计:最终得分 = 30%客观指标(UTMOS, DNSMOS, WER/CER, 说话人相似度等) + 20%多模态LLM评估(推理连贯性、音推一致性) + 50%人工主观评估。

5. 优势与局限

  • 主要优势
    1. 任务定义前瞻且实用:将“思维链”引入TTS,填补了上下文感知语音生成中缺乏可解释性的空白。
    2. 数据规模与质量并重:提供了目前规模最大、场景最丰富的双语上下文感知TTS数据集,且评测集经过极其严格的过滤。
    3. 评估体系设计精巧:结合客观、LLM和人工评估,并特别针对“推理信息量”设计了防作弊机制,确保排名真正反映模型的“思考”能力。
  • 局限性
    1. 数据版权与隐私风险:数据来源于公开影视媒体,尽管只发布切片,但仍面临潜在的版权争议风险。
    2. 评测成本极高:最终评分50%依赖众包人工评估,且需多模态LLM辅助,评测周期长、成本高,难以在日常研发中频繁使用。
    3. 基线能力上限受限:0.6B参数的基线模型虽然证明了可行性,但在处理极复杂情感和超长上下文时,推理深度和语音表现力可能存在天花板。

6. 关键结论与启发

  • 最重要的Takeaway:未来的TTS系统不应仅仅是“文本到语音”的转换器,而应具备“理解上下文-推理意图-生成语音”的完整认知链路。显式的CoT推理是连接语义理解与声学表现的关键桥梁。
  • 对后续研究的启发
    1. 架构设计:探索更高效的端到端架构,在保留CoT可解释性的同时,降低推理延迟(挑战赛规定RTF不得超过3.0)。
    2. 细粒度控制:研究如何将高维的CoT文本推理,精准映射到具体的声学特征(如F0、时长、能量),实现从“语义推理”到“声学渲染”的跨越。
    3. 多模态扩展:未来可考虑将视觉上下文(如人物表情、场景画面)纳入CoT-TTS的推理输入,实现更全方位的上下文感知配音。
👀 推荐值得看
🏷️ 领域语音合成 (TTS) > 情感/风格可控语音合成 (TTS) > 可编辑/指令式 TTS
💡 创新上下文感知TTS中的显式思维链推理——基于传统上下文感知TTS框架改进,引入CoT推理中间输出,将隐式风格映射显式化为可解释的推理链,并配套大规模双语数据集与防作弊评估体系
⭐ 评分7.0
#92
cs.SD
Seoul National University (QS Top 100)

Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings

Byoungjun So, Jaejun Lee, Kyogu Lee
Sound (cs.SD)
Comments: This paper has been accepted to Interspeech 2026
查看摘要
Understanding speaker attributes is crucial for voice-related applications, yet conventional approaches rely on fixed categorical labels, lacking semantic richness and zero-shot generalizability. We propose a novel framework for open-set speaker attribute prediction leveraging Large Language Model (LLM) embeddings to represent attributes in a continuous semantic space. To bridge the cross-modal gap, we introduce a keyword-appending strategy that structures broad semantic representations into a compact, discriminative manifold. Furthermore, we employ a top-k negative loss to establish robust decision boundaries in crowded semantic regions. Experimental results on LibriTTS-P demonstrate that our method outperforms closed-set benchmarks and generalizes effectively to unseen synonyms. Geometric analysis suggests that our strategies regularize the embedding manifold, balancing semantic cohesion with predictive clarity.

📖 深度解读

1. 一句话总结

这篇论文提出了一种基于大语言模型(LLM)嵌入的开放集说话人属性预测框架,通过关键词追加策略和Top-k负样本惩罚机制,将语音特征对齐到结构化的语义流形中,解决了传统闭集分类无法泛化到未知属性的问题。

2. 研究背景与动机

  • 核心问题:如何让模型不仅能预测预定义的说话人属性(如“明亮”、“低沉”),还能具备“开放集”能力,即识别出训练时未见过的同义属性?
  • 重要性:理解说话人属性对于语音识别、多说话人文本转语音(TTS)和语音转换等应用至关重要。传统的说话人嵌入是“黑盒”的,缺乏可解释性;而显式预测属性能提供更透明、可控的语音表征。
  • 现有不足:现有的说话人属性预测方法(如基于LibriTTS-P数据集的研究)通常将其建模为“闭集多标签分类”任务。这种死板的设计无法捕捉属性间微妙的语义关系,且完全无法泛化到数据集之外的属性。

3. 核心方法

论文提出了一个利用LLM嵌入的开放集说话人属性预测框架。
- 关键创新点
1. 加权余弦相似度损失:将语音特征与LLM生成的属性文本嵌入进行对齐,并根据属性强度(如“非常”、“稍微”)进行加权。
2. 关键词追加策略:在属性词后加上领域关键词(如把“cute”变成“cute speech”),以消除语义歧义。
3. Top-k负样本惩罚:动态计算正样本的相似度锚点,对距离过近的负样本属性进行惩罚,以在拥挤的语义空间中划出清晰的决策边界。
- 直觉性解释:想象我们要把听到的声音和文字描述对应起来。传统方法只能死记硬背字典里的词,没见过的词就不认识。本文让模型去理解词的“意思”(通过LLM嵌入)。但是有些词(如“甜”)在日常生活中意思太广,模型容易搞混。于是作者给每个词加上“语音”后缀(变成“甜的语音”),让词义更聚焦。同时,为了防止意思相近的词(如“明亮”和“清晰”)在语义空间里挤在一起分不清,作者设计了一种惩罚机制,强行在它们之间划出“安全距离”。

4. 实验与结果

  • 数据集:LibriTTS-P(目前唯一提供说话人属性标签的开源数据集,包含44个属性类别及强度标注)。
  • 基线方法:Vo-Ve(基于BCE损失的闭集多标签分类模型)。
  • 主要实验结果
  • 闭集预测:在最优阈值下,本文方法的Micro F1得分为0.7625,优于闭集基线的0.7286。这表明即使在传统闭集任务上,语义对齐也优于离散分类。
  • 零样本同义词预测:模型能成功识别训练时未见过的同义词(如用“brilliant”替代“bright”),F1得分与闭集表现几乎持平。
  • 消融实验与几何分析揭示
  • 关键词追加策略确实使嵌入空间的几何形态变得更紧凑(方差减小、体积收缩)。
  • 有趣的是,即使追加的词是毫不相关的“apple”,也能带来性能提升。这说明该策略的本质是“结构正则化”,而非单纯的语义引导。
  • Top-k负样本惩罚在空间较拥挤(如使用“speech”后缀)时效果显著,但在空间较宽泛(如使用“apple”后缀)时作用有限甚至略有负面影响。

5. 优势与局限

  • 主要优势
    1. 具备强大的零样本泛化能力,突破了传统闭集分类的标签限制。
    2. 方法设计具有深刻的几何直觉,通过简单的策略(加关键词)有效解决了跨模态对齐中的语义歧义问题。
    3. 在开放集任务表现优异的同时,闭集任务性能也超越了专门优化的闭集模型。
  • 局限性
    1. 仅在LibriTTS-P单一数据集上进行了验证,缺乏更广泛风格或语种的语料支撑。
    2. 仅使用了GPT-OSS-20B这一种LLM,未探讨不同LLM架构对嵌入流形及最终性能的影响。
    3. 零样本测试仅局限于同义词替换,未测试完全不同概念的新增属性。

6. 关键结论与启发

  • 最重要的Takeaway:将语音属性映射到LLM的连续语义空间是实现开放集预测的有效途径;而成功的关键在于对嵌入流形进行几何结构上的约束与正则化。
  • 启发与延伸方向
  • 结构大于语义:实验中“apple”后缀也能起作用的现象非常启发人,说明在跨模态对齐中,目标空间的“几何紧凑度”可能比“语义准确性”更重要。后续研究可以探索更直接的正则化手段来塑造流形。
  • 多模态大模型结合:未来可以尝试将不同架构的LLM(如Llama系列、Gemini)与语音模型结合,研究文本模型的先验知识如何更好地服务于音频理解。
  • 扩展开放集边界:未来的工作不应局限于同义词泛化,可以尝试构建包含更丰富、层级化属性的数据集,测试模型对完全未知声音特征的零样本感知能力。
🔥 推荐必读
🏷️ 领域副语言与健康 > 属性识别说话人技术 > 说话人嵌入/表征
💡 创新开放集说话人属性预测——基于LLM文本嵌入与语音特征对齐,引入关键词追加策略和Top-k负样本惩罚机制优化语义流形几何结构
⭐ 评分8.0
#93
cs.SD

InstructFX2FX: A Multi-turn Text-to-Preset Demo for Iterative Audio Effect Refinement

Song-Ze Yu, Milan Liessens Dujardin, Yuxuan Cai, Wantong Zhang
Sound (cs.SD)
Comments: Preprint
查看摘要
We present InstructFX2FX, an interactive demonstration of multi-turn, text-guided audio effect refinement. Existing text-to-preset systems are largely single-shot, mapping one textual descriptor to one preset. Real audio engineering is instead sequential: engineers refine an existing effect chain through successive instructions such as "make it warmer" or "too harsh, soften it." This poses a stateful problem that single-shot systems do not address: given the current effect parameters and a new instruction, update the sound while preserving what earlier instructions already achieved. InstructFX2FX tackles this with a hybrid architecture that divides labor between a language model and CLAP-guided optimization. The LLM acts as a high-level planner that selects effects, orders the signal chain, and proposes initial parameters, motivated by recent evidence that LLM initialization outperforms CLAP optimization from a random start; CLAP-guided optimization then refines those parameters perceptually, giving more controllable updates than re-prompting the LLM at each turn, which tends to perturb settings the user did not ask to change. At the demo, attendees drive a dry recording through successive natural-language instructions and inspect the evolving FX chain, intermediate optimization checkpoints, and session state. On SocialFX-derived descriptor transitions, CLAP-guided refinement lowers target-directed DSP-feature MMD on 9 of 10 directed descriptor pairs relative to an LLM-only reprompting baseline, reducing the average MMD by roughly 24% (0.45 to 0.34).

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了InstructFX2FX,一个支持多轮自然语言指令的音频效果迭代精修系统,通过结合大语言模型(负责效果链规划和参数初始化)与CLAP引导的优化(负责基于实际声音的感知微调),解决了传统单次生成预设无法保留和累积历史修改状态的问题。

2. 研究背景与动机

  • 核心问题:现有的文本到音频预设系统是“单次”的,即一段文本对应一组预设参数。但真实的音频工程是一个“序列化精修”过程,工程师会根据当前声音状态不断下达新指令(如“先变暖一点”->“再加点重量”->“太刺耳了,柔和一下”)。
  • 重要性:真实的创作工作流是基于现有状态进行局部迭代的,单次生成系统无法理解“在现有基础上修改”的意图,难以融入实际的音频制作流程。
  • 现有不足:现有的文本引导方法(如Text2FX、LLM2Fx)不支持多轮状态保持。如果简单地在每一轮重新提示LLM,模型会非确定性地重新生成参数,破坏用户未要求修改的设置;更致命的是,LLM无法“听”到实际渲染的音频,无法根据真实听觉反馈进行修正。

3. 核心方法

  • 方法/框架:InstructFX2FX,一个会话感知的混合架构系统。它将任务定义为有状态的多轮参数更新:$(C_t, P_t) = f(x, C_{t-1}, P_{t-1}, I_t, H_{t-1})$。
  • 关键创新点
    1. 混合分工架构:LLM作为“大脑”负责高层语义规划(选择效果器、排序信号链、生成初始参数);CLAP引导的优化作为“耳朵”负责感知层面的参数微调。
    2. 会话感知的路由机制:系统维护一个持久状态,每轮指令会触发三种模式之一:仅初始化(新建效果链)、复用并优化(在现有参数上原地微调)、混合复用与初始化(保留部分旧效果并加入新效果)。
    3. 多优化后端支持:对可微效果(如EQ、混响)使用CLAP引导的梯度下降;对不可微效果(如压缩、失真等)使用基于CLAP目标的贝叶斯优化。
  • 直觉性解释:这就像画画一样,LLM负责“打草稿”和“选画笔”(给出初始参数),而CLAP负责“看着画布精修”(实际播放音频并对比文本指令,微调参数)。系统会记住之前的所有操作,当你说“太刺耳了”时,它只会在当前画作上局部修改,而不是撕掉重画。同时,系统保存了优化过程中的快照,用户可以通过滑块试听不同“强度”的中间状态,而不是只能接受最终结果。

4. 实验与结果

  • 数据集/基准:基于SocialFX数据集,选取了7个EQ相关的描述词(如warm, bright, soft等),构建了10个有向词对(如 warm→bright, harsh→soft)。
  • 基线方法:仅使用LLM重新提示的基线。
  • 主要实验结果
  • 在10个词对中,InstructFX2FX在9个词对上的目标导向DSP特征MMD(最大均值差异,越低越好)低于LLM-only基线。
  • 平均MMD降低了约24%(从0.4461降至0.3380)。
  • 消融实验:在相同的LLM初始化基础上,加入CLAP微调后,8个描述词中有7个超越了仅初始化的状态(平均约13步优化后超越),证明性能提升不仅归功于LLM提供了更好的起点,CLAP优化确实提供了有效的精修信号。

5. 优势与局限

  • 主要优势
    1. 贴近真实工作流:支持多轮迭代和有状态的局部修改,不会破坏用户已有的满意设置。
    2. 优势互补:LLM提供合理的初始搜索点避免了从随机状态开始优化的低效,CLAP提供基于实际音频的感知反馈弥补了LLM无法听音的缺陷。
  • 局限性
    1. 评估范围有限:目前的定量评估主要集中在EQ效果上,因为SocialFX数据集对EQ的描述最为清晰。
    2. 目标不对齐与优化漂移:CLAP嵌入空间不能完全代表所有感知属性。实验发现,优化后期CLAP空间的表现提升有时会导致DSP特征指标下降(过冲现象),尤其在不可微效果(如失真后的“柔和”指令)上表现极不稳定。
    3. 非实时:每次交互优化需要几秒钟,无法作为实时插件直接嵌入DAW(数字音频工作站)工作流。

6. 关键结论与启发

  • 最重要的Takeaway:将音频效果调整视为一个“有状态的序列化过程”而非独立的单次生成,是AI音频工具走向实际应用的关键。结合LLM的语义规划能力和CLAP的感知优化能力,是一种有效的解决范式。
  • 启发与延伸方向:论文指出,推理时的优化存在固有瓶颈,未来最有前景的方向是放弃推理时优化,转向生成式参数模型——例如直接在“迭代FX编辑轨迹”上训练流匹配模型,让模型端到端地学习如何根据当前状态和新指令进行序列化精修。此外,开发针对音频效果定制的领域自适应嵌入模型也是提升稳定性的关键。
👀 推荐值得看
🏷️ 领域通用音频生成 > 音频编辑/修复
💡 创新多轮音频效果迭代精修——基于LLM与CLAP引导优化的混合架构,引入会话感知路由机制实现有状态的局部修改
⭐ 评分7.0
#94
cs.SD

What Do Neural Networks Learn for TDOA Estimation? A Cross-Architecture Probing Study

Yaozhong Kang, Jiang Wang, Runwu Shi, Takeshi Ashizawa, Benjamin Yen 等 (6 人)
Sound (cs.SD); Machine Learning (cs.LG)
Comments: 5 pages, 4 figures, 2 tables. Accepted to Interspeech 2026. Code: this https URL
查看摘要
Neural networks outperform classical GCC-PHAT for Time-Difference-of-Arrival (TDOA) estimation in noise and reverberation, yet their internal strategy remains unexplored. To uncover it, we turn GCC-PHAT's mathematical steps into diagnostic targets, probing hidden layers of three architectures (MLP, CNN, Transformer) and complementing with gradient attribution and causal frequency masking. We find that cross-power computation consistently emerges across all architectures and conditions, while PHAT whitening, the defining step of GCC-PHAT, fails to emerge. Instead, networks learn a magnitude-aware frequency weighting that preserves per-frequency reliability information discarded by PHAT. This makes PHAT an information bottleneck: removing it from both classical and neural GCC pipelines improves performance under additive noise. On real-world reverberant data, PHAT remains the best classical weighting, but end-to-end networks achieve lower error by learning data-adaptive weighting.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文通过“探针”技术逆向分析了神经网络在估计到达时间差(TDOA)时的内部机制,发现网络虽然学会了计算互功率谱,但会抛弃传统经典算法(GCC-PHAT)中的“PHAT白化”步骤,转而学习保留幅度信息的频率加权策略,从而揭示了PHAT白化实际上是一个信息瓶颈。

2. 研究背景与动机

  • 核心问题:神经网络在噪声和混响环境下的TDOA估计任务中表现优于经典的GCC-PHAT算法,但神经网络内部到底学到了什么、采用了什么策略,目前尚不清楚。
  • 重要性:许多实际的声源定位系统采用“经典信号处理前端 + 神经网络后端”的混合架构。如果前端的固定处理步骤(如PHAT白化)丢弃了对神经网络有用的信息,就会限制系统整体性能的上限。理解神经网络的内部机制对于合理设计混合架构至关重要。
  • 现有不足:以往的研究大多将神经网络视为黑盒,只关注输入输出性能,缺乏对其内部计算逻辑的解释。同时,现有的算法展开方法强制网络模仿已知算法,而非自由探索网络在数据驱动下真正学到了什么。

3. 核心方法

  • 提出的方法:一个跨架构的表征探测框架。研究者将GCC-PHAT的数学步骤转化为“诊断目标”,使用线性探针、梯度归因和因果频率掩码三种工具,分析三种不同架构(MLP、CNN、Transformer)在处理TDOA任务时的隐藏层特征。
  • 关键创新点
    1. 将基线模型变为诊断工具:不把GCC-PHAT当作要打败的对手,而是把它的中间计算步骤(互功率、PHAT相位等)作为“标准答案”,去探测网络隐藏层是否包含这些信息。
    2. 跨架构对比分析:通过设计频率连通性截然不同的三种网络(MLP独立处理单频点、CNN局部连接、Transformer全局连接),剥离出网络在不同阶段学到的共性特征。
    3. 因果验证机制:不仅用梯度归因看相关性,还用单频点掩码看因果性,确保得出的结论是网络真正依赖的策略。
  • 核心思路(直觉性解释):想象GCC-PHAT算法是一个包含三步的菜谱:1. 混合两个麦克风的信号(算互功率);2. 把所有信号的音量拉平到一样大小(PHAT白化);3. 找出峰值。研究人员在神经网络的每一层放了一个“探测器”,看看网络是不是按菜谱做菜的。结果发现,网络做了第1步,但坚决拒绝了第2步。相反,网络会根据各个频段的能量大小赋予不同权重(能量大的频段更可靠,权重更高),这恰恰与第2步“拉平音量”的做法背道而驰。

4. 实验与结果

  • 数据集:合成数据(可控白噪声/有色噪声和信噪比)、LibriSpeech语音+模拟房间混响、LOCATA真实世界多通道录音挑战赛数据。
  • 基线方法:经典GCC-PHAT及其不同加权变体、神经GCC(NGCC,将GCC特征送入神经网络)。
  • 主要实验结果
    1. 互功率被学习,PHAT被抛弃:在所有架构和条件下,互功率谱在网络第一层后就能被线性探测到($R^2$高达0.94);但PHAT相位的可解码性始终接近于零($R^2 \le 0.21$),即使增加非线性探针或扩大模型容量也是如此。
    2. 网络学习幅度感知加权:梯度归因显示,网络学到的权重与信号幅度正相关($r=+0.53$),与PHAT权重负相关($r=-0.13$)。因果掩码实验进一步证实了高能量频段对输出结果具有决定性影响。
    3. PHAT是信息瓶颈:在经典GCC和神经GCC(NGCC)管线中,直接移除PHAT(即使用Flat加权或保留幅度信息)在几乎所有含噪条件下的表现都优于PHAT,最高带来了52%的MAE降低。
    4. 真实数据表现:在LOCATA真实混响数据上,经典方法几乎接近随机猜测水平(MAE 13.9-17.4),其中GCC-PHAT是经典方法中最好的;但端到端Transformer通过学习数据自适应加权,实现了低2.4倍的误差(MAE 5.75)。
  • 消融实验揭示:MLP-per-bin虽然能完美提取单频点特征,但缺乏跨频段聚合能力,导致误差较大;而CNN和Transformer通过内部的跨频段交互,实现了类似IFFT+峰值选取的功能,显著降低了误差。

5. 优势与局限

  • 主要优势
    1. 方法论严谨:结合了线性探测、非线性控制、梯度归因和因果干预,形成了一个完整的证据链,结论非常可信。
    2. 具有强实践指导意义:发现“PHAT白化是信息瓶颈”这一结论,可以直接指导现有的混合架构设计——即在将信号送入神经网络之前,不要做PHAT白化预处理。
    3. 跨架构的普适性:结论不局限于某一种特定网络,而是揭示了数据驱动模型在TDOA任务上的共性归纳偏置。
  • 局限性
    1. 单声源假设:探测目标的设计基于单声源场景,多声源重叠时网络是否采用相同策略尚属未知。
    2. 未涵盖波形域模型:本文主要分析基于STFT频域输入的网络,对于直接处理原始波形的大型端到端模型是否表现出相同机制没有探讨。
    3. 混响机制的未解之谜:实验发现随着混响时间($T_{60}$)增加,TDOA的可解码性显著下降,暗示网络可能在混响下学到了超越GCC框架的特征(如隐式去混响),但本文未能进一步揭示这部分机制。

6. 关键结论与启发

  • 最重要的Takeaway:神经网络在TDOA任务中并非盲目模仿经典算法。它“聪明”地意识到,PHAT白化强行抹平幅度的做法会丢失频段可靠性信息。保留幅度信息并进行数据自适应加权,才是提升抗噪性能的关键。
  • 对后续研究的启发
    1. 架构设计:在设计声源定位系统时,应避免使用PHAT作为神经网络的前端预处理,直接使用普通的互相关或保留完整复数谱能提供更丰富的信息。
    2. 未来探测方向:网络在强混响下的行为偏离了GCC框架,后续研究可以设计针对“去混响特征”的探测目标,进一步打开网络在复杂声学环境下的黑盒。
🔥 推荐必读
🏷️ 领域空间音频 > 声源定位
💡 创新跨架构表征探测框架——基于GCC-PHAT数学步骤转化为诊断目标,使用线性探针、梯度归因和因果频率掩码分析不同架构隐藏层特征
⭐ 评分8.5
#95
cs.SD

An Analysis of Untrained Deep Reservoir Networks for Audio Surveillance

Corrado Baccheschi, Patrizio Dazzi
Sound (cs.SD); Artificial Intelligence (cs.AI); Machine Learning (cs.LG)
Comments: accepted paper for AVSS 2026
查看摘要
In this paper, we investigate untrained recurrent models from the Reservoir Computing (RC) paradigm for audio surveillance, focusing on bidirectional Echo State Networks with different depths, from shallow to deep configurations, for emergency sound event detection. We evaluate these models on the MIVIA Audio Events dataset in a multiclass setting across different Signal-to-Noise Ratio (SNR) levels, with the goal of assessing the trade-off between depth, recognition performance, and computational efficiency. We compare the proposed architectures against fully trained recurrent and convolutional-recurrent baselines, namely Bidirectional Long Short-Term Memory networks (BiLSTMs) and Convolutional Recurrent Neural Networks (CRNNs). Results show that deep and shallow reservoir-based models achieve competitive recognition rates, with deeper variants being more robust in highly noisy conditions and shallower ones offering the most favorable efficiency profile, particularly on edge devices such as the NVIDIA Orin. In addition, the proposed approach remains robust across different input representations, including log-Mel spectrograms and MFCCs with varying resolutions. These findings highlight untrained reservoir architectures as a promising solution for resource-constrained audio surveillance scenarios.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种无需训练循环层的深度双向回声状态网络用于音频监控,在保持高识别率的同时大幅降低了计算成本,特别适合资源受限的边缘设备部署。

2. 研究背景与动机

  • 核心问题:在音频监控(如检测玻璃破碎、枪声、尖叫等紧急事件)中,如何在资源受限且存在环境噪音的边缘设备上实现高精度、低延迟的声音事件检测。
  • 重要性:音频监控在公共安全、施工场所监控等场景中至关重要,但现实部署往往面临设备算力有限、环境噪音多变等挑战。
  • 现有不足:传统的深度学习模型(如 CRNN、BiLSTM)虽然准确率高,但计算成本高昂,且 RNN 结构存在梯度消失问题,难以训练长时序依赖,不适合低功耗边缘设备;而传统的机器学习方法(如 SVM+手工特征)在强噪声环境下表现不佳。

3. 核心方法

  • 提出方法:DeepBiESN(深度双向回声状态网络),属于储备池计算范式。
  • 关键创新点
    1. 首次将深度双向储备池计算系统性地应用于音频监控,兼顾了双向时序建模能力与极低的训练成本。
    2. 固定循环权重,仅训练读出层:通过随机初始化并固定内部循环权重(满足回声状态性质),规避了传统 RNN 的梯度消失问题,且最终分类层可通过闭式岭回归直接求解。
    3. 灵活的深度配置:支持从浅层(1层)到深层(5层)的不同配置,以适应不同的噪声环境和算力限制。
  • 直觉性解释:把“储备池”想象成一个固定不变的“复杂随机滤镜”或“回音洞”。输入的音频信号进入这个洞后,会产生复杂的回音(高维状态特征)。系统不需要去改造这个洞(不训练循环层),只需要在洞口放一个简单的接收器(线性读出层),通过分析回音的规律来判断是什么声音。这就把复杂的深度学习训练问题变成了一个简单的线性回归问题。

4. 实验与结果

  • 数据集:MIVIA Audio Events 数据集(包含玻璃破碎、枪声、尖叫三类紧急事件,在不同信噪比 SNR 下测试)。
  • 基线方法:文献中的传统方法(BoW+SVM)、深度学习方法(HRNN, DeNet, SincNet 等),以及本文复现的完全训练模型(CRNN, BiLSTM)。
  • 主要实验结果
  • 准确率:DeepBiESN 总体识别率达到 98.3%。在 5dB 强噪声下,达到 92.9%,超越了所有文献基线;在 15dB 及以上信噪比下,识别率超过 99%,媲美甚至超越完全训练的 CRNN 和 BiLSTM。
  • 效率:在服务器 CPU 和边缘设备 NVIDIA Orin 上,DeepBiESN 的训练时间比 CRNN 和 BiLSTM 快了数个数量级。在 Orin 的 CPU 上,浅层 BiESN 实现了最佳的吞吐量和最低的延迟。
  • 消融实验揭示
  • 深度的作用:深层网络(5层)在 5dB 极端噪声下鲁棒性更强;但在 10dB 以上环境中,浅层网络(1层)的准确率已与深层相当,且效率最高。
  • 特征鲁棒性:无论输入是 log-Mel 频谱图还是不同分辨率的 MFCC,DeepBiESN 表现都非常稳定,甚至在 MFCC=64 时超越了 BiLSTM,证明了其对特征提取管线变化的不敏感性。

5. 优势与局限

  • 主要优势
    1. 极高的训练效率:只需训练一个线性读出层,训练时间大幅缩减,尤其适合 CPU 环境。
    2. 边缘部署友好:浅层配置在边缘设备上实现了精度、延迟和吞吐量的最佳平衡。
    3. 抗噪与特征鲁棒:深层结构抗强噪能力突出,且对不同音频特征表示具有广泛适应性。
  • 局限性
    1. GPU 推理效率不佳:由于当前实现缺乏高度优化的并行化内核,其在 GPU 上的推理时间反而不如经过深度优化的 PyTorch CRNN/BiLSTM 内核。
    2. 泛化能力待验证:实验仅在 MIVIA 单一数据集上进行,结论是否能推广到其他环境声音数据集尚不确定。

6. 关键结论与启发

  • 核心 Takeaway:未训练的储备池架构并非“过时技术”,在资源受限的边缘音频监控场景中,它通过“固定随机循环层+可微线性读出”的设计,提供了一条绕开深度学习高昂训练成本的有效路径。架构深度是一个可调节的旋钮:强噪用深层,求效率用浅层。
  • 后续启发
    1. 为 TinyML 和边缘计算领域的时序信号处理提供了新思路,未来可探索将其部署在 Raspberry Pi 或微控制器等超低功耗设备上。
    2. 未来工作可探索将其与预训练大模型或 Transformer 进行对比,甚至结合,看是否能用极低的成本蒸馏大模型的知识到储备池中。
👀 推荐值得看
🏷️ 领域声音事件与场景 > 声音事件检测 (SED)
💡 创新深度双向回声状态网络——基于储备池计算改进,固定循环权重仅训练读出层以降低边缘部署成本
⭐ 评分7.5
#96
cs.SD

Learning to Evade: Adaptive Attacks on Audio Watermarking 黑名单

Weikang Ding, Hanqing Guo, Rui Duan, Guangjing Wang, Yuanda Wang 等 (7 人)
Sound (cs.SD); Cryptography and Security (cs.CR)
Comments: Accepted by Interspeech 2026 Long Paper track
查看摘要
Advances in generative audio have intensified copyright concerns, making audio watermarking increasingly important for asserting ownership. However, existing audio watermarking methods are vulnerable to adversarial attacks. We find that watermark decoder message probabilities follow normal distributions, a property exploited by defenses to detect manipulations. This paper introduces an adaptive audio watermark attack method (AWM) designed to bypass existing defense strategies. AWM uses a two-stage optimization: the first stage ensures attack success, while the second improves audio quality. To evade detection, it estimates normal distribution parameters from limited samples of the target audio, and then adaptively steers decoded probabilities back into the estimated range. Evaluated on two watermarking methods across three voice datasets, AWM achieves high success while bypassing state-of-the-art detectors: detection rates are below 10% for replacement and creation, and 0% for removal.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文提出了一种名为 AWM 的自适应音频水印攻击方法,通过估算并模拟水印解码器输出的正常概率分布,在保持高音频质量的同时,成功绕过了基于异常检测的防御机制。

2. 研究背景与动机

  • 核心问题:随着生成式AI音频的普及,版权保护和伪造语音检测高度依赖深度学习音频水印技术。然而,这些水印系统容易受到对抗性攻击(如移除、伪造水印)。为了对抗攻击,防御者会使用异常检测机制。
  • 重要性:如果音频水印能被轻易破解且不被发现,创作者的版权将受到侵害,恶意伪造的语音也将无法被追踪,导致严重的经济和声誉损失。
  • 现有不足:现有的水印攻击方法(如 AudioMarkBench)在欺骗解码器时,会改变解码器输出的消息概率分布,使其偏离正常范围,从而极易被防御者的异常检测策略识破;同时,过于激进的攻击会严重破坏音频的听觉质量。

3. 核心方法

  • 方法/框架:论文提出了 AWM(Adaptive audio WaterMark attack),一个两阶段优化的自适应攻击框架。
  • 关键创新点
    1. 发现并利用统计规律:发现水印解码器输出的消息概率在正常音频中服从正态分布(干净音频为单峰,水印音频为双峰),防御者借此检测异常,而攻击者可借此规避检测。
    2. 两阶段优化框架:第一阶段(AWM)专注于通过严格约束概率分布来保证攻击成功并规避检测;第二阶段(AWM+opt)通过放宽约束范围来优化音频听感质量。
    3. 自适应的逐位优化策略:在优化对抗扰动时,只针对需要修改的“异常”比特位施加梯度,已经落在正常分布区间的比特位则保持不变。
  • 直觉性解释:想象一个小偷要伪造印章(水印)。以前的伪造方法虽然印出了图案,但墨迹分布(概率分布)和真印章不一样,保安一眼就能看出是假的。AWM 方法让小偷先观察几个真印章,摸清真印章墨迹分布的规律(均值和方差)。在伪造时,不仅保证印出的图案对,还严格把墨迹分布控制在正常范围内。第一步先确保伪造成功(哪怕印章有点丑),第二步再在不改变墨迹分布的前提下,把印章修得好看一点(提升音质)。

4. 实验与结果

  • 数据集:LibriSpeech, AudioMarkData (Common Voice), GigaSpeech。
  • 基线方法:AudioMarkBench 及其结合五种无盒扰动(低通滤波、幅度缩放、高斯噪声、MP3压缩、高通滤波)的变体。
  • 水印模型:Timbre, AudioSeal。
  • 主要实验结果
  • 极低的检测率 (DSR):对于水印替换和伪造攻击,防御者的检测率降至 10% 以下;对于水印移除攻击,检测率降至 0%。而基线方法的检测率几乎都在 90%-100%。
  • 高鲁棒性:即使在被攻击的音频上再施加五种常见的音频处理扰动(如MP3压缩),AWM 的攻击成功率(ASR)依然接近或达到 100%。
  • 消融实验揭示:在 AWM+opt 阶段,将概率分布的允许范围从 1 个标准差($[\mu-\sigma, \mu+\sigma]$)放宽到 2 个标准差($[\mu-2\sigma, \mu+2\sigma]$),能显著提升音频质量(SNR和ViSQOL指标提升),但会略微增加被检测到的风险(DSR略有上升),揭示了音质与隐蔽性之间的权衡。

5. 优势与局限

  • 主要优势
    1. 隐蔽性极强:成功打破了防御者依赖概率分布异常的检测防线,检测率极低。
    2. 鲁棒且均衡:攻击不仅对后续的常见音频处理具有高度抵抗力,还通过两阶段优化实现了攻击成功率与音频听感的良好平衡。
  • 局限性
    1. 依赖查询权限:攻击者需要能够向水印模型输入少量干净音频来估算分布参数,在完全无查询权限的“无盒”场景下可能受限。
    2. 防御针对性单一:该方法主要针对基于概率分布异常的检测策略。如果防御者采用其他维度的检测(例如直接分析音频频谱的异常特征),该方法的有效性可能会被削弱(论文图9显示AWM在频谱上仍留有轻微噪声痕迹)。

6. 关键结论与启发

  • 最重要的 Takeaway:依赖单一统计特征(如解码概率的正态分布)的防御机制是脆弱的。攻击者可以通过有限的查询“逆向工程”出防御边界,并自适应地将攻击特征伪装在正常分布范围内。
  • 对后续研究的启发
    1. 防御机制需多维度化:未来的水印防御不应仅依赖输出概率的统计分布,应结合时频域特征分析、解码器内部隐状态监测等多维特征进行综合检测。
    2. 水印模型需增强抗逆向能力:水印模型在设计时,应考虑限制攻击者通过多次查询估算分布参数的能力,例如引入查询次数限制或输出结果的随机化扰动。
    3. 攻防博弈升级:这种“估算防御边界并自适应规避”的思路,不仅适用于音频水印,也可启发图像、视频等其他模态水印系统的攻防研究。
💤 推荐可跳过
🏷️ 领域语音安全与隐私 > 音频水印
💡 创新自适应音频水印攻击——基于两阶段优化框架,通过估算并模拟水印解码器输出的正常概率分布来规避异常检测
⭐ 评分8.0
#97
cs.SD
McGill University (QS Top 100)

Physics-Informed Neural Operator for Speech Production Analysis

Kazuya Yokota, Xinmeng Luan, Debasish Ray Mohapatra, Gary Scavone, Sidney Fels
Sound (cs.SD)
Comments: Accepted to Interspeech 2026
查看摘要
Physics-informed neural operators (PINOs) have recently gained attention as fast numerical simulators with potential for solving inverse problems. This study proposes the first PINO-based method for speech production analysis. The model learns the governing one-dimensional wave equations directly without requiring pre-computed supervised training data. Using vocal tract shape data as input features, we compare the proposed model's predicted f0, glottal volume velocity and sound pressure at the lip for five static vowels to a conventional Runge Kutta/Finite difference approach. With errors of 0.8% for glottal volume flow and 3.2% for speech waveforms, the proposed model enables efficient GPU-parallelized simulation without iterative calculations. We conclude that PINO is a promising approach for fast analysis of speech.

📖 深度解读

以下是为您结构化整理的论文解读报告:

1. 一句话总结

这篇论文提出了一种基于物理信息的神经算子(PINO),只需输入声道形状就能无需监督数据、快速且高精度地模拟出声带振动和语音波形,解决了传统物理求解器计算缓慢且难以泛化的问题。

2. 研究背景与动机

  • 核心问题:如何快速、准确地进行语音产生的物理模拟(包括声带振动和声道声学传播),并使其能适应不同的声道形状。
  • 重要性:语音产生的物理模拟对研究声带动力学、诊断嗓音疾病以及模拟嗓音外科手术后的声音变化至关重要。
  • 现有不足:传统的数值求解器(如有限元、有限差分法)计算成本极其高昂,且通常只适合正向模拟,逆向分析需额外开发专门算法。虽然基于物理信息的神经网络(PINNs)能解决逆问题且无需监督数据,但经典的PINN存在致命弱点:每当分析条件(如声道形状)改变时,都需要重新训练网络,缺乏泛化能力。

3. 核心方法

  • 提出方法:基于物理信息的深度算子网络(PI-DeepONet)的语音产生分析框架。
  • 关键创新点
    1. 声道形状作为输入特征:利用神经算子的特性,将声道的横截面积作为分支网络的输入,使单一模型能够处理并输出多种声道形状下的物理状态。
    2. 自动预测基频($f_0$):网络不仅能输出波形,还能根据声道形状预测稳态振动频率$f_0$。通过该频率缩放时间导数,模型只需分析单一周期即可求解,大大减轻了频谱偏差。
    3. 硬约束耦合机制:通过数学公式直接将声门体积流速约束为正值,并保证声带与声道在边界处的耦合作为“硬约束”满足,无需额外设计损失函数。
  • 直觉性解释:想象一个“万能翻译机”。传统物理求解器像个死板的算盘,换个声道形状就得从头一点点重新算;以前的AI(PINN)像个死记硬背的学生,学会发"a"的音后,想发"i"又得重新回炉重造。这篇论文的PINO像个“见多识广”的学霸,它把“声道形状”和“时间/空间位置”分别输入两个子网络(分支和主干),然后把两者的特征相乘得到结果。同时,它内置了物理公式作为“校对员”(PDE损失),不需要真实实验数据就能自我纠错。它甚至能自己估摸出当前声道该发多高的音(基频),从而只算一个周期的波就能复制出完整的稳态语音。

4. 实验与结果

  • 数据集/基准:使用了5个静态元音(/a/, /i/, /u/, /e/, /o/)的声道面积函数数据。
  • 基线方法:传统的四阶龙格-库塔法(RK4)结合有限差分法(FDM)。
  • 主要实验结果
  • 基频($f_0$)误差极小:5个元音的预测误差均在0.25%以下。
  • 波形精度高:声门体积流速的误差为0.36%~1.23%(平均约0.8%),唇部声压的误差为1.01%~5.98%(平均约3.2%)。
  • 推理速度极快:尽管训练5个元音耗时约80小时,但训练完成后,单个元音的推理时间仅为0.0389秒,得益于GPU的高效并行计算,无需传统方法的逐步迭代。
  • 消融实验/结果分析:论文未进行严格的消融实验,但通过结果分析指出,唇部声压的误差明显大于声门流速,原因是声压包含更高的共振峰频率,受神经网络的“频谱偏差”(难以学习高频信号)影响较大。作者提出未来可通过多尺度傅里叶特征来缓解。

5. 优势与局限

  • 主要优势
    1. 零监督数据依赖:完全依靠物理方程损失驱动,摆脱了对昂贵仿真数据或实验数据的依赖。
    2. 泛化与高效并存:一次训练即可适应多种声道形状,且推理速度达到毫秒级,为实时语音分析奠定了基础。
    3. 物理一致性高:通过硬约束保证了声门-声道耦合的物理合理性。
  • 局限性
    1. 高频建模能力不足:受频谱偏差影响,包含高频成分的声压波形误差相对较高(最高近6%)。
    2. 训练成本高昂:训练过程耗时较长(80小时),且论文未展示对未见过的新声道形状的泛化能力(仅测试了训练集中的5个元音)。
    3. 仅限稳态分析:当前框架只针对稳态周期解,无法处理非稳态条件(如辅音、连续语流中的动态变化)。

6. 关键结论与启发

  • 核心Takeaway:PINO是解决语音物理模拟中“速度、精度、泛化”三角矛盾的有力候选者。它成功证明了将声道几何形状作为输入特征,实现跨条件快速物理推理的可行性。
  • 后续启发与延伸方向
    1. 算法改进:引入多尺度傅里叶特征映射或其他抗频谱偏差技术,以提升对高共振峰声压波形的建模精度。
    2. 应用拓展:由于神经算子天然适合逆问题,未来可探索利用该框架从语音信号直接反推声带状态或声道形状,用于医学嗓音诊断。
    3. 维度升级:从当前的一维声道模型向三维几何扩展,以及从静态元音向动态连续语音(包含辅音)扩展,将是走向实际应用的关键跨越。
#98
cs.SD

Kiwano: A Cutting-Edge Open-Source Toolkit for Speaker Verification

Mickael Rouvier, Pierre Michel Bousquet
Sound (cs.SD); Machine Learning (cs.LG)
查看摘要
In this paper, we present Kiwano, an open-source toolkit designed to advance research and evaluation for speaker verification. Kiwano provides a lightweight yet extensible framework built on PyTorch, offering standardized recipes, pretrained models, and integration of several widely used speaker verification architectures. The toolkit emphasizes reproducibility, by delivering transparent training pipelines, unified evaluation protocols and ready-to-use baselines across multiple corpora. Beyond conventional training and inference, Kiwano includes tools for benchmarking, experiment tracking and rapid prototyping of new architectures. To foster community adoption, the toolkit is distributed under the Apache 2.0 license, accompanied by comprehensive documentation and reproducible experiments. By lowering entry barriers and standardizing evaluation practices, Kiwano contributes a valuable resource for both academic research and applied development in speaker verification. The toolkit is publicly available at: this https URL

📖 深度解读

1. 一句话总结

本文介绍了一个名为Kiwano的开源轻量级说话人验证工具包,它集成了最新的模型架构与全面的后端评分工具,通过提供标准化的流程和可复现的实验环境,解决了现有工具包在特定任务支持不足和难以公平对比的问题。

2. 研究背景与动机

  • 核心问题:随着说话人验证技术的发展,缺乏一个既能支持最新SOTA模型,又能提供完整后端处理(如评分、域适应)的统一、可复现的开源实验框架。
  • 重要性:说话人嵌入技术不仅用于声纹识别,还广泛应用于语音合成、说话人日志等下游任务。一个标准化的工具包能降低研究门槛,确保实验结果的可复现性和公平对比,推动领域实质性进展。
  • 现有方法不足:早期的Kaldi基于C++,难以适应现代深度学习的快速迭代;现有的PyTorch工具包(如SpeechBrain、ESPnet)多为通用语音处理框架,针对SV任务的定制性不足,或忽视了生产环境急需的后端评分与域适应模块。此外,不同研究中训练设置各异,导致SOTA结果的公平对比和归因分析十分困难。

3. 核心方法

  • 方法/框架:Kiwano,一个基于PyTorch构建的模块化、端到端说话人验证开源工具包(采用Apache 2.0许可)。
  • 关键创新点
    1. 前沿模型集成:内置了多种最新架构,包括Xi-Vector(引入不确定性估计的贝叶斯扩展)、ECAPA2(结合1D与2D卷积的混合网络)和ReDimNet(通过维度重塑平衡1D/2D处理)。
    2. 全面的后端工具链:不仅限于提取嵌入向量,还提供完整的评分(余弦、PLDA)、分数归一化(S-Norm, AS-Norm等)、域适应(CORAL, fDA等)及质量感知校准(CMF, QMF)工具。
    3. 高效的数据管理与在线增强:采用基于列表的按需加载机制,避免内存溢出;数据增强与特征提取在线进行,节省磁盘空间并提升模型鲁棒性。
  • 直觉性解释:Kiwano就像一个“交钥匙”的高级声纹识别实验室。它不仅帮你把“认人”的模型(前端)搭好,还补齐了从数据加载到最终打分判决(后端)的全套工具。它让研究人员不用再为“环境配置不同导致结果无法对比”而头疼,可以像搭积木一样快速测试不同网络深度、批次大小对识别准确率的影响。

4. 实验与结果

  • 数据集:训练集为VoxCeleb2-dev。域内测试集为VoxCeleb1-O/E/H;域外测试集为CN-Celeb、DiPCo和CommonBench。
  • 基线方法:对比了WeSpeaker、ESPnet-SPK和3D-Speaker等开源工具包的最佳模型。
  • 主要实验结果
  • 架构对比:fwSE-ResNet-200在性能与计算成本间取得了最佳平衡,全局平均EER为3.16%。ECAPA2虽在域内表现尚可,但域外泛化最差且计算最昂贵。
  • 工具包对比:在未使用分数归一化的公平对比下,Kiwano(fwSE-ResNet-200)在VoxCeleb1-O/E/H上均取得最低EER(分别为0.46%, 0.64%, 1.13%),显著优于其他工具包。
  • 极限性能:应用完整的后处理流程(模型平均、大间隔微调、CMF、AS-Norm、QMF)后,Kiwano在VoxCeleb1-O上的EER降至极低的0.34%
  • 消融实验揭示
    1. Batch Size:全局批次大小为512时是训练效率和性能的最佳折中点。
    2. 网络深度:浅层网络(100/200层)更擅长域内识别,深层网络(400层)在域外 mismatch 环境下更鲁棒,但达到600层时收益饱和。
    3. 可复现性:相同条件下4次独立训练的变异系数极低(约0.02),证明其训练流程高度稳定可靠。

5. 优势与局限

  • 主要优势
    1. 前后端全覆盖:弥补了多数工具包重前端轻后端的缺陷,提供端到端的全流程复现能力。
    2. 实验透明且可复现:通过系统性的消融实验,清晰揭示了批次大小、深度等变量对性能的真实影响,且训练稳定性极高。
    3. 性能领先:在多个标准基准测试中达到或超越了现有主流开源工具包的SOTA表现。
  • 局限性
    1. 缺乏自监督学习(SSL)前端支持:当前版本尚未集成基于WavLM等大模型的微调流程(尽管论文声称这是未来工作)。
    2. 硬件门槛较高:核心实验依赖超级计算机(如32张V100或H100 GPU),普通研究者难以完整复现大规模实验。
    3. 部分模型跨域泛化能力不足:实验显示,像ECAPA2这样计算昂贵的模型在跨域(如CN-Celeb)时性能下降严重,工具包在跨域鲁棒性上仍需优化。

6. 关键结论与启发

  • 最重要的Takeaway:Kiwano证明了在一个统一、透明的框架下,不仅能实现SOTA的声纹识别性能,还能系统性地厘清训练动态(如batch size和深度)对域内/域外泛化能力的不同影响。此外,后端校准和归一化技术(CMF, QMF等)能带来约30%的相对性能提升,其重要性不亚于前端模型的设计。
  • 启发与延伸方向
    1. 未来的SV研究应更加关注“域外鲁棒性”而非仅仅追求“域内最优”,因为更深网络在域外表现更好但存在饱和点,这为网络架构搜索(NAS)在SV中的应用提供了思路。
    2. 工具包的后续发展应加速整合SSL预训练模型,这是当前语音表征学习的明确趋势。
    3. 研究者在设计系统时不应只盯着前端编码器,后端评分与质量感知校准同样大有可为。
👀 推荐值得看
🏷️ 领域说话人技术 > 说话人识别/验证
💡 创新端到端说话人验证工具包——基于PyTorch构建,集成了前沿模型架构与全面的后端评分、域适应及质量感知校准工具链
⭐ 评分7.5
#99
cs.SD

ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

Dongdong Li, Jianwei Song, Jianwei Wang, Zhe Wang
Sound (cs.SD)
查看摘要
Call signs are safety-critical entities in air traffic control (ATC) communications because they identify the target aircraft of each spoken instruction. This paper presents ATCCaps, a call-sign-aware ATC speech dataset with caption-level audio-text supervision. Built from real ATC radiotelephony recordings, ATCCaps contains 202.94 hours of curated audio, 170,385 utterances, and 922 unique normalized call signs. The construction pipeline combines confidence-aware transcript parsing, ADS-B-derived call-sign metadata, call-sign normalization, rule-based quality filtering, and LLM-assisted caption generation. Each retained sample is paired with transcript descriptions, call-sign descriptions, and ATC-style captions, supporting ASR evaluation, call-sign matching, and call-sign-aware audio-text retrieval. We further characterize ATCCaps through split statistics, call-sign coverage, seen/unseen call-sign analysis, filtering audits, and caption quality evaluation. The evaluation subset is derived from the human-annotated ATCO2-test-set, enabling reference evaluation with manual transcripts. Results show that ATCCaps provides scalable audio-grounded call-sign supervision, while caption analysis highlights the need to explicitly validate call-sign and numeric fidelity. Reference ASR and CLAP-based baselines demonstrate the usability of ATCCaps for call-sign-aware ATC speech modeling.

📖 深度解读

1. 一句话总结

本文构建了首个具备呼号感知和描述级音文对齐的空管(ATC)语音数据集 ATCCaps,填补了现有数据集在呼号级别监督和跨模态检索方面的空白。

2. 研究背景与动机

  • 核心问题:在空管通信中,呼号是识别目标飞机的安全关键实体。现有语音识别(ASR)系统在嘈杂的真实无线电环境下,难以准确识别这些由字母和数字组成的呼号。
  • 重要性:呼号识别错误可能导致指令发错飞机,直接威胁航空安全。因此,空管语音识别不能仅停留在通用词级转录,必须保证操作实体的准确性。
  • 现有不足:现有的空管数据集(如ATCOSIM、ATCO2)主要关注词级转录或元数据,缺乏大规模、归一化的呼号监督,也没有提供音频与呼号文本描述的对齐标注,无法支持呼号感知的跨模态检索和细粒度实体评估。

3. 核心方法

  • 方法/框架:论文提出了一个可复现的 ATCCaps 数据集构建流水线,包含数据预处理、质量过滤和 LLM 辅助的描述生成三大模块。
  • 关键创新点
    1. 置信度感知的转录解析与 ADS-B 引导的呼号归一化:结合机器转录的置信度分数和 ADS-B 飞行辅助元数据,精准提取并归一化呼号。
    2. 严格的多维度质量过滤:基于信噪比(SNR>10)、时长(≥1.0s)和呼号有效性进行筛选,保留高质量数据。
    3. LLM 辅助的描述级增强:利用大语言模型(DeepSeek)为音频生成符合空管行话的文本描述,支持音文对齐。
  • 直觉性解释:这就像给一段嘈杂的无线电对讲机录音做“精修加字幕”。首先,通过比对飞行雷达数据(ADS-B)确认录音里提到了哪些飞机(呼号),把听不清或太短的录音扔掉;然后,把留下的录音配上标准化的呼号标签和文字记录;最后,让 AI(LLM)根据这些记录改写成更通顺、更符合空管行话的描述语,方便后续用文字去搜录音,或用录音去搜文字。

4. 实验与结果

  • 数据集/基准:基于大规模真实数据 ATCO2 构建,总计 202.94 小时、170,385 条语音、922 个唯一呼号。评估集来自人工标注的 ATCO2-test-set,外部参考使用了 UWB-ATCC 数据集。
  • 基线方法:ASR 任务使用了 ATC 微调的 Whisper Large v3;呼号匹配和音文检索任务使用了对比学习模型 CLAP。
  • 主要实验结果
  • ASR:在 ATCCaps 评估集上 WER 为 14.85%,CER 为 9.44%。
  • 呼号匹配:CLAP 模型在 ATCCaps 上达到 88.54% 的准确率和 94.83% 的 AUC。
  • 音文检索:在音频到文本(A→T)方向 Recall@1 为 36.87%,文本到音频(T→A)方向 Recall@1 为 38.80%。
  • 消融实验揭示
  • 过滤规则审计:被过滤掉的样本中,低信噪比过滤准确率 100%,其他规则过滤准确率也在 92% 以上,证明过滤规则合理且高度选择性。
  • LLM 增强的影响:虽然 LLM 增加了文本多样性,但在呼号和数字的保真度上有所下降(呼号提及率从 100% 降至 71.34%)。在域内检索任务中,加入 LLM 描述反而略微降低了性能,说明安全关键实体的生成仍需谨慎。

5. 优势与局限

  • 主要优势
    1. 填补领域空白:首个提供大规模、归一化呼号监督及描述级音文对齐的 ATC 数据集,支持已见/未见呼号的泛化评估。
    2. 构建流程严谨:结合了元数据、规则过滤和人工审计,数据质量高且流程可复现。
    3. 任务支持广泛:不仅支持传统 ASR,还支持呼号匹配和跨模态检索。
  • 局限性
    1. LLM 生成描述的保真度问题:大模型生成的文本在涉及呼号和数字等安全关键信息时存在幻觉或遗漏,不能完全替代原始转录。
    2. 评估集规模较小:人工标注的评估集仅 1.68 小时,可能在大模型评估时存在一定的方差限制。
    3. 缺乏实体级 ASR 评估指标:目前仅报告了全局的 WER/CER,尚未提供针对呼号准确率的细粒度评估(作者在结论中也承认这是未来工作)。

6. 关键结论与启发

  • 关键 Takeaway:在安全关键领域(如空管),仅仅有大规模语音转录是不够的,必须将关键实体(如呼号)进行归一化提取并提供跨模态的描述级监督;LLM 在数据增强中有用,但在事实性要求极高的场景下需谨慎验证。
  • 启发与延伸方向
    1. 后续研究可以基于此数据集开发专门的实体感知 ASR 模型和跨模态检索算法。
    2. 探索如何约束 LLM 在生成特定领域(如航空)描述时对专有名词和数字的绝对保真。
    3. 扩展数据集的模态,例如引入更精确的雷达轨迹数据来辅助解决未见呼号的泛化问题。
#100
cs.SD

Libretto: Giving LLM Agents a Sense of Musical Structure

Yichen Xu
Sound (cs.SD); Artificial Intelligence (cs.AI)
查看摘要
Generative music systems can now produce impressive audio from text prompts, but audio outputs are difficult to inspect, edit, and diagnose as musical structure. We introduce Libretto, an agent-facing framework for symbolic music generation and revision. Libretto uses an LLM-native grammar with explicit onset slots, voices, and bar-level organization, then evaluates each piece in a corpus-calibrated statistical space over rhythm, harmony, melody, texture, form, and variation. The same structural axes support retrieval, diagnosis, copy-risk control, and iterative self-revision. Across gap filling, reference-guided full-piece generation, gradual morphing, and educational music generation, Libretto turns symbolic music from a raw token sequence into a measurable and editable object for language-model agents.

📖 深度解读

1. 一句话总结

本文提出了一个名为 Libretto 的框架,通过为符号音乐设计大模型易读的文本语法和可量化的音乐结构评估体系,让 LLM 代理能够像音乐家一样“看懂、诊断并迭代修改”音乐的结构,而不仅仅是盲目生成一段音频或一串音符。

2. 研究背景与动机

  • 核心问题:如何让大语言模型(LLM)代理能够直接读取、编辑和诊断符号音乐(如 MIDI)的结构?
  • 为什么重要:现有的音频生成系统(如 Suno, MusicGen)虽然能生成高质量音频,但音频波形无法直接暴露音符时间、声部分配、乐句结构等,难以进行局部检查和编辑。符号音乐虽然保留了可编辑性,但现有的文本表示法(如 ABC 记谱法)对 LLM 来说不够直观,且缺乏能解释“结构哪里出了问题”的评估机制。
  • 现有方法不足
    1. 表示方法不友好:像 ABC 这样的紧凑格式,其音符起始时间是隐式的(需要累加前面的音符时长来推算),这使得 LLM 难以进行精确的时间推理和局部编辑。
    2. 评估方法缺乏解释力:现有系统多依赖主观评分或全局质量分数,无法指出具体是哪个音乐结构属性(如节奏、和声、织体)失败了,也无法指导代理如何修改。

3. 核心方法

论文提出了 Libretto,一个面向 LLM 代理的符号音乐生成与修改框架。
- 关键创新点
1. LLM 原生语法:将音乐表示为纯文本,包含全局头部、声部声明和按小节组织的块。每个音符明确指定音高、起始时间槽和持续时间槽,使得时序和结构直接可读且局部可编辑。
2. 语料库校准的 29 轴统计空间:不使用主观质量评分,而是将音乐映射到涵盖节奏、和声、旋律、织体、曲式和变奏的 29 个可解释轴上,通过百分位数定位其在真实音乐语料库中的位置,用于诊断结构退化(如过于密集、稀疏或不和谐)。
3. 生成-测量-修改的代理循环:代理生成候选作品后,系统计算其结构指纹并检查抄袭风险和任务特定门限,然后提供音乐家可读的反馈(如“让织体不那么稀疏”),指导代理迭代修改。
4. 检索与抄袭风险控制:结合知识库检索具体的音乐概念和示例作为参考,同时在音符级别严格测量抄袭风险,区分风格相似和直接抄袭。

  • 直觉性解释:Libretto 就像给 LLM 配了一副“音乐结构 X 光眼镜”和一本“乐理字典”。它把音乐写成 LLM 一眼就能看懂时间、声部结构的文本(而不是需要心算累加时长的 ABC 谱),然后用 29 个维度给音乐打分,告诉 LLM“你的节奏太单调了”或“和声太奇怪了”。LLM 根据这些反馈自己改稿,直到改出一首结构正常的曲子。

4. 实验与结果

  • 数据集/基准:使用 314 个真实 MIDI 文件(涵盖 8 种流派,来自 Lakh MIDI Dataset)作为参考语料库。
  • 对比的基线方法:单次生成(Single-shot)、无检索生成、不同 LLM 模型(Opus, Sonnet, Haiku)。
  • 主要实验结果
    1. 表示验证:语法在音高和声部上几乎无损(仅丢失 0.019% 的音符),时序精确,且比 ABC 格式更易读、更易局部编辑。
    2. 填补空白任务:代理循环将通过率从 12% 提升至 39%。
    3. 全曲生成任务:代理循环将通过率从 62% 提升至 94%;检索机制将通过率从 25% 提升至 75%。
    4. 教育练习生成:Opus 模型通过率 6/8,优于 Sonnet 和 Haiku 的 3/8。
    5. 渐变变形任务:11/21 通过所有变形检查。
  • 消融实验揭示了什么
    1. 检索的作用:在生成前提供真实音乐参考,能将极端的结构轴拉回正常区间(去退化),从而提高通过率,而不是通过抄袭增加相似度。
    2. 代理循环的作用:在生成后修复未通过门限的输出,仅在存在具体失败时起作用,避免了无差别的修改。

5. 优势与局限

  • 主要优势
    1. 可解释性与可编辑性:通过 LLM 原生语法和 29 轴统计空间,将音乐从黑盒的音频或原始 token 序列变成了可测量、可诊断、可局部编辑的对象。
    2. 无需训练新模型:直接利用现有的 LLM 代理,通过表示-评估循环实现多任务音乐生成,降低了部署门槛。
    3. 结构化反馈机制:提供音乐家可读的反馈,指导代理进行有意义的迭代修改,而非盲目优化数值。

  • 局限性
    1. 评估轴的局限性:29 个轴虽然涵盖了多个维度,但有意抽象掉了力度、微时序、音色和打击乐等信息,可能无法捕捉所有音乐细节。
    2. 依赖外部 LLM 能力:框架的表现受限于底层 LLM 的音乐理解能力,较小或较弱的模型(如 Haiku)表现明显下降。
    3. 流派适应性不均:某些流派(如 Folk)在生成时仍容易积累较多极端结构轴而失败,说明框架在不同风格上的鲁棒性有待提升。

6. 关键结论与启发

  • 最重要的 takeaway:将符号音乐的生成与评估从“端到端黑盒模型”转向“表示-评估-修改的代理循环”,通过可解释的结构化反馈,LLM 代理能够有效地诊断和修复音乐结构缺陷,而无需重新训练专门的模型。
  • 启发或延伸方向
    1. 结构轴的扩展与优化:可以继续细化和扩展评估轴,甚至引入基于人类偏好的美学预测器,使评估更全面。
    2. 智能体强化学习:论文提到反馈循环为音乐生成的代理强化学习提供了自然路径,未来可以优化检索、编辑、重写等动作。
    3. 跨模态应用:这种“显式结构表示+语料库校准评估+迭代修改”的范式可以启发其他需要结构化控制的生成任务(如视频、代码、建筑设计)。
👀 推荐值得看
🏷️ 领域音乐生成 > 可控音乐生成
💡 创新符号音乐生成与修改代理框架——基于LLM代理循环,设计了LLM原生音乐文本语法和29轴语料库校准的结构评估空间,实现可解释的音乐结构诊断与迭代修改
⭐ 评分7.5
#101
cs.SD

Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior 解读失败

Vyom Agarwal, Mokshda Gangrade, Siddharth Pal, Jerry Wu
Sound (cs.SD); Artificial Intelligence (cs.AI)
查看摘要
In this paper, we investigate the tradeoffs between compute allocation and model performance for two speech processing tasks: Automatic Speech Recognition (ASR) and Speech Emotion Recognition (SER). We propose a unified framework that analyzes three fundamental compute dimensions: model size ($x_N$), input length ($x_T$), and representation resolution ($x_V$). Motivated by recent advances in compute optimal scaling for multimodal models, we systematically vary these dimensions to examine their influence on task performance under fixed computational budgets. Our study provides insights into how compute resources can be optimally distributed across model capacity, temporal context, and representational granularity, offering practical guidelines for the design of efficient speech models. Through experiments on LibriSpeech and CREMA-D datasets, we demonstrate non-linear scaling behavior and identify optimal operating points. Our results show that (1) increasing model size yields diminishing returns: scaling Tiny (39M) to Small (244M) reduces WER by 8.22%, whereas Small to Medium (769M) reduces WER by only 2.35%; (2) an optimal audio duration of approximately 4 seconds exists for SER; and (3) reducing encoder token resolution provides an effective mechanism for lowering inference cost, Large-v3 (1540M) with 750 frames requires 2572 GFLOPS whereas with 1500 frames requires 5228 GFLOPS, with less than 3% relative increase in WER. Additionally, LoRA-based adaptation enables efficient finetuning with minimal performance degradation.

📖 深度解读

[PDF 下载失败,无法解读]

#102
cs.SD

Cross-lingual Retrieval-Augmented Classification for Dysarthria Severity Assessment

Taeyoung Jeong, Insung Lee, Du-Seong Chang, Myoung-Wan Koo
Sound (cs.SD); Artificial Intelligence (cs.AI); Computation and Language (cs.CL)
Comments: Accepted to Interspeech 2026
查看摘要
Automatic dysarthria severity assessment is limited by the scarcity of labeled pathological speech data. To address this, we propose Cross-lingual Retrieval-Augmented Classification (CRAC), which leverages speech from a different language via an align-retrieve-fuse pipeline. Supervised contrastive learning first shapes a severity-focused embedding space, then a vector database is built from the opposite-language corpus. During both training and inference, the classifier retrieves top-k references from the aligned space and fuses them with the input via cross-attention. Evaluated on Korean post-stroke and Italian ALS dysarthria datasets under a speaker-independent three-class protocol, CRAC achieves balanced accuracies of 87.3% on Korean and 86.7% on Italian, improving over monolingual baselines by 8.4 and 20.0 percentage points, respectively.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文提出了一个名为 CRAC 的跨语言检索增强分类框架,通过模拟临床医生“参考过往病例”的诊断逻辑,利用其他语言的病理语音数据来检索和融合参考样本,有效解决了低资源场景下构音障碍严重程度自动评估的数据稀缺问题。

2. 研究背景与动机

  • 核心问题:构建可靠的构音障碍(一种运动性言语障碍)严重程度自动评估系统,面临着带临床标签的病理语音数据严重稀缺的挑战。
  • 重要性:传统的评估依赖语言病理学家(SLPs)的听觉感知评估,耗时、昂贵且存在评估者间的主观差异。自动评估系统能极大提升临床效率,辅助治疗规划和长期监测。
  • 现有不足:虽然跨语言适应(利用其他语言的数据)是解决数据稀缺的潜在方案,但简单地将多语言数据混合训练往往适得其反。因为模型容易过拟合于特定语言的声学特征,而非真正与病情严重程度相关的特征,导致性能下降。

3. 核心方法

  • 方法名称:跨语言检索增强分类框架。
  • 关键创新点
    1. 临床启发的对齐-检索-融合流水线:将语言病理学家“对比过往病例进行判断”的临床推理过程操作化。
    2. 严重程度聚焦的嵌入空间:利用监督对比学习,强制模型忽略语言和任务差异,仅按严重程度聚类。
    3. 跨语言检索与交叉注意力融合:在推理时动态检索异国语言的相似病理样本作为“参考书”,与输入特征融合以稳定决策边界。
  • 直觉性解释
    CRAC 的工作原理就像一个经验丰富的医生。第一步(对齐):它先学会把不同国家、不同任务的病人录音,纯粹按照“病情轻重”分门别类放好,忽略口音和语言的干扰。第二步(建库):把另一个国家的病人录音做成一个“病历库”。第三步(检索与融合):当遇到一个新病人时,系统会去这个异国病历库里找几个病情最相似的“参照病例”,然后结合新病人和参照病例的特征,综合做出最终的严重程度判断。

4. 实验与结果

  • 数据集:韩国中风后构音障碍数据集(KR)和意大利肌萎缩侧索硬化症(ALS)构音障碍数据集(IT)。包含发音时长(MPT)和轮替运动(DDK)共6种语音任务。
  • 基线方法:Baseline 1(仅用目标语言数据的单语训练),Baseline 2(简单混合韩意两国数据的朴素多语言训练)。
  • 主要实验结果
  • 在韩国数据集上,CRAC 的平衡准确率达到 87.3%,比单语基线提升了 8.4 个百分点。
  • 在意大利数据集上,CRAC 达到 86.7%,比单语基线大幅提升了 20.0 个百分点。
  • 朴素混合数据(Baseline 2)在韩国数据集上反而导致性能下降(从78.9%降至76.4%),证明了结构化检索的必要性。
  • 消融实验揭示
  • 单独使用对比学习对齐(无检索)效果不稳定。
  • 单独使用检索(无对齐)会导致性能大幅下降,因为未对齐的空间检索到的是语言相似而非病情相似的噪声样本。
  • 对齐和检索缺一不可,两者互补才能发挥最大效用。此外,检索数量 top-k=5 时效果最佳,过多会引入噪声。

5. 优势与局限

  • 主要优势
    1. 有效规避了朴素多语言数据混合带来的语言特征干扰问题,真正提取了跨语言的“严重程度”通用特征。
    2. 框架设计符合医学常理和临床诊断逻辑,具有较强的可解释性。
    3. 模块化设计(冻结Whisper,仅训练投影头和融合模块)在低资源下计算高效且易于实现。
  • 局限性
    1. 验证范围较窄,仅在两种语言(韩、意)和两种病因(中风、ALS)上进行了测试,对更多语言和病因的泛化能力仍未知。
    2. 严重依赖外部向量数据库的构建,若源语言数据库规模极小,检索到的参考样本可能缺乏多样性。
    3. 论文声称检索提供了“互补线索”,但缺乏对检索质量(如检索样本的准确率)的深入定量分析。

6. 关键结论与启发

  • 核心 Takeaway:在医疗语音处理等低资源场景中,跨语言数据不能“简单粗暴”地混合训练。通过对比学习构建任务导向(如严重程度)的统一特征空间,并辅以动态检索增强,是利用异构数据提升性能的有效范式。
  • 启发与延伸方向
    1. 这种“对齐-检索-融合”的范式可以很容易地迁移到其他医疗音频分类任务中,例如抑郁症、帕金森病的语音检测,或者不同录音设备间的跨域适应。
    2. 后续研究可以探索更复杂的检索策略,例如不仅检索相似病情,还检索典型健康样本作为对比锚点,进一步增强决策边界的清晰度。
#103
cs.SD
Carnegie Mellon University (QS Top 100)

Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS

Seymanur Akti, Alexander Waibel
Sound (cs.SD); Computation and Language (cs.CL)
Comments: Accepted to Interspeech 2026
查看摘要
Humans tend to speak louder and clearer in challenging environments, such as noisy conditions or when addressing hearingimpaired listeners, which is called Lombard effect. To simulate this behavior in speech synthesis systems, we introduce a flow-matching based text-to-speech (TTS) model trained with vocal effort and articulation pseudo-labels. The proposed model achieves continuous and disentangled control of vocal effort and articulation, while also enabling word-level emphasis for clarifying specific segments of an utterance. Experimental results show that these control mechanisms effectively improve clarityrelated acoustic features. Furthermore, speech-in-noise experiments demonstrate that our model successfully simulates the intelligibility gains of human clear speech in noisy conditions.

📖 深度解读

1. 一句话总结

本文提出了一种基于流匹配的TTS框架,通过解耦控制“发声力度”和“发音清晰度”来模拟人类在嘈杂环境下的Lombard效应(自动提高音量和清晰度),并支持词级别的重点强调,从而显著提升合成语音在噪声环境中的可懂度。

2. 研究背景与动机

  • 核心问题:如何让TTS系统像人类一样,在嘈杂环境中或面对听力障碍者时,自动生成更清晰、更易听懂的“Lombard语音”。
  • 重要性:随着语音助手和交互设备的普及,TTS系统经常面临复杂的真实声学环境。赋予TTS动态适应环境、提升语音可懂度的能力,对助听设备、车载语音和对话系统至关重要。
  • 现有不足:早期的信号处理方法(如简单放大音量、拉长语音)自然度差;近期的神经网络方法多关注全局特征(如信噪比增益),且通常将“发声力度”和“发音清晰度”混为一谈或独立处理,缺乏一个统一且解耦的控制机制来捕捉它们对可懂度的联合贡献。

3. 核心方法

  • 方法/模型:基于Matcha-TTS(一种流匹配模型)构建的多维度Lombard语音合成框架。
  • 关键创新点
    1. 双轴解耦控制:将Lombard效应分解为“发声力度”(控制音量和频谱能量分布)和“发音清晰度”(控制咬字清晰度和语速)两个独立的控制轴,通过伪标签映射到连续的嵌入空间,支持独立或联合调节。
    2. 因子化注入策略:将风格嵌入同时注入到时长预测器(控制语速、音素拉伸)和声学解码器(控制频谱倾斜、能量分布)中,实现时间与频谱特征的双重调控。
    3. 多级控制:不仅支持整句话的全局风格调节,还支持词级别的精细控制,可以对句子中的特定词汇进行“超清晰发音”和重音强调。
  • 直觉性解释:就像人听到噪音时会不自觉地“大声喊”并且“放慢语速、用力咬字”一样。该模型把这两种行为变成了两个独立的旋钮(发声力度 $\alpha$ 和发音清晰度 $\beta$)。你可以只调大音量而不改变语速,也可以只让某个听不清的关键词被“字正腔圆”地重读,而句子其他部分保持正常语速。

4. 实验与结果

  • 数据集:训练使用Expresso数据集(提取特定风格)结合LJ Speech(增加音素多样性);评估使用Harvard Sentences数据集。
  • 基线方法:一种朴素的信号处理方法(通过RMS匹配增加音量,通过线性时间拉伸降低语速)。
  • 主要实验结果
  • 客观指标:增大发音清晰度($\beta$)能显著降低ASR的词错率(WER)并增加元音离散度(MVD);增大发声力度($\alpha$)主要提升频谱倾斜和高频能量。在SNR=1的强噪声下,两者联合调节获得了最低的WER。
  • 主观评价(CMOS):在自然度上以+1.97的得分显著优于基线(说明基线简单拉长语音很不自然);在噪声下的可懂度上以+1.13的得分优于中性语音。
  • 词级别强调:对ASR识别错误的词汇应用词级别强调(高清晰度+重音),将特定词的WER从17.61%大幅降低至3.90%。
  • 消融实验揭示:发音清晰度是提升语音可懂度(降低WER)的主要驱动力,而发声力度主要通过频谱重分配提升声音的“可听度”(SII指标)。两者在复杂噪声(如餐厅嘈杂声)中具有互补作用。

5. 优势与局限

  • 主要优势
    1. 解耦且连续的控制:提供了比以往方法更灵活、更精细的风格调节能力,避免了“牵一发而动全身”。
    2. 词级强调能力:能够针对句子中的特定片段进行局部清晰度增强,非常符合真实对话中的纠错修复场景。
    3. 自然度高:相比传统的信号处理拉伸方法,基于流匹配生成的Lombard语音在主观听感上更加自然。
  • 局限性
    1. 评估指标的偏差:使用ASR(Whisper)计算WER来评估可懂度存在局限,因为ASR对极端发声力度(分布外数据)敏感,可能会低估Lombard语音的实际收益。
    2. 特征泄漏问题:词级别的控制存在“特征泄漏”,强调某个词时会影响相邻词的发音,需要人为设置较大的对比度才能实现感知上的局部强调。
    3. 依赖伪标签:模型依赖数据集预设的风格类别进行伪标签映射,可能未能完全覆盖真实世界中复杂多变的Lombard语音特征。

6. 关键结论与启发

  • 关键Takeaway:Lombard效应并非单一的“大声说话”,而是“频谱能量重分配(发声力度)”与“咬字清晰化(发音清晰度)”的协同作用。在TTS中解耦并联合控制这两个维度,能最有效地提升强噪声下的语音可懂度。
  • 启发与延伸方向
    1. 未来的TTS评估应寻找比ASR更鲁棒的可懂度评价指标,以减少分布偏移带来的误差。
    2. 词级别的细粒度控制机制有待优化,未来可探索更精确的时间对齐方法来减少风格特征在相邻词之间的泄漏。
    3. 可以进一步研究该系统与环境感知模块的结合,实现根据实时环境信噪比和噪声类型,自动且动态地调节发声力度和发音清晰度的“闭环”语音合成系统。
🔥 推荐必读
🏷️ 领域语音合成 (TTS) > 情感/风格可控
💡 创新多级Lombard语音合成——基于Matcha-TTS流匹配模型,引入发声力度与发音清晰度的双轴解耦控制及因子化注入策略
⭐ 评分8.0
#104
cs.SD

The Watermark Shortcut: How Provenance Marking Sabotages Audio Deepfake Detection

Nicolas M. Müller, Pascal Debus
Sound (cs.SD); Artificial Intelligence (cs.AI)
查看摘要
Provenance watermarking is increasingly treated as a safeguard for synthetic speech, whether built directly into speech-generation models such as Chatterbox, provided through dedicated techniques such as AudioSeal, or deployed by commercial platforms such as ElevenLabs. We identify a previously uncharacterized liability: when synthetic speech is watermarked and human speech is not, detectors trained alongside latch onto the watermark as a spurious "watermark => fake" shortcut. This single feature yields three coupled failures: generalization degradation (model performance deteriorates on unseen data), strip-to-evade (a watermarked fake escapes once unwatermarked), and mark-to-frame (watermarking a real voice flags it as fake). In a controlled white-box experiment, a watermark-trained detector shows all three (for example, mark-to-frame lifts Equal Error Rate from 16% to 75%). In a black-box test of a commercial API, we show that adding a watermark to real speech disguises it as fake. However, this shortcut is fixable: retraining with the watermark on both classes decorrelates it and restores clean behavior. We release experiment data as a paired clean-versus-watermarked corpus (WASP).

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

这篇论文揭示了音频深度伪造检测器在训练时会将“水印”误认为“伪造”的捷径,导致检测器既会被去除水印的假音频欺骗,又会把加了水印的真音频误判为假,并提出通过在训练时对真假音频同时加水印来修复这一漏洞。

2. 研究背景与动机

  • 核心问题:当合成语音(假音频)默认带有溯源水印(如Chatterbox自带的PerTh水印),而真实人类语音不带水印时,深度伪造检测器会在训练时学到一种虚假的因果关系——“有水印=假音频”。
  • 重要性:随着TTS(文本转语音)技术的发展,工业界越来越倾向于默认在生成的音频中嵌入水印以供溯源。然而,这种“默认开启”的工业实践污染了检测器的训练数据,引入了严重的安全漏洞。
  • 现有不足:以往的研究只关注水印在测试阶段作为一种“干扰项”对检测器精度的影响,而忽略了在训练阶段引发的“捷径学习”问题,以及由此引发的耦合攻击(逃避检测和诬陷攻击)。

3. 核心方法

  • 提出的方法/框架:本文主要不是提出一个新模型,而是揭示了一个漏洞机制,并提出了一种基于数据增强的缓解策略。
  • 关键创新点
    1. 定义了三种耦合失效模式:泛化退化(在无水印的未见数据上表现变差)、strip-to-evade(去除假音频的水印即可逃避检测)、mark-to-frame(给真音频加水印会被诬陷为假)。
    2. 提出并验证了缓解策略(WM-aug):在训练时,对真实和伪造音频都添加水印,从而打破水印与“伪造”标签之间的相关性。
    3. 构建并开源了WASP数据集:包含配对的干净音频与加水印音频,排除了生成模型本身的干扰,专门用于研究水印对检测器的影响。
  • 核心思路(直觉性解释):这就好比一个学生考试时发现所有错题都用红笔标记,于是他偷懒不学知识,只要看到红笔就打叉(捷径学习)。结果换一份没有红笔的卷子他就不及格了(泛化退化);如果把错题的红笔擦掉,他就以为是正确答案(逃避检测);更荒谬的是,如果你在正确的题目上画个红笔,他也会打叉(诬陷真音频为假)。修复方法很简单:训练时给对错题都随机画红笔,逼着模型去学真正的知识,而不是看红笔做题。

4. 实验与结果

  • 数据集/基准:白盒实验使用 ASVspoof19 数据集;外部测试使用 ASVspoof21-LA 和 In-the-Wild 数据集;黑盒实验使用自建的 WASP 数据集。
  • 对比的基线方法:Clean-trained detector(在无水印数据上训练的AASIST模型)、商业检测器API。
  • 主要实验结果
  • 白盒实验:水印训练的检测器在带水印假音频上表现极好(EER 0.7%),但这只是假象。去除假音频水印后,EER飙升至31.2%(strip-to-evade);给真音频加水印,EER高达74.6%(mark-to-frame,对照组仅16.4%);在未见过的数据集上,EER比对照组差约9个百分点。
  • 黑盒实验:在商业API上,给真实英语语音加PerTh水印,其“伪造得分”从7.8%升至19.3%,误报率(FPR)从4%升至13%。
  • 消融实验/缓解实验:使用WM-aug(真假音频均加水印)重新训练后,模型在各项测试中恢复到与Clean-trained detector相当的水平,不仅泛化能力恢复,strip-to-evade和mark-to-frame攻击也基本失效。

5. 优势与局限

  • 主要优势
    1. 洞察深刻且切中时弊:抓住了工业界“默认加水印”这一普遍实践与检测器训练之间的隐蔽冲突,问题定义非常清晰。
    2. 论证严密:通过白盒(完全可控)和黑盒(真实商业API)双重验证,证明了该漏洞不仅在理论中存在,在现实中已发生。
    3. 修复方案极其简单有效:不需要修改模型架构,只需简单的数据增强即可解决。
  • 局限性
    1. 黑盒实验中strip-to-evade未生效:论文如实指出,商业API因为训练数据规模大,学到了真实的合成特征,因此去除水印并不能骗过它。这说明捷径学习的严重程度可能受模型规模和数据多样性的限制。
    2. 水印方案的泛化性未知:缓解策略依赖于在训练时应用特定的水印(如PerTh)。如果未来出现新的水印方案,检测器是否仍会受到影响,需要持续验证。

6. 关键结论与启发

  • 最重要的Takeaway:溯源水印与伪造检测器正处于“冲突轨道”上。水印不应被孤立地视为溯源工具,它同时是检测器输入空间中的强特征。如果不加干预地用带水印的合成数据训练检测器,水印就会成为致命的捷径。
  • 启发与延伸方向
    1. 未来的检测器训练必须进行“水印去相关”处理,将水印视为一种需要鲁棒对待的数据增强,而非分类依据。
    2. 学术界和工业界在评估检测器时,应将水印状态作为一个重要的评估维度,论文开源的WASP数据集为此提供了基础。
    3. 可以进一步研究如何从架构层面(如特征解耦)让模型自动忽略水印信号,而不是依赖人工的数据增强策略。
#105
cs.SD

OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics 跨领域

Korbinian Kuhn, Gottfried Zimmermann
Computation and Language (cs.CL); Sound (cs.SD)
Comments: 5 pages, 2 figures
查看摘要
Advances in deep learning and end-to-end Automatic Speech Recognition (ASR) have enabled robust multilingual models, but evaluation metrics remain limited in assessing accuracy. Efforts to improve or replace the common metric Word Error Rate (WER) often focus on English, leaving evaluations for low-resource languages under-explored and hindering fair cross-lingual comparisons. We present OpenWER, an open-source implementation that improves WER robustness through language-specific normalisation and compound word detection. A token-based Levenshtein alignment preserves complementary metrics and allows metadata embedding for granular accuracy scores. Our analysis of 52 languages shows absolute WER reductions of up to 25% compared to common libraries. OpenWER contributes to fairness in ASR research by increasing the reliability of WER across diverse languages and enabling more comprehensive accuracy evaluations.

📖 深度解读

以下是对论文《OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics》的结构化中文解读报告:

1. 一句话总结

这篇论文提出了一个名为 OpenWER 的开源语音识别评估库,通过非破坏性文本归一化和复合词检测技术,解决了多语言 ASR 评估中词错率(WER)虚高的问题,并支持保留标点、大小写及元数据以实现更细粒度的准确率评估。

2. 研究背景与动机

  • 核心问题:如何在不同语言(尤其是低资源语言)间公平、准确地评估自动语音识别(ASR)系统的转录准确率。
  • 重要性:随着多语言 ASR 模型(如 Whisper)的普及,客观、通用的评估指标是对比模型性能、发现语言偏见的关键。
  • 现有不足
    1. 传统的 WER 指标过于简单,把所有错误一视同仁,且与人类感知的语音质量相关性弱。
    2. 基于 NLP/ML 的改进指标依赖训练数据,在低资源语言上容易引入偏见,且泛化能力差。
    3. 传统的文本预处理(如去除标点、统一大小写)具有“破坏性”,不仅主要针对英语设计,还丢失了标点和格式信息,导致即使 WER 很低,文本仍可能难以阅读。

3. 核心方法

  • 方法/框架:OpenWER,一个基于 Python 的开源 ASR 评估库。
  • 关键创新点
    1. 非破坏性归一化:在归一化过程中保留原始 token 和元数据,所有修改被记录在特定字段中,不丢失标点和大小写信息。
    2. 复合词检测:扩展了 Levenshtein 距离算法,在计算成本矩阵时允许合并相邻 token,以处理因连字符或空格缺失/多余导致的复合词对齐错误。
    3. 基于 Token 的对齐与元数据嵌入:以 token 而非字符串为对齐单位,支持嵌入 ASR 模型的置信度、时间戳,或 NLP 工具的词性(POS)、命名实体识别(NER)标签,从而支持多维度的自定义评估。
  • 直觉性解释:传统的 WER 计算像是在用涂改液修改原句,改完之后原貌(标点、大小写)就没了,而且遇到德语那种长复合词,稍微拼错一点就被算作全错。OpenWER 则像是在原句上铺一层“透明描图纸”,在纸面上进行归一化和对齐计算,底层原句的标点、大小写和附加信息完好无损。同时,它还能像拼图一样,智能地把错位的复合词拆开重新对齐,从而更公平地计算错误率。

4. 实验与结果

  • 数据集/基准:Common Voice 17 数据集(涵盖 52 种语言,约 69 万条转录样本);1000 条英语随机样本(用于对比 10 个 ASR 模型)。
  • 对比基线:JiWER 库(常规归一化)和 Whisper 归一化器(深度归一化)。
  • 主要实验结果
    1. 算法等效性验证:在不开启特殊功能时,OpenWER 计算的 WER 与 JiWER 在统计上等效。
    2. WER 显著降低:在全量归一化下,OpenWER 的平均 WER(35.7%)显著低于 Whisper(39.6%)和 JiWER(43.4%)。相比 JiWER,绝对 WER 最高降低了 41.4%(相对降低 65.1%)。
    3. 复合词的影响:开启复合词检测后,平均 WER 从 27.7% 降至 25.3%,在某些特定语言中,降幅高达 20%。
  • 消融/验证实验揭示
    1. 引入标点 token 和可变编辑成本不会影响标准 WER 的等效性。
    2. 不同的分词方法(基础分词、NLP分词、ASR词列表)产生的 WER 结果等效。
    3. 示例评估显示,WER 相似的模型在标点和大小写准确率上差异巨大;且 ASR 模型输出的置信度分数与实际词正确率之间仅呈中度相关,并不完全可靠。

5. 优势与局限

  • 主要优势
    1. 提升跨语言公平性:通过复合词检测和灵活的归一化,大幅减少了非语义差异对 WER 的扭曲,尤其有利于改善低资源语言的评估偏见。
    2. 评估维度更全面:非破坏性设计使得同时评估 WER、标点错误率、大小写错误率成为可能,支持结合 NLP/ASR 元数据进行细粒度诊断。
    3. 模块化与开源设计:易于社区扩展,只需极少编程知识即可添加语言特定的归一化规则。
  • 局限性
    1. 性能瓶颈:纯 Python 实现导致处理速度远不及基于 C 语言的 JiWER(即使开启 JIT,速度仍慢约 13 倍),不适合对性能要求极高的超大规模实时场景。
    2. 复合词处理的语义局限:无字典的复合词合并只是一种近似算法,无法区分词性导致的细微语义差异(如 setup 名词 vs set up 动词)。
    3. 语言特定归一化覆盖有限:目前仅内置了英语和德语的特定归一化器,其他语言的归一化效果仍依赖社区后续贡献。

6. 关键结论与启发

  • 最重要的 Takeaway:WER 仍然是最实用的 ASR 评估指标,但通过“非破坏性预处理”和“算法级复合词对齐”,可以在不引入 ML 偏见的前提下,大幅提升其在多语言环境下的鲁棒性,并解锁更丰富的评估维度。
  • 对后续研究的启发
    1. 未来的 ASR 评估应摒弃单一的 WER 指标,转向基于 Token 的多维评估体系(结合标点、大小写、实体识别准确率等)。
    2. OpenWER 暴露出 ASR 模型置信度与实际正确率相关性弱的问题,启发后续研究探索更可靠的词级置信度评估方法。
    3. 算法性能方面,将 OpenWER 的改进版 Levenshtein 算法用编译语言(如 C++/Rust)重写,是一个明确的工程优化方向。
👀 推荐值得看
🏷️ 领域语音识别 (ASR) > 低资源与多语言
💡 创新非破坏性文本归一化与复合词检测的ASR评估库——基于Levenshtein距离算法改进,引入token级对齐和元数据嵌入
⭐ 评分7.0
#106
cs.SD

Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio 跨领域

Ran Piao, Tsai-Ning Wang, Martijn den Dekker, Linda Moonen, Hareld Kemps 等 (7 人)
Machine Learning (cs.LG); Sound (cs.SD)
查看摘要
Clinical audio diagnosis in low-resource settings requires models that identify conditions from minimal examples without large annotated corpora. We propose Federated Self-Contextualization (FSC), a multimodal language model framework for in-context clinical audio diagnosis across federated hospital clients. FSC constructs pseudo-label episodes via unsupervised clustering of audio representations, bypassing scarce real diagnostic labels, and enables contextual reasoning from support-query pairs. Our progressive three-stage pipeline first aligns audio embeddings with the language model via caption-based pretraining, then adapts it for episodic in-context inference through federated optimization. At test time, given a small labeled support set, the model diagnoses an unseen query through multimodal reasoning. On held-out respiratory and cardiac conditions, FSC achieves 71.6% accuracy in 2-way 2-shot evaluation, outperforming audio-language baselines by over 9%.

📖 深度解读

以下是对这篇论文的结构化中文解读报告:

1. 一句话总结

本文提出了一种名为FSC的联邦学习框架,通过使用无语义的伪标签训练多模态大模型掌握音频匹配的“推理技能”,并结合医疗大模型自带的临床知识,实现了在隐私保护且无需真实标注数据情况下的临床音频少样本诊断。

2. 研究背景与动机

  • 核心问题:如何在数据孤岛(医院间无法共享数据)、缺乏专家标注且需要保护隐私的情况下,利用多模态大模型进行开放词汇的临床音频(如呼吸音、心音)诊断。
  • 重要性:临床音频诊断本质上是一个结合声学证据和医学知识的开放性推理过程。传统的封闭集分类方法无法适应真实世界中不断演变的临床需求和新疾病种类。
  • 现有不足
    1. 传统深度学习方法依赖大量集中式标注数据,无法处理未见过的新疾病,且面临严重的隐私壁垒。
    2. 纯声学的少样本方法(如原型网络)仅依赖嵌入距离,缺乏对医学语义的理解。
    3. 训练大模型进行上下文学习(ICL)需要结构化的“音频-标签”示范对,而这在隐私受限的医疗机构中恰恰是最稀缺的。

3. 核心方法

  • 方法/框架:Federated Self-Contextualization (FSC),一种基于联邦学习的多模态音频-语言模型框架。
  • 关键创新点
    1. 解耦推理技能与医学知识:用无医学语义的伪标签(如“山风”、“海浪”)训练模型学会“根据上下文匹配音频”的抽象推理技能;测试时再利用医疗大模型预训练的医学知识来理解真实疾病标签(如“哮喘”)。
    2. 渐进式三阶段训练流水线:逐步解冻和训练不同模块,防止大模型参数在早期破坏尚未对齐的音频表征。
    3. 联邦伪标签生成:各医院客户端独立进行音频聚类生成伪标签,无需统一标签空间,原始数据绝不出域。
  • 直觉性解释:想象教一个懂医学但不懂听诊的医学生(MedGemma)做诊断。由于没有真实病历,老师先用一些毫无意义的代号(如“山风”)把不同的呼吸音分组,让学生练习“听到A声音就对应A代号”的推理逻辑。等学生练熟了这种逻辑,到了真正考试时,把代号换成真实的疾病名(如“哮鸣音”),学生就能结合自己已有的医学知识,准确地把声音和疾病对应起来。整个练习过程是在各家医院内部独立进行的,大家只交流学习心得(模型参数),不分享病人录音。

4. 实验与结果

  • 数据集:7个涵盖呼吸和心脏音频的医学数据集(如ICBHI, CIRCOR等),共超2.2万条录音,模拟7个联邦客户端。
  • 基线方法:Pengi, GAMA, Gemma3n, Qwen2.5-Omni-7B, Audio Flamingo(均为集中式训练的音频语言模型)。
  • 主要实验结果
  • 在2-way 2-shot评估中,FSC达到71.6%的准确率,比最强基线(Qwen2.5-Omni-7B,62.1%)高出超9个百分点。
  • 在具体疾病上表现优异,如上呼吸道感染(URTI)准确率达89.3%,异常心音达80.7%。
  • 消融实验揭示
    1. 渐进式训练有效:联合训练会导致性能下降5.7个百分点。
    2. 真正利用了音频:去掉音频输入后准确率降至49.7%(接近随机猜测),证明模型没有单纯依赖语言先验作弊。
    3. 反直觉发现:联邦优于集中式。在相同伪标签策略下,联邦训练(71.6%)比集中式训练(65.4%)高出6个点。论文解释称,跨机构的异构数据分布起到了天然的正则化作用,防止模型过拟合于单一的聚类结构。
    4. 医疗大模型骨干至关重要:换成通用LLM(如LLaMA, Qwen)性能大幅下降。

5. 优势与局限

  • 主要优势
    1. 破解了医疗AI中“数据孤岛”与“标注稀缺”的双重困境,极具临床落地价值。
    2. “无意义伪标签+预训练知识”的设计非常巧妙,使模型具备了真正的开放词汇泛化能力。
  • 局限性
    1. 随着分类类别增加(如3-way)或支持集变大(如5-shot),性能下降明显。论文指出这是自回归模型注意力被稀释导致的,说明模型处理长上下文多模态输入的能力有限。
    2. 伪标签的聚类数量(C=10)是人为设定的超参数,不同数据集的最优C值可能不同,缺乏自动化选择机制。
    3. 模型对测试时的Episode格式较为敏感,训练和测试格式需保持一致。

6. 关键结论与启发

  • 最重要的Takeaway:大模型的“推理技能”和“领域知识”可以分别获取并组合。在缺乏领域标注数据时,可以通过无监督伪标签训练纯粹的推理逻辑,再利用大模型预训练知识进行语义接地。
  • 启发与延伸方向
    1. 方法论推广:这种“无意义伪标签训练推理+预训练知识提供语义”的范式,可推广至其他缺乏标注的多模态领域(如脑电波分析、超声图像等)。
    2. 联邦学习的新认知:联邦学习不仅是隐私保护的工具,跨机构的异构性本身可以作为一种提升模型泛化能力的天然正则化手段,这为分布式医疗AI提供了新的理论视角。
    3. 未来改进:需探索降低自回归多模态模型对上下文长度敏感的方法,以支持更复杂(更多类别、更多样本)的临床诊断场景。
#107
cs.SD

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models 解读失败跨领域

Shunsuke Kando, Wataru Nakata, Shinnosuke Takamichi, Yusuke Miyao
Computation and Language (cs.CL); Sound (cs.SD)
Comments: Accepted to Interspeech2026
查看摘要
Generative Spoken Language Modeling (GSLM) enables text-free speech modeling by training language models (LMs) using discrete speech representations instead of textual transcription. In this paper, we investigate the performance of GSLM on speech synthesis and continuation using discrete speech representations with varying bitrates. We segment speech representations with fixed widths and train K-means models in multiple cluster sizes, resulting in various bitrate settings. We demonstrate that intelligible and natural speech can be synthesized at lower bitrate settings than the baseline. Furthermore, speech continuation quality remains stable at lower bitrates across multiple metrics, suggesting that the conventional GSLM setting may be redundant for effective speech generation. Although LLM-based metrics show higher correlation with human subjective score than conventional metrics, it remains low, highlighting the need for more stable automatic evaluation methods.

📖 深度解读

[PDF 下载失败,无法解读]

#108
cs.SD

QAMO: Quality-aware Multi-centroid One-class Learning For Speech Deepfake Detection 解读失败跨领域

Duc-Tuan Truong, Tianchi Liu, Ruijie Tao, Junjie Li, Kong Aik Lee 等 (6 人)
Sound (cs.SD); Artificial Intelligence (cs.AI)
Comments: Accepted by INTERSPEECH 2026
查看摘要
Recent work shows that one-class learning can detect unseen deepfake attacks by modeling a compact distribution of bona fide speech around a single centroid. However, the single-centroid assumption can oversimplify the bona fide speech representation and overlook useful cues, such as speech quality, which reflects the naturalness of the speech. Speech quality can be easily obtained using existing speech quality assessment models that estimate it through Mean Opinion Score. In this paper, we propose QAMO: Quality-Aware Multi-Centroid One-Class Learning for speech deepfake detection. QAMO extends conventional one-class learning by introducing multiple quality-aware centroids. In QAMO, each centroid is optimized to represent a distinct speech quality subspaces, enabling better modeling of intra-class variability in bona fide speech. In addition, QAMO supports a multi-centroid ensemble scoring strategy, which improves decision thresholding and reduces the need for quality labels during inference. With two centroids to represent high- and low-quality speech, our proposed QAMO achieves an equal error rate of 5.09% in In-the-Wild dataset, outperforming previous one-class and quality-aware systems.

📖 深度解读

[LLM 解读失败: HTTP 429]

#109
cs.SD

Physics-Informed Neural Networks for Speech Production 解读失败跨领域

Kazuya Yokota, Ryosuke Harakawa, Masaaki Baba, Masahiro Iwahashi
Sound (cs.SD)
Comments: This work was published in IEEE Transactions on Audio, Speech, and Language Processing
查看摘要
The analysis of speech production based on physical models of the vocal folds and vocal tract is essential for studies on vocal-fold behavior and linguistic research. This paper proposes a speech production analysis method using physics-informed neural networks (PINNs). The networks are trained directly on the governing equations of vocal-fold vibration and vocal-tract acoustics. Vocal-fold collisions introduce nondifferentiability and vanishing gradients, challenging phenomena for PINNs. We demonstrate, however, that introducing a differentiable approximation function enables the analysis of vocal-fold vibrations within the PINN framework. The period of self-excited vocal-fold vibration is generally unknown. We show that by treating the period as a learnable network parameter, a periodic solution can be obtained. Furthermore, by implementing the coupling between glottal flow and vocal-tract acoustics as a hard constraint, glottis-tract interaction is achieved without additional loss terms. We confirmed the method's validity through forward and inverse analyses, demonstrating that the glottal flow rate, vocal-fold vibratory state, and subglottal pressure can be simultaneously estimated from speech signals. Notably, the same network architecture can be applied to both forward and inverse analyses, highlighting the versatility of this approach. The proposed method inherits the advantages of PINNs, including mesh-free computation and the natural incorporation of nonlinearities, and thus holds promise for a wide range of applications.

📖 深度解读

[LLM 解读失败: HTTP 429]

#110
cs.SD

DHAuDS: A Dynamic and Heterogeneous Audio Benchmark for Test-Time Adaptation 解读失败跨领域

Weichuang Shao, Iman Yi Liao, Tomas Henrique Bode Maul, Tissa Chandesa
Sound (cs.SD); Machine Learning (cs.LG)
查看摘要
Existing Test-time Adaptation (TTA) studies rely heavily on static and homogeneous corruption protocols, such as ImageNet-C and CIFAR-10-C/100-C, leading to inconsistent evaluation settings and potentially inflated robustness estimates that are compared with real-world situations. TTA lacks a standardized evaluation infrastructure capable of modeling realistic heterogeneous acoustic degradation. We introduce DHAuDS, a standardized benchmark suite for evaluating audio classification TTA robustness under dynamic corruption severity and heterogeneous noise mixtures. Rather than proposing a new TTA algorithm, DHAuDS focuses on exposing robustness limitations that remain hidden under conventional fixed-noise evaluation protocols.

📖 深度解读

[LLM 解读失败: HTTP 429]

#111
cs.SD

Mask2Flow-TSE: Two-Stage Target Speaker Extraction with Masking and Flow Matching 解读失败跨领域

Junwon Moon, Seungbeom Kim, Hansol Park, Hyunjin Choi, Hoseong Ahn 等 (7 人)
Sound (cs.SD); Artificial Intelligence (cs.AI)
查看摘要
Target speaker extraction (TSE) extracts the target speaker's voice from overlapping speech given a reference utterance. Existing masking-based approaches are lightweight and effective but suffer from an inability to synthesize missing content, leading to degraded perceptual quality. On the other hand, recent generative TSE models typically synthesize high-quality speech with diffusion, but require numerous iterative steps resulting in high computational costs and latency. We propose Mask2Flow-TSE, a two-stage framework combining the strengths of both paradigms. We introduce the deletion/insertion (D/I) proportion, an analytical tool that reveals early flow steps predominantly remove signal components rather than synthesize them. Based on this finding, we decouple deletion from insertion: a masking-based module handles the deletion-dominant early steps, while a single flow-matching step performs the remaining insertion for high-quality reconstruction. Specifically, the first stage uses lightweight convolution for the masking module, while the second stage employs a Diffusion Transformer (DiT) adapted for TSE with speaker conditioning. Unlike prior approaches that start from Gaussian noise, our method starts from the masked spectrogram, enabling high-quality reconstruction in a single inference step. Experiments show that Mask2Flow-TSE produces high-quality extractions with only 85M parameters and one-step inference, while preserving clean single-speaker inputs with minimal degradation.

📖 深度解读

[LLM 解读失败: HTTP 429]

#112
cs.SD

Voice Privacy from an Attribute-based Perspective 解读失败跨领域

Mehtab Ur Rahman, Martha Larson, Cristian Tejedor-Garcia
Sound (cs.SD); Artificial Intelligence (cs.AI)
Comments: Camera-ready version accepted for publication at Interspeech 2026
查看摘要
Voice privacy approaches that preserve the anonymity of speakers modify speech in an attempt to break the link with the true identity of the speaker. Current benchmarks measure speaker protection based on signal-to-signal comparisons. In this paper, we introduce an attribute-based perspective, where we measure privacy protection in terms of comparisons between sets of speaker attributes. First, we analyze privacy impact by calculating speaker uniqueness for ground truth attributes, attributes inferred on the original speech, and attributes inferred on speech protected with standard anonymization. Next, we examine a threat scenario involving only a single utterance per speaker and calculate attack error rates. Overall, we observe that inferred attributes still present a risk despite attribute inference errors. Our research points to the importance of considering both attribute-related threats and protection mechanisms in future voice privacy research.

📖 深度解读

[LLM 解读失败: HTTP 429]

#113
cs.SD

ERM-MinMaxGAP: Benchmarking and Mitigating Gender Bias in Multilingual Multimodal Speech-LLM Emotion Recognition 解读失败跨领域

Zi Haur Pang, Xiaoxue Gao, Tatsuya Kawahara, Nancy F. Chen
Sound (cs.SD)
Comments: This paper has been accepted for presentation at INTERSPEECH 2026 and as non-archival paper at ICML 2026 Workshop on Machine Learning for Audio
查看摘要
Speech emotion recognition (SER) systems can exhibit gender-related performance disparities, but how such bias manifests in multilingual speech LLMs across languages and modalities is unclear. We introduce a novel multilingual, multimodal benchmark built on MELD-ST, spanning English, Japanese, and German, to quantify language-specific SER performance and gender gaps. We find bias is strongly language-dependent, and multimodal fusion does not reliably improve fairness. To address these, we propose ERM-MinMaxGAP, a fairness-informed training objective, which augments empirical risk minimization (ERM) with a proposed adaptive fairness weight mechanism and a novel MinMaxGAP regularizer on the maximum male-female loss gap within each language and modality. Building upon the Qwen2-Audio backbone, our ERM-MinMaxGAP approach improves multilingual SER performance by 5.5% and 5.0% while reducing the overall gender bias gap by 0.1% and 1.4% in the unimodal and multimodal settings, respectively.

📖 深度解读

[LLM 解读失败: HTTP 429]

#114
cs.SD

Beyond Acoustic Prefixes: Persistent Grounding in Serialized Acoustic Memory for LLM-Based Multi-Talker Speech Recognition 解读失败跨领域

Hao Shi, Yuan Gao, Xugang Lu, Tatsuya Kawahara
Sound (cs.SD)
查看摘要
Large Language Models (LLMs) are effective decoders for Serialized Output Training (SOT) in two-talker automatic speech recognition (ASR), but their performance degrades substantially in three-talker mixtures. A key limitation is that conventional systems provide acoustic evidence only through an initial projected prefix, requiring the decoder to preserve fine-grained talker information throughout autoregressive generation. We first revisit CTC-derived static prefix conditioning using discrete token, hybrid token-acoustic, and continuous acoustic prompts. Although continuous acoustic cues are more reliable than discrete CTC hypotheses, the improvements on Libri3Mix remain limited, showing that richer prefix content alone does not resolve the conditioning bottleneck. We therefore propose persistent grounding in serialized acoustic memory, which enables the decoder to retrieve talker-structured acoustic evidence throughout the utterance. Specifically, talker-disentangled and onset-ordered acoustic representations are retained as external memory and accessed during decoding through gated residual cross-attention. We further introduce joint low-rank refinement of the acoustic retrieval pathway and selected LLM self-attention projections using LoRA. Experiments on Libri2Mix and Libri3Mix under clean and noisy conditions show consistent improvements over conventional LLM-SOT and naive stacked cross-attention, with particularly large gains in three-talker mixtures. These results demonstrate the importance of persistent access to structured, talker-aware acoustic evidence for LLM-based multi-talker ASR.

📖 深度解读

[LLM 解读失败: HTTP 429]

#115
cs.SD

HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation 解读失败跨领域

Jian Zhu, Jianwei Cui, Yunlong Xue, Shihao Chen, Yubang Zhang 等 (7 人)
Sound (cs.SD); Multimedia (cs.MM)
Comments: This paper is submitted to the to National Conference on Man-Machine Speech Communication (NCMMSC)
查看摘要
Music accompaniment generation aims to automatically produce instrumental accompaniments that are rhythmically, harmonically, and timbrally coherent with a given vocal input, with broad applications in personalized music creation, arrangement assistance, and music education. Existing approaches, primarily operating in the symbolic domain or relying on single-stage audio generation frameworks, commonly suffer from insufficient high-level semantic structure modeling, limited acoustic detail reconstruction, and weak conditional controllability. To address these limitations, this paper proposes HAFM, a Hierarchical Autoregressive Foundation Model for vocal-conditioned music accompaniment generation. The model employs a dual-rate tokenization strategy in which $50$ Hz HuBERT semantic tokens capture high-level musical structure and $75$ Hz EnCodec acoustic tokens encode fine-grained acoustic content, enabling explicit disentanglement of semantic and acoustic representations. Building on this foundation, a three-stage cascaded generation framework is designed to progressively generate semantic tokens, coarse acoustic tokens, and fine acoustic tokens, refining the accompaniment from global structure to local detail. . Objective evaluation on the MUSDB18 dataset demonstrates that the full three-stage model achieves a Fr{é}chet Audio Distance (FAD) score of 1.71, representing an 18.6% relative improvement over the two-stage baseline (FAD = 2.10). Subjective listening tests show that the generated accompaniments achieve a 51.5% preference rate against ground-truth accompaniments in head-to-head comparisons, and substantially outperform the random baseline in terms of rhythmic alignment, harmonic compatibility, and overall musical coherence. The source code and demo are available at this https URL .

📖 深度解读

[LLM 解读失败: HTTP 429]

#116
cs.SD

Environmental Sound Deepfake Detection Using Deep-Learning Framework 解读失败跨领域

Khoi Vu, Dat Tran, Khanh Do, Phat Lam, Vu Nguyen 等 (11 人)
Sound (cs.SD); Artificial Intelligence (cs.AI)
查看摘要
In this paper, we propose a deep-learning framework for Environmental Sound Deepfake Detection (ESDD) - the task of identifying whether the sound scene and sound event in an input audio recording is fake or real. To this end, we first conduct extensive experiments to explore how individual spectrograms, a wide range of network architectures, and pre-trained models affect the performance of an ESDD model. The experimental results on the benchmark datasets of EnvSDD indicate that detecting deepfake audio of sound scenes and detecting deepfake audio of sound events should be considered as individual tasks. We also show that fine-tuning a pre-trained model is more effective than training a model from scratch for ESDD. Ultimately, our best model, which fine-tunes the pre-trained BEATs model using the proposed two-phase training strategy, achieves an Accuracy of 0.98, F1 score of 0.95, and AUC score of 0.99 on the Test subset of the EnvSDD dataset. Our best model also achieves an Accuracy of 0.86, F1 score of 0.80, and AUC of 0.93 when evaluated cross-dataset on the ESD-Challenge-TestSet dataset.

📖 深度解读

[LLM 解读失败: HTTP 429]

#117
cs.SD

WASIL: In-the-Wild Arabic Spoken Interactions with LLMs 解读失败跨领域

Zien Sheikh Ali, Hamdy Mubarak, Soon-Gyo Jung, Hunzalah Hassan Bhatti, Firoj Alam 等 (6 人)
Sound (cs.SD); Artificial Intelligence (cs.AI); Computation and Language (cs.CL)
Comments: Spoken Prompts, Multilingual LLMs, Speech-based Evaluation, Dialectal Speech, Low-resource Languages, Conversational AI, Speech-to-Text QA, Real-world Interaction, Spoken Language Understanding
查看摘要
Large Language Models (LLMs) voice assistants are commonly built as cascaded Automatic Speech recognition (ASR) to LLM systems, where recognition errors can distort user intent. Dislikes may also arise from ambiguous, out-of-domain, or non-request turns, making it hard to isolate ASR effects. We release WASIL (it denotes connection or linking in Arabic): in-the-wild Arabic spoken interaction prompts with audio, ASR hypotheses, assistant responses, and explicit like/dislike feedback (8,529 turns; 14.2% dislikes), plus a 2,000-turn test set covering Modern Standard Arabic (MSA) and four major dialects with their labels. We provide low-cost gold transcripts via multi-ASR agreement-guided post-editing and annotate answerability (answerable, ambiguous/needs-clarification, unsupported, not-a-request/noise) to separate intrinsic unanswerability from ASR-induced degradation. Finally, we describe scalable reference-free evaluation of responses from ASR vs. gold transcripts using multi-judge LLM scoring.

📖 深度解读

[LLM 解读失败: HTTP 429]

#118
cs.SD

Audio Deepfake Detection with Half-Truth Localisation Using Cross-Attentive Feature Fusion 解读失败跨领域

S. Sutharya, Remya K. Sasi
Sound (cs.SD); Computer Vision and Pattern Recognition (cs.CV); Machine Learning (cs.LG)
Comments: 13 pages, 5 figures, 11 tables
查看摘要
Audio deepfake detection is well-studied as a binary problem, but partially manipulated speech, where a short synthesised segment is spliced into an otherwise genuine utterance, poses a harder and more realistic threat. Detecting such half-truth audio requires not only distinguishing it from real and fully fake speech, but also localising where the manipulation occurs. We present CAFNet, a 576k-parameter architecture that addresses both tasks jointly: it performs ternary classification (real, fully-fake, or half-truth) and regresses the temporal boundaries of the synthesised region in a single forward pass. CAFNet fuses Mel-Frequency Cepstral Coefficient (MFCC), Linear-Frequency Cepstral Coefficient (LFCC), and Chroma Short-Time Fourier Transform (Chroma-STFT) features through parallel depthwise-separable convolution branches with cross-attention, followed by a Bidirectional Long Short-Term Memory (BiLSTM) regression head for boundary prediction. On the combined Multi-Lingual Audio Deepfake Detection Corpus (MLADDC) T2+T3 test set, CAFNet achieves 92.71% accuracy and macro Area Under the Curve (AUC) of 0.9910, with boundary localisation Mean Absolute Error (MAE) of 0.075s and a median error of 0.052s. On binary detection, it achieves 96.76% accuracy and 3.20% Equal Error Rate (EER), outperforming fine-tuned XLS-R 300M (78.31%) and AST 87M (93.03%) at over 500 times fewer parameters. A cross-dataset study further shows that standard fine-tuning collapses cross-domain representations even under reduced backbone learning rates.

📖 深度解读

[LLM 解读失败: HTTP 429]

#119
cs.SD

Dual-Granularity Orthogonal Disentanglement for Generalizable Audio Deepfake Detection 解读失败跨领域

Zhuodong Liu, Hugen Lv, Xiangyu Li, Chunhong Yuan
Sound (cs.SD); Artificial Intelligence (cs.AI)
Comments: Accepted at Interspeech 2026, 5 pages, 3 figures
查看摘要
Audio deepfake detectors often fail to generalize across speakers, as they learn speaker-identity features rather than synthesis artifacts, known as implicit identity leakage. Existing methods address this but incur architectural complexity or training instability. This paper proposes a dual-granularity orthogonal disentanglement framework enforcing feature independence at two levels: sample-level cosine orthogonality captures directional decorrelation, while batch-level cross-covariance regularization eliminates linear correlations across embedding dimensions. A curriculum disentanglement schedule progressively strengthens the orthogonality constraint without auxiliary networks or adversarial dynamics. Experiments on ASVspoof 2019 LA, ASVspoof 2021 DF, and In-the-Wild datasets demonstrate that the proposed method achieves 1.35%, 7.88%, and 21.58% equal error rates (EER), respectively, surpassing gradient reversal disentanglement by 2.60% absolute on cross-dataset transfer.

📖 深度解读

[LLM 解读失败: HTTP 429]

#120
cs.SD

MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild 解读失败跨领域

Haotian Qi, Gabriel Skantze
Sound (cs.SD); Artificial Intelligence (cs.AI); Human-Computer Interaction (cs.HC)
查看摘要
Current multiparty turn-taking models often rely on complex microphone arrays or multi-camera setups, limiting their applicability in human-robot interaction scenarios. We introduce MuVAP, a causal multimodal framework that extends Voice Activity Projection by grounding acoustic predictions in face tracks, enabling speaker-aware turn-taking predictions from a monaural audio stream and a single camera view. To address the combinatorial complexity of modeling multiple speakers, we propose Role-Relative Projection, which maps any N-speaker interaction onto a fixed current versus next floor-holder state. Because existing audiovisual datasets contain disruptive editing cuts that break causal tracking, we introduce the Audio-Visual Conversation Corpus, a 31-hour dataset of unedited, single-camera multiparty conversations. Evaluations demonstrate that MuVAP outperforms strong baselines on Shift-Hold and next-speaker prediction tasks across two- and three-speaker settings.

📖 深度解读

[LLM 解读失败: HTTP 429]

#121
cs.SD

Segment-Level Mandarin Chinese Speech-Based Cognitive Impairment Detection via an Autoencoder with Contrastive Learning 解读失败跨领域

Yongqi Shao, Hong Huo, Flavio Bertini, Danilo Montesi, Tao Fang
Sound (cs.SD); Computation and Language (cs.CL)
Comments: This manuscript was uploaded prematurely. The authors have identified substantial revisions that are required in the methodology, experimental design, and interpretation of results. To avoid potential confusion and citation of an incomplete version, the authors have decided to withdraw this version and prepare a substantially revised manuscript
查看摘要
\noindent\textbf{Background and Objective:} Speech has emerged as a low-cost and non-invasive digital biomarker with considerable potential for cognitive impairment detection. However, limited labeled data and cross-dataset variability remain major challenges for robust speech-based screening systems. \par\noindent\textbf{Methods:} We developed a segment-level representation learning framework for speech-based cognitive impairment detection. Speech recordings were divided into short segments and converted into spectrogram representations. To improve robustness under limited-data conditions, offline and online augmentation strategies were combined with autoencoder-based representation learning and contrastive objectives to enhance discriminative latent representations. \par\noindent\textbf{Results:} Experiments conducted on four independent Mandarin Chinese speech datasets demonstrated stable and competitive performance in both binary and three-class classification tasks, with particularly notable improvements in the clinically challenging three-class setting. Ablation studies further supported the effectiveness of the proposed framework. \par\noindent\textbf{Conclusions:} The findings suggest that segment-level speech representation learning may provide a scalable and practical approach for cognitive impairment screening in resource-constrained clinical settings.

📖 深度解读

[LLM 解读失败: HTTP 429]

#122
cs.SD

Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy 解读失败跨领域

Geewook Kim, Minjoon Seo
Computer Vision and Pattern Recognition (cs.CV); Multimedia (cs.MM); Sound (cs.SD)
Comments: Accepted to Interspeech 2026
查看摘要
Speech and audio encoders developed over years of community effort are routinely excluded from video understanding pipelines, not because they fail, but because benchmarks never required listening. We audit 10 video benchmarks and find items largely solvable from visual cues alone: a single-frame probe answers about 76% of AVQA without audio, suggesting poor measurement of audio-visual reasoning. Building on LLaVA-OneVision, we attach a speech/audio encoder and compare five compressor architectures under 25-fold token reduction (25 Hz to 1 Hz). Across 10 benchmarks, with and without filtering, audio yields clear gains on tasks requiring speech comprehension or cross-modal grounding, while vision-centric suites remain largely unaffected. Our results show that speech encoders play a larger role in video understanding than current benchmarks suggest. We will open-source our work at this https URL .

📖 深度解读

[LLM 解读失败: HTTP 429]

#123
cs.SD

Cross-Attention is Half Explanation in Speech-to-Text Models 解读失败跨领域

Sara Papi, Dennis Fucci, Marco Gaido, Matteo Negri, Luisa Bentivogli
Computation and Language (cs.CL); Artificial Intelligence (cs.AI); Sound (cs.SD)
Comments: Accepted at INTERSPEECH 2026
查看摘要
Cross-attention is a core mechanism in encoder-decoder architectures, widespread in many fields, including speech-to-text (S2T) processing. Its scores have been repurposed for various downstream applications--such as timestamp estimation and audio-text alignment--under the assumption that they reflect the dependencies between input speech representation and the generated text. While the explanatory nature of attention mechanisms has been widely debated in the broader NLP literature, this assumption remains largely unexplored within the speech domain. To address this gap, we assess the explanatory power of cross-attention in S2T models by comparing its scores to input saliency maps derived from feature attribution. Our analysis spans monolingual and multilingual, single-task and multi-task models at multiple scales, and shows that attention scores moderately to strongly align with saliency-based explanations, particularly when aggregated across heads and layers. However, it also shows that cross-attention captures only about 50% of the input relevance and, in the best case, only partially reflects how the decoder attends to the encoder's representations--accounting for just 52-75% of the saliency. These findings uncover fundamental limitations in interpreting cross-attention as an explanatory proxy, suggesting that it offers an informative yet incomplete view of the factors driving predictions in S2T models.

📖 深度解读

[LLM 解读失败: HTTP 429]

#124
cs.SD

Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions 解读失败跨领域

Jinchuan Tian, Haoran Wang, Bo-Hao Su, Chien-yu Huang, Qingzheng Wang 等 (17 人)
Computation and Language (cs.CL); Sound (cs.SD)
查看摘要
Current audio foundation models typically rely on rigid, task-specific supervision, addressing isolated factors of audio rather than the whole. In contrast, human intelligence processes audio holistically, seamlessly bridging physical signals with abstract cognitive concepts to execute complex tasks. Grounded in this philosophy, we introduce Bagpiper, an 8B audio foundation model that interprets physical audio via rich captions, i.e., comprehensive natural language descriptions that encapsulate the critical cognitive concepts inherent in the signal (e.g., transcription, audio events). By pre-training on a massive corpus of 600B tokens, the model establishes a robust bidirectional mapping between raw audio and this high-level conceptual space. During fine-tuning, Bagpiper adopts a caption-then-process workflow, simulating an intermediate cognitive reasoning step to solve diverse tasks without task-specific priors. Experimentally, Bagpiper outperforms Qwen-2.5-Omni on MMAU and AIRBench for audio understanding and surpasses CosyVoice3 and TangoFlux in generation quality, capable of synthesizing arbitrary compositions of speech, music, and sound effects. To the best of our knowledge, Bagpiper is among the first works that achieve unified understanding generation for general audio. Model, data, and code are available at Bagpiper Home Page.

📖 深度解读

[LLM 解读失败: HTTP 429]

#125
cs.SD

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization 解读失败跨领域

Adhiraj Banerjee, Vipul Arora
Machine Learning (cs.LG); Computation and Language (cs.CL); Sound (cs.SD)
Comments: 29 pages main content, 50 total pages, 6 Figures, pre-print, Under Review
查看摘要
Modern learning systems represent perceptual signals with continuous vectors, but comparison, retrieval, memory, alignment, and reasoning are often naturally symbolic. In language, this interface is given by tokens; for speech and audio, it must be learned. Existing audio tokenizers use local quantization, clustering, or reconstruction, leaving sequence consistency, compactness, length control, termination, and edit geometry indirectly optimized. We introduce PairAlign, a framework for compact audio tokenization through sequence-level self-alignment. PairAlign treats tokenization as conditional sequence generation: an encoder maps speech to a condition, and an autoregressive decoder emits tokens from BOS to EOS, learning identity, order, length, and termination. Given two content-preserving views, each token string is trained to be likely under the other's representation, while unrelated examples provide competing sequences. This yields a surrogate for edit-distance preservation while discouraging collapse. Starting from a VQ tokenizer, PairAlign extends a frame-synchronous prior into an autoregressive tokenizer using VQ-derived and EMA-teacher targets, cross-paired teacher forcing, anti-bypass regularization, likelihood contrast, length control, and timing recovery. On 3 s speech, PairAlign learns compact token strings with strong cross-view consistency. In retrieval, it operates at 12.71 tokens/s and reduces archive tokens by 55% versus VQ while preserving edit-distance search. The results expose a compactness--locality trade-off: PairAlign does not aim to dominate dense geometric or SSL tokenizers on every local metric, but provides a lower-rate symbolic interface for comparison, retrieval, and analysis. More broadly, PairAlign is a sequence-symbolic analogue of JEPA-style predictive learning, predicting a learned variable-length symbolic sequence rather than a continuous latent.

📖 深度解读

[LLM 解读失败: HTTP 429]