arXiv 每日论文精读

📡 eess.AS / cs.SD
Audio and Speech Processing, Sound
2026年06月02日
LLM: glm-5.1
56
论文总数
40
跨领域
56
成功解读
0
待处理
#1
eess.AS
University of Washington (QS Top 100)

Privacy-preserving Prosody Representation Learning

Kevin Everson, Mari Ostendorf
Audio and Speech Processing (eess.AS)
Comments: Accepted to ACL 2026
查看摘要
Speech representations that capture prosodic information can be useful for both understanding and generation. However, speaker characteristics are reflected in acoustic-prosodic features (e.g., pitch). To address privacy concerns from the leakage of identity information, we propose a new self-supervised approach to learning prosody representations that incorporates speaker disentanglement strategies. We evaluate our encoder on three tasks to probe representation capabilities, including pitch reconstruction and detection of different prosodic events. Our encoder outperforms raw prosody and HuBERT-base baselines, achieving strong speaker disentanglement without adverse impact on prosody-related downstream tasks.

📖 深度解读

1. 一句话总结

本文提出了一种自监督的韵律编码器,通过输入声门波形、对音高特征进行说话人归一化以及引入对抗性损失,成功将韵律信息与说话人身份解耦,在保护语音隐私的同时提升了韵律建模能力。

2. 研究背景与动机

  • 核心问题:语音中的声学韵律特征(如音高)不可避免地携带着说话人的身份信息。如何在提取有用韵律特征的同时,剔除说话人信息以保护隐私?
  • 重要性:随着语音AI助手的普及,包含身份信息的韵律特征一旦泄露,极易被用于生成深度伪造语音,导致严重的身份盗用和隐私侵犯。
  • 现有方法不足:传统的声学特征提取(如F0、能量)对录音条件敏感且依赖不可靠的对齐算法;现有的自监督语音模型(如HuBERT)虽能捕捉部分韵律,但未刻意解耦说话人信息;而现有的韵律专用模型(如ProsodyBERT)则忽略了隐私保护的需求。

3. 核心方法

  • 提出框架:基于HuBERT架构改进的自监督韵律编码器。
  • 关键创新点
    1. 声门波形作为输入:用估计的声门源波形(经1kHz低通滤波)替代原始音频或原始韵律特征,既保留了嗓音质量信息,又减少了词汇内容的泄露,且比音高追踪更鲁棒。
    2. 说话人归一化的隐藏单元:在构建掩码预测的聚类目标时,对logF0特征减去该说话人的平均音高进行归一化,从源头上减少目标标签中的身份信息。
    3. 对抗性说话人损失:引入梯度反转层和说话人分类器,迫使编码器提取的特征无法识别说话人,实现深度的身份解耦。
  • 核心思路直觉解释:就像教一个学生(编码器)只关注一首歌的“旋律起伏”(韵律),而忽略“是谁在唱”(说话人)。首先,给学生听伴奏的纯音轨(声门波形)而不是原声;其次,在标准答案(隐藏单元)中抹去歌手的固有音色(音高归一化);最后,如果学生答题时还是暴露了歌手身份,就给予惩罚(对抗性损失),逼迫他只关注旋律本身的走向。

4. 实验与结果

  • 数据集/基准
  • 预训练:GigaSpeech (11K小时)。
  • 下游评估:LibriTTS (音高重建)、BU Radio Corpus (短语边界检测、重音检测)、VoxCeleb1 (说话人识别,评估隐私泄露)。
  • 基线方法:HuBERT-base、原始归一化韵律特征向量。
  • 主要实验结果
  • 韵律建模:在重音检测任务上,本文最优模型相比HuBERT-base的F1值相对提升了15%;在0均值音高重建任务上MSE最低(0.008),表明其对局部音高动态的建模能力最强。
  • 隐私保护(解耦效果):在VoxCeleb1说话人识别任务上,HuBERT-base的识别准确率为64%,而本文结合了两种解耦策略的模型将识别准确率大幅降至14%(相对降低66%),证明说话人信息被有效剥离。
  • 消融实验揭示:单独使用对抗损失会略微降低短语边界检测的性能,但结合音高归一化后,不仅性能完全恢复,还在0均值音高重建上取得最佳效果。这说明“目标归一化”与“特征对抗”两种解耦策略是互补的。

5. 优势与局限

  • 主要优势
    1. 实现了双赢:在大幅消除说话人身份信息的同时,没有牺牲(甚至提升了)韵律相关下游任务的性能。
    2. 鲁棒且实用的输入设计:采用声门波形和1kHz低通滤波,避免了对易错的音高追踪算法的过度依赖,并天然屏蔽了部分词汇信息。
  • 局限性
    1. 伪标签的局限:由于GigaSpeech缺乏真实说话人标签,训练时使用了聚类得到的伪说话人标签,这限制了对logF0归一化和对抗损失的精度(真实标签效果可能更好)。
    2. 评估场景不够全面:主要关注语言学层面的局部韵律事件,未在副语言学任务(如情感识别)和语音生成任务上验证;且下游任务依赖人工转录,未测试自动识别 transcripts 下的鲁棒性。
    3. 非因果模型:当前架构非因果,无法直接用于流式语音生成场景。

6. 关键结论与启发

  • 最重要的Takeaway:韵律特征中的说话人信息并非不可剥离。通过在“目标标签”和“特征空间”双重维度上实施解耦策略,可以做到“保留韵律、抹去身份”,为隐私保护的语音处理提供了可行路径。
  • 对后续研究的启发
    1. 数据集完善:未来可等待GigaSpeech发布真实的说话人元数据,以验证真实标签是否能进一步提升解耦效果。
    2. 拓展应用场景:将该方法扩展到语音合成(TTS)或语音转换任务中,通过主观听觉测试来评估生成语音中的身份泄露程度和韵律表现力。
    3. 向因果架构迁移:将当前的编码器改造为因果模型,以适应对延迟敏感的流式语音生成与理解系统。
#2
eess.AScs.SD
Tsinghua University (QS Top 100, 985, 211)

Local Diagnostics of Continuous Normalizing Flow for Out-of-Distribution Detection 跨领域

Xinwei Cao, Mengxuan Lu, Torbjørn Svendsen, Giampiero Salvi
Audio and Speech Processing (eess.AS); Computation and Language (cs.CL); Sound (cs.SD)
Comments: 16 pages, 5 figures
查看摘要
We address the problem of out-of-distribution (OOD) detection for target observations embedded in a subspace of the high dimensional data space. Using continuous normalizing flows (CNFs), we propose a Lagrangian sub-flow (LSF) framework designed to isolate and estimate the density for the relevant components in the representation and using the remaining components as context. Through experimentation with models for speech synthesis, we show that CNFs, similarly to other deep generative models (DGMs), are susceptible to the "likelihood paradox", where high likelihood is erroneously assigned to OOD samples. This is attributed to the inductive bias of DGMs that prioritize low-level structural details over high-level semantic coherence. To mitigate this phenomenon, we propose a number of geometric diagnostic signals based on the velocity field over the sub-flow trajectory. Based on these signals, we design metrics for the challenging task of zero-shot phoneme-level mispronunciation detection. Finally, we demonstrate the superiority of these metrics compared to likelihood-based methods on a real-world mispronunciation detection benchmark.

📖 深度解读

1. 一句话总结

本文提出了拉格朗日子流(LSF)框架,通过隔离连续归一化流(CNF)中的局部子空间并利用速度场的几何特征进行诊断,有效缓解了深度生成模型的“似然悖论”,并在零样本音素级发音错误检测任务中验证了其优越性。

2. 研究背景与动机

  • 核心问题:如何利用连续归一化流(CNF)在高维数据空间中对特定子空间进行有效的分布外(OOD)检测。
  • 重要性:在语音合成、图像生成等实际场景中,异常往往只出现在局部(如某个音素读错、图像局部幻觉),而全局信息(如说话人音色、图像背景)是正常的。因此,需要一种能在保留全局上下文的同时,精准定位局部异常的检测方法。
  • 现有方法不足
    1. 深度生成模型普遍存在“似然悖论”,容易给OOD样本赋予更高的似然值,因为模型倾向于拟合低-level的背景统计特征而非高-level的语义特征。
    2. 现有针对似然悖论的改进方法(如似然比、局部内在维度)大多将模型视为静态的概率估计器,忽略了生成模型在训练和推理过程中蕴含的丰富动态(速度场)信息。
    3. CNF在OOD检测中的潜力被严重忽视,且高维空间中全局平均化会掩盖局部的结构不一致性。

3. 核心方法

  • 提出框架:拉格朗日子流框架,一种事后诊断框架,用于在保留全局上下文感知的前提下,提取CNF中特定子空间的局部动态特征。
  • 关键创新点
    1. 运动学密封机制:通过将子空间外的速度分量置零,切断了子空间与互补空间之间的“跨维度密度泄漏”(即概率质量由于全局运动在子空间内外非法流动),恢复了子流的局部自治性(质量守恒)。
    2. 子流Hutchinson迹估计器:提出一种高效的随机估计方法,只需少量雅可比向量积(JVP)即可计算出子空间的雅可比迹,从而估计子空间的密度变化,避免了高维矩阵的精确求导。
    3. 基于几何轨迹的OOD度量:摒弃了容易失效的似然度量,利用CNF在最优传输(OT)路径下ID样本轨迹应近似直线的先验,提出了位移比(DISP)和余弦相似度(COS)等几何诊断信号。
  • 核心思路直觉解释:把CNF想象成一条复杂的河流,全局水流包含了各种旋涡和支流(全局上下文),而我们只关心其中一条特定支流(目标子空间,如某个音素)的状态。由于主河道和支流互相挤压,支流的水量变化不仅取决于自身,还受主河道影响(密度泄漏)。运动学密封就像在支流入口建了一道虚拟的刚性大坝,只允许支流内部的水流动,这样我们就能纯粹地观察支流自身的流动特征。同时,正常的水流应该沿着最直的路径流淌,如果某条水流的轨迹变得曲折(几何特征异常),就说明这里出现了“异常”(OOD)。

4. 实验与结果

  • 数据集/基准
  • 合成数据(3D空间中的2D圆环分布):用于直观展示密度泄漏及密封机制的效果。
  • 真实数据集:CMU Kids语料库,用于零样本音素级发音错误检测(MDD)。
  • 基线方法:GOP-Codec(基于TTS编解码器)、GOP-GMM(基于高斯混合模型)、GOP-CTC-SF(基于CTC的SOTA判别式方法)。
  • 主要实验结果
  • 在相对度量下,基于几何特征的GOP-COS(AUC=0.738)显著优于基于似然的GOP-LL(AUC=0.668),并超越了传统的GOP-GMM(AUC=0.723)。
  • 尽管不如SOTA判别式方法GOP-CTC-SF(AUC=0.915),但作为生成式零样本方法,其表现已具备很强竞争力。
  • 似然类方法在绝对度量下甚至出现AUC<0.5的逆向相关现象,证实了“似然悖论”的存在,而几何度量有效规避了这一问题。
  • 消融实验/分析揭示
  • 密封机制的有效性:合成数据可视化表明,无密封时OOD点的密度被严重高估,密封后密度分布变得平滑且准确。
  • 轨迹分析揭示:似然(Jacobian迹)无法区分正确发音和错误发音(错误发音反而似然更高),但余弦相似度能清晰展现正确发音更贴合直线OT路径,而错误发音轨迹发生偏移。

5. 优势与局限

  • 主要优势
    1. 细粒度与上下文兼顾:首次在CNF中实现了局部子空间诊断与全局上下文保留的解耦,适用于局部异常检测。
    2. 突破似然悖论:从流场的几何动态视角切入,提供了比静态概率密度更可靠的OOD信号。
    3. 计算高效:通过子流Hutchinson迹估计器,极大降低了高维雅可比矩阵迹的计算代价。
  • 局限性
    1. 应用场景单一:实验仅在语音发音检测这一特定任务上验证,未在计算机视觉、医学图像等其他声称适用的领域进行测试。
    2. 几何度量的启发式性质:DISP和COS是基于OT路径为直线的先验提出的启发式指标,缺乏更严格的理论下界保障。
    3. 计算复杂度仍存挑战:虽然迹估计被优化,但非似然方法仍需沿流路径进行多次函数评估,推理成本依然不低。

6. 关键结论与启发

  • 最重要的Takeaway:在基于CNF的生成模型中,轨迹的几何形变特征(如路径的平直度、方向一致性)比单纯的概率密度(似然值)更能反映数据的语义异常。全局的密度压缩往往被用于维持背景或帧间连贯性,掩盖了局部的语义错误。
  • 对后续研究的启发
    1. 跨领域迁移:将LSF框架推广至图像(检测局部幻觉)、医疗影像(病灶检测)等领域,验证其通用性。
    2. 动态轨迹的深度挖掘:论文附录中提到了时间方向一致性($\beta(t)$)和空间相干性($\alpha(t)$)等更丰富的动态信号,未来可基于这些时变信号设计更强大的OOD检测器,甚至实现异常的精确定位。
    3. 生成模型诊断学:启发研究界不再仅仅把生成模型当作“采样器”或“密度估计器”,而是将其内部的动态演化过程(速度场、雅可比场)作为丰富的诊断信号源。
#3
eess.AScs.SD
Universite PSL (QS Top 100)

Context-aware child-directed speech detection from long-form recordings 跨领域

Théo Charlot, Tarek Kunze, Kaveri K. Sheth, Alejandrina Cristia, Marvin Lavechin
Audio and Speech Processing (eess.AS); Machine Learning (cs.LG); Sound (cs.SD)
Comments: 6 pages, 1 figure
查看摘要
Automatically distinguishing child-directed speech from adult-directed speech in long-form recordings is key to scalable analyses of children's language environments. Existing approaches process utterances in isolation and have been evaluated primarily on English. We address these gaps along three dimensions. First, we fine-tune and evaluate six-self supervised models on a multilingual dataset of 182 children, showing that in-domain pre-training on child-centered recordings substantially outperforms models trained on adult speech. Second, we demonstrate that incorporating surrounding context substantially improves classification, with an absolute gain of 13.8% in average F1-score. Third, we evaluate our model in a realistic end-to-end pipeline, from adult speech detection to addressee classification, showing that performance drops under automatic segmentation but still consistently outperforms a rule-based baseline.

📖 深度解读

1. 一句话总结

本文提出了一种结合上下文音频和领域专用预训练模型的方法,从儿童全天的长录音中自动识别出“对儿童说的话”,解决了现有方法孤立处理语音且依赖人工标注的局限。

2. 研究背景与动机

  • 核心问题:如何从儿童佩戴的录音设备产生的长音频中,自动且准确地分辨出成人是对儿童说话(CDS)还是对其他成人说话(ADS)。
  • 重要性:儿童指向性语言(CDS)对儿童的语言发展至关重要,但目前的分析极度依赖耗时费力的人工标注,限制了大规模跨文化研究的开展。
  • 现有方法不足
    1. 语言局限:主要在英语数据上训练,难以泛化到其他语言和文化(不同文化的CDS声学特征差异很大)。
    2. 缺乏上下文:现有模型将每句话孤立处理,忽略了人类判断说话对象时依赖的上下文线索(如前后是否有儿童发声)。
    3. 脱离实际:现有系统都在人工精准切分的音频上测试,没有在包含语音分割错误的真实自动流水线中验证过实用性。

3. 核心方法

  • 提出框架:基于自监督学习模型的上下文感知微调框架。
  • 关键创新点
    1. 领域匹配预训练:首次系统对比了通用成人语音预训练模型与“儿童中心录音”预训练模型,证明领域内预训练至关重要。
    2. 上下文感知微调:打破孤立切分句子的传统,将目标话语前后各扩展一定时长的上下文音频共同输入模型,但只在目标话语的特征上进行分类预测。
    3. 端到端真实场景评估:首次将说话人分离和对象分类串联成全自动流水线,并在跨语种的保留数据集上测试真实场景下的性能。
  • 核心思路直觉解释:判断一句话是不是对孩子说的,就像看侦探剧不能只看一个片段。如果只听一句话(孤立处理),可能很难判断;但如果听到这句话前后有孩子的咿呀声,或者大人在用夸张的语调连续说话(上下文),判断就容易多了。本文的方法就是让模型在判断当前句子时,也能“听听”前后10秒发生了什么,从而获得更准确的判断依据。

4. 实验与结果

  • 数据集:收集了涵盖6种语言、182名儿童的22小时多语种语料库。其中Tseltal(玛雅语系)和Winnipeg(英语)作为完全未见过的保留集,用于测试跨语料库泛化能力。
  • 基线方法:实验室内部开发的基于规则的方法(如果成人语音出现在目标儿童发声的固定时间阈值内,则判定为CDS)。
  • 主要实验结果
  • 预训练模型对比:在儿童录音上预训练的BabyHuBERT表现最佳,平均F1得分达到53.2%,优于所有在成人干净语音上训练的模型(如W2V2, HuBERT等)。
  • 上下文的威力:加入10秒的上下文窗口后,平均F1得分从53.2%飙升至67.0%,绝对提升高达13.8%。但超过10秒后性能下降,可能因为冗余信息稀释了关键信号。
  • 真实流水线测试:在使用自动语音分割(VTC 2.0)的完全自动流水线中,模型性能出现显著下降(F1从74.1%降至38.6%),但仍大幅优于基于规则的基线方法(25.6%)。
  • 消融实验揭示
  • 多语种预训练的BabyHuBERT优于单语种(W2V2-LL4300),说明多语种儿童环境数据预训练更具优势。
  • 上下文信息对分类有决定性帮助,证实了“孤立处理话语”的传统做法严重限制了模型潜力。

5. 优势与局限

  • 主要优势
    1. 性能提升显著:引入上下文机制带来了两位数的F1值提升,是该方法最核心的亮点。
    2. 多语言与跨文化泛化:在多语种数据上训练和测试,且开源了代码和模型,填补了该领域缺乏开源工具的空白。
    3. 贴近真实应用:进行了端到端自动流水线测试,揭示了真实场景下的性能边界,对实际部署极具参考价值。
  • 局限性
    1. 计算成本高昂:将30秒的上下文输入Transformer导致训练时间从22分钟暴增至2.5小时,推理成本也随之上升。
    2. 误差级联严重:在全自动流水线中,前端语音分割(VTC 2.0)的错误会严重传播并放大,导致最终分类性能大幅缩水(F1下降约35%)。
    3. 长尾类别识别差:对于“其他”类别,由于包含了指向宠物、其他儿童等声学特征各异且与CDS相似的语音,模型识别率极低(F1仅20%左右)。

6. 关键结论与启发

  • 最重要的Takeaway:在对话/交互语音分类任务中,上下文是王道。哪怕只是简单地拼接前后10秒的音频,也能带来巨大的性能飞跃;同时,在特定声学环境(如儿童录音)下,领域内预训练比单纯增加通用成人语音的数据量更有效。
  • 对后续研究的启发/延伸方向
    1. 架构优化:可以探索更高效的上下文融合架构(如分层架构或交叉注意力机制),让目标话语主动去上下文中“检索”有用信息,而不是把整段音频暴力喂给Transformer,以大幅降低计算成本。
    2. 非对称上下文探索:前后文对判断的贡献可能不同(例如前文有儿童发声可能比后文更具提示性),未来可设计非对称的上下文窗口。
    3. 系统级联优化:针对端到端流水线中严重的误差级联问题,未来需要联合优化语音分割和对象分类模块,或者提升前端分割器在嘈杂环境下的鲁棒性。
    4. 宏观有效性验证:在将此系统用于大规模儿童语言发展研究前,必须验证“模型自动统计的CDS时长”与“人工统计的CDS时长”在录音级别是否具有高度相关性,且这种相关性在不同社会文化背景下是否一致。
#4
eess.AScs.SD

Description and Discussion on DCASE 2026 Challenge Task 2: Noise-aware Unsupervised Anomalous Sound Detection for Machine Condition Monitoring 跨领域

Tomoya Nishida, Noboru Harada, Daiki Takeuchi, Daisuke Niizumi, Keisuke Imoto 等 (9 人)
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: this article draws heavily from arXiv:2506.10097
查看摘要
This paper presents an overview of DCASE 2026 Challenge Task 2, titled "Noise-aware unsupervised anomalous sound detection (UASD) for machine condition monitoring." The task aims to advance noise-robust anomalous sound detection for machine condition monitoring under the unsupervised setting, where only normal machine sounds are available for training. Reliable detection under noisy conditions is crucial for practical deployment, but previous DCASE Task 2 settings provided limited information about environmental noise, potentially limiting UASD performance in highly noisy situations. To address this limitation, DCASE 2026 allows participants to exploit two-channel audio samples simultaneously captured at locations near and far from the target machine. Since the distant microphone is expected to contain relatively stronger environmental noise and weaker direct machine sounds, it may help distinguish environmental noise components from the target machine sounds. After the challenge submission deadline, challenge results and an analysis of the submitted systems will be added.

📖 深度解读

1. 一句话总结

本文介绍了DCASE 2026挑战赛任务2,通过提供目标机器近端和远端的双通道音频,让模型利用远端麦克风作为环境噪声参考,从而在无监督条件下解决高噪声环境中的机器异常声检测问题。

2. 研究背景与动机

  • 核心问题:如何在无监督(仅使用正常声音训练)且存在高噪声干扰的实际工业场景中,可靠地检测机器的异常声音。
  • 重要性:异常声检测(ASD)是实现工厂自动化和预测性维护的关键技术。然而,真实工厂环境通常充满各种噪声,这些噪声极易掩盖或混淆机器本身的异常音,导致现有系统频繁误报或漏报。
  • 现有方法不足:此前的DCASE挑战赛虽然也包含噪声场景,但提供的信息有限(仅单通道音频),模型难以区分声音到底是环境噪声还是机器异常。虽然DCASE 2025尝试提供“纯机器音”或“纯噪声”作为辅助数据,但在现实中,让机器停机录纯噪声、或隔离环境录纯机器音往往是不切实际的。

3. 核心方法

  • 提出框架:DCASE 2026 Task 2 “噪声感知的无监督异常声检测(Noise-aware UASD)”任务框架及数据集设计。
  • 关键创新点
    1. 双通道噪声感知机制:提供近端(靠近机器)和远端(远离机器)同步录制的双通道音频。远端麦克风天然包含较弱的机器直达声和较强的环境噪声,相当于一个“天然噪声参考麦克风”。
    2. 更现实的噪声获取方式:与2025年要求“停机录噪声”不同,2026年的设定只需安装两个麦克风即可同步获取混合信号与噪声参考,极大降低了实际部署的工程难度。
    3. 延续并融合真实工业痛点:保留了以往挑战的两大难点——域偏移(Domain shift,训练与测试环境/工况不同)和首发问题(First-shot,面对全新机器类型无法调参)。
  • 核心思路直觉解释:就像你在嘈杂的街头想听清前面人说话(近端麦克风),你很难分辨哪些是对方的声音哪些是街边噪音。但如果此时你让站在远处的同伴(远端麦克风)也录一段音,由于同伴离你较远、离噪声源较近,他录到的几乎全是环境噪音。通过对比这两段录音,你就能很容易地“减去”环境噪音,专注听清前面人的话是否异常。

4. 实验与结果

  • 使用数据集
  • 开发集:7种机器类型(风扇、变速箱、轴承等),包含源域(990个正常样本)和目标域(10个正常样本)的训练数据,以及测试数据。
  • 额外训练集/评估集:5种全新机器类型(无人机、牙刷、缝纫机等),用于测试“首发问题”下的零样本泛化能力。
  • 数据特征:所有音频均为双通道(近/远)、16kHz采样率、时长6-16秒。部分数据为真实录制,部分为通过脉冲响应(IR)仿真合成。
  • 对比基线方法:沿用2023年的自编码器(AE)基线,包含两种打分模式:简单均方误差模式(MSE)和选择式马氏距离模式(MAHALA)。注意:基线仅使用了第一通道(近端)音频,未利用远端噪声参考信息。
  • 主要实验结果
  • 基线在开发集上的表现:源域AUC普遍在60%-77%之间,但目标域AUC下降严重(如ToyCar降至37.87%),pAUC大多在50%-60%左右徘徊。
  • 结果表明,在仅使用单通道且不进行噪声对冲的情况下,面对域偏移和噪声干扰,现有基线的检测能力依然十分薄弱,证明了利用第二通道提升噪声鲁棒性的必要性和巨大空间。
  • 消融实验:由于是挑战赛任务说明文,目前尚未提供参赛者的消融实验结果,官方表示将在挑战赛截止后补充相关分析。

5. 优势与局限

  • 主要优势
    1. 高度贴合实际:双麦克风方案是工业现场极易实现且低成本的部署方式,克服了“需单独录制纯噪声”的乌托邦设定。
    2. 任务设计全面:将噪声鲁棒性、域偏移和首发问题三大工业界最关心的痛点结合在同一个任务中,极具挑战性和指导价值。
  • 局限性
    1. 基线未充分利用新特性:官方提供的AE基线丢弃了远端通道信息,无法为参赛者提供如何融合双通道信息的直接参考。
    2. 数据仿真痕迹:部分数据是通过实验室录制机器声再叠加回放噪声合成的,与真实工厂中机器与噪声发生声学耦合的复杂情况可能存在差异。
    3. 结果缺失:作为挑战赛前期说明,目前缺乏实际算法在该数据集上的验证结果,其实际难度上限和解决思路尚不明确。

6. 关键结论与启发

  • 最重要的Takeaway:在无法获取纯净机器声或纯净环境声的现实约束下,利用空间分布差异(近/远端双麦克风)提取噪声参考信号,是突破无监督异常声检测噪声瓶颈的关键途径。
  • 对后续研究的启发
    1. 多通道信号处理与深度学习的结合:未来的研究可探索如何将传统阵列信号处理(如盲源分离、噪声掩蔽)与深度异常检测模型结合,有效利用远端通道进行“降噪”或“特征解耦”。
    2. 域泛化的新方向:在双通道设定下,如何让模型不仅对物理噪声鲁棒,还能在源域/目标域属性未知的情况下,利用远端通道的辅助信息实现更好的域泛化,将是一个重要研究方向。
#5
eess.AS
National Taiwan University (NTU) (QS Top 100)

RRP-Voice: A Longitudinal Dataset and Benchmark for Recurrent Respiratory Papillomatosis Detection

Wenze Ren, Ke-Han Lu, Kai-Wei Chang, Tiantian Feng, Ching Fang 等 (11 人)
Audio and Speech Processing (eess.AS)
Comments: Submitted to APSIPA ASC 2026 Special Tracks
查看摘要
Deep learning has advanced pathological voice detection rapidly, yet rare laryngeal diseases remain underexplored due to data scarcity. Recurrent Respiratory Papillomatosis (RRP) exemplifies this gap: an HPV-induced disease of the larynx in which patients oscillate between recurrence and post-surgical remission over the years. RRP demands continuous voice monitoring that existing cross-sectional corpora cannot support. We introduce the first longitudinal voice dataset for RRP, comprising recordings from 26 patients with up to ten years of follow-up. Each session pairs sustained vowels with sentence-level utterances, which are annotated by otolaryngologists and confirmed synchronously with laryngoscopy. Building on this resource, we establish a systematic benchmark spanning handcrafted features, end-to-end deep networks, self-supervised pretrained models, and recent audio large language models, all evaluated under session-level cross-validation with patient-level audit. Per-subject longitudinal analyses further confirm that the cross-sectional discriminative signal reflects laryngoscopic disease state rather than stable speaker attributes. This work lays a foundation for rare longitudinal pathological voice tasks in low-resource clinical settings.

📖 深度解读

1. 一句话总结

本文构建了首个针对复发性呼吸道乳头状瘤(RRP)的纵向语音数据集,并系统评估了从传统特征到音频大模型等多种方法,证实了自监督语音模型在罕见病语音检测中最具优势,且模型确实是在识别疾病状态而非说话人身份。

2. 研究背景与动机

  • 核心问题:如何利用语音信号有效检测复发性呼吸道乳头状瘤(RRP),并验证语音特征是否真正反映了疾病的动态变化。
  • 重要性:RRP是一种由HPV引起的喉部罕见病,患者会在“术后缓解”和“复发”之间反复交替,极其需要长期的非侵入式远程监测。语音作为一种低成本、易获取的生物标志物,非常适合这一场景。
  • 现有不足
    1. 罕见病数据匮乏:现有公开语音数据集多集中于常见病,罕见喉部疾病严重缺乏专门的数据集和基准。
    2. 缺乏纵向视角:现有数据集几乎都是横截面的(单时间点采集),将病理语音视为静态特征,无法捕捉患者随疾病复发/缓解的个体内动态变化。
    3. 身份混淆风险:在横截面数据上表现好的模型,可能只是记住了“某个声音像病人”,而不是真正识别出了“疾病状态”,这在传统数据集上无法被审计。

3. 核心方法

  • 提出的框架:RRP-Voice,包含一个纵向语音数据集及一套系统的基线测试基准。
  • 关键创新点
    1. 首个RRP纵向语音语料库:包含26名患者长达10年的随访录音(151次就诊),且每次录音都有喉镜检查同步确认的金标准标签。
    2. 四代方法的系统基准:全面对比了手工特征、端到端CNN、自监督预训练模型和音频大语言模型。
    3. 个体内纵向验证机制:利用同一患者多次就诊的“复发-缓解”配对数据,计算个体内AUC,排除了说话人身份的干扰。
  • 核心思路直觉解释
  • 就像给患者建了一份“声音日记”,不仅看某一天的声音是否生病,更看同一个患者在几年内声音随病情起伏的波动。
  • 在验证时,不再比较“张三的病态声”和“李四的健康声”,而是只比较“张三复发时的声”和“张三缓解时的声”,如果模型能分清,说明它真的听懂了“病”,而不是记住了“人”。

4. 实验与结果

  • 数据集:RRP-Voice(26名患者,151次就诊录音,包含持续元音和连贯语句)。
  • 基线方法:eGeMAPS+LightGBM、Log-Mel CNN、冻结的wav2vec 2.0+MLP、零样本音频大模型。
  • 主要实验结果
  • 自监督模型碾压全场:wav2vec 2.0融合模型取得最佳UAR(0.787)和AUC-ROC(0.866),比传统特征高4.8个UAR点,比端到端CNN高13.1个点。这表明在数据极度稀缺的罕见病场景,自监督预训练应成为默认选项。
  • 多模态融合有效:结合“持续元音”(反映声带稳定振动)和“连贯语句”(反映语调断裂和紧张)能显著提升强表征模型的性能(wav2vec 2.0提升6.1个UAR点),但弱表征模型无法从中受益。
  • 音频大模型表现拉胯:Gemini模型不仅UAR最低(最佳仅0.652),还在元音任务上出现了“全预测为异常”的退化崩溃现象,说明当前音频大模型对短促、无语义的声学刺激泛化能力极差。
  • 消融/纵向验证揭示:在24名有状态交替的患者中,88%的个体内AUC高于随机水平,中位数达到1.000。这直接证明了模型学到的是疾病状态特征,而非说话人身份特征;同时,也发现了约12%的患者声音与喉镜状态脱钩,提示未来需个性化监测。

5. 优势与局限

  • 主要优势
    1. 填补了罕见病纵向语音数据的空白,极具临床价值。
    2. 提出了个体内纵向验证方法,从根本上回应了“模型是否学到疾病本身”的学术质疑。
    3. 基准测试全面,为低资源病理语音研究提供了清晰的实践指引(如:首选自监督模型+多任务录音)。
  • 局限性
    1. 样本量仍然较小(仅26名患者,151条录音),难以支撑复杂的时序预测模型(如RNN/Transformer)训练。
    2. 受限于队列规模,无法进行严格的留一患者法交叉验证,存在一定的数据泄露风险(尽管通过纵向分析进行了弥补)。
    3. 就诊间隔极不规律(过度离散),且部分患者只有单一状态的记录,限制了纵向动态建模的深度。

6. 关键结论与启发

  • 最重要的Takeaway:在罕见病理语音检测中,自监督预训练表征是克服数据稀缺的最可靠利器;而当前火热的音频大模型在缺乏微调的情况下,尚无法胜任此类细粒度、无语义的声学诊断任务。更重要的是,纵向数据验证了“声音确实能追踪疾病状态本身”。
  • 对后续研究的启发
    1. 时序建模:未来可探索在更密集采样的纵向数据上,进行序列级别的疾病状态预测(如预测何时复发)。
    2. 大模型适配:针对音频大模型在短促无语义音频上的崩溃问题,可探索专门的指令微调或上下文学习策略。
    3. 个性化监测:针对那12%声音与喉镜状态脱钩的“异类”患者,需要开发具有患者感知或时间感知的个性化监测算法。
#6
eess.AS

Kinship Verification Using Voice

Jagabandhu Mishra, Tomi H. Kinnunen
Audio and Speech Processing (eess.AS)
Comments: Submited to IEEE TASLP
查看摘要
Kinship verification (KV) from voice, the task of determining whether two speakers are biologically related, has received only little attention. Our work establishes a foundational basis for this emerging frontier, contributing to both performance evaluation and detection methodologies. First, leveraging the speech recordings of the large-scale audio-visual dataset, KAN-AV, we propose a revised evaluation protocol that controls for various confounders and adopts a family-disjoint train--test split to address open-set KV. Second, we analyze the close connection between speaker verification and KV, showing that genealogical similarity of speaker pairs plays opposite roles in the two tasks. Third, we tackle KV using three neural speaker embedding extractors (ECAPA-TDNN, WavLM-ECAPA, and ReDimNet) combined with various back-ends. In zero-shot KV including same-speaker target trials, ReDimNet achieves the lowest equal error rate (EER) of $20.8\%$; however, performance degrades to $39.7\%$ under strict kin trials, where same-speaker target trials are excluded. Our best trainable back-end, which applies asymmetric processing of the embedding pair to mitigate age-difference effects, obtains an EER of $32.0\%$ ($18.6\%$ with speaker target trials included). These results highlight the difficulty of KV while showing that speaker embeddings encode familial cues, offering a promising foundation for voice-based kinship analysis.

📖 深度解读

1. 一句话总结

本文针对语音血缘验证任务,构建了去混杂的开放集评估基准,揭示了说话人验证与血缘验证的对立关系,并提出了一种非对称仿射投影后端以缓解年龄差异影响,验证了现代说话人嵌入中确实编码了家族语音线索。

2. 研究背景与动机

  • 核心问题:如何仅通过语音来判断两个人是否存在生物学亲属关系(语音血缘验证,KV)。
  • 重要性:传统的DNA验证虽然准确但具侵入性、成本高且耗时;在数字取证等场景中,往往只有语音等数字证据可用。语音同时受生理(声带、声道等遗传特征)和行为(口音、语言习惯等环境特征)影响,是极具潜力的非侵入式亲属验证模态。
  • 现有方法不足
    1. 评估协议有缺陷:以往研究多采用“闭集”协议(训练集和测试集包含相同的家族),模型容易“死记硬背”家族特征而非学习泛化的亲属线索;且未控制年龄、性别、录音质量等混杂因素,导致模型可能走了捷径。
    2. 缺乏与说话人验证(SV)的统一视角:未系统厘清SV和KV的边界与内在联系。
    3. 年龄与性别差异处理不足:亲属间(尤其是跨代)存在显著的年龄和性别差异,现有方法未能有效解耦这些因素对语音相似度的干扰。

3. 核心方法

  • 提出框架:基于现代神经说话人嵌入的语音血缘验证框架,包含零样本探测和可训练后端两种范式。
  • 关键创新点
    1. 去混杂的开放集评估协议:采用家族不相交的数据划分,并通过对目标/非目标试验进行性别和年龄差的非参数标准化匹配,消除数据集自带的捷径偏差。
    2. SV与KV的统一视角及“严格亲属”定义:指出SV是KV的特例(正类从“同一个人”扩展到“同一个家族”)。提出“严格亲属”试验(同家族不同说话人),指出家族相似性在SV中是干扰(导致误识),在KV中则是线索。
    3. 非对称仿射投影后端:针对亲属对间的年龄/性别不匹配问题,提出在孪生网络中仅对一方的嵌入进行仿射变换,另一方保持不变。
  • 核心思路直觉解释:如果把提取语音特征比作“量身材”,传统的对称方法相当于把父子俩的身材数据同时压缩或拉伸来找共同点;而非对称方法则承认“父亲比儿子老”,所以只对父亲的数据进行“年轻化投影”(或对儿子的数据进行“年长化投影”),将其映射到与对方相近的年龄子空间中,再进行相似度计算,从而剥离年龄带来的表面差异,凸显真正的遗传相似性。

4. 实验与结果

  • 数据集/基准:对大规模音视频数据集 KAN-AV 进行了严格清洗(去重、去噪、去VoxCeleb重叠说话人),构建了仅含英语高质量语音的子集,并制定了新的评估协议。
  • 基线方法:ECAPA-TDNN, WavLM-ECAPA, ReDimNet(零样本及结合FCN全连接后端、对称仿射投影S-AP后端)。
  • 主要实验结果
  • SV与KV的对立:在SV任务中,亲属作为非目标测试对时,EER显著上升(如ReDimNet从5.26%升至9.83%),证明嵌入包含了家族线索。
  • KV任务极具挑战:在零样本下,包含同一个人的KV任务EER为20.8%(ReDimNet),但剔除同一说话人后的“严格亲属”验证(KV*)EER骤降至39.7%。
  • 非对称后端有效性:本文最佳的AS-AP后端(结合性别约束训练和偏置项)将KV*的EER从零样本的39.7%降至32.0%,KV的EER降至18.6%。
  • 消融实验揭示
  • 年龄排序优于性别排序:在非对称投影中,强制将年长者的嵌入向年幼者空间投影(基于年龄排序)效果最好,说明年龄差异是比性别更核心的干扰因素。
  • 年龄差越大越难:当限制目标和非目标对的年龄差≤2年时,KV*的EER可降至27.9%,证实年龄差是KV性能下降的主因。
  • 同代同性最容易:姐妹对(SS)和兄弟对(BB)的验证效果远好于跨代(如父子)和跨性别对。

5. 优势与局限

  • 主要优势
    1. 评估范式规范化:首次为语音KV领域引入了控制混杂因素的开放集评估标准,避免了性能虚高。
    2. 理论视角清晰:统一了SV和KV的数学定义,明确了“严格亲属”这一核心难点。
    3. 轻量且有效:提出的非对称仿射投影参数量极小,通过正则化保留了原始说话人空间的几何结构,有效缓解了小样本下的过拟合和年龄干扰。
  • 局限性
    1. 绝对性能依然较差:严格亲属验证(KV)的EER仍在32%左右,距离实际应用(如司法取证)的可靠性要求仍有巨大鸿沟。
    2.
    年龄解耦不彻底:非对称投影仅“缓解”而非“消除”了年龄差异的影响,当年龄差超过40岁时性能趋于停滞。
    3.
    数据依赖与简化*:方法在推理时需要明确的年龄/性别元数据来决定投影方向,在未知元数据的真实场景中受限;且研究仅使用英语数据,未验证跨语言的泛化性。

6. 关键结论与启发

  • 最重要的Takeaway:现代说话人嵌入确实编码了可测量的家族语音线索,但亲属间的年龄和性别差异与亲属关系结构深度纠缠,单纯依赖为SV设计的嵌入直接做KV效果极差;血缘验证不能简单视作说话人验证的延伸,而必须专门处理跨代/跨性别的特征偏移。
  • 对后续研究的启发
    1. 数据构建:亟需收集高质量、发音平衡、多年龄段覆盖的家族语音语料库,且需严格控制录音环境。
    2. 解耦表示学习:未来模型应从底层特征中显式解耦“身份/遗传特征”、“年龄特征”和“性别特征”,而非仅在后端做线性补偿。
    3. 生成式方法探索:可探索基于语音转换(Voice Conversion)的思路,将跨代亲属的语音进行年龄归一化后再提取特征,可能比判别式后端更有效。
#7
eess.AScs.SD
City University of Hong Kong (QS Top 100)Huawei (World Famous IT Company)

SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing 跨领域

Hanlin Zhang, Daxin Tan, Dehua Tao, Xiao Chen, Haochen Tan 等 (6 人)
Audio and Speech Processing (eess.AS); Sound (cs.SD)
查看摘要
Instruction-guided speech editing requires a model to modify specified speech attributes while preserving unrelated characteristics. Despite rapid progress in Speech Large Language Models (Speech LLMs), systematic evaluation of this capability remains challenging, as existing benchmarks are fragmented across isolated editing tasks. To bridge this gap, we introduce \textbf{SpeechEditBench}, a bilingual multi-attribute benchmark for instruction-guided speech editing. SpeechEditBench encompasses seven atomic editing tasks, as well as compositional editing tasks that integrate multiple operations within a single instruction. We propose an anchor-based evaluation protocol that separately assesses the edit success of target attributes and the preservation of untargeted attributes, leading to three metrics: target success, preservation success, and joint success. Using this benchmark, we evaluate mainstream Speech LLMs and specialized speech editing systems. The results reveal three key findings: (1) no single model performs well across all editing dimensions; (2) closed-source Speech LLMs generally outperform open-source models; (3) compositional editing remains highly challenging, with even the most advanced models struggling to achieve high joint success. SpeechEditBench provides a rigorous diagnostic framework to identify bottlenecks in Speech LLMs, thereby facilitating the development of next-generation Speech LLMs with more robust and precise instruction-guided editing capabilities. Data and code will be released upon acceptance.

📖 深度解读

1. 一句话总结

本文提出了SpeechEditBench,首个中英双语多属性语音编辑基准,通过基于锚点的评估协议分别衡量“目标修改成功”与“无关内容保留”,系统性地揭示了当前语音大模型在指令驱动编辑中存在的“改得掉但留不住”以及组合编辑能力极差等核心缺陷。

2. 研究背景与动机

  • 核心问题:如何系统、统一地评估语音大模型遵循自然语言指令进行语音编辑的能力。
  • 重要性:语音编辑要求模型在“精准修改目标属性”和“完美保留无关特征”之间取得平衡,这是语音智能体走向实用化的关键能力;同时,它也能作为诊断工具,测试模型是否能将分散的编辑能力统合在一个架构中。
  • 现有方法不足
    1. 基准碎片化:现有评估散落在孤立的子任务中,缺乏统一的任务定义和评测标准。
    2. 评估指标缺陷:传统指标依赖死板的波形匹配,无法容纳语音编辑“一对多”的合法情况(即同一个编辑指令可以有多种正确的音频输出)。
    3. 单维度考量:现有评估往往只看“有没有改成功”,忽略了“没让改的地方有没有保留原样”,导致模型能力被严重高估。

3. 核心方法

  • 提出框架:SpeechEditBench,一个包含4700个样本的中英双语语音编辑评测基准与协议。
  • 关键创新点
    1. 多层级任务体系:定义了7种原子编辑任务(内容、说话人、情感、风格、韵律、副语言、声学),并首创了组合编辑任务(在一条指令中同时要求修改2-3种属性)。
    2. 基于锚点的评估协议:摒弃波形匹配,为每个样本设定“目标锚点”(验证是否改对)和“保留锚点”(验证是否保留原样),支持灵活但严谨的验证。
    3. 双约束指标体系:提出三个核心指标——目标成功(TS,改得对不对)、保留成功(PS,留得准不准)和联合成功(JS,两者是否同时满足),精准拆解模型的能力瓶颈。
  • 核心思路直觉解释:就像评价一个理发师,不能只看他能不能按你的要求剪短头发(目标成功),还要看他有没有不小心把客人的眉毛剃了(保留成功)。SpeechEditBench就是给语音模型出的“理发师资格考试”,既考“手艺”,也考“不误伤”。

4. 实验与结果

  • 数据集/基准:SpeechEditBench(4700个源语音-指令对,涵盖中英双语,包含7个原子任务及组合任务)。
  • 对比基线:8个主流Speech LLMs(含GPT-Realtime、Gemini-Live等闭源模型,Qwen3-Omni等开源模型)及多个专用编辑系统(如VoiceCraft-X, DeepFilterNet等)。
  • 主要实验结果
    1. 闭源优于开源:闭源模型在多数任务上领先,如GPT-Realtime在内容编辑联合成功率达96.67%,Gemini-Live在韵律编辑达65.17%。
    2. “改得掉”但“留不住”:开源模型普遍存在严重的保留缺陷。例如Step-Audio-EditX在韵律编辑的目标成功率有51.51%,但联合成功率仅剩20.13%,说明改了韵律却破坏了文本内容。
    3. 组合编辑是灾难:即使是表现最好的闭源模型,在三重组合编辑任务上的联合成功率也几乎为0%;在双重组合编辑中,Gemini-Live和GPT-Realtime的联合成功率也仅有21.50%和20.00%。
  • 消融实验揭示
    1. 语言偏见:双语评测发现,在非内容编辑任务中,模型保留英文内容的能力通常优于中文。
    2. 语义-声学冲突:在情感编辑的挑战集(文本语义与目标情感冲突,如文本是“我很生气”但要求读出开心)中,模型的目标成功率显著下降,说明模型极易被文本语义带偏。

5. 优势与局限

  • 主要优势
    1. 评测维度的完整性:首次将“修改成功”与“内容保留”解耦并联合评估,戳破了以往只看目标成功率带来的能力泡沫。
    2. 任务的丰富性与前瞻性:引入组合编辑任务,直击大模型多约束指令遵循的痛点,为未来研究指明方向。
    3. 评测协议的合理性:基于锚点的评估避免了“必须和某条特定音频波形一模一样”的苛刻要求,更符合语音生成的多样性本质。
  • 局限性
    1. 语言覆盖有限:目前仅支持中英双语,未涵盖低资源语言及更广泛语系。
    2. 指标依赖自动模型:评估高度依赖ASR、Gemini裁判等自动模型,无法完全替代人类对自然度、细微韵律的主观听感。
    3. 交互范式单一:仅关注单轮指令编辑,未涉及多轮迭代修正(即“再稍微开心一点”这种自然对话场景)。

6. 关键结论与启发

  • 最重要的Takeaway:当前语音大模型在编辑任务上的核心瓶颈是“保留无关属性”,而非“执行目标修改”。模型往往在改变目标属性的同时,对原始语音造成了不可控的破坏(即“牵一发而动全身”),且同时满足多重编辑约束的能力极其薄弱。
  • 对后续研究的启发
    1. 架构设计:未来的语音大模型需要设计更精细的解耦机制,在特征空间或注意力层面隔离“目标属性”与“无关属性”,避免编辑时的全局污染。
    2. 训练范式:应当将“保留损失”作为核心优化目标引入模型训练,而不仅仅是追求编辑指令的执行率。
    3. 评测延伸:可基于此基准的思路,向多轮对话编辑、跨语言编辑(如用中文指令编辑英文语音)、细粒度声音风格插值等方向拓展评测边界。
#8
eess.AScs.SD

Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning 跨领域

Ding Ma, Jinyi Mi, Fengji Li, Lester Phillip Violeta, Jiajun He 等 (8 人)
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: 15 pages, 7 figures. Accepted to IEEE TBME
查看摘要
Objective: laryngectomees depend on an electromechanical device to generate electrolaryngeal (EL) speech. Compared with normal speech, EL speech suffers from severe distortion, limited phonetic variation, unnatural prosody, and temporal shifts, degrading naturalness and intelligibility. Although sequence-to-sequence (seq2seq) voice conversion (VC) based EL-speech-to-normal-speech conversion (EL2SP) is promising, substantial mismatches between EL and normal speech inevitably cause cumulative mapping errors that limit performance. To address this, we describe a novel representation learning framework integrating speech and text representations to improve mapping and reconstruction quality within a seq2seq VC model. Methods: our methodology comprises two main stages: 1) representation integration and learning, and 2) reconstruction training. A network capable of incorporating auxiliary text information is first constructed with pretrained modules to learn speech--text-based integrated representations. Then, an autoencoder-style reconstruction strategy finalizes EL2SP model to inherit these representations without increasing model complexity. We introduce three fusion strategies including middle-, input-, and hybrid-level fusion strategies that progressively enhance learning. Moreover, besides standard seq2seq VC objectives, an additional reconstruction loss on the integrated representation is introduced to refine representation transfer. Results: experiments under different EL2SP datasets consistently demonstrate that our methods, combined with data augmentations, outperform baselines relying solely on speech representations. Furthermore, progressive improvements with system design depth validate the effectiveness of our methods. Significance: the proposed methods provide an extensible and practical methodology for EL speech enhancement and assistive communication technologies.

📖 深度解读

1. 一句话总结

本文提出了一种融合语音与文本表征的序列到序列(seq2seq)语音转换框架,通过在训练阶段引入文本信息来指导电子喉语音的编码映射,并在推理阶段巧妙剥离文本模块,从而在不增加模型复杂度的前提下,显著提升了电子喉语音转换为自然语音的质量和清晰度。

2. 研究背景与动机

  • 核心问题:如何将喉切除患者发出的严重失真、缺乏自然韵律且伴随机械噪声的电子喉(EL)语音,高质量地转换为自然正常语音(EL2SP)。
  • 重要性:EL语音是喉切除患者最便捷的发声方式,但其极低的自然度和清晰度导致严重的沟通障碍,改善EL语音能直接且极大地提升患者的生活质量。
  • 现有方法不足:主流的seq2seq语音转换模型仅依赖语音特征,由于EL语音与正常语音在声学特征上存在巨大鸿沟(如机械噪声、音调异常、语速不匹配),编码器难以提取纯净的语言学表征,导致映射过程中产生累积误差,转换性能遭遇瓶颈。虽然已有研究尝试引入文本信息,但往往需要在推理阶段也输入文本,或大幅增加模型复杂度与训练难度,不适用于实际的EL辅助场景。

3. 核心方法

  • 提出框架:一种基于“表征集成学习-重建训练”的两阶段框架。
  • 关键创新点
    1. 多层级语音-文本融合策略:提出了三种融合文本与语音表征的方式,形成性能递进的层级:中间层融合(MF,在编码器后融合语义)、输入层融合(IF,在编码器前注入文本线索)、混合层融合(HF,结合前两者,效果最佳)。
    2. 自编码器风格的知识继承与剥离:在第二阶段(重建训练),移除文本编码器,仅用EL语音作为输入,通过自编码器重建的方式,强迫语音编码器去逼近第一阶段学到的“语音-文本融合表征”,从而在推理时无需文本输入且不增加模型参数。
    3. 融合表征引导的辅助损失函数:在重建训练阶段,引入L1损失直接约束语音编码器的输出与第一阶段的融合表征对齐,使表征迁移更精准。
  • 核心思路直觉解释:就像给一个在嘈杂环境中听不清的人(语音编码器)配了一位手语翻译(文本编码器)。在训练时,翻译把准确的意思告诉听者,帮助他理解嘈杂声音背后的真实含义;等听者训练有素后,即使翻译不在场(推理阶段不需要文本),听者也能凭借经验从嘈杂声音中提取出准确信息。

4. 实验与结果

  • 数据集:使用了1个大规模日文TTS数据集(JSUT)用于预训练,以及5个小规模EL2SP数据集(包含3个真实患者数据集Patient-1/2/3和2个模拟患者数据集Pseudo-Patient-1/2)用于微调和评估。
  • 基线方法
  • Baseline 1:传统的预训练+微调范式(仅用语音)。
  • Baseline 2:引入合成数据(SD)增强的两阶段微调方法(仅用语音,前SOTA)。
  • 主要实验结果
  • 客观指标:在所有数据集上,提出的最佳系统(P-HF-3)全面超越基线。例如在Patient-1数据集上,相比Baseline 2,MCD(频谱失真)从6.24降至5.74,CER(字错误率,衡量清晰度)从23.3%大幅降至18.4%。
  • 主观指标:在自然度MOS评分中,P-HF-2在Patient-1上达到3.54(Baseline 2为2.90,原始EL为1.09);在清晰度MOS评分中,P-HF-2达到3.84(原始EL为1.97),提升显著。
  • 消融实验揭示
  • 对比“-1”(无合成数据)、“-2”(加合成数据)、“-3”(加合成数据+辅助损失)系统,性能依次递进,证明合成数据和辅助损失的有效性。
  • 对比三种融合策略,MF < IF < HF,证明将文本信息前置到输入端能让编码器更好地内化文本线索,而混合融合能取得最精细的集成效果。

5. 优势与局限

  • 主要优势
    1. 推理高效且实用:最终模型完全保留了原始seq2seq VC的架构和参数量(约30.4M),推理时仅需EL语音输入,无需文本,适合端侧部署。
    2. 突破性能瓶颈:通过文本的跨模态指导,有效缓解了EL语音严重失真带来的累积映射误差,在自然度和清晰度上实现双赢。
    3. 框架扩展性强:提出的融合策略和表征继承方法可适配其他面临严重声学失真的语音转换任务。
  • 局限性
    1. 非因果架构导致高延迟:当前模型是非因果的自回归模型,必须等整句话输入后才能开始转换,实时交互延迟较高(5秒语音需约0.91秒处理),难以实现真正的流式对话。
    2. 韵律恢复的轻微折衷:论文指出,引入文本表征虽然大幅提升了语言学内容的准确性,但在音高(F0)等韵律指标的重建上存在微小的波动和让步,合成数据的不完美也会引入韵律不稳定性。

6. 关键结论与启发

  • 最重要的Takeaway:在处理极低质量源语音的转换任务时,引入模态间(如文本)的清晰语义作为“脚手架”来指导语音编码器的训练,并在推理时撤走“脚手架”,是突破纯语音表征学习瓶颈的有效范式。
  • 后续研究启发
    1. 实时流式转换:将当前非因果的Transformer架构替换为因果架构或非自回归模型,实现低延迟的流式EL语音转换,是走向临床实时应用的关键。
    2. 多模态情感与韵律补偿:未来可引入视觉信息(如唇部视频、面部表情),不仅能辅助提升内容识别,还能弥补当前文本引导在韵律和情感表达上的不足。
    3. 轻量化与端侧部署:探索模型蒸馏或轻量化设计,使该框架能直接在智能手机等移动设备上运行,真正惠及患者。
#9
eess.AScs.SD

Localizing broadband noise sources using the Loève spectrum and a 2.5D approach 跨领域

Christian H. Kasess, Wolfgang Kreuzer, Holger Waubke
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: 31 pages, 13 figures
查看摘要
The localization of moving sound sources using a microphone array is typically based on modifying the signal to compensate for the Doppler effect. In the time domain this compensation is done on a sample-by-sample basis. In the frequency domain short time segments need to be used in which the Doppler effect is assumed to be approximately constant and a discrete Fourier transform is done on each segment. In contrast, the authors developed an inverse 2.5D localization method for uniformly moving single-frequency sources that works in the spectral domain and allows for the use of longer windows. This was achieved by modifying the 2.5D forward model to directly compute the effect of the motion in the static observer position. The method does neither require to modify the measured signal nor does it require quasi-stationary of the measurements within the window used. Unfortunately, this approach is not directly suitable for broad-band stochastic sources, and in the present work we will investigate how the statistical properties of a uniformly moving stochastic source change when observed at a static observer. Using a 2.5D setting, the relation between the power spectral density of the moving source and the Loève spectrum, which is a generalization of the cross-spectral density at the static receivers, was derived. Based on simulated data with speeds up to 100 m\,s$^{-1}$, the work presented here provides a proof of concept for a method based on multi-taper estimates for the Loève spectrum to localize moving broad-band stochastic sources . Currently, the method requires a stationary source signal and that the spectral density is flat within a certain range around the frequency of interest. Also, correlations between sources are currently not considered.

📖 深度解读

1. 一句话总结

本文提出了一种基于Loève谱和2.5D声学框架的宽带随机运动声源定位方法,无需对信号进行时域多普勒补偿或截取短时准平稳窗口,即可在频域直接建立运动源与静态接收器之间的统计关系并实现定位。

2. 研究背景与动机

  • 核心问题:如何使用静态麦克风阵列对匀速运动的宽带随机噪声源(如行驶中的高铁产生的滚动噪声和空气动力学噪声)进行精准定位。
  • 为什么重要:交通噪声是声学研究的重点,准确识别运动声源的位置是进行噪声控制和评估的前提。
  • 现有方法不足:传统方法通常在时域逐样本补偿多普勒效应,或在频域使用短时窗口假设信号“准平稳”。这些方法不仅计算繁琐,且短时窗口会截断信号,导致频率分辨率下降和频谱泄漏,无法有效处理高度非平稳的宽带随机信号。

3. 核心方法

  • 提出方法:基于2.5D Helmholtz边界元框架的Loève谱正演模型与多锥估计法。
  • 关键创新点
    1. 引入Loève谱处理非平稳性:放弃了传统的互谱密度(仅适用于平稳信号),转而使用双频域的Loève谱。它能自然刻画因多普勒效应导致的接收信号非平稳特征,无需在时域做任何信号修改。
    2. 2.5D框架下的统计映射:在2.5D声学框架下,推导了运动源的功率谱密度与静态观察者接收到的Loève谱之间的理论映射关系,将3D问题降维计算,大幅降低了计算量。
    3. 融合多锥估计的频谱泄漏修正:将多锥估计器的频域平滑效应(类似于窗函数带来的泄漏)纳入理论正演模型中,消除了短时窗口带来的空间周期性伪影,提升了定位精度。
  • 核心思路直觉解释
    想象一个鸣着笛的火车朝你开来,你听到的声音频率是不断变化的(非平稳)。传统方法要么把声音“拉回”原来的频率(时域去多普勒),要么只取极短的一瞬间假设声音没变(短时准平稳)。本文的方法则是:既然声音在变,我们就直接用一种能描述“变化”的数学工具(Loève谱,它看的是两个频率之间的关联)。通过物理声学推导,文章找出了“火车原本的平稳声音统计特征”与“你听到的变化声音的Loève谱”之间的换算公式。只要算出听到的Loève谱,就能反推火车的位置。

4. 实验与结果

  • 数据集/基准:纯仿真数据。模拟了64通道麦克风阵列,声源速度为50 m/s和100 m/s,声源信号为500-2000 Hz的带限白噪声。
  • 基线方法:无传统基线对比,主要是理论值与估计值之间的自洽性验证(相关系数),以及与瑞利极限的对比。
  • 主要实验结果
  • 单源定位:在真实源位置处,理论Loève谱与估计Loève谱的相关系数出现明显峰值,证明方法可行。当使用较长的时间窗口(如T≥250ms)且对多次通过取平均时,相关系数显著提升。
  • 双源分离:当两个源的距离达到瑞利极限(约1.2m)时,相关系数曲线能区分出两个独立的峰值,符合物理光学分辨率极限。
  • 消融实验揭示
  • 多锥估计器的影响:若不将多锥估计器的频域平滑效应纳入理论模型,短窗口下定位结果会出现严重的空间周期性伪影;纳入后伪影被有效抑制。
  • 源谱形状的影响:假设源谱平坦(白噪声)在高速下会引入误差;若将真实的非平坦频谱(如高斯滤波噪声)代入理论公式,定位相关性大幅回升。
  • 源间相关性的影响:假设源间互不相关,若人为引入完全相关的源,会导致梳状滤波干涉效应,降低理论与估计的吻合度,但峰值位置仍基本保持。

5. 优势与局限

  • 主要优势
    1. 摆脱了短时准平稳假设:允许使用更长的时间窗口,从而获得更好的频率分辨率和统计稳定性。
    2. 纯频域处理:无需复杂的时域信号重采样或多普勒补偿,直接在频域通过统计特性建立映射。
    3. 2.5D框架的扩展性:天然兼容边界元法(BEM),未来可轻松加入散射体(如列车车身、地面)的建模。
  • 局限性
    1. 强假设依赖:目前要求源信号是宽平稳(WSS)的,且在关注频带内功率谱密度平坦(局部白噪声),这在实际复杂噪声中难以完全满足。
    2. 忽略源间相关性:假设不同位置的声源互不相关,但实际中(如车轮不同部位的辐射)往往存在空间相关性,这会干扰定位结果。
    3. 缺乏反演算法:本文仅解决了正演问题(从源推接收谱),尚未提出配套的逆问题求解(反演定位)算法,目前仅用相关系数搜索代替。

6. 关键结论与启发

  • 最重要的Takeaway:对于匀速运动的宽带随机声源,其多普勒诱导的非平稳性可以在频域被严格且优雅地解析,通过Loève谱与2.5D框架的结合,完全不需要截断信号或修改原始时域数据即可实现声源定位。
  • 对后续研究的启发/延伸方向
    1. 开发专用反演算法:当前仅用相关系数遍历网格,未来需引入稀疏约束或正则化的逆问题求解器(如反卷积/压缩感知),以实现高分辨率的自动定位。
    2. 放宽理论假设:如何将非平坦谱和源间相关性直接纳入正演模型,是走向工程实用的关键。
    3. 实测数据验证:从仿真走向真实的高铁列车阵列测量数据,验证并调优多锥估计器的参数选择。
    4. 探索其他谱估计器:文中提及Loève谱的估计器不唯一,未来可尝试基于Wigner-Ville谱等其他时频分析工具的估计方法,并推导其对应的频域混淆效应。
#10
eess.AS

Domain-Agnostic Incremental Learning for Sound Classification. A DCASE 2026 Challenge task

Riccardo Casciotti, Manjunath Mulimani, Manu Harju, Jesper Rindom Jensen, Annamaria Mesaros
Audio and Speech Processing (eess.AS)
Comments: White paper. To be completed after the challenge deadline and submitted for the DCASE 2026 Workshop
查看摘要
This paper presents the Domain-Agnostic Incremental Learning for Audio Classification Task of the DCASE 2026 Challenge. Incremental learning refers to sequentially learning new tasks with the same system while maintaining its knowledge and performance on the previously learned task. Domain-incremental learning for sound classification refers to learning the same sound classes but in different acoustic domains, and was formalized as a data challenge for the first time in DCASE 2026. Participants will train a system to learn ten sound classes in three different domains, with learning at each incremental task not having access to previous task data. Submitted systems will be ranked by the overall average accuracy calculated over the three domains. The provided baseline system obtains a modest performance of 44.9\% accuracy over the three domains, mostly due to erroneous inference of the domain for the test sample.

📖 深度解读

1. 一句话总结

本文介绍了DCASE 2026挑战赛的“领域不可知增量音频分类”任务,旨在解决音频系统在连续学习新声学领域时无法访问旧数据且推理时不知领域标签的“灾难性遗忘”问题,并提供了一个基于批归一化层适配的基线系统。

2. 研究背景与动机

  • 核心问题:如何让音频分类模型按顺序学习来自不同领域的相同声音类别(领域增量学习),且在推理时无需知道样本属于哪个领域(领域不可知),同时不遗忘之前学过的领域知识。
  • 重要性:这是现实世界中机器听觉的常见场景(如录音设备、环境变化导致声学特征偏移),模型需要终身学习并保持泛化能力,而不是固化在单一数据分布上。
  • 现有方法不足
    1. 传统的领域自适应通常只考虑源域和目标域两个域,且需要同时访问源域数据进行分布对比,无法扩展到多域的持续学习。
    2. 现有的领域感知增量学习假设推理时能获取领域标签,从而可以直接调用对应领域的专用参数,这在实际应用中往往是不现实的。
    3. 普通的微调会导致严重的灾难性遗忘,而现有的音频增量学习缺乏一个统一、公平的评估基准。

3. 核心方法

  • 提出的框架:DCASE 2026 Task 7 挑战赛框架及基线系统。
  • 关键创新点
    1. 首次形式化领域不可知增量学习(DAIL)任务:在音频挑战赛中首次定义了“推理时无领域标签”且“学习时无旧域数据”的严苛增量学习标准。
    2. 基于批归一化(BN)层的领域适配机制:模型主体(卷积层)跨域共享,每遇到一个新领域,仅新增并训练该领域专属的BN层,以捕捉新域的数据分布特征。
    3. 基于熵的领域自动路由:推理时,由于不知道样本属于哪个领域,模型将样本同时通过所有已知的“共享层+域专属BN层”组合,计算各类别预测概率的熵值,选择熵值最小(即模型最确信)的那个域的BN层结果作为最终输出。
  • 核心思路直觉解释:就像一个医生掌握了在三种不同气候下诊断相同疾病的方法。主体诊断逻辑(共享层)是通用的,但针对不同气候的体征参考标准(BN层)是专用的。面对一个不知来自何地的病人(推理样本),医生用三套标准分别推演一遍,哪套标准给出的诊断结论最笃定(熵最小),就认为病人来自该气候区,并采用该诊断。

4. 实验与结果

  • 数据集:DIL-DCASE26开发集(包含D2和D3两个域,D1域数据不公开,仅提供在D1上预训练好的模型)。10个声音类别,每个音频片段单标签。
  • 基线方法:基于PANNs CNN14架构,采用上述的BN层适配与熵路由机制。
  • 主要实验结果
  • 基线系统在D2和D3上的平均准确率仅为 44.9%(学完D3后,D3准确率35.0%,D2保持54.7%)。
  • 性能低下的主要原因是领域路由错误:模型在推理时错误地为D2/D3的样本选择了D1的BN层。
  • 上界对比:如果采用“领域感知”(即人为提供正确域标签,直接使用正确BN层)的Oracle方式,平均准确率可达 67.6%。这表明只要领域判断准确,模型本身的知识保留是不错的,性能瓶颈完全在于领域不可知情况下的路由机制。
  • 消融实验:论文通过对比“领域不可知(熵路由)”与“领域感知(真实标签路由)”的结果,揭示了当前基线系统在领域身份推断上的严重缺陷。

5. 优势与局限

  • 主要优势
    1. 任务设置极具现实意义:去除了推理时的领域先验,逼近真实的开放世界部署场景。
    2. 公平的评估基准:禁止使用外部数据和预训练模型,迫使参赛者从增量学习算法本身寻求突破,而非依赖大规模预训练的先验知识。
  • 局限性
    1. 基线系统的路由机制过于脆弱:基于熵的领域选择极易偏向早期领域(如D1),导致严重的误判。
    2. 数据访问限制极端:D1域完全不提供数据(连回放缓冲区都不可能建立),虽然增加了挑战性,但也限制了一些基于回放或正则化的增量学习方法的应用。

6. 关键结论与启发

  • 最重要的Takeaway:在领域不可知的增量学习中,“如何识别当前样本的域”比“如何保留旧域的知识”是更致命的瓶颈。基线系统通过共享层+域专属BN层成功保留了知识(Oracle下67.6%),但糟糕的域路由将其拉低至44.9%。
  • 对后续研究的启发
    1. 改进域路由机制:未来的研究应重点设计更鲁棒的领域推断方法,例如引入对比学习让不同域的特征更可分,或训练一个独立的领域分类器,而非简单依赖输出熵。
    2. 解耦特征学习:探索如何让共享层提取出与域无关的鲁棒特征,从而降低对域专属参数(如BN层)的依赖。
    3. 挑战赛结果值得期待:由于论文撰写时挑战赛尚未截止,该任务最终将催生哪些创新的路由或抗遗忘机制(如高级正则化、生成回放、动态架构等),是音频持续学习领域的重要风向标。
#11
eess.AS

Breaking the Pair: Evaluating Dyadic Interaction via Speaker Switching

Nishchay Nilabh, Neeraj Kumar Sharma
Audio and Speech Processing (eess.AS)
查看摘要
Speakers in dialogue continuously adapt their communicative behavior across acoustic, lexical, and semantic dimensions, a phenomenon known as conversational entrainment. Modeling this process requires representations that capture the global structure of interaction, yet prior approaches fail to disentangle dyad-specific patterns from speaker-specific traits, limiting their ability to capture true conversational adaptation. We address this with the Dyadic Distance Matrix (DDM), which encodes all pairwise similarities between the turns of two speakers over an entire conversation, capturing long-range cross-speaker dependencies. This raises a key question: does the DDM represent genuine interaction, or merely reflect individual speaker characteristics? We propose the speaker-switch test, a principled control in which one speaker's turns are replaced with those from an unrelated speaker drawn from a different conversation. This preserves turn-level statistics while disrupting the original dyadic coadaptation. The ability to distinguish real from switched DDMs thus directly evaluates whether the representation encodes interaction-specific structure. Across four embedding types and classifiers including ResNet-50 on the CANDOR corpus, real DDMs are consistently distinguishable from their switched counterparts. Comparisons with LibriSpeech show higher discriminability in read speech, highlighting the role of prosodic variability in naturalistic conversations. GradCAM analysis further reveals distinct structural signatures driving classification. These results establish the speaker-switch test as a robust diagnostic for validating representations of dyadic conversational interaction.

📖 深度解读

1. 一句话总结

本文提出了一种名为“说话人切换测试”的评估框架,通过将对话中一方的发言替换为无关说话人的发言,来检验对话交互表征(DDM)是否真正捕捉了两人之间的“协同适应”,而非仅仅是个人说话习惯的叠加。

2. 研究背景与动机

  • 核心问题:如何验证一个对话计算模型捕捉到的是两人之间真正的“互动交互结构”,而不是每个说话人各自独立的声学或语义特征?
  • 重要性:对话中的“会话趋同”(conversational entrainment,即两人越聊越像)是沟通的核心现象。如果模型无法区分“真互动”和“假拼凑”,就无法真正理解对话动态,也会限制对话系统的发展。
  • 现有不足:以往的方法多依赖局部相邻回合的相似度,且严重混淆了两种结构:一是两人互动产生的“对话特有模式”,二是说话人自身的“个体特征”。这导致模型可能仅仅因为“认出了说话人”就给出了高分,而不是因为检测到了两人之间的相互影响。

3. 核心方法

  • 提出框架:本文使用二元距离矩阵作为对话的基础表征,并提出了说话人切换测试来进行验证。
  • 关键创新点
    1. DDM全局表征:不局限于相邻回合,而是计算对话中A所有回合与B所有回合之间的两两余弦距离,形成一个全局的交互矩阵。
    2. 说话人切换测试:一种巧妙的“控制变量法”。将真实对话中B的发言替换为另一场无关对话中C的发言,构造出“伪对话”。如果模型能分辨出“真对话”和“伪对话”,就证明DDM编码了超越个体特征的互动信息。
    3. 跨语料库对比:引入朗读语音作为对照,揭示自然对话中韵律变化的作用。
    4. 可解释性分析:使用GradCAM热力图直观展示DDM矩阵中哪些区域对判断真假互动起决定性作用。
  • 直觉解释:想象你要证明一对舞伴是在“配合跳舞”而不是“各跳各的”。你把女舞伴换成另一个毫无默契的人,如果裁判依然看不出区别,说明原来的舞蹈也没有真正的互动。本文就是把对话中的“舞伴”换掉,看AI能不能识破这种“假拼凑”。

4. 实验与结果

  • 数据集:自然对话数据集 CANDOR(主要),朗读语音数据集 LibriSpeech(跨语料对照)。
  • 基线/对比方法
  • 嵌入方式:wav2vec 2.0(情感/韵律)、x-vector(声纹/结构)、openSMILE(声学特征)、all-MiniLM(语义/文本)。
  • 分类器:ResNet-50(主模型),CNN,MLP。
  • 主要实验结果
  • 语义特征是强信号:在CANDOR上,基于文本的语义嵌入使用ResNet-50达到了100%的完美分类准确率,即便用最简单的MLP也能达到85.7%。这说明话题和词汇的协同是判断真互动的最强依据。
  • 声学特征需深度模型:在CANDOR的声学特征上,浅层网络(MLP)直接崩溃(准确率接近50%的随机猜测),而ResNet-50能达到约68%-69%的准确率,证明声学互动模式是复杂的、空间分布式的,需要深度网络提取。
  • 朗读语音极易识别:在LibriSpeech(朗读语音)上,所有模型(包括MLP)在声纹特征上都达到了100%准确率。这是因为朗读语音缺乏自然对话中的韵律适应,声纹特征过于稳定,导致“假拼凑”一秒露馅。
  • 消融/解释性实验(GradCAM)揭示
  • 语义互动看对角线:真实对话的语义DDM热力图集中在矩阵对角线(时间相近的回合话题相似),切换后对角线特征消失。
  • 声学互动看全局:真实对话的声学DDM热力图呈现全局激活,说明韵律适应是贯穿整个对话的长期行为,而非仅限于相邻回合。

5. 优势与局限

  • 主要优势
    1. 评估范式严谨:说话人切换测试巧妙地剥离了个体特征,为“交互表征有效性”提供了一个极具说服力的因果推断标准。
    2. 多维度验证:跨越声学、声纹、语义三个层次,并辅以自然对话与朗读语音的对比,结论非常立体。
    3. 可解释性强:GradCAM分析不仅证明了模型有效,还揭示了语义和声学适应在时间维度上的不同模式(局部对齐 vs 全局分布)。
  • 局限性
    1. 分类器架构依赖:声学特征在MLP上表现极差,这意味着DDM的实用性可能受限于对深度网络(如ResNet)的依赖,计算成本较高。
    2. 切换方式的生态效度:随机替换另一人的发言虽然控制了变量,但破坏了对话的时序连贯性,模型可能仅仅是因为“发现对话驴唇不对马嘴”而分类成功,未必完全是因为捕捉到了微妙的“协同适应”。
    3. 未涉及下游任务:目前仅停留在“验证表征有效性”的阶段,尚未证明这种验证过的DDM表征能否实际提升对话系统或情感预测等下游任务的性能。

6. 关键结论与启发

  • 最重要的Takeaway:对话交互表征必须经过“剥离个体特征”的检验;DDM确实编码了真正的双人互动结构,且语义互动表现为局部时间对齐,声学互动表现为全局长期分布。
  • 对后续研究的启发
    1. 表征学习的改进:未来的对话模型在设计损失函数时,应引入类似“说话人切换”的对比学习机制,强迫模型学习交互特征而非偷懒记忆说话人特征。
    2. 从验证到预测:既然DDM被证明是有效的交互表征,下一步应将其整合到对话结果预测(如沟通成功率、共情水平评估)或更自然、更具响应性的对话生成系统中。
    3. 声学建模的挑战:自然对话中的声学适应极其复杂,如何设计更适合捕捉这种全局分布式协同的轻量级网络,是一个值得探索的方向。
#12
eess.AS
KAIST - Korea Advanced Institute of Science & Technology (QS Top 100)University of Illinois at Urbana-Champaign (QS Top 100)

SiamCTC: Learning Speech Representations through Monotonic Temporal Alignment

SooHwan Eom, Mark Hasegawa-Johnson, ad Chang D. Yoo
Audio and Speech Processing (eess.AS)
Comments: Accepted to Interspeech 2025
查看摘要
Self-supervised speech representation learning has made significant progress through Siamese networks, which leverage different views of the same input. However, existing methods often require frame-wise alignment between these views, overlooking the broader linguistic context invariance across different speaking styles. We introduce SiamCTC, a framework that integrates Siamese networks with Connectionist Temporal Classification (CTC) to learn speech representations without strict frame-level correspondence. By employing CTC loss to establish flexible, monotonic alignments between differing temporal realizations of the same content, SiamCTC accommodates speed perturbations and other temporal augmentations. This design relaxes frame-wise constraints while preserving temporal coherence and enhancing robustness to speaking-rate variations in downstream tasks. Our experiments demonstrate that SiamCTC leads to more adaptable speech representations, particularly at diverse speaking rates.

📖 深度解读

1. 一句话总结

本文提出了SiamCTC框架,通过结合孪生网络和CTC(连接时序分类)损失,让模型在语速变化等时间扰动下依然能对齐并提取不变的语音内容特征,解决了传统自监督语音学习方法依赖严格帧级对齐的痛点。

2. 研究背景与动机

  • 核心问题:如何在自监督语音表征学习中,提取不受语速、说话风格等时间变化影响的“语言内容不变性”特征。
  • 重要性:语音信号不仅包含语言内容,还夹杂了说话人特征、环境噪声和语速等信息。如果模型对语速变化过于敏感,在实际应用(如遇到快语速或慢语速语音时)性能就会大打折扣。
  • 现有方法不足:当前基于孪生网络或掩码预测的自监督方法(如HuBERT, WavLM, SPIN等)通常假设两个增强视图之间存在严格的帧级对应关系。这种“死板”的对齐要求导致模型无法使用“语速扰动”这种极其有效的时间增强手段(因为一变速,帧就错位了),也未能充分挖掘不同说话风格下语言内容的本质不变性。

3. 核心方法

  • 提出框架:SiamCTC。该框架将原始语音和经过时间扰动(如变速)的语音输入共享的孪生编码器,通过三个联合优化的损失函数进行训练。
  • 关键创新点
    1. 引入CTC实现柔性单调对齐:摒弃了传统的严格帧对齐,改用CTC损失来建立两个视图之间的对齐关系。CTC允许“多对一”的路径映射,天然适应语速变化带来的帧数和位置偏移。
    2. 时间对比学习(TINCE)防表征坍塌:由于CTC容易走捷径(把所有帧映射成同一个向量来最小化对齐代价),引入TINCE损失,强制相邻帧相似、远离帧区分,从而保留局部时间上下文。
    3. 对齐一致性约束(KLD):用Viterbi或DTW计算的硬对齐路径作为监督信号,通过KL散度约束模型学到的软对齐(注意力分数),提升对齐质量。
  • 核心思路直觉解释:想象两个人用不同语速读同一段话,传统方法要求第5个字必须和第5个字对齐(帧级对齐),这显然行不通;SiamCTC则像是一个带弹性的尺子,允许快读的3个帧对应慢读的5个帧(CTC对齐),同时用“相邻的音要相似,隔得远的音要拉开差距”的规则(TINCE)防止这把尺子缩成一团(表征坍塌)。

4. 实验与结果

  • 数据集:LibriSpeech(使用train-clean-100进行微调,test-clean进行评估)。
  • 基线方法:HuBERT, WavLM,以及它们的改进版变体SPIN、LASER。
  • 主要实验结果
  • 在音素识别(PR)和语音识别(ASR)任务上,SiamCTC全面超越基线。例如,在WavLM基础上应用SiamCTC,PER从4.84%降至3.96%(下降0.88%),WER从6.21%降至5.73%(下降0.48%)。
  • 鲁棒性测试:在不同语速(0.8x到1.2x)下,SiamCTC表现极其稳定。在0.8x慢速下,HuBERT的PER飙升至6.52%,而SiamCTC仅为4.6%;在1.2x快速下,HuBERT为6.28%,SiamCTC仅为4.7%。
  • 消融实验揭示
  • 仅用CTC损失,PER为5.26%;加入KLD对齐一致性,微降至5.16%;
  • 加入TINCE防坍塌损失,PER大幅降至4.48%,说明防止表征坍塌比硬对齐指导更重要;
  • 三者结合达到最优4.32%,证明各损失互补。

5. 优势与局限

  • 主要优势
    1. 打破帧级对齐枷锁:使模型能够安全地使用语速扰动等时间增强,极大提升了模型对语速变化的鲁棒性。
    2. 即插即用:可以作为现有SSL模型(如HuBERT, WavLM)的微调插件,有效提升下游任务性能。
    3. 理论自洽:CTC对齐、防坍塌对比学习和对齐一致性三者构成了逻辑严密的闭环。
  • 局限性
    1. 超参数敏感:论文自身承认,模型对数据增强策略、负样本采样、注意力温度等超参数非常敏感(尤其是较低的温度对寻找对齐至关重要)。
    2. 未验证从头训练的潜力:当前实验仅在预训练模型基础上进行微调验证,未探索从零开始训练SiamCTC的上限。

6. 关键结论与启发

  • 最重要的Takeaway:在语音自监督学习中,“柔性对齐”优于“刚性对齐”。通过CTC放宽帧级对应约束,不仅不会丢失时间连贯性,反而能让模型更好地学习跨越不同语速的语言内容不变性。
  • 对后续研究的启发
    1. 从零预训练的探索:将SiamCTC的CTC对齐机制直接嵌入到大规模预训练阶段(而非仅作为微调阶段),结合掩码增强,可能会训练出更强大的基础模型。
    2. 离散化表征的结合:如论文局限部分所述,未来可探索将连续表征替换为向量量化的离散语音单元,这可能会进一步与CTC的离散对齐特性契合,推动口语语言建模的发展。
    3. 自适应对齐策略:针对当前模型对温度参数和对齐超参数敏感的问题,未来可研究自适应调节对齐锐度的策略。
#13
eess.AS
Johns Hopkins University (QS Top 100)Carnegie Mellon University (QS Top 100)

Exploiting Noise Inseparability for Weakly-Supervised Discriminative Speech Denoising Using Noisy Targets

Matthew Maciejewski, Samuele Cornell
Audio and Speech Processing (eess.AS)
Comments: Submitted to IWAENC 2026
查看摘要
Speech denoising is an often necessary step not only for human listening, but also for downstream processing by systems lacking robustness to noisy, real-world acoustic conditions. Unfortunately, denoising is a problem where conventional in-domain supervised training is not trivial, as the training targets cannot be annotated by humans: producing a clean version of a naturally-noisy speech recording is itself the task to solve. Supervised training is typically performed through the artificial addition of noise to clean speech recordings, which can only be sourced from controlled domains, a significant limitation due to the poor out-of-domain generalization of neural networks. An alternative is noisy target training (NyTT), which simply replaces the clean speech with in-domain noisy recordings, with the hope that learning to remove the artificial noise will extend to the natural. Though having shown promising results, NyTT's training objective is not minimized by clean speech estimates. We show that by estimating the artificial noise in addition to the naturally-noisy speech, the undesirable optimum can actually be exploited: the residual noise in the speech estimate can be canceled by the noise estimate via simple subtraction. Crucially, the optimum is fully compatible with conventional artificial mixtures, enabling joint training using both types of data with consistent optimization targets, opening the door to improved domain adaptability. The effectiveness of our approach is demonstrated through WHAM! and CHiME-3-based benchmarks.

📖 深度解读

1. 一句话总结

本文提出了一种名为差分噪声过滤(DNF)的弱监督语音去噪框架,通过让模型同时输出带噪语音和噪声估计并进行相减,巧妙化解了传统含噪目标训练中残留噪声的偏差问题,并实现了合成数据与真实含噪数据的联合训练,显著提升了模型在真实场景下的去噪和域适应能力。

2. 研究背景与动机

  • 核心问题:如何在缺乏纯净语音目标的情况下,利用真实环境中的含噪语音训练有效的语音去噪模型。
  • 重要性:传统的全监督去噪依赖“纯净语音+人工加噪”的合成数据,但真实世界的噪声和说话方式千差万别,神经网络在合成数据上训练后往往在真实场景下泛化能力差(域偏移问题)。而真实场景中,我们很难甚至不可能获取到与带噪语音完全对应的纯净语音。
  • 现有方法不足:含噪目标训练是当前主流的弱监督范式,它通过在真实带噪语音上继续加噪,让模型学习从“更噪”到“较噪”的映射。但其存在致命缺陷:由于网络无法分离混合在一起的同类背景噪声,优化目标会迫使模型在输出的语音中保留一半的混合噪声(即“和稀泥”式的折中解),导致去噪不彻底;且其优化目标与传统合成数据的监督目标冲突,无法有效进行混合训练。

3. 核心方法

  • 提出框架:差分噪声过滤。
  • 关键创新点
    1. 化劣势为优势的“差分相减”机制:既然网络无法分离混合噪声,必然会在语音估计中残留噪声,DNF干脆让网络同时输出两个结果——带噪语音估计和噪声估计。由于两者都包含相同的混合噪声成分,直接将两者相减,残留噪声就被完美抵消了,剩下的就是纯净语音。
    2. 一致的联合训练目标:DNF的差分机制使得弱监督数据(含噪目标)和全监督数据(纯净目标)在数学优化上达到了统一。在混合训练时,不再有相互冲突的梯度方向,从而兼顾了合成数据的强监督力和真实数据的域适应性。
    3. 尺度不变性约束:为了保证相减时噪声能精确抵消,利用信号正交性理论,在训练时对两个输出的尺度进行对齐约束,确保它们包含等量的噪声成分。
  • 直觉解释:就像电路中的差分放大器,两根信号线接收相同的干扰(噪声),相减后干扰就被消除了,只留下差异部分(语音)。网络虽然分不清哪部分是自然噪声、哪部分是人工加的噪声,但它把这两者打包成了一个整体,只要保证两个输出端携带的“噪声包裹”一样大,减法就能生效。

4. 实验与结果

  • 数据集/基准:WHAM!(单说话人增强数据集)和 CHiME-3(真实嘈杂环境语音数据集)。
  • 对比基线:传统的单输出 NyTT(含噪目标训练)基线模型。
  • 主要实验结果
  • WHAM! 数据集:在纯含噪目标训练下,DNF 相比基线最高带来 5.9 dB 的 SI-SDRi 提升。
  • CHiME-3 数据集:在混合训练(24份合成+4份真实)下,DNF的 DNSMOS 达到 2.46,而表现最好的基线(纯合成训练)仅为 1.89;DNF的 UTMOS 达到 2.40,基线仅为 1.89。
  • 消融实验揭示
  • 混合训练的容忍度:DNF 对含噪数据的包容度极高,即使训练集中有一半是含噪目标,性能也几乎不下降;而基线在含噪数据占一半时性能暴跌 3.4 dB。即使只有 10% 的纯净数据,DNF 也能大幅缓解纯含噪训练的性能劣化。
  • ASR下游任务权衡:虽然 DNF 产出的语音更干净(MOS分高),但在 ASR 识别率(WER)上略逊于未处理音频或基线。这是因为基线保留了较多原始噪声,恰好符合 ASR 模型的多条件训练分布;而 DNF 去噪更彻底,反而引入了 ASR 未见过的处理伪影。

5. 优势与局限

  • 主要优势
    1. 从理论层面解释并解决了 NyTT 框架中残留噪声的偏差问题。
    2. 打通了弱监督与全监督训练的壁垒,使得混合训练不仅可行,而且高效。
    3. 在真实带噪数据的域适应上,客观语音质量指标(DNSMOS/UTMOS)提升显著。
  • 局限性
    1. 纯含噪目标训练下,性能距离纯纯净目标训练仍有较大差距(5.1 dB vs 15.2 dB),说明完全摆脱对纯净数据的依赖仍不现实。
    2. 存在“去噪-识别”的权衡:去噪越干净,可能引入越多的非线性伪影,导致下游 ASR 模型不认,WER 反而上升。
    3. 方法依赖于“两种噪声不可分”的假设,如果人工噪声与自然噪声特性差异过大,理论分析的最优解可能偏移。

6. 关键结论与启发

  • 最重要的 takeaway:在弱监督语音去噪中,与其强迫网络去完成它做不到的“同类噪声分离”,不如顺应其特性,让它在不同输出中保留相同的噪声偏差,最后通过代数相减(差分)物理消除。
  • 对后续研究的启发
    1. 伪影抑制:未来的去噪模型不仅要追求高信噪比,还需特别关注去噪后语音的分布是否匹配下游模型(如ASR)的训练分布,减少处理伪影。
    2. 多任务差分架构:这种“估计A+噪声”与“估计B+噪声”相减得到“A-B”的差分思想,不仅可以用于去噪,或许可以推广到语音分离、去混响等其他存在目标获取困难的音频任务中。
    3. 数据混合策略:在工程实践中,若要适配真实嘈杂环境,采用 DNF 这类框架进行“少量干净数据+大量真实带噪数据”的联合训练,是极具性价比的方案。
#14
eess.AS
Northwestern Polytechnical University (985, 211)

SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription

Yuhang Dai, Haopeng Lin, Zhennan Lin, Jiale Qian, Jun Wu 等 (13 人)
Audio and Speech Processing (eess.AS)
Comments: 10 pages, 4 figures, 3tables
查看摘要
Recent advances in Automatic Speech Recognition (ASR) and Large Language Models (LLMs) have significantly improved speech understanding capabilities. However, multi-speaker speech transcription remains challenging task, constrained by highly similar speaker voices, rapid turn-taking transitions, overlapping utterances and inaccurate speaker boundary segmentation. These challenges become particularly pronounced in real-world conversational audio, where speaker dynamics and acoustic conditions are highly variable. This technical report presents SoulX-Transcriber, a unified multi-speaker transcription system that jointly models speaker diarization (SD) and ASR within an LLM-based framework. SoulX-Transcriber adopts a two-stage training strategy to improve both speaker discrimination and transcription robustness. In the first stage, speaker-aware multi-task continuous pre-training enhances speaker representation learning and boundary perception. In the second stage, supervised fine-tuning further optimizes the model for accurate end-to-end speaker-attributed transcription under complex multi-speaker conditions. SoulX-Transcriber delivers strong performance and robustness across multiple public benchmarks, including AliMeeting, AISHELL-4, and AMI, while maintaining high adaptability to multi-domain scenarios.

📖 深度解读

1. 一句话总结

本文提出了SoulX-Transcriber,一个基于大音频语言模型的两阶段训练框架,通过增强说话人表征学习和构建高保真模拟对话数据,有效解决了复杂多说话人场景下“谁在什么时间说了什么”的识别难题。

2. 研究背景与动机

  • 核心问题:多说话人语音转写(SDR),即解决“谁在什么时间说了什么”的问题。
  • 为什么重要:随着会议记录生成、客服审计等工业需求的激增,多说话人语音理解成为刚需。
  • 现有方法不足
    1. 传统的级联系统(VAD+SV+ASR)存在严重的错误传播问题,在说话人频繁交替和语音重叠时表现极差。
    2. 现有的基于大音频语言模型(LALM)的端到端方法,大多只关注模型架构修改或推理阶段优化,忽视了训练阶段的说话人表征学习,导致模型在面对声音相似、语速快、重叠多的真实对话时,说话人区分能力不足,容易发生身份混淆。

3. 核心方法

  • 提出框架:SoulX-Transcriber,基于Qwen3-Omni构建的端到端多说话人转写系统。
  • 关键创新点
    1. 面向对话的模拟数据管线:通过大模型生成对话脚本,并基于9维声学/语义属性(性别、音高、情感等)进行细粒度的向量检索,为脚本中的角色精准匹配参考音频,从而大规模合成包含声音相似者和复杂交互的“硬核”训练数据。
    2. 说话人感知的多任务连续预训练(第一阶段):不改变底层架构,而是通过5个辅助任务联合训练,强制模型学习说话人表征。包括:说话人轮次预测(STP,学边界)、目标说话人提取与识别(TSER,学提取)、说话人验证(SV,学区分)、SDR主任务和常规ASR任务。
    3. 高质量监督微调(第二阶段):用约1000小时的高质量人工标注和精筛数据微调,消除第一阶段大规模伪标签带来的噪声,提升最终输出的精度和指令遵循能力。
  • 核心思路直觉解释:传统方法像是一个只学了“听写”和“分段”的学生,遇到声音像的人就容易搞混。SoulX-Transcriber的做法相当于给学生安排了“专项特训”:先让它做“找不同”(SV)、“跟着某人的声音做听写”(TSER)和“标出换人节点”(STP)的练习,把“认人”的本领练扎实了,再去解决完整的会议记录问题;同时,老师还会专门生成“双胞胎声音”的模拟题让它练手,最后再用标准答案纠错,确保它不仅会认人,还能精准输出。

4. 实验与结果

  • 数据集/基准:公开会议数据集(AliMeeting, AISHELL-4, AMI),以及自建的通用领域测试集(日常对话、电影、播客)。评估包含短音频和5分钟长音频场景。
  • 对比基线:VibeVoice-ASR(开源SOTA)、Gemini-2.5-Pro、Gemini-3.1-pro-preview(闭源商业大模型)。
  • 主要实验结果
  • 中文短音频:在AISHELL-4和AliMeeting上全面碾压所有基线。AISHELL-4的DER降至2.89%(对比VibeVoice的6.77%和Gemini-3.1的24.84%),cpWER降至13.90%。
  • 长音频:在5分钟长音频测试中优势更明显,AliMeeting的DER仅为5.72%(Gemini-2.5高达58.14%),证明其极强的长上下文说话人追踪能力。
  • 通用领域:在日常对话和电影场景下表现卓越,播客场景相对较难,但仍远超基线。
  • 说话人归属性:核心指标$\Delta cp$(cpWER与WER的差值,反映因认错人带来的额外错误)在多数场景下极小甚至为负,证明其说话人归属错误率极低。
  • 消融实验(注:原文未提供显式的消融实验表格,但通过两阶段训练的描述和$\Delta cp$指标可以推断:多任务预训练显著降低了说话人混淆错误,而SFT阶段修复了伪标签噪声带来的精度损失。)

5. 优势与局限

  • 主要优势
    1. 说话人区分度极高:通过显式的多任务预训练和属性匹配的模拟数据,在声音相似和长音频场景下,说话人混淆率大幅低于现有大模型。
    2. 数据构建巧妙:提出的9维属性匹配模拟管线,解决了多说话人真实标注成本极高且难以构造“声音相似”困难样本的痛点。
    3. 即插即用:两阶段训练策略无需修改底层LALM架构,具有较好的通用性和迁移潜力。
  • 局限性
    1. 英文泛化能力存疑:模型训练数据以中文为主,虽然论文声称在英文AMI数据集上表现“合理”,但cpWER达到32.78%,绝对数值较高,说明跨语言泛化仍有较大提升空间。
    2. 播客场景表现受限:在内部播客测试集中,DER达到21.15%,$\Delta cp$高达11.87%,说明在背景复杂、说话风格多变的极难场景下,说话人追踪仍会失效。
    3. 依赖伪标签质量:第一阶段使用了10万小时数据,其中大量为伪标签,尽管第二阶段用精筛数据微调,但伪标签噪声对模型能力上限的潜在压制不可忽视。

6. 关键结论与启发

  • 最重要的Takeaway:在基于大语言模型的多说话人转写任务中,“训练方法/数据策略”比“模型架构修改”更关键。通过在预训练阶段显式引入说话人判别类任务(STP, SV, TSER),可以从根本上解决大模型“认人能力弱”的通病。
  • 对后续研究的启发
    1. 数据合成的精细化:未来生成多说话人训练数据时,不应仅停留在简单的音频拼接,而应像本文一样,利用大模型进行细粒度的“角色-声音”语义/声学属性匹配,以生成高质量的困难负例。
    2. 解耦评估指标:$\Delta cp$(cpWER与WER的差值)是一个极具启发性的指标,它帮助研究者剥离ASR本身的错误,单独审视系统的说话人归属能力,未来研究应更多关注并优化这一维度。
    3. 跨语言与多模态延伸:当前系统在英文和复杂声学场景下仍有不足,后续可探索多语言平衡预训练,或引入视频唇语信息辅助说话人分割,以解决纯音频在极端场景下的身份混淆问题。
#15
eess.AScs.SD
University of Science and Technology of China (QS Top 100, 985, 211)

DUET: Unified Dual-Space Emotion Control for Diffusion and Flow-Matching Driven Text-to-Speech 跨领域

Xu Zhang, Longbing Cao, Zhangkai Wu
Sound (cs.SD); Audio and Speech Processing (eess.AS)
查看摘要
Diffusion and flow-matching based text-to-speech (TTS) models excel in naturalness but often lack explicit emotion control, as emotional signals remain entangled with speaker identity. We discover that emotion embedding emerges as a linearly decodable direction of frozen hidden states, nearly orthogonal to the direction embedding speaker identity. This inspires a plug-and-play framework DUET for emotion control over pretrained diffusion and flow-matching based TTS models. During generation, DUET unifies dual-space control to achieve fine-grained emotion intervention in a single per-step update: hidden space steering shifts generation along the target emotion direction, while mel-space guidance refines spectral details through gradients backpropagated from a differentiable vocoder. We validate DUET on five architecturally diverse pretrained TTS backbones across three datasets, where it outperforms 10 supervised state-of-the-art emotional TTS baselines across paradigms and achieves the highest human-rated emotion appropriateness. To further showcase its qualitative behavior, we deploy DUET on an Ameca humanoid robot, where it produces richly expressive emotional speech on the humanoid, demonstrating the strong potential for plug-and-play affective interaction for embodied agents.

📖 深度解读

1. 一句话总结

本文提出了一种即插即用的框架DUET,通过在隐空间沿情感方向引导、在频谱空间通过可微分声码器优化细节,无需重新训练即可让预训练的扩散/流匹配语音合成模型生成丰富且精准的情感语音。

2. 研究背景与动机

  • 核心问题:如何在不重新训练的情况下,让基于扩散和流匹配的预训练文本转语音(TTS)模型具备精确的情感控制能力。
  • 重要性:基于扩散/流匹配的TTS模型音质自然,但缺乏显式的情感控制。如果通过监督学习重新训练,不仅计算成本高昂,还需要大量带情感标注的数据,且容易受限于固定的情感类别体系。
  • 现有不足:现有的免训练方法通常只在单一空间(如仅在隐空间或仅在频谱空间)进行干预,且忽略了情感与说话人身份的纠缠问题。此外,直接在频谱空间做微调,由于声码器(将频谱转为波形)的非线性映射,微小的情感调整往往无法忠实传递到最终音频中。

3. 核心方法

  • 提出框架:DUET(Unified DUal-space Emotion conTrol),一个统一隐空间和频谱空间的双空间即插即用情感控制框架。
  • 关键创新点
    1. 发现情感与说话人的几何正交性:首次揭示在冻结的TTS模型隐状态中,情感是线性可解码的,且其方向与说话人身份方向近乎正交,这为“只改情感不变音色”提供了理论可能。
    2. 双空间统一干预:将隐空间的全局引导与频谱空间的局部梯度修正统一在去噪的每一步中,互补解决情感控制问题。
    3. 生成时探测机制:针对纯文本输入的TTS模型,发现离线提取的情感方向与生成时的方向正交,因此创新性地在生成过程中动态提取伪标签进行探测,确保跨架构通用性。
  • 核心思路直觉解释
  • 隐空间引导:就像在汽车导航中设定了“情感方向”,在模型中间层的隐状态上,沿着这个方向推一把,让整条生成轨迹的大方向偏向目标情感(如把平淡的语调拉向悲伤)。
  • 频谱空间指导:但只推大方向不够,有些频谱细节(如急促的呼吸声)大方向管不到。因此,通过一个“可微分的声码器”,把最终波形的情感识别损失反传回频谱图,就像用细砂纸打磨频谱细节,确保最终发出的声音确实带有目标情感的细腻质感。
  • 两者在每一步去噪中接力完成:先调大方向,再抠细节。

4. 实验与结果

  • 数据集/基准:在ESD、CREMA-D和IEMOCAP三个数据集上,插入了5种架构各异的预训练TTS主干网络(F5-TTS, Matcha-TTS, GradTTS, ProDiff, StableTTS)。
  • 基线方法:对比了10个当前最先进的有监督情感TTS模型(如Qwen3-TTS, CosyVoice2等)。
  • 主要实验结果
  • 在ESD数据集上,DUET+GradTTS取得了75.5%的平均情感准确率,比最强有监督基线绝对提升了28.7%。
  • 在所有三个数据集上,5个主干网络中有4个超越了所有有监督基线;即使表现最差的StableTTS(因模型太轻量),在IEMOCAP上也超越了所有基线。
  • 主观评价中,DUET的情感适当性(EMOS 3.93)最高,自然度(NMOS 3.83)也极具竞争力。
  • 消融实验揭示
  • 去掉隐空间引导,平均准确率下降24.3%;去掉频谱空间指导,下降19.5%。两者缺一不可。
  • 隐空间引导主导全局韵律(对happy/sad更有效),频谱空间指导在补充瞬态细节上作用更大(对需要爆发力的angry贡献比例更高)。

5. 优势与局限

  • 主要优势
    1. 免训练与强通用性:真正实现即插即用,无需重新训练TTS模型,且广泛兼容扩散与流匹配两种主流范式、5种不同架构。
    2. 性能卓越:作为无监督方法,客观和主观指标均超越了需要大量标注数据的有监督SOTA模型。
    3. 解耦控制:利用情感与说话人空间的正交性,在调控情感时较好地保留了原说话人的音色。
  • 局限性
    1. 对瞬态情感(如愤怒)控制较弱:由于隐空间引导是对所有时间帧施加统一方向,无法很好地捕捉愤怒等依赖局部急促节奏变化的情感。
    2. 仅限于离散类别情感:目前只支持如开心、悲伤等分类情感,尚未拓展到唤醒度/效价等连续维度的情感控制。

6. 关键结论与启发

  • 最重要的Takeaway:预训练TTS模型的隐空间中天然存在与说话人身份解耦的线性情感子空间,利用这一几何特性,可以在不破坏原模型流形的情况下,通过双空间协同实现精细的情感控制。
  • 对后续研究的启发/延伸方向
    1. 时序自适应干预:未来可探索在隐空间和频谱空间引入时间维度的动态引导,以解决局部瞬态情感(如愤怒的突发重音)控制不佳的问题。
    2. 连续情感空间控制:沿着低维子空间的思路,未来可研究沿唤醒度和效价方向的连续向量控制,实现情感强度的精细渐变。
    3. 具身智能交互:论文在Ameca人形机器人上的成功部署表明,这种即插即用的情感生成技术可以直接赋能具身智能体,未来可结合多模态(面部表情、手势)实现更自然的情感交互。
#16
eess.AS
University of Illinois at Urbana-Champaign (QS Top 100)KAIST - Korea Advanced Institute of Science & Technology (QS Top 100)

SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors 跨领域

Yekaterina Yegorova, Argyrios Gerogiannis, Haolong Zheng, Julia Hockenmaier, Chang D. Yoo 等 (6 人)
Computation and Language (cs.CL); Audio and Speech Processing (eess.AS)
查看摘要
Speech-aware large language models often generalize poorly to out-of-domain settings. We propose SALSA (Speech-Aware LLM Adaptation via Learned Steering Activations), a lightweight adaptation method that learns layer-wise steering vectors. Unlike commonly used steering approaches that rely on contrastive activation differences, SALSA directly optimizes steering vectors using a supervised objective. Across children's speech, multilingual speech, and Mandarin-English code-switching benchmarks, SALSA substantially improves performance over zero-shot inference and speech in-context learning baselines, achieving up to 46.8% relative improvements over zero-shot. Analysis further demonstrates that steering the encoder, particularly the later layers, is more effective than steering the LLM backbone. These findings suggest that steering improves downstream ASR performance by adapting higher-level acoustic and phonetic representations to better align with the pretrained language model representation space, rather than by modifying the decoder itself.

📖 深度解读

1. 一句话总结

本文提出了SALSA,一种通过监督学习直接优化语音编码器“转向向量”的轻量级方法,在不修改模型权重的前提下,有效解决了语音大模型在儿童语音、多语言和语码转换等跨域场景下的泛化难题。

2. 研究背景与动机

  • 核心问题:语音感知大语言模型(SALLMs)在遇到训练数据中缺乏的跨域语音(如儿童语音、小语种、语码转换)时,识别性能会大幅下降。
  • 重要性:SALLMs虽然具备强大的语言先验知识,但如果无法将声学特征与语言模型的解码空间对齐,这些知识就无法在下游ASR任务中发挥作用。
  • 现有方法不足
    1. 微调/LoRA:需要更新模型参数,计算成本高且数据需求大。
    2. 上下文学习(ICL/SICL):虽然无需训练,但语音中包含大量说话人身份、韵律等声学变异,导致很难检索到有效的示范样本,且容易引入噪声导致性能崩溃。
    3. 传统激活转向:依赖对比样本对(如正负样本)提取转向向量。但在ASR任务中,天然的配对音频极难获取,且语音的高变异性会让对比信号充满噪声。

3. 核心方法

  • 提出方法:SALSA(Speech-Aware LLM Adaptation via Learned Steering Activations)。在冻结SALLM所有参数的前提下,为语音编码器的各层学习一组加性的“转向向量”。
  • 关键创新点
    1. 监督优化转向向量:摒弃了传统的“对比样本对相减”提取法,直接使用ASR的交叉熵损失函数端到端地优化转向向量,无需构建配对样本。
    2. 保范数重归一化机制:在注入转向向量时,保持激活值的原始范数(长度)不变,只改变其方向,从而在不破坏原表征空间分布的前提下实现行为干预。
    3. 聚焦编码器干预:将干预点锁定在语音编码器(尤其是高层),而非LLM解码器,实现了声学表征到语言模型空间的高效对齐。
  • 直觉性解释:想象SALLM是一个精通多国语言的“大脑”,但它的“耳朵”(语音编码器)在听某些口音或童音时会产生偏差。SALSA不是去重新训练这个大脑或耳朵,而是给耳朵戴上了一个“可学习的滤镜”(转向向量)。这个滤镜通过少量样本学会了如何把失真的声音信号“拨正”到大脑能听懂的方向上,且滤镜的强度刚好不改变原音量(保范数)。

4. 实验与结果

  • 数据集
  • 儿童语音:MyST, OGI, RSR
  • 多语言:CommonVoice (俄语 Ru, 特维语 Twi)
  • 语码转换:SEAME (中英混合)
  • 基线方法:Zero-shot(零样本)、TICL(基于文本嵌入检索的语音上下文学习)
  • 主要实验结果
  • 对比Zero-shot:SALSA在RSR数据集上实现了44.6%的相对WER降低,在SEAME上最高实现46.8%的相对MER降低。
  • 对比TICL:TICL在多语言和语码转换场景下极不稳定,甚至会导致性能严重退化(如SEAME上MER暴涨100%以上),而SALSA则稳定且大幅领先。
  • 数据效率:仅需200个样本即可在俄语上实现WER的大幅下降(87.50% -> 28.33%),展现出极高的数据效率。
  • 消融实验揭示
    1. 干预模块:干预编码器远比干预LLM解码器有效,联合干预反而不如单独干预编码器,说明跨域适应的关键在于“修整输入给大脑的声学信号”,而非“修改大脑本身”。
    2. 干预层级:干预编码器的高层比低层效果更好。因为高层承载了更多音素和语言学信息,低层主要是基础声学特征(特维语Twi除外,因为模型完全没见过该语言,只能依赖低层声学调整)。
    3. 数据规模:在高度异质的数据集(如MyST,说话人变异极大)上,数据量过大反而会导致性能下降(过拟合于不一致的声学信号)。

5. 优势与局限

  • 主要优势
    1. 极致轻量与高效:冻结所有模型参数,仅训练极少量转向向量,计算开销极小,且只需几百个样本即可生效。
    2. 稳定可靠:相比于ICL在跨域场景下的崩溃式退化,SALSA表现出极强的稳定性和一致性。
    3. 机理清晰:通过详尽的消融实验,明确了SALLM跨域适应的瓶颈在于编码器高层与LLM的对齐,为后续研究指明了方向。
  • 局限性
    1. 全局向量的局限:SALSA目前学习的是数据集共享的单一转向向量,对于说话人差异极大的高度异质数据(如MyST),容易发生方向冲突,缺乏输入依赖的自适应能力。
    2. 未见语言的适应力有限:对于预训练阶段完全未见过的语言(如Twi),转向带来的提升微弱,说明转向无法“无中生有”地创造语言知识,只能做已有知识的对齐。
    3. 任务单一:目前仅在ASR任务上验证,未拓展到语音翻译、情感识别等其他语音任务。

6. 关键结论与启发

  • 最重要的Takeaway:语音大模型在跨域场景下的表现不佳,往往不是因为LLM缺乏相关语言知识,而是因为语音编码器的声学表征与LLM的解码空间存在“错位”。通过轻量级的表征干预(转向编码器高层),就能以极低的成本弥合这一鸿沟。
  • 后续启发与延伸方向
    1. 动态/输入依赖的转向:未来的转向方法可以从“全局一把抓”转向“因人而异、因音而异”,根据单条音频的声学特征动态生成转向向量,以应对高异质性的语音数据。
    2. 多任务泛化:将转向机制从ASR拓展到更广泛的语音任务(如语音情感识别、说话人分离等),探索不同任务下的最优干预层级和策略。
    3. 与参数高效微调的结合:探索转向向量与LoRA等方法的正交性或互补性,寻找“权重微调+表征干预”的联合最优解。
#17
eess.AScs.SD

Quality Audio Prototyping: a prototype system for unified sound retrieval and procedural generation 跨领域

Nelly Garcia, Aditya Bhattacharjee, Gabryel Mason-Williams, Israel Mason-Williams, Emmanouil Benetos 等 (6 人)
Sound (cs.SD); Human-Computer Interaction (cs.HC); Machine Learning (cs.LG); Audio and Speech Processing (eess.AS)
Comments: DaFx 2026
查看摘要
Sound design workflows frequently oscillate between time-consuming library searches and the complexity of procedural synthesis, with practitioners typically relying on disconnected tools to address each challenge separately. This paper introduces Quality Audio Prototyping (QuAP), a working prototype that unifies content-based audio retrieval and procedural sound generation within a single interface, reducing the procedural distance between a narrative concept and its sonic realisation. QuAP integrates a similarity-based retrieval engine with real-time procedural audio models, complemented by a rule-based assistant that provides perceptually informed parameter guidance, offering definitions and recommendations derived from empirical optimisation rather than requiring prior synthesis knowledge. Preliminary evaluation confirms the viability of this approach: subjective assessment demonstrated statistically significant quality improvements in five of six embedded synthesis models, and an encoder ablation study established the preferred retrieval architecture on a sound effect dataset. A user evaluation with 16 practitioners confirmed the tool's workflow utility, with all participants agreeing that the parameter assistant preserved creative agency while lowering the barrier to procedural interaction.

📖 深度解读

1. 一句话总结

本文提出了QuAP系统,将基于内容的音频检索与程序化声音生成统一在一个界面中,并通过内置的感知参数助手,解决了声音设计师在搜索音效和合成声音时工具割裂、程序化合成门槛高的问题。

2. 研究背景与动机

  • 核心问题:声音设计师在工作时,经常需要在庞大的音效库中搜索素材,又需要使用程序化合成来生成新声音,但现有工具往往各自为战,导致工作流割裂,频繁的“上下文切换”打断了创作心流。
  • 重要性:声音设计是影视游戏听觉维度的核心,在探索阶段,设计师需要快速将“叙事概念”转化为“声音现实”,工作流的顺畅与否直接影响创作效率和质量。
  • 现有不足
    1. 工具割裂:检索系统、合成引擎和组织工具相互独立,无法无缝衔接。
    2. 音乐偏见:现有的大规模音频生成/检索模型多基于音乐数据集训练,难以泛化到非线性的、基于纹理的音效和环境音。
    3. 合成门槛高:程序化合成的参数空间维度高、命名技术化,非专业用户难以驾驭,且容易剥夺设计师的创意控制权。

3. 核心方法

  • 提出框架:QuAP(Quality Audio Prototyping),一个基于JUCE开发的工作原型系统,集成了混合检索、程序化合成和智能指导三大模块。
  • 关键创新点
    1. 混合检索与合成的统一:将基于文本/元数据的搜索、基于深度嵌入的声学相似度检索(FAISS加速)与6种程序化合成模型整合在同一插件中,支持检索结果与合成声音的混合叠加。
    2. 基于感知的参数助手:不同于黑盒式的AI生成,该助手是基于规则的。它通过“特征驱动的瓶颈框架”提取出对人类感知最关键的声学特征,将合成参数的推荐范围限制在主观听感最真实的区间,并用自然语言解释参数的感知效果。
    3. 面向音效的轻量级嵌入模型:采用在音效数据集(FSD50K)上微调的MobileNetV3提取音频嵌入,摆脱了音乐数据的偏见,且足够轻量以支持DAW中的实时部署。
  • 核心思路直觉解释:QuAP就像一个“懂行的录音棚助理”。以前你要找声音,得去档案室翻箱倒柜;想改声音,得去摆弄复杂的合成器。现在,这个助理不仅帮你秒找相似音效,还给你提供一个调音台——上面的旋钮不仅已经帮你调到了“听起来最像那么回事”的默认区间,还贴着小纸条告诉你“拧这个钮会让声音听起来更空旷”,你只需在此基础上微调即可,既省心又不会剥夺你的最终决定权。

4. 实验与结果

  • 数据集/基准:FSD50K(用于检索模型微调和消融实验)、KSFX合成数据集(用于特征重要性分析)。
  • 基线方法:ResNet18-IBN(音频嵌入模型消融对比基线)、Default Unoptimised(未优化的程序化合成基线)。
  • 主要实验结果
    1. 检索性能:MobileNetV3在FSD50K上的mAP达到0.449,NDCG达到0.656,优于ResNet18-IBN(mAP 0.412, NDCG 0.625),证明了轻量模型在音效检索中的有效性。
    2. 合成质量(MUSHRA主观评价):6个合成模型中有5个在优化后听觉质量有统计学显著提升(p<0.05)。但Explosion类别优化后得分反而下降(56.40降至52.55),Rocket未达显著水平(p=0.08),Jet因过于“塑料感”被排除在最终评估外。
    3. 用户评估:16位从业者中75%认为QuAP对工作流有帮助,100%的用户认为参数助手降低了程序化合成的门槛,同时保留了创意主导权
  • 消融实验揭示:在音效检索任务中,轻量级的MobileNetV3不仅计算效率更高,而且在检索准确度上也超过了常用于音乐翻唱/采样识别的ResNet18-IBN骨干网络。

5. 优势与局限

  • 主要优势
    1. 工作流整合:打破了检索与生成的壁垒,支持“搜出来的声音”和“合成的声音”直接混合叠加,减少了工具切换。
    2. 人机协同设计:参数助手提供白盒指导而非黑盒替代,降低了专业门槛的同时捍卫了设计师的创意控制权。
    3. 领域适配性:针对音效/环境音而非音乐进行模型优化,填补了现有音频AI工具在声音设计领域的空白。
  • 局限性
    1. 合成质量存在天花板:对于Rocket和Jet等类别,仅靠后处理效果优化无法弥补底层合成算法的不足,优化后仍显“合成感”。
    2. 覆盖范围有限:目前仅内置了6种音效合成模型(多为物理/减法合成),应用场景较为局限。
    3. 助手机制较静态:参数助手是基于规则的静态推荐,无法根据用户的实时反馈进行动态自适应调整。

6. 关键结论与启发

  • 最重要的Takeaway:在创意工具中,AI/智能系统的价值不在于“完美替代人类生成结果”,而在于“降低探索门槛并保留人类的最终决策权”。即使程序化合成的音质并非完美(MUSHRA得分仅处于“轻微相似”区间),只要能提供叙事适配性和混合叠加的基础,就具有实际工作流价值。
  • 对后续研究的启发
    1. 算法级优化与后处理的结合:未来的程序化音频优化不应仅停留在加EQ/混响等后处理层面,需要将感知特征重要性反馈深入到合成算法本身的参数调整中。
    2. 动态自适应助手:可以将当前的静态规则助手扩展为交互式、可根据用户偏好动态更新的智能体。
    3. 跨模态与更广覆盖:扩展程序化模型的类别,并探索从文本/视觉叙事概念直接驱动检索与合成的端到端工作流。
#18
eess.AScs.SD
Columbia University (QS Top 100)

Sympatheia: Emotionally Adaptive Voice Assistant with Continuous Affect Conditioning 跨领域

Sukru Samet Dindar, Riki Shimizu, Xilin Jiang, Nima Mesgarani
Sound (cs.SD); Computation and Language (cs.CL); Human-Computer Interaction (cs.HC); Machine Learning (cs.LG); Audio and Speech Processing (eess.AS)
查看摘要
Empathetic spoken dialogue systems must infer a user's emotional state to respond appropriately, yet everyday speech often carries weak, neutral, or ambiguous affective cues. To address this, we introduce Sympatheia, a speech-to-speech dialogue framework conditioned on affect inferred from the user's speech and, when available, explicit affect specifications provided as a continuous valence--arousal (VA) control signal by a multimodal sensing module or user interface. To train our model, we construct Sympatheia-18k, an emotion-conditioned synthetic spoken dialogue corpus with 12 emotion anchors. This dataset includes an emotional split for learning affective speech behavior, and a neutral split that pairs emotionally neutral queries with multiple emotion-conditioned responses to isolate explicit emotion control in emotionally ambiguous cases. Empirical results show that Sympatheia outperforms speech conversational baselines in generating responses whose semantic content and spoken delivery are both emotionally appropriate. We further show that the same VA interface can integrate emotion estimates from diverse sensing modules, including facial expression, biosignals, and textual affect descriptions, improving response alignment when speech alone provides limited emotional evidence. These results suggest that continuous affect conditioning is an effective practical step for building emotionally adaptive voice assistants.

📖 深度解读

1. 一句话总结

本文提出了SYMPATHEIA,一个通过连续的“效价-唤醒度(V-A)”信号来控制语音助手情绪的框架,解决了日常语音中情绪线索微弱或模糊时助手无法做出共情回应的问题。

2. 研究背景与动机

  • 核心问题:如何让语音助手在用户语音情绪微弱、中性或模棱两可时,依然能生成语义和语音语调都恰当的共情回应。
  • 重要性:随着语音助手向长期陪伴型角色转变,情绪对齐不仅能让交互更自然、减少误解,还能提供更好的心理安慰和参与感。如果回应情绪错位(比如用户悲伤时助手用欢快语气回答),会严重破坏交互体验。
  • 现有方法不足
    1. 过度依赖明显语音线索:现有系统多针对高强度的明显情绪设计,但日常语音往往含蓄、混合或中性,仅靠语音难以准确推断。
    2. 离散情绪标签的局限:传统方法多使用固定的离散情绪类别(如喜怒哀乐),这过于僵化,无法捕捉真实世界中渐变的、混合的、跨文化的复杂情绪。

3. 核心方法

  • 提出框架:SYMPATHEIA,一个端到端的语音对话框架。它既保留了从用户语音中隐式推断情绪的能力,又引入了一个可选的、连续的效价-唤醒度(V-A)接口作为显式控制信号。
  • 关键创新点
    1. 连续V-A情绪接口:将情绪表示为二维平面上的连续坐标,而非离散标签。12种基本情绪作为该平面上的“锚点”,模型因此能理解情绪的渐变、混合,并允许外部信号直接注入。
    2. 即插即用的多模态感知融合:V-A接口成为通用“插座”,可将面部表情、脑电/心电等生理信号、文本情绪描述等异构外部信号,通过概率加权映射统一转化为V-A坐标,无需修改对话主干模型。
    3. 对比式合成数据集构建:构建了SYMPATHEIA-18k数据集,特别设计了“中性分割”,将同一个中性提问与12种不同情绪的回应配对,强迫模型学会“用户没表现情绪时,听从外部V-A指令来调整回应”。
  • 核心思路直觉解释:就像一个经验丰富的倾听者,如果你声音里带着明显的喜怒,他能察觉并顺应;如果你面无表情、语气平淡,但他看到了你紧锁的眉头(外部视觉信号)或你手环测到的心跳加速(外部生理信号),他依然能给出恰当的安慰。SYMPATHEIA的V-A接口就是用来接收这些“旁证”的通用语言。

4. 实验与结果

  • 数据集/基准:自建的SYMPATHEIA-18k(含情感分割与中性分割),以及真实语音基准VoiceBench。
  • 基线方法:GLM-4-Voice, Qwen3-Omni, Qwen2.5-Omni, Kimi-Audio, OpenS2S, OSUM-EChat。
  • 主要实验结果
  • 共情评分:在用户语音中性但提供V-A条件的测试中,SYMPATHEIA得分4.37,远超最强基线Kimi-Audio的3.64;在人类评估中,其情绪MOS得分为3.86,同样位列第一。
  • 回应多样性:面对不同情绪提示,SYMPATHEIA生成的回应在语义和词汇相似度上最低,证明它确实在根据不同情绪改变回应内容,而非输出千篇一律的万能模板。
  • 韵律控制:SYMPATHEIA生成的语音基频、能量、语速等声学特征与目标V-A坐标的相关性最高(如唤醒度与基频标准差的相关系数达0.46),证明它不仅改了词,还改了“腔调”。
  • 消融实验揭示
  • 保留通用能力:微调后的模型在通用问答上的表现(语音质量、语义相似度、WER)不降反升,未牺牲基础对话能力。
  • V-A空间连续性:给V-A坐标添加高斯噪声后,模型表现逐渐下降而非崩溃,证明模型学到了连续的情绪空间,且对上游感知模块的估计误差有一定容忍度。

5. 优势与局限

  • 主要优势
    1. 解决长尾痛点:有效应对了日常交互中最常见但最难处理的“情绪模糊/中性”场景。
    2. 高度模块化与扩展性:解耦了情绪感知与对话生成,新增任何传感器只需映射到V-A平面,无需重训大模型。
    3. 细粒度控制:连续V-A表示比离散标签更能捕捉情绪的强度和混合状态。
  • 局限性
    1. 数据与评估的生态效度不足:训练和测试主要依赖合成数据与自动化评估(LLM-as-a-judge),能否在真实、自发、长程对话中维持共情尚未可知。
    2. V-A映射的非通用性:论文承认,将离散情绪映射为固定V-A坐标是一种启发式操作,缺乏跨文化、跨个体的普适性,无法完美表征复杂的混合情绪。
    3. 上游误差的级联风险:虽然模型对噪声有一定容忍,但如果外部传感器(如生理信号)持续提供严重错误或高度个体差异化的信号,仍会导致回应过度或不足。

6. 关键结论与启发

  • 最重要的Takeaway:将情绪作为连续变量(V-A)显式注入语音对话模型,并允许外部多模态信号接入,是构建实用型共情语音助手的关键且有效的一步。
  • 对后续研究的启发/延伸方向
    1. 个性化V-A校准:未来的系统应开发针对不同用户、文化背景的V-A空间动态校准机制,而非使用全局固定锚点。
    2. 时序情绪追踪:从单轮的静态V-A坐标扩展到多轮对话中的动态情绪轨迹跟踪,实现更连贯的情绪陪伴。
    3. 真实人机交互验证:亟需在真实的长期人机交互场景中,通过人类用户评估其对信任感、舒适度的实际影响,以及处理隐私和伦理问题的规范。
#19
eess.AS
Tsinghua University (QS Top 100, 985, 211)

PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects 跨领域

Sicheng Yang, Shulan Ruan, Shiwei Wu, Yu Liu, Lu Fan 等 (7 人)
Computation and Language (cs.CL); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: 19 pages, 13 figures, KDD 2026
查看摘要
While End-to-End (E2E) Speech-Large Language Models (Speech-LLMs) are rapidly evolving, their evaluation methodologies remain limited to the era of simple transcription. Existing benchmarks suffer from three critical limitations: a pronounced bias towards high-resource languages, a focus on low-level recognition (ASR) rather than semantic reasoning, and a neglect of regional dialects. To bridge this gap, we introduce PolySpeech-100, a massive-scale benchmark designed to assess `native-level' speech comprehension across 110 linguistic variants. We employ a novel hybrid construction pipeline that augments gold-standard human recordings with instruction-driven synthetic speech, allowing us to cover 19 distinct Chinese dialects and over 80 low-resource languages. Extensive evaluation of 22 state-of-the-art models (including Gemini-3, GPT-Audio, and Qwen2.5-Omni) yields pivotal insights. First, we demonstrate that open-source E2E models outperform Cascade (ASR+LLM) systems on heavy dialects, proving that direct audio processing preserves critical paralinguistic cues and prosodic features (e.g., intonation, stress) that are often lost in standard transcription. Second, we reveal a significant performance gap: while commercial models maintain robustness, open-source models suffer catastrophic degradation on low-resource languages. Finally, counter-intuitively, we observe that under standard zero-shot settings, Chain-of-Thought prompting frequently degrades speech understanding performance for most evaluated models, revealing a potential modality alignment gap in current architectures. PolySpeech-100 establishes a rigorous standard for the next generation of inclusive, omni-capable Speech-LLMs. The data, demo, and code are publicly available at this https URL .

📖 深度解读

1. 一句话总结

本文提出了一个覆盖110种语言和方言的大规模语音理解基准PolySpeech-100,通过“人工录音+指令驱动合成”的混合构建策略解决了方言和低资源语言的数据稀缺问题,并揭示了端到端模型在方言理解上的优势以及当前语音大模型在低资源语言和思维链推理上的严重缺陷。

2. 研究背景与动机

  • 核心问题:现有的语音大模型评估体系严重滞后,无法衡量模型在真实、多样化语言环境下的“母语级”理解能力。
  • 重要性:随着语音大模型向端到端架构演进,模型理论上能捕捉语调、重音等超越文本的副语言信息,但如果没有合适的基准,就无法验证这种优势,也无法推动模型向更具包容性的全球化应用发展。
  • 现有方法不足
    1. 高资源语言偏见:绝大多数基准只关注英语和标准普通话,忽视了世界上绝大多数语言。
    2. 任务层次浅:主要评估自动语音识别(ASR)等底层“听写”能力,而非深度的语义推理和内容理解。
    3. 忽视方言多样性:将语言视为单一整体(如统称“中文”或“阿拉伯语”),忽略了粤语、四川话、摩洛哥阿拉伯语等极具挑战性的地域方言。

3. 核心方法

  • 提出框架:PolySpeech-100基准数据集及其混合构建流水线。
  • 关键创新点
    1. 三轨数据聚合策略:针对不同资源级别的语言采用不同数据源——高资源语言用真实人工录音,中国方言用“改写+生成”的高保真合成,长尾低资源语言用神经网络TTS合成,兼顾了真实性与覆盖广度。
    2. “先改写后合成”的方言生成机制:利用LLM将标准文本转化为方言词汇(如普通话转粤语词汇),再通过支持指令控制的CosyVoice 3.0注入特定口音和语调,解决了方言数据极难采集的痛点。
    3. 多层级质量保证协议:通过物理完整性检查、ASR回环验证(防止合成出现严重幻觉或语义偏移)以及人工抽检,确保合成数据的有效性(与真实录音相关性达0.83)。
  • 核心思路直觉解释:就像为了考察一个人的外语听力,我们不能只让他听新闻播报,还得让他听懂带口音的市井对话。但请各地真人录音太贵了,于是我们用AI把标准剧本“翻译”成方言词汇,再请一个“AI配音演员”用当地口音读出来,最后用语音识别反查一遍确保没读错,以此来低成本地构建一个“巴别塔”式的听力考试题库。

4. 实验与结果

  • 数据集/基准:PolySpeech-100(包含110种语言变体,分为高资源语言、19种中国方言、81种低资源长尾语言三类),基于Belebele阅读理解数据集构建。
  • 对比基线:22个SOTA模型,包括闭源商业模型(Gemini-3, GPT-Audio-mini)、开源端到端模型(Qwen2.5-Omni, Fun-Audio-Chat等)以及级联系统(Whisper/Qwen3-ASR + LLM)。
  • 主要实验结果
    1. 整体表现:Gemini-3-flash一骑绝尘(85.30%),GPT-Audio-mini表现平庸(56.63%),部分缺乏系统提示词支持的开源模型(如Mini-Omni)准确率甚至低于25%的随机猜测基线。
    2. 方言理解:开源端到端模型(如Qwen2.5-Omni 78.61%)显著超越级联系统(Whisper-v3+Qwen2.5 62.62%)和GPT-Audio-mini(55.58%),证明直接处理音频能保留ASR转写中丢失的关键副语言线索。
    3. 低资源语言:开源模型遭遇灾难性崩溃(多在30-40%),而Gemini依然坚挺(84.61%),凸显了闭源与开源之间巨大的能力鸿沟。
  • 消融/深入分析揭示
    1. 鲁棒性:模型对方言特征的掌握并非过拟合,在加噪测试中表现稳定;但强噪声下高资源语言性能大幅下降。
    2. CoT(思维链)失效:反直觉地,在零样本设置下,CoT提示导致大多数模型性能下降(如Qwen2.5-Omni高资源语言降10.88%),表明当前语音模型存在模态对齐缺陷,强制文本推理会割裂音频特征。
    3. 音频上下文学习无效:3-shot示例不仅没带来显著提升,反而因长上下文导致部分模型“遗忘”问题,性能大幅下降。

5. 优势与局限

  • 主要优势
    1. 极致的语言覆盖:首次在语音理解基准中大规模引入细粒度方言和极低资源语言,填补了评估空白。
    2. 高扩展性的构建范式:验证了“指令驱动合成数据”可以作为真实人工录音的有效替代,为后续低资源语音评估提供了可复用的方法论。
    3. 深刻的洞察力:不仅比拼分数,更揭示了端到端优于级联的底层原因(副语言信息保留)以及CoT在语音模态的失效问题。
  • 局限性
    1. 合成数据的边界:尽管与真实数据相关性高,但合成语音仍可能缺乏真实世界中极度嘈杂的环境音、自发性的话语停顿和情感波动。
    2. 任务形式的局限:目前仅采用多项选择问答(MCQ)格式,无法评估开放域对话、全双工交互等更复杂的真实语音交互能力。
    3. 语言覆盖仍有盲区:如论文自身承认,仍遗漏了藏语及亚马逊、太平洋岛国的部分原住民语言。

6. 关键结论与启发

  • 最重要的Takeaway:文本是语音的“有损压缩”。对于重口音和方言,传统的“先转写再理解”级联范式存在信息瓶颈,端到端原生语音推理才是实现包容性语音理解的方向;同时,将文本LLM的推理技巧(如CoT)生搬硬套到语音模态会适得其反。
  • 对后续研究的启发
    1. 模态对齐机制需创新:当前模型在音频模态下无法有效进行CoT推理,未来需要设计专门针对“音频-推理”对齐的训练范式或架构,让模型学会“基于声音特征进行思考”。
    2. 低资源语音编码器亟待突破:开源模型在低资源语言上的崩溃表明,仅靠现有的音频编码器不够,需要探索更强大的多语言/跨语言自监督语音预训练方法。
    3. 评估标准升级:未来的语音基准应从“听写准确率”全面转向“听觉理解与推理”,并纳入情感、语速、全双工对话等更贴近真实社交场景的维度。
#20
eess.AScs.SD

A 1000-hour EEG-EMG-audio dataset of Japanese speech production 解读失败跨领域

Motoshige Sato, Ilya Horiguchi, Masakazu Inoue, Kenichi Tomeoka, Eri Hatakeyama 等 (9 人)
Neurons and Cognition (q-bio.NC); Human-Computer Interaction (cs.HC); Sound (cs.SD); Audio and Speech Processing (eess.AS); Signal Processing (eess.SP)
查看摘要
We present a multimodal dataset of 1020 hours of simultaneously recorded scalp electroencephalography (EEG), facial electromyography (EMG), and speech audio from three healthy native Japanese speakers during open-vocabulary overt speech. Recordings were acquired with three EEG systems-an ultra-high-density system ( this http URL ) and two cap-type systems ( this http URL and eegosports), spanning 62-128 channels-across many sessions over several months. Each session provides time-synchronized EEG, facial EMG, and audio, together with speech-event annotations and transcriptions. Although collected with speech decoding as a primary motivation, the dataset also supports work on multimodal signal processing, artifact modeling, longitudinal and cross-device adaptation, and EEG representation learning. Technical validation included power spectral density and event-related potential analyses across participants, devices, and tasks, which showed the expected 1/f spectral profile, task-related alpha-band attenuation, and time-locked evoked responses. The dataset is released in Brain Imaging Data Structure (BIDS) format via OpenNeuro under a CC0 waiver to support both speech-related and broader EEG research.

📖 深度解读

[PDF 下载失败,无法解读]

#21
eess.AScs.SD

A Lightweight Slot-Attention Framework for Multi-Instrument Multi-Pitch Estimation 跨领域

Michael Taenzer
Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: Preprint submitted to the IEEE 28th International Workshop on Multimedia Signal Processing (MMSP). This work has been submitted to the IEEE for possible publication. 6 pages, 2 figures
查看摘要
Multi-pitch estimation (MPE) typically predicts which pitches are active in a mixture, but not which instrument or source produced them. This paper investigates a lightweight slot-attention framework for multi-instrument MPE (MI-MPE), where a mixture CQT is mapped to an unordered set of source-like pitch maps. The model uses permutation-invariant Hungarian matching to avoid fixed output semantics and treats the number of slots as an upper bound on the number of active sources. We further study two modular extensions: a self-supervised timbre encoder that provides training-time targets for slot-level timbre embeddings, and a polyphony branch that regularizes the pitch density of mixture- and slot-level predictions. Experiments show that Hungarian matching substantially improves instrument family decomposition on URMP. Stem-level prediction remains more challenging: timbre and polyphony supervision improve selected configurations, but do not consistently resolve source assignment. The results suggest that slot-based architectures are a promising direction for source-aware MPE, while highlighting the need to couple auxiliary musical cues to slot identity more carefully.

📖 深度解读

1. 一句话总结

本文提出了一种轻量级的基于槽注意力机制的模型,将音乐混合音频分解为无序的声源级音高图,并通过匈牙利匹配、音色监督和复音数正则化来尝试解决多乐器多音高估计中的声源归属难题。

2. 研究背景与动机

  • 核心问题:传统的多音高估计(MPE)只能识别音频中有哪些音高被激活,却无法区分这些音高分别是由哪个乐器(声源)发出的,即缺乏“声源归属”能力。多乐器多音高估计(MI-MPE)要求模型同时完成声源发现、流分配和音符转录。
  • 重要性:这是实现全自动音乐转录(AMT)的关键一步,对于音频编辑、混音分离等下游任务至关重要。特别是在电子音乐中,声源往往不是传统的乐器类别,而是“主音、铺底音、贝斯”等角色,且角色可能在曲中变化,因此不能依赖固定的输出标签。
  • 现有方法不足:1) 现有MPE模型大多只在混合音频层面做预测,不区分声源;2) 依赖固定乐器标签的模型无法适应角色多变的电子音乐场景;3) 基于聚类的方法需要预先指定声源数量;4) 大型预训练模型计算开销大,且缺乏同时包含孤立音轨和可靠音高标注的开源数据集。

3. 核心方法

  • 提出框架:一个轻量级的Slot-based MI-MPE模型。输入混合音频的CQT(常数Q变换)特征,输出一组无序的、类似声源的音高激活图。
  • 关键创新点
    1. 置换不变的槽注意力机制:将输出视为一组无序的“槽”,每个槽负责解释混合音频中的一部分。槽的数量是声源数的上限,空闲槽会被抑制。通过匈牙利匹配在训练时动态分配预测槽与真实声源的对应关系,打破了固定输出语义的限制。
    2. 自监督音色编码器:在孤立音轨上自监督训练音色编码器,作为“教师”在训练时为槽提供音色嵌入目标。推理时不需要该编码器,保持模型轻量。其变体还通过FiLM机制用预测的音色嵌入去调制槽的音高解码器。
    3. 复音数分支:预测每帧同时发声的音高数量,在混合层面和槽层面提供辅助监督,约束模型预测出符合逻辑的声源音高密度。
  • 核心思路直觉解释:想象一个合唱团,传统方法只能听出当前时刻有哪些音高在响;本模型则派出K个“侦察兵”,每个侦察兵负责盯紧其中一个歌手。侦察兵之间会竞争(注意力竞争),确保不会多个人盯同一个歌手。匈牙利匹配就像是排练时的调度员,随机分配侦察兵去盯哪个歌手,只要盯上了就行,不要求特定编号。音色监督给侦察兵配备了“听音辨人”的参考书,复音数监督则告诉侦察兵“你盯的这个人最多只能同时唱几个音”,防止他们瞎猜。

4. 实验与结果

  • 数据集
  • URMP:原声乐器合奏数据集(传统乐器)。
  • mshoxxDB:电子音乐数据集(合成音色,极具挑战性)。
  • MusicNet:仅用于标准MPE基线测试。
  • 基线方法:论文主要进行了内部模块的渐进式消融对比(从标准MPE到家族级槽,再到音干级槽并加入音色和复音数),而非与外部大型SOTA模型比拼性能。
  • 主要实验结果
  • 匈牙利匹配至关重要:在URMP家族级预测中,使用匈牙利匹配(Exp 1c)相比固定槽顺序(Exp 1b),家族AP从24.00飙升至61.12,F1从33.91升至65.91,证明打破固定输出语义是声源分解的基础。
  • 音干级预测极具挑战:从家族级细化到具体音干级时,性能大幅下降。
  • 音色与复音数的增益不稳定:在URMP上,FiLM音色调制(Exp 2b)和槽级复音数监督(Exp 3c)能稳步提升音干级F1(从33.78提升至42.60);但在更复杂的mshoxxDB上,这些辅助模块虽然有时能提升某项指标(如Exp 2b的stem AP从9.31升至19.81),但整体表现波动,未能一致地解决声源分配问题。
  • 消融实验揭示:辅助任务(音色/复音数)与槽分解之间存在耦合冲突。例如,音色监督可能改善了槽嵌入的对齐,但并未真正改善对应的音高掩码预测;加入复音数分支但不加监督损失甚至有害。

5. 优势与局限

  • 主要优势
    1. 轻量且灵活:模型参数量仅约130万~168万,无需CPU/GPU即可快速训练,且不依赖大型预训练模型。
    2. 摆脱固定语义束缚:置换不变的槽机制非常适合声源角色不固定、数量动态变化的真实音乐场景(尤其是电子乐)。
    3. 推理轻量:音色编码器仅在训练时作为教师使用,推理时无额外开销。
  • 局限性
    1. 声源分配仍未妥善解决:论文声称音色和复音数能提供辅助线索,但实验表明它们不能一致地改善声源归属,有时甚至会损害全局音高预测,说明辅助信号与槽身份的耦合方式仍需优化。
    2. 基线性能偏弱:标准MPE基线在MusicNet上的AP仅为60.31,远低于现有SOTA的75左右,这限制了其作为实际应用基础的可行性。
    3. 数据集规模受限:由于缺乏大规模带孤立音轨和音高标注的开放数据集,模型能力可能未被充分挖掘。

6. 关键结论与启发

  • 最重要的Takeaway:基于槽的架构是解决声源感知MPE(MI-MPE)的极具潜力的方向,但必须使用置换不变匹配(如匈牙利匹配)来处理槽的模糊性;此外,仅仅给槽添加音色或复音数等辅助预测头是不够的,如何将这些音乐线索更深度、更解耦地绑定到槽的身份上,是未来必须解决的痛点。
  • 对后续研究的启发/延伸方向
    1. 解耦辅助线索:未来的音色信息不应仅仅作为预测目标或简单的解码器调制,而应探索更解耦的方式(如作为强先验约束)来稳定槽的身份。
    2. 动态槽分配:当前槽数量是固定的上限,未来可研究自适应槽分配机制,以及更强的重复声源抑制策略。
    3. 时变音色建模:考虑到延音、混响等效果,音色在时间维度上是变化的,静态的音色嵌入可能不足以指导帧级别的声源分配。
    4. 规模扩展:在Slakh2100等更大规模数据集上验证该轻量框架的泛化能力。
#22
eess.AS
University of Washington (QS Top 100)

MURMUR: An Efficient Inference System for Long-Form ASR 跨领域

Wei-Tzu Lee, Keisuke Kamahori, Baris Kasikci
Machine Learning (cs.LG); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
查看摘要
Long-form automatic speech recognition (ASR) requires both high accuracy and low latency, but existing systems force a trade-off between the two. Chunk-based pipelines process audio in parallel windows for low latency, but lose cross-chunk context and need brittle heuristics to align speakers and timestamps at boundaries. Long-context ASR models resolve everything in a single pass for better accuracy, but are an order of magnitude slower. We propose Murmur, an inference system that overcomes this trade-off by operating at two levels. At the inter-chunk level, we revisit the chunk-based pipeline for modern long-context ASR, treating chunk size as a tunable hyperparameter, and show that intermediate chunk sizes strike a good balance of accuracy and latency. At the intra-chunk level, we exploit attention sparsity through a sliding window KV cache eviction policy applied to both output and speech tokens. On AMI-IHM, Murmur matches single-pass accuracy while reducing latency by 4.2x, with further gains from token eviction at less than 1% relative tcpWER degradation. The code of Murmur is available at this https URL .

📖 深度解读

1. 一句话总结

MURMUR通过将长音频切分为中等长度的分块并行处理,并在块内利用注意力稀疏性剔除无关的KV缓存,在保持长文本语音识别高精度的同时,大幅降低了推理延迟。

2. 研究背景与动机

  • 核心问题:长文本自动语音识别(ASR)难以同时实现高精度和低延迟。
  • 重要性:会议、讲座等真实场景动辄数十分钟到数小时,高效的长音频转写是语音技术落地的关键。
  • 现有方法不足
    1. 基于分块的系统(如WhisperX):将音频切成30秒小段并行处理,延迟低;但丢失了跨段上下文,导致说话人归属和时间戳在边界处对齐困难,且依赖脆弱的启发式规则进行拼接,误差累积严重。
    2. 长上下文单次推理模型(如VibeVoice-ASR):一次性处理整段音频,精度高且原生输出时间戳和说话人标签;但自回归解码极慢(延迟是分块法的10倍),且面临“重复循环”的灾难性故障(一段出错,整段作废)。

3. 核心方法

  • 提出框架:MURMUR,一个针对长上下文ASR模型的双层优化推理系统。
  • 关键创新点
    1. 将分块大小视为可调超参:打破传统30秒的硬性限制,发现300秒是精度与延迟的“甜点”。
    2. 语音Token的延迟-滑动窗口驱逐策略:针对语音Token独特的对角线注意力模式,设计专门的KV缓存淘汰机制。
    3. 跨块说话人重对齐:不盲从外部说话人日志结果,而是以模型块内预测为准,仅用外部结果对齐跨块的说话人身份。
  • 核心思路直觉解释
  • 分块策略(间奏):就像读书一样,30秒的切片像是一字一字看,缺乏全局观;而一口气看一小时又容易走神且耗时。MURMUR发现每次看5分钟(300秒)刚刚好,既有足够的上下文弄清谁在说话,又能分批并行处理节省时间。
  • 缓存驱逐(内化):在生成5分钟转写文本时,模型不需要时刻回顾所有的声音片段。就像你边听边记笔记,听到第4分钟时,第1分钟的大部分声音细节已经不再影响你当下的书写了。MURMUR通过滑动窗口把那些“已被遗忘”的语音Token从内存(KV缓存)中踢出去,只保留近期和关键的Token,从而大幅加速注意力计算。

4. 实验与结果

  • 数据集:AMI-IHM(近场干净语音)、AMI-SDM(远场噪声语音)、Tedlium3(演讲)、Earnings21(电话会议)。
  • 基线方法:WhisperX(分块代表)、VibeVoice-ASR单次推理(长上下文代表)。
  • 主要实验结果
  • 在AMI-IHM上,MURMUR匹配了单次推理的精度(tcpWER 25.29% vs 25.68%),但延迟降低了4.2倍(88.4s vs 370.7s)。
  • 相比WhisperX,MURMUR在时间戳与说话人对齐的指标(tcpWER)上具有压倒性优势(25.29% vs 35.54%)。
  • 单次推理在远场(SDM)数据上极易触发“重复循环”导致整段崩溃,而MURMUR的分块机制将故障隔离在单个块内,鲁棒性远超单次推理。
  • 消融实验揭示
  • 分块大小:干净音频在较短分块时精度即饱和,噪声音频更依赖长上下文,但过长反而因声学混淆导致精度下降,300秒是普适的最优解。
  • KV缓存驱逐:仅驱逐输出文本Token(3.85×加速),仅驱逐语音Token(4.20×加速),两者结合反而因管理开销叠加导致加速比略降(3.85×)。语音Token驱逐虽然只带来 modest 的加速,但证明了超过75%的语音Token在解码时确实不被需要。

5. 优势与局限

  • 主要优势
    1. 打破精度-延迟权衡:成功结合了分块系统的高效和长上下文系统的精度。
    2. 系统鲁棒性强:有效规避了长文本自回归模型致命的“重复循环”问题,将灾难性故障局部化。
    3. 无需复杂后处理:无需依赖外部脆弱的强制对齐和说话人日志模块,端到端输出结果。
  • 局限性
    1. 适用模型范围窄:目前仅适用于原生支持输出时间戳和说话人标签的长上下文ASR模型(如VibeVoice-ASR),无法直接应用于传统架构(如Whisper)。
    2. 语音驱逐策略较粗糙:固定的滑动窗口无法精准识别哪些Token是安全的,更细粒度的窗口会损害精度,说明简单的位置策略无法捕捉非连续的可驱逐Token。
    3. 语言单一:实验仅在英语数据集上进行,不同语言的韵律和句法结构可能影响最优分块大小和注意力稀疏性。

6. 关键结论与启发

  • 最重要的Takeaway:语音识别存在一个明确且比文本更短的“最优上下文长度”(本文为300秒),过长不仅无益,反而会因声学噪声累积和说话人复杂度增加而损害性能;适度分块+内部稀疏化是长音频推理的最优解。
  • 后续研究启发
    1. 自适应/感知内容的驱逐策略:未来可探索基于Query感知或声学特征引导的语音Token自适应驱逐,替代当前的固定滑动窗口,以进一步挖掘稀疏性潜力。
    2. 分块大小的动态调整:可根据音频的声学复杂度(信噪比、说话人数量)动态调整分块大小,干净音频切短些,嘈杂音频切长些。
    3. 跨模型架构验证:随着更多端到端长上下文语音大模型的出现,验证这种“中等分块+KV驱逐”范式的普适性。
#23
eess.AScs.SD

Echo: A Joint-Embedding Predictive Architecture for Speaker Diarization and Speech Recognition in a Shared Latent Space 跨领域

Louis Mouchon
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: 18 pages, 17 tables, 1 figure. Proof-of-concept, independent research
查看摘要
We present Echo, a proof-of-concept audio system built around a single 25 M-parameter ViT encoder. The encoder is pretrained with a JEPA objective and then specialised by stages to carry speaker identity, phonetic content, and dynamic source routing in the same 512-dimensional latent space, with no per-task fine-tuning at deployment. Light heads handle diarization (ArcFace + VBx) and dynamic source separation (null-target K-set prediction). On synthetic VoxCeleb2 mixtures with unknown K, the canonical stack reaches 15.00% blind DER, 97.80% PIT separation accuracy with +9.52 dB latent SI-SDR, and a +53.50-point speaker/content factorisation gap on a held-out k-NN probe. The point of Echo is not a new SOTA on any single task but the joint coexistence of three tasks on one encoder at this footprint. We document the design stage by stage, report the dead-ends, and identify the structural wall on end-to-end ASR through the VQ bottleneck that still bounds the PoC.

📖 深度解读

1. 一句话总结

本文提出了Echo,一个仅25M参数的单编码器音频系统,通过分阶段注入和联合嵌入预测架构(JEPA)锚点机制,在同一个共享潜空间中同时实现了说话人日志、语音分离和内容识别,且部署时无需针对特定任务微调。

2. 研究背景与动机

  • 核心问题:如何在一个单一的音频编码器的共享潜空间中,同时承载说话人身份、语音内容和动态说话人路由这三种截然不同的信号,且在推理时不需针对不同任务切换模型。
  • 重要性:传统的语音系统通常是“碎片化”的——说话人日志和语音识别(ASR)使用完全独立的模型栈,这不仅增加了部署的内存和计算开销,还导致各模块的失败模式无法互通。如果能用一个模型同时搞定“谁在什么时候说了什么”,将极大降低边缘设备上的部署成本。
  • 现有方法不足:现有的自监督学习骨干(如wav2vec 2.0, HuBERT等)虽然强大,但必须针对特定任务微调,无法在不破坏其他任务表现的前提下同时复用同一潜空间;而现有的联合系统(如EEND-SS, TS-SEP)则依赖多个专用子网络或条件路径,并非真正的“单编码器共享空间”。

3. 核心方法

  • 提出框架:Echo,基于8层ViT(25M参数)和7阶段渐进式训练流水线。
  • 关键创新点
    1. 永久JEPA锚点机制:在后续每个涉及编码器更新的训练阶段,都保留上一阶段的教师模型作为“锚点”计算JEPA损失,防止编码器在学习新任务(如语音内容)时灾难性遗忘旧任务(如说话人身份)。
    2. VQ瓶颈实现结构化解耦:用256个码本的向量量化(VQ)瓶颈替代传统的对抗性分类器来分离内容和说话人。直觉上,离散的VQ码本容量有限,无法承载连续的音色信息,从而“物理上”逼迫说话人信息只能从$W_s$通道走,实现了高达53.5个百分点的解耦间隙。
    3. Null-target动态K路由:在分离头设置3个槽位,并引入一个可学习的“静音目标”。推理时,如果某个槽位与静音目标的余弦相似度高于阈值,则判定为空槽,从而无需外部VAD即可动态支持1到3个说话人的混合音频。
  • 核心思路直觉解释:就像在一个大礼堂里,Echo先学会辨认不同人的脸(JEPA预训练),然后在不忘记长相的前提下学会读唇语(CTC注入锚点保护),接着给每个人发不同颜色的帽子(VQ瓶颈逼迫身份和内容分流),最后训练一个调度员,根据现场人数灵活指派座位(Null-target路由),整个过程始终共用同一个大脑(编码器)。

4. 实验与结果

  • 数据集/基准:合成VoxCeleb2混合音频(1-3人),LibriSpeech-clean-100。
  • 基线方法:对比了历史变体(强对抗解耦、多锚点等),以及外部专用系统(EEND-EDA, pyannote 3.1)作为量级参考。
  • 主要实验结果
  • 说话人/内容解耦:因子化间隙达到+53.50个百分点(内容通道的说话人信息泄露从36%降至5%)。
  • 语音分离:在2人混合下,PIT准确率达97.80%(MSE打分),潜空间SI-SDR为+9.52 dB;动态K路由准确率94.4%。
  • 说话人日志:在未知说话人数量(盲K)下,DER为15.00%;端到端流水线可精确恢复K=2.00。
  • 模型体积:仅日志配置仅需25.3M参数(50MB bf16),完全自包含。
  • 消融实验揭示
  • 去除JEPA锚点会导致说话人几何结构被彻底破坏;
  • VQ瓶颈比对抗分类器在解耦上有效得多(+27.8点间隙提升);
  • 多重监督损失叠加在单编码器上会过度约束,导致PIT准确率暴跌至80.20%,单一阶段单一监督是最佳实践;
  • VBx聚类前对嵌入进行逐句Z-score标准化至关重要,否则聚类会崩溃。

5. 优势与局限

  • 主要优势
    1. 极致的参数共享:首次在单一编码器的同一潜空间中无需微调即可同时承载日志、分离和内容三个任务,部署成本极低。
    2. 优雅的解耦机制:利用VQ的离散性天然阻断身份信息泄露,比对抗训练更稳定、效果更好。
    3. 动态灵活性:Null-target设计使得模型能自适应未知说话人数量,无需外部VAD辅助。
  • 局限性
    1. ASR结构性墙:经过VQ瓶颈后,帧级语音细节被破坏,端到端CTC解码遭遇结构墙(CER高达70%),目前只能输出“语音结构的胡言乱语”,无法真正做ASR。
    2. 合成到真实的泛化鸿沟:在真实长录音中,由于$W_s$对音高具有不变性,同一说话人的语调变化会被误判为不同说话人,导致VBx严重过度分割。
    3. 模型规模较小:目前仅为25M参数的PoC,在单一任务指标上无法与大型专用SOTA模型抗衡。

6. 关键结论与启发

  • 最重要的Takeaway:自监督的JEPA骨干网络配合“永久锚点”的渐进式训练策略,可以在单一潜空间中叠加多种截然不同的信号模态,且互不破坏。多任务共存不一定需要复杂的网络分支,关键在于训练阶段的正则化约束和结构化瓶颈设计。
  • 后续启发与延伸方向
    1. 突破ASR瓶颈:用有限标量量化(FSQ)替代VQ,或让CTC直接在量化前的连续表征$z_e$上训练,以保留帧级语音分辨率。
    2. 解决音高不变性带来的过度分割:探索音高条件化的$W_s$或在真实会议数据上重拟合PLDA,以缩小合成到真实的泛化鸿沟。
    3. 规模扩展:将当前的8层ViT扩展到24层(如WavLM-Large级别),验证JEPA锚点和Null-target路由机制在更大模型上的Scale-up能力。
#24
eess.AScs.SD

DiffAU: Diffusion-Based Ambisonics Upscaling 跨领域

Amit Milstein, Nir Shlezinger, Boaz Rafaely
Audio and Speech Processing (eess.AS); Sound (cs.SD); Signal Processing (eess.SP)
查看摘要
Spatial audio enhances immersion by reproducing 3D sound fields, with Ambisonics offering a scalable format for this purpose. While first-order Ambisonics (FOA) notably facilitates hardware-efficient acquisition and storage of sound fields as compared to high-order Ambisonics (HOA), its low spatial resolution limits realism, highlighting the need for Ambisonics upscaling (AU) as an approach for increasing the order of Ambisonics signals. In this work we propose DiffAU, a cascaded AU method that leverages recent developments in diffusion models combined with novel adaptation to spatial audio to generate 3rd order Ambisonics from FOA. By learning data distributions, DiffAU provides a principled approach that rapidly and reliably reproduces HOA in various settings. Experiments in anechoic conditions with multiple speakers, show strong objective and perceptual performance.

📖 深度解读

1. 一句话总结

本文提出了DiffAU,一种基于级联扩散模型的空间音频升阶方法,通过将一阶Ambisonics(FOA)条件化为输入,逐步生成高阶(三阶)Ambisonics(HOA),从而在无需昂贵麦克风阵列的情况下显著提升了3D声场的空间分辨率。

2. 研究背景与动机

  • 核心问题:如何将低空间分辨率的一阶Ambisonics(FOA,4通道)上采样为高空间分辨率的高阶Ambisonics(HOA,更多通道),即Ambisonics升阶(AU)问题。
  • 重要性:HOA能提供更逼真的3D沉浸式音频体验(广泛应用于VR/AR、游戏等),但直接采集HOA需要庞大且昂贵的麦克风阵列;而FOA硬件成本低,但空间分辨率差。AU技术能以低成本实现高质量空间音频。
  • 现有方法不足
    1. 基于模型的方法(如压缩感知PWD-CS):依赖声场稀疏性假设,在多声源或非理想声学环境下性能急剧下降。
    2. 基于数据驱动的深度学习方法(如Conv-TasNet):虽然摆脱了稀疏性假设,但属于确定性映射,缺乏对高阶系数后验分布的建模能力,导致生成的高阶音频与真实HOA在听感上仍有差距。

3. 核心方法

  • 提出框架:DiffAU,一个基于条件扩散模型的级联空间音频升阶框架。
  • 关键创新点
    1. 将AU建模为条件生成问题:把欠定的AU逆问题转化为从后验分布 $p(\text{HOA}|\text{FOA})$ 中采样的问题,利用扩散模型的概率特性提供物理合理的解,避免了硬性的稀疏先验。
    2. 级联式逐阶升采样:不直接从1阶跳到3阶,而是设计两个级联的扩散模块(1阶→2阶,2阶→3阶),每个模块只预测新增的通道。这种模块化设计便于训练、解释,且可灵活扩展至任意阶数。
    3. 针对空间音频的数据表征:将时域信号转为频域(STFT),并引入非线性幅度变换 $H(x)$ 归一化动态范围,再将复数拆分为实部虚部拼接,以适配深度网络输入。
  • 核心思路直觉解释:想象你要把一张模糊的360度全景图变清晰。传统方法要么假设图里只有几个点(稀疏先验),要么用黑盒直接硬猜。DiffAU的做法是:先给你模糊的底图(FOA),然后像画家叠色一样,先画好2阶的细节,再在2阶的基础上画3阶的细节。在这个过程中,扩散模型就像一个有经验的画家,知道在给定底图的情况下,合理的细节应该长什么样,从而一步步“去噪”出逼真的高分辨率声场。

4. 实验与结果

  • 数据集:基于WSJ0语料库构建的自由场(无混响)数据集,包含1到4个说话人的混合声场,生成对应的三阶Ambisonics。
  • 基线方法
    1. PWD-CS:基于压缩感知的传统模型方法。
    2. Conv-TasNet AU:基于波形域的确定性深度学习方法。
  • 主要实验结果
  • 客观指标(STFT-SDR):DiffAU全面超越基线。在总体平均上,DiffAU达到 24.7 dB,而Conv-TasNet为14.0 dB,PWD-CS为12.6 dB。即便在传统方法最擅长的单说话人场景(满足稀疏性),DiffAU(29.5 dB)仍大幅领先。
  • 随着说话人数量增加(稀疏性被破坏),基线方法性能骤降,而DiffAU表现出更强的鲁棒性(4人时仍保持19.6 dB)。
  • 主观听感测试(MUSHRA)
  • DiffAU生成的3阶信号得分(79.0)与真实的3阶信号得分(78.4)在统计学上无显著差异(p=1.0),而1阶锚点仅为21.8。这表明DiffAU在感知上已接近真实HOA。
  • 消融实验:论文未在正文中展示独立的消融实验部分,但通过方向能量图展示了DiffAU恢复的空间能量分布与Ground Truth高度吻合。

5. 优势与局限

  • 主要优势
    1. 概率生成优势:通过学习数据分布解决了AU的病态逆问题,不再依赖脆弱的稀疏假设,多声源下鲁棒性强。
    2. 听感极佳:主观听感测试证明其生成的音频质量与真实高阶麦克风采集的信号无异。
    3. 架构灵活:级联设计使得模型可以逐阶训练,且理论上可扩展至任意目标阶数。
  • 局限性
    1. 环境局限:目前仅在自由场(无噪声、无混响)条件下验证,距离真实世界的复杂声学环境还有差距。
    2. 生成效率:扩散模型需要多步迭代采样(文中提及每个模块30步预测+30步校正),推理速度可能受限,难以满足极低延迟的实时应用。

6. 关键结论与启发

  • 最重要的Takeaway:将空间音频升阶视为一个条件生成问题,利用扩散模型从数据分布中采样,是突破传统物理先验和确定性映射瓶颈的有效且极具潜力的途径。
  • 对后续研究的启发
    1. 向真实场景拓展:下一步必然是将DiffAU引入噪声和混响环境,可能需要在扩散过程中引入物理约束或结合房间声学模型。
    2. 实时化改进:可以探索一致性模型或扩散模型加速采样技术,以实现实时Ambisonics升阶。
    3. 跨模态条件生成:既然可以以FOA为条件生成HOA,未来是否可以以文本、视频或单通道音频为条件直接生成3D空间音频?这为空间音频生成打开了新的想象空间。
#25
eess.AScs.SD
Google (World Famous IT Company)

Systematic Evaluation of Time-Frequency Features for Binaural Sound Source Localization 跨领域

Davoud Shariat Panah, Alessandro Ragano, Dan Barry, Jan Skoglund, Andrew Hines
Audio and Speech Processing (eess.AS); Machine Learning (cs.LG); Sound (cs.SD)
Comments: Accepted at EUSIPCO 2026
查看摘要
This study presents a systematic evaluation of time-frequency feature design for binaural sound source localization (SSL), focusing on how feature selection influences model performance across diverse conditions. We investigate the performance of a convolutional neural network (CNN) model using various combinations of amplitude-based features (magnitude spectrogram, interaural level difference - ILD) and phase-based features (phase spectrogram, interaural phase difference - IPD). Evaluations on in-domain and out-of-domain data with mismatched head-related transfer functions (HRTFs) reveal that carefully chosen feature combinations often outperform increases in model complexity. While two-feature sets such as ILD + IPD are sufficient for in-domain SSL, generalization to diverse content requires richer inputs combining channel spectrograms with both ILD and IPD. Using the optimal feature sets, our low-complexity CNN model achieves competitive performance. Our findings underscore the importance of feature design in binaural SSL and provide practical guidance for both domain-specific and general-purpose localization.

📖 深度解读

1. 一句话总结

这篇论文系统评估了双耳声源定位中的时频特征组合,证明了“精心的特征设计”比“堆叠复杂的模型”更能提升定位性能,并找出了应对不同场景的最优特征组合。

2. 研究背景与动机

  • 核心问题:在双耳声源定位(SSL)任务中,输入特征的选择(如幅度谱、相位谱、双耳级差ILD、双耳相位差IPD)如何影响模型的定位精度和泛化能力?
  • 重要性:准确的声源定位是虚拟现实、听觉场景分析和机器人等应用的基础。而特征表示直接决定了模型提取空间线索的能力,在噪声和混响环境下的鲁棒性,以及跨环境的泛化性。
  • 现有不足:尽管深度学习在SSL上取得了进展,但以往研究对输入特征的选取较为随意,缺乏系统性的对比实验。唯一的相关研究使用的是四麦克风阵列数据,且仅限于两两特征组合,未探索更丰富的特征集,其结论也无法直接推广到双耳音频场景。

3. 核心方法

  • 提出框架:使用一个轻量级的CNN模型作为“探针”,控制模型复杂度变量,纯粹评估4种基础特征及其组合(最多4种)对SSL的影响。
  • 关键创新点
    1. 首次系统性的双耳特征消融:全面对比了幅度类(Mag, ILD)和相位类(Phase, IPD)特征的单体及组合效果,突破了以往仅用单一或固定组合的局限。
    2. 跨域与HRTF不匹配评估:通过引入训练集未见过的声音内容(自然声、合成声)和未见过的头相关传递函数(HRTF),严苛测试特征的泛化能力。
    3. 回归任务与连续角度预测:不同于以往将方位角离散化为分类任务的模型,本文采用考虑角度周期性的MSE损失进行连续回归预测,理论上能实现高于5°分辨率的精度。
  • 核心思路直觉解释:就像人类靠两只耳朵听声辨位,低频主要靠耳朵的“时间/相位差”(IPD),高频主要靠“音量差”(ILD)。如果只给模型看其中一种,它就是个“偏科生”;如果只给它听过的语音,它靠死记硬背也能蒙对。但要想让模型在遇到没听过的奇怪声音(如纯噪音)时依然能找准方向,就必须把原始的声谱图(提供声音本底结构)和双耳差异(ILD+IPD,提供明确空间线索)结合起来,给它最全面的“参考书”。

4. 实验与结果

  • 数据集
  • 训练/验证集:基于SADIE II数据库和TSP语音合成。
  • 域内测试集:TSP-SSL(纯语音,HRTF不匹配)。
  • 域外测试集:SynBAD-Var / SynBAD-Fix(包含粉红噪声、响板、纯音等多样化内容,HRTF不匹配)。
  • 基线方法:FA ViT, AMViT, BAST-MAMBA(均为近年基于Transformer的模型)。
  • 主要实验结果
  • 域内(语音):简单的双特征组合 ILD + IPD 即可达到最优(水平面MAE 4.5°),增加特征无显著收益。
  • 域外(多样内容):三特征组合 Phase L/R + ILD + IPD 表现最佳(水平面MAE 8.4°),比仅用ILD+IPD(10.7°)提升显著。对于无结构的宽带噪声,单靠声谱图定位误差高达125°,而加入ILD+IPD后骤降至10°以内。
  • 模型对比:本文的轻量级CNN(0.1M参数)在域外测试集上(MAE 8.4°)大幅击败了参数量大得多的BAST-MAMBA(26M参数,13.2°)和FA ViT(0.6M参数,26.1°)。仅在域内语音上略逊于FA ViT(4.5° vs 2.7°)。
  • 消融实验揭示
  • 单特征不足以胜任定位;双耳差异特征(ILD/IPD)比单耳原始声谱图更具空间鲁棒性。
  • 混响在某些情况下反而有助于定位(为原本缺乏结构的信号提供了时间/频谱结构)。
  • 纯音(Pure Tone)是所有特征的噩梦,符合心理声学中单一正弦波造成定位模糊的常识。

5. 优势与局限

  • 主要优势
    1. 以小博大:用仅0.1M参数的极简模型,通过特征工程在跨域泛化上击败了26M参数的复杂Transformer,极具工程指导价值。
    2. 结论清晰实用:为社区提供了明确的特征选择指南——如果只做特定语音定位用ILD+IPD,如果做通用声源定位用Phase L/R + ILD + IPD。
    3. 开源贡献:公开了代码和数据集,为双耳SSL提供了可复现的基准。
  • 局限性
    1. 模型架构单一:仅用CNN作为测试床,未验证这些最优特征组合在CRNN或Transformer上是否还能带来同等幅度的性能跃升(尽管论文声称复杂模型不如好特征,但缺乏“好特征+复杂模型”的实验数据支撑)。
    2. 任务场景受限:目前仅验证了单声源定位,未涉及更复杂、更贴近真实场景的多声源重叠情况。
    3. 纯音困境未解:实验指出了纯音定位极差的问题,但并未提出针对性的特征改进方案。

6. 关键结论与启发

  • 最重要的Takeaway:在双耳声源定位中,“喂什么数据”比“用什么模型”更重要。精心设计的互补特征组合带来的收益,远超单纯增加模型参数和复杂度。
  • 对后续研究的启发
    1. 特征与架构的协同探索:既然找到了最优特征集(Phase L/R + ILD + IPD),下一步应将其引入更强大的架构(如注意力机制网络),验证是否能进一步逼近定位极限。
    2. 针对困难样本的特征增强:针对纯音等缺乏空间线索的信号,可探索引入动态头部转动补偿或更高级的频域-空域联合表征来破解定位模糊。
    3. 向多源与真实场景拓展:当前的单源结论能否平移到多声源定位与检测(SELD)任务中,是未来极具价值的探索方向。
#26
eess.AScs.SD

FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation 跨领域

Junseok Lee, Sangyong Lee, Chang-Jae Chun
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Sound (cs.SD)
Comments: Title updated
查看摘要
Scaling Multimodal Large Language Models (MLLMs) to long-form speech is bottlenecked by the explosive growth of input tokens. Unlike images or videos, audio lacks overlapping information, making extreme 1-token compression highly susceptible to the loss of fine-grained acoustic cues. To overcome this, we propose FastSLM, a token-efficient architecture featuring the Hierarchical Temporal Abstractor (HTA). HTA progressively distills non-overlapping acoustic features across multiple temporal scales, achieving an extreme compression rate of 1.67 tokens per second a 97% reduction without losing critical context. Experimental results show that FastSLM achieves competitive performance with state-of-the-art models on long-form benchmarks despite operating with significantly fewer FLOPs and parameters. The source code and model checkpoints are available at this https URL .

📖 深度解读

1. 一句话总结

本文提出了一种名为FastSLM的语音大语言模型架构,通过分层时间抽象器(HTA)将长语音极度压缩至每秒1.67个Token(减少97%),在保留细粒度声学特征的同时,解决了长语音输入导致的计算爆炸问题。

2. 研究背景与动机

  • 核心问题:如何将多分钟甚至小时级的“长语音”高效地输入到大语言模型(LLM)中进行理解与推理。
  • 重要性:语音是人机交互的主要接口,但现有的语音大模型(ALM)主要针对短语音(<60秒)设计,难以处理长语音任务(如长语音摘要、长语音问答)。
  • 现有方法不足
    1. 计算爆炸:传统方法将语音编码器的密集帧级特征直接输入LLM,导致序列极长,自回归计算的二次方复杂度让人无法承受。
    2. 扁平压缩的灾难性信息丢失:图像/视频有大量空间冗余,压缩容易;但语音是时序连续且无重叠的,如果采用简单的平均池化或单阶段查询压缩,会直接抹除音素、语调等对理解至关重要的细粒度声学线索,导致严重的“上下文-粒度”权衡困境。

3. 核心方法

  • 提出框架:FastSLM,核心包含分层时间抽象器(HTA)和三阶段训练策略。
  • 关键创新点
    1. 声学到语义的相变框架:不把语音压缩看作单纯的“降采样”,而是模拟人类认知——从底层的音素感知,逐步过渡到高层的语义理解。
    2. 分层时间抽象器(HTA):通过三阶段逐步压缩,实现极端压缩率(1.67 tokens/sec)且不丢失关键细节。
    3. 细节恢复机制:在极度压缩后,让压缩后的语义Token反向关注原始的多尺度声学特征,找回可能丢失的细粒度线索(如语调、说话人身份)。
    4. 数据高效的三阶段训练:仅利用易获取的ASR数据集进行长语音对齐,绕开了昂贵且稀缺的长上下文指令微调数据的依赖。
  • 核心思路直觉解释
  • HTA就像“做会议纪要”:第一阶段(局部提取)像速记员,记下每个发音细节;第二阶段(时间聚合)像提炼段落大意,过滤掉停顿和废话;第三阶段(语义抽象)像总结核心思想。最后用极少的字(1.67字/秒)概括整场会议。
  • 细节恢复就像“查录音回放”:虽然最终给老板(LLM)看的是极度精简的纪要,但纪要里暗藏了“索引”,如果老板对某处有疑问,可以瞬间调取当时的原始录音片段核对,确保不丢细节。

4. 实验与结果

  • 数据集/基准:涵盖英语和韩语的ASR(OpenASR, Fleurs等)、AST(Fleurs, Minds14)、SSUM(SDS-PART6, KMSS)、SQQA(LibriSQA, KorQuAD-speech)。
  • 对比基线:WhisperV3, Qwen2-Audio, Phi-4-MM, Voxtral-Mini, Gemini-2.5-Flash,以及平均池化、窗口级/段级抽象器(WTA/STA)。
  • 主要实验结果
    1. 极致压缩与效率:HTA将Token率压至1.67 tokens/sec,相比平均池化(25 tokens/sec),LLM的FLOPs降低了92%(30.6T → 2.15T)。
    2. 性能比肩SOTA:在韩语ASR取得SOTA(CER 3.82),在英韩语音问答(SQQA)取得SOTA(69.5%和64.9%),在语音翻译和摘要上与参数量更大的模型表现相当,但每30秒语音仅需50个Token(Whisper需1500个)。
    3. 超长语音扩展性:在单张40G A100上,其他模型显存呈指数级增长,FastSLM呈近线性增长,可处理8小时语音且首字延迟极低。
  • 消融实验揭示
    1. 1.67 tokens/sec是最佳甜点,再低性能崩塌,再高收益递减(符合人类正常语速的信息瓶颈)。
    2. 去掉分层结构(下采样或分层注意力),长语音ASR的WER会从5.78暴涨至12.4/10.8,证明分层对长序列不可或缺。
    3. 去掉第二阶段的长语音ASR训练,长文本理解能力显著下降。

5. 优势与局限

  • 主要优势
    1. 极高的计算性价比:用不到主流模型1/10的Token量,实现了同等甚至更优的多任务性能,大幅降低推理成本。
    2. 卓越的长音频扩展能力:近线性的显存增长和稳定的首字延迟,使消费级显卡处理小时级音频成为可能。
    3. 训练数据门槛低:用普通ASR文本对即可实现长语音对齐,无需昂贵的长语音指令数据。
  • 局限性
    1. 合成数据的领域鸿沟:韩语长语音指令数据依赖TTS生成,论文坦承这可能导致模型在真实、自发、充满噪音的对话场景中存在泛化差距。
    2. 超长解码鲁棒性未充分验证:虽然验证了8小时的显存扩展性,但未定量评估数小时连续解码是否会引发严重的插入错误等语言鲁棒性问题。
    3. 模态单一:目前仅针对语音优化,未验证其在环境音、音乐等更广泛音频场景下的分层抽象有效性。

6. 关键结论与启发

  • 最重要的Takeaway:语音大模型中的模态对齐不应是简单的“扁平降维”,而应是“分层抽象”。将连续声学流压缩到与人类语速相匹配的语义瓶颈(约1.67 tokens/sec),是实现计算效率与语义保真度完美平衡的关键。
  • 对后续研究的启发
    1. 信息瓶颈理论的跨模态应用:可以探索不同模态(如视频、传感器时序数据)是否存在类似的“自然信息瓶颈”率,以此指导模态适配器的设计。
    2. 长上下文对齐的廉价替代法:本文用长ASR任务替代长指令微调来做上下文扩展,为缺乏长文本标注数据的模态研究提供了一种经济高效的训练范式。
    3. 动态压缩率机制:当前1.67是固定压缩率,未来可研究根据语音信息密度(如静音段高压缩,密集对话低压缩)动态调整Token输出的自适应抽象器。
#27
eess.AS
Nanyang Technological University, Singapore (NTU) (QS Top 100)

Description and Discussion on DCASE 2026 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes 跨领域

Binh Thien Nguyen, Masahiro Yasuda, Noboru Harada, Romain Serizel, Mayank Mishra 等 (11 人)
Audio and Speech Processing (eess.AS)
查看摘要
This paper presents an overview of the Detection and Classification of Acoustic Scenes and Events (DCASE) 2026 Challenge Task 4, Spatial Semantic Segmentation of Sound Scenes (S5). The S5 task focuses on the joint detection and separation of sound events in complex spatial audio mixtures, contributing to the foundation of immersive communication. First introduced in DCASE 2025, the S5 task continues in DCASE 2026 Task 4 with key changes to better reflect real-world conditions, including allowing mixtures to contain multiple sources of the same class and to contain no target sources. In this paper, we describe task setting, along with the corresponding updates to the evaluation metrics and dataset. The experimental results of the submitted systems are also reported and analyzed. The official access point for data and code is this https URL .

📖 深度解读

1. 一句话总结

本文介绍了DCASE 2026挑战赛任务4,该任务致力于在复杂空间音频中同时检测并分离声事件,重点解决了真实场景中“同类声源多重出现”和“无目标声源”两大难题。

2. 研究背景与动机

  • 核心问题:如何从复杂的多通道空间音频混合信号中,准确识别出声事件的类别,并将其对应的单通道音频信号分离出来(即空间语义分割,S5)。
  • 重要性:该技术是沉浸式通信、扩展现实(XR)和智能生活声学监控等前沿应用的基础。
  • 现有不足:上一届(DCASE 2025)的任务设定过于理想化:1)假设同一混合音频中不会出现相同类别的声源(例如不允许两个人同时说话);2)假设每段音频必定包含至少一个目标声源。这导致现有系统在面对真实、复杂的声学环境时泛化能力差,且传统的评价指标在遇到同类声源时因匹配歧义而失效。

3. 核心方法

  • 提出框架:DCASE 2026 Task 4 的整体任务框架及基线系统。基线系统采用“两阶段级联”架构:第一阶段是音频 tagging(AT)模型,负责识别混合音频中包含哪些声事件类别;第二阶段是标签查询源分离(LQSS)模型,根据检测到的标签将对应的音频信号分离出来。
  • 关键创新点
    1. 任务设定的真实化升级:允许混合音频中包含多个同类声源(需利用空间位置差异进行区分),并允许包含零目标声源(考验系统在持续运行中的抗误报能力)。
    2. 评价指标的革新(CAPI-SDRi):引入了类感知置换不变信噪比提升指标,通过置换不变目标解决了同类多源情况下的“输出-参考信号匹配歧义”问题,并对虚警和漏报进行惩罚。
    3. 基线AT模型的升级:将AT模型的输出从单一的多热向量改为多个独热向量,以支持同类多源的检测;同时引入了4通道版AT模型(M2DAT_4c),在分类阶段就利用空间信息。
  • 核心思路直觉解释:想象你在一个聚会上听音(S5任务)。以前的方法假设聚会里只有一个人说话、一个闹钟响;现在的方法承认聚会上可能两个人同时在说话(同类多源),或者根本没人说话只有背景噪音(零目标)。为了评价你分离得准不准,新评价标准允许系统把分离出的“人声A”和“人声B”自动对号入座到最匹配的真实人声上(置换不变),而不是死板地按顺序匹配。

4. 实验与结果

  • 使用数据集:基于DCASE 2025数据集筛选,结合新录制的18类孤立声事件、一阶Ambisonics房间脉冲响应(RIR)和背景噪声,使用团队自研工具SpAudSyn合成的数据集。包含开发集(训练/验证/测试)和评估集(含合成与真实录制)。
  • 对比基线:单通道AT模型(M2DAT_1c)+ ResUNetK 分离模型 vs. 4通道AT模型(M2DAT_4c)+ ResUNetK 分离模型。
  • 主要实验结果:在开发集的测试子集上,4通道模型(M2DAT_4c)全面优于单通道模型。CAPI-SDRi从8.17提升至8.49,混合级准确率从57.14%提升至60.71%,源级准确率从67.15%提升至70.39%。
  • 消融实验/分析揭示:通过对比1通道与4通道AT模型的结果,验证了在音频标签识别阶段(而不仅仅是分离阶段)引入空间信息,对于提升同类多源场景下的检测和分离性能至关重要

5. 优势与局限

  • 主要优势
    1. 高度贴近真实场景:打破同类互斥和必有目标的假设,极大提升了相关技术在真实XR和监控场景中的落地可能。
    2. 评价体系严谨:CAPI-SDRi指标巧妙解决了同类声源评估的数学歧义,且向下兼容无同类声源的情况。
    3. 数据构建规范:开发了SpAudSyn工具,支持全参数化JSON存储和训练时动态生成,保证了实验的可复现性。
  • 局限性
    1. 基线架构的固有瓶颈:两阶段级联系统存在错误传播问题(AT阶段的漏报/误报会直接导致分离阶段失败),论文未在基线中探索端到端或迭代优化的方案。
    2. 零目标场景的评价缺陷:对于正确预测“无目标”的静音片段,当前指标选择直接将其排除在平均计算之外(不奖不罚),这可能导致系统在长时连续运行时的“正确拒识”能力得不到正向激励。

6. 关键结论与启发

  • 最重要的Takeaway:真实世界的声学场景充满同类声源叠加和纯粹的背景噪音,要让系统走向实际应用,必须在任务设定和评价指标上直面这些复杂性;同时,空间信息不仅是声源分离的利器,在声事件分类检测阶段同样能提供巨大增益。
  • 对后续研究的启发
    1. 架构演进:两阶段级联容易累积误差,后续研究可探索端到端模型,或如文中提到的“标签估计与源分离交替迭代优化”的方案来打破错误传播。
    2. 零目标/极低事件率场景优化:如何更好地处理长音频中偶发目标事件的检测,以及设计更合理的奖励机制(对正确预测无目标给予正向分数),是未来评价体系演进的方向。
    3. 空间线索的深度挖掘:既然同类声源在空间上至少相隔60度,如何设计更强大的空间特征提取网络,让模型仅凭微小的空间角度差异就能在特征空间中解耦同类声源,将是技术突破的关键点。
#28
eess.AS

Step-Audio-R1.5 Technical Report 跨领域

Yuxin Zhang, Xiangyu Tony Zhang, Daijiao Liu, Fei Tian, Yayue Deng 等 (19 人)
Audio and Speech Processing (eess.AS)
查看摘要
Recent advancements in large audio language models have extended Chain-of-Thought (CoT) reasoning into the auditory domain, enabling models to tackle increasingly complex acoustic and spoken tasks. To elicit and sustain these extended reasoning chains, the prevailing paradigm -- driven by the success of text-based reasoning models -- overwhelmingly relies on Reinforcement Learning with Verified Rewards (RLVR). However, as models are strictly optimized to distill rich, continuous auditory contexts into isolated, verifiable text labels, a fundamental question arises: are we fostering true audio intelligence, or merely reducing a continuous sensory medium into a discrete puzzle? We identify this as the "verifiable reward trap." While RLVR yields remarkable scores on standardized objective benchmarks, it systematically degrades the real-world conversational feel of audio models. By prioritizing isolated correctness over acoustic nuance, RLVR reduces dynamic interactions to mechanical "answering machines," severely compromising prosodic naturalness, emotional continuity, and user immersion, particularly in long-turn dialogues. To bridge the gap between mechanical objective verification and genuine sensory empathy, we introduce Step-Audio-R1.5, marking a paradigm shift toward Reinforcement Learning from Human Feedback (RLHF) in audio reasoning. Comprehensive evaluations demonstrate that Step-Audio-R1.5 not only maintains robust analytical reasoning but profoundly transforms the interactive experience, redefining the boundaries of deeply immersive long-turn spoken dialogue.

📖 深度解读

1. 一句话总结

本文指出单纯依赖可验证奖励(RLVR)训练音频推理模型会导致“可验证奖励陷阱”(模型变成机械的答题机器而丧失情感和语调),并提出Step-Audio-R1.5模型,通过引入基于人类反馈的强化学习(RLHF)成功打破了准确性与交互自然性之间的对立。

2. 研究背景与动机

  • 核心问题:如何让大音频语言模型在进行复杂推理时,既能保持高准确率,又能具备自然、富有同理心的多轮语音交互能力?
  • 重要性:随着思维链推理扩展到音频领域,模型需要处理的不再只是文本,而是包含丰富情感、语调和节奏的连续感官输入。在真实的语音对话中,用户不仅要求“答得对”,更要求“说得像人”。
  • 现有方法不足:当前主流的RLVR(基于可验证奖励的强化学习)范式存在“可验证奖励陷阱”。它将连续的音频输入强行压缩为离散的文本标签(如类别、数字)来计算二元奖励,导致模型只关注“说了什么”,而完全忽视了“怎么说”。这使得模型在多轮对话中变得机械、冷漠、缺乏情感连贯性,沦为毫无沉浸感的“答题机器”。

3. 核心方法

  • 提出框架:Step-Audio-R1.5,一个结合了RLVR与RLHF的音频推理框架。
  • 关键创新点
    1. 揭示并打破“可验证奖励陷阱”:首次系统性地指出RLVR在音频模态中的根本缺陷,并用RLHF替代单一的二元正确性奖励,将优化目标从“事实正确性”扩展到“整体交互质量”。
    2. 解耦的生成架构:模型在生成时将“内部推理过程”与“最终回复”结构化解耦,为无缝融入RLHF提供了架构基础。
    3. 基于评分准则的生成式奖励模型:针对多轮语音对话中优化目标异质(有的要求格式正确,有的要求语气自然)的问题,设计了统一的奖励模型。对于有明确准则的约束,模型基于准则打分;对于模糊的偏好,则进行对比偏好判断,并将两者联合优化以防止灾难性遗忘。
  • 核心思路直觉解释:想象你在教一个学生做听力题。RLVR就像是只看标准答案对不对,对就给糖,错就挨批,结果学生虽然选答案很准,但说话像个没有感情的机器人。Step-Audio-R1.5则引入了“语文老师”(RLHF),不仅看答案对不对,还根据一套评分细则(Rubric)看学生回答时的语气、连贯性和情感是否自然,综合给分,从而教出一个既能做对题又能好好聊天的学生。

4. 实验与结果

  • 数据集/基准:AudioMultiChallenge (Audio MC, 多轮交互)、Big Bench Audio、MMSU、MMAU、Spoken MQA,以及团队自建的Step-Caption、Step-DU、Step-SPQA(侧重副语言特征感知)。
  • 基线方法:Gemini 3 Flash/Pro, Qwen3.5-omni-flash/plus, 前代模型 Step-Audio-R1。
  • 主要实验结果
  • Step-Audio-R1.5(32B参数)平均分达77.97,仅次于Gemini 3 Pro(79.67),超越了同级别的Qwen模型。
  • 相比前代Step-Audio-R1,平均分大幅提升5.47分。
  • 在考验真实交互能力的Audio MC上得分41.15(前代仅24.61),逼近Gemini系列,证明其多轮对话能力的质变。
  • 在副语言感知任务上进步显著:Step-DU提升18.39分,Step-SPQA提升5.04分。
  • 消融实验:论文未在正文中提供详细的消融实验数据,但通过对比前代模型(纯RLVR)与R1.5(引入RLHF及冷启动SFT)的巨大差异,定性地验证了交互导向冷启动SFT和联合RLHF训练对提升对话自然度的关键作用。

5. 优势与局限

  • 主要优势
    1. 破除权衡困境:证明了推理准确性与交互自然性并非鱼与熊掌不可兼得,RLHF能有效弥补RLVR带来的体验退化。
    2. 细粒度的奖励设计:生成式奖励模型结合了规则准则与偏好对比,精准适配了语音对话中“硬约束”与“软偏好”并存的复杂场景。
    3. 架构高效:仅用32B参数,在多项基准上抗衡甚至超越了体量更大的商业闭源模型。
  • 局限性
    1. 评估模态局限:所有基准测试均采用语音到文本(S2T)格式,未展示模型直接生成语音时的韵律、情感表现力(即“说得好”在生成端的体现)。
    2. 消融与量化分析不足:论文更多是定性地阐述了“可验证奖励陷阱”,缺乏对RLVR退化现象的定量消融分析(如训练步数与自然度下降的曲线),也未单独拆解冷启动SFT与RLHF各自的贡献度。

6. 关键结论与启发

  • 最重要的Takeaway:音频推理模型的下一个前沿不在于把连续的感官输入压缩成离散的答题拼图,而在于让模型的行为与人类自然对话中丰富、有同理心的动态特征对齐。RLVR的“机械冷漠”不是CoT的错,而是贫乏奖励信号的错。
  • 后续研究启发
    1. 奖励模型设计:未来可探索更细粒度的多模态奖励模型,不仅评估文本回复,还能直接对生成的语音声学特征(如语调起伏、情感共鸣)进行打分。
    2. 端到端语音对话:将这种结合了准则与偏好的RLHF范式扩展到语音到语音(S2S)的模型中,真正实现从感知到生成的全链路沉浸式交互。
    3. 对齐税的定量研究:亟需建立一套量化“对话自然度/情感连贯性”的自动评估指标,以更科学地测量和避免RLVR带来的体验退化。
#29
eess.AScs.SD

Embedding-Space Diffusion for Zero-Shot Environmental Sound Classification 跨领域

Ysobel Sims, Alexandre Mendes, Stephan Chalup
Sound (cs.SD); Machine Learning (cs.LG); Audio and Speech Processing (eess.AS)
查看摘要
Zero-shot learning enables models to generalise to unseen classes by leveraging semantic information, bridging the gap between training and testing sets with non-overlapping classes. While much research has focused on zero-shot learning in computer vision, the application of these methods to environmental audio remains underexplored, with poor performance in existing studies. Generative methods, which have demonstrated success in computer vision, are notably absent from zero-shot environmental sound classification studies. To address this gap, this work investigates generative methods for zero-shot learning in environmental audio. Two successful generative models from computer vision are adapted: a cross-aligned and distribution-aligned variational autoencoder (CADA-VAE) and a leveraging invariant side generative adversarial network (LisGAN). Additionally, we introduced a novel diffusion model conditioned on class auxiliary data. Synthetic embeddings generated by the diffusion model are combined with seen class embeddings to train a classifier. Experiments are conducted on five environmental audio datasets, ESC-50, ARCA23K-FSD, FSC22, UrbanSound8k and TAU Urban Acoustics 2019, and one music classification dataset, GTZAN. Results show that the diffusion model outperforms all baseline methods on average across six audio datasets. This work establishes the diffusion model as a promising approach for zero-shot learning and introduces the first benchmark of generative methods for zero-shot environmental sound classification, providing a foundation for future research.

📖 深度解读

1. 一句话总结

本文提出了一种基于嵌入空间的扩散模型,通过生成未见类别的合成音频特征来实现环境声的零样本分类,显著提升了分类准确率并确立了该领域的首个生成式基准。

2. 研究背景与动机

  • 核心问题:如何对模型训练阶段从未见过的环境声音类别进行准确分类(即零样本学习,Zero-Shot Learning)。
  • 重要性:在现实世界中,我们无法为所有可能的声音收集标注数据,零样本学习能让模型具备识别新声音的能力,对智慧城市、助听设备等应用至关重要。
  • 现有不足
    1. 零样本学习在计算机视觉中研究充分,但在环境音频领域严重滞后,且现有非生成式方法性能不佳。
    2. 视觉领域中表现优异的生成式方法(如GAN、VAE)从未被系统性地引入环境音频零样本学习。
    3. 现有的基于扩散模型的零样本方法(如直接使用Stable Diffusion)依赖庞大的预训练模型,局限于图像和文本模态,且存在训练数据泄露的风险,无法直接应用于音频。

3. 核心方法

  • 提出框架ZeroDiffusion,一种在嵌入空间运作的条件扩散模型。
  • 关键创新点
    1. 首个不依赖预训练大模型的嵌入空间扩散方法:不直接生成原始音频或图像,而是在低维特征向量空间中进行扩散,模型极其轻量且与数据模态无关。
    2. 多损失函数协同:在扩散模型训练中结合了重构损失、分布对齐、方差损失、质心对齐和余弦相似度损失,确保生成的合成特征既逼真又具多样性。
    3. 模态无关的生成式零样本范式:用未见类的语义向量(Word2Vec)作为条件,生成对应的音频特征向量,再与真实可见类数据混合训练分类器。
  • 核心思路直觉解释
    就像人类如果知道“海豚”有“哨声”、“水花”等属性,即使没听过也能想象出大概的声音特征。ZeroDiffusion也是这个逻辑:它先学会“声音特征”和“文字描述”之间的对应规律。当遇到没听过的声音类别时,只要给它这个类别的文字描述,它就能从纯噪声中“凭空想象”出符合描述的伪造声音特征。最后,用这些伪造特征加上已知真实特征一起训练分类器,分类器就学会了辨认那些从未真正听过的声音。

4. 实验与结果

  • 数据集:5个环境声数据集(ESC-50, ARCA23K-FSD, FSC22, UrbanSound8k, TAU 2019)和1个音乐数据集(GTZAN)。
  • 基线方法
    1. 非线性ALE(环境音频零样本SOTA基线,非生成式)
    2. CADA-VAE(视觉领域SOTA,基于VAE)
    3. LisGAN(视觉领域SOTA,基于GAN,去除了直推式设置以保公平)
  • 主要结果
  • ZeroDiffusion在6个数据集上的平均准确率最高(34.86%),超越了ALE(32.27%)、LisGAN(29.36%)和CADA-VAE(31.37%)。
  • 在大规模数据集(如ARCA23K-FSD和TAU 2019)上优势尤为明显,例如在TAU 2019上达到48.57%,远超其他方法。
  • 消融实验
  • 基线ALE本质上就是ZeroDiffusion去掉了“扩散生成合成数据”的环节。ZeroDiffusion相比ALE的显著提升,直接证明了引入扩散模型生成未见类合成数据是性能提升的关键因素。

5. 优势与局限

  • 主要优势
    1. 性能优越:在大多数数据集上达到SOTA,证明了扩散模型在零样本音频分类中的巨大潜力。
    2. 轻量且通用:在嵌入空间操作,避免了像素/波形级别生成的巨大计算开销,且天然支持任何模态的输入特征。
    3. 填补空白:首次为环境音频零样本学习建立了生成式方法(GAN/VAE/Diffusion)的基准。
  • 局限性
    1. 训练不稳定/方差大:生成式方法(包括ZeroDiffusion)的运行间标准差远高于非生成式方法(ALE最高约1%,而ZeroDiffusion在UrbanSound8k上高达7.77%),在实际应用中可靠性存疑。
    2. 对数据规模敏感:在每类样本极少的数据集(如ESC-50仅40样本/类)上表现不稳定,说明生成模型在数据匮乏时容易“想象跑偏”。
    3. 缺乏理论保障:论文指出零样本学习目前缺乏理论边界,无法预知给定的可见类集合是否足以推断特定的未见类。

6. 关键结论与启发

  • 最重要的Takeaway:扩散模型不仅擅长生成逼真的图像,其在特征空间作为“数据增强器”同样能为零样本学习带来质的飞跃,且这种范式是模态无关的。
  • 后续研究启发
    1. 稳定性优化:亟需解决生成式零样本方法方差过大的问题,例如探索更稳定的扩散采样策略或引入正则化。
    2. 小样本场景适应:研究如何在每类音频极少的情况下(如几十个样本)依然保持生成特征的保真度。
    3. 跨域验证:既然方法是模态无关的,未来可将其直接迁移到图像、视频甚至跨模态的零样本分类任务中进行验证。
    4. 理论探索:从理论层面界定“可见类”对“未见类”的推断上限,为生成式零样本学习提供数学保障。
#30
eess.AScs.SD
Seoul National University (QS Top 100)

MAVL: A Multilingual Audio-Video Lyrics Dataset for Animated Song Translation 跨领域

Woohyun Cho, Youngmin Kim, Sunghyun Lee, Youngjae Yu
Computation and Language (cs.CL); Machine Learning (cs.LG); Multimedia (cs.MM); Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: Accepted to EMNLP 2025, Project Page: this https URL , our codes and datasets are available at this https URL
查看摘要
Lyrics translation requires both accurate semantic transfer and preservation of musical rhythm, syllabic structure, and poetic style. In animated musicals, the challenge intensifies due to alignment with visual and auditory cues. We introduce Multilingual Audio-Video Lyrics Benchmark for Animated Song Translation (MAVL), the first multilingual, multimodal benchmark for singable lyrics translation. By integrating text, audio, and video, MAVL enables richer and more expressive translations than text-only approaches. Building on this, we propose Syllable-Constrained Audio-Video LLM with Chain-of-Thought SylAVL-CoT, which leverages audio-video cues and enforces syllabic constraints to produce natural-sounding lyrics. Experimental results demonstrate that SylAVL-CoT significantly outperforms text-based models in singability and contextual accuracy, emphasizing the value of multimodal, multilingual approaches for lyrics translation.

📖 深度解读

1. 一句话总结

本文提出了首个多模态多语种动画歌曲翻译基准MA VL,并设计了结合音视频线索与音节约束的思维链模型SylAVL-CoT,解决了传统纯文本翻译无法兼顾“可唱性”与“画面情境”的难题。

2. 研究背景与动机

  • 核心问题:歌词翻译不仅是语义的转换,更需要保证“可唱性”(音节、节奏匹配)和情境契合度。在动画音乐中,歌词还需与视觉画面和听觉氛围对齐。
  • 重要性:优秀的歌词翻译(如迪士尼动画的官方配音)需要超越字面直译,进行创造性改写以维持音乐性和叙事感,这对跨文化传播至关重要。
  • 现有不足:以往的歌词翻译研究多局限于纯文本或“文本+乐谱”,且通常只针对单一语言对。纯文本模型(如Google Translate)容易产生字面死译,导致音节过多无法演唱,且忽略了画面中的动态情感(例如,画面中蝴蝶在“飞”,纯文本只译出蝴蝶“存在”)。

3. 核心方法

  • 提出框架:论文提出了MA VL基准和SylAVL-CoT模型。该模型基于多模态大语言模型(Gemini),无需微调,通过思维链将多模态信息与音节约束结合。
  • 关键创新点
    1. 首个多模态多语种歌词基准(MA VL):整合了英、西、法、韩、日5种语言的文本、音频和视频对齐数据。
    2. 音节感知的多模态思维链:将翻译拆解为三步推理,强制模型在多模态语境下遵守音节约束。
    3. 双参考系评估体系:提出不仅与原语言对比,还要与官方人工配音版对比,更真实地反映翻译的“可唱性”与“自然度”。
  • 核心思路直觉解释:就像人类译配者一样,SylAVL-CoT翻译一首歌时会分三步走:第一步,听音切字,听着旋律把原歌词拆成音节,摸清节奏底子;第二步,看画填词,看着画面里的动作和情绪,用目标语言把意思写出来,同时尽量保持音节数量一致;第三步,打磨修整,如果音节多了或少了,就反复调整语序和用词,直到字数卡得上旋律,意思也贴合画面。

4. 实验与结果

  • 数据集:MA VL(包含228首动画歌曲的5语种平行语料,附对齐的音视频)。
  • 基线方法:Google Translate、mBART-50、Qwen2.5-72B、GPT-4o、Gemini 2.0(分带/不带音节约束)。
  • 主要实验结果
  • 可唱性(音节误差):SylAVL-CoT在韩语上的音节误差(对比原英文)低至0.695,远低于GPT-4o(3.084)和纯文本翻译(12.226)。
  • 语义与自然度:虽然与原英文的语义相似度略低于直译模型(因为进行了大量意译),但与人工配音版对比时,其语义相似度和发音距离均达到最优,说明其改写策略更接近人类专家。
  • 人类评估:在4种语言的整体质量评分中,SylAVL-CoT均排名第一(如韩语3.95分,高于GPT-4o的3.19分)。
  • 消融实验揭示
  • 多模态缺一不可:仅用音频能更好地保留原意,仅用视频会促使模型更自由地意译;同时加入音视频(T+A+V)时,与人工配音版的语义契合度最高。
  • CoT步骤不可或缺:去掉“音节列表生成”或“迭代优化”步骤都会导致音节误差显著上升。
  • 模型适配性:CoT策略对Gemini的提升极大,但对GPT-4o和Qwen效果有限,说明处理复杂多约束推理需要特定的大脑(模型架构)。

5. 优势与局限

  • 主要优势
    1. 打破模态孤岛:首次将视觉和听觉信息引入歌词翻译,解决了“字面翻译与画面脱节”的痛点。
    2. 极强的可唱性保障:通过思维链强制音节对齐,大幅降低了演唱时的节奏违和感。
    3. 即插即用:无需收集海量多模态数据微调,直接利用现有MLLM的推理能力。
  • 局限性
    1. 数据范围受限:目前仅覆盖动画音乐和5种主流语言,未涵盖流行乐、低资源语言或声调语言(如中文的声调与旋律匹配问题未解决)。
    2. 行级翻译局限:模型目前按行翻译,无法像人类一样跨行重组或合并拆分句子,限制了诗意和节奏的极致发挥。
    3. 对齐与评估的偏差:音视频时间戳对齐仍存在误差(如重叠人声);自动评估指标难以完全捕捉音乐的艺术性和情感细微差别。

6. 关键结论与启发

  • 最重要的Takeaway:在歌词翻译这种高度受限的创意生成任务中,多模态上下文(音视频)与结构化推理(CoT)的结合,能够使机器翻译突破“字面忠实”的桎梏,走向“情境与音乐双重契合”的人类专家水平。
  • 对后续研究的启发
    1. 跨行/段落级翻译:未来可利用MA VL中的段落级标注,探索超越单行限制的篇章级歌词译配模型。
    2. 声调语言的支持:将中文等声调语言的“字调-旋律”约束纳入多模态推理框架,是极具挑战的延伸方向。
    3. 多模态对齐技术:更精准的音视频-文本细粒度对齐(如动作级、音符级)将进一步提升多模态翻译的上限。
#31
eess.AScs.SD
Imperial College London (QS Top 100)

HRTFformer: A Spatially-Aware Transformer for Individual HRTF Upsampling in Immersive Audio Rendering 跨领域

Xuyi Hu, Jian Li, Shaojie Zhang, Stefan Goetz, Lorenzo Picinali 等 (7 人)
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: Accepted to IEEE Transactions on Multimedia 2026
查看摘要
Individual Head-Related Transfer Functions (HRTFs) are starting to be introduced in many commercial immersive audio applications and are crucial for realistic spatial audio rendering. However, one of the main hesitations regarding their introduction is that creating individual HRTFs is impractical at scale due to the complexities of the HRTF measurement process. To mitigate this drawback, HRTF spatial upsampling has been proposed with the aim of reducing the measurements required. While prior work has seen success with different machine learning (ML) approaches, these models often struggle with long-range preservation of local spatial variation patterns across neighbouring source directions and generalization at high upsampling factors. In this paper, we propose a novel transformer-based architecture for HRTF upsampling, leveraging the attention mechanism to better capture spatial correlations across the HRTF sphere. Working in the spherical harmonic (SH) domain, our model learns to reconstruct high-resolution HRTFs from sparse input measurements with significantly improved accuracy. To enhance spatial coherence, we introduce a neighbour dissimilarity loss that promotes magnitude smoothness, yielding more realistic upsampling. We evaluate our method using both perceptual localization models and objective spectral distortion metrics. Experiments show that our model outperforms existing methods across several evaluation metrics in generating realistic, high-fidelity HRTFs.

📖 深度解读

1. 一句话总结

本文提出了一种基于Transformer的HRTFformer模型,通过利用球谐域的注意力机制和邻居差异性损失,仅用极少量的稀疏测量点就能精准重建出高分辨率、高保真的个性化头相关传输函数(HRTF)。

2. 研究背景与动机

  • 核心问题:如何以极少的测量点(稀疏采样)重建出高分辨率的个性化HRTF(空间上采样)。
  • 重要性:个性化HRTF是VR/AR等沉浸式音频实现精准声源定位和真实感的关键,但传统的声学测量耗时且需专业设备,难以大规模普及。
  • 现有方法不足
    1. 传统插值法(如重心插值、球谐插值):在数据稀疏时性能急剧下降,且基于固定数学假设,无法捕捉复杂的个体频谱变化。
    2. 现有深度学习法(如基于GAN的方法):虽然在客观频谱误差(LSD)上表现尚可,但在高稀疏度下往往生成“平均化”的HRTF,丢失了个体特征;且客观指标与主观听觉感知常常脱节。

3. 核心方法

  • 提出模型:HRTFformer,一种空间感知型的Transformer编解码器架构。
  • 关键创新点
    1. 球谐(SH)域与Transformer的结合:将3D球面上的HRTF数据投影到1D的球谐系数序列,利用Transformer的自注意力机制捕捉不同阶次球谐系数间的全局空间依赖关系。
    2. 邻居差异性损失(NDL):提出一种新的损失函数,约束相邻空间位置的HRTF幅度变化模式,确保重建结果在空间上的平滑连续性,避免突变,提升真实感。
    3. 迭代投影解码器与Token Scaling:解码器用迭代上/下采样模块替代传统前馈层以提升分辨率;用Token Scaling替代LayerNorm,保留对幅度敏感的频谱能量分布信息。
  • 核心思路直觉解释
    想象你要画一张精细的全球气候图,但只给了你几个城市的气温(稀疏HRTF)。传统方法是用这几个点拉线(插值),图会很不自然;普通AI可能直接套用一个“全球平均气温模板”。而HRTFformer的做法是:先将数据转换成一套“气候基函数”(球谐变换),然后用Transformer这颗“超级大脑”去理解这些基函数之间谁和谁有关联(自注意力),从而推断出缺失的细节;同时,NDL损失就像一个约束,提醒它“相邻城市的气温不能差得太离谱”,最终画出一张既精细又符合局部气候规律的个性化地图。

4. 实验与结果

  • 数据集:SONICOM HRTF数据集。
  • 基线方法:9种,包括传统方法(重心插值、SH插值、SUpDEq)和深度学习方法(AE-GAN, GEP-GAN, IOA3D, Kalimotxo等)。
  • 稀疏设置:3、5、19、100个初始采样点(点越少越困难)。
  • 主要结果
    1. 客观指标(LSD, ILD, ITD):在极具挑战的极稀疏条件(3点和5点)下,HRTFformer全面碾压所有基线。例如在3点时,LSD降至4.20 dB,ITD降至17.50,远优于GAN和插值方法;在100点(密集)时,与SOTA表现相当。
    2. 感知评估(极向精度误差、象限误差):在3、5、19点下,HRTFformer的感知定位误差大幅领先。例如3点时的极向精度误差仅为3.83,而最接近的基线也在10以上,证明其重建的HRTF在听觉上更利于定位。
  • 消融实验揭示
    1. 编解码器中的Transformer模块对捕捉全局依赖至关重要,纯卷积效果差。
    2. 旋转位置编码和Token Scaling比传统绝对位置编码和LayerNorm更适合此任务。
    3. NDL损失有效维持了局部空间平滑,提升了感知真实感。

5. 优势与局限

  • 主要优势
    1. 极稀疏条件下的强泛化力:仅需3-5个测量点即可重建出具有高度个性化且感知准确的HRTF,极大降低了测量门槛。
    2. 客观与主观感知的对齐:克服了以往ML模型“客观指标好但听觉定位差”的通病,在感知定位模型评估中优势显著。
    3. 空间连续性保障:NDL损失有效防止了重建HRTF在空间上的突变,提升了听觉真实感。
  • 局限性
    1. 数据集单一:所有实验仅在SONICOM单一数据集上进行,未验证跨数据集(不同测量设备和协议)的泛化能力。
    2. 缺乏真实人类听感测试:感知评估依赖计算模型(贝叶斯听觉定位模型),尚未经真实受试者的主观听感验证。
    3. 计算开销大:模型参数量(270M)和推理时间远大于GAN基线,不适合实时处理(尽管作者辩称上采样通常是离线任务)。

6. 关键结论与启发

  • 最重要的Takeaway:在HRTF上采样任务中,引入Transformer的自注意力机制来建模球谐系数间的全局依赖,并辅以空间平滑约束(NDL),能够有效打破极稀疏条件下的“平均化”魔咒,实现客观指标与主观感知双赢的个性化重建。
  • 对后续研究的启发/延伸方向
    1. 跨数据集泛化:未来需重点解决不同测量系统带来的域偏移问题,探索多数据集联合训练或域适应方法。
    2. 合成数据与迁移学习:针对真实HRTF数据稀缺的问题,可利用物理仿真生成合成HRTF进行预训练,再迁移到真实数据上。
    3. 主观听感验证:将计算模型的结论推进到真实人类的VR/AR听感测试中,验证空间真实感、外化感和定位准确度。
#32
eess.AScs.SD

SARA: Stress Test Reasoning in Audio Deepfake Detection 解读失败跨领域

Binh Nguyen, Charles Fleming, Thai Le
Computation and Language (cs.CL); Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: Preprint for ACL 2026 submission
查看摘要
Audio Language Models (ALMs) offer a promising shift towards explainable audio deepfake detections (ADD), moving beyond \textit{black-box} classifiers by providing transparency to their predictions via reasoning traces. However, such reasoning may not support the model predictions, reflecting poor coherence, or, worse, may rationalize incorrect predictions with plausible but misleading explanation. Moreover, the behavior of ALM reasoning under adversarial attacks remains under-explored, raising questions about the practical reliability of such explanation capabilities. To address this gap, this study introduces \textbf{SARA} (\textbf{S}hift \textbf{A}nalysis of \textbf{R}easoning in \textbf{A}udio), a diagnostic framework that evaluates ALM reasoning across three dimensions: acoustic perception, reasoning-verdict coherence and dissonance. We test five open-source ALMs against both acoustic and linguistic adversarial attacks. We show that acoustic attacks significantly degrade reasoning-verdict coherence (average decrease of 14.20\%), frequently inducing internal logical conflicts. Conversely, linguistic attacks achieve higher attack success rates while maintaining reasoning coherence. We further demonstrate that the textual coherence of generated reasoning traces also serves as a latent indicator of adversarial inputs, enabling effective detection of perturbed audio (0.78 in F1) \textit{without accessing the raw acoustic signal}. These findings suggest that reasoning traces provide diagnostic utility that persists even when final classification outputs are compromised.

📖 深度解读

[PDF 下载失败,无法解读]

#33
eess.AScs.SD
City University of Hong Kong (QS Top 100)

DSA-Tokenizer: Disentangled Semantic-Acoustic Tokenization via Flow Matching-based Hierarchical Fusion 跨领域

Hanlin Zhang, Daxin Tan, Dehua Tao, Xiao Chen, Haochen Tan 等 (8 人)
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: Submit to ACL ARR 2026 May
查看摘要
Speech tokenizers are a key building block of fully discrete Speech LLMs. Existing tokenizers either prioritize semantic encoding, fuse semantic content with acoustic style inseparably,or achieve incomplete semantic-acoustic disentanglement. To achieve better disentanglement,we propose DSA-Tokenizer,which explicitly disentangles speech into discrete semantic and acoustic tokens via distinct optimization this http URL ,semantic tokens are supervised by ASR to capture linguistic content,while acoustic tokens focus on mel-spectrograms restoration to encode this http URL further introduce a hierarchical Flow Matching decoder and a joint reconstruction-context inpainting training strategy,allowing the model to support both high-fidelity reconstruction and cross-utterance voice this http URL speed up inference,we distill the DiT decoder to reduce sampling steps of inference to 4 and improve synthesis quality with GAN this http URL demonstrate that DSA-Tokenizer provides strong semantic-acoustic disentanglement,reliable controllable voice cloning,and efficient high-fidelity generation with low WER/CER.Moreover, our results suggest that disentangled tokenization provides a more effective interface for downstream large-model speech this http URL samples are avaialble at this https URL .

📖 深度解读

1. 一句话总结

本文提出了DSA-Tokenizer,一种双流语音分词器,通过正交约束将语音严格解耦为语义和声学令牌,并结合流匹配解码器与GAN微调,实现了高保真重建、跨话语语音克隆以及为下游语音大模型提供更可控的接口。

2. 研究背景与动机

  • 核心问题:如何将语音信号有效且干净地解耦为语义内容(说了什么)和声学风格(谁说的、怎么说),以支持语音大模型的精细化控制与生成。
  • 重要性:在完全离散的语音大模型中,语音分词器是核心组件。如果分词器能实现干净的解耦,下游模型就能像搭积木一样,自由组合A的文本内容和B的音色风格,实现可控的语音生成。
  • 现有方法不足
    1. 语义分词器(如HuBERT):偏重文本内容,丢弃了音色和韵律等声学细节。
    2. 语义-声学混合分词器(如EnCodec):重建音质好,但内容和风格纠缠在一起,无法独立控制。
    3. 浅层解耦分词器(如SpeechTokenizer):尝试在混合架构上做分离,但解耦不彻底,存在信息泄漏(语义令牌里还有音色信息,反之亦然),导致跨话语语音克隆时效果崩溃。

3. 核心方法

  • 提出框架:DSA-Tokenizer(Disentangled Semantic-Acoustic Tokenizer),包含双流编码器和基于流匹配的分层融合解码器。
  • 关键创新点
    1. 任务特异性的双流正交约束:语义流仅用ASR(CTC损失)监督,逼其只保留文本;声学流仅用Mel频谱重建和说话人一致性损失监督,逼其只保留音色/风格。两者优化目标完全正交,从根源上切断信息泄漏。
    2. 联合重建与上下文修复训练:训练时不仅做自我重建,还随机做“完形填空”(给前半段声学+全部语义,预测后半段Mel谱),强迫模型学会从部分声学推断全局风格,强化解耦。
    3. 分层融合的流匹配解码器:语义令牌作为“骨架”,通过ControlNet方式直接加到噪声输入上(强时间对齐);声学令牌作为“皮肉”,通过交叉注意力灵活注入(弱对齐,便于跨话语拼接)。
    4. 少步蒸馏与GAN微调:将流匹配解码器蒸馏至4步推理,并在Mel空间引入GAN微调,弥补MSE损失对高频细节建模不足的问题,大幅提升音质。
  • 直觉解释:就像制作提线木偶,语义令牌是木偶的骨架和动作脚本(必须严丝合缝对齐时间),声学令牌是木偶的服装和妆容(可以灵活替换搭配)。训练时既让木偶自己表演(重建),又让木偶穿别人的衣服演自己的剧本(上下文修复),从而确保骨架和衣服彻底分开。

4. 实验与结果

  • 数据集/基准:训练使用10万小时中英文Emilia子集;评估使用SeedTTS(重建与克隆)、LibriSpeech/VoxCeleb1(解耦探测)、LibriTTS(下游LLM任务)。
  • 对比基线:WavTokenizer, EnCodec, SpeechTokenizer, SAC, Facodec等。
  • 主要实验结果
    1. 重建与克隆:在极低比特率(0.7 kbps)下,DSA-Tokenizer是唯一在重建和跨话语克隆任务上都保持强劲表现的模型。在克隆任务中,英文UTMOS达4.16(SAC仅1.34),WER仅2.47%(SAC高达90.22%)。
    2. 解耦探测:DSA的语义令牌ASR WER最低(6.28%)且说话人分类准确率极低(2.35%),声学令牌则相反,证明实现了最干净的解耦
    3. 下游LLM任务:在LLM语音克隆中,DSA的WER(16.55%)远优于SAC(22.89%)和WavTokenizer(89.44%);在零样本TTS中,DSA取得了最佳的UTMOS和SIM。
  • 消融实验揭示
    1. 去掉说话人一致性损失,克隆任务的SIM从0.60暴跌至0.20,WER升至7.83%。
    2. 去掉上下文修复训练,克隆任务直接崩溃(WER升至134.85%)。
    3. 4步蒸馏+GAN微调不仅将推理步数从16步降至4步,还在所有指标上超越了原始16步模型。

5. 优势与局限

  • 主要优势
    1. 解耦彻底:通过正交约束和修复训练,真正实现了语义与声学的无泄漏分离。
    2. 兼顾音质与可控性:在极低比特率下兼顾了高保真重建与灵活的跨话语音色克隆。
    3. 对下游模型友好:为语音大模型提供了更清晰的接口,显著提升了LLM生成语音的可控性和准确率。
  • 局限性
    1. 推理效率仍受限:尽管蒸馏到了4步,但基于流匹配的DiT解码器仍比纯GAN或单次前向传播的编解码器重,对极低延迟场景不友好。
    2. 评估维度与语种有限:解耦评估主要针对语义和说话人身份,未深入探讨韵律、情感等细粒度声学属性的解耦;且仅验证了中英文。
    3. 重建SIM的权衡:在重建任务中,为了换取更好的解耦和下游LLM表现,DSA的说话人相似度(SIM)略低于部分纯重建导向的模型(如SAC)。

6. 关键结论与启发

  • 最重要的Takeaway:语音分词器中语义与声学的“干净解耦”是提升下游语音大模型可控性的关键,而“跨话语语音克隆”是检验解耦是否彻底的试金石;混合或浅层解耦的令牌会严重阻碍大模型的内容-风格组合生成能力。
  • 后续启发/延伸方向
    1. 更细粒度的解耦:当前声学令牌仍是一个整体,未来可探索将声学进一步解耦为音色、情感、语速等独立子空间,实现更精细的“旋钮式”控制。
    2. 轻量化解码器:结合一致性模型或先进的GAN架构,进一步将流匹配解码器压缩至1-2步生成,满足实时流式交互需求。
    3. 多语种与全属性探测:将解耦框架扩展至更多语种,并建立包含韵律、情感在内的更全面的解耦评估基准。
#34
eess.AS
Hong Kong University of Science and Technology (QS Top 100)

Escaping the BLEU Trap: A Signal-Grounded Framework with Decoupled Semantic Guidance for EEG-to-Text Decoding 跨领域

Yuchen Wang, Haonan Wang, Yu Guo, Honglong Yang, Xiaomeng Li
Computation and Language (cs.CL); Artificial Intelligence (cs.AI); Human-Computer Interaction (cs.HC); Audio and Speech Processing (eess.AS); Neurons and Cognition (q-bio.NC)
查看摘要
Decoding natural language from non-invasive EEG signals is a promising yet challenging task. However, current state-of-the-art models remain constrained by three fundamental issues: Semantic Bias, where outputs collapse into generic linguistic templates; Signal Neglect, where models rely heavily on LLM priors to hallucinate fluent text even in the absence of meaningful signals; and the "BLEU Trap", where high-frequency stopwords inflate n-gram metrics, masking a lack of true semantic fidelity. To resolve these challenges, we move beyond conventional end-to-end pipelines and propose SemKey, a novel multi-stage framework that enforces signal-grounded generation through four decoupled semantic objectives: sentiment, topic, length, and surprisal. We extract these semantic anchors from EEG embeddings directly, then unify them with an Active Retrieval Decoding mechanism, compelling the LLM to ground its token generation in the neural signals rather than defaulting to linguistic priors. Furthermore, we break the BLEU Trap by establishing a comprehensive evaluation protocol using rigorous retrieval and distribution-based metrics such as Fréchet Distance. Extensive experiments demonstrate that SemKey effectively mitigates hallucinations on noise inputs and achieves SOTA performance on these robust protocols. Code will be released upon acceptance at this https URL .

📖 深度解读

1. 一句话总结

本文提出了一种名为SEMKEY的多阶段EEG脑电波解码文本框架,通过解耦高级语义属性(情感、主题等)引导生成并强制模型依赖真实神经信号,从而打破了现有模型依赖语言先验产生幻觉的“BLEU陷阱”,实现了真正基于信号的可靠解码。

2. 研究背景与动机

  • 核心问题:如何从非侵入式EEG脑电信号中准确、忠实地解码出自然语言文本。
  • 为什么重要:脑机接口(BCI)技术是失语症或闭锁综合征患者恢复沟通的唯一希望,而非侵入式EEG因其安全性和便携性是最具普及潜力的方案。
  • 现有方法不足
    1. 语义偏差:模型输出容易坍缩为高频、通用的语言模板(如总是生成"He was..."或"The movie..."),缺乏真实语义。
    2. 信号忽视:模型过度依赖大语言模型(LLM)自身的语言先验来“瞎编”流畅文本,即使输入纯噪声,也能生成看似通顺的句子。
    3. “BLEU陷阱”:传统N-gram评价指标(如BLEU)会被高频停用词和通用模板虚高抬高,掩盖了模型实际上并未解码出真实语义的致命缺陷。

3. 核心方法

  • 提出框架:SEMKEY,一个两阶段的“引导-生成”框架。
  • 关键创新点
    1. 并行神经驱动属性解耦(Stage 1):不再让模型盲目端到端生成,而是先从EEG信号中显式提取四个高级语义锚点——情感、主题、长度和惊异度。这相当于给LLM画了“语义边界”,防止其随意发挥。
    2. 多视角主动检索解码(Stage 2):将Stage 1提取的属性转化为自然语言提示词作为Query;同时重构注意力机制(Q-K-V Injection),将EEG特征强行作为Key和Value注入LLM的交叉注意力层。这迫使LLM在生成每个词时,必须主动去EEG信号中“检索”依据,而不是靠自己的语感瞎猜。
    3. 突破“BLEU陷阱”的评估协议:摒弃单一BLEU,引入N-way检索准确率(看生成文本能否在干扰项中认出真实语义)、内容召回率(只算实词匹配)和Fréchet Distance(衡量生成分布与真实分布的距离),全方位挤干水分。
  • 核心思路直觉解释:以前的模型就像一个“不听讲的学生”,考试时全凭常识瞎编答案(语言先验),且总爱写套话(语义偏差),老师用死板的格式评分还给了高分(BLEU陷阱)。SEMKEY的做法是:先逼学生从听力材料(EEG)中提炼出核心大纲(四个属性),然后考试时把听力材料放在他面前,强制他必须看着材料找答案(Q-K-V注入),最后改卷时不仅看句式,还要核对核心事实和逻辑分布。

4. 实验与结果

  • 数据集:ZuCo 1.0 和 ZuCo 2.0(包含超2.2万个句子-EEG对)。
  • 基线方法:GLIM(当前最强无Teacher Forcing基线)、DeWave、EEG2Text等。
  • 主要实验结果
  • 检索准确率:SEMKEY在24-Way检索准确率达到16.24%,相比GLIM的10.74%有显著提升(提升超50%)。
  • 生成质量与多样性:Self-BLEU从GLIM的90.86%降至52.08%(越低越好,越接近真实文本的49.38%),FD距离从0.57降至0.26,证明生成分布更接近真实文本,且打破了模板化输出。
  • 噪声测试(信号依赖验证):输入纯高斯噪声时,GLIM仍能输出流畅的幻觉文本,而SEMKEY直接输出乱码,证明了其“垃圾进,垃圾出”的严格信号依赖性。
  • 消融实验揭示
  • 移除Q-K-V注入机制会导致多样性崩溃,证明强制模型关注信号至关重要。
  • 移除任何一个语义属性(尤其是Surprisal和Length)都会导致性能下降,证明四个属性作为语义锚点是互补且缺一不可的。

5. 优势与局限

  • 主要优势
    1. 根除幻觉:通过Q-K-V注入和语义约束,从根本上解决了EEG解码中“信号忽视”和“语义偏差”的顽疾。
    2. 评估范式革新:揭露并打破了“BLEU陷阱”,为EEG-to-Text领域提供了更严谨、更抗作弊的评价标准。
    3. 即插即用:其属性解耦和Q-K-V注入机制对其他多模态信号解码任务具有强借鉴意义。
  • 局限性
    1. 细粒度解码能力依然薄弱:论文坦诚,模型在解码专有名词(如人名、地名)等低频细粒度信息时依然困难,Content Recall绝对值仅2.71%。
    2. 跨个体泛化瓶颈:受限于EEG数据的跨个体差异巨大,当前基于多受试者混合训练的策略难以捕捉精细的神经映射。
    3. 绝对性能偏低:尽管相对基线有大幅提升,但距离实际临床应用的可用性仍有很长的路要走。

6. 关键结论与启发

  • 最重要的Takeaway:当前EEG-to-Text领域存在严重的“自欺欺人”现象——高BLEU分数掩盖了模型只是在背诵语言模板的事实;只有强制模型在生成时严格依赖输入信号(如Q-K-V注入),并采用分布级/检索级指标,才能评估出真实的解码能力。
  • 对后续研究的启发
    1. 数据采集转向:未来的EEG解码研究不应再在低资源、多被试的混合数据上内卷,而应转向高资源、单一个体的纵向深度数据采集,以减少脑拓扑差异带来的噪声。
    2. 解耦与引导范式:在处理极低信噪比信号时,“先提取粗粒度语义约束,再进行细粒度生成”的Coarse-to-Fine范式,比纯端到端隐式对齐更有效。
    3. 评估标准重塑:后续任何EEG解码工作,都应将“噪声输入测试”和“分布级指标”作为标配,以证明模型真正在做“解码”而非“幻觉”。
#35
eess.AScs.SD
Shanghai Jiao Tong University (QS Top 100, 985, 211)

HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding 跨领域

Bohan Li, Shi Lian, Hankun Wang, Yiwei Guo, Yu Xi 等 (9 人)
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: 14 pages, 2 figures, 8 tables
查看摘要
Unified speech foundation models require a holistic tokenization space that is both learnable by language models and decodable into high-quality waveforms. Existing speech tokenizers, however, often fail to satisfy these requirements simultaneously, leading to increased architectural complexity and more involved training designs. We propose HoliTok, a continuous Holistic speech Tokenization model designed for unified generation-understanding modeling. HoliTok encodes 48~kHz speech into a compact 25~Hz sequence of 128-dimensional latents. It is trained with a progressive strategy that jointly preserves signal-level fidelity, incorporates semantic information, and maintains strong latent learnability. Based on this tokenization, we build a unified AR+DiT model for speech synthesis and recognition, where the same latent sequence supports both generation-specific and unified generation-understanding tasks. Experiments show that HoliTok achieves competitive reconstruction fidelity, improves generative learnability for high-quality and controllable synthesis, and, among the evaluated representations, is the only one that operates robustly in our unified generation-understanding architecture without additional optimization tricks. These results suggest that HoliTok serves as an effective speech tokenizer and a foundational representation interface for unified spoken language modeling. The code is available at: this https URL .

📖 深度解读

1. 一句话总结

本文提出了HoliTok,一种连续的语音整体分词器,通过渐进式训练策略将高保真声学重建、语义信息和下游可学习性融为一体,首次在统一的AR+DiT架构下无需额外复杂设计即可稳健兼顾语音生成与理解任务。

2. 研究背景与动机

  • 核心问题:如何构建一个既能被语言模型轻松学习(用于生成),又能解码出高质量波形(用于声学保真),同时保留丰富语义信息(用于理解)的统一连续语音表示空间。
  • 重要性:多模态基础模型正走向“理解与生成统一”的架构。如果分词器本身不能同时满足上述三个要求,下游模型就不得不通过增加特定任务编码器、多流Token或解耦模块等复杂设计来“打补丁”,导致模型臃肿且难以优化。
  • 现有方法不足
    1. 传统声学特征(如Mel谱):保留了信号细节但序列冗长,缺乏语义,难以用于理解任务。
    2. 自监督语音表示(如WavLM):语义丰富但无法直接解码回高保真音频,且对生成模型不友好。
    3. 离散分词器(如EnCodec):量化过程会丢失信息,多码本设计增加了建模复杂度。
    4. 现有连续分词器:往往只侧重重建或生成,无法作为理解与生成的“共享接口”;现有的“统一”表示也多在独立系统中分别验证,未在真正共享参数的统一架构下经受考验。

3. 核心方法

  • 提出模型:HoliTok(Holistic Tokenization)。它将48kHz语音压缩为25Hz、128维的连续隐变量序列,并采用基于VAE的编解码架构。
  • 关键创新点
    1. 渐进式隐空间塑造策略:避免一步到位的强KL约束破坏重建质量,分三阶段逐步优化隐空间。
    2. 下游感知的语义注入:在保证可解码性的前提下,通过多粒度蒸馏和语言模型监督,强制隐变量保留对理解任务至关重要的信息。
    3. 统一评估范式:采用AR+DiT架构作为“试金石”,直接检验同一连续表示在共享参数下同时支持生成与理解的能力。
  • 核心思路直觉解释
  • 阶段I(打地基):先训练一个确定性的自编码器,只管把音频重建做到极致,确保隐空间有一个高保真的“底座”。
  • 阶段II(修轨道):冻结编解码器,只训练变分瓶颈层,用很弱的KL约束让隐变量的分布变得平滑规则(像正态分布靠拢),这样后续的语言模型才容易预测(生成),但又不至于偏离阶段I的“高保真区域”太远。
  • 阶段III(通心智):放开约束,引入强KL正则化,同时把WavLM等老师的语义知识“蒸馏”进来,并用ASR、情感识别等任务直接监督隐变量。这就像给一个只会模仿声音的“复读机”注入了理解语言和情感的大脑,使其既会说,又懂意思。

4. 实验与结果

  • 数据集/基准
  • 重构与合成:LibriSpeech, Seed-TTS-Eval, Emergent-TTS, EmoVoiceDB, FCaps等。
  • 统一建模:Emilia (TTS), LibriSpeech/AISHELL-1等 (ASR)。
  • 基线方法:Mel频谱、Semantic-VAE(侧重语义的连续分词器)、MingTok-Audio(专为AR+DiT设计的分词器)。
  • 主要实验结果
  • 重构:HoliTok在极其紧凑的表示下(25Hz, 128维,压缩比7.5x),取得了极具竞争力的保真度,并在说话人相似度(SPKSIM)和情感相似度(EMOSIM)上达到最佳。
  • 语音合成:在零样本TTS和可控TTS中,HoliTok的可学习性极佳,在表达力维度上击败GPT-4o-mini-TTS的胜率最高(53.6%),且可控性指标CLSP最优。
  • 统一建模(核心亮点):在统一的ASR+TTS任务中,Semantic-VAE生成崩溃(TTS WER>99%),MingTok-Audio生成严重退化(TTS WER约50%),而HoliTok-Unite是唯一能在统一架构下保持稳健的表示(TTS WER降至8.59%,ASR WER降至8.02%)。
  • 消融实验揭示
  • 仅靠强变分正则化不足以支撑统一建模;
  • 去掉语义蒸馏会损害副语言信息;去掉多任务监督则会导致生成能力大幅崩溃(类似于Semantic-VAE的失败);
  • 下游DiT模块使用TTS预训练初始化能显著提升生成质量,且HoliTok-Unite的语义编码器在微调时保持可训练比冻结效果更好。

5. 优势与局限

  • 主要优势
    1. 真正的统一接口:无需复杂的下游架构修补,同一套连续隐变量即可在共享参数网络中同时支撑高质量的语音生成与理解。
    2. 鱼与熊掌兼得:通过渐进式训练,成功跨越了“高保真重建”与“语义可学习性”之间的鸿沟。
    3. 极高的压缩效率:以极低的帧率(25Hz)和维度(128-dim)实现了不输甚至部分超越高冗余Mel谱的性能。
  • 局限性
    1. 领域泛化性未充分验证:实验主要围绕语音(说话)展开,尚未系统验证该分词器在环境音、音乐等更广泛音频领域的统一建模能力。
    2. 架构依赖性:下游评估仅基于AR+DiT架构,未探索纯DiT或非自回归等其他统一建模范式,表示的普适性有待考察。

6. 关键结论与启发

  • 最重要的Takeaway:语音分词器的“可解码性”、“可学习性”和“语义丰富度”并非不可兼得,关键在于训练策略的顺序与节奏——必须先建立高保真的解码底座,再逐步引入结构化约束和语义监督,而不是一步到位。
  • 对后续研究的启发
    1. 分词器设计重于下游修补:与其在下游模型中堆叠模块来弥补表示空间的缺陷,不如将精力投入到构建一个“整体性”的表示空间,这能大幅简化统一基础模型的设计。
    2. 评估标准的转变:评估语音分词器不应仅看重构指标或单一任务表现,必须在“共享参数的统一生成-理解架构”中进行压力测试,才能暴露其真实短板。
    3. 延伸方向:将HoliTok的渐进式训练范式推广至通用音频(音乐、环境音)建模;探索HoliTok与全非自回归等更高效架构的兼容性。
#36
eess.AScs.SD
Seoul National University (QS Top 100)KAIST - Korea Advanced Institute of Science & Technology (QS Top 100)

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS 跨领域

Deokjin Seo, Gangin Park, Kihyun Nam
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: 8 pages, 4 figures, 9 tables
查看摘要
We present Chatterbox-Flash, a zero-shot text-to-speech model obtained by fine-tuning a pretrained autoregressive TTS decoder into a block-diffusion decoder, enabling parallel token generation within each block while retaining block-by-block streaming. We find that naively transferring mainstream block-diffusion decoding to discrete speech tokens degrades quality, as a long-tail token distribution biases parallel position selection toward a few high-frequency tokens. To mitigate this without architectural modification, we introduce two inference-time techniques: prior-calibrated scoring, which subtracts the block-level marginal token distribution, and an early-decoding schedule, which adaptively terminates iteration based on calibrated confidence. On standard zero-shot TTS benchmarks, Chatterbox-Flash attains high-fidelity synthesis comparable to strong autoregressive and non-autoregressive baselines, while supporting streaming inference with time-to-first-packet on par with streaming AR systems and substantially lower real-time factor. Code and audio samples are available at this https URL .

📖 深度解读

1. 一句话总结

本文提出了Chatterbox-Flash,一个通过将自回归TTS模型微调为块扩散模型来实现流式零样本语音合成的方法,并引入先验校准评分和早停解码机制,成功解决了离散语音token长尾分布导致的并行生成质量下降问题,在保持与自回归模型相当音质的同时大幅降低了推理延迟。

2. 研究背景与动机

  • 核心问题:如何让零样本TTS系统在保持高音质和流式输出能力的同时,大幅降低生成延迟(即提高并行生成效率)?
  • 重要性:自回归(AR)模型虽然音质好且支持流式,但token必须逐个生成,延迟随音频长度线性增长,无法满足实时交互需求;非自回归(NAR)模型虽然能并行生成,但通常需要整句生成完毕才能输出,不支持原生流式。
  • 现有不足:主流的离散扩散语言模型(DLM)和块扩散技术虽然在文本生成上取得了成功,但直接迁移到离散语音token上会导致音质严重退化。原因是语音codec存在严重的“长尾分布”(少数高频token如静音占据了极大比例),导致模型在并行选择位置去噪时,总是优先选择这些高频但缺乏上下文信息的token,一旦在块边界处选错,就会破坏后续所有生成的声学连续性。

3. 核心方法

  • 提出框架:Chatterbox-Flash。它保留了原有自回归TTS模型的架构,仅将训练目标替换为掩码去噪,将AR解码器转化为块扩散解码器。推理时按块自回归(左到右),块内并行生成。
  • 关键创新点
    1. 混合注意力与互补掩码训练:条件前缀保持因果注意力以维持预训练特征,语音块内使用双向注意力,块间因果;训练时使用互补掩码确保每个token都被充分监督。
    2. 先验校准评分:一种推理时修正技术。在决定块内哪些位置优先去噪时,不再单纯依赖模型的置信度,而是减去一个“无条件先验分布”(即该token在全局的边缘概率)。直觉上,这就像在考试评分时“扣除基础分,只看附加分”,过滤掉静音等高频token的虚假高置信度,让模型优先提交真正依赖上下文的难词。
    3. 早停解码调度:基于校准后的置信度分数,自适应决定每步去噪多少token。当块内剩余token的置信度足够高时,提前终止迭代,从而节省计算量。

4. 实验与结果

  • 数据集/基准:LibriSpeech-PC test-clean 和 Seed-TTS test-en(零样本语音克隆基准)。
  • 基线方法:强AR模型(IndexTTS2, CosyVoice3, Qwen3-TTS等)和NAR模型(F5-TTS, MaskGCT, OmniVoice等)。
  • 主要实验结果
  • 音质匹配:Chatterbox-Flash在音质(UTMOS)和说话人相似度(SIM-o)上与强AR/NAR基线持平甚至更优,且是对比中唯一原生支持流式推理的NAR系统
  • 延迟大幅降低:与流式AR模型Qwen3-TTS相比,首包时间(TTFP)相当(~118ms vs 138ms),但实时率(RTF)降低了约2.4-2.7倍(0.107 vs 0.253),意味着生成速度可达实时的9倍以上。
  • 修正致命缺陷:直接使用Fast-dLLM v2的解码方式会导致WER飙升至15%以上,而引入先验校准(PMI)后WER降至1.67%。
  • 消融实验揭示
  • PMI在常规朗读数据集上与普通调度音质持平,但其核心价值在于提供了校准的置信度信号,使得早停解码成为可能,平均减少20%的去噪步数且不损失质量。
  • 在更难的EmergentTTS-Eval(包含生僻发音、副语言特征)上,PMI直接带来了10.6%的WER相对降低,证明其在困难样本上能有效抑制长尾偏差。

5. 优势与局限

  • 主要优势
    1. 兼顾音质与流式效率:巧妙结合了AR的流式特性和NAR的并行特性,在极低延迟下实现了高保真合成。
    2. 即插即用的推理修正:先验校准评分无需修改模型架构或额外前向传播,仅通过缓存一个无条件先验分布即可消除长尾偏差。
    3. 高效的计算分配:早停机制允许模型在简单音频段快速跳过,将算力集中在复杂部分。
  • 局限性
    1. 块大小扩展受限:当块大小扩展到较大(D≥128)时模型会崩溃,且全因果或自蒸馏等替代方案会导致韵律崩塌或采样极度敏感,与全序列扩散模型的并行度差距仍然存在。
    2. 先验校准的直接收益有限:论文承认,在计算预算充足的标准测试集上,PMI相比普通调度并没有直接提升客观指标,其主要作用仅是服务于早停机制(在困难集上除外)。
    3. 数据贡献未剥离:为了训练稳定性,使用了混合数据集,未单独剥离各数据源对最终效果的贡献。

6. 关键结论与启发

  • 最重要的Takeaway:将自回归TTS转化为块扩散模型以实现流式并行生成是可行的,但必须解决离散语音token特有的“长尾高频token霸权”问题;通过先验校准剥离边际概率偏差,是解锁高质量并行生成的关键。
  • 对后续研究的启发
    1. 扩散模型的置信度校准:在其他模态(如视频、音乐)的离散扩散生成中,如果也存在类似的长尾分布,先验校准(PMI)可能成为一种通用的去偏策略。
    2. 块大小的缩放定律:如何突破块大小的限制(D>128),使得块扩散模型既能保持韵律多样性,又能接近全序列模型的一次性生成能力,是一个重要的开放性问题。
    3. 流式扩散的工程优化:论文中提到的“前缀KV缓存复用”、“早发块服务”等工程实践,为后续开发生产级流式扩散模型提供了宝贵的参考范式。
查看摘要
Face-to-face speech comprehension is inherently multimodal, integrating acoustic signals with visible articulation, facial expression, head motion, and other socially relevant cues. While audiovisual speech systems typically focus on the mouth region as the primary visual source of linguistic information, affective facial expressions are often treated separately as emotion-recognition targets. This paper investigates whether upper-face affective information contributes to audiovisual sentence recognition beyond audio and mouth-region cues, particularly under acoustic degradation. Using the CREMA-D audiovisual emotional speech corpus, we train feature-based sentence classifiers under four cue conditions: audio only (A), audio plus mouth/lower-face features (A+M), audio plus upper-face features (A+U), and audio plus both mouth and upper-face features (A+M+U). Models are evaluated on clean audio and pink-noise conditions at +10 dB, +5 dB, and 0 dB SNR using actor-independent splits. Results show that mouth/lower-face features provide substantial robustness benefits under degraded audio. At 0 dB SNR, A+M improves accuracy over A by 0.0794, with an actor-bootstrap 95% confidence interval of [0.0296, 0.1298]. Upper-face affective cues exhibit a more nuanced effect. Although the direct accuracy gain of A+M+U over A+M is small, full-face models consistently improve calibration across SNR levels and outperform shuffled upper-face controls under noisy conditions. These findings suggest that affective facial information may support multimodal robustness and confidence estimation under acoustic uncertainty without directly encoding lexical content. More broadly, the study highlights the potential role of socially expressive facial cues in human-centered audiovisual interaction systems.

📖 深度解读

1. 一句话总结

本文通过控制性实验发现,在嘈杂环境下进行音视频句子识别时,除了嘴部动作提供明显的识别增益外,上半脸的情感线索虽不能直接提升识别准确率,但能显著改善模型的置信度校准和抗噪鲁棒性。

2. 研究背景与动机

  • 核心问题:在音频受损(如环境嘈杂)的情况下,上半脸(眉眼、额头)的情感表情信息是否能在嘴部视觉发音线索之外,为音视频句子识别提供额外的帮助?
  • 重要性:面对面交流本质上是多模态的,人类在听不清时会自然结合对方的面部表情来理解语义。构建能在真实嘈杂环境下稳健运行的多模态AI系统,需要全面理解不同面部区域的具体贡献。
  • 现有不足:传统的音视频语音识别系统几乎只关注嘴部区域(因为与发音直接相关);而情感计算领域通常把面部表情单独作为情绪分类的目标。两者割裂,导致现有系统忽略了“情感表情可能作为上下文线索辅助语言理解”的潜在价值。

3. 核心方法

  • 提出框架:多模态线索消融框架。将面部视觉信息拆分为“嘴部/下半脸发音线索”和“上半脸情感线索”,在多种噪音水平下评估它们对句子识别的贡献。
  • 关键创新点
    1. 面部区域解耦:不把脸当成一个整体,而是拆分为发音区(嘴/下巴)和情感区(眉眼/额头),独立评估其贡献。
    2. 打乱控制组:在保持特征数量和类型不变的前提下,故意打乱上半脸特征与当前音频片段的对应关系,以排除“特征数量增加”或“说话人特定模式”带来的虚假提升。
    3. 多维评估体系:不仅看准确率,还引入了期望校准误差(ECE)来评估模型对自己预测的“自信程度”是否靠谱。
  • 核心思路(直觉解释):就像我们在嘈杂的酒吧里听朋友说话,看嘴唇怎么动(嘴部线索)能直接帮我们猜出词语;而朋友皱眉或瞪眼(上半脸线索)虽然不直接代表某个词,但能给我们提供“这很重要”或“他在生气”的上下文,让我们对自己的猜测更有底气。研究通过线性分类器提取特征,在4种音频条件(干净、+10dB、+5dB、0dB噪音)下对比了4种输入组合(A, A+M, A+U, A+M+U)。

4. 实验与结果

  • 数据集:CREMA-D(包含91位演员、12个句子类别、6种情绪的音视频语料库)。
  • 基线方法/对比条件:纯音频(A)、音频+嘴部(A+M)、音频+上半脸(A+U)、音频+全脸(A+M+U),以及打乱上半脸的A+M+U控制组。模型采用简单的多项式逻辑回归。
  • 主要实验结果
  • 嘴部线索是硬核支撑:噪音越大,嘴部线索越管用。在0 dB极噪下,A+M比纯A的准确率高出7.94%(95% CI [0.0296, 0.1298])。
  • 上半脸线索对准确率提升有限:在0 dB下,全脸(A+M+U)比仅嘴部(A+M)的准确率仅微升1.05%,且置信区间跨零(95% CI [-0.0052, 0.0254]),说明不显著。
  • 上半脸线索显著改善校准:在所有噪音级别下,加入上半脸特征都降低了ECE(模型预测置信度更准)。
  • 消融/控制实验揭示:在0 dB噪音下,对齐的A+M+U比打乱上半脸的A+M+U准确率高3.05%,对数损失低0.0889。这强有力地证明了:上半脸信息的作用不是由于增加了特征数量,而是其对齐的情感上下文在起作用

5. 优势与局限

  • 主要优势
    1. 实验设计严谨:通过“打乱控制组”巧妙排除了特征冗余和说话人身份泄露的干扰,证实了上下文对齐的价值。
    2. 视角新颖:打破了“上半脸只管情绪、下半脸只管语音”的传统割裂思维,用校准和鲁棒性指标重新定义了情感线索在语音识别中的作用。
    3. 结论克制且合理:没有夸大上半脸的作用,明确指出它不直接编码词汇内容,而是作为不确定性估计的辅助上下文。
  • 局限性
    1. 任务与模型过于简化:仅是12个句子的封闭集分类,且使用的是片段级特征+线性分类器,缺乏端到端模型对时序和非线性交互的捕捉能力。
    2. 数据生态效度不足:CREMA-D是演员表演的短句,并非自然对话,缺乏真实交互中的注意力、意图等更丰富的社交信号。
    3. 特征提取工具局限:使用MediaPipe提取混合形变特征,而非专业的面部动作编码系统(FACS,如OpenFace),可能遗漏了更精细的面部肌肉动作细节。

6. 关键结论与启发

  • 最重要的Takeaway:在音视频语音识别中,上半脸的情感信息不是“词汇编码器”,而是“置信度调节器”。它不能直接告诉你对方说了什么,但能在你听不清时,帮你更好地判断“我猜得对不对”。
  • 对后续研究的启发
    1. 系统设计层面:未来的多模态人机交互系统不应只盯着用户的嘴,也不应把面部表情仅用于情绪识别,而应将上半脸情感信号作为噪音环境下的不确定性估计和鲁棒性增强模块融入语音处理流程。
    2. 研究方法层面:在评估多模态AI时,除了准确率,应更多关注校准等反映模型认知状态的指标;同时,“打乱控制组”的方法可广泛应用于其他多模态对齐贡献的验证中。
    3. 延伸方向:可以在更复杂的端到端模型、自然对话数据集上验证该结论,并探索除情感外的其他社交信号(如注意力、意图)是否具有类似的“置信度调节”作用。
查看摘要
Modern audio processing networks are commonly deployed on accelerators whose peak throughput is obtained through dense linear algebra, whereas conventional acoustic frontends -- a Short-Time Fourier Transform (STFT) followed by sparse Mel aggregation -- remain structurally heterogeneous. This mismatch can introduce memory-bandwidth, dispatch, and intermediate-allocation overheads on contemporary accelerator backends. This work introduces MelT, a single-stage frontend framework in which Mel-spaced Non-Uniform Discrete Fourier Transform (NDFT) bases are precomputed and applied to time-domain acoustic frames through dense General Matrix Multiplication (GEMM) operations. The contribution is not the NDFT operator itself; rather, it is the formulation of Mel-spaced NDFT projection as a GEMM-native audio frontend and its evaluation as a hardware-efficient alternative to conventional STFT+Mel pipelines. Evaluated across platforms ranging from Apple A18 Pro edge hardware to NVIDIA H100 datacenter acceleration, MelT attains up to a $3.75\times$ speedup in inference latency and a $3.52\times$ reduction in energy consumption while maintaining downstream classification accuracy.

📖 深度解读

1. 一句话总结

本文提出了一种名为MelT的单阶段音频前端框架,通过将传统的“STFT+Mel滤波”多级流水线重构为基于密集矩阵乘法(GEMM)的非均匀离散傅里叶变换(NDFT),解决了传统音频特征提取与现代AI加速器硬件不匹配的问题,在保持模型精度的同时大幅提升了推理速度并降低了能耗。

2. 研究背景与动机

  • 核心问题:现代深度学习音频系统通常部署在专为密集矩阵乘法优化的硬件加速器(如GPU的Tensor Core、Apple的矩阵协处理器)上,但传统的音频前端(STFT+稀疏Mel滤波器组)却是为Cooley-Tukey FFT算法设计的多级异构流水线,两者存在严重的硬件不匹配。
  • 为什么重要:这种不匹配会导致在推理时产生额外的内存带宽消耗、内核调度开销、中间张量分配以及矩阵硅片利用率低下,严重拖累了端到端音频系统的整体吞吐量。
  • 现有方法不足
    1. 传统流水线:STFT产生均匀的频谱再进行稀疏Mel聚合,步骤繁琐且不利于加速器并行。
    2. 可学习前端(如LEAF):虽然替代了固定流水线,但计算开销极大(是传统Mel的300倍),且往往无法稳定超越固定的Mel滤波器组。
    3. 已有时域方法(如TMFWC):虽然概念上类似,但缺乏明确的NDFT数学框架,也没有针对加速器的GEMM实现和跨平台能耗评估。

3. 核心方法

  • 提出框架:MelT(及其倒谱扩展MFCCT)。它摒弃了“先做均匀FFT再聚合”的传统思路,直接在目标Mel频率坐标上进行投影,并将整个计算过程融合为一次或几次密集矩阵乘法(GEMM)。
  • 关键创新点
    1. GEMM原生的Mel前端:将Mel频率的NDFT投影公式化为密集矩阵乘法,把窗函数吸收进预计算的投影矩阵中,使特征提取完全契合现代加速器的执行路径。
    2. 代数不等价性分析:明确指出MelT的“相干直接投影”(先投影再求能量)与传统STFT+Mel的“非相干后聚合”(先求能量再加权求和)在代数上并非严格等价,但实验证明这种差异不影响下游任务。
    3. 跨平台硬件级能耗评估:首次在音频前端领域引入芯片级功耗遥测(NVIDIA的NVML和Apple的powermetrics),将能耗而非仅仅延迟作为核心评估指标。
  • 直觉解释:传统方法就像是用一把刻度均匀的尺子量完所有尺寸后,再把需要的尺寸拼凑起来(多步、有中间产物);而MelT相当于定制了一把刻度刚好就在Mel频率上的尺子,直接一量就得到结果,并且这个“量”的动作是用加速器最擅长的“矩阵乘法”一步完成的。

4. 实验与结果

  • 数据集/基准
  • 系统基准:LibriSpeech语音信号(1s-160s)。
  • 下游任务:VoxCeleb1(性别分类)、SPIRA(COVID-19临床呼吸音检测)。
  • 硬件平台:覆盖边缘到数据中心,包括Apple A18 Pro、Apple M4 Pro、NVIDIA V100、NVIDIA H100。
  • 基线方法:传统的STFT+Mel流水线以及传统MFCC。
  • 主要实验结果
  • 延迟:在160s长音频下,MelT在A18 Pro上实现最高3.75×的加速,在H100上实现1.92×加速。
  • 能耗:A18 Pro上能耗降低3.52×,H100上降低2.74×(H100上不仅时间短了,芯片实时功耗也从438W降至309W)。
  • 下游精度:在VoxCeleb1上,MFCCT与传统MFCC精度持平(97.84% vs 97.95%);在SPIRA临床任务上,MFCCT的F1 Score甚至从0.9737提升到了0.9860
  • 消融实验揭示了什么
  • Mel bins(M)的缩放影响:随着Mel bins数量增加,MelT的加速比下降(因为计算复杂度为O(NM))。在M=512时加速比降至1.01×(临界点),但在现代音频系统常用的M=40~128区间内,MelT始终保持显著优势。
  • 跨前端泛化:MFCCT(加入Log和DCT-II)同样保持了与MelT一致的加速和节能效果,证明GEMM原生的优势不局限于单一特征表示。

5. 优势与局限

  • 主要优势
    1. 极致的硬件对齐:将复杂的异构信号处理流水线转化为加速器最喜爱的密集矩阵乘法,显著减少内核调度和内存搬运。
    2. 显著的绿色AI效益:不仅大幅降低延迟,还通过硬件实测证明了极大幅度的能耗节约,对边缘设备和数据中心都极具价值。
    3. 精度无损甚至更优:尽管在数学上与传统流水线不完全等价,但在实际下游任务中保持了特征有效性,甚至在临床数据上表现更好。
  • 局限性
    1. 大M值下的扩展性受限:由于复杂度为O(NM),当Mel bins需求极高时,传统FFT的O(N log N)优势会凸显,MelT将不再有加速效果。
    2. 下游任务验证规模有限:论文仅在相对简单的分类任务(性别分类和二分类呼吸音检测)上验证了精度,缺乏在大型ASR(语音识别)或自监督模型预训练等更复杂任务上的验证。
    3. 特征不等价性的深层影响未明:虽然“相干投影”在实验中表现不错,但论文未深入分析这种信号处理层面的差异在更复杂模型中是否会带来潜在的负面效应。

6. 关键结论与启发

  • 最重要的Takeaway:在现代AI加速器时代,算法的“理论计算量(FLOPs)最小”不再等同于“实际运行最快”。针对硬件执行特性(密集矩阵计算)重新设计经典信号处理流水线,可以在不损失模型性能的前提下获得巨大的系统效率提升。
  • 对后续研究的启发
    1. 软硬件协同设计的延伸:这种“GEMM-native”的设计哲学可以推广到其他信号处理领域(如雷达、医学成像中的非均匀傅里叶变换),用理论复杂度换取硬件亲和度。
    2. 端到端音频系统的重构:未来的音频大模型可以直接将MelT作为可导的初始层,甚至与后续的Transformer/Conv层联合优化,省去特征提取与模型推理之间的内存壁垒。
    3. Green AI的评估标准:后续研究应更多采用芯片级功耗遥测来评估推理能耗,而非仅依赖延迟或理论算力来估算“绿色”程度。
#39
cs.SD
Alibaba (World Famous IT Company)

UniVocal: Unified Speech-Singing Code-Switching Synthesis

Yufei Shi, Qian Chen, Wen Wang, Xiangang Li, Zhen-Hua Ling 等 (6 人)
Sound (cs.SD)
Comments: accepted by ACL 2026
查看摘要
We propose UniVocal, a unified framework that implicitly infers vocal modes from text context to pioneer Speech-Singing Code-Switching (SCS) Synthesis - a task where transitions are autonomously driven by textual semantics, akin to seamless human language blending. Unlike single-mode generation or systems relying on switching-control tags, our proposed UniVocal implicitly infers vocal modes solely from text context. To achieve this, we employ a data-efficient two-stage curriculum learning strategy that progressively trains a competitive TTS system to acquire the desired SCS capability. Addressing data scarcity, we introduce a scalable pipeline to synthesize diverse code-switching data that is both semantically and acoustically natural, alongside a new multi-scenario benchmark, SCSBench. To address limitations of semantic tokenizers in capturing acoustic details, we also introduce refined cent token and Chain-of-Thought (CoT) generation for planning prosody before content generation, effectively enhancing empathetic speech generation and singing melody. Experimental results demonstrate that UniVocal achieves state-of-the-art performance on SCSBench while maintaining competitive performance on regular speech and singing tasks. Audio samples are available at this https URL . The code and dataset are released at this https URL .

📖 深度解读

1. 一句话总结

本文提出了UniVocal框架,首次实现了无需显式控制标签、仅凭文本语义就能在语音和歌声之间自然切换的合成任务,并通过“先规划韵律再生成内容”的思路提升了情感表达与旋律质量。

2. 研究背景与动机

  • 核心问题:如何在一个生成过程中,根据文本语义自动实现语音与歌声的无缝切换(Speech-Singing Code-Switching, SCS)。
  • 重要性:在人类日常交流中,常常会在说话时自然地哼唱或插入旋律(如讲故事时哼个小调),这是一种本能且富有表现力的沟通方式,但现有的AI语音系统无法实现这种自然过渡。
  • 现有方法不足
    1. 专用模型割裂:TTS模型缺乏旋律感,歌声合成(SVS)模型缺乏自然语言的韵律灵活性,两者无法混用。
    2. 统一模型需显式控制:现有的统一音频生成模型(如Bark)虽然能生成两种模式,但必须依赖人工添加的标签(如[sing])来强制切换,缺乏对文本语义的感知能力,且切换生硬。
    3. 数据匮乏:现实中几乎不存在高质量的“说唱切换”配对数据。

3. 核心方法

  • 提出框架:UniVocal,基于CosyVoice 2构建的统一语音-歌声生成框架。
  • 关键创新点
    1. 精细化音分标记与思维链生成:传统语义tokenizer会丢失音高细节。本文将频率转换为对数音分尺度,并取模映射到1200个离散token(精度达1音分),在生成时采用“先预测音高token,再预测语义token”的交错生成策略。这就像“先搭骨架再填血肉”,让模型在生成具体内容前先规划好韵律走向。
    2. 可扩展的数据合成流水线:用LLM生成语义连贯的“说唱切换”剧本(包含显式触发词如“让我想起一段旋律”和隐式语义边界),再用对齐后的模型合成音频,解决了SCS数据稀缺问题。
    3. 两阶段课程学习:第一阶段用4:1的歌语料比对TTS模型进行继续预训练,对齐语音和歌声的潜空间分布;第二阶段用1:1:1的语音、歌声、合成切换数据进行微调,防止灾难性遗忘并掌握切换能力。
  • 直觉解释:就像培养一个只会朗诵的演员学唱歌。先让他听大量歌曲找乐感(Stage 1 对齐);然后给他一些边说边唱的剧本让他练(Stage 2 微调);同时教他一个诀窍——开口前先在脑子里哼准音高再吐字(CoT生成),这样不仅唱得准,连说话的情感都更丰富了。

4. 实验与结果

  • 数据集/基准:构建了SCSBench(包含隐式、显式和混合提示的测试集),以及常规的SeedTTS、GTSinger等。
  • 基线方法:级联系统(Gemini切分文本 + Bark合成,或 Gemini + CosyVoice 2 + LeVo合成)。
  • 主要结果
  • SCS任务:在SCSBench-Mixed上,UniVocal的客观切换F1达到0.871,主观F1达到0.810,大幅超越级联基线;且在切换时音色一致性(内部相似度)远优于拼接系统。
  • 常规任务:在零样本TTS上保持竞争力(UTMOS第一);在文本共情测试中,情感表达(E-MOS)比CosyVoice 2基线提升0.48,媲美商业系统ElevenLabs;在长歌声合成中,自然度和音乐性主观评分超越Vevo 1.5。
  • 消融实验揭示
  • CoT的作用:去掉CoT后,切换F1虽微升,但语音情感(E-MOS降0.23)和歌声音乐性(M-MOS降0.32)大幅下降,证明“先规划音高”对表现力至关重要。
  • 课程学习的必要性:去掉两阶段策略直接混合训练,切换F1暴跌至0.496,证明必须先对齐分布才能学会复杂切换。
  • 共情能力的来源:共情能力的提升不仅来自CoT,还源于Stage 1中多样化的歌声数据解锁了模型潜在的情感表征。

5. 优势与局限

  • 主要优势
    1. 语义驱动的无缝切换:摆脱了显式标签依赖,实现了更符合人类直觉的“文本语义决定发声模式”。
    2. 统一架构的高一致性:单一模型生成避免了级联系统带来的音色漂移和拼接感。
    3. 一石二鸟的CoT设计:音高规划不仅提升了歌声旋律,还意外解锁了更强的语音情感表现力。
  • 局限性
    1. 训练数据质量受限:歌声数据来自Suno的分离提取,带有电音伪影和歌词对齐误差,限制了合成音质上限。
    2. 纯隐式切换仍有困难:在完全依赖语义差异(无显式触发词)的场景下,模型容易将歌词误判为对白,目前仍需轻微的显式触发词辅助。
    3. 评估指标的局限:由于切换片段通常很短,F1分数常退化为0或1的二元结果,导致自动评估指标在样本级的相关系数偏低,难以捕捉细微的质量差异。

6. 关键结论与启发

  • 最重要的Takeaway:语音和歌声并非不可逾越的孤立模态,通过对齐潜空间并引入“先规划音高后生成内容”的思维链机制,模型不仅能学会基于语义在两者间自由切换,还能产生跨模态的正向增益(即学唱歌让说话更有感情)。
  • 对后续研究的启发
    1. 数据构建方向:利用LLM生成语义边界模糊的剧本是解决多模态交织数据稀缺的有效范式,可扩展至“哭笑切换”、“耳语与呼喊切换”等场景。
    2. 生成范式方向:CoT在音频生成中的应用潜力巨大,将韵律/旋律等高层属性显式化并优先预测,可作为提升各类音频生成模型表现力的通用策略。
    3. 未来延伸:如何进一步缩小合成数据与真实复杂场景的分布差距,实现完全无显式锚点的纯隐式语义切换,是该领域下一个值得攻克的难点。
#40
cs.SD

HAIM: Human-AI Music Datasets for AI Music Production Tracking Benchmark

Seonghyeon Go, Yumin Kim
Sound (cs.SD); Artificial Intelligence (cs.AI)
查看摘要
As generative platforms such as Suno and Udio reach human-grade audio quality, the scope of AI's utility has expanded across the entire music production workflow. Beyond simple track generation, these advancements have catalyzed the adoption of AI-driven methodologies in diverse forms. These include vocal synthesis, arrangement, and professional mastering. However, current detection research remains largely confined to a binary `AI-or-human' paradigm. It fails to reflect the realities of contemporary music production workflows. In real-world production, AI tools are increasingly used to refine or master human-produced tracks, and human engineers likewise post-process AI-generated material to ensure professional quality. Moreover, users often employ adversarial tactics to bypass AI detectors, such as applying human mastering to AI-generated tracks. This creates a grey area that a simple binary classification fails to capture. In this paper, we define and investigate ``AI Music Tracking'': the challenge of identifying specific AI integration across the multifaceted spectrum of music production. To this end, we introduce HAIM, a dataset with diverse labels for stages of music production. It is designed to isolate stages of AI intervention, including hybrid production and agent-level tracking. Our evaluation of state-of-the-art detectors reveals systemic flaws. By releasing HAIM, we propose a new benchmark that shifts the field beyond binary classification toward a granular, structured evaluation of AI music.

📖 深度解读

1. 一句话总结

本文提出了“AI音乐追踪”这一新任务,并构建了HAIM数据集,将AI音乐的识别从简单的“人/AI二分类”推进到对音乐制作流程中各环节(作曲、作词、演唱、混音)AI参与度的细粒度多标签追踪。

2. 研究背景与动机

  • 核心问题:现有的AI音乐检测研究局限于“非黑即白”的二分类(整首曲子要么是人类作,要么是AI作),但这脱离了现代音乐制作的现实。
  • 重要性:在真实的音乐工业中,AI常被用作工具融入制作流程(如AI作曲+人声演唱、人作曲+AI混音),甚至有人故意用人类混音来掩盖AI生成的痕迹以逃避平台检测。法律(如欧盟AI法案)和版权纠纷也需要明确AI参与的“程度”和“环节”,而不仅仅是一个是否的判断。
  • 现有不足:当前最先进的检测系统(如Deezer、IRCAM等)在纯AI/纯人类音频上准确率极高(可达99.8%),但面对“人机协作”的混合音频时,不仅表现未知,且根本无法输出AI具体参与了哪些环节的信息。

3. 核心方法

  • 提出框架:论文定义了“AI音乐追踪”任务,并构建了HAIM数据集及基线模型。
  • 关键创新点
    1. 多维度的分类法:将音乐制作拆解为四个核心角色(作曲、作词、演唱、音频工程师),为每首曲目打上多标签,而非单一标签。
    2. 精细的混合场景构建:数据集不仅包含纯人类(A1)和纯AI(A2),还构建了三大类混合场景:后期混合(如AI母带处理、人类混音掩盖AI痕迹)、组件混合(如AI翻唱、人类作词+AI生成)、时间混合(人声与AI音频的拼接或交叉淡入淡出)。
    3. 零样本时序定位能力:模型不仅能判断角色,还能在时间轴上定位AI片段的边界。
  • 核心思路直觉解释:以前的检测就像只判断一道菜是不是机器做的,现在则是要尝出这道菜里,哪几种食材是机器种的,哪几步烹饪是厨师做的,甚至还能指出菜盘里哪一半是机器做的。模型通过将长音频切片,提取每个切片的特征,再融合分析,从而同时实现“角色追踪”和“时间定位”。

4. 实验与结果

  • 数据集:HAIM,包含19.6万条音轨,分为13个子类别(涵盖纯人类、纯AI、9种混合模式、2种时间混合模式)。
  • 基线方法:Deezer模型、SpecTTTra、CLAM、FST,以及本文改进的MuQ-FST。
  • 主要实验结果
  • 二分类检测的系统性崩溃:现有检测器在面对混合音频时表现混乱。例如,人类混音的AI曲目(B3/B4)很容易骗过FST(检测率仅2.2%-4.4%),而AI母带处理的人类曲目(B1)则几乎不被任何模型识别为AI。
  • MuQ-FST表现:在纯AI检测上达到99.8%,在多标签追踪任务中,能较准确识别作曲、演唱和工程师角色的AI参与(如B3/B4中工程师角色预测为0%),但在“作词”角色上彻底失效。
  • 消融/深入实验揭示
  • 作词角色不可解:模型无法仅通过声学特征区分人类还是AI写了歌词,即便显式监督训练也无效,说明必须引入文本/ASR等辅助模态。
  • 时序定位:利用切片特性,MuQ-FST在无需额外训练的情况下,实现了对拼接/交叉淡化音频中AI边界的零样本定位,边界F1分数在拼接场景下达0.914。

5. 优势与局限

  • 主要优势
    1. 理念超前:首次将AI音乐检测从“二分类”升维到“多角色追踪”,高度契合当前AI辅助创作的现实。
    2. 场景丰富:数据集涵盖了现实中逃避检测(人类混音掩盖AI)和常见创作模式(AI翻唱、AI变奏)的多种灰度场景。
    3. 附加能力:模型自然衍生出了时序边界定位的能力,解释性更强。
  • 局限性(论文如实说明):
    1. 生成器单一与过拟合风险:混合数据集(Group B)大多基于单一模型(ACE-Step-1.5)生成,且人类混音使用了固定模板,模型可能只是记住了特定生成器或插件的“指纹”,而非真正理解了“人类混音”的泛化特征。
    2. 角色粒度不足:作曲角色将编曲和旋律写作混为一谈,实际中这两者可由人机分别完成。
    3. 声学特征的局限:纯声学模型无法判断“作词”归属,存在模态天花板。

6. 关键结论与启发

  • 最重要的Takeaway:AI音乐检测的“二分类时代”已经过时。在AI作为工具深度融入工作流的今天,简单的“是不是AI”不仅难以判断,也不再是正确的问题,我们应该追问“AI在哪里、参与了多少”。
  • 对后续研究的启发
    1. 多模态融合:未来追踪系统必须结合ASR(语音识别)和歌词文本分析,才能解决“作词人”的归属问题。
    2. 鲁棒性与攻防:人类后期处理(混音/母带)是对抗检测的强有力手段,未来的检测研究应将此类混合场景作为对抗鲁棒性的标准测试床。
    3. 细粒度归因:研究可向更细的粒度延伸,如MIDI级别的和弦归因、音轨级别的音源分离检测,以及结合大语言模型(LLM)进行可解释的推理归因。
#41
cs.SD

JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions

Jiashuo Yu, Yao Yao, Boyu Chen, Alex Wang
Sound (cs.SD); Artificial Intelligence (cs.AI); Computer Vision and Pattern Recognition (cs.CV)
查看摘要
We address the challenge of generating high-fidelity, long-form soundtracks that remain coherent across scene transitions. Existing AI music systems are mainly designed for short, isolated clips and lack mechanisms to ensure narrative continuity. We present JenBridge, a modular and interpretable framework for adaptive long-form video soundtracking that ensures both high-fidelity audio generation and transition naturalness. The core architecture is a Transformer-based generative model trained with a flow-matching objective, following a two-stage paradigm: pretraining on large-scale text-audio corpora to establish robust musical priors, then adapting to the video domain with dual text-visual conditioning for precise cross-modal alignment. Crucially, to achieve long-form coherence across diverse scene changes, JenBridge incorporates a novel adaptive transition mechanism. This system features a versatile toolkit of transition styles, including a generative transition method, and uniquely employs a Large Language Model (LLM) Agent that acts as a director to select the most appropriate transition for each narrative shift intelligently. To rigorously assess this task, we propose the LVS Benchmark, a new benchmark that includes a curated dataset and novel evaluation metrics focusing on holistic and transition-aware assessment. Extensive experiments on the proposed benchmark demonstrate that JenBridge significantly outperforms existing methods in both objective and subjective metrics, particularly in terms of transition naturalness and overall narrative coherence. JenBridge represents a significant step towards fully automated, professional-quality video soundtracking.

📖 深度解读

1. 一句话总结

本文提出了JenBridge框架,通过“分段生成+LLM智能导演选择过渡方式”的策略,解决了长视频配乐中场景切换时音乐过渡不自然、缺乏叙事连贯性的问题。

2. 研究背景与动机

  • 核心问题:如何为包含多个场景切换的长视频生成既具有高保真度,又能在场景转换时保持叙事连贯性和音乐自然过渡的长配乐。
  • 重要性:自动视频配乐在实际影视制作中需求巨大,但真实的视频通常充满动态的场景变化,音乐需要跟随画面情绪和节奏演变,而非一成不变。
  • 现有方法不足:现有的AI音乐生成系统(尤其是Video-to-Music模型)大多只能针对单一、短小的片段生成孤立的音乐,缺乏处理场景转换的机制;如果硬性拼接,会导致听觉上的割裂感;而直接让模型处理长视频,又难以维持高质量的音画对齐和音乐结构。

3. 核心方法

  • 提出框架:JenBridge,一个模块化、可解释的长视频自适应配乐框架。
  • 关键创新点
    1. 视觉到音乐的提示词翻译器(VMPT):利用微调的LLM将视频的视觉描述自动转化为包含流派、乐器、情绪、BPM等结构化信息的音乐提示词,解决视频-音乐数据集中缺乏精细音乐标注的问题。
    2. 自适应过渡机制:提供了一个包含四种风格(硬切、静音间隙、淡入淡出、生成式过渡)的过渡工具包,并由一个LLM Agent(智能导演)根据前后场景的视觉和音乐上下文,自动选择最合适的过渡方式。
    3. 基于ControlNet的生成式过渡:针对缺乏专门的音乐过渡训练数据的问题,利用音频修复模型结合球面线性插值,在潜在空间和文本嵌入空间进行平滑过渡,无需专门训练即可生成连接前后段的“音乐桥梁”。
  • 核心思路直觉解释:就像给一部电影配乐,JenBridge不是一口气把整部电影的音乐瞎编出来,也不是每换个镜头就硬切音乐。它的工作流程像是一个专业配乐团队:先把电影按情节切开(分段),给每段情节写专属曲子(分段生成);最关键的是,它请了一位“AI导演”(LLM Agent),这位导演看着前后剧情,决定两段音乐之间是该突然停下(硬切)、留白喘口气(静音)、慢慢渐变(淡入淡出),还是专门写一小段过渡旋律把它们连起来(生成式过渡)。

4. 实验与结果

  • 数据集/基准:提出了首个长视频配乐基准 LVS Benchmark,包含120个多场景电影预告片(共3小时,567个场景),强调整体性和过渡感知评估。该基准不设“标准答案”配乐,而是评估生成音乐与视觉叙事的匹配度。
  • 基线方法:CMT (S/L), LORIS, AudioX, VidMuse (S/L)(S代表分段拼接,L代表直接处理长视频)。
  • 主要实验结果
  • 客观指标:在音画对齐上,JenBridge的ImageBind得分(0.224)比最强基线VidMuseS高出38%以上;在音乐制作复杂性(PC)上,比最强长视频基线高出2.27分,证明其过渡机制创造了更丰富的音乐结构。
  • 主观指标:在用户研究中,JenBridge的整体得分(4.3)远超所有基线,特别是在过渡自然度上得分4.2,比最强基线VidMuseL(2.5)高出1.7分,直接证明了自适应过渡机制的听感优势。
  • 消融实验揭示
  • 去掉自适应过渡(改为硬切),过渡得分从4.2暴跌至2.8;
  • 去掉视觉条件,音画对齐得分大幅下降(0.224降至0.171);
  • 去掉LLM导演(固定使用生成式过渡)或去掉球面插值,过渡自然度均出现明显下降,证明了每个组件的不可替代性。

5. 优势与局限

  • 主要优势
    1. 开创性地解决长视频过渡难题:首次在AI配乐中引入LLM作为导演来智能决策过渡方式,极大提升了长视频配乐的连贯性和专业感。
    2. 巧妙的零样本过渡生成:利用音频修复模型结合插值来实现生成式过渡,绕过了缺乏过渡音乐训练数据的痛点。
    3. 评估体系的创新:提出了不依赖“原声带对照”的LVS Benchmark,更符合配乐主观创作的本质。
  • 局限性
    1. 音质受限于公开数据集:虽然基础模型用了高保真私有数据,但在第二阶段适配视频时,由于公开视频-音乐数据集音质较差,导致最终模型的音质有所折损。
    2. 缺乏全局叙事规划与原声理解:LLM导演目前只看相邻的两个片段(局部决策),缺乏对整条视频长线叙事的规划;同时模型只看画面,听不到视频原声(如对话),在对话密集的场景中可能做出不合时宜的配乐选择。

6. 关键结论与启发

  • 最重要的Takeaway:长视频AI配乐的核心挑战不在于单纯拉长生成时间,而在于如何优雅地处理场景边界的音乐过渡;引入LLM进行高层语义决策(当导演)+ 生成模型进行底层信号合成(做乐手)的协同范式是非常有效的。
  • 后续研究启发
    1. 多模态感知融合:未来的配乐模型应引入自动语音识别(ASR)和音源分离技术,让“AI导演”能听懂视频中的对话和环境音,从而做出更聪明的配乐决策。
    2. 长上下文叙事规划:可以将现有的局部两两对比决策,升级为基于长上下文LLM的全局叙事规划,让配乐具有更宏观的起承转合。
    3. 高质量数据建设:亟需构建高保真、精细标注且版权合规的视频-音乐对齐数据集,以突破当前模型在视频适配阶段的音质瓶颈。
#42
cs.SD

MOSS-Audio Technical Report

Chen Yang, Chufan Yu, Hanfu Chen, Jie Zhu, Jingqi Chen 等 (25 人)
Sound (cs.SD); Artificial Intelligence (cs.AI)
查看摘要
MOSS-Audio is a unified audio-language model for speech, environmental sound, and music understanding, supporting audio captioning, time-aware question answering, timestamped transcription, and audio-grounded reasoning. MOSS-Audio couples a dedicated audio encoder with a modality adapter and a large language model: the encoder produces 12.5 Hz temporal representations, the adapter projects them into the decoder space, and the decoder generates autoregressive text outputs. Two design choices are central to the system: \textbf{DeepStack cross-layer feature injection}, which exposes the decoder to acoustic information from multiple encoder depths, and \textbf{time markers}, which provide explicit temporal cues by inserting timestamp markers into the audio-token stream. At the data level, we design an event-preserving audio annotation pipeline that segments raw audio at coherent event boundaries, applies branch-specific annotation to speech, music, and general audio, and merges the results into unified captions for pretraining. The intermediate branch-specific captions are further retained to support the construction of task-oriented SFT data. The model is pretrained on large-scale audio-language data, with time-aware objectives incorporated to support temporal grounding, and then undergoes multi-stage post-training to enhance instruction following and audio-grounded reasoning. We release 4B and 8B variants in both Instruct and Thinking configurations. MOSS-Audio achieves strong performance across general audio understanding, speech captioning, ASR, and timestamped ASR, positioning it as a promising understanding foundation for future voice agents.

📖 深度解读

1. 一句话总结

MOSS-Audio 提出了一个统一的音频-语言模型,通过跨层特征注入和显式时间标记技术,结合事件保留的分支数据标注管线,在单一框架内解决了语音、环境音和音乐的识别、描述与复杂推理问题。

2. 研究背景与动机

  • 核心问题:如何构建一个能够同时理解语音、环境音和音乐的统一音频大模型,使其不仅能转录内容,还能感知声学特征、定位事件时间并进行复杂推理。
  • 重要性:对于未来的语音智能体而言,音频模型不能仅仅是一个“语音转文字”的转录器,而必须是感知和推理的基础,需要同时理解用户意图、声学上下文和时间敏感事件。
  • 现有方法不足
    1. 表征瓶颈:现有模型多直接复用为ASR设计的语音编码器,倾向于丢弃韵律、情感等非词汇信息,且仅使用编码器最后一层输出,丢失了底层声学细节。
    2. 时间感知弱:模型通常依赖隐式的位置编码推断时间,在长音频中极不可靠,难以完成时间戳转录和时间敏感型问答。
    3. 数据割裂:不同音频任务(ASR、音频描述、音乐分析)依赖不同层级的声学抽象,现有数据处理常采用固定窗口切割,破坏了完整声学事件,且缺乏统一的多任务标注融合机制。

3. 核心方法

  • 提出框架:MOSS-Audio,采用“音频编码器-模态适配器-大语言模型”架构,发布了4B和8B两种规模,并区分了Instruct(指令执行)和Thinking(深度推理)两种配置。
  • 关键创新点
    1. DeepStack 跨层特征注入:不只用编码器最后一层,而是将编码器中间层的特征提取出来,通过合并适配器注入到语言模型的浅层。直觉上,这就像给大脑同时提供耳朵听到的原始振动细节(底层特征)和初步处理后的语义(高层特征),避免了信息在单一传输通道中的流失。
    2. 显式时间标记:在音频特征序列中,每隔2秒(对应25个12.5Hz的音频token)插入一个绝对时间数字(如“2”、“4”)。这让模型直接“看到”时间流逝,将时间定位从隐式推断变成了显式的复制与生成任务。
    3. 事件保留的分支数据管线:摒弃传统的固定时长裁剪,先通过声音事件检测找到自然边界进行切割,保留完整事件;然后分发给语音、音乐、环境音三个专业分支进行独立标注,最后通过路由与约束机制融合为统一描述。
    4. 分阶段后训练:区分了SFT(指令遵循)、推理冷启动(引入思维链范式)和强化学习(DAPO算法优化推理鲁棒性,减少幻觉)。

4. 实验与结果

  • 数据集/基准
  • 通用音频理解:MMAU, MMAU-Pro, MMAR, MMSU
  • 语音描述:自建的2000样本13维度语音描述基准
  • ASR:涵盖12个维度(方言、歌声、噪声等)的测试集
  • 时间戳ASR:AISHELL-1 (zh), LibriSpeech (en)
  • 基线方法:对比了开源的 Qwen2.5-Omni, Kimi-Audio, Audio Flamingo Next, Step-Audio 等,以及闭源的 GPT4o-Audio, Gemini-3-Pro 等。
  • 主要结果
  • 通用音频理解:MOSS-Audio-8B-Thinking 取得开源模型最优平均分(71.08),甚至超越了30B规模的模型;Thinking变体在理解推理任务上全面优于Instruct变体。
  • 语音描述:MOSS-Audio-8B-Instruct 取得最高分(3.725),在性别、口音、音高等13个维度上甚至超越了闭源的 Gemini-3.1-Pro。
  • ASR:MOSS-Audio-8B-Instruct 取得最低平均CER(11.30%),在方言和歌声识别上优势明显。
  • 时间戳ASR:MOSS-Audio-8B-Instruct 在中英文上均取得极低的AAS偏移量(中文35.77ms,英文131.61ms),远优于 Qwen3-Omni 和 Gemini-3.1-Pro(动辄600-800ms)。
  • 消融实验(隐含于训练曲线):强化学习(DAPO)阶段的动态曲线表明,模型在提升奖励分数的同时,响应长度并未无限膨胀,说明模型学会了紧凑有效的推理,而非通过冗长输出“刷分”。

5. 优势与局限

  • 主要优势
    1. 全频段信息保留:DeepStack机制有效解决了传统编码器丢失底层声学细节的问题,使模型兼具细粒度感知与高级语义理解。
    2. 卓越的时间定位能力:显式时间标记的设计,使模型在时间戳ASR任务上实现了数量级的精度提升。
    3. 数据与架构的深度协同:事件保留切割+分支标注融合管线,与模型的多任务统一预训练目标完美契合,最大化了异构数据的价值。
  • 局限性
    1. 缺乏语音生成能力:论文明确指出这是一个“理解为中心”的模型,尚不支持语音合成或端到端的语音对话,需外接TTS系统。
    2. 数据管线的复杂性:分支标注、路由融合及多阶段后训练(尤其是DAPO的动态过滤与过采样)流程极其复杂,复现成本和工程门槛极高。
    3. 长音频的局部注意力限制:编码器采用最大100帧(8秒)的滑动窗口注意力,虽然提升了效率,但可能将长距离语义依赖的压力全部转移到了语言模型端。

6. 关键结论与启发

  • 最重要的 takeaway:一个统一的音频大模型完全可以在单一框架内同时实现高精度的语音转录、细粒度的副语言描述和复杂的时间推理;关键在于打破编码器的“最后一层瓶颈”,并给模型提供显式的时间锚点。
  • 对后续研究的启发
    1. 架构层面:DeepStack思路可推广至其他模态(如视频、点云),多层级特征注入可能成为解决模态对齐信息损耗的通用范式。
    2. 时间建模:将时间戳作为显式文本标记插入序列,这种“化隐式为显式”的简单做法极其有效,未来可探索更细粒度或层级化的时间标记。
    3. Agent延伸:MOSS-Audio证明了其作为Voice Agent“感知大脑”的潜力,后续研究可将其与工具调用、检索增强和语音生成模块结合,构建真正全双工的实时交互智能体。
#43
cs.SD
Shanghai University (211)

C2GA: A Class-Controllable Generative Augmentation Framework for Respiratory Sound Classification

Ziqi Ma, Mengyu Han, Anteng Cai, Zhanchong Liu, Bowen Feng 等 (7 人)
Sound (cs.SD)
Comments: 18 pages, 5 figures, submitted to Computer Methods and Programs in Biomedicine
查看摘要
Background: Respiratory sound classification plays a critical role in the clinical identification of pulmonary pathologies. However, its performance is often hindered by the limited size, severe noise, and class imbalance of real-world auscultation datasets. Although conventional audio augmentation techniques are easy to implement, they may inadvertently distort subtle pathological characteristics. Meanwhile, existing Variational Autoencoder (VAE)- or Generative Adversarial Network (GAN)-based generative approaches often suffer from limited sample fidelity and insufficient controllability over class semantics, particularly under conditions of scarce supervision. Methods: To overcome these limitations, we propose C2GA, a class-controllable generative augmentation framework. C2GA first constructs a semantically rich discrete latent space using a conditional Vector-Quantized Variational Autoencoder (VQ-VAE), in which local acoustic tokens are explicitly decoupled from global class prototypes. Subsequently, a Transformer-based autoregressive prior is trained to generate label-consistent token sequences. These generated tokens are then fused with the corresponding class prototypes and decoded into high-fidelity Mel-spectrograms for data augmentation. Conclusion: These results indicate that C2GA provides an effective and semantically reliable augmentation strategy for respiratory sound analysis. By enabling controllable and high-quality data generation, the proposed framework offers a promising solution for improving the robustness and generalization of respiratory sound classification in realistic clinical scenarios.

📖 深度解读

1. 一句话总结

本文提出了一种名为C2GA的类别可控生成式数据增强框架,通过在离散潜空间中解耦局部声学特征与全局类别原型,并利用Transformer自回归先验生成高质量的呼吸音频谱图,有效解决了真实医疗音频数据中样本少、噪声大和类别不平衡导致的分类性能低下问题。

2. 研究背景与动机

  • 核心问题:如何利用生成式数据增强提升呼吸音分类模型在数据稀缺、类别严重不平衡和高噪声环境下的性能。
  • 重要性:呼吸音分类是临床识别肺部病理(如哮鸣音、湿啰音)的关键手段,但真实听诊数据往往难以获取,且罕见病理声音的漏诊在临床上后果严重。
  • 现有方法不足
    1. 传统音频增强(如时间拉伸、频段掩码):容易破坏细微的病理特征(例如频段掩码可能直接遮盖掉代表湿啰音的关键频谱尖峰)。
    2. 传统生成方法(VAE/GAN):在监督数据不足时,生成的样本保真度低,容易出现频谱模糊或模式崩溃,且对类别语义的控制力不足,无法精准生成特定病理特征的音频。
    3. 代价敏感方法(如Focal Loss):仅通过调整损失权重来缓解类别偏见,无法从根本上增加少数类的声学多样性。

3. 核心方法

  • 提出框架:C2GA(Class-Controllable Generative Augmentation),采用两阶段生成范式。
  • 关键创新点
    1. 类别条件离散表示学习:引入条件VQ-VAE,将呼吸音编码为离散的声学Token序列,同时显式提取并解耦出“全局类别原型”(代表该类别的宏观能量和频谱分布特征)。
    2. Transformer自回归先验:利用Transformer建模离散Token的时间依赖关系,根据指定类别标签自回归地生成符合该类别病理规律的Token序列。
    3. 双重类别控制注入机制:在生成阶段,将生成的局部Token与全局类别原型融合,并在解码器的多尺度结构中强制注入类别条件,确保生成的样本既有多样性,又严格符合目标类别的临床语义。
  • 核心思路直觉解释:如果把生成呼吸音比作写一篇医学报告,VQ-VAE就是先把真实的报告拆解成“词汇”(局部声学Token)和“大纲”(全局类别原型)。在生成时,Transformer负责根据大纲按语法规则写出连贯的词汇(自回归生成),而全局原型则像是一个严格的审稿人,确保写出来的内容始终紧扣疾病的核心特征(双重注入),最后再把这些词汇和审稿意见一起翻译成最终的音频频谱图(解码器)。

4. 实验与结果

  • 数据集
  • Dataset 1:自建的大规模二分类数据集(正常 vs 湿啰音)。
  • Dataset 2:基于ICBHI基准构建的高噪声三分类数据集(正常、湿啰音、两者兼有)。
  • 基线方法:传统增强(DCRN, ESPnet-SE++)、传统生成(Conv-VAE, WaveGAN)、扩散模型(AFT, AudioLDM2)、代价敏感损失。
  • 主要实验结果
  • 在最具挑战性的Dataset 2上,C2GA达到了49.85%的准确率和49.50%的F1分数,比最强的扩散模型基线AudioLDM2分别高出1.75和2.20个百分点。
  • 在Dataset 1上,F1分数比基线提升了约3.95个百分点(73.20% → 77.15%)。
  • 消融实验揭示
  • 时间动态性最关键:移除Transformer先验(Variant A)导致F1大幅下降(49.50% → 44.20%),说明呼吸音的时序依赖对生成质量至关重要。
  • 全局原型不可或缺:移除原型融合(Variant B)导致F1下降3.1%,说明仅靠局部Token无法维持类别间的宏观特征差异。
  • 类别条件必不可少:在第一阶段移除类别监督(Variant C)导致F1下降2.35%,说明无监督的离散空间容易导致不同病理特征的语义混淆。

5. 优势与局限

  • 主要优势
    1. 精准的类别控制力:通过“局部Token+全局原型”的双重注入,解决了生成模型在医疗音频中容易出现的类别漂移问题,确保合成数据对少数类有实质性的信息增益。
    2. 高保真与临床一致性:离散Token建模避免了GAN的模糊和频谱伪影,成功重建了湿啰音等尖锐的瞬态病理特征。
    3. 优化加速:合成的数据为分类器提供了更一致的梯度,起到了“热启动”作用,显著降低了初始训练损失并加速收敛。
  • 局限性
    1. 超参数敏感性:合成数据比例和损失权重的配置对不同骨干网络影响差异较大(如CNN14和ResNet18的最佳配置不同),实际应用时需要仔细调参。
    2. 数据集规模与多样性限制:实验仅在二分类和三分类的相对受限数据集上验证,对于更复杂的、包含多种罕见病理音的大规模长尾分布,框架的扩展性尚未得到证实。
    3. 两阶段训练成本:VQ-VAE与Transformer先验需串行训练,且依赖预训练的声学编码器,整体流程较长。

6. 关键结论与启发

  • 最重要的Takeaway:在医疗音频生成中,显式地解耦并控制局部细节(时序Token)与全局语义(类别原型),比单纯追求生成逼真度(如扩散模型)更能有效提升下游分类器的性能,特别是在类别不平衡和高噪声场景下。
  • 对后续研究的启发
    1. 扩展到更多模态与病种:该“离散化+原型控制”的范式可迁移至心音、肠鸣音等其他生理信号生成,或扩展到更多细粒度的呼吸病理分类。
    2. 端到端联合优化:未来可探索将生成器与下游分类器进行联合微调,使生成样本直接针对分类器的弱点(如对抗性生成)进行优化。
    3. 自动化配比策略:针对不同架构对合成数据比例和权重的敏感性,可引入元学习或自适应调节机制,动态决定训练过程中合成数据的采样策略。
#44
cs.SD

Parameter-efficient Dual-encoder Architecture with Differentiable Choquet Integral Fusion for Underwater Acoustic Classification

Amirmohammad Mohammadi, Joshua Peeples, Alexandra Van Dine
Sound (cs.SD); Machine Learning (cs.LG)
Comments: 9 pages, 7 figures
查看摘要
Underwater acoustic classification has a wide array of oceanic applications, but faces challenges due to an increasingly complex acoustic environment. Waveform and spectrogram representations have been primarily used as acoustic data features for classification tasks in this domain. Spectrograms model harmonic dependencies, but these reduced representations can filter out acoustic features relevant for discrimination. While phase information from the waveform allows full characterization of the signal, the original waveform can be noisy and complex, rendering this representation difficult for models to process directly. This paper proposes a dual-encoder neural architecture to simultaneously process acoustic waveforms and spectrograms, leveraging pre-trained backbones and parameter-efficient fine-tuning modules, enabling a domain adaptation. To combine these adapted branches, a novel differentiable fuzzy aggregation mechanism based on the Choquet integral is introduced to balance the temporal and spectral representations. This fusion strategy not only yields higher classification accuracy but also provides interpretability. Specifically, by analyzing the learned fuzzy measures, insights are revealed about class-specific shifts in the network's representation reliance. By dynamically shifting attention to the representation least corrupted by potential asymmetric channel distortions, the proposed gating mechanism mitigates the non-stationary challenges of the underwater environment. Evaluations on the DeepShip and ShipsEar datasets demonstrate that the proposed architecture achieves classification improvements over independent single-encoder baselines, while simultaneously restricting the trainable parameter space. This mitigates the risk of overfitting on limited acoustic datasets while alleviating the computational costs associated with fully fine-tuning foundation models.

📖 深度解读

1. 一句话总结

本文提出了一种参数高效的双编码器架构,通过可微分的Choquet积分融合机制,动态结合声学波形和频谱图进行水下声学分类,在大幅减少可训练参数的同时提升了分类准确率和模型可解释性。

2. 研究背景与动机

  • 核心问题:如何有效融合水下声学信号的时域波形和频域频谱图特征,以实现高精度、抗干扰且计算高效的水下目标分类。
  • 重要性:水下声学分类在自主探索、海事安全等领域应用广泛。然而,水下环境复杂(多径干扰、环境噪声等),单一特征表示往往在特定噪声下失效,例如频谱图会丢失相位和宽带特征,而原始波形又过于嘈杂且难以直接建模谐波依赖。
  • 现有方法不足
    1. 单一表示(仅波形或仅频谱)无法全面刻画复杂的船舶辐射噪声,在低信噪比下性能下降。
    2. 传统的多特征融合(如拼接、加权平均)是静态的,无法根据环境噪声的非对称畸变动态调整依赖权重。
    3. 直接微调大型基础模型进行双分支融合计算成本极高,且水下声学数据集规模有限,极易过拟合。

3. 核心方法

  • 提出框架:Parameter-efficient Dual-encoder Architecture with Differentiable Choquet Integral Fusion(基于可微Choquet积分融合的参数高效双编码器架构)。
  • 关键创新点
    1. 可微分的Choquet积分决策级融合:引入模糊测度来建模波形和频谱之间的冗余与协同关系,并通过软排序门控机制解决传统Choquet积分不可导的问题,实现端到端优化。
    2. 动态软门控路由:根据两个分支对每个类别的预测置信度,动态决定依赖波形还是频谱,使模型能抵御非平稳的水下信道畸变。
    3. 参数高效微调(PEFT)与多目标优化:冻结预训练主干网络(AST和AVES),仅注入LoRA或HPT模块进行域适应,并采用联合损失函数(融合损失权重为单分支的2倍)确保双分支协同优化。
  • 核心思路直觉解释:想象你有两个顾问(波形和频谱)帮你识别船只。传统方法是把他们的话直接拼起来或对半取平均,但这忽略了他们可能存在信息重叠(冗余),或者有时一个顾问被噪声干扰了(不可靠)。Choquet积分就像一个聪明的调度员,它不仅知道每个顾问的独立能力,还知道他们合作时的“化学反应”(协同)。当频谱图被环境噪声掩盖时,调度员会自动把注意力转移到受影响较小的波形上;反之亦然。而且,这个调度员的决策过程是可解释的,你能看到它为什么这么做。

4. 实验与结果

  • 数据集:DeepShip(4类船舶)和 ShipsEar(4类船舶+1类背景噪声)。
  • 基线方法:单编码器全量微调(AST, AVES, ResNet-50, CNN14等)、单编码器PEFT(LoRA, HPT)、双编码器全量微调。
  • 主要实验结果
    1. 性能与效率双赢:双编码器PEFT(如Dual LoRA/Dual HPT)仅需约10万可训练参数(全量微调需17.5万以上),在DeepShip上达到71.1-71.2%的准确率,超越了绝大多数单编码器全量微调基线(如AST全量微调为72.3%,但参数量达8.5万且仅为单分支)。
    2. 低虚警率优势:在ShipsEar的局部AUC(pAUC0.30,即低假阳率区域)评估中,双编码器HPT(0.664)甚至显著优于单编码器全量微调(0.642)。
  • 消融与可解释性分析
    1. 模糊测度揭示类别偏好:在全量微调下,融合权重保持初始的0.5(模型容量足够大时不需动态取舍);但在PEFT和线性探测下,模型整体更依赖频谱图,但对特定类别(如DeepShip中的Tanker油轮)会赋予波形更高的权重,证明模型能识别并优先选择最具区分度的表示。
    2. CKA表示相似度分析:PEFT模型与全量微调模型在浅层相似度高,深层差异大;且波形分支的相似度低于频谱分支,表明波形分支更难适应,未来需要分配更高的微调容量(如更高的LoRA秩)。

5. 优势与局限

  • 主要优势
    1. 动态且可解释的融合:不同于黑盒注意力机制,Choquet积分的模糊测度直接量化了模型对不同模态的依赖程度,提供了明确的决策解释。
    2. 极高的参数效率:在冻结庞大基础模型的前提下,仅微调极少量参数即可达到媲美甚至超越全量微调的性能,有效缓解了水下小样本数据的过拟合风险。
    3. 鲁棒的非对称抗噪能力:动态门控机制使模型能在时域或频域受干扰时,自动“切换”至受影响较小的通道。
  • 局限性
    1. 计算开销未充分评估:论文虽然减少了可训练参数量,但双编码器前向传播的推理计算量(FLOPs)和内存占用必然高于单编码器,文中未对实际部署的硬件效率进行量化分析。
    2. 全量微调下门控失效:当模型容量足够大(全量微调)时,Choquet积分的模糊测度退化为静态的0.5,未能体现出动态融合的优势,说明该机制目前更适用于参数受限的场景。
    3. 波形分支适应困难:CKA分析暴露出波形分支在PEFT下与全量微调的对齐度较差,当前的对称PEFT策略可能不是波形分支的最优解。

6. 关键结论与启发

  • 最重要的Takeaway:在水下声学分类中,时域和频域特征具有互补性和非对称的抗噪能力;通过可微分的Choquet积分进行决策级融合,可以在极度压缩可训练参数的同时,实现自适应的模态动态路由,并提供模型决策的可解释性。
  • 对后续研究的启发
    1. 非对称PEFT设计:由于波形分支比频谱分支更难适应下游任务,未来的双分支微调应采用非对称策略,为波形分支分配更多的微调参数(如更高的LoRA rank)。
    2. 深层微调侧重:CKA显示表示漂移主要发生在深层,提示可以设计仅针对网络后几层进行参数高效微调的方案,进一步降低微调预算。
    3. 结合模型压缩:正如作者在结论中提到的,下一步可将量化技术应用于冻结的主干网络,以缓解双编码器架构带来的推理内存开销,推动其在边缘水下设备上的部署。
#45
cs.SD

DAStatFormer: A Hybrid Multibranch Transformer with Statistical Feature Integration for DAS-Based Pattern Recognitions 跨领域

Michel Dione, Jerry Lonlac, Hélène Louis, Anthony Fleury, Stephane Lecoeuche
Machine Learning (cs.LG); Artificial Intelligence (cs.AI); Sound (cs.SD)
查看摘要
Distributed Acoustic Sensing (DAS) enables large-scale monitoring through optical fibers, but its high dimensionality and complex spatio-temporal patterns make event classification demanding. Existing deep learning approaches-CNNs, recurrent models, and Transformer variants-either fail to capture long-range dependencies or require processing raw DAS matrices at prohibitive cost. We propose DAStatFormer, a hybrid multibranch Transformer that combines compact multidomain statistical features with Gated Transformer Networks. Instead of raw signals, we extract 24 ANOVA-selected attributes per channel from the temporal, waveform, and spectral domains, reducing data size by orders of magnitude while preserving discriminative information. Each domain is processed via dedicated step-wise and channel-wise attention branches, fused by an adaptive gating mechanism. Experiments on the open $\Phi$-OTDR benchmark and a real-scenario DAS dataset show that DAS-tatFormer achieves up to 99.4% accuracy and near-perfect real-world performance, while using significantly fewer parameters and lower inference cost than models such as DASFormer and DeepViT. These results demonstrate its suitability for scalable, real-time DAS-based monitoring. We release our code at this https URL

📖 深度解读

1. 一句话总结

本文提出了DAStatFormer,一种将DAS原始信号转化为紧凑的多域统计特征,并通过多分支门控Transformer进行融合的分类框架,在大幅降低计算成本的同时实现了极高的DAS事件识别准确率。

2. 研究背景与动机

  • 核心问题:如何高效、准确地对分布式声学传感(DAS)系统产生的高维时空矩阵进行事件分类。
  • 重要性:DAS技术将光纤转化为密集的虚拟传感器阵列,广泛应用于管道监测、周界安防等领域,实现实时的事件检测与定位。
  • 现有方法不足
    1. CNN/RNN模型:受限于局部感受野,难以捕捉DAS信号中的长距离时空依赖关系。
    2. Transformer模型:虽然能捕捉长距离依赖,但直接处理原始高维DAS数据或图像化表示(如瀑布图),计算开销极其庞大,且容易丢失信号细节。
    3. 特征利用不充分:现有深度学习模型多为端到端黑盒,很少显式利用DAS信号在时域、波形和频域上的互补物理统计特性。

3. 核心方法

  • 提出框架:DAStatFormer,一个混合多分支Transformer框架。
  • 关键创新点
    1. 紧凑的多域统计特征:摒弃原始高维信号,从时域、波形域和频域提取24个经ANOVA筛选的统计属性,将数据维度降低了数个数量级。
    2. 多分支门控Transformer架构:为三个特征域分别设计独立分支,每个分支内包含Step-wise(通道间空间相关性)和Channel-wise(属性间相关性)两条注意力路径,并通过软门控机制自适应融合。
    3. 统一的DAS预处理流水线:将真实场景下非标准化的DAS记录重构为统一的窗口化格式,兼容Transformer输入。
  • 核心思路直觉解释
    想象你要识别一段极其冗长的地震波记录。传统方法(CNN/Transformer)是死磕原始波形,费时费力。DAStatFormer的做法是:先让“统计员”把每个传感器的长波形提炼成一张包含24个关键指标的“体检表”(如最大振幅、脉冲因子、频谱重心等);然后,派三个“专家”(三个Transformer分支)分别看时域、波形和频域的体检表;每个专家不仅横向对比不同传感器的指标(Step-wise),还纵向分析指标间的关联(Channel-wise);最后,通过一个“智能开关”(门控机制)综合三位专家的意见,得出最终结论。

4. 实验与结果

  • 数据集
    1. 实验室ϕ-OTDR数据集(6类事件,如挖掘、行走等)。
    2. 真实场景DAS数据集(9类事件,如车辆、攀爬栅栏等,由Tomasov等人提供并经本文重构)。
  • 基线方法:SVM, 2D CNN, CNN-BiLSTM, XGBoost, DeepViT, DASFormer, DASViT1D。
  • 主要实验结果
    1. 实验室数据集:准确率达99.48%,与当前SOTA的DASFormer(99.60%)持平,但模型参数量大幅减少(DASFormer超600万参数,本文模型极其轻量),GPU内存占用仅115MB。
    2. 真实场景数据集:准确率达99.93%,宏F1达99.96%,远超CNN基线(91.4%)和DASViT1D(93.5%),且推理时间仅为4.13ms/sample(DASViT1D为13ms)。
  • 消融实验揭示
    单独使用时域特征已能达到99.1%的准确率,但融合波形和频域特征后,准确率提升至99.48%,且实现了零误报率(NAR=0.00),证明了多域特征的互补性。

5. 优势与局限

  • 主要优势
    1. 极高的计算效率:通过统计特征降维,彻底摆脱了原始高维矩阵的计算负担,适合实时和边缘部署。
    2. 性能优异且鲁棒:在实验室和真实场景下均达到或超越SOTA,且误报率极低。
    3. 可解释性强:基于物理意义的统计特征比纯黑盒端到端学习更具可解释性。
  • 局限性
    1. 统计特征的时序丢失:将长序列压缩为24个统计量,虽然保留了全局特征,但不可避免地丢失了信号内部的微观时序动态变化细节。
    2. 特征工程的依赖:24个特征是经ANOVA从60个候选中筛选出的,这种手工特征工程可能在不同类型的DAS系统或噪声环境下需要重新验证和调整。

6. 关键结论与启发

  • 最重要的Takeaway:在DAS事件识别中,精心设计的紧凑多域统计特征结合轻量级注意力机制,能够以极低的计算成本达到甚至超越处理原始数据的重型深度学习模型。
  • 对后续研究的启发
    1. 特征与深度学习的融合范式:未来在处理高维传感信号时,不应盲目追求端到端原始数据输入,显式引入领域先验的统计/物理特征作为“降维锚点”是更高效的路径。
    2. 边缘计算部署:该框架的低推理延迟和低内存占用,为在资源受限的边缘设备上实现实时DAS监测提供了可能,后续可探索模型量化与剪枝。
    3. 自监督学习结合:论文在展望中提到,未来可探索自监督学习,这或许能弥补当前方法对标注数据依赖较重以及统计特征丢失微观时序细节的问题。
#46
cs.SD
University of Zurich (QS Top 100)ETH Zurich - Swiss Federal Institute of Technology (QS Top 100)

Logit Distillation on Manifolds: Mapping by Learning 跨领域

Yiru Yang, Junling Wang, Nishant Kumar Singh, Luohong Wu, Haoran Yan
Machine Learning (cs.LG); Artificial Intelligence (cs.AI); Sound (cs.SD)
查看摘要
A simple way to improve the performance of almost any machine learning model is not to train a single but several models with diverse algorithms which will make slightly distinct kinds of predictions and errors on the same data, and thus improve the average predictions and robustness. However, making predictions using a whole ensemble of models is cumbersome and computationally too expensive to allow deployment to a large number of users, especially if the models are large neural nets. In response to this, we introduce a layer and point wise projection mapping, which maps student and teacher representations into an aligned high-dimensional embedding space during training process. The proposed approach combined with LoRA injection reduces the student model trainable parameters to less than 1% of the teacher model, while significantly improving word error rate (WER) compared to other distillation methods, as demonstrated in ablation studies. Unlike a mixture of experts, our method can be trained rapidly and in parallel.

📖 深度解读

1. 一句话总结

本文提出了一种基于黎曼流形的几何感知知识蒸馏框架(RC),通过将师生模型的对齐过程从传统的欧几里得空间提升到可学习的黎曼空间中进行子空间映射,在仅微调不到1%参数的极端压缩下,显著提升了语音识别模型的蒸馏效果。

2. 研究背景与动机

  • 核心问题:如何在大规模基础模型(如Whisper)中,高效地将大模型(教师)的知识迁移到小模型(学生)中,同时避免性能严重下降。
  • 重要性:集成大模型虽然性能好,但计算和部署成本极高,知识蒸馏是解决模型轻量化的关键手段。
  • 现有不足:传统的逻辑蒸馏(如KL散度)隐含假设师生模型的表征存在于兼容的欧几里得空间中,仅仅做“点对点”的数值匹配。这种方法忽略了高维特征空间内在的几何结构和深层关系,导致在模型异构或深度压缩时,高阶关系信息丢失严重。

3. 核心方法

  • 提出框架:Riemann-Constrained Logit Distillation (RC),一种几何感知的知识蒸馏框架。
  • 关键创新点
    1. 黎曼流形上的对齐:摒弃平坦的欧式空间假设,通过可学习的投影映射诱导出拉回黎曼度量,让师生模型在动态学习的弯曲空间中进行对齐。
    2. Grassmann流形子空间匹配:不把特征当作孤立的向量,而是视作线性子空间。通过正交化和计算子空间投影矩阵的Frobenius范数差,实现与坐标基无关的几何结构对齐。
    3. 极致参数高效:结合冻结的骨干网络、LoRA微调和流形投影模块,实现99.79%的训练参数压缩率。
  • 核心思路直觉解释
  • 传统蒸馏就像是用经纬度(欧式坐标)来对比两座山的形状,只看每个点的海拔差。
  • 本文方法则是把学生模型的特征“投影”到教师模型所在的地形中,不仅看海拔,还看山脉的走向、坡度等“几何结构”(子空间)。通过让学生模型学到教师模型的“地形走势”,而不仅仅是“点的位置”,从而在参数极少的情况下也能完美复刻教师的能力。

4. 实验与结果

  • 数据集/基准:多语言自动语音识别(ASR),使用LibriSpeech(960小时训练集,仅为基线方法的4.53%)和Multilingual LibriSpeech (MLS)。
  • 基线方法:Whisper系列原始模型、Distil-Whisper(使用2万+小时伪标签训练的SOTA蒸馏模型)。
  • 主要实验结果
  • 在较难的test-other集上,RC的WER为13.49%,比Whisper Medium基线(16.14%)绝对降低了2.65个百分点。
  • 在仅用不到5%训练数据且可训练参数不到教师模型0.1%的情况下,性能逼近使用海量数据训练的Distil-Large-v2。
  • 推理速度(RTFx=8.0)与Medium模型持平,投影模块仅增加约0.5%的延迟。
  • 消融实验揭示
  • 几何对齐目标(特别是轨迹对齐TRAJ)贡献了最大的性能增益(-37.81% WER),远超单纯的KL散度蒸馏。
  • 三阶段课程学习策略(几何对齐→混合精炼→任务打磨)至关重要,比固定权重训练进一步降低了50.55%的WER,说明“先学结构,再学任务”的优化轨迹是稳定收敛的关键。

5. 优势与局限

  • 主要优势
    1. 极高的参数效率:在冻结绝大部分参数的前提下,仅通过极低成本的LoRA和投影层实现了有效蒸馏。
    2. 数据高效:在训练数据不足(不到基线5%)的情况下,依靠几何结构的保持超越了传统方法。
    3. 保持泛化性:仅在英文数据上训练,由于对齐了子空间几何结构,自然保持了教师模型的多语言零样本能力。
  • 局限性
    1. 计算开销转移:虽然推理参数少,但训练过程中需要计算Jacobian矩阵、正交化和流形优化(如Cayley回缩),训练的工程复杂度和显存开销可能较高(论文未详细对比训练资源消耗)。
    2. 超参数敏感:三阶段课程学习的权重调度和边界设定较为精细,迁移到其他任务或模型时可能需要重新调参。
    3. 多模态验证不足:论文在附录中提到了视觉-语言多模态设定的形式化表达,但主实验仅在语音(ASR)单一模态上验证,其在视觉或多模态大模型上的实际效果未充分展示。

6. 关键结论与启发

  • 最重要的Takeaway:知识蒸馏不仅是输出概率的匹配,更是表征几何结构的保持;在极端压缩下,“对齐流形结构”比“对齐孤立数值”更能保留大模型的核心能力。
  • 后续启发/延伸方向
    1. 扩展至多模态大模型:该框架的子空间对齐思想天然适合处理不同模态(图、文、音)异构空间的蒸馏问题,未来可应用于多模态大模型的轻量化。
    2. 优化轨迹的重要性:消融实验证明“怎么学”(课程学习策略)和“学什么”(几何目标)同样重要,后续研究可更多关注蒸馏过程中的优化动力学。
    3. 可学习度量的潜力:通过神经网络诱导黎曼度量的思想,可启发更多非欧空间下的表征学习与对齐工作。
#47
cs.SD

Spiking and Event-driven Neuromorphic Mamba Models for Efficient Speech Recognition 跨领域

Tauseef Ahmed, Tao Sun, Jeronimo Castrillon, Kanishkan Vadivel, Guangzhi Tang
Neural and Evolutionary Computing (cs.NE); Sound (cs.SD)
Comments: Accepted at IJCNN2026
查看摘要
Deep learning has greatly advanced automatic speech recognition (ASR), enabling widespread deployment on edge devices such as smartphones and smart home systems. However, the computational and energy demands of deep neural networks pose significant challenges for such resource-constrained deployments, introducing latency and limiting real-time interaction. Neuromorphic computing offers a promising solution by introducing activation sparsity through spiking neural networks (SNNs) and event-driven neural networks, converting dense operations into sparse computations. However, a study that evaluates the hardware benefits of different neuromorphic strategies remains lacking for ASR. This paper explores spiking and event-driven neuromorphic neural networks to improve activation sparsity in the state-of-the-art SpeechMamba model for ASR. We introduce an event-driven SpeechMamba with FATReLU activation, achieving over 60% activation sparsity with less than 1% accuracy degradation on LibriSpeech. We also propose a spiking SpeechMamba that attains over 70% sparsity while using 30% fewer parameters than comparable SNNs. Finally, we develop a cycle-accurate event-driven simulator enabling flexible algorithm-hardware co-exploration, which helps us identify computational bottlenecks and yields over 10% additional efficiency improvements.

📖 深度解读

1. 一句话总结

本文将最先进的语音识别模型SpeechMamba改造为事件驱动和脉冲两种神经形态计算版本,在极低精度损失下实现了超60%的激活稀疏度,并开发了周期精确的仿真器揭示了“算法稀疏度≠硬件加速”的真相,进而指导模型优化获得了额外的10%以上硬件效率提升。

2. 研究背景与动机

  • 核心问题:如何降低自动语音识别(ASR)模型在边缘设备上的高计算与高能耗开销,使其能够高效部署?
  • 重要性:ASR已广泛部署于智能手机和智能家居等资源受限的边缘设备上,但传统深度神经网络(DNN)的密集矩阵乘法会导致高延迟和高功耗,严重影响实时交互体验。
  • 现有不足
    1. 缺乏对复杂ASR的神经形态策略评估:现有的神经形态计算(SNN或事件驱动)多用于简单的关键词识别,缺乏在复杂大词汇量ASR任务上的系统性对比。
    2. 算法指标与真实硬件脱节:现有研究多用理论上的突触操作数(SOP)或理想能耗来衡量效率,忽略了真实硬件上不规则稀疏度难以利用以及内存访问开销巨大的问题。
    3. 仿真工具受限:现有仿真器要么是缺乏硬件指标(如延迟、周期)的分析模型,要么是被特定芯片架构(如Loihi)锁死的死板模拟器,无法支持灵活的算法-硬件协同探索。

3. 核心方法

论文提出了两种神经形态SpeechMamba模型及一套协同仿真优化框架:
- E-SpeechMamba(事件驱动版):在模型关键瓶颈点插入FATReLU激活函数(低于阈值的激活置零),将密集计算转为稀疏计算。核心思路是“先保精度,再挤水分”,提出了三阶段训练法:①用ReLU预训练并加稀疏损失;②用数据驱动策略扫描并初始化FATReLU阈值(在精度容忍范围内最大化阈值);③微调阈值并加稀疏正则化。
- S-SpeechMamba(脉冲版):用LIF脉冲神经元替换激活层,生成二值脉冲。引入了“安静-爆发”双正则化损失,既防止神经元“死掉”(不放电),又惩罚过度放电,以维持高稀疏度。
- 事件驱动仿真器与协同优化:开发基于RISC-V Ibex核心的周期精确仿真器,支持操作级原子事件的数据流执行。通过仿真定位到Mamba块中的计算热点(如SSM Scan模块不可稀疏化),据此在E-SpeechMamba中额外插入FATReLU点进行针对性优化。

关键创新点
1. 首次将事件驱动(FATReLU)与脉冲(LIF)两种神经形态范式引入最先进的SSM-Attention混合ASR模型,并设计了针对性的多阶段/正则化训练策略。
2. 开发了灵活且周期精确的事件驱动RISC-V仿真器,填补了原子级操作仿真与真实硬件评估之间的空白。
3. 提出了“仿真定位热点 -> 指导算法修改 -> 提升硬件效率”的闭环协同优化范式。

4. 实验与结果

  • 数据集:LibriSpeech(约1000小时英语语音)
  • 基线方法:原始SpeechMamba、Whisper-Large-V2、Pruned Conformer、Spike-driven Transformer、IML-Spikeformer等。
  • 主要实验结果
  • E-SpeechMamba:在test-clean上WER仅增加不到1%(2.32% -> 3.20%),换取了62%的激活稀疏度
  • S-SpeechMamba:达到了72%的最高稀疏度,且比现有的SOTA脉冲模型参数量减少30%,但WER相对较高(4.71%)。
  • 仿真器揭示的真相:S-SpeechMamba虽然算法稀疏度(72%)高于E-SpeechMamba(62%),但在仿真中的CPU周期减少反而更低(19.58% vs 32.32%)。原因是LIF神经元需要频繁读写膜电位状态,巨大的内存访问开销抵消了计算稀疏带来的红利。
  • 协同优化结果:基于仿真器定位热点并优化后的E-SpeechMamba (Optimized),CPU周期减少提升至46.13%,内存访问减少提升至28.50%,相比优化前获得了超过10%的额外硬件效率提升。

5. 优势与局限

主要优势
1. 极低的性价比损失:E-SpeechMamba以不到1%的精度损失换取了超60%的激活稀疏度,在精度和效率间取得了极佳的平衡。
2. 打破算法幻觉:通过自研仿真器,首次在复杂ASR任务上实证了“高算法稀疏度不等于高硬件效率”,揭示了脉冲网络状态维护的隐性内存开销。
3. 闭环优化的示范:展示了如何利用硬件仿真反馈指导算法结构调整(增加稀疏点),实现了真实的算法-硬件协同设计。

局限性
1. 脉冲模型精度受损严重:S-SpeechMamba的WER大幅上升(接近5%),在要求高准确率的实际ASR应用中可能不可用。
2. 结构稀疏性受限:Mamba核心的SSM Scan模块无法被稀疏化(会导致精度崩塌),这成为了事件驱动架构中难以消除的“计算硬骨头”,限制了极限效率的提升。
3. 仿真平台的代表性:虽然基于RISC-V的Ibex核心提供了周期精确评估,但它本质上是一个通用轻量级核心,其结论在具有特殊片上网络或存算一体架构的专用神经形态芯片上是否依然成立,有待商榷。

6. 关键结论与启发

  • 最重要的Takeaway:在神经形态计算中,算法层面的稀疏度数字具有欺骗性。只有通过硬件感知的评估,才能发现内存访问模式和不均匀稀疏度带来的真实瓶颈;事件驱动(无状态)在内存受限场景下可能比脉冲网络(有状态)更具实际优势。
  • 对后续研究的启发
    1. 算法设计需硬件感知:未来的稀疏算法设计不能只追求Top-line的稀疏度百分比,必须将内存搬运开销和不可稀疏算子考虑在内。
    2. 突破SSM的稀疏化瓶颈:如何对状态空间模型(如Mamba的Scan操作)进行无损或微损的稀疏化/事件驱动化,是一个极具价值的研究方向。
    3. 混合架构的潜力:结合E-SpeechMamba(低内存开销)和S-SpeechMamba(极高计算稀疏度)优点的混合神经形态架构,可能是未来边缘ASR的破局之道。
#48
cs.SD

Diffusion-Based Heart Sound Generation: Evaluation with Physiological Signal Metrics, Classifiers, and Expert Listening 跨领域

Xinqi Bao, Jia Bi, Xin Chen, Ernest Nlandu Kamavuako, Saikat Chatterjee
Signal Processing (eess.SP); Sound (cs.SD)
查看摘要
Publicly available phonocardiogram (PCG) datasets remain limited in size and pathological diversity, constraining both auscultation training and the generalisation of automated heart-sound classifiers. A class-conditional diffusion model for PCG generation is developed in the log-mel domain and synthetic fidelity is assessed using complementary (i) physiology-inspired plausibility metrics, (ii) downstream label-consistency evaluation, and (iii) expert listening. Experiments use the Phy-sioNet/Computing in Cardiology Challenge 2016 dataset (3240 recordings) with recording-level splits. After preprocessing and quality control, 16,749 non-overlapping 4 s clips are mapped to a normalised 1 x 128 x 128 log-mel representation to train a conditional 2D U-Net denoiser with classifier-free guidance. Signal-level plausibility is quantified on reconstructed waveforms using three lightweight metrics: an envelope-autocorrelation rhythm score, an amplitude-based explosion score, and the dominant cycle lag. Synthetic clips preserve similar dominant cycle durations but exhibit reduced envelope periodicity and increased transient burstiness relative to real clips. For downstream evaluation, a ResNet-50 classifier achieves 92.24% accuracy on the held-out real test set and 82.8% accuracy on class-balanced synthetic batches, indicating that generated signals retain discriminative structure relevant to normal/abnormal classification. In a pilot expert listening study (60 clips, two clinicians), most synthetic clips are judged as heart-sound-like, while abnormality sensitivity is low for both real and synthetic 4 s excerpts. Overall, the results provide a practical baseline for diffusion-based PCG generation while highlighting remaining challenges in retaining abnormal acoustic cues and reducing reconstruction-induced artefacts.

📖 深度解读

1. 一句话总结

本文提出了一种基于条件扩散模型的心音(PCG)生成方法,并在对数梅尔频谱域上生成心音,同时引入了三种生理启发的合理性指标、下游分类器和专家听诊来综合评估合成心音的质量,为解决心音数据稀缺问题提供了实用基线。

2. 研究背景与动机

  • 核心问题:公开的心音(PCG)数据集规模小且病理多样性不足,限制了听诊训练和自动心音分类模型的泛化能力。
  • 重要性:心血管疾病是全球首要死因,心音听诊是低成本的一线筛查手段,但高度依赖医生经验;而AI辅助诊断又受限于数据稀缺。
  • 现有方法不足
    1. 现有的生成模型(如GAN)多聚焦于正常心音,对异常病理声音的生成和多样性关注不足。
    2. 缺乏一个综合的量化评估框架来验证合成心音是否保留了临床有意义的生理节律(如S1-S2结构)和能量分布,且没有产生违背物理规律的伪影。
    3. 现有评估多依赖视觉检查或单一的下游任务,无法全面反映临床合理性。

3. 核心方法

  • 提出框架:一种基于类别条件扩散模型的心音生成与评估框架。模型在对数梅尔频谱域上运行,使用2D U-Net作为去噪网络,结合无分类器指导进行条件生成。
  • 关键创新点
    1. 心音专属的扩散生成管线:将心音转化为2D对数梅尔频谱图(1×128×128),利用紧凑的2D U-Net和类别条件(正常/异常)进行可控生成,避免了直接在时域生成的困难。
    2. 提出三种生理启发的合理性指标:从物理和生理角度约束和评估生成信号,而非仅靠统计特征。
    3. 多维度综合评估体系:将信号级指标、下游分类器标签一致性、临床专家听诊三者结合,形成互补的评估闭环。
  • 核心思路直觉解释
  • 生成过程:就像把一张清晰的心音“照片”逐步加噪变成雪花点,再训练一个网络学会如何从雪花点一步步“雕刻”出清晰的心音。通过告诉网络“我要正常”或“我要异常”,就能按需生成。
  • 合理性指标:评估生成的心音是否“像人跳出来的”——节律得分看心跳是否规律(像不像是稳定的心跳周期),爆炸得分看有没有出现违背物理常识的极端尖峰(像不像是机器发出的刺啦声),主周期滞后看心跳速度是否在人类正常的范围内。

4. 实验与结果

  • 数据集:PhysioNet/CinC Challenge 2016(3240条录音,预处理后得到16,749个4秒片段)。
  • 基线方法:无传统生成基线对比,主要是真实数据与生成数据的对比,以及使用ResNet-50作为探测分类器。
  • 主要实验结果
  • 信号级指标:合成心音的主周期时长与真实心音相似(0.845s vs 0.802s),但节律稳定性较差(0.368 vs 0.460),且瞬态突发伪影更多(爆炸得分39.00 vs 31.24)。
  • 下游分类器:ResNet-50在真实测试集上准确率达92.24%,但在类别平衡的合成集上降至82.8%。特别是异常类的召回率下降严重(仅70.4%),说明部分生成的异常样本在特征空间上“越界”偏向了正常类。
  • 专家听诊:2名临床医生对60个片段评估。合成心音的听诊可信度较高(80%-85%被认为像心音),但无论是真实还是合成片段,医生对异常的敏感度都极低(真实片段异常召回率仅15%-25%,合成片段仅10%-20%)。
  • 消融实验:本文未进行传统意义上的模型结构消融,但通过指标筛选实验发现:用生理指标过滤合成数据虽能提高听感合理性,但可能会误伤异常样本中的病理特征(如杂音),导致筛选后的样本更偏向正常类。

5. 优势与局限

  • 主要优势
    1. 评估体系完善:首次将物理生理合理性指标、机器分类探测与人类专家听诊结合,为心音生成领域树立了多维度的评估标杆。
    2. 条件生成有效:证明了扩散模型能够生成具有合理心跳周期且听感上高度逼真的心音信号。
    3. 指标轻量可解释:提出的三项合理性指标计算简单,且具有明确的物理/生理意义。
  • 局限性
    1. 异常特征保留差:模型生成的异常心音容易丢失病理特征(如杂音),在分类器下容易误判为正常,说明语义一致性不足。
    2. 波形重建伪影:从梅尔频谱图重建回时域波形时,容易引入瞬态突发伪影(爆炸得分偏高)。
    3. 专家评估规模小且受限于片段长度:仅2名医生参与,且4秒的短片段导致医生在真实数据上的异常识别率也极低,难以充分验证生成质量。

6. 关键结论与启发

  • 最重要的Takeaway:扩散模型能够生成节律时间参数合理、听感像心音的信号,但在保留异常病理语义(如杂音)和避免频谱重建伪影方面仍存在显著挑战;单纯的生理指标后处理过滤无法替代生成模型本身的语义一致性优化。
  • 对后续研究的启发/延伸方向
    1. 多任务/一致性损失:在扩散模型训练中加入辅助分类头或分类器一致性损失,在去噪的同时优化类别判别性,解决异常样本特征丢失问题。
    2. 可微生理损失:将节律稳定性、瞬态惩罚等物理指标转化为可微的代理损失函数,直接嵌入扩散模型的训练过程中。
    3. 长上下文生成:从4秒短片段扩展到更长片段的生成,以捕捉多周期节律和持续性杂音,可采用层级化或分块生成策略。
    4. 更丰富的标注:从二分类(正常/异常)扩展到具有细粒度杂音标注的数据集(如CirCor DigiScope),以生成更具体的病理心音。
#49
cs.SD
ETH Zurich - Swiss Federal Institute of Technology (QS Top 100)

VocSim: A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio 跨领域

Maris Basha, Anja Zai, Sabine Stoll, Richard Hahnloser
Sound (cs.SD); Artificial Intelligence (cs.AI)
Comments: Accepted at ICML 2026. Code: this https URL
查看摘要
General-purpose audio representations aim to map acoustically variable instances of the same event to nearby points, resolving content identity in a zero-shot setting. Unlike supervised classification benchmarks that measure adaptability via parameter updates, we introduce VocSim, a training-free benchmark probing the intrinsic geometric alignment of frozen embeddings, with no parameters updated and no labels used (a label-free PCA whitening is fit per subset to correct anisotropy). VocSim aggregates 125k single-source clips from 19 corpora spanning human speech, animal vocalizations, and environmental sounds, isolating content representation from source separation (polyphonic mixtures are out of scope). We evaluate embeddings with Precision@k for local purity and the Global Separation Rate (GSR) for point-wise class separation, calibrated by lift over an empirical permutation baseline. A simple pipeline of frozen Whisper features, time-frequency pooling, and label-free PCA yields strong zero-shot performance with stable GSR rankings across domains (Kendall's tau = 0.60). However, on blind low-resource speech (Shipibo-Conibo, Chintang), local retrieval collapses while remaining above chance, exposing a cross-lingual speech generalization gap. As external validation, our top embeddings predict avian perceptual similarity, improve bioacoustic classification, and achieve state-of-the-art on the HEAR benchmark. We release data, code, and a public leaderboard.

📖 深度解读

1. 一句话总结

本文提出了VOCSIM,一个免训练的零样本音频基准,通过直接探测冻结音频嵌入空间的内在几何结构来评估“内容同一性”,并暴露出当前顶级模型在低资源跨语言语音泛化上的严重崩溃。

2. 研究背景与动机

  • 核心问题:如何在不进行任何参数更新和标签训练的情况下,评估通用音频表征模型(如Whisper, CLAP等)内在的“内容同一性”能力(即把同一声音事件的不同声学变体映射到相近空间位置的能力)。
  • 重要性:判断声音相似性是生物和人工智能系统的基础能力。直接评估冻结嵌入空间的内在几何结构,可以判断模型是否具备开箱即用的检索和索引能力,这是实际应用中的常见需求。
  • 现有方法不足:当前的音频评估基准(如HEAR, SUPERB)主要依赖线性探测或微调来衡量“可适应性”,这引入了混淆变量——高分可能源于优化配方的有效性,而非表征本身的质量;此外,多声源(复音)评估会将“表征质量”与“声源分离能力”混为一谈。

3. 核心方法

  • 提出框架:VOCSIM,一个严格限制为单声源、免训练、零样本的音频评估基准。
  • 关键创新点
    1. 纯几何探测与各向异性修正:完全冻结模型参数,仅使用无标签的直推式PCA白化(per-subset label-free PCA)来修正基础模型常见的“表示锥”问题(各向异性),从而公平诊断嵌入空间的内在拓扑潜力。
    2. 全局分离率(GSR)指标:提出一种新的点对点评估指标,通过比较“最近异类距离(NID)”与“平均同类距离(Avg_ID)”来衡量类间边界完整性,对类别“泄漏”极度敏感,且比传统轮廓系数更鲁棒。
    3. 严格的OOD盲测集设计:引入非网络爬取的低资源语言(Shipibo-Conibo, Chintang)作为盲测集,彻底杜绝预训练数据泄漏,揭示真实的跨语言泛化鸿沟。
  • 核心思路直觉解释:就像评估一个图书馆的图书分类系统,不要求管理员重新学习(免训练),只是把书按原样放上书架,看同类书(如同一事件的不同录音)是否自然聚拢,且不同类书之间是否有清晰过道(GSR指标)。为了防止书架本身的倾斜导致书全挤在角落(各向异性),先用无标签的物理方法把书架调平(PCA白化),再进行评估。

4. 实验与结果

  • 数据集/基准:VOCSIM(包含19个子集,12.5万个单声源片段,涵盖人类语音、动物发声、环境音),以及外部验证基准HEAR、鸟类感知数据、小鼠超声发声分类。
  • 基线方法:Whisper, CLAP, WavLM, Wav2Vec 2.0, BEATs, EAT, AudioMAE,以及Log-Mel频谱和单领域自编码器(VAE/AE)。
  • 主要实验结果
  • Whisper + 简单池化 + PCA = 最强零样本配方:冻结的Whisper Large-v3编码器配合时频池化和PCA,在公开集上达到66.8%的P@1和41.7%的GSR。
  • 跨语言语音泛化崩溃:在公开英语语音上P@1达46.5%的Whisper,在盲测低资源语言上暴跌至11.5%(仅略高于随机),证明了严重的跨语言泛化鸿沟。
  • GSR的跨域稳定性:局部检索指标(P@1)对预训练域高度敏感(不同领域由不同模型夺冠),而全局分离指标(GSR)在不同领域间排名极度稳定(Kendall's τ=0.60)。
  • 消融实验揭示
  • 简单的统计池化优于复杂的动态时间规整(DTW)重排;包含填充符的池化反而更好(因为模型对静音也有结构化表征)。
  • 盲测集上PCA几乎无效,因为模型在OOD数据上未能形成结构化流形,白化操作只是在旋转噪声。
  • GSR对标签噪声鲁棒,而P@1则随噪声急剧下降。

5. 优势与局限

  • 主要优势
    1. 诊断纯粹性:剥离了下游优化和声源分离的干扰,纯粹评估表征空间的内在几何质量。
    2. 揭示真实缺陷:通过严格的盲测集,首次量化了SOTA模型在低资源跨语言语音上的“伪泛化”现象(仅比随机好一点)。
    3. 预测有效性:VOCSIM的排名与下游实际应用(HEAR榜单SOTA、生物声学感知对齐)高度一致,证明其是优秀的模型早期筛选器。
  • 局限性
    1. 范围受限:严格限制为单声源,排除了复调音乐和复杂声景,无法评估模型的声源分离能力。
    2. 非严格的单样本推理:由于使用了基于子集统计的直推式PCA,并非完全的“即插即用”单样本推理(尽管论文同时提供了无PCA的结果)。
    3. 环境音覆盖不足:环境音仅有一个ESC-50子集,代表性较弱;动物发声子集虽无确认泄漏,但非严格意义上的盲测。

6. 关键结论与启发

  • 最重要的Takeaway:当前顶级音频基础模型在公开基准上的优异表现,很大程度上依赖于对高资源语言和常见声学环境的“记忆插值”,它们并未学到真正通用的音位学或声学拓扑结构;在未见过的低资源语言上,其内容聚类能力几乎崩溃。
  • 对后续研究的启发/延伸
    1. 模型开发方向:亟需开发能够学习“通用音位声学特征”而非仅拟合高资源语言的音频预训练范式。
    2. 评估范式迁移:音频表征评估应从“适应性测试”向“内在几何探测”延伸,GSR等指标可作为衡量模型零样本就绪度的新标准。
    3. 基准扩展:未来可在VOCSIM框架下,补充严格盲测的动物发声和环境音数据集,以验证跨语言泛化鸿沟是否同样存在于更广泛的非语音音频OOD场景中。
#50
cs.SD

Acoustic and perceptual differences between standard and accented speech and their voice clones 跨领域

Tianle Yang, Chengzhe Sun, Phil Rose, Siwei Lyu
Sound (cs.SD); Artificial Intelligence (cs.AI); Computation and Language (cs.CL); Computers and Society (cs.CY); Human-Computer Interaction (cs.HC)
查看摘要
Voice cloning is often evaluated in terms of overall quality, but less is known about accent preservation and its perceptual consequences. We compare standard and heavily accented Mandarin speech and their voice clones using a combined computational and perceptual design. Embedding-based analyses showed larger original-clone distances for accented speakers in several speaker-discriminative embedding spaces, but this difference disappeared after normalizing against each speaker's within-original baseline variability. In the perception study, clones are rated as more similar to their originals for standard than for accented speakers, and intelligibility increases from original to clone, with a larger gain for accented speech. These results show that accent variation can shape perceived identity match and intelligibility in voice cloning even when it is not reflected in baseline-normalized speaker-embedding distance, and they motivate treating accent preservation as an explicit component of speaker identity preservation, rather than assuming that it is fully captured by off-the-shelf speaker-discriminative embeddings.

📖 深度解读

1. 一句话总结

这篇论文揭示了语音克隆技术在处理重口音语音时,虽然能提升其可懂度,但会削弱听者感知的说话人相似度,且这种口音带来的身份流失无法被现有的标准说话人嵌入模型所捕捉。

2. 研究背景与动机

  • 核心问题:当语音克隆系统学习并克隆一个人的声音时,源说话人的口音条件(重口音 vs. 标准口音)是否会影响说话人身份的保留程度和语音的可懂度?
  • 重要性:口音不仅是地域差异的体现,更与个人的社会身份认同紧密相连。在语音克隆(音频深度伪造)技术日益普及的当下,如果系统在克隆重口音时“抹平”了口音特征,不仅关乎技术的“保真度”,更涉及身份代表性和数字包容性等伦理问题。
  • 现有不足:目前对语音克隆的评估多关注整体质量或自然度,缺乏针对口音保留及其感知后果的研究;同时,业界常依赖说话人判别性嵌入(如x-vector)来衡量身份保留度,但尚不清楚这些计算指标能否真实反映口音变化对人类感知的影响。

3. 核心方法

  • 提出框架:结合计算分析(嵌入空间距离)与人类感知实验(主观评分),构建多层次的语音克隆评估框架。
  • 关键创新点
    1. 引入口音作为变量:首次系统性地将“口音条件”作为语音克隆评估的核心维度,对比标准普通话与重口音普通话的克隆差异。
    2. 计算与感知的交叉验证:不单一依赖客观指标或主观打分,而是将模型嵌入空间的距离与人类听者的相似度/可懂度评分直接对齐比较,揭示了两者之间的脱节。
    3. 基线归一化度量:提出了“克隆偏离度”(Clone divergence, ∆div),即用原声-克隆声的距离减去原声内部的基线变异,以排除重口音本身自带的高变异性的干扰。
  • 核心思路直觉解释:就像用AI临摹两幅画,一幅是标准画风,另一幅是极具个人特色的狂草。研究不仅量了“临摹品与原作的像素差”(嵌入距离),还找了真人来评“临摹品有没有原画的神韵”(感知相似度)和“临摹品是不是更好认了”(可懂度)。结果发现,AI在临摹狂草时,自作主张把它写成了楷书(可懂度变高),虽然从像素差异比例上看似乎没走形,但懂行的人一看就觉得“没内味了”(身份相似度下降)。

4. 实验与结果

  • 数据集:重口音中文语料库与标准中文语料库(AISHELL-3),各选20名说话人。
  • 基线方法/系统:使用3种主流商用语音克隆系统生成克隆语音;使用5种说话人嵌入模型(x-vector, ECAPA-TDNN, ResNet-TDNN, WavLM-SV, UniSpeech-SAT-SV)提取特征。
  • 主要实验结果
  • 嵌入距离:重口音说话人的“原声-克隆”绝对距离显著大于标准口音,但一旦用各自原声的内部变异进行归一化(∆div),两者的差异完全消失。说明客观指标认为克隆对重口音“没有偏心”。
  • 感知相似度:听者评分打脸了客观指标。在AnyVoice和MiniMax系统中,重口音克隆语音被感知为与原声的相似度显著低于标准口音(例如AnyVoice中标准与重口音的潜变量差异∆=1.32, p=.011)。
  • 可懂度:克隆语音整体比原声更易懂,且重口音的“可懂度提升幅度”显著大于标准口音(交互效应 p=1.65×10⁻⁶),说明克隆系统起到了“口音标准化”的副作用。
  • 消融实验/控制变量:研究通过线性混合效应模型控制了不同克隆系统带来的差异,发现上述口音效应在不同系统中具有普遍性(尤其是感知结果)。

5. 优势与局限

  • 主要优势
    1. 视角新颖:敏锐捕捉到了“口音”这一被语音克隆领域长期忽视但极具社会意义的关键变量。
    2. 揭露了客观指标的盲区:有力证明了当前广泛使用的说话人嵌入向量无法有效编码口音相关的身份信息,对依赖此类指标的研究敲响了警钟。
    3. 揭示了身份与可懂度的权衡:指出了克隆技术中“听得清”和“像本人”之间的矛盾。
  • 局限性
    1. 口音定义较粗粒度:口音条件是以语料库级别划分的,而非针对单个说话人的口音严重程度进行精细量化。
    2. 听者背景单一:感知实验排除了与重口音同方言区的听者,仅反映了“标准口音主导群体”的感知,未考虑口音内部群体的自我认同感知(即该口音的本地人是否也觉得不像)。
    3. 克隆系统黑盒化:使用了商用API(ElevenLabs等),无法深入探究模型内部结构或训练数据是如何导致口音被“抹平”的。

6. 关键结论与启发

  • 最重要的Takeaway:说话人身份的保留是一个多层次概念,口音是其中的核心组件。现有的标准说话人嵌入距离无法替代人类感知,一个在嵌入空间中“保真”的克隆语音,可能在听感上已经背叛了说话人的口音身份。
  • 后续研究启发
    1. 评估体系重构:语音克隆的评估必须将“口音保留度”作为独立且显性的指标,不能与普通的“说话人相似度”混为一谈。
    2. 算法改进:亟需开发能够解耦语音内容、口音特征与音色特征的新模型,实现“可懂度提升但口音不丢失”的可控克隆。
    3. 嵌入模型升级:需要设计专门对口音和方言变异更敏感的说话人表征模型,以弥补当前自监督或判别性模型在非标准语音上的表征缺陷。
#51
cs.SD

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval 跨领域

HaeJun Yoo, Yongseop Shin, Insung Lee, Myoung-Wan Koo, Du-Seong Chang
Sound (cs.SD); Computation and Language (cs.CL)
Comments: Accepted at ACL 2026 Main Conference. Camera-ready version
查看摘要
Audio-text retrieval systems based on Contrastive Language-Audio Pretraining (CLAP) achieve strong performance on traditional benchmarks; however, these benchmarks rely on caption-style queries that differ substantially from real-world search behavior, limiting their assessment of practical retrieval robustness. We present Omni-Embed-Audio (OEA), a retrieval-oriented encoder leveraging multimodal LLMs with native audio understanding. To systematically evaluate robustness beyond caption-style queries, we introduce User-Intent Queries (UIQs) - five formulations reflecting natural search behaviors: questions, commands, keyword tags, paraphrases, and exclusion-based negative queries. For negative queries, we develop a hard negative mining pipeline and propose discrimination metrics (HNSR, TFR) assessing models' ability to suppress acoustically similar distractors. Experiments on AudioCaps, Clotho, and MECAT show that OEA achieves comparable text-to-audio retrieval performance to state-of-the-art M2D-CLAP, while demonstrating clear advantages in two critical areas: (1) dominant text-to-text retrieval (+22% relative improvement), and (2) substantially superior hard negative discrimination (+4.3%p HNSR@10, +34.7% relative TFR@10), revealing that LLM backbones provide superior semantic understanding of complex queries.

📖 深度解读

1. 一句话总结

本文提出了一种基于多模态大语言模型的音频检索编码器OEA,并构建了模拟真实用户搜索意图的UIQ基准,证明了LLM骨干网络在文本检索和排除性复杂查询(即“不要什么”)上具有远超传统CLAP模型的语义理解与抗干扰能力。

2. 研究背景与动机

  • 核心问题:现有的音频-文本检索系统在面对真实世界中多样化的搜索意图时表现脆弱,无法准确理解用户的复杂查询(尤其是包含否定、排除意图的查询)。
  • 重要性:随着多媒体内容爆发,基于自然语言的音频检索成为刚需。然而,用户在实际搜索时往往使用简短关键词、提问、命令或带有排除条件的句子,而非标准的数据集描述。
  • 现有方法不足
    1. 评估偏差:主流基准(如AudioCaps, Clotho)使用描述性标题进行测试,与真实搜索行为严重脱节,导致模型能力被高估。
    2. 数据泄露:论文指出,常用的训练集WavCaps与测试集存在严重重叠(AudioCaps重叠17.7%,Clotho重叠61.0%),导致指标虚高。
    3. 语义理解浅薄:传统CLAP模型采用双编码器架构,其文本编码器较轻量,倾向于将查询压缩为“词袋”向量,难以处理包含逻辑否定(如“没有雷声”)的复杂语义。

3. 核心方法

  • 提出方法:Omni-Embed-Audio (OEA),一种基于多模态大语言模型的统一检索编码器。
  • 关键创新点
    1. 统一编码架构:打破传统双编码器模式,使用单一的多模态LLM(如Qwen2.5-Omni)作为共享骨干,同时处理文本和音频输入,让音频理解直接受益于LLM强大的语言先验。
    2. UIQ基准与意图分类:提出用户意图查询(UIQ),将真实搜索分为三大类五小类:对话式(提问、命令)、重构式(标签、改写)、排除式(否定查询),填补了检索鲁棒性评估的空白。
    3. 硬负样本挖掘与判别指标:设计了四阶段流水线挖掘“声学相似但语义不同”的硬负样本(如“雨声”vs“雷雨声”),并提出HNSR等新指标,专门衡量模型“既要找得准,又要排得掉”的细粒度判别力。
  • 核心思路直觉解释:传统CLAP就像是一个只会抓关键词的“新手图书管理员”,你跟他说“不要雷声”,他可能只听到了“雷声”就去找了;而OEA像是一个“资深管理员”,由于大脑(LLM骨干)里见过大量的人类指令和逻辑表达,他能准确理解“下雨声但绝对不能有雷声”这种复杂诉求,并在相似的干扰项中精准避开雷声。

4. 实验与结果

  • 数据集/基准:AudioCaps, Clotho, 以及无数据泄露的MECAT。并基于此构建了AudioCaps-UIQ, Clotho-UIQ, MECAT-UIQ。
  • 基线方法:LAION-CLAP, Robust-CLAP, MGA-CLAP, 当前SOTA的M2D-CLAP,以及未经检索训练的原始LALMs。
  • 主要实验结果
    1. 文本到音频 (T2A):OEA与SOTA的M2D-CLAP整体相当,但在无泄露的MECAT集和跨域泛化上表现更好。
    2. 文本到文本 (T2T):OEA取得碾压优势,在MECAT上相对M2D-CLAP提升22%(R@5)。
    3. 排除性查询(硬负样本判别):OEA优势显著,HNSR@10达到34.6%(比M2D-CLAP高4.3%),TFR@10相对提升34.7%。
    4. 命令式查询:OEA达到49.87%,领先M2D-CLAP 5.13%,证明LLM对指令动词的理解更强。
  • 消融实验揭示
    1. 未经检索微调的原始LALMs在检索任务上几乎不可用(R@5仅约1%),证明对比学习对齐的必要性。
    2. 模型参数量从3B增至7B并未带来一致的提升,说明检索任务更依赖对比对齐质量和数据契合度,而非单纯堆参数。

5. 优势与局限

  • 主要优势
    1. 深度的语义理解:得益于LLM骨干,在处理包含否定逻辑和指令性意图的复杂查询时,表现出传统模型无法企及的判别力。
    2. 评估体系的革新:揭露了现有基准的数据泄露问题,并提供了更贴近真实搜索场景的UIQ基准和评估指标。
    3. 高效的部署潜力:虽然骨干庞大,但仅微调0.3%的LoRA参数,且在线检索只需编码文本(约2-5ms/query),延迟可控。
  • 局限性
    1. 硬件门槛高:推理所需显存远大于轻量级CLAP模型,边缘设备部署需依赖量化或蒸馏。
    2. 架构依赖性强:目前依赖原生支持音频的多模态LLM,难以直接替换为纯文本LLM+外挂音频编码器的混合架构。
    3. UIQ的合成偏差:UIQ主要由GPT-5.1生成,尽管有人工校验,但仍可能与真实的用户原生搜索日志存在分布偏差。

6. 关键结论与启发

  • 最重要的Takeaway:在音频检索中,“找得准”不等于“排得对”。传统指标掩盖了模型无法处理“排除性意图”的致命缺陷;引入具备强逻辑推理能力的LLM作为检索编码器,是解决复杂语义检索的有效路径。
  • 对后续研究的启发
    1. 评估范式的转移:未来的检索研究必须重视数据泄露问题(如引入MECAT),并将“抗干扰/否定理解能力”纳入常规评估。
    2. 检索架构的演进:从双编码器向基于LLM的统一编码器过渡,探索如何更好地将LLM的指令遵循能力转化为跨模态的精细对齐能力。
    3. 检索特化的Scaling Law:模型规模并非越大越好,后续可探索针对检索任务的更高效数据配比与对齐策略。
#52
cs.SD

BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps 跨领域

Lekai Qian, Haoyu Gu, Jingwei Zhao, Ziyu Wang
Sound (cs.SD); Artificial Intelligence (cs.AI)
查看摘要
Tokenizing music to fit the general framework of language models is a compelling challenge, especially considering the diverse symbolic structures in which music can be represented (e.g., sequences, grids, and graphs). To date, most approaches tokenize symbolic music as sequences of musical events, such as onsets, pitches, time shifts, or compound note events. This strategy is intuitive and has proven effective in Transformer-based models, but it treats the regularity of musical time implicitly: individual tokens may span different durations, resulting in non-uniform time progression. In this paper, we instead consider whether an alternative tokenization is possible, where a uniform-length musical step (e.g., a beat) serves as the basic unit. Specifically, we encode all events within a single time step at the same pitch as one token, and group tokens explicitly by time step, which resembles a sparse encoding of a piano-roll representation. We evaluate the proposed tokenization on music continuation and accompaniment generation tasks, comparing it with mainstream event-based methods. Results show improved musical quality and structural coherence, while additional analyses confirm higher efficiency and more effective capture of long-range patterns with the proposed tokenization.

📖 深度解读

1. 一句话总结

本文提出了BEAT,一种以“拍”为均匀时间步长的符号音乐网格化分词方法,通过将钢琴卷帘的稀疏表示与自回归Transformer结合,解决了现有事件型分词无法显式编码音乐时间规律性的问题,从而提升了音乐生成的结构连贯性与实时控制能力。

2. 研究背景与动机

  • 核心问题:如何将符号音乐有效地分词,以适配基于语言模型的Transformer架构进行生成。
  • 为什么重要:音乐是一种具有高度结构化、规律性时间模式和复调组织的信息,分词方式直接决定了模型能否有效捕捉并生成符合人类感知的音乐结构。
  • 现有方法不足:当前主流的“事件型”(如REMI)或“乐谱型”(如ABC)分词方法,将音乐按时间顺序序列化为长短不一的事件(如音符开始、时间偏移),导致单个token跨越的时长不确定。这种非均匀的时间推进迫使模型必须隐式地推断底层的时间网格,增加了学习规律性节拍结构的负担;同时,这种异步对齐的方式也难以支持严格的实时伴奏生成。

3. 核心方法

  • 提出方法:BEAT(Beat-wise Encoding for Autoregressive Transformers),一种基于均匀时间步长(拍)的网格化分词框架。
  • 关键创新点
    1. 以拍为单位的均匀时间步长:将一拍(如四分音符)作为固定的时间单位,所有音乐事件在拍内被编码,确保每个token子序列对应固定时长,显式引入人类音乐感知的节拍先验。
    2. 稀疏且紧凑的钢琴卷帘编码:利用钢琴卷帘的稀疏性,只编码拍内有激活的音高。将每个音高在拍内的状态(发声/延续/静默)通过3进制转换为一个Pattern token,配合相对音高偏移和平均力度,形成紧凑的token对,避免了朴素网格序列化带来的极度冗长。
    3. 支持实时因果生成的结构设计:音乐被严格按拍边界切分,拍与拍之间无信息泄漏,旋律与伴奏在拍级别严格对齐且因果递进,天然适配流式的实时生成场景。
  • 核心思路直觉解释:如果把音乐比作一段视频,事件型分词就像是在写“第1秒出现红球,持续0.5秒,第1.3秒出现蓝球……”的描述性文字,时间跨度忽长忽短;而BEAT则是把时间切成均匀的“帧”(一拍一帧),每帧只记录当前画面里有什么(哪些音高在响、怎么响的),空白处直接跳过。这样模型看“帧”的节奏是稳定的,更容易学到音乐的律动,也方便在播放到某一帧时立刻决定下一帧演什么。

4. 实验与结果

  • 数据集:Lakh MIDI Dataset (LMD) 和 MuseScore 钢琴数据集。
  • 基线方法:REMI/REMI+, Compound Word (CPW), Interleaved ABC, AMT (Anticipatory Music Transformer), 以及为了对照而设计的 Naive Piano-Roll(只保留网格但去掉稀疏编码)。
  • 主要实验结果
  • 客观指标:在钢琴和多轨续写任务中,BEAT在节奏一致性(JS GC)和分布距离(FMD)上均取得最优(如钢琴FMD为436.7,优于REMI的550.9和AMT-L的445.2)。
  • 主观评价:在连贯性、合理性和音乐性三项指标上,BEAT在钢琴续写中显著优于所有基线;在多轨续写中与参数量更大的AMT-L表现相当且略有提升。
  • 实时伴奏:在与专门为实时伴奏设计的SongDriver对比中,BEAT在连贯性、合理性和音乐性上均取得显著优势。
  • 消融实验与深入分析揭示
  • 紧凑性与可压缩性:BEAT产生的序列长度最短(平均1825.6),且在BPE压缩下表现出更高的压缩率,说明其蕴含了更多可复用的音乐子结构。
  • 重复-多样性平衡:其他方法要么陷入过度重复,要么过于发散;BEAT的Unique beat ratio曲线最贴近真实音乐,展现出优秀的长期结构连贯性。
  • 结构归纳偏置:在合成的模式受控任务(如步进移调、节拍交错、时间偏移重建)中,BEAT以极高精度捕捉了这些模式,证明其按拍分组的设计极大地减轻了模型学习局部结构的负担。

5. 优势与局限

  • 主要优势
    1. 显式的时间规律性:通过均匀的拍级分词,完美契合音乐节拍本质,显著提升了长程结构的连贯性和节拍稳定性。
    2. 序列紧凑高效:巧妙融合了网格的规律性与事件型的紧凑性,在同等上下文窗口下能建模更长的音乐语境。
    3. 零门槛支持实时控制:无需特殊的流式架构或强化学习,仅靠分词本身的因果对齐即可实现高质量的实时伴奏生成。
  • 局限性
    1. 依赖量化输入:目前仅适用于已量化的乐谱或MIDI,无法直接处理包含自由速度的未量化表演MIDI。
    2. 细粒度分辨率与词汇表的权衡:若要在拍内捕捉更精细的节奏(增大τ),会导致Pattern词汇表呈指数级增长并出现长尾分布,可能阻碍模型学习。
    3. 力度表达的损失:当前将拍内每个音高的力度简化为了平均值,丢失了拍内细微的力度起伏变化。

6. 关键结论与启发

  • 最重要的Takeaway:在序列建模中,表示的形态(归纳偏置)比模型规模更重要。通过将音乐分词从“变长事件流”转变为“均匀时间网格的稀疏编码”,BEAT用仅150M的参数量在多项指标上超越了780M的基线模型,证明贴合领域物理本质的表示能极大释放模型的学习效能。
  • 对后续研究的启发/延伸方向
    1. 细粒度动态建模:可探索引入VQ-VAE等向量量化方法,将拍内的连续力度曲线或更精细的τ状态压缩为离散码本,以突破当前均值力度和长尾词汇表的限制。
    2. 向音频域扩展:这种“均匀时间步+稀疏事件”的范式不仅适用于符号音乐,或许也可为音频离散化(如语音/音乐Codec)提供新的时间对齐思路。
    3. 更广泛的实时交互应用:BEAT的严格因果与节拍对齐特性,为构建低延迟、可介入式的人机即兴演奏系统铺平了道路,未来可探索在生成过程中动态插入人类演奏指令的控制机制。
#53
cs.SD
University of Washington (QS Top 100)University of California, Los Angeles (UCLA) (QS Top 100)

Do Joint Audio-Video Generation Models Understand Physics? 跨领域

Zijun Cui, Xiulong Liu, Hao Fang, Mingwei Xu, Jiageng Liu 等 (11 人)
Sound (cs.SD); Artificial Intelligence (cs.AI); Computer Vision and Pattern Recognition (cs.CV); Multimedia (cs.MM)
Comments: Preprint. Project Page: this https URL . Full abstract appears in the PDF
查看摘要
Joint audio-video generation models are rapidly approaching professional production quality, raising a central question: do they understand audio-visual physics, or merely generate plausible sounds and frames that violate real-world consistency? We introduce AV-Phys Bench, a benchmark for evaluating physical commonsense in joint audio-video generation. AV-Phys Bench tests models across three scene categories: Steady State, Event Transition, and Environment Transition. It covers physics-grounded subcategories drawn from real-world scenes, plus Anti-AV-Physics prompts that deliberately request physically inconsistent audio-video behavior. Each generation is evaluated along five dimensions: visual semantic adherence, audio semantic adherence, visual physical commonsense, audio physical commonsense, and cross-modal physical commonsense. Across three proprietary and four open-source models, we find that Seedance 2.0 performs best overall, but all models remain far from robust physical understanding. Performance drops sharply on event-driven and environment-driven transitions, and even strong proprietary systems collapse on Anti-AV-Physics prompts. We further introduce AV-Phys Agent, a ReAct-style evaluator that combines a multimodal language model with deterministic acoustic measurement tools, producing rankings that closely align with human ratings. Our results identify cross-modal physical consistency and transition-driven scene dynamics as key open challenges for joint audio-video generation.

📖 深度解读

1. 一句话总结

本文提出了首个评估音视频联合生成模型物理常识的基准AV-Phys Bench,揭示了当前顶尖模型虽能生成语义正确的视听内容,但在跨模态物理一致性(尤其是场景动态变化时)上存在严重缺陷。

2. 研究背景与动机

  • 核心问题:当前的音视频联合生成模型是否真正理解现实世界的物理规律,还是仅仅在生成“看起来和听起来合理”但物理上相互矛盾的内容?
  • 重要性:在物理世界中,视觉和听觉受同一物理事件支配(如把闹钟放进泡沫盒,视觉上被遮挡,听觉上变沉闷)。如果模型无法保持这种跨模态的物理一致性,将严重限制其在世界模拟器、具身智能和教育等下游任务中的可靠性。
  • 现有方法不足:现有的评估基准大多只关注单一模态的物理真实性(仅视频或仅音频),或仅关注静态孤立事件,且缺乏对“跨模态物理一致性”的评估;此外,现有的自动化评估指标无法精准定位物理违规现象,而人工评估又难以大规模扩展。

3. 核心方法

  • 提出框架AV-Phys Bench(评估基准) + AV-Phys Agent(自动化评估智能体)。
  • 关键创新点
    1. 场景演化分类法:将物理场景按动态演化分为三类——稳态(物理配置不变)、事件转换(动作改变声源状态,如调大音量)、环境转换(环境改变声音传播,如从室内走到室外)。
    2. 反物理提示词:在每个类别中加入故意违背物理常识的提示词(如“羽毛落在软垫上发出雷鸣般的巨响”),以测试模型是真正掌握了物理规则,还是仅仅记住了“看起来合理”的先验模式。
    3. 五维评估量规:打破单一评分,从视觉/音频的语义遵循(V-SA, A-SA)、视觉/音频的物理常识(V-PC, A-PC)以及跨模态物理常识(AV-PC)五个维度进行严格的二值(Y/N)评判。
    4. AV-Phys Agent:结合多模态大语言模型(MLLM)与确定性音频信号处理(DSP)工具的ReAct风格智能体。直觉上,它让大模型“看”和“听”来评判语义,但在评判物理规律(如音高、响度、混响变化)时,调用DSP工具提供确凿的测量数据作为证据,从而实现与人类高度对齐的自动化评估。
  • 核心思路直觉解释:就像给AI出了一套“物理综合测验”,不仅考它“画得对不对、声音像不像”,更考它“画面和声音在物理规律上是否咬合”。为了自动批改这份试卷,AI考官不仅凭感觉打分,还要用声学仪器(DSP工具)实际测量音频数据,确保打分有理有据。

4. 实验与结果

  • 数据集/基准:AV-Phys Bench,包含321个精心设计的提示词-量规对,涵盖268个物理遵循提示和53个反物理提示。
  • 对比基线模型:3个闭源模型(Seedance 2.0, Kling 3.0 Omni, Veo 3.1)和4个开源模型(LTX-2.3, Ovi 1.1, JavisDiT++, MagiHuman)。
  • 主要实验结果
  • 语义到物理的断崖式下跌:所有模型在物理常识上的表现远逊于语义遵循。最强模型Seedance 2.0的视觉语义(V-SA)达0.940,但跨模态物理一致性(AV-PC)降至0.750;Veo 3.1的AV-PC更是从0.877跌至0.422。
  • 动态转换是崩溃重灾区:相比于稳态场景,模型在事件转换和环境转换场景下性能大幅下降,最高降幅达67%。
  • 反物理测试暴露“死记硬背”:面对反物理提示,闭源模型表现崩溃(Seedance 2.0的物理得分下降68.5%),它们倾向于自动“纠正”提示词,生成符合现实物理但违背提示词要求的内容,说明模型只是编码了物理先验,缺乏灵活组合物理规则的能力。
  • 消融实验揭示:在AV-Phys Agent中,音频DSP工具的引入是提升评估准确率的关键(尤其是A-PC维度提升0.150),而单纯依赖MLLM的视觉理解能力已经较强,加入视觉工具反而略微干扰了判断。

5. 优势与局限

  • 主要优势
    1. 填补空白:首个系统性地针对“音视频跨模态物理一致性”进行评估的基准,特别是引入了场景动态演化和反物理测试。
    2. 评估体系严谨:五维量规和严格合取的评分规则,能够精准定位模型是在语义、单模态物理还是跨模态对齐上出了问题。
    3. 自动化评估高保真:AV-Phys Agent通过大模型+确定性工具的协同,实现了与人类评判高度一致(Pearson r=0.934)的可扩展评估。
  • 局限性
    1. 提示词与时长局限:当前仅支持英文提示词和8秒短视频,未覆盖多语言和长视频场景。
    2. 评分粒度较粗:采用严格的二值(Y/N)评分,虽然保证了标注一致性,但丢失了物理违规严重程度的梯度信息。
    3. 智能体骨干单一:AV-Phys Agent目前仅基于Gemini 3.1 Pro,未验证其他开源/闭源多模态大模型作为评判骨干的泛化性。

6. 关键结论与启发

  • 最重要的Takeaway:当前音视频生成模型在跨模态物理一致性上存在严重的“幻觉”,它们更像是“物理先验的模仿者”而非“物理规则的理解者”,尤其是在面对动作或环境变化时,视听极易脱节。
  • 对后续研究的启发
    1. 模型训练方向:未来的生成模型需要引入显式的物理表征学习或因果推理模块,而不能仅依赖数据驱动的概率生成;AV-Phys Agent的评估结果可作为强化学习中的可验证奖励信号(RLVR)来微调模型。
    2. 基准扩展方向:可将该分类法和评估框架自然扩展到图生视频、视频生音频等多模态生成任务中,并进一步引入更细粒度的序数评分标准。
    3. 评估范式启发:“MLLM推理 + 领域确定性工具”的ReAct评估范式,为其他需要精确量化判断(而非主观感受)的AI评估任务提供了极具潜力的通用思路。
#54
cs.SD

ASKD-Whisper: Adaptive Self-knowledge Distillation for Efficient and Low-Latency Automatic Speech Recognition 解读失败跨领域

Junseok Lee, Nahun Kim, Sangyong Lee, Chang-Jae Chun
Computation and Language (cs.CL); Artificial Intelligence (cs.AI); Sound (cs.SD)
Comments: Title and content have been updated
查看摘要
Knowledge distillation (KD) is one of the most effective paradigms for compressing large-scale foundation models into deployable architectures. In the context of Automatic Speech Recognition (ASR), previous studies have predominantly focused on forcing the student model to strictly mimic the predictive distribution of a massive teacher model. However, this static dependency often presents an inherent trade-off: while the student rapidly acquires basic linguistic representations, it simultaneously inherits the teacher's domain-specific blind spots and over-confident hallucinations, leading to a severe decline in out-of-distribution generalization capacity. To effectively mitigate this issue, we propose Adaptive Self-Knowledge Distillation (ASKD), a dynamic curriculum framework. ASKD systematically decays the dependency on the teacher's distribution as training progresses-thereby unlocking the student's independent reasoning capacity-and subsequently employs a self-knowledge distillation phase to act as a structural regularizer. By applying ASKD, we distill the massive Whisper architecture into a compact variant, ASKD-Whisper. In our comprehensive evaluations across diverse acoustic domains, ASKD-Whisper not only achieves a 5x speedup in inference latency but also outperforms its teacher model by yielding a 1.07% lower word error rate (WER). These results demonstrate that ASKD effectively prevents teacher-induced overfitting and establishes a new state-of-the-art for generalizable model compression.

📖 深度解读

[PDF 下载失败,无法解读]

#55
cs.SD
University of Oxford (QS Top 100)Chinese University of Hong Kong (CUHK) (QS Top 100)

The Alignment Curse: Modality Alignment Supercharges Audio Attacks via Text Transfer 跨领域

Yupeng Chen, Junchi Yu, Aoxi Liu, Baoyuan Wu, Philip Torr 等 (6 人)
Machine Learning (cs.LG); Artificial Intelligence (cs.AI); Sound (cs.SD)
Comments: 23 pages, 5 figures
查看摘要
Recent advances in end-to-end trained omni-models have substantially improved audio capabilities by strengthening text-audio modality alignment. However, whether such alignment inadvertently facilitates the transfer of safety vulnerabilities across modalities remains underexplored. This question is critical as text-based jailbreak attacks are considerably more mature than audio-based ones; if they transfer systematically, current audio safety evaluations may underestimate risks originating from the text modality. In this paper, we introduce the Alignment Curse, a formally characterized and empirically validated principle showing that stronger modality alignment enables more effective transfer of attacks from text to audio, revealing a fundamental tension between capability and safety. Motivated by this principle, we conduct a comprehensive black-box evaluation of three attack categories on recent omni-models (e.g., Qwen2.5-Omni, Qwen3-Omni): text attacks, text-transferred audio attacks, and audio attacks. We find that text-transferred audio attacks perform comparably to, and often better than, audio-based attacks, exhibiting a clear advantage under audio-only access. This suggests that text-based vulnerabilities play a pivotal role in shaping audio safety risks. Finally, we empirically analyze the relationship between modality alignment and transfer effectiveness across attack methods and models, observing consistent support for the Alignment Curse: tighter modality alignment leads to more effective cross-modality attack transfer.

📖 深度解读

1. 一句话总结

这篇论文揭示了全模态模型中的“对齐诅咒”现象:模型在训练中越是对齐文本和音频模态以提升能力,文本模态的越狱攻击就越容易转移到音频模态,导致音频安全风险被严重低估。

2. 研究背景与动机

  • 核心问题:全模态模型在加强文本-音频模态对齐时,是否会将文本模态的安全漏洞(如越狱攻击)一并转移给音频模态?
  • 重要性:随着语音助手的普及,音频安全性至关重要。目前文本越狱攻击技术远比音频攻击成熟,如果文本攻击能轻易跨模态转移,意味着当前针对音频的安全评估可能存在巨大盲区,低估了实际风险。
  • 现有方法不足:现有的音频安全评估通常将音频和文本攻击割裂开来,没有深入探究跨模态攻击转移的机制;同时,缺乏在统一框架下对文本攻击、文本转移音频攻击和原生音频攻击的公平对比(特别是基于相同模态访问权限的对比)。

3. 核心方法

  • 提出框架/原则:论文提出了对齐诅咒原则,从理论和实证两个维度证明了模态对齐与跨模态攻击转移之间的因果关系。
  • 关键创新点
    1. 理论形式化:利用KL散度和Pinsker不等式,数学上证明了当文本和音频的表征分布足够接近(即对齐度高,KL散度小)时,文本模态产生的不安全输出概率会近似等价地出现在音频模态。
    2. 跨模态攻击范式:提出利用成熟的文本越狱提示词,通过TTS(文本转语音)直接转化为音频进行攻击(Text-transferred Audio Attacks),并在黑盒及纯音频访问限制下验证其有效性。
    3. 对齐与安全的权衡揭示:明确指出了模型“能力(对齐度)”与“安全性”之间存在根本性冲突——对齐越紧密,跨模态漏洞转移越彻底。
  • 核心思路直觉解释:可以把全模态模型想象成一个“双语者”,训练过程就是让它把“听觉(音频)”和“视觉(文本)”映射到同一个大脑语义区。如果它把一句话的“听”和“看”理解得一模一样(对齐度高),那么骗过它“眼睛”的谎言,直接念给它“听”也同样管用。你教它听得越懂,它反而越容易被同样的谎言骗过。

4. 实验与结果

  • 数据集/基准:JailbreakBench (100个有害行为) 和 AdvBench子集 (100个提示词)。
  • 对比基线方法
  • 文本攻击:PAP, ReNeLLM, AutoDAN-Turbo
  • 文本转移音频攻击:上述文本提示词经GPT-4o-mini-tts转换的音频
  • 原生音频攻击:SSJ, Speech Editing, Dialogue Attack, VoiceJailbreak, Multi-AudioJail
  • 主要实验结果
  • 文本转移攻击极其有效:在纯音频访问场景下,PAP(A)等文本转移音频攻击的平均SR(攻击成功率)显著优于原生音频攻击。例如在JailbreakBench上,PAP(A)的平均SR达到0.72,而表现最好的原生音频攻击SSJ仅为0.62。
  • 跨模型转移性强:即使只用代理模型生成文本越狱再转音频攻击目标模型,PAP(A)依然能达到0.71的平均SR。
  • 消融实验/分析揭示
  • KL散度与转移成功率负相关:通过估算模型中间层的KL散度,发现KL越小(对齐越强),攻击转移得分越高,皮尔逊相关系数达到-0.94至-0.96,直接验证了“对齐诅咒”。
  • 格式依赖性攻击转移失败的原因:ReNeLLM在转移至音频时效果大跌,原因是其依赖代码符号和换行符,TTS转换会破坏这些结构,导致KL散度变大(超出非真空域KL<2),破坏了对齐。

5. 优势与局限

  • 主要优势
    1. 视角深刻且及时:首次从模态对齐的机制出发,系统性地揭示了文本向音频的跨模态安全风险转移,填补了该领域的理论空白。
    2. 实验设计严谨:区分了“文本+音频访问”和“纯音频访问”两种威胁模型,确保了文本转移攻击与原生音频攻击对比的公平性。
    3. 理论与实践闭环:不仅有严密的数学边界推导,还有KL散度估算与攻击成功率的强相关性验证,逻辑自洽。
  • 局限性
    1. 模态覆盖有限:目前仅验证了文本到音频的转移,未涉及图像、视频等更广泛模态的跨模态转移验证。
    2. 安全风险类型单一:实证部分仅关注了越狱攻击,未验证对齐诅咒是否同样适用于后门攻击、偏见或幻觉等其他安全风险。
    3. 防御侧验证初步:虽然探讨了基于文本表征的防御探针可向音频转移,但未考虑针对音频信号层面的特定扰动攻击对防御转移的破坏。

6. 关键结论与启发

  • 最重要的Takeaway:全模态模型的音频安全漏洞本质上是文本安全漏洞的投影;模型越聪明(模态对齐越好),这种跨模态的“投毒”就越致命。当前的音频安全评估必须将文本转移攻击纳入核心考量。
  • 对后续研究的启发/延伸方向
    1. 跨模态防御机制:受对齐诅咒启发,未来的防御可以“以毒攻毒”,利用文本模态防御的低成本和高成熟度,直接向音频模态转移防御能力(如共享表征空间的安全监控器)。
    2. 抗TTS破坏的攻击研究:研究如何让包含复杂排版或代码结构的文本越狱提示词在TTS转换后仍保持语义结构,或开发对声学特征鲁棒的跨模态攻击。
    3. 更广泛的对齐诅咒验证:将本框架扩展至“文本-图像”、“文本-视频”甚至“图像-音频”之间的安全漏洞转移研究,探索全模态模型下通用安全对齐的理论边界。
#56
cs.SD

DECKER: Domain-invariant Embedding for Cross-Keyboard Extraction and Recognition 解读失败跨领域

Bikrant Bikram Pratap Maurya, Nitin Choudhury, Daksh Agarwal, Arun Balaji Buduru
Cryptography and Security (cs.CR); Sound (cs.SD)
Comments: Accepted to AsiaCCS'26
查看摘要
Acoustic side-channel attacks (ASCA) on keyboards pose a significant security risk, as keystrokes can be inferred from typing acoustics, revealing sensitive information. Prior ASCA studies are limited by small-scale datasets with restricted diversity in users, keyboards, and environments, constraining analysis across devices, microphones, and noise conditions. We introduce HEAR, a dataset designed to study ASCA along three axes: keyboard generalization, noise adaptation, and user bias. HEAR contains recordings from 53 participants using 37 laptop keyboards, collected in three realistic settings: (1) external microphone capture, (2) device microphone capture without network noise, and (3) VoIP-based streaming capture. This enables controlled evaluation across users, keyboards, and environments. On HEAR, we establish an ASCA benchmark spanning conventional features and pre-trained representations from raw audio and spectrograms in unimodal and multimodal settings. We propose DECKER, a domain-invariant keystroke inference framework with four stages: (1) Keyboard Signature Normalization to reduce device coloration, (2) domain-adversarial disentanglement to suppress keyboard identity, (3) supervised cross-keyboard contrastive alignment to enforce key consistency, and (4) Acoustic Style Randomization to synthesize unseen keyboard responses. We further explore sentence-level inference using an LLM-based post-processing layer to refine keystroke sequences via linguistic context. Results on HEAR show DECKER improves keystroke identification over strong baselines, particularly in cross-keyboard and cross-user settings, with further gains from language-model rectification. These findings highlight that ASCA remains effective across diverse users, devices, and noisy environments, underscoring its practical security risk.

📖 深度解读

[PDF 下载失败,无法解读]