arXiv 每日论文精读

📡 eess.AS / cs.SD
Audio and Speech Processing, Sound
2026年06月03日
LLM: glm-5.1
32
论文总数
24
跨领域
32
成功解读
0
待处理
#1
eess.AScs.SD
University of Illinois at Urbana-Champaign (QS Top 100)Tsinghua University (QS Top 100, 985, 211)

FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations 跨领域

Haolong Zheng, Siyin Wang, Xulin Fan, Zengrui Jin, Mark Hasegawa-Johnson
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Sound (cs.SD)
查看摘要
Few-shot prompting provides an effective way to adapt auditory large language models to low-resource tasks such as children's speech recognition. However, most auditory large language models are not explicitly trained to perform inference in this demonstration-conditioned format, limiting the extent to which they can benefit from few-shot prompting. To address this limitation, we introduce Few-Shot Aware GRPO (FSA-GRPO), an RL-based post-training recipe that uses a specially designed reward to encourage the model to leverage few-shot demonstrations, thereby strengthening its few-shot adaptation ability. Notably, training with only high-resource adult ASR data improves the model's general few-shot adaptation ability, yielding gains not only in children's speech recognition but also in speech translation and audio understanding. We further study data selection and auxiliary reward weighting to identify an effective training recipe. Our experiments show that when in-domain data are unavailable or cannot be used for training, FSA-GRPO is more effective than direct tuning on related out-of-domain data.

📖 深度解读

1. 一句话总结

本文提出了一种基于强化学习的后训练策略(FSA-GRPO),通过设计“任务准确性+示例语义对齐”的双重奖励,教会听觉大模型如何更好地利用少样本示例,从而在不损害零样本能力的前提下,显著提升模型在儿童语音识别等低资源任务上的表现。

2. 研究背景与动机

  • 核心问题:如何让听觉大模型在缺乏目标领域训练数据(如儿童语音)的低资源场景下,更有效地利用少样本示例进行自适应推理。
  • 重要性:高资源数据训练的模型在低资源领域(如儿童语音、小语种)表现往往大幅下降,而目标领域数据通常稀缺、昂贵或涉及隐私无法使用。
  • 现有方法不足
    1. 原生ICL(上下文学习)效果有限:大多数听觉大模型在训练时并未见过“带示例”的推理格式,导致推理时给的示例无法被充分利用。
    2. 有监督微调(SFT)的风险:直接用少样本格式微调模型,容易导致“灾难性遗忘”(损害零样本能力),或者让模型只学到了格式皮毛而没学会真正参考示例(即只学格式不学语义)。

3. 核心方法

  • 提出方法:FSA-GRPO(Few-Shot Aware Group Relative Policy Optimization),一种基于强化学习(GRPO)的少样本感知后训练框架。
  • 关键创新点
    1. 首个针对语音ICL的RL后训练方案:将少样本适应能力的训练转化为强化学习问题,而非传统的SFT,利用RL天然的优势(允许模型在示例有用时参考、无用时忽略)来保持零样本能力。
    2. 双重奖励机制:不仅奖励模型“答得对”(ASR准确性),还额外奖励模型“听得进劝”(生成结果与提供的示例在语义上对齐)。
    3. 高效的数据选择策略:提出挑选“示例很好但模型当前做不好”的困难样本进行训练,大幅提升RL训练的效率。
  • 核心思路直觉解释
    想象你在教一个学生做听力题。传统的SFT就像让学生死记硬背标准答案,容易让他丧失原本的做题直觉(遗忘零样本能力);而FSA-GRPO就像是在学生做题时,不仅看他对不对(ASR奖励),还看他有没有参考你给他的提示(语义对齐奖励)。如果他完全无视提示做错了,扣分;如果他过度抄提示导致做错,也扣分(通过阈值截断防止过度抄袭)。通过这种“胡萝卜加大棒”的方式,学生学会了何时该参考提示、何时该相信自己,从而变成了一个更会利用提示的做题高手。

4. 实验与结果

  • 使用数据集/基准
  • 训练:仅使用Common Voice英文成人大规模ASR数据。
  • 评估:儿童ASR(MyST, RSR)、音频理解/推理(MMAU, MMAR)、多语言ASR(德/法/中)、语音翻译(CoVoST2)。
  • 对比基线方法:原始Qwen2.5-Omni、MetaSICL(元学习风格微调)、同等数据量下的直接SFT、各种直接领域微调(SFT/GRPO)。
  • 主要实验结果
    1. 少样本全面领先:在RSR儿童ASR上,FSA-GRPO的3-shot WER降至16.32,远优于原始模型的27.86和MetaSICL的22.16;在语音翻译上BLEU达到37.25,显著优于基线的33.65。
    2. 零样本能力保持:不同于MetaSICL和SFT导致零样本性能大幅下降,FSA-GRPO在提升少样本性能的同时,零样本性能甚至略有提升或持平。
    3. 超越直接领域微调:在无法使用目标域数据训练的严格设定下,FSA-GRPO(用成人数据训练+儿童示例推理,WER 16.32)甚至大幅优于直接用2k儿童语音数据微调(WER 22.69),相对WER降低53.9%。
  • 消融实验揭示
    1. 数据选择:“好示例+差表现”的数据组合训练效果最好(WER 20.56),优于随机采样(22.14),证明让模型在“有参考但做错”的样本上学习最有效。
    2. 辅助奖励权重:语义对齐奖励权重 $\lambda=0.04$ 时效果最佳(WER 16.56),过小(0.01)信号不足,过大(0.08)则会导致模型过度抄袭示例而损害性能。

5. 优势与局限

  • 主要优势
    1. 免目标域数据训练:仅需高资源成人语音数据训练,即可获得强大的低资源领域适应能力,极具实用价值。
    2. 兼顾零样本与少样本:巧妙利用RL的奖励机制,打破了传统微调中“提升少样本必然损害零样本”的魔咒。
    3. 泛化性强:仅在ASR任务上训练,提升效果却能迁移到语音翻译、音频理解等未见过的任务上。
  • 局限性
    1. 统计稳健性不足:论文承认所有实验结果均基于单次运行和固定检查点,未报告多种子下的均值和方差,小幅性能差异可能不可靠。
    2. 跨模型迁移未充分调优:在Audio-Flamingo-Next上的实验直接复用了Qwen的超参数,未进行针对性调优,导致收益较小,跨架构泛化能力仍需验证。
    3. 配置探索有限:仅验证了固定数量(3-shot)和检索方式的示例,不同示例数量、提示格式下的最优行为尚未明确。

6. 关键结论与启发

  • 最重要的Takeaway:与其让模型在目标域数据上苦苦微调,不如用强化学习教模型“如何更好地利用提示”。一旦模型掌握了这种元能力,即使推理时只给几个简单的示例,也能达到甚至超越直接用相关领域数据微调的效果。
  • 对后续研究的启发/延伸方向
    1. 奖励设计的拓展:当前的语义对齐奖励基于文本嵌入相似度,未来可探索更细粒度的奖励(如声学特征对齐、防止幻觉的惩罚机制)。
    2. 跨模态ICL训练:本文证明了在单一模态(语音识别)训练可迁移到其他音频任务,后续可研究跨模态(如视觉+语音)的少样本感知强化训练。
    3. 动态示例分配:结合本文的数据选择策略,未来可探索动态的推理时示例分配机制(如根据查询难度决定给0个还是3个示例),让模型在零样本和少样本之间无缝切换。
#2
eess.AScs.SD

Wavelet as Tokenizer: Preliminary Results on a Shared Wavelet Token Schema for Natural Signals 跨领域

Shenghao Ding
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Computer Vision and Pattern Recognition (cs.CV); Machine Learning (cs.LG); Sound (cs.SD)
Comments: 12 pages, 3 figures
查看摘要
This paper studies whether audio, images, and video can share a common wavelet token schema rather than relying on separate modality-specific latent grids. It introduces a preliminary continuous-token model built around a one-level Haar DWT/IDWT frontend, a shared coefficient-token layout, optional structural metadata, lightweight modality value adapters, and a shared token-wise encoder-decoder trunk. On Speech Commands, EuroSAT RGB, and DAVIS 2017 data, a dense shared model reaches 39.92 dB audio, 29.37 dB image, and 23.93 dB video PSNR. A matched-rate sweep under continuous latent scalar budgets indicates that the visual gains are not explained solely by latent capacity, while also showing that additive metadata embeddings are not a universal source of improvement. Finally, fixed-rate energy selection provides a strong non-parametric baseline: energy_global improves average PSNR over uniform selection by 16.73 dB for audio, 16.90 dB for images, and 15.86 dB for video under compressed keep ratios. Masked sparse training reaches 34.45 dB video PSNR with 50% of dense tokens. The results support a unified wavelet token schema and sparse token interface, while stopping short of establishing a universal discrete vocabulary.

📖 深度解读

1. 一句话总结

这篇论文提出了一种基于小波变换的统一分词框架(WAT),证明了音频、图像和视频这三种不同模态的自然信号可以共享同一套“小波系数+元数据”的Token语法,并通过一个共享的连续Token模型实现有效的重建。

2. 研究背景与动机

  • 核心问题:音频、图像和视频能否共享一种通用的Token语法,而不是各自依赖模态特定的隐空间网格?
  • 重要性:现有的分词器(Tokenizer)通常是为单一模态设计的(如音频用EnCodec,图像用VQGAN,视频用MAGVIT)。如果能找到一种跨模态的通用Token语言,不仅能统一多模态的表征方式,还能为未来的多模态大模型和生成式AI提供更一致的接口。
  • 现有不足:目前的视觉分词器大多将信号压缩成密集的隐空间网格,丢失了信号的多尺度物理结构信息;而现有的联合分词器(如图像-视频)也仅局限于视觉领域,没有将音频纳入统一的信号场(1D/2D/3D)框架中考虑。

3. 核心方法

  • 提出框架:Wavelet as Tokenizer (WAT)。该框架将所有模态视为不同维度(1D音频、2D图像、3D视频)的采样场,通过一层Haar离散小波变换(DWT)提取系数,并映射为统一的Token序列,经过共享编解码器后,再通过逆小波变换(IDWT)重建信号。
  • 关键创新点
    1. 统一的Token语法:每个Token不仅包含小波系数值,还显式携带结构化元数据(模态、维度、尺度、子带、位置),相当于给每个Token发了一张“身份证”,说明它代表什么频率、在哪个位置。
    2. 轻量级模态适配与共享主干:不同模态仅通过极轻量的线性适配器(和音频缩放因子)接入,核心的编解码网络(MLP)完全共享,无需注意力机制或复杂的模态特定网络。
    3. 基于能量的非参数化稀疏选择:利用小波系数的能量大小作为Token重要性的跨模态统一信号,直接丢弃低能量Token,无需学习即可实现自适应的稀疏分配。
  • 核心思路直觉:就像搭乐高积木,无论你是搭1D的声音轨道、2D的平面图还是3D的立体建筑,底层都可以使用同一种形状的“基础砖块”(小波系数Token)。平滑的地方用少一点粗砖块,边缘和细节的地方用多一点细砖块,而砖块的包装盒上写着它的用途和位置(元数据)。

4. 实验与结果

  • 数据集:Speech Commands (音频), EuroSAT RGB (图像), DAVIS 2017 (视频)。
  • 基线方法:独立模态基线、匹配容量基线(控制连续隐变量标量总数一致)、均匀/随机Token选择基线。
  • 主要实验结果
  • 密集共享模型:在引入音频缩放因子($s_{audio}=4$)后,共享模型在图像和视频上大幅超越独立基线(图像+6.46 dB,视频+3.03 dB),音频仅略低0.87 dB(达到39.92 dB)。
  • 匹配容量实验:在控制总参数容量一致的情况下,共享模型在视觉上依然优于独立模型,证明视觉增益不仅仅是因为瓶颈变大。
  • 元数据的作用反转:令人意外的是,显式添加元数据嵌入在视觉任务中反而不如不加元数据好,仅在部分图像设置中有益,打破了“元数据越多越好”的直觉。
  • 非参数稀疏选择:基于全局能量的Token选择在极低保留率下,比均匀选择平均提升15-17 dB的PSNR,证明小波能量是极佳的跨模态重要性指标。
  • 掩码稀疏训练:仅保留50%的高能量Token进行训练,视频PSNR甚至达到了34.45 dB,超过了密集共享基线(23.93 dB),展现了稀疏化的巨大潜力。

5. 优势与局限

  • 主要优势
    1. 跨模态统一性:首次在1D/2D/3D信号上实现了真正的语法级共享,而非仅仅是共享网络骨干。
    2. 结构化与可解释性:Token携带物理意义(尺度、子带、位置),比黑盒的隐空间向量更透明。
    3. 天然的稀疏友好性:小波变换使得基于能量的稀疏分配极为高效,无需学习即可大幅超越均匀分配。
  • 局限性
    1. 实验规模极小:仅使用了64x64的低分辨率图像和极短视频片段,模型也是极简的MLP,缺乏与当前SOTA视觉/音频分词器在真实压缩率上的可比性。
    2. 缺乏真正的比特率评估:目前使用的是连续隐变量,没有引入向量量化(VQ/FSQ)和熵编码,因此无法报告真实的比特率,本质上还是一个自编码器而非真正的压缩器。
    3. 统计鲁棒性不足:所有学习型模型的结果均为单次运行,缺乏多次种子的均值和方差,且元数据嵌入的负面效果尚未得到有效解释和解决。

6. 关键结论与启发

  • 最重要的Takeaway:自然信号(音频/图像/视频)确实可以共享一套基于小波系数的统一Token语法;且在这种语法下,小波系数的能量是跨模态通用的“重要性货币”,使得稀疏化变得异常自然和高效。
  • 对后续研究的启发
    1. 元数据的注入方式需重新设计:简单的加法嵌入会损害性能,未来应探索FiLM调制、门控路由等更高级的条件注入方式。
    2. 从连续走向离散:下一步必须引入FSQ或RVQ等量化手段,在真实的比特率约束下验证该语法的有效性。
    3. 向3D场扩展:该框架的“信号场”视角天然契合3D高斯溅射(3DGS)或神经辐射场,未来有望实现音频、视频、3D场景的终极统一Token化。
#3
eess.AScs.SD
KAIST - Korea Advanced Institute of Science & Technology (QS Top 100)

SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models 跨领域

Chenshuang Zhang, Kyeong Seon Kim, Chengxin Liu, Tae-Hyun Oh
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Computer Vision and Pattern Recognition (cs.CV); Machine Learning (cs.LG); Multimedia (cs.MM); Sound (cs.SD)
Comments: Accepted at CVPR 2026
查看摘要
Despite the success of audio-visual large-language models (LLMs), they can produce plausible but ungrounded outputs, termed hallucination. Existing benchmarks focus on environmental sounds (e.g., dog barking) to indicate event occurrence. In contrast, human speech carries fundamentally different, rich semantics and temporal structures, yet it remains unexplored whether current models can accurately align speech content with corresponding visual signals. In this work, we show that speech content can induce hallucinations in audio-visual LLMs. To systematically study this, we introduce SVHalluc, the first comprehensive benchmark for evaluating speech-vision hallucination in audio-visual LLMs. Our benchmark diagnoses speech-vision hallucinations from two critical and complementary aspects: semantic and temporal. Experimental results demonstrate that state-of-the-art open-source audio-visual LLMs struggle with aligning speech content with corresponding visual signals, with a near-random accuracy on multiple tasks. In contrast, Gemini 2.5 Pro significantly outperforms the open-source models. Our analysis suggests that their failures stem from limited ability in cross-modality understanding, despite strong performance in single-modality perception. Our work uncovers a new and fundamental limitation of current audio-visual LLMs and highlights the need for speech-grounded video comprehension. Project page: this https URL .

📖 深度解读

1. 一句话总结

本文提出了首个针对音视频大模型中“语音-视觉幻觉”的评测基准SVHalluc,揭示了现有开源模型在将语音内容与视觉信号进行语义和时间对齐时存在严重缺陷(表现接近随机猜测),而其根本原因在于跨模态信息整合能力薄弱。

2. 研究背景与动机

  • 核心问题:音视频大模型在处理视频和语音时,会产生看似合理但缺乏输入依据的“幻觉”,特别是无法准确将语音内容与画面进行对齐。
  • 重要性:人类语音包含丰富的语义和复杂的时间结构(如描述过去或未来的事),如果模型盲目将语音与画面强行关联,会导致严重的安全隐患和应用错误。
  • 现有方法不足:现有的音视频幻觉基准主要关注“环境音”(如狗叫、警笛),仅将其作为事件发生的简单指示器,测试局限于“当前时刻”和“有限语义”。它们完全忽略了人类语音与环境音的本质区别——语音不仅是“有人在说话”的事件标志,更包含密集的语义指令和超越当下的时间跨度。

3. 核心方法

  • 提出框架:SVHalluc,一个专门诊断音视频大模型“语音-视觉幻觉”的基准测试。
  • 关键创新点
    1. 视角转换:首次将研究焦点从“环境音-视觉”转向“语音-视觉”,挖掘语音带来的独特幻觉模式。
    2. 双维度系统诊断:从“语义”和“时间”两个互补维度剖析幻觉,每个维度设计3个由粗到细的任务,共6个任务。
    3. 自动化构建+人工校验:基于YouCook2数据集,通过打乱音视频配对、GPT组合错位事件等自动化手段生成正负样本,并经过人工质量把控。
  • 核心思路直觉解释
  • 语义幻觉:测试模型会不会“听风就是雨”。比如语音里提到了“切黄瓜”,但画面里根本没有黄瓜,模型会不会因为听到了就脑补画面里有?任务从整体是否匹配(GSA),到具体物体是否存在(FGSA),再到动作和物体的错位绑定(CMSB,如把语音的“切”和画面的“西红柿”强行组合)逐步深入。
  • 时间幻觉:测试模型有没有“时空错乱”感。语音说的事情可能发生在过去或未来,模型能不能分清?任务从判断是否同步发生(TA),到定位相对时间(TF),再到在干扰下识别当前真实画面(CMTB)逐步加难。

4. 实验与结果

  • 使用数据集:基于YouCook2构建的SVHalluc基准,包含2405个视频-问题对。
  • 对比基线方法:开源模型(Qwen3-Omni, Qwen2.5-Omni, video-SALMONN 2, VideoLLaMA 2)与商业模型(Gemini 2.5 Pro)。
  • 主要实验结果
  • 开源模型全线崩溃:在全局语义对齐(GSA)、时间对齐(TA)和时间预测(TF)等任务上,开源模型准确率接近50%(即随机猜测水平),表现出强烈的“语音-视觉对齐偏见”(认为语音一定在描述当前画面)。
  • 商业模型表现悬殊:Gemini 2.5 Pro在GSA任务上达到93.10%的准确率,在时间任务上也远超开源模型,证明该基准是可解的,且暴露了开源与闭源模型的巨大鸿沟。
  • 消融实验揭示
  • 单模态不是瓶颈:Qwen3-Omni的语音识别(WER低)和语音时间定位(mIoU高)能力很强,说明模型“听得清、听得准”,但“对不上”画面。
  • 文本提示部分有效:输入语音的文本转录本可以提升部分细粒度语义任务(FGSA, CMSB)的表现,但在时间错位任务(CMTB)中反而加剧了幻觉(因为文本成了更强的干扰项)。
  • 跨模态融合失败:去掉语音输入后,某些任务准确率反而上升(因为去除了干扰),证实了模型无法有效整合双模态信息进行推理。

5. 优势与局限

  • 主要优势
    1. 填补空白:首次系统性地揭示了音视频大模型在“语音-视觉”对齐上的幻觉问题,视角新颖。
    2. 诊断精细:双维度6个任务的设计由浅入深,能够精准定位模型是在语义绑定还是时间对齐上出了问题。
    3. 分析透彻:通过详尽的消融实验,排除了单模态感知能力的嫌疑,将问题核心锁定在跨模态推理上。
  • 局限性
    1. 数据来源单一:仅基于YouCook2(烹饪视频)构建,视频场景和动作类型相对局限,可能无法完全代表真实世界中极其多样的语音-视觉交互场景。
    2. 评估形式受限:采用选择题形式,虽然便于量化评估,但可能无法充分反映模型在开放式生成场景中的幻觉严重程度。

6. 关键结论与启发

  • 最重要的Takeaway:当前的音视频大模型存在严重的“跨模态整合无能”——它们单模态感知(听音、看图)能力很强,但无法将语音的语义和时间信息与视觉信号进行可靠的逻辑对齐,极易被语音内容误导而产生幻觉。
  • 对后续研究的启发
    1. 模型训练方向:亟需开发专门针对“语音-视觉对齐”的训练策略或对比学习机制,打破模型“语音必描述当前画面”的固有偏见。
    2. 架构改进方向:现有的将音视频直接映射到文本空间的架构可能不足以支撑细粒度的跨模态时间与语义推理,需要探索更深度的多模态交互架构。
    3. 基准扩展方向:未来可将SVHalluc扩展到更多元化的真实生活场景(如电影、Vlog、安防监控),并探索从客观选择题走向开放式生成的幻觉评估。
#4
eess.AScs.SD

A Comparison of Generative and Discriminative Methods for Speech Enhancement: Robustness, Complexity, and Hallucination 跨领域

Shrishti Saha Shetu, Emanuël A. P. Habets, Andreas Brendel
Audio and Speech Processing (eess.AS); Sound (cs.SD)
查看摘要
In this study, we conduct a comprehensive comparative analysis of generative and discriminative deep learning-based speech enhancement methods, specifically in noise reduction tasks. Our investigation focuses on evaluating their effectiveness under high and low signal-to-noise ratio conditions, considering both matched and mismatched training scenarios. We further investigate the impact of training data volume, model convergence speed, and interpret the performance differences in terms of objective results for the considered training paradigms. Additionally, we compare the complexity-performance trade-off and the practical viability of these approaches. To further strengthen the evaluation, we study the hallucination characteristics of generative approaches in terms of word error rate and phoneme similarity. The insights derived from this study provide empirical evidence to assist researchers and practitioners in understanding whether the perceptual gains of different approaches justify their computational cost in practical applications.

📖 深度解读

1. 一句话总结

本文全面对比了语音降噪任务中判别式与生成式(GAN、扩散模型等)深度学习方法,发现在低信噪比下GAN方法性能最优且计算效率更高,而扩散模型虽生成能力强但计算代价过大,性价比不高。

2. 研究背景与动机

  • 核心问题:在语音增强(降噪)任务中,生成式方法(如扩散模型、GAN)与传统的判别式方法相比,其实际的性能收益是否足以弥补其带来的高昂计算成本?
  • 重要性:语音增强在消费电子中应用广泛,模型的计算复杂度直接决定了其能否在真实设备上实时部署。近年来生成式模型(尤其是扩散模型)在低信噪比下表现亮眼,但其巨大的算力需求成为了落地的“拦路虎”。
  • 现有不足
    1. 现有研究多在小规模、同质化数据集上评估,缺乏在多样化噪声和极低信噪比下的全面测试;
    2. 很少有研究将判别式与多种生成式方法放在同一基准下,综合考量“性能-复杂度”的权衡;
    3. 生成式模型容易“幻觉”(凭空生成不存在的语音内容),但缺乏对其幻觉程度的量化评估。

3. 核心方法

  • 研究框架:本文并非提出单一新模型,而是构建了一个大规模的对比评估框架。涵盖了三大类方法:
  • 判别式模型(DCCRN, GCRN等):将降噪视为回归问题,直接映射带噪语音到干净语音。
  • GAN类生成模型(DisCoGAN, NoCoGAN, CMGAN等):通过生成器与判别器的对抗训练,单步直接生成干净语音。
  • 扩散类生成模型(SGMSE+, BBED, FlowSE, SEBridge等):通过迭代去噪(或基于概率流/一致性模型)逐步生成干净语音。
  • 关键创新点
    1. 统一骨干网络的公平对比:不仅对比了不同架构,还将同一个大型骨干网络(NCSN++)分别用判别式、GAN和扩散目标进行训练,剥离了网络架构带来的性能差异。
    2. 引入幻觉评估:使用ASR词错率(WER)和音素相似度(LPS)来量化生成式模型的“幻觉”严重程度。
    3. 多维度的实用性分析:除了常规指标,还深入分析了训练收敛速度、数据规模依赖性以及计算复杂度(GMACs和参数量)的权衡。
  • 核心思路直觉解释:如果把降噪比作“把弄脏的画复原”,判别式方法是直接拿橡皮擦和画笔一笔画成(快但可能生硬);扩散模型是反复涂抹修改几十遍(慢但细节可能更好);GAN则是找了个造假高手,看一眼脏画直接凭经验画张干净的(快且逼真,但可能画错细节)。本文就是想弄清楚:这几十遍的精雕细琢到底值不值?

4. 实验与结果

  • 数据集:使用Interspeech 2020 DNS Challenge数据集构建了高信噪比([-5, 30] dB)和低信噪比([-25, 0] dB)两个1000小时训练集。测试集包含DNS非混响测试集(高SNR)和专门的极低SNR测试集。
  • 基线方法:涵盖2种判别式(DCCRN, GCRN)、4种GAN、5种扩散/流匹配模型,以及同一骨干网络的不同训练范式变体。
  • 主要实验结果
  • 高SNR场景:判别式模型与生成式模型性能相当,但判别式计算代价极低,实用性最强。
  • 低SNR场景:GAN方法全面胜出。例如在匹配条件下,NCSN++ (GAN) 在FwSegSNR和SI-SDR上以明显优势领先;在非匹配条件下,NCSN++ (GAN) 取得了最佳的SI-SDR提升(16.03, 15.13, 13.41 dB)。扩散模型虽在SI-SDR上与GAN接近,但在PESQ等感知指标上落后,可能存在过度去噪或振荡问题。
  • 复杂度权衡:扩散模型(如SGMSE+, SToRM)的计算量(GMACs)是GAN和判别式模型的60-100倍以上,但性能并未同步提升,性价比极低。
  • 消融与深入分析
  • 收敛与数据依赖:GAN方法仅需50小时数据即可达到峰值性能,且训练步数最少(约250k步);而扩散模型极度依赖数据量(需200小时以上),且收敛极慢(需400k步以上)。
  • 幻觉现象:在中高SNR下,所有生成式模型的幻觉都较少(音素相似度高达85%-92%);但在极低SNR(<-7dB)下,生成式模型会产生频谱伪影,幻觉显著增加。整体而言,GAN的幻觉控制略优于扩散模型。

5. 优势与局限

  • 主要优势
    1. 评估全面且公平:首次在如此多维度的条件(数据量、SNR、匹配/非匹配、骨干网络一致)下对比了主流的三大范式。
    2. 打破了对扩散模型的盲目迷信:用扎实的实验数据证明了在语音降噪任务中,扩散模型的高算力开销并未换来相应的高收益。
    3. 关注了被忽视的“幻觉”问题:为生成式语音增强的可靠性评估提供了量化视角。
  • 局限性
    1. 任务单一:仅聚焦于降噪任务,未涉及语音修复、带宽扩展等更具“生成”属性的任务,而在那些任务中扩散模型可能更具优势(论文也在讨论中承认了这点)。
    2. 评估指标的局限:尽管引入了WER和LPS评估幻觉,但仍属于客观指标,缺乏主观听感测试(如MOS)来最终定夺感知质量。
    3. 架构探索不足:虽然控制了NCSN++这一骨干网络,但未探讨针对轻量化设计的扩散模型或更先进的单步生成架构。

6. 关键结论与启发

  • 最重要的Takeaway:对于语音降噪任务,由于带噪语音提供了极强的条件引导,模型并不需要太强的“无中生有”能力。因此,单步推理的GAN方法在低SNR下实现了性能与效率的最佳平衡;扩散模型“杀鸡用牛刀”,性价比最低;高SNR下判别式模型仍是首选。
  • 对后续研究的启发
    1. 研究方向转移:研究者应停止盲目将大型扩散模型直接套用于语音降噪,而应更多关注GAN或高效判别式架构的优化。
    2. 任务适配性:生成式范式的价值应更多探索在那些条件信息极度匮乏、需要强生成先验的任务上(如极窄带带宽扩展、包络丢失的语音合成)。
    3. 低信噪比幻觉抑制:极低信噪比下生成式模型的幻觉频发是一个亟待解决的问题,未来可研究如何结合判别式特征的鲁棒性来约束生成式模型的“过度发挥”。
#5
eess.AScs.SD
Zhejiang University (QS Top 100, 985, 211)Shanghai Jiao Tong University (QS Top 100, 985, 211)Tencent (World Famous IT Company)

AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following 跨领域

Haitao Li, Tian Tan, Yuguang Yang, Shan Yang, Xie Chen
Audio and Speech Processing (eess.AS); Artificial Intelligence (cs.AI); Sound (cs.SD)
查看摘要
The rapid advancement of instruction-guided audio generation has highlighted the critical need for robust alignment evaluation. Current automated evaluation methods heavily rely on holistic scoring from general-purpose large language models, which struggle to decouple complex instructions, lack interpretability, and fail to capture fine-grained attribute mismatches. To address this, we introduce a novel dynamic rubric-based evaluation paradigm that adaptively decomposes complex audio captions into a variable number of independent, verifiable binary rubric items. To rigorously benchmark this capability, we propose the AnyAudio-Judge Bench, a comprehensive, bilingual benchmark comprising 7,920 meticulously curated samples across four diverse audio domains (speech, sound, music, and mixed), featuring deliberately constructed hard negatives. Furthermore, we construct a large-scale corpus of 105K samples with explicit Chain-of-Thought (CoT) rationales to train our dedicated evaluator, the AnyAudio-Judge model. By employing a training pipeline that combines Supervised Fine-Tuning (SFT) and Group Relative Policy Optimization (GRPO), our model successfully aligns its reasoning paths with the rubric-based scoring mechanism. Extensive experiments demonstrate that AnyAudio-Judge not only significantly enhances zero-shot alignment detection compared to state-of-the-art baselines, but also provides precise and interpretable reward signals that substantially improve instruction alignment in downstream reinforcement learning for audio generation.

📖 深度解读

1. 一句话总结

本文提出了AnyAudio-Judge,一个通过将复杂音频指令动态拆解为可验证的二元评分项来精细评估音频生成指令遵循情况的框架,并构建了专属基准和训练语料,显著提升了评估的准确性与可解释性,还能作为奖励模型指导下游强化学习。

2. 研究背景与动机

  • 核心问题:如何准确、细粒度且可解释地评估生成音频与复杂文本指令之间的对齐程度(即模型是否准确生成了指令要求的声学属性)。
  • 重要性:随着指令引导的音频生成技术(如InstructTTS、文本到音效/音乐生成)的快速发展,生成指令越来越复杂(涉及情感、音色、时序等),缺乏精准的评估手段会严重阻碍模型的迭代与优化。
  • 现有方法不足
    1. 客观指标(如CLAP相似度):只能衡量全局粗粒度相似性,对细节属性的不匹配“不敏感”。
    2. 人类评估:成本高、不可扩展且主观性强。
    3. 大模型作为评判者:现有方法多采用“一揽子”的整体打分,无法解耦复杂指令,难以定位具体是哪个属性生成失败;且缺乏带有“困难负样本”的专门基准来测试评判模型的鉴别能力。

3. 核心方法

  • 提出框架:AnyAudio-Judge,包含一个动态评分基准、一个大规模训练语料和一个专门的评价模型。
  • 关键创新点
    1. 动态评分范式:摒弃传统的整体打分,利用LLM将复杂指令自适应地拆解为数量不等的、独立的二元判断题,通过计算各项满足概率的均值得到最终对齐分数。
    2. 困难负样本构建基准:构建了包含语音、声音、音乐和混合音频的双语基准,通过“指令交换”和“属性扰动”刻意制造细微的属性错位负样本。
    3. 结合CoT与GRPO的评判模型训练:构建了10.5万条包含推理链的语料进行SFT,并利用GRPO强化学习在困难样本上进一步对齐推理路径与评分机制。
  • 核心思路直觉解释:就像老师批改作文,不能只给一个总分,而是要把评分标准拆成“字迹是否工整”、“逻辑是否清晰”、“有无错别字”等多个具体的小问题,每个问题答“是”得一分,最后算平均分。这样不仅分数更准,还能明确告诉学生哪里没做好。同时,为了防止评判模型“偷懒”,专门给它出了一些“陷阱题”(困难负样本),逼着它学会抠细节。

4. 实验与结果

  • 使用数据集/基准
  • 自建的AnyAudio-Judge Bench(7920样本,中英双语,7个子集)。
  • 外部偏好数据集PAM(用于验证泛化性)。
  • 对比基线方法:CLAPScore、AQAScore、以及多种主流大音频语言模型(如Audio-Flamingo3, Qwen2.5-Omni, Gemini-2.5-Pro等)在“整体打分”和“动态评分”两种提示词下的表现。
  • 主要实验结果
  • 在AnyAudio-Judge Bench上,AnyAudio-Judge在中英文子集上分别达到了85.26%84.45%的平均准确率,显著优于最强的基线模型Gemini-2.5-Pro(80.01% / 77.72%)。
  • 在外部PAM数据集上,AnyAudio-Judge与人类偏好的皮尔逊相关系数(LCC)达到0.614,超越了CLAPScore和所有AQAScore变体。
  • 消融实验揭示
  • 范式有效性:从整体打分切换到动态评分,即使是同样的基座模型,准确率也有大幅提升(如基座模型从65.33%升至76.66%)。
  • 训练阶段贡献:SFT教会了模型遵循评分格式,而GRPO通过聚焦困难样本进一步提升了性能(从83.78%提升至84.45%)。

5. 优势与局限

  • 主要优势
    1. 细粒度与可解释性:通过拆解指令为二元项,能精准定位音频生成中的具体属性缺陷,而非给出模糊的全局分数。
    2. 高判别力:得益于困难负样本的构建与GRPO训练,模型在鉴别细微属性错位(如情感强度不对、时序错误)上远超现有通用大模型。
    3. 实用性:不仅能做评估,还能作为密集奖励模型,有效指导下游InstructTTS的强化学习训练。
  • 局限性
    1. 评分项拆解质量的依赖:如果LLM拆解出的二元问题质量不佳(如遗漏了隐含约束或拆分过细),会直接影响评判的准确性。
    2. 推理成本增加:动态生成评分项和逐一验证的流程,相比直接输出一个全局分数,引入了额外的计算开销和推理时间。

6. 关键结论与启发

  • 最重要的Takeaway:将复杂的跨模态对齐评估转化为“动态的、细粒度的二元验证”范式,比传统的全局打分更有效、更可解释;且专门针对评判任务的微调(SFT+GRPO)能显著超越闭源通用大模型。
  • 对后续研究的启发/延伸方向
    1. 评估即监督:本文验证了精细评估模型作为RLHF奖励信号的巨大潜力,未来可拓展至更多模态(如视频生成)的指令遵循强化学习中。
    2. 自动化基准构建:通过“指令交换”和“属性扰动”构造困难负样本的Pipeline,为其他模态构建高难度评判基准提供了标准范式。
    3. 动态粒度控制:根据指令复杂度自适应调整评分项数量(简单指令少拆,复杂指令多拆)的思路,可在其他需要多步推理的LLM评估任务中推广。
#6
eess.AScs.SD

SpeakerCard-1M: An Evidence-Grounded Speaker Card Corpus for In-the-Wild Speaker Verification 跨领域

Junyi Peng, Oldřich Plchot, Xiao Song, Dading Chong, Lichun Fan 等 (11 人)
Audio and Speech Processing (eess.AS); Sound (cs.SD)
Comments: Corpus and protocols at this https URL
查看摘要
Modern speaker verification (SV) systems rely on speaker embeddings that are effective but difficult to interpret or query in natural language. Most existing speech-text corpora target controllable synthesis or utterance-level captioning, and provide limited speaker-level supervision for in-the-wild speaker recognition. This paper introduces SpeakerCard-1M, a bilingual speaker-centric resource for evidence-grounded SV, derived from VoxCeleb1/2 and CN-Celeb1/2, where the "-1M" suffix refers to the 1.78M utterance-level captions contained in the release. We adopt a tool-first, LLM-last approach: ten acoustic probes produce field-level evidence, the evidence is aggregated into speaker profiles under a schema that separates relatively stable traits from utterance-level states, and bilingual Speaker Cards are rendered by a constrained LLM that sees only the structured fields. The release includes 56.7K Speaker Card records over 10.2K speakers, 1.78M utterance-level captions, and speaker-ID-disjoint hard-negative triplets. We further define two SV-oriented cross-modal protocols, bidirectional Speaker-Text Retrieval (T2S-R / S2T-R) and Attribute-Conditioned Verification (AC-Verify), and compare a dual-encoder baseline against recent audio language models under a zero-shot forced-choice setting. Joint audio-text training increases VoxCeleb1-O EER by 0.31% absolute over the audio-only baseline. Under a style-symmetric LLM-generated counterfactual protocol, eight recent audio language models (7B-30B+ parameters, both open- and closed-source) score 49-77% on pitch-level AC-Verify under two-way forced choice, compared with 88.66% reached by our dual encoder.

📖 深度解读

1. 一句话总结

本文构建了一个名为SpeakerCard-1M的双语(英/中)说话人卡片数据集,通过“工具优先、大模型在后”的流水线将声学特征转化为结构化的自然语言描述,为传统难以解释的说话人验证(SV)系统提供了可查询的文本证据层,并揭示了当前音频大模型在细粒度声学属性(如音高)推理上的严重不足。

2. 研究背景与动机

  • 核心问题:现代说话人验证(SV)系统提取的嵌入向量虽然有效,但无法用自然语言解释或查询(例如,用户无法通过文字描述“找一个低沉沙哑的男声”来检索,也无法知道模型是基于什么属性做出的判断)。
  • 重要性:随着语音系统与自然语言接口的结合日益紧密,用户需要通过语言交互来检索说话人或验证特定属性;同时,提供可解释的“证据”而非仅仅给出一个相似度分数,对模型的可靠性至关重要。
  • 现有方法不足
    1. 现有语音-文本语料库多针对语音合成或语句级描述,缺乏说话人级别的监督;
    2. 说话人描述多为自由文本,未区分稳定特征(如性别、口音)和瞬时状态(如情绪、环境),导致模型容易将环境噪声误认为说话人特征;
    3. 现有的音频大模型在标准SV测试中错误率极高,缺乏基于结构化证据的跨模态评估基准。

3. 核心方法

  • 提出框架:SpeakerCard-1M 数据集及“工具优先、大模型在后”的构建流水线。
  • 关键创新点
    1. 特征-状态分离:在标注框架层面强制区分说话人的稳定特征(6种,如性别、音高、口音)和语句级瞬时状态(4种,如情绪、信道),并在生成“仅身份”卡片时剔除状态信息,防止环境信息泄漏为身份特征。
    2. 工具优先、大模型在后:感知阶段完全交由10个现成的声学探针提取结构化证据,大模型仅作为“语言化工具”将结构化字段转写为自然语言,彻底杜绝了大模型自由发挥产生的幻觉。
    3. 属性条件验证协议(AC-Verify):提出了一种反事实评估协议,通过翻转卡片中的某一个属性(如把“男”改成“女”)生成干扰项,专门测试模型是否真正理解了声学属性,而不是靠表面文字捷径。
  • 核心思路直觉解释:就像给病人出体检报告,先用各种仪器(探针)测出血压、心率等硬指标并分类(特征/状态),然后让文书(LLM)只根据这些指标写报告,文书不能凭空捏造;如果想知道医生(模型)是不是真懂,就把报告里的“男”改成“女”给医生看,看他会不会被忽悠。

4. 实验与结果

  • 数据集/基准:基于VoxCeleb1/2和CN-Celeb1/2构建,包含1万多名说话人、178万条语句级描述、5.67万张经过质控的说话人卡片。
  • 基线方法:自研的双编码器(WavLM + BGE-M3文本编码器),以及8个主流的开源/闭源音频大模型(如Qwen2-Audio, Gemini, GPT等,参数量7B-30B+)。
  • 主要实验结果
    1. 传统SV性能保留:联合音频-文本训练仅使VoxCeleb1-O的EER绝对增加0.31%(0.76%→1.07%),代价极小。
    2. 音频大模型在细粒度属性上全面溃败:在AC-Verify音高反事实测试中,8个顶级音频大模型的准确率仅在49%-77%之间(Qwen2-Audio甚至不如瞎猜),而本文的双编码器达到88.66%。
    3. 音频塔的不可替代性:纯文本级联基线(探针→LLM→文本匹配)在S2T检索上R@10仅为9.30%,远低于双编码器的25.50%,证明音频嵌入包含了单句探针无法捕捉的“语句到说话人”的聚合信息。
  • 消融实验揭示
    1. Schema的作用:移除特征-状态分离约束后,AC-Verify的CF指标下降6.87%,Hard指标下降4.50%,检索性能也下降,证明程序化约束不仅是个分类标签,更是保护模型性能的关键。
    2. 检索与判别的权衡:检索特化模型虽然提升了召回率,但AC-Verify准确率大幅下降(如CF从93.84%降至85.45%),说明过度优化检索容易让模型学到文本捷径,削弱了对细粒度声学属性的判别力。

5. 优势与局限

  • 主要优势
    1. 高可信度与可解释性:通过探针提取+Schema约束+LLM受限生成,从源头掐断了属性幻觉,提供了可溯源的文本证据层。
    2. 填补评估空白:提出的AC-Verify协议精准暴露了当前音频大模型在细粒度声学推理上的致命短板,为多模态SV提供了新的评估标准。
    3. 极小的SV性能损耗:证明了引入跨模态文本对齐不会破坏原有的声学表征能力。
  • 局限性
    1. 标注质量受限于探针:数据集的标注上限取决于上游声学探针的准确性,对于口音、音色、情绪等在野外数据中本身就不稳定的属性,探针置信度较低,缺乏大规模人工校验(尤其是音高)。
    2. 跨语言迁移不对称:中文训练集迁移到英文测试效果极差,说明属性级推理具有强烈的语言特异性,难以直接跨语言泛化。
    3. 身份重叠与难度校准:未对源语料库中的跨集身份重复进行后处理去重,且难负例的难度未经过人类主观校准。

6. 关键结论与启发

  • 最重要的Takeaway:当前的大型音频语言模型在处理细粒度声学属性(如音高)时依然非常薄弱,它们往往依赖文本捷径而非真正理解音频;而通过结构化证据约束训练的轻量级双编码器,能在保留传统SV性能的同时,在跨模态推理上大幅超越巨型通用模型。
  • 后续研究启发
    1. 模型架构演进:如何将结构化的声学证据(而非自由文本)作为监督信号注入到音频大模型中,以弥补其在细粒度声学属性上的推理缺陷。
    2. 评估体系拓展:未来的多模态说话人评估不应仅停留在粗粒度的检索或验证,应广泛采用类似AC-Verify的反事实评估,以检验模型是否真正实现了“证据接地”。
    3. 跨语言对齐:如何解决声学属性推理在跨语言场景下的不对称问题,构建真正语言无关的声学特征空间。
#7
eess.AScs.SD
Shanghai Jiao Tong University (QS Top 100, 985, 211)

WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling 跨领域

Wenxi Chen, Dongya Jia, Yushen Chen, Zhikang Niu, Yuzhe Liang 等 (14 人)
Audio and Speech Processing (eess.AS); Sound (cs.SD)
查看摘要
Recently, diffusion models operating on VAE latents or mel-spectrograms have become the dominant paradigm for zero-shot TTS. Although these compressed representations improve generation efficiency, they inevitably suffer from information loss and non-end-to-end training. Theoretically, directly modeling raw waveforms circumvents these issues; however, this direction remains underexplored and is often deemed difficult due to the extremely long sequence length of audio signals. To overcome this, we propose WavTTS, the first raw waveform generative TTS model that substantially narrows the gap with latent-space generative models. Built upon the flow matching with Diffusion Transformer (DiT), WavTTS directly models speech waveforms via a simple patchification strategy, while integrating multi-scale mel-spectrogram supervision to provide perceptual guidance during training. Furthermore, we investigate the impact of prediction targets and noise scheduling in waveform diffusion, and develop an effective schedule design to improve generation quality. Evaluations on open-source benchmarks demonstrate that WavTTS closely approaches the performance of current state-of-the-art latent generative zero-shot TTS models, while substantially outperforming previous end-to-end speech generation models. Our findings demonstrate the feasibility of scaling diffusion-based TTS directly in the waveform space, opening a new direction for end-to-end speech generation.

📖 深度解读

1. 一句话总结

WavTTS提出了一种直接在原始音频波形空间进行扩散建模的零样本文本转语音(TTS)框架,绕过了传统方法对有损中间特征(如梅尔频谱或VAE潜变量)的依赖,首次在纯端到端生成下逼近了当前主流压缩空间SOTA模型的性能。

2. 研究背景与动机

  • 核心问题:如何在不依赖有损中间表示(如mel-spectrogram或VAE latent)的情况下,实现高质量的零样本TTS?
  • 重要性:直接对原始波形建模可以实现真正的端到端训练,避免因使用预训练编解码器或声码器带来的信息丢失(如相位、高频细节)、多阶段级联误差以及重建伪影,理论上能打破现有生成质量的“天花板”。
  • 现有方法不足
    1. 当前主流NAR TTS模型(基于扩散或流匹配)大多在压缩的连续空间生成,这些表示本质上是有损的,且依赖两阶段训练,存在误差累积。
    2. 早期的端到端波形生成模型(如WaveNet)受限于自回归架构,推理极慢;而现有的非自回归波形模型在零样本泛化能力上与主流模型存在巨大鸿沟。
    3. 原始音频极高的时间分辨率(序列极长)和复杂的声学结构(相位、周期性)使得直接建模极具挑战性,导致该方向长期未被充分探索。

3. 核心方法

  • 提出框架:WavTTS,基于流匹配和Diffusion Transformer (DiT) 的非自回归零样本TTS模型,直接在原始波形空间生成语音。
  • 关键创新点
    1. 波形分块与x-prediction目标:采用简单的非重叠分块策略将极长的1D波形转换为较短的patch序列,大幅降低计算复杂度;将流匹配的预测目标从速度场改为直接预测干净波形,为引入感知损失提供便利。
    2. 多尺度梅尔频谱辅助监督:在x-prediction的基础上,直接对预测波形与真实波形提取多尺度梅尔频谱并计算L1距离,作为感知引导加速收敛并提升音质,无需依赖预训练模型。
    3. 信号-噪声方差对齐:针对语音波形方差远小于高斯噪声方差(导致训练长期处于低信噪比区间)的问题,在训练前对波形幅度进行常数缩放(放大9倍),使信噪比轨迹上移,稳定优化过程。
    4. 噪声偏移的时间调度:训练时采用Logit-Normal分布采样时间步,偏向高噪声区域;推理时提出PolyShift调度策略,在ODE求解的早期(高噪声阶段)分配更多积分步数,减少早期截断误差的传播。
  • 核心思路直觉解释:如果把生成语音比作雕刻,传统方法是用一块已经粗加工的“压缩木块”(mel/latent)来雕,虽然省力但丢失了木纹细节;WavTTS则是直接从一块原木(原始波形)开始雕。为了应对原木体量太大、细节太繁杂的问题,WavTTS把原木切成“积木块”来处理;雕刻时不仅看轮廓(时域损失),还用不同焦距的放大镜看纹理(多尺度mel损失);同时,调整了工作节奏——在粗雕(高噪声阶段)时花更多精力,并确保原木的尺寸和刻刀的力度匹配(方差对齐),从而避免了把木头雕崩。

4. 实验与结果

  • 数据集/基准:训练使用开源Emilia数据集(约9.5万小时中英双语)。零样本评估使用Seed-TTS test-en/zh;标准TTS评估使用LJSpeech和LibriSpeech-PC。
  • 基线方法:SOTA NAR模型(F5-TTS, E2-TTS, MaskGCT, LongCat-AudioDiT等)、AR模型(CosyVoice, Spark-TTS等)、以及早期端到端模型(VITS, JETS, WaveGrad 2)。
  • 主要实验结果
  • 零样本TTS:在Seed-TTS test-en上,WavTTS取得了1.50%的WER3.92的UTMOS,在可懂度和自然度上超越了所有对比基线(包括当前的SOTA);但在说话人相似度(SIM-o)上略逊于部分高度优化的潜空间模型(如LongCat-AudioDiT的0.76,WavTTS为0.65)。
  • 端到端TTS对比:在LJSpeech和LibriSpeech-PC上,WavTTS在WER和UTMOS上均优于VITS、JETS等传统端到端模型。
  • 消融实验揭示
  • x-prediction + mel监督:v-prediction不如x-prediction;去掉mel损失会导致收敛极慢且指标全面下降,但mel权重过大也会干扰波形流的学习。
  • 方差对齐:不缩放波形(k=1)会导致SIM-o和UTMOS断崖式下跌,证明方差对齐至关重要。
  • 噪声调度:训练时偏向高噪声采样能显著加速WER收敛;推理时PolyShift比均匀采样和Sway Sampling效果更好。
  • 缩放定律:小数据集(LibriTTS)下增大模型参数无益甚至有害,只有在足够大的数据(Emilia)下,大模型才能在SIM-o等指标上展现优势。
  • 表示空间对比:在相同框架下,直接波形建模的收敛速度和最终UTMOS优于mel、STFT和MDCT,其中STFT/MDCT因复数结构或尖锐分布导致收敛极慢。

5. 优势与局限

  • 主要优势
    1. 极简的端到端流水线:彻底摆脱了对外部声码器、编解码器或神经压缩器的依赖,避免了多阶段级联误差。
    2. 卓越的可懂度与自然度:在客观指标上(WER和UTMOS)超越了依赖中间表示的SOTA模型,证明了无损波形建模的潜力。
    3. 方法论启发:为高维音频扩散提供了行之有效的配方(方差对齐+噪声偏移+感知监督),挑战了“高质量TTS必须依赖中间特征”的固有认知。
  • 局限性
    1. 说话人相似度仍有欠缺:论文声称在音色克隆上不及部分SOTA,承认高维无损空间增加了有限容量模型捕捉目标音色的难度,需要进一步扩大参数量或引入特定对齐策略。
    2. 高维建模的计算代价:尽管采用了分块策略,直接处理波形序列的计算开销依然庞大,对数据规模和模型容量的要求极高(小数据下大模型会失效)。
    3. 推理调度的复杂性:PolyShift等策略引入了额外的超参数(如p和s),需要针对波形空间进行特定调优,不如标准均匀采样通用。

6. 关键结论与启发

  • 最重要的Takeaway:直接在原始波形空间进行大规模扩散建模不仅可行,而且能在零样本TTS任务上取得与主流压缩空间模型媲美甚至更优的表现,这为语音生成开辟了一条无需声码器的全新端到端路径。
  • 对后续研究的启发/延伸方向
    1. 模型缩放与架构改进:既然论文验证了波形空间建模对数据量和参数量的强依赖,后续可探索更高效的Transformer架构或混合专家系统,以降低计算门槛。
    2. 音色克隆增强:针对波形空间难以聚焦音色克隆的问题,可研究专门针对高维波形的说话人对比学习损失或特征解耦策略。
    3. 动态调度策略:消融实验指出均匀采样在训练后期的UTMOS表现更好,未来可探索随训练进程动态调整的时间步采样策略(先重粗结构,后重精细纹理)。
    4. 向高保真音频拓展:当前实验仅限于16kHz,该方法能否以及如何扩展到44.1kHz/48kHz的高保真音频生成,是一个极具价值的探索方向。
#8
eess.AS

Stable Hybrid Cross-Attention Fusion for Audio-Visual Event Recognition

Parinaz Binandeh Dehaghani, Danilo Pena, A. Pedro Aguiar
Audio and Speech Processing (eess.AS); Signal Processing (eess.SP)
Comments: 6 pages, 4 Figures
查看摘要
Audio-Visual Event Recognition (AVER) is essential for intelligent urban monitoring systems, where robust multimodal understanding of complex environments is required. This paper proposes a stable hybrid cross-attention fusion framework for audio-visual event recognition in smart urban environments. The proposed architecture combines pretrained Video Masked Autoencoder (VideoMAE) and Audio Spectrogram Transformer (AST) representations with FiLM-based audio conditioning, bidirectional cross-attention fusion, multimodal Transformer encoding, and modality-temporal attention. To improve computational efficiency and training stability, frozen pretrained backbones and cached feature extraction are employed. Extensive experiments on the AVE dataset show that the proposed framework achieves the highest average performance among the evaluated unimodal and multimodal baselines across multiple evaluation metrics, obtaining a best validation accuracy of 91.74% and a test accuracy of 83.85 plus/minus 1.40% over five independent runs. The results indicate that the proposed hybrid fusion strategy effectively captures complementary audio-visual information and provides robust multimodal representation learning for challenging realworld urban monitoring scenarios.

📖 深度解读

1. 一句话总结

本文提出了一种稳定的混合交叉注意力融合框架,通过结合冻结的预训练视听模型与多层次的多模态交互机制,高效且鲁棒地解决了复杂城市监控场景中的音视频事件识别问题。

2. 研究背景与动机

  • 核心问题:如何有效融合音频和视觉模态,以实现复杂真实环境下的音视频事件识别(AVER)。
  • 重要性:在智能城市监控中,单一模态往往不可靠(如视觉易受遮挡、光照影响,音频易受环境噪音干扰),多模态融合能提供更鲁棒的场景理解。
  • 现有方法不足
    1. 传统CNN+简单拼接的融合方式过于浅层,无法捕捉音视频之间复杂的跨模态依赖和长距离时序交互。
    2. 现有的基于Transformer的端到端多模态训练方法计算成本极高,且在中等规模数据集上容易出现训练不稳定的问题。

3. 核心方法

  • 提出框架:稳定混合交叉注意力融合框架。
  • 关键创新点
    1. 缓存特征与冻结骨干:冻结预训练的VideoMAE(视频)和AST(音频)骨干网络,离线提取并缓存特征,仅训练融合模块,大幅提升计算效率和训练稳定性。
    2. FiLM音频条件化:在融合前,利用视觉特征生成仿射参数,对音频特征进行缩放和偏移,实现视觉对音频的早期引导。
    3. 双向交叉注意力与多模态Transformer:通过音视频双向交叉注意力实现深度跨模态对齐,再通过多模态Transformer联合建模时序与模态间相关性。
    4. 模态-时序注意力:在最终聚合时,自适应地赋予不同模态和不同时间片段不同的权重,突出关键信息,抑制噪音。

  • 核心思路直觉解释
    想象一个在嘈杂街头执行任务的机器人。首先,它用眼睛看和耳朵听(冻结骨干提取特征);接着,它根据看到的东西(比如看到狗的嘴型)来调整听觉的敏感度,过滤掉无关噪音(FiLM条件化);然后,它把听到的和看到的互相印证,看画面找声源,听声音找画面(双向交叉注意力);随后,它在脑海中把这些印证过的信息按时间线串联起来理解(多模态Transformer);最后,在判断当前事件时,它决定更依赖哪个感官、哪个瞬间(模态-时序注意力)。整个过程只训练“如何整合信息”的大脑区域,而不去重塑“眼睛”和“耳朵”本身,因此既快又稳。

4. 实验与结果

  • 数据集:AVE(Audio-Visual Event)数据集。
  • 基线方法:Video-only (VideoMAE)、Audio-only (AST)、Simple AV Fusion (FiLM+特征拼接)。
  • 主要实验结果
  • 提出的Hybrid Fusion在几乎所有指标上取得最佳表现,测试准确率达到83.85%,平衡准确率82.77%,加权F1分数83.68%。
  • 令人意外的是,纯视频模型表现极差(测试准确率仅50.6%),而纯音频模型表现尚可(79.91%),说明在该数据集中听觉信息更具判别力。
  • 相比Simple AV Fusion(82.39%),混合融合策略带来了约1.5%的准确率提升。
  • 计算成本:尽管Hybrid Fusion可训练参数量最大(6.856M),但由于采用了缓存特征策略,其训练时间仅为0.3835小时,相比Simple AV Fusion(0.3134小时)仅有轻微增加,性价比极高。
  • 消融实验:论文通过逐步叠加模块的基线对比(从单模态 -> 简单融合 -> 混合融合)揭示了各模块的贡献,证明了双向交叉注意力、Transformer编码和时序注意力机制的叠加能有效捕捉互补信息。多次独立运行的标准差较低,验证了框架的稳定性。

5. 优势与局限

  • 主要优势
    1. 效率与性能兼顾:通过“冻结骨干+离线缓存”策略,以极小的训练时间代价换取了显著的性能提升。
    2. 训练稳定性高:结合残差连接、LayerNorm、混合精度等策略,在中等规模数据上实现了稳健的多模态学习(低方差)。
    3. 融合层次深:从特征级条件化到双向注意力,再到时序级聚合,层层递进地挖掘了跨模态互补信息。

  • 局限性
    1. 泛化性验证不足:仅在AVE一个数据集上进行了验证,未在其他音视频数据集(如VGGSound, ActivityNet)上测试其通用性。
    2. 单向条件化的偏倚:FiLM条件化仅使用了视觉引导音频,未探索音频引导视觉或双向条件化,这在视觉受阻而音频清晰的场景可能不是最优解。
    3. 缺乏端到端微调的对比:虽然冻结骨干是为了效率,但论文未讨论如果进行端到端微调(哪怕成本更高),性能是否存在天花板,使得读者无法评估该方法在绝对性能上的上限损失。

6. 关键结论与启发

  • 最重要的Takeaway:在中等规模的音视频任务中,不需要昂贵的端到端训练,通过冻结强大的预训练单模态骨干,并设计精细的多阶段混合注意力融合模块,就能以极低的计算成本获得更优、更稳定的跨模态识别效果。
  • 后续研究启发
    1. 特征缓存的推广:这种“离线提取+在线融合”的范式可广泛应用于资源受限的边缘计算场景(如实际的智慧城市摄像头端侧)。
    2. 更灵活的条件化机制:未来可探索动态路由的条件化机制(根据模态信噪比决定谁引导谁),而非固定的视觉引导音频。
    3. 模态缺失的鲁棒性:鉴于实验显示视觉特征在某些类别中极其不可靠,后续可研究该融合框架在某一模态完全缺失(如摄像头被遮挡或麦克风损坏)时的退化表现及应对策略。
#9
eess.AS

In-the-Loop Training of Deep Feedback Cancellation for Hearing Aids

Svantje Voit, Simon Doclo
Audio and Speech Processing (eess.AS)
查看摘要
Acoustic feedback limits the maximum gain in hearing aids. In addition to several approaches based on adaptive filtering, recently a deep-neural-network-based feedback cancellation (DFC) approach has been proposed, which is trained via an open-loop framework. Since open-loop-trained DFC (DFC-OL) can become unstable during inference at high gains, in this paper we propose an in-the-loop-trained DFC (DFC-IL) that integrates the DFC directly into the optimisation loop. This allows the model to be exposed to unstable conditions during training. A two-stage training strategy involving pre-training on stable systems and fine-tuning on a wider gain range enables DFC-IL to learn robust howling reduction. Experimental results on measured feedback paths demonstrate that in scenarios with small gains, the proposed DFC-IL performs similarly to DFC-OL, and both exceed the performance of adaptive filters. In scenarios with high amplification gains, DFC-IL clearly outperforms DFC-OL by maintaining system stability.

📖 深度解读

1. 一句话总结

本文提出了一种“在环训练”的深度反馈消除算法(DFC-IL),通过让神经网络在训练阶段就直面可能引发啸叫的不稳定闭环系统,解决了传统开环训练模型在高增益场景下容易崩溃的问题,显著提升了助听器的稳定性和可用增益。

2. 研究背景与动机

  • 核心问题:助听器中扬声器和麦克风之间的声学耦合会产生声学反馈,当增益过高时系统会变得不稳定,产生令人不适的啸叫,这限制了助听器能提供的最大音量。
  • 重要性: robust的反馈消除算法是助听器信号处理的核心,直接决定了用户能否获得足够的听力补偿而不受啸叫干扰。
  • 现有方法不足
    1. 传统自适应滤波器(如NLMS, PEM-NLMS):由于扬声器与麦克风信号之间存在固有相关性,其估计往往存在偏差,难以完美消除反馈。
    2. 现有深度学习方法(DFC-OL):采用“开环”框架训练,即训练数据来自没有反馈消除的稳定闭环系统。这导致训练与推理存在严重脱节——网络在训练时从未见过自己产生的残余反馈或高增益下的不稳定状态,因此在实际推理遇到高增益(易啸叫)场景时,极易失去控制导致系统崩溃。

3. 核心方法

  • 提出方法:在环训练的深度反馈消除框架(DFC-IL)。将DNN反馈消除器直接嵌入到训练的闭环系统中,使得网络在前向传播时,必须使用自己预测的反馈信号来计算误差信号并生成扬声器信号。
  • 关键创新点
    1. 闭环在环训练机制:打破了开环训练的局限,让网络在优化过程中直接暴露在残余反馈和潜在的不稳定条件下,迫使网络学会如何从自身错误中恢复并抑制啸叫。
    2. 两阶段训练策略:先在稳定的低增益条件下预训练,让网络掌握基本的反馈路径估计能力;然后在包含极高增益(可能导致啸叫)的条件下微调,让网络学习极端情况下的鲁棒性。
    3. 网络架构的时序约束:相比前作DFC-OL,去除了平均池化和递归平滑,严格将时间上下文限制在单帧内,采用帧级更新,降低了计算复杂度并增强了时序一致性。
  • 核心思路直觉解释:就像训练走钢丝的人,以前的方法(开环)是在平地上模拟动作,一旦真上了钢丝(高增益推理)就容易摔下来;现在的方法(在环)是直接在钢丝上训练,并且教练(两阶段训练)先在低矮的钢丝上教基本功,再升高钢丝(高增益微调),这样训练出来的人不仅会走,还能在摇晃(不稳定)时自我调整保持平衡。

4. 实验与结果

  • 数据集:结合了Hearpiece数据库和双麦BTE助听器测量的真实反馈路径,以及合成的反馈路径;语音数据来自LibriSpeech。测试集仅使用真实测量的反馈路径以确保评估可靠性。
  • 基线方法:经典方法(NLMS, PEM-NLMS),神经网络方法(NeuralAFC, DFC-OL)。
  • 主要实验结果
  • 低增益场景(C1, C2):DFC-OL表现最好,DFC-IL性能与之接近,两者均优于传统方法和NeuralAFC。
  • 高增益场景(C3, C4):DFC-OL性能急剧下降甚至导致系统不稳定(ECLG > 0dB),而DFC-IL依然保持系统稳定(ECLG < 0dB),平均ECLG达到-4.6 dB,全面超越DFC-OL的-2.1 dB。
  • 收敛与追踪:在7.5秒发生反馈路径突变时,神经网络方法(DFC-IL, DFC-OL)的收敛速度远快于传统自适应滤波器。
  • 消融实验/对比分析:通过对比DFC-OL和DFC-IL在不同增益下的表现,揭示了开环训练的“条件匹配偏见”——DFC-OL在匹配的低增益下极好,但泛化到高增益极差;而DFC-IL通过在环训练牺牲了极低增益下的部分绝对性能,换取了全增益范围内的鲁棒稳定性。

5. 优势与局限

  • 主要优势
    1. 高增益下的鲁棒稳定性:解决了深度学习反馈消除器在高增益下容易引发啸叫的致命缺陷,显著提高了助听器的可用增益(ASG)。
    2. 训练与推理的一致性:在环训练消除了数据分布的偏差,使模型能应对自身造成的残余反馈。
    3. 快速的路径追踪能力:继承了神经网络方法的优点,在反馈路径突变时能快速收敛。
  • 局限性
    1. 低增益下的性能折衷:论文图表显示,在低增益(C1)场景下,DFC-IL的稳态ECLG和ASG略逊于专门针对此条件训练的DFC-OL,存在一定的权衡。
    2. 两阶段训练的复杂性:相比直接开环训练,需要精心设计预训练和微调的增益范围及学习率,训练流程更复杂。
    3. 计算复杂度考量:虽然采用了帧级更新降低延迟,但在资源极其受限的实际助听器硬件上,LSTM和FC层的实时运行仍面临算力挑战(论文未详细探讨实际设备的算力开销)。

6. 关键结论与启发

  • 最重要的Takeaway:对于本身会影响系统状态的闭环控制问题(如声学反馈消除),训练框架必须与推理框架保持一致。让模型在训练时“看到”自己造成的后果(在环训练),是提升其在极端条件下鲁棒性的关键。
  • 对后续研究的启发
    1. 算法层面:两阶段训练策略可启发其他涉及不稳定闭环控制的信号处理任务(如回声消除、主动降噪),即“先稳后破”的 curriculum learning 思路。
    2. 架构层面:如何设计能在低算力设备上实时运行且保持闭环稳定性的轻量级网络,是下一步走向落地的关键。
    3. 性能平衡:未来研究可探索如何结合开环的精度优势与在环的稳定优势,例如设计动态切换机制或多任务损失函数,以消除低增益下的性能折衷。
#10
eess.AScs.SD
University of Science and Technology of China (QS Top 100, 985, 211)Peking University (QS Top 100, 985, 211)

SegTune: Structured and Fine-Grained Control for Song Generation 跨领域

Yuejiao Wang, Zihao Ji, Pengfei Cai, Xu Li, Haorui Zheng 等 (9 人)
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: This paper has been accepted to ACL 2026 as an oral presentation and has been nominated for the Best Paper Award. This work is a revised and extended version of an earlier technical report ( arXiv:2510.18416 ). arXiv admin note: text overlap with arXiv:2510.18416
查看摘要
Recent advances in neural song generation have enabled high-quality synthesis from lyrics and global textual prompts. However, most systems fail to model temporally varying attributes of songs, severely limiting fine-grained control over musical structure and dynamics. To address this, we propose SegTune, a Diffusion Transformer-based framework enabling structured and fine-grained controllability by allowing users or large language models (LLMs) to specify local musical descriptions aligned to song segments. These segment prompts are temporally broadcast to corresponding time windows, while global prompts ensure stylistic coherence. To support precise lyric-to-music alignment, we introduce an LLM-based duration predictor that autoregressively generates sentence-level timestamps in LyRiCs format. We further construct a large-scale data pipeline for high-quality song collection with aligned lyrics and prompts, and propose new metrics to evaluate segment alignment and vocal consistency. Experiments demonstrate that SegTune outperforms existing baselines in both musicality and controllability. Visit our project page ( this https URL ) for codes and more generated songs.

📖 深度解读

1. 一句话总结

SegTune 提出了一种基于扩散 Transformer 的歌曲生成框架,通过引入“全局+段落”的层级文本提示机制和基于 LLM 的歌词时长预测器,解决了现有歌曲生成模型无法对音乐结构和情感进行细粒度时序控制的问题。

2. 研究背景与动机

  • 核心问题:现有的歌曲生成模型(无论是自回归 AR 还是非自回归 NAR)主要依赖全局文本提示进行控制,无法捕捉和生成随时间变化的音乐属性(如特定段落的乐器编排、情感变化、节奏强度)。
  • 重要性:真实歌曲的结构是动态演进的(主歌、副歌、桥段各有不同),缺乏细粒度控制会导致生成的歌曲听感单调、平庸,且人声与伴奏容易在表达上脱节,严重限制了创作者的表达灵活性。
  • 现有方法不足
    1. 控制粒度粗:现有模型仅支持全局控制,少数加入结构标签的方法分辨率依然不足。
    2. 时长标注依赖人工:NAR 模型通常需要人工提供精确的歌词时间戳,或使用脆弱的零样本 LLM 提示,既耗时又容易出错。
    3. 模态协调难:在只有全局条件的约束下,模型很难同时生成协调的人声和伴奏。

3. 核心方法

  • 提出框架:SegTune,一个基于条件流匹配和 Diffusion Transformer (DiT) 的非自回归歌曲生成框架。
  • 关键创新点
    1. 层级提示条件化:将文本提示分为“全局提示”(控制整体风格、音色)和“段落提示”(控制特定时间窗口的情感、乐器、节奏),段落提示在对应的时间帧上进行时间广播,实现全局一致与局部可控的解耦。
    2. 基于 LLM 的时长预测器:微调 Qwen3-4B 模型,根据歌词和层级提示自回归生成句子级别的 LRC 格式时间戳,彻底免除了推理时对人工时间戳的依赖。
    3. 精细化数据与评估管线:构建了包含质量过滤、歌词对齐和层级标注的大规模数据处理管线,并提出了段落级 MuLan 分数和歌手属性评分等新指标来评估细粒度控制力。
  • 核心思路直觉解释:如果把生成歌曲比作拍电影,以前的方法是给导演一个“全局剧本”(比如:拍一部科幻片),导演只能凭感觉拍;SegTune 则是给导演提供了“分镜头脚本”(段落提示),明确指定第几分钟要紧张、第几分钟要抒情,同时还有一个智能场记(时长预测器)自动计算每句台词该在什么时候说,从而让整部电影既有统一风格,又有起伏跌宕。

4. 实验与结果

  • 数据集/基准:内部收集的以中文流行歌曲为主的高质量数据集(预训练约 2.7 万小时,微调约 4 千小时);测试集为 ChatGPT 生成的 15 首中文流行歌曲。
  • 基线方法:YuE, LeVo (AR 模型);DiffRhythm+, ACE-Step (NAR 模型)。
  • 主要实验结果
  • 音质与音乐性:SegTune-DPO 在主观音乐性 MOS 评分中达到最高(4.57),且标准差最小;在客观音频美学和 SongEval 指标上同样名列前茅。
  • 歌词保真度:SegTune-SFT 的音素错误率(PER)仅为 14.5%,远低于其他基线(如 YuE 的 48.5%),证明其人声清晰度极高。
  • 指令遵循:SegTune-SFT 的性别控制准确率达到 96.7%,显著优于其他模型。
  • 消融实验揭示
  • 提示编码器选择:使用 Qwen3-Embedding 替代音乐领域常用的 MuQ-MuLan 效果更好,因为 MuQ-MuLan 在训练时缺乏歌手属性(如性别)的对齐,导致其嵌入空间无法区分男女声;而层级拼接优于线性融合。
  • 时长预测器:微调的 Qwen3-SFT 预测误差(MAE 0.99s)远低于零样本 GPT-4o(3.24s),且使用该预测器生成的音乐质量与使用真实时间戳几乎无异。

5. 优势与局限

  • 主要优势
    1. 细粒度控制突破:首次在 NAR 歌曲生成中实现了真正意义上的段落级属性控制,打破了全局提示带来的同质化瓶颈。
    2. 自动化程度高:时长预测器摆脱了人工标注时间戳的繁琐,极大降低了用户使用门槛。
    3. 生成稳定性强:结合 DPO 训练和高质量数据管线,生成的音乐在音乐性和音质上不仅上限高,且方差极小(表现稳定)。
  • 局限性
    1. DPO 带来的属性偏移:论文坦诚指出,由于偏好数据中年轻女声占主导,DPO 优化虽然提升了音质,却损害了模型对年龄和性别的控制准确率(存在偏好与指令遵循的权衡)。
    2. 段落结构依赖:当用户输入的段落结构模糊或不符合常规时,时长预测器的性能会下降,进而影响整体生成质量。
    3. 段内动态缺失:目前只能控制段落级别的属性变化,无法实现段落内部的渐变效果(如渐强、装饰音等)。

6. 关键结论与启发

  • 最重要的 takeaway:将文本提示在时间维度上进行结构化解耦(全局风格广播+局部段落广播),并辅以自动化的时长预测,是解决非自回归歌曲生成中“长序列一致性”与“局部细粒度控制”矛盾的有效途径。
  • 对后续研究的启发
    1. 对齐策略的改进:DPO 会导致特定属性的“遗忘”或偏移,未来需要探索多目标强化学习或在线策略优化,在提升音质的同时硬性约束人口统计学属性(如性别、年龄)的保真度。
    2. 更细粒度的控制:当前控制粒度停留在“段落”,未来可探索 Beat 级别或 Note 级别的时变控制信号注入,以实现渐强、滑音等更丰富的音乐表现。
    3. 多智能体协作创作:SegTune 的段落提示可由 LLM 自动生成,这为构建“对话式 AI 音乐创作助手”铺平了道路,用户只需自然语言交流,LLM 即可动态拆解为层级提示并完成生成。
#11
eess.AScs.SD

Before Fusion, Ask What to Keep: Contextual Calibration of Multimodal Signals 跨领域

Jiyuan Liu, Liangwei Nathan Zheng, Wei Emma Zhang, Xinpei Wang, Weitong Chen
Machine Learning (cs.LG); Multimedia (cs.MM); Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: 11 pages, 7 figures, 9 tables
查看摘要
Multimodal systems often benefit from combining information across language, sound, and visual streams, but this benefit is not guaranteed. A modality that is useful for one input may become distracting for another, and local feature responses within the same modality can disagree with evidence from other sources. This work investigates how to adjust multimodal representations before they are merged by a downstream predictor. We develop a compact calibration module that compares each modality with the others at the summary level, extracts cues of cross-source support and conflict, and converts these cues into instance-wise and dimension-wise modulation signals. The calibration is applied to the original modality features rather than to already fused representations, enabling the model to suppress misleading components, preserve weak but useful evidence, and emphasize responses that are better supported by the current multimodal context. The module is designed as a plug-in component and can be attached to different fusion backbones without changing their prediction heads. Across five benchmarks covering sentiment understanding, action recognition, audio-visual event detection, and audio-visual emotion classification, the proposed pre-combination calibration strategy improves performance under both sequence-based and convolutional fusion settings. Additional analyses under modality removal, synthetic corruption, training dynamics, and feature-level visualization show that calibrating signals before fusion can reduce interference from unreliable modalities and produce more stable multimodal optimization.

📖 深度解读

1. 一句话总结

这篇论文提出了一个名为VGMR的即插即用模块,在多模态特征融合之前,通过评估各模态在跨模态上下文中的“价值”(一致性与冲突证据),对原始特征进行细粒度的增强或抑制,从而解决不可靠模态信号在融合时产生干扰的问题。

2. 研究背景与动机

  • 核心问题:多模态学习中,增加模态并不总是带来性能提升。弱模态或不可靠模态可能包含噪声、冗余或与其他模态冲突的信息,直接融合会干扰最终预测。
  • 重要性:如果模型在融合前无法区分哪些信号是有用的、哪些是有害的,就会导致“劣币驱逐良币”,使得多模态模型的表现甚至不如单模态模型。
  • 现有方法不足:现有的解决思路(如OGM-GE、PMR等)大多从“优化层面”入手,通过调整梯度、损失权重或学习率来平衡模态。但这属于“事后补救”,在特征进入联合优化后才干预,无法在融合前显式地识别并剔除有害的特征成分;而现有的注意力或门控机制通常只关注“相关性”或“显著性”,但一个显著且自信的模态在与其他模态冲突时,反而可能是有害的。

3. 核心方法

  • 提出方法:Value-Gated Modality Refiner (VGMR),一个置于融合骨干网络之前的轻量级特征校准模块。
  • 关键创新点
    1. 重新定义“价值”:将模态价值定义为“上下文条件下的影响证据”,而非直接保留概率。高价值意味着该信号对当前上下文影响大,但最终是保留还是抑制,由门控结合特征本身共同决定。
    2. 基于一致性与冲突的跨模态交互:在摘要层面计算目标模态与其他模态的逐元素乘积(一致性)和绝对差(冲突),作为评估价值的依据。
    3. 双层价值引导的细粒度门控:生成全局(样本级)和通道级的价值信号,结合原始特征和投影特征,生成与原始特征等维度的细粒度门控矩阵,实现时间步和特征维度的精准调制。
  • 核心思路直觉解释:就像一个会议的主持人(VGMR),在大家融合讨论之前,先分别找每个人(各模态)谈话。主持人不仅听他们自己怎么说,还对比他们之间的观点是否一致(一致性)或矛盾(冲突)。如果某人的观点虽然强烈但与其他人都矛盾,主持人就会给他“降音量”(抑制);如果某人的观点虽弱但补充了关键信息,主持人就给他“扩音”(增强),从而确保进入自由讨论环节的信息都是高质量且互补的。

4. 实验与结果

  • 数据集/基准:涵盖了5个基准数据集,包括情感理解(MOSI, MOSEI)、动作识别(UCF101)、视听事件检测(AVE)和视听情感分类(CREMA-D)。
  • 基线方法:对比了朴素融合、优化级平衡方法(OGM-GE, PMR, MMPareto, ARL等)以及通用门控/交互机制(Cross-Attention, Sigmoid+Tanh Gate)。
  • 主要实验结果
  • 在Transformer和Concat两种骨干网络下,VGMR在大多数数据集上取得了最佳Accuracy和有竞争力的F1。例如在MOSEI(Transformer)上,达到84.46%的Acc和80.29%的F1,优于所有优化级平衡方法。
  • 在受控对比中,VGMR优于参数量相当的Concat+MLP和通用门控机制,证明性能提升并非单纯来自参数量增加。
  • 消融实验揭示
  • 通道级价值信号比全局信号对细粒度调制更关键,但两者结合效果最好。
  • 冲突证据比一致性证据更重要,特别是对于弱模态的提纯。
  • 反直觉的发现:当文本被噪声破坏时,模型输出的“价值分数”反而升高,但“门控响应”却降低。这证实了“高价值≠高保留”,高价值只是标记了“这里有需要关注的影响”,门控网络结合特征后决定对其进行抑制。

5. 优势与局限

  • 主要优势
    1. 作用时机前置:从源头(融合前)净化特征,避免了有害信号在融合阶段污染全局表征。
    2. 兼容性强:作为即插即用模块,可与现有优化级平衡方法(如OGM-GE, ARL)叠加使用并进一步提升性能。
    3. 鲁棒性显著:在模态缺失和高斯噪声注入实验中,VGMR表现出更强的抗干扰能力和更稳定的优化曲线。
  • 局限性
    1. 计算开销:虽然训练时间低于部分优化级方法,但推理延迟从1.17ms增加到3.87ms,在低延迟要求的场景下是不小的负担。
    2. 粒度受限:当前跨模态交互基于池化后的“摘要”计算,可能会丢失细粒度的时间/空间局部冲突(如短暂的音画不同步)。
    3. 理论联系待深化:虽然受信息分解(PID)启发,但并未显式计算和优化冗余、独特和协同信息量,价值信号仍偏经验性。

6. 关键结论与启发

  • 最重要的Takeaway:多模态融合的关键不在于“要不要用弱模态”,而在于“融合前如何甄别并过滤其中的有害成分”。将“影响证据(价值)”与“调制方向(门控)”解耦,比单纯赋予模态权重更有效。
  • 后续研究启发
    1. 细粒度价值估计:将摘要级的交互扩展到时间窗或空间区域级,以捕捉更局部的跨模态冲突。
    2. 与信息论的深度结合:未来可探索将价值估计与互信息、冗余度等信息论指标显式绑定,提供更严格的理论保障。
    3. 更极端的鲁棒性探索:将VGMR推广到模态缺失、时序错位等更复杂的真实世界噪声场景中验证和改进。
#12
eess.AScs.SD
Fudan University (QS Top 100, 985, 211)

EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement 跨领域

Hui Li, Yangfan Gao, Junlin Shang, Changhao Jiang, Tao Gui 等 (7 人)
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
Comments: 17 pages, 10 figures
查看摘要
Audio tokenizers serve as the discrete interface between continuous audio and Audio Language Models (ALMs), but existing tokenizers often struggle to support both understanding and generation. Reconstruction-oriented codecs preserve acoustic fidelity but lack rich semantics, while semantic-aware tokenizers typically rely on separate semantic and acoustic streams, introducing redundancy or misalignment. We propose \textbf{EntangleCodec}, a unified discrete audio tokenizer that learns caption-aligned semantic-acoustic representations before quantization. By aligning audio with rich captions rather than ASR transcripts, EntangleCodec captures linguistic content, speaker identity, emotion, prosody, and acoustic scenes within a compact token stream. A flow-matching diffusion decoder further enables high-quality reconstruction across speech, music, and general audio. EntangleCodec achieves reconstruction quality competitive with specialized codecs, outperforms all codec-based baselines on audio understanding by up to \textbf{+7.4\%} on MMAR, and supports both TTS and TTA generation in a unified framework. Furthermore, EntangleCodec-based audio language models demonstrate strong scaling behavior: even at \textit{0.6B} parameters, the model surpasses specialized continuous-representation LLMs with over \textit{13B} parameters across three benchmarks using \textbf{22$\times$} fewer parameters; scaling to \textit{8B} further establishes new state-of-the-art results on MMAR, highlighting that representation quality is as critical as model scale in audio language modeling. Code and model weights are available at this https URL .

📖 深度解读

1. 一句话总结

本文提出了EntangleCodec,一种通过将音频与丰富文本描述(而非仅ASR文本)对齐来学习“语义-声学纠缠”表征的统一音频分词器,仅用单一离散词表就在音频理解、重建和生成任务上实现了全面领先,甚至让0.6B的小模型在理解能力上超越了13B的连续表征大模型。

2. 研究背景与动机

  • 核心问题:如何为音频大语言模型(ALMs)设计一种离散分词器,使其既能保留高保真的声学细节(用于生成/重建),又能蕴含丰富的语义信息(用于理解推理)。
  • 重要性:分词器是连续音频与离散语言模型之间的“接口”,其表征质量直接决定了下游音频大模型的上限。
  • 现有方法不足
    1. 重建导向的编解码器(如EnCodec, DAC):保真度高,但缺乏高层语义,导致下游LLM难以进行深度推理。
    2. 语义感知的分词器(如SpeechTokenizer, XCodec):通常采用“双流”架构(语义流+声学流),不仅引入了冗余,还需要复杂的后期融合;且其语义监督多依赖ASR转录文本,丢失了说话人身份、情感、韵律和环境声等非文本语义信息。

3. 核心方法

  • 提出方法:EntangleCodec,一个统一的离散音频分词器框架。
  • 关键创新点
    1. 量化前的语义-声学纠缠:摒弃传统的双流架构,使用单一共享编码器,在量化前就将语义和声学信息融合在同一个表征空间中,避免了后期融合的麻烦。
    2. 基于丰富描述的语义对齐:不再使用单薄的ASR文本,而是利用LLM生成包含说话人特征、情感、韵律、音乐结构和声学场景的“丰富描述”,通过对比学习将音频与这些丰富文本对齐,让离散token承载多维度的语义。
    3. 两阶段解耦训练策略:第一阶段联合训练编码器、文本编码器、量化器和解码器(学习语义);第二阶段冻结编码器和量化器,仅用对抗损失精调解码器(提升重建音质),实现语义与音质的解耦优化。
  • 核心思路直觉解释:传统的分词器就像是一本只有发音指南(声学)或只有字幕(ASR)的字典;而EntangleCodec像是一本“百科全书”,它在把声音变成密码(量化)之前,就已经把说话人的情绪、周围的场景、乐器的种类等“潜台词”和声音本身的波形揉在一起了。这样LLM拿到这串密码时,不仅知道“说了什么”,还知道“怎么说的”、“在哪说的”,同时还能用这串密码原样还原出声音。

4. 实验与结果

  • 数据集/基准
  • 训练:LibriSpeech, MusicBench, AudioSet等约3200小时多域音频。
  • 评估:重建、理解(MMAR, MMAU-mini, MMAU)、生成(TTS的SEED-TTS, TTA的AudioCaps/Clotho)。
  • 基线方法:DAC, EnCodec, WavTokenizer, SpeechTokenizer, XCodec, Mimi, XCodec2,以及SALMONN, Qwen2-Audio等连续表征大模型。
  • 主要实验结果
    1. 重建:UTMOS达到3.96,与专门的重建编解码器XCodec2(4.02)旗鼓相当,且在语音、声音、音乐三个域均保持前二,证明语义增强未牺牲音质。
    2. 理解:在控制变量下(同用Qwen3-0.6B),MMAR得分比次优基线高+7.4%;基于EntangleCodec的0.6B模型甚至超越了13B的SALMONN,参数量减少22倍。
    3. 生成:TTS的WER降至9.8%(最低),TTA的CLAP分数达0.17(是次优的4倍以上),证明统一token对生成的有效性。
    4. 缩放定律:扩展到8B参数时,在MMAR上达到42.6%的SOTA。
  • 消融实验揭示
    1. 去掉对比学习损失,UTMOS暴跌0.92,说明文本对齐不仅提升语义,反而有助于形成更结构化的声学表征。
    2. 用ASR替代丰富描述,性能全面下降,证明非文本的细粒度语义(情感、场景等)对统一分词至关重要。
    3. 第二阶段的解码器精调对提升感知音质不可或缺。

5. 优势与局限

  • 主要优势
    1. 极简且统一的架构:单流单码本设计,无需双流融合,一套token同时搞定理解、TTS和TTA。
    2. 极高的参数效率:表征质量极高,使得小规模LLM也能爆发出比肩超大连续模型的推理能力。
    3. 语义与声学互促进:证明了通过文本对齐引入语义,不仅不会拖累重建,反而能引导出更好的声学表征结构。
  • 局限性
    1. 语义粒度受限:依赖LLM生成的描述,对于极其微妙的情感变化或复杂的和声细节,当前标注可能仍不够精细。
    2. 缩放探索不足:受限于算力,LLM缩放仅验证到8B参数,在30B/70B等更大规模下的表现及重建/理解的算力分配平衡仍是未知数。

6. 关键结论与启发

  • 最重要的Takeaway:在音频大模型时代,分词器的表征质量与模型参数规模同等重要(甚至更具性价比)。一个设计优良的离散分词器,可以打破离散token在理解任务上的瓶颈,让小模型战胜大模型。
  • 对后续研究的启发
    1. 超越ASR的监督信号:未来音频自监督/对比学习应更多挖掘多维度的自然语言描述作为监督,而非局限于文本转录。
    2. “先纠缠后解耦”的训练范式:在量化前融合多模态信息,在量化后分阶段解耦优化特定目标(如音质),这种范式可推广至视频、多模态分词器的设计。
    3. 统一生成接口:TTS和TTA无需再使用不同的建模管线和分词器,统一离散token为“万物皆可生成”的通用音频GPT铺平了道路。
#13
eess.AS

CoughSense: Five-Class Respiratory Disease Classification via Whisper Encoder Fine-Tuning and Dual-Encoder Cross-Attention Fusion with Balanced Contrastive Learning 跨领域

Nikhil Vincent
Machine Learning (cs.LG); Audio and Speech Processing (eess.AS)
Comments: 26 pages, 3 figures
查看摘要
Automated cough analysis offers a path to low-cost respiratory screening, but most existing work stops at binary COVID-19 detection. A practical tool needs to tell apart several respiratory conditions from one cough recording on a consumer smartphone. We present CoughSense, a system that sorts cough recordings into five classes. These are healthy, COVID-19, asthma or respiratory condition, bronchitis, and pneumonia. We aggregated 18,301 recordings from four public datasets (Coswara, CoughVID, Virufy, and the West China Hospital Pediatric Cough Dataset) and used the OpenAI Whisper encoder as a pretrained backbone for cough disease classification. The main contribution is active-frame QKV attention pooling, which restricts attention to the first 200 of 1500 encoder tokens. This avoids the silence-dilution problem that arises because a 3-second cough fills only 150 tokens of Whisper's 30-second input window. Other training parts handle the 19 to 1 class imbalance and the four-dataset domain shift. These include WeightedRandomSampler, SpecAugment, Balanced Mixup with forced minority pairing, a supervised contrastive auxiliary loss, FiLM symptom conditioning, and gradient-reversal domain adaptation. A dual-encoder model fuses Whisper with the OPERA-CT respiratory foundation model through cross-attention. CoughSense (Whisper-tiny, 8.6M parameters) reached 82.3 percent balanced accuracy on five-fold cross-validation (macro-F1 of 0.817, AUC of 0.941). It beat an ImageNet-pretrained EfficientNet-B2 by 11.1 points and a ViT trained from scratch by 29.6 points. All five classes passed 74 percent recall and four of five passed 80 percent. The dual-encoder model reached 85.4 percent balanced accuracy. Active-frame pooling is the largest single contributor across all ablation components at 5.1 points, which should help any short-audio task using Whisper as a backbone.

📖 深度解读

1. 一句话总结

本文提出了CoughSense系统,通过微调Whisper语音编码器并引入“有效帧注意力池化”解决短音频信号稀释问题,结合对比学习与域适应技术,首次实现了从智能手机录音中对五种呼吸道疾病的高精度分类,并部署为移动端实时应用。

2. 研究背景与动机

  • 核心问题:如何仅通过智能手机录制的咳嗽声,准确区分健康、COVID-19、哮喘/呼吸道疾病、支气管炎和肺炎这五种类别。
  • 重要性:咳嗽是全球门诊最常见的原因,智能手机录音提供了一种低成本、易普及的呼吸道疾病初筛手段。现有的研究大多局限于“是否感染COVID-19”的二元分类,无法满足现实中区分不同呼吸道疾病的临床需求(例如,儿童湿咳更需警惕肺炎而非新冠)。
  • 现有方法不足
    1. 声学模糊性:不同疾病(如支气管炎与肺炎)的咳嗽声学特征极为相似,传统模型难以区分。
    2. 类别严重失衡:健康样本与肺炎样本比例达19:1,导致模型容易陷入“全预测为健康”的崩溃状态。
    3. 数据域偏移:数据来自不同地域、不同人群(成人与儿童)和不同采集环境,模型容易记住环境噪声而非疾病特征。
    4. 架构局限:现有方法多采用ImageNet预训练的视觉模型(如EfficientNet),缺乏对音频时序结构的深层理解。

3. 核心方法

  • 提出框架:CoughSense,一个基于Whisper编码器微调的单编码器模型,以及一个融合Whisper与OPERA-CT的双编码器模型。
  • 关键创新点
    1. 有效帧QKV注意力池化:这是本文最大的技术贡献。Whisper设计用于30秒音频,而咳嗽通常只有1-4秒。在1500个输出Token中,约90%是静音零填充,直接平均池化会“稀释”疾病信号。该方法只截取前200个Token(覆盖约4秒有效音频),再通过可学习的多头注意力机制进行池化。
    2. 首次将Whisper编码器用于咳嗽分类:利用Whisper在68万小时语音上学到的声门激励和声道共振特征,迁移到同属喉部发声机制的咳嗽声上。
    3. 针对失衡与偏移的训练策略:结合加权采样、强制少数类配对的Balanced Mixup、监督对比损失、FiLM症状条件化(引入发热/味觉丧失等临床特征)以及梯度反转域适应(GRL),多管齐下解决数据痛点。
    4. 双编码器交叉注意力融合:将通用语音模型Whisper与专业呼吸音频模型OPERA-CT通过交叉注意力机制融合,互补信息。
  • 核心思路直觉解释:就像让一个懂人类发声的“语言学家”(Whisper)和一个懂病理声音的“呼吸科医生”(OPERA-CT)一起会诊。同时,因为病人只咳了3秒,我们不让“语言学家”看30秒的白卷,而是只把有声音的那段剪出来(有效帧池化)让他重点分析,并结合病人的症状单(FiLM条件化),从而给出准确诊断。

4. 实验与结果

  • 数据集:聚合了4个公开数据集(Coswara, CoughVID, Virufy, 华西医院儿科咳嗽数据集),共计18,301条录音。对极度缺乏的支气管炎和肺炎数据进行了8倍数据增强。
  • 基线方法:CLAP(零样本)、从头训练的ViT、ImageNet预训练的EfficientNet-B2。
  • 主要实验结果
  • CoughSense (Whisper-tiny, 8.6M参数) 达到 82.3% 的平衡准确率,比同参数量的EfficientNet-B2高出11.1个百分点,比从头训练的ViT高出29.6个百分点。
  • 五个类别的召回率均超过74%,其中四个超过80%。最难识别的是COVID-19(74.8%),最易识别的是健康(89.1%)。
  • 双编码器模型进一步提升至 85.4% 平衡准确率
  • 服务端推理延迟约180毫秒。
  • 消融实验揭示
  • 有效帧池化贡献最大,单独带来 +5.1% 的提升,证明了去除静音稀释效应对短音频任务至关重要。
  • QKV注意力池化在有效帧基础上再添 +2.2%。
  • 其他组件(FiLM +0.7%, GRL +0.4%, Mixup +0.5%, SupCon +0.3%)均提供正向增益。
  • 数据增强对少数类至关重要:无增强时支气管炎/肺炎召回率仅40%/36%,8倍增强后飙升至80%/82%。

5. 优势与局限

  • 主要优势
    1. 突破短音频瓶颈:有效帧池化优雅地解决了通用音频大模型与短促医学音频之间的长度不匹配问题,具有广泛推广价值。
    2. 轻量且高效:仅用8.6M参数的Whisper-tiny就超越了体量相近甚至更大的传统视觉模型,证明了语音预训练的强大迁移力。
    3. 端到端落地:不仅停留在算法层面,还实现了iOS/Android的移动端实时部署。
  • 局限性
    1. 成人与儿童域鸿沟:支气管炎和肺炎数据仅来自0-11岁儿童,而其他数据多为成人,这种声学解剖学差异限制了模型在成人支气管炎/肺炎上的可靠性。
    2. 标签噪声:大部分非新冠标签依赖自报,缺乏PCR或临床确诊,可能影响评估指标的真实性。
    3. 缺乏前瞻性临床验证:所有结果均来自离线交叉验证,尚未在真实临床流中进行前瞻性测试。

6. 关键结论与启发

  • 最重要的Takeaway:在处理短促音频(如咳嗽、心跳)时,直接套用长音频预训练模型会导致严重的“静音稀释”效应;通过“有效帧截断+注意力池化”可以释放大模型在短音频任务上的巨大潜力,这一发现不仅适用于咳嗽,也适用于所有基于Whisper等大模型的短音频场景。
  • 对后续研究的启发
    1. 数据层面:急需收集具有临床确诊的成人支气管炎和肺炎咳嗽数据集,以弥补当前的年龄域偏移;未来可纳入结核病(TB)数据扩展为六分类。
    2. 架构层面:通用语音大模型(Whisper)与专业医学音频大模型(OPERA-CT)的交叉注意力融合是提升性能的有效途径,后续可探索更高效的融合机制。
    3. 工程层面:当前推理依赖服务端,未来可探索通过ONNX导出实现完全的端侧推理,既降低延迟又保护患者隐私。
#14
eess.AScs.SD
KAIST - Korea Advanced Institute of Science & Technology (QS Top 100)

Inference-Time Scaling for Joint Audio-Video Generation 跨领域

Jaemin Jung, Kyeongha Rho, Inkyu Shin, Joon Son Chung
Multimedia (cs.MM); Computer Vision and Pattern Recognition (cs.CV); Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: Accepted by Transactions on Machine Learning Research (TMLR). Project page: this https URL
查看摘要
Joint audio-video generation aims to synthesize realistic audio-video pairs that are both semantically aligned with text prompts and precisely synchronized. While existing joint audio-video generation models often require substantial training resources to improve fidelity, Inference-Time Scaling (ITS) has recently emerged as a promising training-free alternative in single-modality domains. However, extending ITS from a single modality to multimodal domains is non-trivial, as it requires balancing multiple heterogeneous objectives. In this paper, we present the first comprehensive study of ITS for joint audio-video generation. We first demonstrate that a multi-verifier framework is essential to address the limitations of single-objective guidance, including asymmetric performance trade-offs and verifier hacking. Through systematic analysis, we then identify an optimal multi-verifier combination that yields balanced improvements across all quality dimensions. Finally, to effectively aggregate diverse reward signals, we propose Adaptive Reward Weighting (ARW), a novel test-time optimization algorithm. ARW treats reward aggregation as an online optimization problem, utilizing learnable parameters to calibrate reward variances without requiring prior knowledge of reward distributions, thereby ensuring robust multi-objective selection. Experimental results on VGGSound and JavisBench-mini benchmarks demonstrate that our framework significantly enhances semantic alignment, perceptual quality, and audio-visual synchronization of generated outputs. Synthesized samples and code are available on the project page: this https URL .

📖 深度解读

1. 一句话总结

本文首次将推理时间缩放(ITS)技术引入联合音视频生成任务,通过构建多验证器框架并结合自适应奖励加权算法(ARW),在不重新训练模型的前提下,有效解决了多模态生成中语义对齐和音视频同步难以兼顾的问题。

2. 研究背景与动机

  • 核心问题:如何在不增加训练成本的前提下,提升联合音视频生成的质量,使其同时满足文本语义对齐、音视频同步和高感知质量。
  • 重要性:现实世界中的视听信号是紧密耦合的,高质量的联合生成对影视制作、游戏和VR/AR等领域具有重要应用价值。然而,现有模型经常生成与文本提示不符或音画不同步的样本。
  • 现有方法不足
    1. 训练成本高昂:传统提升生成质量的方法通常需要扩大模型规模或增加训练数据,消耗巨大算力。
    2. 单模态ITS的局限:推理时间缩放(ITS,即通过增加推理计算量来提升质量)在单模态(纯图像/视频)中已取得成功,但直接扩展到多模态并非易事,因为多模态需要同时优化多个异构目标(如文本对齐、音画同步等)。
    3. 单验证器易被“黑客攻击”:仅使用单一奖励信号进行搜索,会导致模型钻空子(Verifier Hacking),即某一项指标虚高,但其他关键指标反而下降,出现不对称的性能权衡。

3. 核心方法

  • 提出框架:针对联合音视频生成的多验证器推理时间缩放框架,核心包含最优验证器组合策略与自适应奖励加权(ARW)算法。
  • 关键创新点
    1. 揭示单验证器的缺陷与多验证器的必要性:实验证明单一奖励信号会导致严重的权衡失调和“验证器黑客”现象,必须引入多验证器来全面评估多模态质量。
    2. 发现最优验证器组合:通过系统分析,发现将“文本-视频一致性验证器(VR)”与“细粒度音视频同步验证器(JS)”结合,能取得最均衡的提升。因为同步性本身蕴含了时间维度的语义一致性,比单纯加粗粒度的语义对齐验证器更有效。
    3. 提出自适应奖励加权(ARW):一种测试时优化算法,用于融合不同量级和分布的异构奖励信号。
  • 核心思路直觉解释
  • 多验证器组合:就像选拔全能运动员,不能只看跑步成绩(单一指标),否则可能选出偏科的选手;必须同时考核跑步和跳跃(多指标),才能选出综合素质最高的人。
  • ARW算法:不同裁判(验证器)的打分标准不同,有的给分松(方差大),有的给分紧(方差小)。如果直接把分数相加,松的裁判会主导结果。ARW就像一个动态调节器,在推理时自动学习每个裁判打分的波动情况,给波动大的打分乘上一个较小的缩放系数,从而让所有裁判的发言权处于同一量级,确保评选公平。

4. 实验与结果

  • 数据集/基准:VGGSound测试集、JavisBench-mini。
  • 基线方法
  • 生成模型:JavisDiT, MMDisCo。
  • 搜索策略:Best-of-N, EvoSearch。
  • 聚合方法:Rank聚合、Min-Max归一化、Weighted Sum、Z-score归一化。
  • 主要实验结果
  • 在JavisBench-mini上,使用EvoSearch+ARW的组合,相比无ITS的基线,整体提升达到28.67%,文本和音视频相关指标均获得均衡且显著的提升。
  • 在VGGSound上,EvoSearch+ARW的整体提升高达46.36%,远超传统的加权求和等方法。
  • ARW在所有设置下都展现出最均衡的Text和AV提升,避免了传统方法(如Z-score偏向AV,Weighted Sum偏向Text)的极端偏科。
  • 消融实验揭示
  • 验证器选择:VQAScore计算开销巨大且效果不如轻量级的VideoReward;细粒度的JavisScore比粗粒度的AV-align和AVHScore能提供更有效的同步指导。
  • ARW收敛性:ARW对优化器(Adam/SGD/RMSprop)不敏感,均能快速收敛,且额外计算开销仅占推理总时间的0.06%-0.08%。
  • 泛化性:在更强的开源模型LTX-2上,ARW依然能带来7.28%的整体提升。

5. 优势与局限

  • 主要优势
    1. 免训练提升:完全在推理阶段工作,无需修改或重新训练庞大的生成模型。
    2. 均衡多目标优化:通过ARW有效解决了多模态生成中异构奖励信号难以融合的痛点,避免了单一指标霸权。
    3. 即插即用与泛化性:框架可兼容不同的搜索策略(Best-of-N, EvoSearch)和不同的底层生成模型(JavisDiT, MMDisCo, LTX-2)。
  • 局限性
    1. 受限于基座模型能力:如果预训练的音视频生成模型本身基础保真度太差,ITS也无法凭空创造出完美的内容(天花板受限)。
    2. 内存与计算开销大:高维多模态数据占用大量显存,限制了并行评估的候选样本数量;同时生成和评分多个候选样本导致推理时间显著增加。

6. 关键结论与启发

  • 最重要的Takeaway:在多模态生成任务的推理时间缩放中,多验证器指导是不可或缺的,而实现多验证器有效协同的关键在于动态平衡异构奖励信号的方差(即ARW)。
  • 对后续研究的启发
    1. 算法效率优化:本文指出ITS计算开销大,未来可探索针对音视频联合生成的缓存加速、早停机制或更高效的搜索算法,以降低推理成本。
    2. 更精细的多模态验证器设计:当前JS验证器证明了细粒度同步信号的有效性,未来可开发更多针对跨模态时序互动(如因果关系、物理规律)的验证器,进一步引导生成。
    3. 扩展至更多模态:该多验证器+ARW的范式不仅适用于音视频,也可自然延伸到文本-音频-视频-3D等更复杂的多模态联合生成场景中。
#15
eess.AS
Sony (World Famous IT Company)Carnegie Mellon University (QS Top 100)

Benchmarking Speech-to-Speech Translation Models 跨领域

Alkis Koudounas, Hayato Futami, Quentin Jodelet, Osamu Take, Shinji Watanabe 等 (6 人)
Computation and Language (cs.CL); Audio and Speech Processing (eess.AS)
Comments: Paper under submission
查看摘要
Speech-to-speech translation (S2ST) has advanced rapidly, but offline evaluation lacks a unified protocol: studies report non-overlapping metric subsets, preventing direct comparisons. We introduce COMPASS, a unified and reproducible benchmarking framework integrating 46 metrics across eight dimensions, and deploy it on 1,248 model-language configurations from FLEURS and CVSS, spanning cascaded and end-to-end architectures over ten language pairs. Architectures exhibit complementary strengths: best-vs-worst gaps exceed 30\% on naturalness and speaker preservation but remain within a few points on translation quality, so single-metric rankings systematically misrepresent system quality. Correlation filtering reduces 46 metrics to 10 per direction, with three axes requiring different metrics across X$\to$EN and EN$\to$X (e.g., TER/UTMOS vs. ChrF++/NISQA-MOS); these subsets preserve rankings (Spearman's $\rho>0.80$) while cutting evaluation time by $\approx 2.5\times$. Human validation across dubbing, podcasts, and medical domains shows standalone MOS predictors fail to predict listener preference, while top domain-specific metrics correlate with human judgment ($\rho \geq 0.90$). We release COMPASS as a foundation for domain-aware S2ST evaluation.

📖 深度解读

1. 一句话总结

本文提出了COMPASS,首个统一且可复现的语音到语音翻译(S2ST)离线评估框架,通过整合46个指标并进行数据驱动的冗余过滤,揭示了单一指标评估的误导性以及不同应用场景和翻译方向需要定制化指标集的必要性。

2. 研究背景与动机

  • 核心问题:语音到语音翻译(S2ST)领域缺乏统一的离线评估标准,不同论文报告的指标互不重叠,导致系统间无法直接比较。
  • 重要性:S2ST系统的质量是多维度的(翻译准确性、语音自然度、说话人保持、情感/韵律、时间对齐等),且不同应用场景(如视频配音、播客、医疗对话)对维度的优先级要求截然不同。如果评估不全面或脱离场景,可能导致系统在实际部署时表现糟糕。
  • 现有不足:目前没有标准化的工具包来保证指标计算的一致性;研究者往往只挑对自己有利的指标报告;常用的单一指标(如ASR-BLEU)掩盖了系统在自然度、说话人保持等方面的巨大差异(差距可达30%以上);且不清楚哪些指标是冗余的,哪些指标真正与人类偏好相关。

3. 核心方法

  • 提出框架COMPASS (COMPrehensive ASsessment Suite),一个模块化、可复现的S2ST评估框架。
  • 关键创新点
    1. 构建8维先验评估分类体系:将S2ST评估划分为翻译质量(文本/ASR)、音频自然度、说话人一致性、韵律/情感、等时性、等距性和唇音同步8个维度,并整合了46个现有指标。
    2. 数据驱动的指标过滤流水线:通过计算指标间的系统级Spearman相关性,剔除高度冗余的指标。在保留指标时,综合考量其区分度、跨语言稳定性、独立性和文献采用率,将46个指标精简为每方向10个核心指标。
    3. 方向感知与场景感知的指标选择:发现并论证了X→EN和EN→X由于瓶颈不同需要不同的指标(如文本评估前者用TER,后者用ChrF++);同时根据不同应用场景(配音、播客、医疗)推荐不同的指标子集。
  • 核心思路直觉解释:就像评价一辆车不能只看最高速度(单一指标),还要看舒适度、油耗、安全性(多维评估)。但评估维度太多又费时费力,且有些指标是“换汤不换药”(比如油耗和续航里程高度相关)。COMPASS的做法是:先把所有能测的指标都拿来,算出哪些指标其实是重复算账,然后挑出最有代表性、最能区分好坏车、且大家最常用的指标组成“精简版体检套餐”。同时,赛车和家用车需要的“精简套餐”还不一样,COMPASS能根据你的使用场景(翻译方向、应用领域)定制套餐。

4. 实验与结果

  • 数据集/基准:FLEURS(朗读语音,10种语言双向)和 CVSS(X→EN方向);人类评估使用了MELD-ST(配音)、EuroParl(播客)和MultiMed-ST(医疗)。
  • 基线方法:对比了端到端模型(SeamlessM4T, Qwen-Omni)和级联模型(S2TT+TTS, ASR+MT+TTS),共1,248种模型-语言配置。
  • 主要实验结果
  • 架构无绝对赢家:级联模型在时间对齐和说话人保持上占优,端到端模型在语音自然度上更好,翻译质量两者相当。单一指标(如COMET-DA)会掩盖系统间在自然度上高达30%的差距。
  • 精简指标集高效保真:46个指标被精简为10个,评估时间减少约2.5倍,且与全量指标的排名相关性保持在Spearman's $\rho > 0.80$。
  • 方向差异:X→EN和EN→X在3个维度上需要不同指标(如自然度评估,译入英语用UTMOS更好,译出英语用多语言的NISQA-MOS更好)。
  • 消融/人类评估揭示
  • MOS预测器失效:常用的UTMOS和NISQA-MOS与人类整体偏好呈零相关甚至负相关(在配音的情感保持上$\rho = -0.90$),因为“干净的合成语音”反而可能剥离了表达力。
  • 场景决定指标:配音场景最看重韵律/时间指标($\rho=0.91$),播客场景看重等距性指标(翻译太长会破坏听感,$\rho \in [0.95, 1.00]$),医疗场景最看重文本翻译指标(COMET-DA达到$\rho=1.00$)。
  • 自动指标填补人类盲区:在人类标注者最难达成一致的维度(如配音的唇音同步,一致性$\alpha=0.68$),自动指标反而与人类判断相关性极高($\rho \ge 0.94$)。

5. 优势与局限

  • 主要优势
    1. 统一与可复现:首次为杂乱无章的S2ST离线评估提供了标准化的工具和协议。
    2. 高效且科学:通过相关性过滤大幅降低评估成本,且证明了精简集不会损失排名判别力。
    3. 实战导向:打破了“一套指标走天下”的迷思,用扎实的人类评估证明了场景化评估的必要性。
  • 局限性
    1. 朗读语音偏差:主要基准(FLEURS/CVSS)是朗读语音,缺乏自发对话中的情感和韵律变化,导致在当前数据下“说话人一致性”和“韵律”经验性地合并成了一个维度。
    2. ASR自评估循环:评估依赖Whisper-Lv3做ASR转录,而部分级联系统也用Whisper作前端,可能存在对Whisper级联系统的偏好偏差(尽管控制实验显示影响不大)。
    3. 仅限离线评估:未涵盖流式/同声传译场景中的延迟指标(如平均滞后时间),且人类评估仅限于短音频(<30s),未考虑长音频的累积漂移问题。

6. 关键结论与启发

  • 最重要的Takeaway:S2ST评估绝不能只看翻译准确性,单一指标排名具有结构性误导;同时,脱离应用场景的评估是没有意义的,医疗、配音、播客需要完全不同的评估标尺。
  • 对后续研究的启发/延伸方向
    1. 开发针对自发语音的基准:未来需要在自发对话语料上重新运行COMPASS的过滤流水线,验证当前的6维经验性分组是否依然成立,特别是说话人保持与韵律是否会解耦。
    2. 研发高阶感知指标:现有的MOS预测器(如UTMOS)只能测“声音干不干净”,无法测“情感对不对”和“值不值得信任”,亟需开发能预测真实世界信任度和情感保真度的新指标。
    3. 扩展到流式与长音频评估:将COMPASS的维度扩展至同声传译的延迟评估,以及长音频中的说话人音色漂移和累积延迟检测。
#16
eess.AScs.SD

LiveBand: Live Accompaniment Generation in the Audio Domain 跨领域

Marco Pasini, Javier Nistal, Mathias Rose Bjare, Stefan Lattner, George Fazekas
Sound (cs.SD); Artificial Intelligence (cs.AI); Audio and Speech Processing (eess.AS)
查看摘要
We present LiveBand, a real-time system that generates high-fidelity music accompaniments to live audio input, respecting strict causal constraints. Our method trains a causal transformer generator in the continuous latent space of a pre-trained causal audio autoencoder, using adversarial sequence-level supervision from a discriminator. At each timestep, the generator receives only the causally available mix context and Gaussian noise, and predicts accompaniment latents without access to future mix frames or ground-truth target latents. Training is performed in a single parallel forward pass under causal masking, while streaming inference proceeds autoregressively with a rolling attention state. The model's training and inference computations are matched by design, eliminating teacher forcing and the associated exposure bias. On a multi-instrument music accompaniment benchmark, LiveBand improves over prior work on objective measures of audio quality, beat alignment, and mix adherence, while enabling real-time streaming generation without lookahead into the future on consumer hardware.

📖 深度解读

1. 一句话总结

本文提出了LiveBand,一个基于因果Transformer和序列级对抗训练的实时音乐伴奏生成系统,通过消除教师强制带来的暴露偏差,在无需“偷看”未来音频输入的情况下,实现了高保真、低延迟且与现场演奏高度契合的流式伴奏生成。

2. 研究背景与动机

  • 核心问题:如何让AI在严格遵循因果性(即绝对不能看到未来输入信息)且低延迟的约束下,根据现场实时输入的混合音频流,生成契合的音乐伴奏。
  • 为什么重要:这能让音乐家与AI进行实时的“即兴合奏”,AI需要像真人乐手一样,根据听到的节奏、调性和动态即时调整自己的演奏,这是人机交互和音乐生成领域的长期目标。
  • 现有方法不足
    1. 依赖“偷看”未来:近期基于离散token的自回归模型(如StreamMusicGen)表明,若不引入一定程度的未来信息,生成的伴奏很难与输入音频保持契合。
    2. 暴露偏差与误差累积:传统自回归模型在训练时使用真实历史数据(教师强制),推理时却依赖自身生成的历史数据。这种分布不匹配在实时伴奏中是致命的——一个微小的节拍错位会像滚雪球一样导致彻底的节奏崩塌。
    3. 帧级目标的僵化:帧级预测目标会严苛惩罚微小的局部时间偏差,但在实时演奏中,即使是人类乐手也会有小幅度的抢拍或拖拍,需要系统具备容忍局部偏差、关注整体连贯性的能力。

3. 核心方法

  • 提出框架:LiveBand。该框架在一个预训练的因果音频自编码器的连续潜空间中,训练一个因果Transformer生成器,并使用条件对抗判别器进行序列级监督。
  • 关键创新点
    1. 消除教师强制,训练推理天然对齐:生成器在每一步仅接收当前的因果混合音频条件和高斯噪声,不依赖历史生成结果作为输入。时间依赖性完全由Transformer内部的注意力机制隐式传递。这使得训练时的并行前向传播与推理时的自回归滚动在计算上完全等价,从根本上消除了暴露偏差。
    2. 序列级对抗监督替代帧级预测:用判别器评估整个生成序列的全局真实感与连贯性,而非逐帧对比真实标签。这允许模型在保持长程音乐结构的同时,容忍微小的局部时间微调(如同人类乐手的临场纠偏)。
    3. 自适应梯度惩罚:提出一种动态调节判别器梯度惩罚权重的机制,通过在线监控判别器相对于生成器的优势度,自动调整正则化强度,稳定对抗训练,免去了繁琐的人工调参。
  • 核心思路直觉解释:想象一个乐手在即兴伴奏,传统方法(教师强制+帧级目标)就像是乐手一边看着完美乐谱一边弹,一旦弹错一个音,后续就不知所措;而且要求他每个音符必须严丝合缝卡在毫秒级的时间点上。LiveBand的做法则是:乐手只听当前的声音(因果条件)和自己的乐感(噪声输入),不依赖自己刚才弹了什么来决定下一个音(消除教师强制),同时评判标准从“每个音是否对准节拍器”变成了“整段演奏听起来是否和谐连贯”(序列级对抗),这让乐手能灵活调整小失误,保持整体演奏的流畅。

4. 实验与结果

  • 数据集/基准:Slakh2100(多乐器音乐伴奏基准数据集),以及一个约2万条内部录音数据集。
  • 基线方法:StreamMusicGen (SMG),当前最先进的流式伴奏生成模型。
  • 主要实验结果
    1. 客观指标全面领先:在音频保真度(FAD)、节拍对齐(BA F1)和混合音频契合度(COCOLA)上,LiveBand在所有因果设置下均优于SMG。最惊人的是,LiveBand在提前1秒生成(完全不看当前输入)的极端设置下,其表现甚至优于SMG在完全同步(τ=0)设置下的表现。
    2. 零误差累积:SMG在20秒生成后各项指标出现明显退化(漂移),而LiveBand展现出零漂移甚至指标随时间略微提升的趋势,证明其彻底解决了长序列误差累积问题。
    3. 主观听感测试:在音频质量、时间一致性、混合契合度等四个维度上,LiveBand均显著优于SMG(p<0.006)。
    4. 实时性:在消费级RTX 3090显卡上,LiveBand(τ=0.1s配置)的单步生成+解码延迟约为43.6ms(编译模式下),完全满足实时流式生成的预算要求(92.88ms/帧)。
  • 消融实验揭示
    1. 注意力汇:加入Sink机制对长程漂移有轻微改善,但对抗训练本身已使模型具备较强的抗漂移能力。
    2. AdaGP:自适应梯度惩罚的表现与手动精细调优的最佳固定惩罚权重相当,但极大降低了调参成本。

5. 优势与局限

  • 主要优势
    1. 突破因果性瓶颈:证明了“不偷看未来就无法生成契合伴奏”并非任务的本质限制,而是训练范式不当导致的,为实时音乐交互去除了关键障碍。
    2. 训练推理完美匹配:无需昂贵的自回归展开训练,即可消除暴露偏差,工程实现高效且推理稳定。
    3. 鲁棒的抗漂移能力:序列级监督使模型具备自我纠偏能力,彻底解决了长时生成中的节奏崩塌问题。
  • 局限性
    1. 音频保真度仍有提升空间:尽管优于基线,但客观FAD指标显示生成音频与真实音频在音质上仍有明显差距(论文自身也承认这一点)。
    2. 受限于自编码器质量:模型在冻结的潜空间中运行,音质的上限被预训练的因果音频自编码器所制约。

6. 关键结论与启发

  • 最重要的Takeaway:在严格的实时流式生成任务中,序列级对抗训练 + 无教师强制的范式,远优于传统的帧级预测 + 教师强制范式。前者通过关注全局分布和切断误差反馈环,赋予了模型在信息受限(无未来上下文)情况下的强鲁棒性和自适应能力。
  • 对后续研究的启发/延伸方向
    1. 底层编解码器的升级:开发更高保真度的因果音频自编码器,将是直接提升此类潜空间生成模型音质的关键。
    2. 范式的跨领域迁移:LiveBand展示的“无教师强制+序列对抗”机制,不仅适用于音乐,极有可能被迁移到实时视频生成、实时对话等其他受严格因果和延迟约束的序列生成领域。
    3. 更长上下文与更复杂交互:未来可探索在更长音乐结构(如段落切换)下的实时响应,以及引入更细粒度的控制信号(如情感、特定演奏技法指令)。
#17
eess.AScs.SD

Efficient ASR Training with Conversations that Never Happened 跨领域

Máté Gedeon, Péter Mihajlik
Computation and Language (cs.CL); Artificial Intelligence (cs.AI); Sound (cs.SD); Audio and Speech Processing (eess.AS)
查看摘要
Conversational ASR for lower-resource languages and niche domains is limited by the scarcity of domain-matched multi-speaker training data. We propose an augmentation pipeline that generates scenario-level dialogues with participant metadata, maps speaker attributes to TTS voice profiles, and assembles synthesized utterances into speaker-aware simulated conversations. We evaluated five LLM families under single-generator, fixed-budget mixture, and scale-up settings using the same FastConformer-Large training recipe for each one. We ran comprehensive evaluations on the Hungarian BEA-Dialogue benchmark corpus, with the method itself being applicable to any language given the resources for each component. The results show that synthetic conversations consistently improve speech recognition performance, but generator choice and data composition strongly affect the gains. Our largest training configuration, using only 67 hours of real conversations and 636 hours of simulated data, achieves better performance on the evaluation benchmark than a zero-shot model trained on 2700 hours of Hungarian speech. These findings indicate that LLM-generated conversational data synthesized with TTS is a practical complement to real conversational corpora for speech model training.

📖 深度解读

1. 一句话总结

本文提出了一种利用大语言模型(LLM)生成对话场景与文本、再通过TTS合成语音并模拟多说话人对话的数据增强流水线,有效解决了低资源语言对话式语音识别(ASR)训练数据匮乏的问题。

2. 研究背景与动机

  • 核心问题:对话式ASR在低资源语言和特定领域面临严重的多说话人对话训练数据短缺。
  • 重要性:真实的对话数据不仅需要转录,还包含复杂的说话人转换、停顿、打断和语音重叠,这些是ASR模型适应真实场景的关键,但采集成本极高。
  • 现有方法不足
    1. 传统的信号级增强(如加噪、变速)只能增加声学鲁棒性,无法增加新的词汇、话题和对话结构。
    2. 现有的TTS合成通常基于固定文本,缺乏对“谁在什么语境下说话”的控制,生成的孤立句子无法体现多轮对话的交互特征(如话轮转换、重叠)。
    3. 虽然英语有专门的对话式TTS模型,但大多数语言缺乏此类资源。

3. 核心方法

  • 提出框架:一个三阶段的“LLM+TTS+对话模拟”流水线,用于生成带有说话人感知的合成对话数据。
  • 关键创新点
    1. 场景驱动的LLM文本生成:不再基于现有文本库,而是让LLM从零生成包含话题、参与者元数据(年龄、性别、职业、角色)和结构化多轮对话的完整场景。
    2. 元数据条件化的音色匹配:将LLM生成的说话人属性(年龄、性别)与TTS参考音色库进行自动匹配,确保合成语音的音色与对话角色设定一致。
    3. 说话人感知的对话模拟:将TTS合成的独立语音片段,根据真实对话的统计规律(停顿、同说话人/不同说话人转换的时间间隔),拼接成包含自然停顿和语音重叠的多声道对话音频。
  • 核心思路直觉解释:就像拍一部没有画面的广播剧——先用LLM当编剧写剧本并设定角色,然后用TTS按角色选角配音,最后由剪辑师根据真实人类聊天的节奏,把零散的台词拼起来,加上抢话和停顿,变成一段逼真的群聊录音。

4. 实验与结果

  • 数据集/基准:匈牙利语对话式语音基准 BEA-Dialogue(包含67小时真实对话训练集)。
  • 基线方法
    1. Whisper-large-v3(零样本)
    2. 仅用67小时真实数据训练
    3. 基于真实语料拼接的SASC增强方法
    4. 2700小时匈牙利语单语种ASR模型(零样本)
  • 主要实验结果
    1. 单生成器:5种主流LLM(GPT, Claude, Gemini, Grok, Qwen)生成的数据均能持续降低ASR错误率,且数据量越大效果越好。其中GPT-5.4 mini表现最强(cpWER 17.75% vs 纯真实数据的20.44%)。
    2. 混合生成器:在固定预算(500段对话)下,并非LLM种类越多越好。GPT+Haiku的双拼效果最佳(cpWER 17.56%),加入弱模型反而会稀释高质量数据导致性能下降。
    3. 规模放大与对比:在放开数据量限制后,4个LLM混合(GPT+Haiku+Qwen+Grok)加上真实语料拼接增强,仅用67小时真实数据+636小时合成数据,就达到了15.40%的cpWER,显著超越了使用2700小时真实语音训练的零样本基线(16.27%)。
  • 消融实验揭示:生成器对下游ASR的贡献不能仅看单打独斗的成绩,互补性很关键(如单打弱的Qwen在混合中比单打强的Gemini更有用);单纯增加音频时长无效,新增的数据必须提供有价值的词汇和对话多样性。

5. 优势与局限

  • 主要优势
    1. 高度自动化与可控性:从场景构思到语音合成全链路自动化,且能精准控制说话人属性和对话节奏。
    2. 极强的数据效率:用极少量的真实对话数据结合合成数据,就能超越海量通用真实数据训练的模型,大幅降低数据标注成本。
    3. 通用性强:虽然实验在匈牙利语上进行,但只要有所需语言的TTS和参考音频,该流水线可直接迁移。
  • 局限性
    1. 对TTS和参考音色库的依赖:流水线的上限受限于现有TTS系统的自然度和参考音色库的多样性,对于极低资源语言可能仍不适用。
    2. LLM生成数据的边际效益递减:实验表明,当加入不能提供有效多样性的LLM生成器时,性能会饱和甚至下降,说明合成数据的质量和多样性比单纯的规模更重要。
    3. 规模探索有限:论文自身也指出,当前实验最大仅测试到500段对话的生成,更大规模的潜力尚未完全挖掘。

6. 关键结论与启发

  • 最重要的Takeaway:LLM生成的“从未发生过的对话”结合TTS和对话模拟,是解决对话式ASR数据饥渴的实用且高效的方案;数据组合的“化学反应”(互补性)比单纯堆砌数据规模更重要。
  • 对后续研究的启发
    1. 数据配比策略:未来研究应重点关注如何筛选和评估合成数据的“信息增量”,避免无效数据稀释训练集,开发出更智能的数据混合策略。
    2. 跨领域泛化:可将此流水线应用于医疗、法庭等极缺对话数据的垂直领域,利用LLM快速生成领域专属对话。
    3. 端到端对话TTS:当前的三阶段拼接法是现有技术限制下的妥协,未来随着多语言对话式TTS的发展,流水线可进一步简化为“LLM剧本 -> 对话式TTS直出”。
#18
eess.AScs.SD
Chinese University of Hong Kong (CUHK) (QS Top 100)Hong Kong Polytechnic University (QS Top 100)

UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion 跨领域

Zhaoqing Li, Haoning Xu, Jingran Su, Yaofang Liu, Zhefan Rao 等 (12 人)
Audio and Speech Processing (eess.AS); Sound (cs.SD)
查看摘要
We present UNISON, a latent diffusion framework that unifies speech generation, sound generation, and audio editing within a single model. A single model handles text-to-audio, text-to-speech, zero-shot speaker cloning, mixed speech-and-sound generation, scene-level audio editing, speech-in-scene editing, and timed temporal composition, all of which share a single set of weights. Our architecture features two core designs: (1) Layer-wise deep LLM fusion, which injects hidden states from uniformly sampled layers of a frozen MLLM into corresponding MM-DiT blocks via learned projections, providing depth-matched semantic conditioning that improves instruction following over single-layer baselines; and (2) a unified multi-task architecture where task identity is encoded solely by a channel-wise mask and source audio is provided through VAE-encoded channel concatenation. Training is stabilized by an online GPU-side multi-task data synthesis pipeline with task-homogeneous batching and a two-stage curriculum. With 621M--732M trainable parameters, UNISON achieves results competitive with or exceeding task-specialist models across evaluated domains, while being roughly $4\times$ smaller than comparable unified systems.

📖 深度解读

1. 一句话总结

UNISON提出了一种统一的音频生成与编辑框架,通过“逐层深度融合LLM语义”和“通道拼接多任务输入”两大核心设计,仅用一套权重和621M-732M的参数量,就在文本生音、语音合成、零样本克隆、音频编辑等7个任务上达到甚至超越了专门的庞大模型。

2. 研究背景与动机

  • 核心问题:如何在一个模型中统一处理音频生成(如音效生成、TTS)和音频编辑(如场景加音、去音)等多种任务?
  • 重要性:实际应用中,用户往往需要系统能听、能说、能改(例如:生成一段带背景音的语音,再把背景音里的警笛声去掉)。当前这些任务通常由多个独立模型完成,导致部署成本高,且无法实现跨任务的知识共享(例如生成能力无法反哺编辑能力)。
  • 现有方法不足
    1. 潜空间碎片化:现有的“统一”模型仍依赖大量异构辅助模块(如TTS专用的音素编码器、编辑专用的Mel编码器、独立的时长预测器等),导致不同任务实际上在不同的特征空间运作,阻碍了真正的知识融合。
    2. 浅层文本条件化:现有方法通常只提取LLM的最后一层特征来指导生成,丢弃了语言模型的层级语义信息(浅层编码词法/音素,深层编码抽象语义),导致模型在处理复杂组合指令(如“3秒时加入男性的说话声和狗叫声”)时表现不佳。

3. 核心方法

  • 提出框架:UNISON,基于Flow Matching和MM-DiT(多模态双流DiT)的统一潜空间生成框架。
  • 关键创新点
    1. 逐层深度融合:打破只取LLM最后一层的传统,将冻结的Qwen2.5-Omni-7B各层特征,通过线性投影一一对应地注入MM-DiT的各层中。浅层DiT接收词法/音素特征,深层DiT接收抽象语义特征,实现“深度匹配的语义对齐”。
    2. 极简多任务统一架构:彻底摒弃所有辅助编码器。任务身份仅通过一个通道掩码来区分(0=生成,1=编辑,2=零样本克隆);源音频/参考音频直接用冻结的VAE编码后,与加噪目标在通道维度拼接输入。
    3. 在线多任务数据合成与课程学习:在GPU端实时合成多任务训练数据,采用“同质批次采样”(一个batch内只有同一种任务)和“两阶段课程”(先学生成,再学编辑)来稳定多任务联合训练。
  • 直觉解释
  • 逐层融合就像教小孩画画:先教握笔和线条(浅层词法),再教构图和意境(深层语义),而不是把一本百科全书直接拍在桌上(只用最后一层)让他自己悟。
  • 通道拼接就像给模型一张带图层的画板:底层是噪点(待生成),中间是原图(待编辑),最上面是一张透明标签(标明任务是画画还是改画),模型只需看这一张画板就能干活,不需要换画笔(辅助模块)。

4. 实验与结果

  • 数据集/基准:AudioCaps (T2A), Seed-TTS (TTS/零样本克隆), 以及自建的T2AS、音频编辑、场景语音编辑、定时生成测试集。
  • 基线方法:AudioLDM 2, Make-An-Audio 2, GenAU-L, Audio-Omni (3.05B), UniSonate (1.34B), F5-TTS, CosyVoice 2, MMEDIT, SDEdit 等。
  • 主要结果
  • T2A:UNISON (732M) 取得最佳FAD (1.558) 和 CLAP (0.503),超越3.05B的Audio-Omni。
  • TTS:UNISON (732M) 在纯TTS和零样本克隆上均取得最低WER/CER(英文纯TTS WER 1.27%,零样本1.50%),且无需音素编码器。
  • 音频编辑:整体FD (12.38) 和 CLAP (0.364) 大幅超越MMEDIT和Audio-Omni。
  • 性别控制与定时生成:仅凭文本指令实现100%性别控制准确率;时间轴控制完全依赖LLM解析自然语言,无需外部对齐模块。
  • 消融实验揭示
  • 深层融合优于单层:仅用倒数第二层(D24-L)的CLAP最低(0.175),FD最高(22.71)。
  • 冗余文本Token损害TTS:同时使用逐层融合和最后一层持久流(D24-OL)虽能提升CLAP,但会导致WER飙升(5.52%),证明“瞬时”逐层注入是更优解。
  • 双流架构的必要性:单流架构(文本音频共享QKV)效果显著变差。
  • LLM规模很重要:换用3B LLM导致各项指标下降。

5. 优势与局限

  • 主要优势
    1. 极简与统一:真正实现“一套权重、一个前向传播”覆盖7大任务,去除了所有异构辅助模块,参数量仅为同类统一模型的1/4。
    2. 指令遵循能力强:逐层深度融合极大提升了模型对复杂组合指令(时间、性别、音效混合)的理解与执行能力。
    3. 生成与编辑互促:共享VAE和DiT主干,使得生成任务学到的先验知识能自然迁移到编辑任务上。
  • 局限性
    1. VAE的上限限制:沿用的MMAudio VAE是为环境音设计的,对语音的高频细节、呼吸声和细粒度音色重建存在瓶颈。
    2. 训练数据的真实性不足:编辑和混合任务的数据是通过算法简单叠加合成的,缺乏真实世界的声学交互(如混响、掩蔽效应),且标注存在噪声。
    3. 未覆盖音乐领域:受限于开源音乐数据集的版权问题,目前不支持音乐生成。

6. 关键结论与启发

  • 最重要的Takeaway:音频的生成与编辑不需要割裂的架构,也不需要繁杂的辅助模块。只要文本语义的注入足够“深”(层级对齐),且任务定义足够“简”(通道掩码+拼接),一个小巧的统一模型就能爆发出超越庞大专业模型的战斗力。
  • 后续研究启发
    1. 架构层面:可以探索训练一个专为“语音+音效+音乐”统一设计的多尺度VAE,打破当前高频细节丢失的瓶颈;将通道拼接机制扩展至视频特征,实现V2A(视频生音)的统一。
    2. 数据层面:引入物理信息模拟(如房间脉冲响应)来构建更逼真的编辑训练数据,缩小合成数据与真实场景的分布差异。
    3. 范式层面:这种“逐层深度融合+极简通道路由”的范式,具有很强的泛化性,未来可尝试迁移至多模态视频生成或跨模态统一大模型中。
#19
eess.AS

Domain-Agnostic Incremental Learning for Sound Classification. A DCASE 2026 Challenge task 跨领域

Riccardo Casciotti, Manjunath Mulimani, Manu Harju, Jesper Rindom Jensen, Annamaria Mesaros
Audio and Speech Processing (eess.AS)
Comments: White paper. To be completed after the challenge deadline and submitted for the DCASE 2026 Workshop. Revision: Table 1 corrected to provide macro-average accuracy
查看摘要
This paper presents the Domain-Agnostic Incremental Learning for Audio Classification Task of the DCASE 2026 Challenge. Incremental learning refers to sequentially learning new tasks with the same system while maintaining its knowledge and performance on the previously learned task. Domain-incremental learning for sound classification refers to learning the same sound classes but in different acoustic domains, and was formalized as a data challenge for the first time in DCASE 2026. Participants will train a system to learn ten sound classes in three different domains, with learning at each incremental task not having access to previous task data. Submitted systems will be ranked by the overall average accuracy calculated over the three domains. During the development stage, the provided baseline system obtains a modest performance of 52.5\% accuracy over the last two domains, mostly due to erroneous inference of the domain for the test sample.

📖 深度解读

1. 一句话总结

本文介绍了DCASE 2026挑战赛的“领域无关增量音频分类”任务,旨在解决音频系统在连续学习新声学领域时发生的“灾难性遗忘”以及推理时无法识别领域标签的难题。

2. 研究背景与动机

  • 核心问题:如何让音频分类模型按顺序学习不同声学环境(领域)下的相同声音类别,且在学习新领域时不遗忘旧领域,同时在推理阶段无需依赖领域身份标签即可正确分类。
  • 重要性:这是机器听觉中非常现实的场景。现实中的音频系统往往会随着时间推移遇到不同的录音设备或声学环境(领域变迁),如果每次都要重新训练或需要明确知道当前处于哪个环境,系统的适用性将大打折扣。
  • 现有方法不足
    1. 领域自适应通常只考虑源域和目标域两个领域,且需要同时访问两者的数据进行分布对比,无法应对多领域的持续增量学习。
    2. 领域感知增量学习假设推理时已知领域标签,可以手动切换模型参数,这在实际应用中往往是不切实际的。
    3. 现有的增量学习方法在面对“领域无关”设定时,极易发生灾难性遗忘,导致旧领域性能崩溃。

3. 核心方法

  • 提出框架:DCASE 2026 Task 7 基线系统——基于批归一化(BN)领域适配的领域无关增量学习框架。
  • 关键创新点
    1. 首次正式定义并构建基准:在DCASE挑战赛中首次确立了“领域无关”的音频增量学习评估标准,禁止使用外部数据和预训练模型,确保比较的公平性。
    2. 领域共享特征+领域特定BN层:卷积层参数在所有领域间共享,而为每个新领域单独开辟并训练一组BN层参数,以此吸收不同领域的分布差异。
    3. 基于熵的领域隐式推断:在推理时,由于不知道输入属于哪个领域,模型将输入分别与所有已学领域的BN层组合进行前向传播,计算预测概率的熵(不确定性),选择熵最小(即模型最确信)的那个领域对应的分类结果作为最终输出。
  • 核心思路直觉解释:就像一个医生在不同科室(领域)轮转学习。共享的卷积层是医生掌握的通用医学知识,而不同的BN层就像是不同科室的“行话和习惯”。轮转时,医生只需学习新科室的“习惯”,不用推翻重学医学基础。看病(推理)时,病人没挂科室号(无领域标签),医生就把病人的症状在所有科室的“习惯”下都推演一遍,哪个科室给出的诊断最自信(熵最小),就认为病人属于那个科室并采用该诊断。

4. 实验与结果

  • 数据集:DIL-DCASE26 开发集(包含D2、D3两个领域,D1的音频不可见,其知识已预置在基线模型中)。包含10个声音类别(警报、婴儿哭声、狗叫等)。
  • 基线方法:基于PANNs CNN14架构的BN层增量适配系统。
  • 主要实验结果
  • 学习D2后,在D2上准确率为54.7%。
  • 增量学习D3后,在D3上准确率为35.0%,在D2上保持54.7%(未发生严重遗忘),两域平均准确率为44.9%
  • 消融/对比实验揭示
  • 基线性能低下(44.9%)的主要瓶颈在于推理时的领域预测错误(特别是D1的BN层被错误地用于D2/D3的数据,导致性能拉胯)。
  • 上界对比:如果推理时直接给定真实的领域标签(Task-dependent,即领域感知设定),D2和D3的平均准确率可达67.6%。这表明只要改善领域识别或BN层选择机制,系统性能有巨大的提升空间(超过20%的潜力)。

5. 优势与局限

  • 主要优势
    1. 高度贴近现实:严格限制了推理时的领域信息获取,倒逼算法提升真正的泛化与鲁棒性。
    2. 轻量级增量机制:仅增加BN层参数来适应新领域,参数开销极小,避免了为每个领域复制整个大模型。
    3. 公平的评估平台:禁用预训练模型和外部数据,纯粹考察增量学习策略本身的有效性。
  • 局限性
    1. 领域推断机制脆弱:基于熵最小化的领域选择策略存在严重偏差,容易偏向早期领域(如D1),导致整体性能大幅缩水。
    2. 未利用旧数据:完全不允许回放旧领域数据,虽然符合严格的增量设定,但也极大增加了克服灾难性遗忘的难度。
    3. 基线表现过于平庸:44.9%的准确率说明该基线方法在实际应用中几乎不可用,仅能作为挑战赛的下限参考。

6. 关键结论与启发

  • 最重要的Takeaway:在领域无关的增量学习中,如何准确识别测试样本的领域(即选择正确的领域特定参数)是决定系统成败的关键瓶颈。模型特征提取和分类器本身的能力尚可(领域感知下可达67.6%),但领域错配会导致性能断崖式下跌。
  • 对后续研究的启发/延伸方向
    1. 改进领域路由机制:可以研究更强大的领域判别器或不确定性估计方法,替代简单的基于熵的推断,甚至实现动态软性组合多个领域的BN层。
    2. 无监督领域对齐:探索在不访问旧数据的前提下,如何让共享特征空间对新旧领域保持更好的分布不变性。
    3. 生成式回放:既然不能存储旧数据,是否可以通过生成模型伪造旧领域的特征或数据,以缓解领域推断偏差和遗忘问题。
#20
eess.AS
Northwestern Polytechnical University (985, 211)

SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription 跨领域

Yuhang Dai, Haopeng Lin, Zhennan Lin, Jiale Qian, Jun Wu 等 (13 人)
Audio and Speech Processing (eess.AS)
Comments: 10 pages, 4 figures, 3tables
查看摘要
Recent advances in Automatic Speech Recognition (ASR) and Large Language Models (LLMs) have significantly improved speech understanding capabilities. However, multi-speaker speech transcription remains challenging task, constrained by highly similar speaker voices, rapid turn-taking transitions, overlapping utterances and inaccurate speaker boundary segmentation. These challenges become particularly pronounced in real-world conversational audio, where speaker dynamics and acoustic conditions are highly variable. This technical report presents SoulX-Transcriber, a unified multi-speaker transcription system that jointly models speaker diarization (SD) and ASR within an LLM-based framework. SoulX-Transcriber adopts a two-stage training strategy to improve both speaker discrimination and transcription robustness. In the first stage, speaker-aware multi-task continuous pre-training enhances speaker representation learning and boundary perception. In the second stage, supervised fine-tuning further optimizes the model for accurate end-to-end speaker-attributed transcription under complex multi-speaker conditions. SoulX-Transcriber delivers strong performance and robustness across multiple public benchmarks, including AliMeeting, AISHELL-4, and AMI, while maintaining high adaptability to multi-domain scenarios.

📖 深度解读

1. 一句话总结

本文提出了SoulX-Transcriber,一个基于大语言模型的端到端多说话人语音转录框架,通过“多任务预训练+高质量微调”的两阶段策略和精细的对话数据模拟管线,有效解决了复杂对话中说话人区分困难、语速交替快和语音重叠导致的“谁在何时说了什么”的识别难题。

2. 研究背景与动机

  • 核心问题:多说话人语音转录(SDR),即解决“谁在何时说了什么”的问题。
  • 为什么重要:随着会议记录生成、客服质检等工业需求激增,该技术具有极高的应用价值。但真实对话音频环境极为复杂,存在频繁的说话人切换、严重的语音重叠、声学环境多变,以及同性别说话人声音极度相似等干扰。
  • 现有方法不足:传统的级联系统(VAD+SV+ASR)存在严重的误差传播和系统复杂度高的问题;而现有的基于大型音频语言模型(LALM)的端到端方法,大多侧重于模型架构修改或推理阶段优化,在训练阶段对说话人表征学习的关注不足。这导致模型学到的说话人特征缺乏“类内紧凑性”和“类间区分度”,在面对声音相似、快速抢话等复杂情况时鲁棒性较差。

3. 核心方法

  • 提出框架:SoulX-Transcriber,基于Qwen3-Omni构建的端到端多说话人转录系统。
  • 关键创新点
    1. 面向对话的数据模拟管线:为了解决真实标注数据稀缺且缺乏困难样本的问题,构建了一套自动化的多说话人对话生成流水线。其核心是一个多维说话人属性匹配机制,将对话角色的文本描述(性别、年龄、音高等9个维度)编码为特征矩阵,与参考音频库进行加权相似度检索,确保合成的对话在音色搭配上既符合剧本设定,又能批量制造“声音相似”的困难负样本。
    2. 两阶段说话人感知训练策略:在不改变底层大模型架构的前提下,通过定制化训练增强说话人表征能力。
  • 核心思路直觉解释
  • 数据管线:就像拍电影选角,导演(LLM)先分析剧本角色性格,然后 Casting 系统根据“年龄、声线、语速”等精细标签在演员库中精准挑人,甚至故意挑两个声音很像的演员来增加剧本的冲突感(困难样本),从而锻炼模型在极端情况下的分辨力。
  • 两阶段训练:第一阶段是“通识+专项大操练”,不仅学核心的转录(SDR),还加入说话人转换预测(STP)、目标说话人提取(TSER)、声纹验证(SV)等辅助任务,强迫模型学会“听音辨人”和“找边界”;第二阶段是“精修”,用少量但极高精度的人工标注数据微调,洗掉第一阶段伪标签带来的噪音,确保最终输出的严谨性。

4. 实验与结果

  • 使用数据集:公开会议基准 AliMeeting、AISHELL-4(中文)和 AMI-SDM(英文);以及自建的内部泛领域测试集(日常对话、电影、播客)。评估包含短片段和5分钟长音频。
  • 对比基线:VibeVoice-ASR(开源SOTA)、Gemini-2.5-Pro、Gemini-3.1-pro-preview(闭源商业模型)。
  • 主要实验结果
  • 中文场景霸榜:在 AISHELL-4 和 AliMeeting 上,SoulX-Transcriber 取得全面最优。例如在 AISHELL-4 短片段上,DER(说话人错误率)降至 2.89%(对比VibeVoice的6.77%和Gemini-3.1的24.84%),cpWER(带说话人属性的词错率)降至 13.90%
  • 说话人归属性极佳:在多个测试集上,$\Delta cp$(cpWER与WER的差值,纯反映说话人归属错误)极小,甚至在AISHELL-4上出现负值,表明模型几乎不因“认错人”而产生额外的转录错误。
  • 长音频与泛化能力:在5分钟长音频测试中,大幅领先其他模型(如AliMeeting长音频DER仅5.72%,Gemini-3.1高达38.75%);在内部泛领域测试中同样保持碾压优势。
  • 英文场景:尽管训练数据以中文为主,在英文AMI数据集上依然具备竞争力。
  • 消融实验:论文未提供显式的消融实验表格,但通过两阶段训练的论述可知,若去除第一阶段的多任务预训练,模型的说话人表征能力会下降;若去除第二阶段的高质量SFT,伪标签噪声将限制模型的高精度归属性。

5. 优势与局限

  • 主要优势
    1. 说话人区分能力极强:通过多任务预训练和制造声音相似的困难合成数据,有效解决了同性别/音色相近说话人的混淆问题。
    2. 长音频与鲁棒性出色:在5分钟长音频和开放域(电影、播客)场景下,说话人追踪稳定,不易出现长对话中的身份漂移。
    3. 工程实用性强:不需要修改大模型底层架构,仅通过数据工程和训练策略的优化即可实现,具备较好的可复现性和迁移性。
  • 局限性
    1. 英文性能仍有提升空间:虽然具备跨语言能力,但在英文AMI数据集上的绝对指标不如中文数据集亮眼,存在多语言不平衡问题。
    2. 数据管线复杂度高:伪标签流水线(多ASR融合、聚类)和多维属性匹配模拟管线涉及极多环节和外部模型(VAD, ASR, bge-m3, TTS),构建和调试成本较高。
    3. 缺乏显式消融验证:作为技术报告,未对各个辅助任务(STP/TSER/SV)或数据配比进行详细的消融实验,难以量化每个创新点的独立贡献。

6. 关键结论与启发

  • 最重要的Takeaway:在基于LLM的语音转录系统中,“训练策略与数据工程”的收益可以远大于“模型架构的修改”。通过在预训练阶段显式引入说话人判别性任务(如SV、TSER),并利用属性匹配合成困难样本,可以根本性地提升模型的说话人表征质量。
  • 对后续研究的启发
    1. 数据合成的精细化:未来在构造多说话人数据时,不应仅停留在“把不同人的声音拼在一起”,而应像本文一样,利用大模型进行语义和声学属性的深度匹配,主动构造“易混淆”的困难交互场景。
    2. 解耦评估指标:$\Delta cp$(说话人归属误差差值)是一个很好的评估视角,后续研究应更多关注如何将ASR的识别错误与说话人归属错误解耦评估。
    3. 两阶段范式的推广:“大规模伪标签多任务预训练 + 小规模高精度SFT”的范式,对于其他受限于高质量标注数据的音频理解任务(如情感识别、声学事件检测)同样具有借鉴意义。
#21
eess.AScs.SD

Differentiable Optimization of Linear Differential Microphone Arrays: A Joint Geometry and Filter Design Framework 跨领域

Siminfar Samakoush Galougah, Ramani Duraiswami
Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: 5 pages, 4 figures, 2 tables
查看摘要
This paper presents a differentiable optimization framework for the design of constrained Linear Differential Microphone Arrays (LDMAs). The proposed method leverages a non-uniform delay-and-sum beamformer as a light-weight base system model, proving its ability to achieve the optimal beampattern of LDMAs by jointly optimizing microphone positions and filter weights. The formulation enables the optimized design of a filter with a distortion-free constraint in the desired sound direction, while also imposing constraints on microphone positioning to ensure consistent performance. Through evaluation on multiple metrics, including Mean Squared Error (MSE), Directivity Index (DI), White Noise Gain (WNG), and computation time, and comparison with state-of-the-art methods, this approach demonstrates a flexible, directive, robust, and hardware-efficient design.

📖 深度解读

1. 一句话总结

本文提出了一种基于可微优化的线性差分麦克风阵列(LDMA)设计框架,通过联合优化麦克风位置和滤波器权重,在保证目标方向无失真接收和麦克风间距约束下,实现了灵活、鲁棒且硬件高效的阵列波束图设计。

2. 研究背景与动机

  • 核心问题:如何高效地设计线性差分麦克风阵列(LDMA),使其波束图(beampattern)逼近理想状态,同时兼顾指向性、对白噪声的鲁棒性以及硬件实现的灵活性。
  • 重要性:LDMA因其能在低频段实现高指向性而广泛应用于语音处理领域,但传统设计方法随着阵列阶数增加,设计复杂度急剧上升,且往往面临白噪声放大(WNG低)的问题,导致实际应用受限。
  • 现有方法不足
    1. 缺乏灵活性:传统方法(如经典有限差分法)通常假设麦克风等间距分布且滤波器权重固定,难以适应复杂约束。
    2. 优化不彻底:现有优化方法大多只针对几何位置或滤波器权重中的某一项进行优化,未能实现两者的联合优化。
    3. 鲁棒性差:部分方法虽然能逼近理想波束图,但会严重放大白噪声(WNG为负数),在实际传感器噪声环境下表现不佳。

3. 核心方法

  • 提出框架:基于可微编程的联合优化框架。该框架以轻量级的非均匀延迟求和波束成形器为基础模型,将LDMA设计转化为一个带约束的可微优化问题。
  • 关键创新点
    1. 联合优化:首次在LDMA设计中实现了麦克风几何位置(间距)与滤波器权重的端到端联合优化。
    2. 可微约束建模:将物理约束(目标方向无失真、麦克风间距上下限)直接嵌入可微优化流程中,利用自动微分技术求解梯度。
    3. 轻量化架构:摒弃了传统DMA复杂的多级设计流程,采用简单的延迟求和模型,证明了通过参数优化即可达到传统复杂模型的效果。
  • 核心思路直觉解释:想象你在调配一个定向收音器,传统做法是按固定图纸把麦克风排成一条等距的线,然后给每个麦克风套用固定的计算公式,结果往往是收音方向准了,但背景白噪音也被放大了。本文的做法是:把麦克风的位置和每个麦克风的音量调节旋钮都变成“可自动微调”的参数,然后给AI一个目标(画出最理想的收音指向图)和两条规矩(必须听清正前方的声音,麦克风不能分得太开或太远)。通过自动求导技术,AI能迅速试出最佳的麦克风摆放位置和旋钮刻度,既精准指向目标,又有效压制了背景白噪音。

4. 实验与结果

  • 数据集/基准:本文属于物理参数优化,未使用传统机器学习数据集,而是以理想的N阶LDMA波束图作为目标基准。
  • 基线方法:经典LDMA设计、鲁棒LDMA设计、零约束LDMA设计。
  • 主要实验结果(以二阶LDMA,5个麦克风为例):
  • MSE(均方误差):本文方法达到 $2.54 \times 10^{-6}$,比基线方法(最低为 $2.05 \times 10^{-2}$)降低了四个数量级,波束图完美逼近理想状态。
  • WNG(白噪声增益,越高越鲁棒):本文方法达到 3.99 dB,而经典方法为 -30.21 dB,鲁棒和零约束方法也为负值。本文彻底扭转了白噪声被放大的劣势。
  • DI(指向性指数):本文为 2.99 dB(接近理想的3 dB),与基线相当,但WNG表现远超基线。
  • 计算开销:优化仅需7步,耗时0.66秒,对于离线的阵列配置完全可以接受。
  • 消融/扩展实验揭示
    1. 最小麦克风数量验证:在三阶LDMA中使用最少数量的麦克风($M=N+1=4$),依然能全面超越基线方法(WNG达4.53 dB,MSE大幅降低),证明了硬件高效性。
    2. 位置误差鲁棒性:当麦克风偏离最优位置0.1cm时,波束图依然与理想图高度吻合,说明该方法对实际制造和安装中的微小误差具有容错性。

5. 优势与局限

  • 主要优势
    1. 打破性能折衷:成功打破了传统LDMA中指向性(DI)与鲁棒性(WNG)之间的零和博弈,在保持高指向性的同时获得了正数的WNG。
    2. 设计灵活高效:支持任意阶数和任意约束条件,且所需麦克风数量可降至理论最低值($M=N+1$),大幅降低硬件成本。
    3. 对物理误差鲁棒:优化出的参数配置对微小的麦克风位置偏移不敏感,适合实际工程落地。
  • 局限性
    1. 窄频带限制:论文的实验和公式推导目前仅针对单一频率(2kHz),尚未在宽带信号上验证(尽管论文声称扩展到宽带是直接的)。
    2. 局部最优风险:论文承认优化结果高度依赖于参数的初始猜测,可能陷入局部最优,导致某些角度出现微小的不匹配。
    3. 理想化假设:实验主要在仿真中进行,未考虑实际声学环境中的多径效应和衍射效应。

6. 关键结论与启发

  • 最重要的Takeaway:麦克风阵列的物理结构(几何位置)和信号处理参数(滤波器权重)不应割裂设计;通过可微优化进行联合设计,可以用最简单的延迟求和模型,在严苛的物理约束下实现最优、最鲁棒的波束图。
  • 对后续研究的启发/延伸方向
    1. 宽带扩展:将单频目标函数扩展为多频目标函数或引入FIR滤波器,实现宽带LDMA的可微联合设计,这是走向实际应用最迫切的需求。
    2. 初始化策略:研究如何为可微优化提供更好的参数初始化(例如利用传统方法的解作为先验),以避免局部最优并加速收敛。
    3. 3D阵列拓展:将此框架从线性阵列推广到环形或面阵,解决更复杂的3D空间声源定位与降噪问题。
#22
eess.AScs.SD

TALKPLAY: Multimodal Music Recommendation with Large Language Models 解读失败跨领域

Seungheon Doh, Keunwoo Choi, Juhan Nam
Information Retrieval (cs.IR); Sound (cs.SD); Audio and Speech Processing (eess.AS)
查看摘要
We present TALKPLAY, a novel multimodal music recommendation system that reformulates recommendation as a token generation problem using large language models (LLMs). By leveraging the instruction-following and natural language generation capabilities of LLMs, our system effectively recommends music from diverse user queries while generating contextually relevant responses. While pretrained LLMs are primarily designed for text modality, TALKPLAY extends their scope through two key innovations: a multimodal music tokenizer that encodes audio features, lyrics, metadata, semantic tags, and playlist co-occurrence signals; and a vocabulary expansion mechanism that enables unified processing and generation of both linguistic and music-relevant tokens. By integrating the recommendation system directly into the LLM architecture, TALKPLAY transforms conventional systems by: (1) unifying previous two-stage conversational recommendation systems (recommendation engines and dialogue managers) into a cohesive end-to-end system, (2) effectively utilizing long conversational context for recommendation while maintaining strong performance in extended multi-turn interactions, and (3) generating natural language responses for seamless user interaction. Our qualitative and quantitative evaluation demonstrates that TALKPLAY significantly outperforms unimodal approaches based solely on text or listening history in both recommendation performance and conversational naturalness.

📖 深度解读

[PDF 下载失败,无法解读]

#23
eess.AScs.SD

TalkPlayData 2: An Agentic Synthetic Data Pipeline for Multimodal Conversational Music Recommendation 解读失败跨领域

Keunwoo Choi, Seungheon Doh, Juhan Nam
Information Retrieval (cs.IR); Artificial Intelligence (cs.AI); Multimedia (cs.MM); Sound (cs.SD); Audio and Speech Processing (eess.AS)
查看摘要
We present TalkPlayData 2, a synthetic dataset for multimodal conversational music recommendation generated by an agentic data pipeline. In the proposed pipeline, multiple large language model (LLM) agents are created under various roles with specialized prompts and access to different parts of information, and the chat data is acquired by logging the conversation between the Listener LLM and the Recsys LLM. To cover various conversation scenarios, for each conversation, the Listener LLM is conditioned on a finetuned conversation goal. Finally, all the LLMs are multimodal with audio and images, allowing a simulation of multimodal recommendation and conversation. In the LLM-as-a-judge and subjective evaluation experiments, TalkPlayData 2 achieved the proposed goal in various aspects related to training a generative recommendation model for music. TalkPlayData 2 and its generation code are released at this https URL .

📖 深度解读

[PDF 下载失败,无法解读]

#24
eess.AScs.SD
KAIST - Korea Advanced Institute of Science & Technology (QS Top 100)

TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling 跨领域

Seungheon Doh, Keunwoo Choi, Juhan Nam
Information Retrieval (cs.IR); Multimedia (cs.MM); Sound (cs.SD); Audio and Speech Processing (eess.AS)
Comments: Accepted for publication at The Workshop on AI for Music, Neural Information Processing Systems (NeurIPS-AI4Music)
查看摘要
While the recent developments in large language models (LLMs) have successfully enabled generative recommenders with natural language interactions, their recommendation behavior is limited, leaving other simpler yet crucial components such as metadata or attribute filtering underutilized in the system. We propose an LLM-based music recommendation system with tool calling to serve as a unified retrieval-reranking pipeline. Our system positions an LLM as an end-to-end recommendation system that interprets user intent, plans tool invocations, and orchestrates specialized components: boolean filters (SQL), sparse retrieval (BM25), dense retrieval (embedding similarity), and generative retrieval (semantic IDs). Through tool planning, the system predicts which types of tools to use, their execution order, and the arguments needed to find music matching user preferences, supporting diverse modalities while seamlessly integrating multiple database filtering methods. We demonstrate that this unified tool-calling framework achieves competitive performance across diverse recommendation scenarios by selectively employing appropriate retrieval methods based on user queries, envisioning a new paradigm for conversational music recommendation systems.

📖 深度解读

1. 一句话总结

本文提出了一种基于大语言模型工具调用机制的音乐推荐框架,将LLM作为“调度员”动态组合多种检索与过滤工具(如SQL、BM25、稠密检索、语义ID),从而在多轮对话中精准理解用户意图并给出个性化推荐。

2. 研究背景与动机

  • 核心问题:如何在对话式音乐推荐系统中,有效整合多种检索方式(结构化过滤、稀疏检索、稠密检索、生成式检索),以满足用户复杂多样的需求?
  • 重要性:真实的工业级推荐系统通常是多阶段、多路召回的,用户在对话中的需求往往既包含硬性属性过滤(如“2020年发行的”),又包含模糊的语义需求(如“悲伤的钢琴曲”),单一检索方法无法兼顾。
  • 现有方法不足:当前基于LLM的推荐系统多依赖单一的检索或生成方式(如仅依赖语义向量检索或仅用Semantic ID生成),导致系统行为受限,无法充分利用数据库的元数据过滤、多模态匹配等关键能力,难以全面捕捉用户复杂的上下文需求。

3. 核心方法

  • 提出框架TalkPlay-Tools。该框架将LLM定位为端到端的推荐智能体,负责解析用户意图、规划工具调用顺序及参数,并协调外部执行环境完成“检索-重排”流水线。
  • 关键创新点
    1. 统一的多工具集设计:首次将布尔过滤(SQL)、稀疏检索(BM25)、多模态稠密检索(Text-to-Item, Item-to-Item, User-to-Item)和生成式检索(Semantic ID)统一在一个智能体的工具库中。
    2. 基于LLM的检索-重排流水线规划:通过Prompt引导,LLM将推荐过程拆解为“规划-检索-重排”三个阶段,预测需要调用的工具类型、执行顺序和参数,且工具间形成串行过滤池(前一个工具的输出是后一个工具的候选集)。
    3. 多模态上下文信息的注入:将用户画像、历史对话以及音乐的多模态Semantic ID作为In-context信息输入给LLM,使LLM能够理解并调用它从未见过的领域特定标识符(如User ID和Semantic ID)。
  • 核心思路直觉解释:把LLM想象成一个高级餐厅的“大堂经理”,它不亲自做菜(不直接算向量或查数据库),但精通各类需求。当顾客说“我要一份辣的、卡路里低于500的牛肉”,经理会先吩咐A去库房按食材过滤出牛肉(SQL),再吩咐B按口味筛选出辣味(BM25/稠密检索),最后吩咐C按营养标准重排(重排工具),从而精准上菜。

4. 实验与结果

  • 数据集/基准:TalkPlayData 2(一个多模态对话式音乐推荐合成数据集),测试集包含1000段对话,每段8轮。
  • 基线方法
    1. BM25(纯稀疏检索)
    2. Qwen3-LM + BM25(LLM生成查询词+BM25模糊匹配)
  • 主要实验结果
  • 本文方法(Qwen3-LM + Tool Calling)在零样本设定下取得了最佳性能,Hit@1达到0.022,Hit@10达到0.082,相比最强基线(Qwen3-LM + BM25的0.018和0.076)有显著提升,证明了多工具重排的有效性。
  • 消融与行为分析
  • 工具调用频率:LLM更偏好调用预训练中常见的通用工具(如SQL、BM25频率高),而对领域特定工具(如Item-to-Item、Semantic ID)调用较少。
  • 工具调用成功率:SQL因语法复杂成功率最低(27.4%);Item-to-Item因需预测完整的Track ID成功率中等(68.4%);而出乎意料的是,User-to-Item(98.8%)和Semantic ID(95.8%)成功率极高,这归功于Prompt中提供了丰富的用户画像和历史对话作为上下文,LLM能轻松“照抄”这些ID。

5. 优势与局限

  • 主要优势
    1. 灵活性与统一性:打破了单一检索范式的局限,一套框架灵活应对精确过滤、语义搜索、个性化推荐等多种复杂场景。
    2. 即插即用与可扩展:各检索模块以工具形式解耦,未来增加新工具(如知识图谱检索)无需修改LLM底层架构。
    3. 零样本能力强:无需针对推荐任务微调LLM,仅通过上下文学习即可有效调度工具。
  • 局限性
    1. 复杂工具调用易失败:如SQL语法错误、幻觉出错误的Track ID等问题较突出,系统目前依赖反复重试来兜底,效率较低。
    2. 工具偏好失衡:LLM对领域特定工具(Semantic ID等)天然不熟悉,导致调用频率低,这些强大工具的潜力未被完全激发。
    3. 流水线串行依赖:工具必须按顺序执行,前序工具的错误或遗漏会直接污染后续工具的输入空间。

6. 关键结论与启发

  • 最重要的Takeaway:将LLM作为推荐系统的“大脑”进行工具调度,而非直接作为推荐器本身,能有效融合传统推荐系统的结构化过滤能力与LLM的语义理解能力,是对话式推荐的新范式。
  • 后续研究启发
    1. 引入强化学习(RL)优化工具调用:正如论文展望所述,可用RL来减少工具调用的语法错误,提升首次调用成功率,摆脱对重试机制的依赖。
    2. 个性化工具路由策略:研究如何根据用户行为模式动态调整工具调用策略,而不仅仅局限于当前基于物品的推荐逻辑。
    3. 领域特定工具的适配训练:针对LLM不熟悉Semantic ID等私有标识符的问题,可以通过构造工具调用的SFT数据对LLM进行微调,提升其使用长尾工具的自信与准确度。
#25
cs.SD

A Training-Efficient Transformer-Based Anti-Spoofing Network for Logical Access in ASVspoof 5

Sidan Yin, Bo Zhao
Sound (cs.SD); Computers and Society (cs.CY)
Comments: 11 pages, 2 figures
查看摘要
Synthetic and manipulated speech can reduce the reliability of automatic speaker verification systems, so anti-spoofing methods need to be both accurate and efficient in training and inference. This paper focuses on the ASVspoof 5 Track 1 closed condition, where standard cross-entropy training may not give enough attention to hard trials and is not directly aligned with ranking- and threshold-based evaluation metrics. We propose TFPARN, a Transformer-based focal-pairwise attentive ranking network. The system extracts log-Mel features from speech, uses a Transformer encoder to model frame-level information, applies attention pooling to obtain utterance-level representations, and is trained with a combination of focal classification loss and pairwise ranking loss. RawBoost augmentation is used during training, and test-time augmentation is applied during evaluation to improve robustness. Compared with re-implemented AASIST and RawNet2 baselines under the same protocol, TFPARN achieves the best results, with a minDCF of 0.2430 and an EER of 12.52%. Ablation experiments further show that the pairwise loss, focal loss, and attention pooling all improve performance. TFPARN also uses the lowest inference memory among the compared systems, at 1.4 GB, runs at about 0.79 ms per utterance, and reaches its best checkpoint in less training time than AASIST. These results show that TFPARN provides a good balance between detection accuracy and computational cost for logical access anti-spoofing.

📖 深度解读

1. 一句话总结

本文提出了一种名为TFPARN的轻量级语音防伪模型,通过结合焦点损失和成对排序损失来优化排序敏感的评估指标,并利用注意力池化聚焦伪造线索,在ASVspoof 5挑战赛中实现了检测精度与训练/推理计算成本的最佳平衡。

2. 研究背景与动机

  • 核心问题:如何为自动说话人验证(ASV)系统构建一个既能准确检测未知语音深度伪造攻击,又具备高计算效率(训练快、推理内存小)的反欺骗模型。
  • 重要性:随着AI生成语音越来越逼真,ASV系统面临严重威胁;同时,实际部署的语音验证设备往往硬件资源有限且要求低延迟,模型还需要频繁更新以应对新攻击,因此训练和推理效率至关重要。
  • 现有方法不足
    1. 传统的交叉熵(CE)损失无法让模型在训练后期聚焦于难样本,且与ASVspoof基于排序和阈值的评估指标(如minDCF、EER)不对齐。
    2. 伪造语音的破绽通常是局部且稀疏的,简单的全局平均池化容易稀释这些关键线索。
    3. 现有代表性模型(如AASIST、RawNet2)未在检测性能与计算效率之间取得良好平衡(例如AASIST参数虽少但图注意力机制导致内存和延迟极高)。

3. 核心方法

  • 提出模型:TFPARN(Transformer-based Focal-Pairwise Attentive Ranking Network)。
  • 关键创新点
    1. 双损失函数协同:结合焦点损失和成对排序损失,前者让模型死磕“难样本”,后者强制真实语音的得分高于伪造语音一个边界值,直接优化排序指标。
    2. 注意力时间池化:用轻量级打分网络为不同帧分配权重,让模型聚焦于最可能包含伪造线索的帧,避免全局平均造成的线索稀释。
    3. 高效的架构选择:摒弃不规则的图计算或长序列RNN,采用标准Transformer处理短时log-Mel序列,完美契合GPU的密集矩阵运算特性。
  • 核心思路直觉解释
  • 就像批改难度悬殊的考卷:普通交叉熵就像老师改卷,大部分简单题做对后就不怎么管了;焦点损失则让老师把精力集中在容易混淆的“错题”上;成对排序损失则要求不仅判断对错,还必须让“真卷子”的得分比“假卷子”高出一定及格线,确保排名绝对可靠。
  • 就像寻找画作赝品的破绽:伪造语音的破绽往往只出现在几帧的某个频段,注意力池化就像拿着放大镜重点看那些笔触异常的地方,而不是把整幅画平均看一遍。

4. 实验与结果

  • 数据集/基准:ASVspoof 5 Track 1 闭集条件(仅使用官方训练集,无外部数据/预训练模型)。
  • 基线方法:重新实现的AASIST和RawNet2(统一协议,冻结前端滤波器)。
  • 主要实验结果
  • 检测性能:TFPARN全面超越基线,最佳配置(ID 6)取得minDCF 0.2430、EER 12.52%的最好成绩(AASIST分别为0.2911和18.58%)。
  • 计算效率:TFPARN推理峰值内存仅1.4 GB(AASIST高达56.7 GB),推理延迟约0.79 ms/句(AASIST为10.48 ms),达到最佳checkpoint的训练时间仅149.4分钟(AASIST需1014.6分钟)。
  • 消融实验揭示
  • 成对排序损失:对EER影响不大,但显著降低了minDCF和Cllr,证明其优化了全局排序和决策成本。
  • 焦点损失:大幅降低了Cllr(从1.6786降至0.7232),证明其有效提升了模型对难样本的区分度和分数校准能力。
  • 注意力池化:相比平均池化,进一步拉低了minDCF和EER,验证了聚焦局部线索的有效性。

5. 优势与局限

  • 主要优势
    1. 极致的效率与性能平衡:在检测指标领先的同时,内存占用仅为AASIST的1/40,训练速度快7倍,极具工程落地价值。
    2. 训练目标与评估指标对齐:通过引入排序和焦点损失,解决了传统CE损失与EER/minDCF不对齐的痛点。
    3. 泛化性更好:训练曲线显示,RawNet2虽训练误差极低但开发集表现差(过拟合),TFPARN则保持了最小的Train-Dev泛化差距。
  • 局限性
    1. 排序损失的近似性:当前使用的成对合页损失只是在mini-batch内近似排序,并未直接且可微地优化minDCF等检测成本函数。
    2. 分数校准的稳定性:引入注意力池化后,虽然排序指标(minDCF/EER)最优,但校准指标Cllr的方差变大(稳定性稍弱于仅用焦点损失的版本)。

6. 关键结论与启发

  • 最重要的Takeaway:在音频防伪领域,模型架构的“GPU友好度”比单纯的参数量更重要(AASIST参数少但极慢),且将损失函数与评估指标(排序与难样本挖掘)对齐,能以极低的计算代价换取显著的性能提升。
  • 后续研究启发
    1. 更精细的排序损失:可以探索列表式或可微的排序损失,直接针对minDCF等成本函数进行优化,以突破当前成对合页损失的近似瓶颈。
    2. 池化与校准的协同:注意力池化引入的方差问题值得深入研究,未来可探索如何结合正则化或更鲁棒的池化机制,在保持排序优势的同时稳定分数校准。
#26
cs.SD

Audio Spotforming via Post-Filtering Using Cross-Array Non-target Estimates

Yuto Ishikawa, Li Li, Shogo Seki, Kouei Yamaoka
Sound (cs.SD)
Comments: Accepted for EUSIPCO 2026
查看摘要
Audio spotforming is a technique for extracting target speech from noisy mixtures by utilizing multiple microphone arrays. Conventional methods estimate a shared target speech component from linearly separated signals obtained by each array using low-rank approximations and apply post filtering (PF) based on this estimated low-rank representation. However, owing to the mismatch between low-rank models and the complex structure of speech signals, directly relying on low-rank approximations for PF can degrade the speech extraction performance. In this study, we leverage the observation that non-target components located in the target speech direction from the perspective of one array can be spatially separated when viewed from other arrays. This insight motivates a new spotforming method for efficient post-filter estimation using non-target estimates across arrays instead of relying on low-rank approximations. Experiments demonstrate that the proposed method outperforms conventional spotforming methods.

📖 深度解读

1. 一句话总结

本文提出了一种利用跨麦克风阵列的非目标语音估计来构建后置滤波器的新型音频聚束方法,摆脱了传统低秩近似的依赖,在提升目标语音提取性能的同时大幅降低了计算复杂度。

2. 研究背景与动机

  • 核心问题:在多麦克风阵列语音提取中,当干扰说话人(非目标语音)与目标说话人处于同一方向时,单一阵列无法从空间上将二者分离(即“遮挡”问题)。
  • 问题重要性:这是波束成形技术固有的空间分辨率瓶颈,严重限制了嘈杂环境下的语音通信和识别性能。
  • 现有方法不足:现有的音频聚束技术利用多个分布式阵列来解决此问题,分为空间滤波(SF)和后置滤波(PF)两阶段。在PF阶段,传统方法(如NMF、NTF)依赖低秩近似来提取跨阵列共享的目标语音频谱模式。然而,语音信号结构复杂,低秩模型难以精准刻画,强行使用会导致性能下降;若要达到较好效果(如NTF),则需要极大的基数量,导致计算复杂度剧增。

3. 核心方法

  • 提出方法:基于跨阵列非目标估计的聚束后置滤波框架。
  • 关键创新点
    1. 视角转换(跨阵列空间分集):巧妙利用了分布式阵列的空间几何差异——从阵列A看与目标同向的干扰,从阵列B看则是不同向可分离的。
    2. 摒弃低秩假设:不再用低秩模型去“猜”目标语音长什么样,而是用其他阵列分离出的非目标成分来“减去”本阵列目标方向上的干扰。
    3. 稀疏先验引入:为目标语音的时变方差引入逆伽马分布先验,促使目标语音在时频域呈现稀疏性,进一步压制干扰。
  • 核心思路直觉解释
    假设你(阵列A)正看着台上的人(目标),但有个挡路者(干扰)正好和台上的人重叠,你很难看清。但你的朋友(阵列B)站在侧面,他能清楚地把挡路者认出来。传统方法是让所有人凭记忆画出台上人的特征(低秩近似),这很难画准。本文的方法是:朋友把他看到的挡路者特征告诉你,你直接从视线中把挡路者“抠掉”,剩下的自然就是台上的人了。最后,综合大家的视角,得到最清晰的目标图像。

4. 实验与结果

  • 数据集/基准:使用JVS日语语音数据集,通过Pyroomacoustics模拟不同混响(0ms和200ms)和不同麦克风数量(3个和4个麦克风/阵列)的房间环境,设置3个干扰说话人。
  • 基线方法:Conv. (NMF) 和 Conv. (NTF),即传统的基于非负矩阵/张量分解的聚束方法。
  • 主要实验结果
  • 在无混响(0ms)下,本文方法(无先验版本)的SDR达到22.85 dB,远超NTF的16.72 dB;PESQ和STOI也全面领先。
  • 在有混响(200ms)下,本文方法依然在SDR、PESQ、STOI上取得最优(如4麦阵列下SDR为8.97 dB,NTF为7.94 dB)。
  • 引入稀疏先验的方法在SIR(信干比)上表现最佳(最高达22.68 dB),说明压制干扰能力极强,但过强的稀疏性会损伤目标语音导致SDR略降。
  • 消融实验揭示:对比“有先验”和“无先验”版本发现,引入稀疏先验是一把双刃剑:它能更狠地压制干扰(SIR提升),但过度稀疏也会误伤目标语音引入失真(SDR和PESQ略降)。
  • 计算复杂度:传统方法的复杂度与基数量(NMF需50,NTF需300)线性相关,而本文方法仅与阵列数和麦克风数(通常极小)相关,实际计算开销大幅降低,且迭代次数仅需20次(传统需100次)。

5. 优势与局限

  • 主要优势
    1. 性能提升显著:打破了低秩建模的瓶颈,在客观指标(尤其是SDR和感知指标)上明显超越现有方法。
    2. 计算高效:无需庞大的基数量进行矩阵分解,计算复杂度大幅降低。
    3. 物理意义清晰:利用了分布式阵列间真实的空间几何关系,逻辑直观且鲁棒。
  • 局限性
    1. 稀疏先验的权衡问题:论文自身也表明,引入的稀疏先验在提升干扰抑制和保留目标语音完整性之间存在trade-off,参数(α)需要仔细调节。
    2. 对空间滤波阶段的依赖:该方法需要SF阶段(GC-ILRMA)准确提供目标方向和非目标方向的分离信号,如果SF阶段估计的解混滤波器质量不佳,跨阵列的非目标估计就会产生误差并传递到PF阶段。
    3. 同步性假设:实验中虽然模拟了微小的随机时移(10个采样点),但在实际分布式阵列中,时钟漂移和采样率偏差可能更复杂,对跨阵列协方差估计的鲁棒性仍需更严苛的验证。

6. 关键结论与启发

  • 最重要的 takeaway:在分布式麦克风阵列处理中,跨阵列的“非目标(干扰)信息”比“目标低秩假设”更有价值且更易获取。通过交叉利用不同视角的干扰估计,可以优雅地解决同向干扰的难题。
  • 对后续研究的启发
    1. 从建模目标转向建模干扰:未来的语音分离/提取研究,可以更多关注如何精确刻画和估计干扰成分,而非强求目标语音符合某种数学分布(如低秩性)。
    2. 与深度学习的结合:本文的跨阵列空间分集思想可以引入到神经网络中,例如设计多分支网络专门提取跨视角的残差/干扰特征,以指导目标声源的掩蔽估计。
    3. 先验分布的自适应:针对稀疏先验导致的目标语音失真问题,未来可探索数据驱动的或自适应的稀疏正则项,在抑制干扰和保留语音包络之间找到动态平衡。
#27
cs.SD
Tencent (World Famous IT Company)

SketchSong: Hierarchical Song Generation with Sketch Planning and Fine-Grained Multi-Track Modeling

Xiaoyue Duan, Nanxing Hu, Yutang Feng, Xudong Yan, Jiatao Chen 等 (7 人)
Sound (cs.SD); Machine Learning (cs.LG); Multimedia (cs.MM)
查看摘要
Recent song generation systems can synthesize realistic audio, yet generating complete songs remains challenging for two reasons. First, explicit song-level arrangement planning remains limited in existing methods, so models often need to organize overall arrangement development while generating low-level audio details. This often leads to incoherence in arrangements, such as weak section transitions and limited dynamic progression. Second, coarse modeling of different musical parts obscures their distinct roles and interactions, limiting arrangement richness of generated songs. In this paper, we present SketchSong, a hierarchical song generation framework that addresses these issues through song-level sketch planning and fine-grained multi-track modeling. Along the temporal dimension, SketchSong first predicts a compact sequence of high-level sketch tokens derived from compressed audio representations, and then generates audio tokens conditioned on these sketches. This coarse-to-fine process gives the model an explicit arrangement plan before detailed audio generation. Along the track dimension, SketchSong explicitly models four tracks, i.e., vocals, bass, drums and other instruments. This enables the model to capture the roles and interactions of different musical parts more precisely. Experiments on song generation benchmarks show that SketchSong consistently outperforms our baseline on both objective metrics and human listening tests. Despite not employing additional post-training for preference optimization such as lyrics and text-prompt alignments, SketchSong achieves competitive results against strong, post-trained open-source systems, demonstrating the effectiveness of our overall design.

📖 深度解读

1. 一句话总结

SketchSong 通过引入“歌曲级草图规划”(先写大纲再填细节)和“细粒度多音轨建模”(分声部编写伴奏)的分层框架,解决了现有歌曲生成中段落过渡不自然、动态发展平缓和乐器编排单调的问题。

2. 研究背景与动机

  • 核心问题:如何生成结构连贯、编排丰富且具有长期音乐发展逻辑的完整歌曲。
  • 重要性:一首好歌不仅需要局部听起来逼真,还需要清晰的段落推进(如主歌到副歌的能量递进)、自然的动态变化,以及人声与各乐器间协调的互动。这些品质需要在整首歌的跨度上维持,而非仅存在于短促的局部。
  • 现有方法不足
    1. 缺乏全局规划:现有模型通常在同一个生成过程中既要处理高层编排(段落走向、动态起伏),又要预测底层音频细节,导致“一心二用”,容易出现段落过渡生硬、动态变化匮乏的问题。
    2. 声部建模过于粗糙:多数系统将歌曲作为单一混合信号生成,或仅做粗粒度的“人声-伴奏”分离。这掩盖了贝斯、鼓组和其他乐器在节奏、和声与织体上的独特作用,限制了编排的丰富度和层次感。

3. 核心方法

  • 提出框架:SketchSong,一个基于“粗到细”和“混合到分轨”范式的分层歌曲生成框架。
  • 关键创新点
    1. 歌曲级草图规划:在生成详细音频前,先预测一段紧凑的高层“草图序列”,为模型提供显式的编排计划。
    2. 细粒度四音轨建模:将传统的“人声+伴奏”二分法,细化为“人声、贝斯、鼓、其他乐器”四个显式音轨,精准捕捉不同乐器的角色与互动。
    3. 草图信息跨阶段注入:通过第一阶段的隐藏状态,将草图规划中的编排线索传递给第二阶段的分轨模型,实现两个维度的互补。
  • 核心思路直觉解释
  • 草图规划 = 写作文先列提纲:模型不是一上来就逐字逐句写正文(生成音频token),而是先根据提示词列出一个5秒一个节拍的“大纲”(草图token,包含这段该有什么情绪、多密集),然后再看着大纲扩写正文。这样文章就不会跑题,段落转折也自然。
  • 多音轨建模 = 乐队分声部排练:以前生成伴奏就像让一个人同时弹奏所有乐器,糊成一团;现在明确分出贝斯手、鼓手等,大家各司其职(贝斯管低音底盘,鼓管节奏律动),最后再合到一起,音乐自然更丰富、更有层次。

4. 实验与结果

  • 数据集:约100万首歌曲(5.4万小时)的内部数据集,使用Demucs进行音轨分离。
  • 基线方法:LeVo(主要基线,同数据集重训)、YuE、DiffRhythm 2、ACE-Step 1.5等开源系统。值得注意的是,开源系统大多使用了偏好对齐的后训练,而SketchSong没有。
  • 主要实验结果
  • 客观指标:相比同设置下的LeVo,SketchSong的FAD(音频质量)从3.73降至3.06,PER(发音错误率)从32.3降至27.8,MuQ-T(文本音频对齐度)从0.29升至0.32。在未使用后训练的情况下,多项美学指标与强开源系统打得有来有回。
  • 主观听感(MOS):整体质量从3.60提升至3.68,乐器丰富度从3.56大幅提升至3.84。
  • 消融实验揭示
  • 草图规划主要提升长期连贯性、段落清晰度、音乐性和记忆点(解决“结构发展”问题)。
  • 多音轨建模主要提升制作复杂度、制作质量和乐器丰富度(解决“编排层次”问题)。
  • 两者是互补的:多音轨建模单独使用时对FAD提升有限(论文归因于非人声音轨共享解码器导致重混音不自然),但与草图结合后达到了最佳的整体平衡。

5. 优势与局限

  • 主要优势
    1. 全局与局部兼顾:通过“先规划后填充”的机制,有效解决了长音频生成中容易出现的结构涣散问题。
    2. 可解释与可控性:草图序列成为了用户控制歌曲走向的显式接口,用户可以通过替换参考音频的草图来强行改变生成歌曲的风格和能量走向,而无需修改文本提示词。
    3. 声部解耦更合理:四音轨设计符合真实音乐制作的逻辑,显著提升了伴奏的层次感和可分离性。
  • 局限性
    1. 解码端瓶颈:当前贝斯、鼓和其他乐器仍共享同一个伴奏编解码器解码,简单的幅度缩放重混音可能导致音频自然度受损(这也是单独使用多音轨时FAD未改善的原因)。
    2. 缺乏后训练对齐:目前未引入针对歌词对齐、文本提示对齐的偏好优化(如DPO),导致在某些文本对齐和发音准确率指标上仍逊色于经过后训练的开源模型。

6. 关键结论与启发

  • 最重要的 takeaway:在自回归音频生成中,将“高层结构规划”与“底层细节生成”解耦,并将“粗粒度伴奏”拆解为“细粒度多声部”,这两个正交维度的改进是互补的——前者管“时间线上的发展”,后者管“横截面上的厚度”,共同促成了高质量的歌曲生成。
  • 对后续研究的启发/延伸方向
    1. 多音轨编解码器的研发:亟需为贝斯、鼓等训练专用的解码器,以打破当前共享伴奏codec带来的重混音音质瓶颈。
    2. 结合偏好对齐:将SketchSong的架构优势与RLHF/DPO等后训练技术结合,有望在结构和音质双重提升的基础上,进一步解决歌词对齐等可控性问题。
    3. 更精细的草图控制:当前的草图基于5秒窗口提取,未来可以探索更细粒度或层级更丰富的草图(如段落级+乐句级),实现更灵活的音乐结构控制。
#28
cs.SD

Speech Emotion Recognition using Attention-based LSTM-Network with Residual Connection

Daniil Krasnoproshin, Maxim Vashkevich
Sound (cs.SD); Computation and Language (cs.CL); Machine Learning (cs.LG)
Comments: 6 pages, 5 figures, DSPA 2026
查看摘要
Speech emotion recognition is an important component of modern human-computer interaction systems. However, many state-of-the-art approaches rely on large pretrained models with high computational and memory requirements, limiting their applicability. This paper proposes ResLSTM-SA, a lightweight architecture that integrates residual connections with soft attention within an LSTM-based framework. Evaluated on the RAVDESS dataset under strict speaker-independent partitioning, the proposed model outperforms conventional attention-based LSTM baselines and several previously reported CNN- and hybrid CNN-LSTM architectures in terms of unweighted average recall (UAR). The best-performing variant (ResLSTM-SA-h64) achieves a maximum UAR of 0.6517 with only 46.8k trainable parameters, delivering competitive accuracy with three orders of magnitude fewer parameters than large-scale self-supervised alternatives, thereby enabling efficient deployment on edge devices and real-time voice assistants. The source code is available at this https URL .

📖 深度解读

1. 一句话总结

这篇论文提出了一种轻量级的语音情感识别模型ResLSTM-SA,通过融合残差连接和软注意力机制,在仅用不到5万参数的情况下,实现了与传统大模型相当的情感识别准确率,解决了边缘设备部署难的问题。

2. 研究背景与动机

  • 核心问题:如何在计算资源受限的场景下(如边缘设备、实时语音助手)高效地进行语音情感识别(SER)。
  • 重要性:语音情感识别是人机交互、医疗保健、客服系统等领域的核心技术,但现实应用往往受限于硬件算力和内存。
  • 现有方法不足:当前主流的高精度方法(如PANNs、Wav2Vec 2.0等大规模预训练模型)虽然准确率高,但参数量动辄数千万甚至上亿,计算和内存开销极大,难以在资源受限的边缘设备上实时部署;而传统的轻量级模型(如CNN、基础LSTM)在特征提取和时序建模能力上存在瓶颈,准确率不够理想。

3. 核心方法

  • 提出模型:ResLSTM-SA(带有残差连接和软注意力的LSTM网络)。
  • 关键创新点
    1. 维度匹配的残差连接:第一层LSTM的隐藏层维度与输入特征维度严格一致(均为46维),使得原始声学特征可以直接与LSTM提取的上下文特征进行逐元素相加,既保留了原始底层信息,又注入了时序上下文。
    2. 轻量高效的架构设计:用极少的参数量(最优模型仅4.68万参数)实现了深层时序建模,打破了“高精度必须大模型”的常规路径。
    3. 声学特征增强:在传统MFCC特征之外,引入了12维的色度特征来捕捉音高和声调信息,丰富了情感韵律的表达。
  • 核心思路直觉解释:可以把这个模型想象成一位“划重点的学生”。原始的语音特征就像是一本厚厚的教科书,第一层LSTM(带残差)相当于学生在书上做批注,补充了上下文联系,但原书内容一字不落(残差连接保留原始信息);接着,软注意力机制就像考试前只看画红线的关键段落,给包含强烈情绪的时间段分配更高的权重;最后基于这些“重点批注”做出情绪判断。

4. 实验与结果

  • 数据集:RAVDESS(包含8种情绪的高质量音频数据集)。
  • 基线方法:基础LSTM-SA(无残差)、AlexNet+SVM、CNN+LSTM、微调的AlexNet、GResNet+S,以及大规模预训练模型(CNN14、wav2vec 2.0)。
  • 主要实验结果
  • 最优模型 ResLSTM-SA-h64 实现了 0.6517 的最高UAR(未加权平均召回率),参数量仅 0.05M
  • 对比基础LSTM-SA-h128(0.5895 UAR,91.6k参数),ResLSTM-SA-h32仅用28k参数就达到了0.6130的UAR,实现了“参数更少、精度更高”。
  • 在非自监督模型中,ResLSTM-SA-h64超越了所有传统CNN和混合架构(UAR 0.56~0.62),且参数量比它们少了两到三个数量级。
  • 虽然绝对精度不及317M参数的wav2vec 2.0(0.8182),但以千分之一的参数量达到了极具竞争力的水平。
  • 消融实验揭示
  • 残差连接的作用:在相同隐藏维度下,加入残差(ResLSTM-SA对比LSTM-SA)使UAR提升了最高7.7个百分点。
  • 模型容量的权衡:隐藏维度从32增至64能提升性能,但增至128时性能反而下降(UAR从0.6232降至0.6107),说明过大的参数量在小数据集上容易过拟合,h64是最佳平衡点。

5. 优势与局限

  • 主要优势
    1. 极致的参数效率:以不到5万的参数量超越了数千万参数的传统模型,极大地降低了部署门槛。
    2. 即插即用的特征增强:残差连接的设计巧妙且轻量,无需增加额外维度即可融合原始特征与上下文特征。
    3. 严格的评估协议:采用说话人无关的5折交叉验证和10次独立随机种子实验,结果稳健,避免了数据泄露和随机性偏差。
  • 局限性
    1. 数据集单一且规模小:仅在RAVDESS这一高质量、受控环境的小型数据集上验证,对真实嘈杂环境下的鲁棒性未知。
    2. 与顶级大模型仍有绝对差距:与wav2vec 2.0等自监督模型相比,UAR仍有约16个百分点的绝对差距,牺牲了部分精度换取轻量化。
    3. 情绪混淆明显:模型在区分“开心”和“中性”情绪时存在系统性混淆(开心极易被误判为中性),说明模型对某些微妙情感的细粒度特征捕捉仍不足。

6. 关键结论与启发

  • 最重要的Takeaway:在语音情感识别中,精巧的网络结构设计(如维度匹配的残差+注意力)可以在极大降低模型复杂度的同时,达到甚至超越复杂庞大的传统模型,轻量化与高精度可以兼得。
  • 后续研究启发/延伸方向
    1. 跨数据集泛化验证:亟需在“真实场景”数据集(如IEMOCAP、MELD等包含背景噪声和自发语音的数据集)上验证ResLSTM-SA的泛化能力。
    2. 轻量级多模态融合:论文目前仅处理音频,未来可探索将此轻量架构扩展至多模态(如结合面部Action Units),构建轻量级的多模态情感识别系统。
    3. 特征工程与端到端学习的结合:本文仍依赖手工特征(MFCC+Chroma),未来可探索如何用极少参数将原始波形端到端地映射为类似Chroma的韵律特征,进一步优化流水线。
#29
cs.SD
Sorbonne University (QS Top 100)

Tonal parsimony in chord-sequence analysis: combining modulation cost and tonal vocabulary

François Pachet
Sound (cs.SD); Artificial Intelligence (cs.AI)
Comments: 20 pages, 1 figure
查看摘要
We study the assignment of local tonalities to chord sequences, a task useful for harmonic analysis, composition, and jazz-oriented improvisation. Standard dynamic-programming approaches minimize modulations but can introduce unnecessarily many tonal centers. We compare this transition-only objective with pure minimum-vocabulary analysis and with tonal parsimony, which minimizes lexicographically the number of modulations and then the number of distinct tonalities. Although this joint objective is combinatorially hard in general, we give exact algorithms exploiting the fixed 24-tonality major/minor universe. On 31,032 LMD Chords sequences, tonal parsimony preserves the transition optimum while reducing tonal vocabulary in 55.8% of cases. With weighted jazz-substitution closure, it lowers mean tonalities from 3.802 to 3.206 and modulations from 16.728 to 12.141. On 1,555 annotated jazz standards, it improves compatible chord-scale agreement to 95.6%, supporting tractable professional-scale harmonic analysis.

📖 深度解读

1. 一句话总结

这篇论文提出了一种名为“调性极简”的算法,在为和弦序列分配局部调性时,优先保证调性转换次数最少,并在同等条件下选择使用最少的不同调性数量,从而为爵士乐和声分析提供了更紧凑、更符合专家直觉的结果。

2. 研究背景与动机

  • 核心问题:给定一段和弦序列,如何为每个和弦分配一个最合理的局部调性(如C大调、A小调等),以便于即兴演奏、和声分析和重新编曲。
  • 重要性:在爵士乐等音乐风格中,局部调性的分配直接决定了乐手即兴演奏时使用的音阶。准确的和声分析是音乐生成和理解的基础。
  • 现有方法不足:传统的动态规划(DP)方法只关注“最小化调性转换次数”(即尽量少变调),但这会导致一个盲区:在同样少的变调次数下,算法可能会随意引入许多不必要的、零散的调性中心,使得分析结果显得冗杂,缺乏音乐上的整体连贯性。

3. 核心方法

  • 提出框架:论文提出了“调性极简”优化目标,这是一个字典序优化问题:首先最小化调性转换次数($C$),在转换次数相同的情况下,再最小化使用的不同调性总数($K$)。
  • 关键创新点
    1. 字典序优化目标:首次将“调性词汇量最小化”作为次要约束引入和声分析,填补了传统仅关注转换代价的空白。
    2. 固定调性宇宙下的精确算法:虽然该优化问题在理论上是NP难的,但论文利用了西方音乐中固定只有24个大/小调的特性,设计了一种基于标签和支配剪枝的动态规划算法,实现了实际应用中的高效精确求解。
    3. 引入爵士和弦替代闭包:在局部候选调性生成阶段,加入带权重的爵士和声替代规则(如三全音替代、次属和弦等),使得原本“不兼容”的离调和弦能在当前调性下获得合理的功能解释。
  • 核心思路直觉解释:想象你规划一条跨城路线,传统方法只保证“换乘次数最少”,但可能让你坐了5条不同的线路;新方法则在此基础上,要求“在换乘次数最少的前提下,尽量只坐同一家公司的车”。同时,通过“替代规则”,算法能识别出某些看似不相关的车次其实属于同一家公司的联程票,从而避免无谓的换乘。

4. 实验与结果

  • 数据集
    1. LMD Chords语料库(31,032个和弦序列,约250万个和弦)
    2. Jazz Standards Progressions Book(1,555首带专业音阶标注的爵士标准曲)
    3. 自建的CokerBench(19个针对特定和声功能的测试用例)
  • 基线方法
    1. 仅最小化转换的动态规划(Transition-only DP)
    2. 仅最小化调性词汇量的命中集算法
  • 主要实验结果
  • 在LMD语料库上,调性极简方法100%保留了DP的最小转换次数,同时在55.8%的序列中减少了使用的调性数量
  • 结合替代规则后,调性极简将平均调性数从3.802降至3.206,平均转换次数从16.728降至12.141。
  • 在专业标注验证上,调性极简达到了95.6%的兼容一致率(比两种基线的94.3%更高),且严格一致率达到81.1%。
  • 消融实验揭示
  • CokerBench测试表明,很多看似是优化目标导致的问题,其实是“候选调性缺失”问题。加入替代规则后,三种方法在大部分用例上表现趋同,但在复杂多调性交替的用例中,调性极简仍能独占鳌头,兼顾最少转换和最少调性。

5. 优势与局限

  • 主要优势
    1. 理论优雅,效果叠加:完美继承了传统DP“少变调”的优点,同时消除了冗余的调性中心,分析结果更紧凑。
    2. 工程可用:巧妙利用24调的固定规模,将理论上的NP难问题转化为实际中毫秒级可解的优化问题。
    3. 与领域知识深度结合:替代规则不是作为后处理修补,而是作为候选域扩充融入全局优化,使得专业爵士和声现象(如三全音替代)得到原生支持。
  • 局限性
    1. 缺乏局部功能偏好:算法仅基于音阶包含关系和全局计数,无法区分“包含在Ab大调中”和“功能属于F小调”的差异,导致在关系大小调交替时可能错误地选择0转换的单一调性解释。
    2. 对无标记大七和弦的过度压缩:对于如 Cmaj7 | Ebmaj7 | Abmaj7 这样本应具有多个独立主音的序列,由于Cmaj7音阶被G大调包含,算法会倾向于压缩调性数量,而非给出5个独立调性的预期分析。

6. 关键结论与启发

  • 最重要的Takeaway:在和声分析中,仅仅追求“少变调”是不够的,必须同时约束“调性词汇量”,才能得出符合人类音乐直觉的分析结果;而实现这一复杂联合优化的关键,在于利用音乐本身有限的调性集合(24个)来降维打击。
  • 对后续研究的启发
    1. 生成式音乐的复杂度控制:论文指出,优化后的调性数量$K$可以作为衡量和声复杂度的有效指标,未来可用于控制AI音乐生成时的和声丰富度(如指定生成$K=2$的中等复杂度进行曲)。
    2. 双层优化问题:如何在生成阶段直接强制约束全局的$K$值,是一个极具挑战的 bilevel 优化问题,这是未来约束满足和音乐生成交叉领域的重要方向。
    3. 引入局部功能权重:为解决关系大小调误判的局限,未来模型可能需要在候选域阶段引入基于调式功能(主、属、下属)的权重或惩罚,而不仅仅是音高包含关系。
#30
cs.SD
Nanjing University (985, 211)

Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

Ye Tao, Lupeng Liu, Xuenan Xu, Jiasun Feng, Jiarui Wang 等 (9 人)
Sound (cs.SD); Multimedia (cs.MM)
查看摘要
Recent unified audio generation models can support diverse tasks across speech, sound effects, and music, but most of them still focus on isolated task-level synthesis. However, real video production often requires multiple components of a complete audio track to be generated jointly and consistently for the same video. We present Foley-Omni, a unified multimodal audio generation model that extends isolated task-level synthesis to complete video soundtrack generation by jointly modeling speech, sound effects, and music within a shared latent generation process. To support training and reproducible evaluation, we develop an audiovisual data curation pipeline and introduce V2ST-Bench, a benchmark for holistic video soundtrack generation evaluation. Experiments show that Foley-Omni achieves competitive performance with expert systems on individual synthesis tasks, while improving speech intelligibility, audiovisual consistency and perceptual quality for mixed soundtrack generation.

📖 深度解读

1. 一句话总结

本文提出了Foley-Omni,一个统一的多模态音频生成模型,它不仅能处理单一的音频生成任务,还能直接为给定视频端到端地联合生成包含语音、音效和音乐的完整且协调的配乐。

2. 研究背景与动机

  • 核心问题:如何为一段视频生成包含语音、音效和背景音乐,且在时间轴上同步、语义上一致的完整配乐(Video-to-Soundtrack, V2ST)。
  • 重要性:真实的视频制作不仅需要画面,还需要多元素协同的音频(如说话声与口型对齐、动作声与画面同步、音乐烘托氛围)。闭源系统(如Google Veo3)已具备此能力,但学术界在此领域严重滞后。
  • 现有方法不足
    1. 任务割裂:现有的统一音频模型(如AudioX)主要停留在“任务级”统一(即一个模型支持多种单一任务),无法在同一个生成过程中联合输出多种音频。
    2. 拼凑方案的缺陷:如果分别用不同的专家模型生成语音、音效和音乐再后期混合,会导致严重的“各管各的”问题——音效可能掩盖语音,时间轴无法精准对齐,整体听感割裂。
    3. 数据与评测缺失:现有视听数据集标注粗糙、时间未对齐,且缺乏针对“完整配乐”的公开评测基准。

3. 核心方法

  • 提出框架:Foley-Omni,基于扩散Transformer(DiT)和流匹配的统一多模态生成框架。
  • 关键创新点
    1. 结构化多模态条件输入:使用特殊标签([WORDS], [AUDIO], [MUSIC])将不同音频的文本描述整合为统一的结构化文本,并通过共享的UM-T5编码器映射到同一语义空间,实现多种任务共享同一文本接口。
    2. 混合条件注入机制:对于视频输入,提取CLIP特征(提供场景语义)和Synchformer特征(提供口型与动作的时间同步 cues)。语义特征通过交叉注意力注入,而时间同步特征则通过Adapter对齐时间长度后,直接加到带噪的音频隐变量上,提供强时间锚点。
    3. 课程学习策略:采用三阶段渐进式训练——先学文本到音频(建立音频先验),再学视频到音频(学习视听对齐),最后学混合配乐生成(学习多源共存与平衡),避免多任务直接混合导致的语音不可懂和音效被压制。
    4. 数据清洗与声学验证管线:用Gemini 2.5 Pro生成结构化标注,并用音源分离模型Bandit分离出语音/音效/音乐轨道,计算各轨道能量,剔除能量极低(听不见)的“视觉幻觉”标签,保证训练数据绝对可靠。
  • 核心思路直觉解释:就像拍电影,以前是配音、拟音、配乐各干各的最后混音,经常对不上号;现在是一个导演带着统一的剧本(结构化文本),看着画面(视频特征),指挥一个交响乐团(DiT模型)一次性把所有声音和谐地演奏出来,并且通过把“指挥棒的动作”(同步特征)直接叠加到乐谱上,确保每个音符都卡在画面帧上。

4. 实验与结果

  • 数据集/基准
  • 训练数据:经清洗管线处理的约270万对多模态数据。
  • 评测基准:本文提出的 V2ST-Bench(300个高质量多源共存视频),以及AudioCaps、VGGSound、GRID、LRS2等单任务基准。
  • 基线方法
  • 完整配乐任务:构建了拼凑式基线(MMAudio生成音效 + AudioX生成音乐 + CosyVoice3/LipVoicer生成语音,后期混合)。
  • 单任务:AudioLDM 2, CosyVoice 3, MusicGen, MMAudio, EmoDubber等专家模型。
  • 主要实验结果
  • 完整配乐(核心亮点):在V2ST-Bench上,Foley-Omni全面碾压拼凑式基线。词错率(WER)从10.57%降至7.59%,音画同步度(DeSync)从0.85降至0.16,主观听感(A-MOS)从2.99提升至3.92(接近真实音频的4.33)。证明端到端生成避免了后期混合的互相干扰和时间错位。
  • 单任务性能:在TTA、TTS、TTM、V2A、VisualTTS五个独立任务上,Foley-Omni均取得了与专家模型极具竞争力的成绩,甚至在V2A的同步度(DeSync)和VisualTTS的零样本泛化(LRS2 WER)上表现更优。
  • 消融实验揭示
    1. 去掉同步特征的加法注入路径,音画对齐度(IB分数)显著下降,证明直接相加对时间对齐至关重要。
    2. 去掉课程学习(直接多任务联合训练),WER在GRID和V2ST上分别暴涨至27.4%和29.29%,证明渐进式学习是防止任务间“互相打架”(尤其是语音被破坏)的关键。

5. 优势与局限

  • 主要优势
    1. 范式突破:从“单一任务生成”跨越到“端到端完整配乐生成”,解决了多源音频混合时的冲突与不协调问题。
    2. 强时间对齐:混合条件注入机制(尤其是同步特征的加法直连)带来了极佳的音画同步效果。
    3. 生态建设:提供了高质量的数据清洗管线和首个公开的V2ST-Bench,填补了该领域的评测空白。
  • 局限性
    1. 缺乏细粒度控制:目前只能生成最终的混合音频,无法让用户单独调节人声音量、音乐强度等比例,后期编辑不便。
    2. 对比基线受限:由于同类开源系统不存在,完整配乐任务只能与本文拼凑的Pipeline对比,缺乏端到端的同量级对手。
    3. 语音清晰度瓶颈:由于训练数据包含多说话人,偶尔会导致生成的语音音色受干扰,清晰度受限,未来需引入参考音频机制。

6. 关键结论与启发

  • 最重要的Takeaway:为视频生成配乐时,“先生成再混合”的拼凑范式存在天然缺陷,而将语音、音效、音乐放在同一个隐空间中进行联合建模和端到端生成,能够有效解决跨组件干扰和音画失步问题,是通往真实视频配音的必由之路。
  • 对后续研究的启发/延伸方向
    1. 可控配乐生成:在统一生成的基础上,引入细粒度的控制接口(如各音轨的音量推子、均衡器等),实现“生成即混音”。
    2. 参考音频驱动:引入说话人的参考音频,解决多说话人数据导致的音色模糊问题,提升特定角色的语音保真度。
    3. 数据管线的复用:本文提出的“大模型标注 + 音源分离验证”的数据清洗思路,可广泛应用于其他存在多源重叠的多模态数据处理中。
#31
cs.SD
Apple (World Famous IT Company)

A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation 解读失败跨领域

Kai Li, Jintao Cheng, Chang Zeng, Zijun Yan, Helin Wang 等 (8 人)
Sound (cs.SD); Human-Computer Interaction (cs.HC)
Comments: Accepted to ICML 2026
查看摘要
Query-based universal sound separation is fundamental to intelligent auditory systems, aiming to isolate specific sources from mixtures. Despite recent advances, existing methods continue to suffer from residual interference in complex acoustic scenes. This performance limitation stems largely from a data bottleneck: in-the-wild datasets contain weak labels and severe co-occurrence of events. These flaws induce models to learn spurious correlations between background noise and target categories instead of robust acoustic features. To address this, we propose an automated pipeline that eliminates co-occurrence of events by mining high-purity single-event segments from in-the-wild datasets via a semantically consistent synthesis protocol. Utilizing this pipeline, we constructed Hive, a high-quality synthetic dataset comprising 2.4k hours of raw audio. Experimental results demonstrate that, compared with the state-of-the-art model SAM-Audio which was trained on a huge dataset $\sim$500 times larger than Hive, certain open-source models trained on Hive achieve competitive separation accuracy and perceptual quality. Moreover, these models exhibited remarkable zero-shot generalization on out-of-distribution evaluation benchmarks. These findings highlight that prioritizing purity of supervised signals enables significant data efficiency, offering a new paradigm for training robust auditory foundation models with reduced computational costs. Code and dataset are available at this https URL .

📖 深度解读

[PDF 下载失败,无法解读]

#32
cs.SD
Fudan University (QS Top 100, 985, 211)

MOSS-Audio Technical Report 跨领域

Chen Yang, Chufan Yu, Hanfu Chen, Jie Zhu, Jingqi Chen 等 (26 人)
Sound (cs.SD); Artificial Intelligence (cs.AI)
查看摘要
MOSS-Audio is a unified audio-language model for speech, environmental sound, and music understanding, supporting audio captioning, time-aware question answering, timestamped transcription, and audio-grounded reasoning. MOSS-Audio couples a dedicated audio encoder with a modality adapter and a large language model: the encoder produces 12.5 Hz temporal representations, the adapter projects them into the decoder space, and the decoder generates autoregressive text outputs. Two design choices are central to the system: \textbf{DeepStack cross-layer feature injection}, which exposes the decoder to acoustic information from multiple encoder depths, and \textbf{time markers}, which provide explicit temporal cues by inserting timestamp markers into the audio-token stream. At the data level, we design an event-preserving audio annotation pipeline that segments raw audio at coherent event boundaries, applies branch-specific annotation to speech, music, and general audio, and merges the results into unified captions for pretraining. The intermediate branch-specific captions are further retained to support the construction of task-oriented SFT data. The model is pretrained on large-scale audio-language data, with time-aware objectives incorporated to support temporal grounding, and then undergoes multi-stage post-training to enhance instruction following and audio-grounded reasoning. We release 4B and 8B variants in both Instruct and Thinking configurations. MOSS-Audio achieves strong performance across general audio understanding, speech captioning, ASR, and timestamped ASR, positioning it as a promising understanding foundation for future voice agents.

📖 深度解读

1. 一句话总结

MOSS-Audio 提出了一个统一的音频-语言模型,通过跨层特征注入和显式时间标记技术,结合事件保留的数据标注管线,在单一框架内实现了对语音、环境音和音乐的精准识别、时间定位与深度推理。

2. 研究背景与动机

  • 核心问题:如何构建一个能够同时理解异构音频信号(语音、环境音、音乐)、遵循自然语言指令,并具备时间感知与推理能力的统一音频大模型。
  • 重要性:对于未来的语音智能体而言,音频模型不能仅仅是一个“语音转文字”的转录器,而必须是感知和推理的核心——它需要理解用户的语气、环境背景、事件发生的时间线,才能为下游的对话或行动提供支撑。
  • 现有不足
    1. 特征瓶颈:现有模型多直接复用为ASR(语音识别)设计的编码器,只输出最后一层特征,丢失了低层的韵律、瞬态事件等声学细节,难以支撑环境音和音乐理解。
    2. 时间感知弱:大多数模型缺乏显式的时间建模,仅靠音频token的相对位置推断时间,在长音频中极不可靠。
    3. 数据割裂:不同音频任务(ASR、字幕、推理)依赖不同粒度的声学抽象,现有数据构建常采用固定窗口切割,破坏了完整声学事件,且缺乏统一的多分支标注与融合机制。

3. 核心方法

  • 提出框架:MOSS-Audio,采用“音频编码器-模态适配器-大语言模型”架构,发布了4B和8B两种规模,并分别提供Instruct(指令执行)和Thinking(深度推理)两种配置。
  • 关键创新点
    1. DeepStack 跨层特征注入:不只用编码器最后一层,而是将编码器中间层的特征提取出来,通过Merge Adapter注入到LLM的浅层。直觉上,这就像给大脑同时提供“底层感官细节”(如音色、节奏)和“高层语义概念”(如词汇、旋律),打破了单一特征层的信息瓶颈。
    2. 显式时间标记:在音频特征序列中,每隔2秒(对应25个12.5Hz的音频token)插入一个表示耗时的数字标记(如<2>, <4>)。这让模型直接“看到”绝对时间流逝,而非自己去猜,极大提升了时间戳转录和时间问答能力。
    3. 事件保留的分支标注管线:摒弃传统的固定时长切分,先通过声音事件检测找到自然边界进行切分,保留完整事件;随后将音频路由到语音、音乐、环境音三个专业分支进行独立标注;最后通过先验路由和约束合成,将多分支结果融合为统一的无幻觉字幕。
    4. 分阶段的后训练范式:区分了Instruct和Thinking两种模型。Thinking模型在SFT后增加了“推理冷启动”(引入思维链数据)和基于DAPO的强化学习阶段,通过动态过滤和奖励优化,让模型学会基于音频证据进行紧凑推理,而非输出冗长的废话。

4. 实验与结果

  • 数据集/基准
  • 通用音频理解:MMAU, MMAU-Pro, MMAR, MMSU
  • 语音字幕:自建的2000样本13维度评测集
  • ASR:涵盖健康、方言、歌声、噪声等12个维度的测试集
  • 时间戳ASR:AISHELL-1 (zh), LibriSpeech (en)
  • 基线方法:GPT4o-Audio, Gemini-3/3.1-Pro, Qwen2.5/3-Omni, Step-Audio, Kimi-Audio, Audio Flamingo系列等主流开源与闭源模型。
  • 主要结果
  • 通用音频理解:MOSS-Audio-8B-Thinking 取得 71.08 的平均分,在开源模型中排名第一,甚至超越了30B规模的Step-Audio-R1和Qwen3-Omni-30B。
  • 语音字幕:MOSS-Audio-8B-Instruct 平均分 3.725,超越所有对比模型(包括闭源的 Gemini-3.1-Pro),在口音、音高、情绪等细粒度描述上优势明显。
  • ASR:MOSS-Audio-8B-Instruct 在12维度平均CER为 11.30,优于Qwen3-Omni-30B的11.39。
  • 时间戳ASR:MOSS-Audio-8B-Instruct 在英文和中文上的时间偏移(AAS)仅为 131.61ms 和 35.77ms,远优于Qwen3-Omni(646.95ms/833.66ms)和Gemini-3.1-Pro(871.19ms/708.24ms)。
  • 消融实验/训练动态揭示
  • 强化学习(DAPO)动态表明:随着训练进行,模型解决简单问题的 rollout 会被动态过滤(奖励方差为0),迫使模型在困难样本上学习;同时,模型回复长度并未随奖励上升而无限膨胀,而是稳定在250-270 tokens,说明模型学会了“紧凑且有效”的推理,减少了幻觉。

5. 优势与局限

  • 主要优势
    1. 架构与任务的统一性:单一模型同时兼顾了细粒度的感知(ASR、时间戳定位)和高层次的认知(音频推理、字幕生成),打破了以往感知与推理难以兼得的困境。
    2. 卓越的时间感知能力:显式时间标记的引入带来了颠覆性的时间定位精度提升,将误差从数百毫秒级降至几十毫秒级。
    3. 高效且高质量的数据引擎:事件保留切分+多分支融合标注,从源头保证了预训练数据的声学完整性和语义丰富性。
  • 局限性
    1. 缺乏语音生成能力:论文明确指出该模型是“理解核心”,目前仅输出文本,无法直接生成或克隆语音,需外接TTS系统才能构成完整的语音交互闭环。
    2. 数据管线的复杂性:多分支标注、LLM融合与校验、强制对齐等流程极其繁复,复现成本高,且严重依赖一系列上游模型(ASR ensemble, SED, LLM judge等)的准确性。
    3. Thinking模式的推理边界:虽然RL让模型学会了紧凑推理,但论文未深入探讨在极长音频(如小时级)或极度嘈杂重叠音频下,显式2秒时间标记和推理范式的鲁棒性。

6. 关键结论与启发

  • 最重要的 takeaway:一个强大的统一音频模型,必须打破“ASR编码器只管转写、LLM只管推理”的割裂,通过跨层特征注入保留多粒度声学细节,并通过显式时间标记赋予模型绝对时间感,这是实现精准感知与深度推理统一的基石。
  • 对后续研究的启发
    1. 架构层面:DeepStack 在音频模态的成功验证了“浅层对齐细节、深层对齐语义”的跨模态注入策略的普适性,未来可进一步探索动态选择注入层或跨模态注意力机制。
    2. 数据层面:事件保留切分和“先分治后融合”的标注思路,可推广至视频等多模态大模型的数据构建中,避免暴力截断带来的语义断裂。
    3. 智能体延伸:MOSS-Audio 定位为 Voice Agent 的“感知与推理大脑”,后续研究可在此基础上接入工具调用、检索增强(RAG)和流式语音生成,构建端到端的实时语音智能体。