摘要(译文):本文探索用离散扩散语言模型并行精炼整段转录(而非逐 token 自回归)。为 DiffusionGemma(26B MoE,均匀随机 token 离散扩散)训练音频原生接口:冻结 Whisper 编码器提供声学特征,轻量投影映射至嵌入空间,低秩适配让冻结主干关注新模态——仅训练约 4200 万参数(主干的 0.16%)。发现常规训练目标无法锚定音频,用 CTC 损失打破死锁。最终模型在 LibriSpeech test-clean 达 6.6% 词错率,约 8 步并行转录,单适配器支持多语言。
作者:Harsha Vardhan Khurdula 等|发布:2026-07-14|原文:arxiv.org/abs/2607.13013
评论区