跳到正文
原文
arXiv cs.CL· Moran Yanuka, Raja Giryes, Moris Alper·· 5 小时前AI 评分65

多语言语音模型存在音系干扰导致混合语输入识别率下降

Phonological Interference in Multilingual Speech Models

AI 摘要

该论文指出基于音素的语音模型在处理代码切换(code-switching)或未见过的低资源语言时存在系统性失效,其核心原因是音系干扰(phonological interference)。模型错误地假设输入仅属于单一语言,并强行施加该语言的音系规则,从而覆盖掉与假设语言冲突的局部音素决策。实验显示,在代码切换输入下,两个电话识别器和一个音素条件文本转语音模型的特定音素丢失率高达 32% 至 79%,而共享音素的丢失率则显著较低。

研究者通过探针分析发现,这种干扰源于模型内部激活的低维子空间,该子空间承载了语言估计信息。当在该子空间中向目标语言方向引导时,单语语音会丢失原语言独有音素并产生目标语言独有音素。针对此问题,作者提出了窗口化语言估计(WLE),这是一种推理时的修复方法,用每个位置附近短窗口的计算结果替换模型的全局语言估计。测试表明,WLE 能消除三个模型中 34% 至 69% 的干扰,且在识别器上基本不改变单语性能。

事实层面,该研究量化了多语言语音模型在跨语言场景下的具体性能衰减比例及内部机制;推断层面,这表明当前主流语音模型在复杂真实场景(如双语对话)中的泛化能力受限于单一的隐式语言假设;猜测层面,若 WLE 类方法能推广至更大规模模型,可能成为解决多语言端侧部署中“长尾语言”和“混合语”问题的关键工程手段,但需验证其在实时推理延迟上的开销。

来源:arXiv cs.CL · arxiv.org