语码转换(code-switching),指说话人在同一段对话——常常是同一句话——里混用两种语言。香港的上班族一句话里粤语和英语切换好几次;新加坡的一次点餐在英语、马来语和福建话之间轮转;马尼拉的客服电话里,他加禄语每隔一两个从句就嵌进英语产品词。
这不是边缘情况。这是亚洲及更广地区数亿人的日常说话方式——而它恰恰是语音 AI 仍在失灵的地方。
模型为什么在混合语音上翻车
语音识别和语音系统主要用单语数据训练,因为规模化存在的只有单语数据。面对混合语音,它们以可预测的方式失败:
- 语言识别切换太慢。 模型认定了一种语言,把嵌入的另一种语言的词碾碎;
- 借词被”纠正”。 粤语句子里的英文产品名,被输出成一个发音相近但毫无意义的粤语词;
- 切换点本身就是难点。 准确率恰恰在语言边界上崩塌——而名字、数字、产品词偏偏就坐在边界上。
对任何服务多语言市场的产品——语音助手、客服机器人、车载语音、听写——这些失败落在整句话里最值钱的那些词上。
为什么这数据爬不到、也造不出来
显而易见的办法都行不通:
- 公开网络上没有。 广播和播客语音都被剪辑成单语标准形态;自然的混合语音活在不被发布的对话里;
- 合成在长尾上塌方。 TTS 生成的语码转换继承了模型本来就有的边界错误,拿它训练等于强化失败。研究界在做 TTS 增强路线,恰恰因为真实数据稀缺——增强能拉伸真实数据,替代不了它;
- 随手众包做不出来。 自然的混合语音需要真正的双语者,按语域和场景做简报、按技术规格录制——不是零工在嘈杂房间里念提示词。
只剩一条路:由真正的双语说话人,按规格录制——受控场景(客服、点餐、导航)、均衡的说话人构成、限定环境,以及覆盖 AI 训练用途的书面同意。
好的语码转换数据长什么样
一个生产级批次会规定:语言对与切换方式(句内/句间)、场景与语域、说话人按性别/年龄段/地区口音配比、音频格式(16–48 kHz、声道分离)、环境配比,以及精确到说话人 ID 和批次 ID 的逐条元数据。转写要用标记切换点的规范——把混说抹平的转写,毁掉的恰恰是模型最需要的信号。
把可用语料和噪音区分开的,是这套规格纪律,不是话筒。这也是为什么这类数据被下一代多语言语音系统的团队盯着:语言难找、说话人难合格、QA 要在成千上万条录音上撑住。
这是我们面向 AI 团队的语言数据工作的核心线之一——粤英、普英语码转换音频,以生产级规模录制与验证,同意与来源文档齐备、可支撑 AI 监管的文档化要求。语音 AI 背后的人力生产线怎么跑,见和你对话的 AI 是被人训练出来的;文本侧的质量层,见怎么评估 AI 翻译质量。