大多数在生产中跑 AI 翻译的团队,评估方式都一样:找个懂这门语言的人读几页,说一句”看着还行”。然后某个产品名以三种译法同时上线,或者一条质保条款意思悄悄跑偏,团队才发现——”看着还行”从来不是度量。
评估 AI 翻译质量,是按既定错误框架给产出打分——类别、严重度、评分规则事先约定——让质量变成一个可以跨批次、跨语言、跨引擎比较的数字。没有框架,审校是观点;有了框架,审校是数据。
一套能用的错误框架长什么样
行业基线建立在 MQM/DQF 类别之上。一套实用的工作集:
| 类别 | 抓什么 | 典型严重度 |
|---|---|---|
| 准确性 | 误译、漏译、增译、未译 | 轻微 → 致命 |
| 流畅度 | 语法、拼写、别扭表达 | 轻微 → 严重 |
| 术语 | 违反术语表、产品词不一致 | 严重(受监管内容常为致命) |
| 风格 | 语气、语域、品牌声音不符 | 轻微 → 严重 |
| 地区惯例 | 日期、单位、格式、市场特定要求 | 轻微 → 严重 |
把表格变成体系的是两件事:
严重度加权。 剂量里丢个小数点,和一句话别扭,不是同一种缺陷。每个错误定严重度(轻微/严重/致命),每档配权重,每批次算出千字得分——质量从此可以随时间比较。
事先约定的通过阈值。 一个批次要么过线,要么触发返工。没有阈值,分数只是谈资;有了阈值,分数驱动决策。
用你的框架,还是标准框架?
如果你的团队已有自己的错误类型体系——很多电商和企业团队有——审校伙伴应该原样套用:审校按你的类别与严重度作业,结果按你的格式输出,进你现有的看板。框架本身不如”始终用同一套”的纪律重要。破坏可比性的是中途换框架,不是选了”不对的”那套。
到底要审多少?
对 AI 产出做全量审校,通常会吃掉 AI 翻译本来省下的钱。能落地的做法是深度匹配风险:
- 高风险内容(监管声明、安全文本、法律条款):完整译后编辑,逐字过;
- 面向收入的内容(产品页、campaign):按市场暴露度选完整或轻度译后编辑;
- 高量低风险内容(客服话术、内部文档):抽样 LQA——每批抽出统计上有意义的切片打分,盯趋势。
抽样节奏本身就是质量体系。每周按稳定框架抽 10% 打分的团队,比三个月前全量审过一次的团队,更了解自己的 AI。
哪种配置适合你
- AI 产出直接面向客户、错误有法律或品牌风险 → 完整译后编辑到出版级(ISO 18587 定义了这门学科);
- 产出仅内部使用或低暴露、但必须可理解 → 轻度译后编辑;
- 主要想知道引擎够不够好、错在哪 → 纯 LQA 监控,按抽样节奏打分,不改稿;
- 同时跑多个引擎或内部 AI 方案 → 同一套框架跨引擎执行,是唯一公平的比较方式。
还差一环闭合:修正必须回流。反复出现的术语错误进强制术语表;反复出现的风格偏差进提示词或引擎配置。评估如果从不改变上游,那是记账,不是质量管理。
这正是我们AI 翻译人工审校服务提供的那一层——按基于 MQM/DQF 的框架(或你自己的)做译后编辑与 LQA,深度按风险匹配。同一套评估纪律用在模型而非内容上,就是我们面向 AI 团队的语言数据工作的一部分。至于 AI 翻译现在到底错在哪,见AI 翻译仍会出错的地方。