微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 当机器翻译遇到最后一道难题:一个"越翻越简单"的悖论

当机器翻译遇到最后一道难题:一个"越翻越简单"的悖论

2026-09-28 11:09
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-09-28 11:09 • 科技行者

2018年,微软发了一篇论文,标题挺唬人:《在中英新闻翻译上实现人类平等》。意思是说,他们的机器翻译已经和专业译者翻得一样好了。

这话听起来是个好消息。可如果你去问一个真正用过翻译软件的人,他大概率会告诉你:不对啊,机翻还是经常翻车。

这就是一个挺拧巴的事实:论文说机器翻译已经"达到人类水平"了,但普通用户还是觉得它不靠谱。到底是论文吹牛,还是用户矫情?

都不是。问题出在我们评价翻译好坏的方式上,已经失灵了。

一、测试题太简单,学生怎么可能考不好

想象一下,如果你给一个能考上清华的学生,反复用小学数学题考他,他次次满分,你能说他"数学能力达到顶尖水平"吗?

这其实就是当前翻译测试集正在发生的事。

**标准翻译测试集正在快速饱和,这是本文开篇就点出的核心矛盾。**

饱和*:指某个测试的难度已经跟不上被测对象的能力,导致几乎所有强模型都能拿到接近满分,测试因此失去区分度。

现在的翻译模型太强了,那些精心准备的新闻类测试集,对它们来说已经不构成真正的挑战。测试打不出区分度,自然也就没法告诉我们哪个模型更好,更没法告诉我们模型到底还差在哪里。

有人想到一个办法:干脆人工构造一些刁钻的句子,或者用算法自动搜索容易让模型翻车的输入,专门用来"为难"模型。这个思路听起来合理,但论文里指出了一个致命缺陷:这些人为制造的"刁钻句子"往往不自然,不是人们真实会说、会写的话。你测出来的失败,可能只是一种脱离实际场景的"人造陷阱",对改进真实翻译体验帮助有限。

二、打分本身,可能比翻译本身更难

即便你找到了真正困难的句子,还有第二个坑等着你:怎么给翻译结果打分?

现在主流有三条路:

第一条是老办法,像ChrF、BLEU这类,靠比对翻译结果和参考答案的文字重合度打分。

ChrF/BLEU*:基于字符或词语重叠度计算的自动翻译评分指标,是翻译领域最早也是使用最广的自动评估方法。

问题是,翻译从来不是只有一个正确答案的填空题。同一句话,十个译者能给出十种合格的译法,只看重合度,就是在用"你和标准答案长得像不像"来评判"你翻得对不对"。当模型翻译质量越来越接近参考翻译的水平,这种粗暴比对反而越来越不靠谱。

第二条路是训练出来的神经网络评分模型,比如Comet,或者让另一个大语言模型来当裁判。

LLM-as-a-judge*:让一个大语言模型扮演裁判角色,阅读原文和译文后直接打分或做判断,是近年流行的自动评估方式。

这条路听起来智能多了,但论文指出了一个更深的悖论:要准确评判一份高质量翻译的好坏,评判者本身得具备相当高的翻译水平才行。可这些当裁判的LLM,恰恰也是被测试的翻译模型本身,或者和它们能力相近。让一个模型去当自己或者同类的裁判,它很可能连错误在哪儿都看不出来,因为它自己就会犯同样的错。

打个比方,如果让一个刚学会做菜的人去评判另一道菜咸淡合不合适,他大概率尝不出问题,因为他自己掌勺时可能也是这个咸淡。真正能挑出毛病的,得是一个更资深的老饕。可现实是,我们手头最好的裁判,恰恰就是这些正在被考核的模型自己。

第三条路是回归人工评估这个"金标准"。但人工评估同样有硬伤:不同批次的评审员打分标准不统一,今天打85分的翻译换一批人可能只给70分;人工评估贵,请专业译者逐句打分成本很高;而且每次有新模型出现,为了公平比较,之前所有模型都得重新拉出来评一遍,这笔账越滚越大。

论文里还举了个特别扎心的例子:Comet QE 22这个自动指标,对绝大多数翻译的打分都挤在60%到80%这个区间里,而人类打分理论上是0%到100%全域分布的。这就好比一把尺子,理论刻度是0到100厘米,但实际上你量什么东西它都显示在60到80厘米之间,这把尺子的辨识力显然出了问题。

三、把测试出题权交给全世界的用户

面对这两个难题,这篇论文的思路挺有意思:既然专家关起门来设计的测试题已经不够用了,那就把出题的权力开放给所有真正在用不同语言生活、工作的人。

这就是论文提出的Last Translation Benchmark(简称LTB,最后翻译基准)的核心想法。

LTB*:一个持续滚动更新的众包翻译难题数据集,收录人类撰写并经过同行评审的翻译难题案例,涵盖文本、图片、音频、视频等多种形式。

这个名字本身带点自嘲和幽默,论文里也承认,"Last"这个词是种夸张修辞,灵感来自于现有的翻译基准大多已经饱和,没法再可靠地指导后续研究了。

具体怎么做的?研究团队搭建了一个在线平台,任何人都可以注册上去,提交一个自己认为"机器翻不好"的句子、图片、音频或者视频。提交者先给出源文本,再亲自写一份"完美翻译"作为参考答案。接着,平台会自动调用多个主流翻译模型(比如谷歌翻译、Gemini、GPT系列等)对这段内容进行翻译,提交者可以实时看到这些模型翻出来的结果。

看着这些五花八门的翻译结果,提交者就能一眼发现:哦,原来大家都在这个地方翻车了。基于这个观察,提交者要写出"验证规则",清清楚楚地指出这处翻译错误具体是什么样的。

验证规则*:针对某个具体翻译难题手工撰写的判定标准,用来描述"什么样的翻译才算合格",可以被后续的AI裁判自动检验。

为了确保这道题目"真的难",系统要求:提交平台上展示的十个自动翻译结果里,至少有八个必须没通过验证规则的检验,同时提交者自己写的人工翻译必须能通过。这个双重门槛保证了收录进来的题目既是模型翻不好的,又是人类能翻好的,不是无理取闹式的刁钻。

提交完之后,还有一道同行评审关卡。每份提交会被另一位精通相关语言的贡献者审核,确认题目公平合理、错误确实明显、验证规则写得站得住脚,才能最终被收录进数据集。

这套流程听起来挺繁琐,但恰恰是这份繁琐,保证了收录进LTB的每一道题,都是真实存在过、有血有肉的翻译陷阱,而不是实验室里凭空想象出来的语言学难题。

**这种思路很像小区里居民自发组织的"路口盲区排查",专业交通规划部门可能因为设计思路先入为主,漏掉一些真正在生活中让司机困惑的路口,而天天开车经过那里的居民,反而能一眼指出"这个转弯处视线被树挡住了"这种活生生的问题。**

如果只靠语言学家闭门造车去设计测试题,他们会先形成一套关于"什么难"的假设,然后按照假设去构造例子。这个路子有个天然局限:假设之外的难点,根本无从发现。LTB反过来,先收集真实世界里让人挠头的例子,再从这些例子里归纳出"到底哪里难"的规律。这是一种从现象到理论的反向操作,恰恰弥补了传统方法"先射箭后画靶"的盲区。

四、判卷标准从"打分"变成"打勾"

光有难题还不够,LTB真正的创新,其实是评判方式本身。

传统的评分体系,不管是自动指标还是人工评审,给出的都是一个模糊的百分比数字。85分和90分之间到底差在哪里,没人说得清楚。

LTB干脆换了个思路:每道题目配一套或几条验证规则,一份翻译要么全部通过所有规则,判定为"过",要么只要有一条没过,就判定为"不过"。

论文里举的第一个例子特别典型。原文是"两位新护士打破了男子100米世界纪录",这句话里"护士"在英文里没有性别标记,但翻成捷克语时,护士这个词天然带阴性词尾。谷歌翻译、Gemini、GPT-5.6全都翻成了"女护士",忽略了上下文明明说这是"男子"的事实。只有人工翻译正确地选用了阳性形式的表达。

这道题的验证规则写得极其具体:"护士"一词不应该译成暗示女性的词形,因为上下文清楚说明这些护士是男性。用这条规则去检验,结果一目了然:所有AI模型都是0分,人工翻译是100分。没有模糊地带,没有"85分还是90分"的争论。

对照组是论文里的第二个例子,一段普通的赛马评论翻译。各家模型的得分从70%到100%不等,评分理由无非是"用词略有生硬"这种主观偏好式的评语。这类翻译本身没有硬伤,评分的差异更多反映的是评委个人的品味,而不是翻译对错。论文用这两个例子的对比,清楚地展示了什么叫"有效的困难",什么叫"无意义的噪音"。

为什么"打勾"式评判更靠谱?论文里做了一个特别巧妙的实验来验证这一点。研究者让翻译模型在生成译文的同时,提前看到验证规则,结果发现翻译质量大幅提升,通过率从7.2%直接跳到89.8%。

这说明了什么?说明这些模型不是学不会满足这些规则,而是压根不知道自己应该往这个方向去注意。

**这就像一场考试,如果你提前告诉学生"这道题要考的是勾股定理的逆用",学生原本可能压根没往这个方向想,一旦点破,他大概率能做对。但如果不告诉他考点,他可能会在完全不相关的方向上瞎琢磨,最后交白卷。**

验证规则的存在,恰恰给评判者(不管是人还是AI)提供了一种"生成者"没有的特权信息,即精确知道要去检查什么。这就打破了"评判翻译的能力等同于翻译能力本身"这个死循环,让即便水平不够高的裁判,也能借助规则精准挑出错误。

那能不能让模型自己生成验证规则,自己给自己出题、自己找漏洞呢?论文也试了,结果只带来了小幅提升,从7.2%涨到12.9%,远远达不到看到人工规则时89.8%的水平。原因也很直白:生成一条好规则,本身需要先知道"隐藏答案"是什么,这跟翻对这道题一样难,甚至更难。

五、这套"打勾"体系真的公平吗

一个自然的疑问是:让AI来当裁判判断"是否通过验证规则",这个裁判本身靠不靠谱?会不会存在"我用同一个模型既当运动员又当裁判"这种自己给自己开绿灯的情况?

论文专门做了一组实验来检验这一点,方法是测量"自我偏好偏差"。

自我偏好偏差*:指一个AI模型作为评判者时,倾向于给自己生成的翻译结果打更高的分,而这种偏爱和其他独立评判者的看法不一致。

结果很说明问题。当用传统的"通用裁判打分"方式时,几乎所有模型都表现出明显的自夸倾向,比如Gemma 4自己给自己打分,比其他模型给它打的分平均高出28.2%。但换成"验证规则打勾"这套体系后,同样是Gemma 4,这个自夸幅度骤降到8.9%。

论文对此的解释是,验证规则提供的是相对客观的判定标准,不太容易被模型的个人偏好左右,就像一条规则写着"护士不能翻成阴性词形",这是个能直接核对的事实判断,不太容易被自我偏爱"曲解"成有利于自己的方向。

另外一个让人意外的发现是,不同AI裁判之间对"打勾"结果的排名高度一致,论文用肯德尔相关系数衡量,验证规则打分方式在不同裁判之间的一致性达到86.9%,远高于通用裁判打分的71.3%和自动化指标的35.1%。换句话说,不管你换哪个AI来当裁判,只要规则写得清楚,判定结果都差不多,这才是一个真正靠谱的评价体系该有的样子。

**这就好比一场体操比赛,如果裁判打分靠的是"我觉得这个动作优美不优美"这种主观印象,不同裁判打出来的分数天差地别是常态;但如果裁判手里有一份清清楚楚的动作难度系数表,规定"翻腾两周半没做到位就扣0.5分",不同裁判核对完之后,给出的分数自然会高度趋同。**

这个类比揭示的正是LTB评估设计的核心逻辑:主观印象式打分注定不稳定,而基于清晰、可核验规则的判定,才能让评价结果真正跨越裁判个体的差异,变得可复现、可信赖。

六、目前的模型到底翻得怎么样

数据说话最直接。LTBv1这个版本收录了3456道被接受的例子,覆盖109种语言。论文对29个模型做了系统性测试,结果相当扎心。

排在第一的Gemini 3.1 Pro,用不同AI裁判做检验,通过率也只在37%到44%之间徘徊。第二名GPT-5.6 Sol,通过率进一步下降到28%到36%。往下排,大多数模型的通过率都在个位数到十几之间,像老牌的谷歌翻译只有1.1%到3.7%。

对比一下,人类提交的参考翻译,通过率高达90%到99.9%。这个差距不是小打小闹,而是断崖式的。

但如果你只看"通用裁判打分"这一列,画风完全变了。同样是这些模型,用通用裁判打分,几乎所有模型都能拿到70%到90%之间的"良好"评级。论文里引用的评分标准写得清楚,65%到80%意味着"近乎完整的信息传递,只有轻微的不自然之处,需要轻度校对"。

也就是说,同一批翻译结果,用验证规则一测,惨不忍睹;换成通用打分,个个良好。这个巨大的反差恰恰印证了论文的核心论点:传统评价体系正在系统性地掩盖模型的真实短板。

七、什么样的句子最让AI犯难

这篇论文最有意思的部分,或许不是分数本身,而是背后梳理出的一整套"翻译难点分类法"。

研究团队请两位语言学家先手工标注了一批例子,归纳出难点类型,再用AI把这套分类扩展到全部数据集上。

最大的一类难点叫"语义相关",包含一词多义、搭配、语气保持等具体子类。论文举了个特别生动的例子:一篇学术论文摘要里出现"submit your paper",这里的paper明明是指"论文",但几乎所有模型都把它翻成了德语里表示"一张纸"的Papier,而不是表示"文章"的Artikel。这暴露的是模型对特定语境下词义选择的把握不准。

另一类叫"非单语性差异",涉及不同语言之间的接口问题,比如假朋友词(长得像但意思不同的词)、需要把一个词展开成一个短语才能表达清楚的情况。论文里给出的豪萨语例子很典型:"marka-marka"这个叠词本意是表达"倾盆大雨、持续不断",但因为它和英语单词mark长得像,谷歌翻译直接把它当成了同形词,翻成了风马牛不相及的"这个季节被标记了"。

第三大类是"非组合性表达",简单说就是不能靠字面意思拼凑出整体含义的语言现象,包括隐喻、双关语、诗歌、拟声词,甚至还有需要推理才能理解的"元推理"类句子。论文里举了个泰语的例子,一段配图带谐音双关的笑话,靠着改变声调把"大象"变成"胖乎乎的",几乎所有模型都翻丢了这个巧妙的双关。人类翻译者用英语里"elefat"(把elephant和fat捏在一起)来对应这个双关的巧思,而AI要么翻成"Elephant? Chunky!"要么直接翻丢了整个笑点。

**这就像给一个只会查字典的翻译新手一份英文脱口秀剧本,里面全是谐音梗和文化梗。他能一个字一个字地翻对,却翻不出那种"啊,这里有个包袱"的会心一笑。字典给不了他这种敏感度,只有真正泡在这门语言的文化里,反复听过类似的笑话,才能练出这种直觉。**

除了语言学层面的难点,论文还归纳了"超语言"类难点,主要涉及文化知识、社交惯例、网络流行语等,这些东西压根不在字典里,得靠"活在这门语言的文化里"才能掌握。论文举了个韩语例子:在水果摊上,顾客称呼陌生老板娘"???"(奶奶),这是韩语文化里对年长陌生人表达尊重的惯用称呼,但翻成英文时,几乎所有模型都直译成了"Grandma",硬生生把陌生的买卖关系翻成了亲属关系。

还有一类叫"约束条件",比如要求译文长度不能超过20个字符,或者要求译文必须保持"无元音"这种游戏规则式的怪癖限制。这类题目虽然罕见,但恰恰反映了翻译在实际应用场景里经常遇到的硬性格式要求,比如字幕翻译的长度限制。

最后还有一类叫"模型阻断项",指的不是翻译难度本身的问题,而是模型出现了拒绝作答、输出不相关内容、翻译不完整、把提示词当成指令执行等"翻车但不是因为难"的情况。比如论文里一个梵扎韦语(Sandawe)翻阿拉伯语的极简单句子"你叫什么名字",Claude Haiku 4.5直接拒绝作答,理由是"建议咨询坦桑尼亚的语言专家",而这门语言其实并不特别复杂,只是资源稀缺,模型压根没学过。

八、人工翻译真的更好,还是只是自说自话

有个挺尖锐的疑问:既然验证规则是提交者自己写的,那人工翻译天然就是按照自己写的规则设计的,这样的高分是不是有点"既当裁判又当运动员"的嫌疑?

论文对此做了一次独立的小规模人工复核,请了22位精通对应语言的评审员,用对比式错误标注法(cESA)对317个例子重新打分。这个方法的巧妙之处在于,评审先在不知道验证规则的情况下打一轮分,再看到规则之后重新打一轮分。

结果显示,人工翻译在两轮打分里都稳居榜首,这跟验证规则给出的排名基本吻合,但和通用裁判、自动化指标给出的排名并不一致。更有意思的一个细节是:在评审员不知道验证规则时,人类翻译和第二名模型之间的差距相对较小;但一旦评审看到规则,这个差距明显拉大了。

这说明什么?说明评审员在没有提示的情况下,可能压根没意识到某个细微差别是个问题,一旦点破,才恍然大悟原来这里藏着个坑。这恰恰再次印证了验证规则的价值,它让原本容易被忽略的失误变得清晰可见。

九、这份榜单会一直更新下去

LTB不是一份一次性交付的静态数据集,而是一个持续滚动收集的"活"基准。论文里明确说,LTBv1收录的是2026年9月1日之前被接受的提交,未来还会随着新数据的持续收集不断发布新版本。

这个设计本身也回应了机器翻译评测领域的一个老大难问题:一旦某个测试集发布,模型厂商很快就会针对它做优化,甚至不排除测试数据混进训练集这种"数据污染"的可能。论文里提到,平台上展示给贡献者看的模型列表会持续更新,确保基准始终保持挑战性,数据也不会被提前"泄题"。

论文里还有一个挺有意思的延伸实验,叫作跨语言迁移。研究者尝试把已有的翻译难题从一种目标语言迁移到另一种目标语言,比如把"印地语翻英语"的题目改造成"印地语翻捷克语"。核心想法是:如果一个印地语习语难倒了模型翻成英语,那它大概率也会难倒模型翻成法语,因为问题根源在于模型没理解这个习语本身,跟目标语言是哪个关系不大。

实验发现,大约48%的题目能通过自动筛选,但人工复核后,真正能被判定为"合格"的比例是64.1%。失败的主要原因是验证规则在新语言环境下不再适用,比如原本测试印地语某个特定亲属称谓翻译是否准确的规则,迁移到不区分这类称谓细节的德语场景下就失去了意义。

论文观察到一个规律:难点根源在原文语言里的题目(比如需要理解某个习语、双关语的题目)迁移成功率高,因为不管目标语言换成什么,模型没理解原文这件事本身不会变;但难点根源在原目标语言的题目(比如涉及某种语法性别系统的规则)就很难迁移,因为换一种目标语言,这个语法特性可能压根不存在。

写在后面

读完这篇论文,我最先想到的是一个很朴素的问题:我们到底该怎么定义"翻译得好"这件事?

论文里那道护士性别的题目让我愣了一下。这道题看起来极其简单,一句话,一个词的性别选择,任何一个学过基础语法的人都能反应过来。可几乎所有最先进的模型全军覆没。这说明的不是模型笨,而是模型在处理这类"需要结合上下文推翻默认假设"的情况时,存在一种系统性的惯性,它太容易依赖词汇本身自带的语法性别标记,而忽略了句子明确给出的反证信息。

还有一个细节让我印象很深:论文里提到,让模型自己生成验证规则时,效果远不如直接给它人工写好的规则。这背后其实藏着一个更本质的问题,那就是发现问题和解决问题,有时候是两种完全不同的能力。一个模型可能具备纠正某个错误的能力,但它压根意识不到自己需要纠正这个错误。这跟人类学习里"元认知"的概念很像,知道自己不知道什么,本身就是一种独立的技能,而不是知识量堆出来的副产品。

这让我忍不住想,如果把这套"验证规则打勾"的思路搬到其他领域会怎样,比如代码审查、法律文书起草,是不是也存在类似的困境:通用打分容易失真,而针对具体错误的清单式核查反而更靠谱?

论文里那个跨语言迁移的小实验也值得多想一层。48%的自动筛选通过率背后,其实暗示了一件事:有些"难点"是语言本身的属性,跟着句子走到哪个目标语言都一样难;而另一些"难点"只是碰巧撞上了某种语言的语法特性,换个目标语言这道题可能压根不成立。这提醒我们,翻译的难度从来不是单一维度的,它至少要拆成"源语言难度"和"目标语言难度"两层来看,而这两层可能各自需要完全不同的应对策略。

如果三年后有人跟进这套体系,继续给LTB添加新题目,那些今天让最强模型集体翻车的例子,到时候还会难吗?

Q&A

Q1:Last Translation Benchmark是什么?

A:它是一个由全球贡献者众包收集的翻译难题数据集,收录人类撰写并经过同行评审的例子,涵盖文本、图片、音频、视频,专门用来测试当前最先进翻译模型的失败案例。

Q2:为什么传统翻译评测方法不可靠了?

A:因为标准测试集已经趋于饱和,强模型几乎都能拿高分,失去区分度;而自动指标和AI裁判又容易受自我偏好偏差影响,评分标准也常常模糊不清,无法准确反映真实翻译质量。

Q3:验证规则打勾这套评测方式比传统打分好在哪?

A:验证规则针对具体错误设定清晰的通过/不通过标准,不同AI裁判之间判定结果高度一致,自我偏好偏差也远低于传统打分方式,能更客观地暴露模型真实短板。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-