Quality Estimation for Machine Translation
QE 读书笔记 01
Chapter 1: Introduction
本章主要对 QE 的定义、内容进行了梳理。QE 的一个根本特性是 reference-free。它是在没有参考译文的情况下,对系统某个具体输出的质量或可靠性进行预测。且 QE 主要评价的不是 MT 系统整体的质量水平,而是单个具体译文本身的质量。这使得 QE 很适合用于进行对自然语言的翻译质量评价,因为自然语言通常没有唯一的标准答案。并且在实际翻译中,用户不会关心整个系统的翻译质量水平,而是更关心此时他们用来翻译的文本其译文质量。QE 通常以监督机器学习为基础,也就是先人为规定什么是 quality,然后通过 labels 将其具体化。QE 排除了人工文本,只限定于机器译文输出,两者区别在于人工文本的质量评价所需的要素更多。
QE 主要有四种类型:word-level、phrase-level、sentence-level 和 document-level。
- word-level 是将译文中的每个词打上类似于 good/bad 的标签,但也有更具体的标签类型,其核心困难是,对于包含大量单词的大型训练数据集,标签量也非常巨大。
- sentence-level 和 document-level 是以打分的形式评价一段译文,通常在 [0, 1] 之间,分数越高质量越好。要注意的是,对于 document 的质量评价分数不是 sentence 分数的简单聚合,还要考虑 context 的问题。有些在句子层面上得分不高的句子,由于能够使上下文连贯,反而会让篇章层面的分数提高,反之亦然。但针对篇章层面的评价难度更高,因为它的主观性更强,且缺少 discourse-wide information 和人工标注数据,使得最终评分只能算一个估算成果。
- phrase-level 可以看作是 word-level 的变体,差别在于它将 phrase 视作质量评价单元。但作者评价,这种方法已经逐渐过时,因为当前的 MT 系统多采用神经模型,而这种模型是逐词生成译文,而不是逐短语。
本章末尾,作者强调,上述各方法都有各自长处,因此需要结合使用。
END