1 模型背景与动机
1.1 序列到序列预训练的演进
在自然语言处理领域,预训练模型经历了从单向语言模型(如GPT)到双向模型(如BERT)的演进。BART(Bidirectional and Auto-Regressive Transformer)首次将去噪自编码器与自回归解码器结合,统一了掩码语言模型和自回归语言模型的优势。然而,BART仅针对单一语言(英语)设计,限制了其跨语言迁移能力。
1.2 多语言预训练的需求
随着全球化应用场景的增多,机器翻译、跨语言信息检索等任务迫切需要能够同时处理多种语言的通用模型。传统方法需为每对语言单独训练模型,成本高昂且难以覆盖低资源语言。多语言预训练模型通过共享参数学习跨语言表示,显著降低了资源开销。
2 架构设计
2.1 编码器-解码器结构
mBART采用标准的Transformer编码器-解码器架构。编码器将输入序列映射为上下文表示,解码器以自回归方式生成目标序列。编码器与解码器均为12层(基础版),隐藏维度1024,注意力头16个。与BART不同的是,mBART的编码器与解码器共享部分底层参数以促进跨语言知识迁移。
2.2 词汇表与子词分词
mBART使用SentencePiece子词分词器,构建了涵盖100种语言的统一词汇表,大小为250,000 token。该词汇表通过BPE(Byte Pair Encoding)算法从多语料库中学习,确保各语言字符的均衡表示。统一词汇表使得不同语言的文本可在同一嵌入空间中被编码。
2.3 去噪目标函数
mBART的预训练目标是在编码器输入中加入噪声,然后训练解码器重建原始文本。主要噪声形式包括:
2.3.1 文本掩码(Text Infilling)
随机选择输入序列中一定比例(如35%)的连续片段,将其替换为特殊掩码token [MASK]。解码器需要根据上下文预测被掩码的完整片段。
2.3.2 句子排序(Sentence Ordering)
将文档中的句子顺序随机打乱,模型需学习还原原始排序。此任务增强了模型对篇章级语义结构的理解。
2.3.3 噪声注入策略
除文本掩码与句子排序外,mBART还引入词删除、词替换(替换为随机词)等噪声,构建更复杂的重构任务。噪声比例与类型在训练中动态调整,以提高鲁棒性。
3 训练方法
3.1 多语言语料构建
预训练语料来自CCNet和Wikipedia,涵盖100种语言,总规模超1TB。为确保语言平衡,对高频语言(如英语、中文)进行下采样,对低资源语言进行上采样,保留约500GB的有效数据。语料清洗去除了HTML标签、非自然语言内容及重复片段。
3.2 预训练阶段
模型在256块NVIDIA V100 GPU上训练约2周,使用Adam优化器,学习率预热后线性衰减。批大小约为2048序列,每序列最大长度1024 token。预训练采用混合精度训练,损失函数为交叉熵损失,联合优化编码器与解码器参数。
3.3 微调与迁移学习
预训练后的mBART可针对下游任务微调。对于机器翻译,在平行语料上以标准seq2seq方式训练,解码器输出目标语言文本。对于文本生成任务(如摘要、对话),则直接在目标语言标注数据上微调。微调时保持预训练权重不变,仅更新特定任务层或全部参数。零样本翻译通过直接输入源语言文本并指定目标语言token实现。
4 主要变体与改进
4.1 mBART-50(50语言扩展)
2021年Meta AI发布mBART-50,将语言覆盖从25种扩展至50种,词汇表增大至500,000 token。训练数据新增从CCAligned、ParaCrawl等平行语料提取的伪平行句对。mBART-50在低资源翻译任务上提升了约2-3 BLEU分数。
4.2 mBART-CC(基于常识的增强)
mBART-CC在预训练阶段引入常识推理任务(如关系分类、知识图谱路径预测),增强模型的语义理解能力。该变体在跨语言问答和自然语言推理任务上表现优于原始mBART,但翻译性能提升有限。
4.3 与其他模型的对比(如XLM、M2M-100)
与XLM(2019)相比,mBART采用seq2seq结构而非仅有编码器,更适合生成任务;与M2M-100(2021)相比,mBART采用单方向解码(从左到右)而非多方向解码,参数更少但零样本翻译质量相当。在WMT英德翻译上,mBART-50比同等规模的XLM-R高约1.5 BLEU,但低于M2M-100(因M2M针对性优化了方向性)。
5 应用场景
5.1 机器翻译
5.1.1 低资源语言翻译
在尼泊尔语-英语、拉丁语-英语等低资源对中,mBART通过预训练学到的跨语言知识,仅需数百条平行句对即可获得可用的翻译质量,比传统统计机器翻译提升超过10个BLEU点。
5.1.2 零样本翻译
无需任何双语数据,mBART可直接将源语言文本翻译成从未见过的目标语言(如从德语直译成日语)。零样本翻译质量约为有监督训练的70-80%,在相似语系语言对中表现更佳。
5.2 多语言文本生成
mBART可用于跨语言摘要(如将英文新闻摘要生成中文)、多语言对话系统(单模型支持10种语言响应),以及代码切换文本生成。其统一解码器使得输出语言可通过特殊标记灵活控制。
5.3 跨语言理解任务
在XNLI(跨语言自然语言推理)、PAWS-X(跨语言语义相似度)等基准上,mBART微调后的性能接近甚至超过专用跨语言模型XLM-R,表明其编码器具备良好的跨语言语义对齐能力。
6 性能评估与基准
6.1 WMT翻译任务表现
在WMT 2019英-德、英-法翻译任务中,mBART(大型)分别达到32.0和41.7 BLEU,高于同期最强的Transformer (big) 约1.5 BLEU。在低资源语言对(如英-罗马尼亚语)上,mBART比基线模型提升5-8 BLEU。
6.2 零样本翻译质量分析
在Europarl多语言语料上,mBART的零样本翻译BLEU值分布在20-35之间,其中罗曼语族之间(如西-意)接近30,跨语系(如德-中)降至15左右。错误类型集中于词汇选择错误和句法扭曲,但整体可理解性优于基于回译的方法。
6.3 资源消耗与部署考量
mBART大型模型参数量约680M,单次推理需约2GB显存(FP16)。推理速度在V100上约为每秒2000字符(英-德),适合服务端部署。mBART-50模型参数量增至1.2B,推理时间增加约40%,需GPU集群支持。
7 局限性及后续发展
7.1 词表大小与语言覆盖
统一词表虽降低存储开销,但导致罕见语种(如斯瓦希里语、祖鲁语)的词表覆盖不足,子词碎片化严重。mBART-50的词表扩充部分缓解了该问题,但对极低资源语言仍存在表示稀疏。
7.2 对罕见语言的泛化能力
预训练阶段数据量差异导致模型对高频语言(英、中)偏置明显,罕见语言翻译时易混入高频语言词汇。此外,mBART无法处理完全未在预训练中出现的语言。
7.3 与大型语言模型(如GPT、LLaMA)的关系
随着GPT-3、LLaMA等大规模自回归模型(参数超100B)兴起,mBART在翻译质量上已被超越。但mBART的编解码器架构在需要精确控制输入输出对应关系的任务(如交互式翻译)中仍具优势。后续工作(如NLLB-200)延续了mBART的多语言思路,通过扩大语言数量(至200种)和数据增强,重新确立其在低资源翻译领域的地位。