
XTREME 是什么谷歌 40 种语言 9 大任务跨语言基准测试完全解读【免费下载链接】xtremeXTREME is a benchmark for the evaluation of the cross-lingual generalization ability of pre-trained multilingual models that covers 40 typologically diverse languages and includes nine tasks.项目地址: https://gitcode.com/gh_mirrors/xt/xtremeXTREMECross-lingual TRansfer Evaluation of Multilingual Encoders是由谷歌研究院与 DeepMind 联合提出的跨语言基准测试专门用于评估预训练多语言模型的跨语言泛化能力。这个基准测试覆盖 40 种类型多样的语言横跨 12 大语系并包含 9 个经典自然语言处理任务。无论你是研究多语言 NLP 的学生、工程师还是关注 mBERT、XLM-R 等模型能力的开发者XTREME 都是一份绕不开的跨语言能力体检报告。本文将用通俗易懂的方式为你全面解读这个跨语言基准测试的设计思路、任务构成与上手方法。什么是 XTREME 跨语言基准测试简单来说XTREME 就是一个多语言高考它用统一的题目9 大任务、统一的考生群体预训练多语言模型和统一的评分标准综合得分 Combined Score来衡量一个模型能否把在英语上学到的能力迁移到其他 39 种语言上。在 XTREME 出现之前学界对多语言模型的评测往往是零散的有的只测词性标注有的只测问答语言覆盖也不够多样。XTREME 的贡献在于它把句子分类、结构化预测、句子检索、问答四大范式整合进一个基准并刻意挑选了 Tamil泰米尔语、Swahili斯瓦希里语、Yoruba约鲁巴语等许多被研究得很少的小语种让评测结果更能真实反映模型的通用多语言能力。这个基准测试的研究论文发表于 2020 年对应论文hu2020xtreme其引用信息完整保存在仓库的 README.md 中。XTREME 覆盖的 40 种语言12 大语系一网打尽XTREME 的 40 种语言并非随机挑选而是从维基百科条目最多的前 100 种语言中按语言多样性、任务覆盖度、训练数据可得性三个原则筛选出来的语言代码ISO 639-1包括 af、ar、bg、bn、de、en、es、zh 等常见语言也包含 jv爪哇语、my缅甸语、yo约鲁巴语等稀有语言。这些语言覆盖了 12 大语系印欧语系英语、法语、德语、俄语、印地语等汉藏语系中文、缅甸语亚非语系阿拉伯语、希伯来语、斯瓦希里语等达罗毗荼语系泰米尔语、泰卢固语、马拉雅拉姆语南岛语系印尼语、爪哇语、他加禄语突厥语系土耳其语、哈萨克语乌拉尔语系芬兰语、匈牙利语、爱沙尼亚语以及日语日本语系、格鲁吉亚语卡特维尔语系、泰语壮侗语系、韩语与巴斯克语孤立语言等语言之间的差异越大跨语言迁移的难度就越高评测也越有说服力。语言与任务的对应关系可以在 evaluate.py 的XTREME_TASK2LANGS配置中直接查看。XTREME 的 9 大任务详解四大类别逐一拆解XTREME 的 9 个任务全部来自公开的成熟数据集覆盖了自然语言处理的四大经典范式。下面的表格可以让你一目了然任务类别数据集任务说明涉及语言数句子分类XNLI自然语言推理15句子分类PAWS-X复述/改写识别7结构化预测UD-POS词性标注33结构化预测Wikiannpanx命名实体识别40句子检索BUCC平行句对挖掘4句子检索Tatoeba跨语言句对检索35阅读理解XQuAD抽取式问答11阅读理解MLQA抽取式问答7阅读理解TyDiQA-GoldP抽取式问答9句子分类任务XNLI 与 PAWS-XXNLI跨语言自然语言推理判断一句话是否蕴含、矛盾或中立另一句话考验模型的语义理解能力。PAWS-X跨语言复述识别判断两个句子是否表达相同含义其中的反例由打乱词序自动生成难度更高。结构化预测任务UD-POS 与 Wikiann NERUD-POS基于通用依存关系Universal Dependencies的词性标注任务覆盖 33 种语言考验模型对语法结构的理解。Wikiann NER命名实体识别需要从文本中找出人名、地名、机构名等实体覆盖全部 40 种语言是考验细粒度标记能力的硬骨头。句子检索任务BUCC 与 TatoebaBUCC 2018从可比语料库中找出互译的句子对考验模型是否能把语义映射到共享的向量空间。Tatoeba跨语言句子检索直接比较不同语言句子的向量相似度。有趣的是这两个任务不需要微调直接用预训练模型的表示就能评测。阅读理解问答任务XQuAD、MLQA 与 TyDiQA-GoldP三个问答数据集都采用抽取式问答从段落中抽取答案片段的形式但语言侧重不同XQuAD 覆盖 11 种语言、MLQA 覆盖 7 种、TyDiQA-GoldP 则包含孟加拉语、斯瓦希里语等高难度语言。XTREME 评估方式零样本跨语言迁移XTREME 的核心评估设定是zero-shot零样本跨语言迁移先用英语标注数据微调多语言预训练模型再直接把模型应用到其他语言的测试集上全程不接触目标语言的有监督数据。这带来一个关键设计为了防止模型在实验过程中作弊意外接触到测试集标签仓库在数据预处理时会移除测试集的标签并打乱测试句子的顺序。这一处理逻辑在 utils_preprocess.py 中实现对保证评测公平性至关重要。支持的基线模型包括bert-base-multilingual-cased、xlm-mlm-100-1280和xlm-roberta-large模型实现代码位于 third_party/ 目录如 third_party/bert.py、third_party/xlm_roberta.py。XTREME 快速上手环境安装与数据下载想亲自跑一遍 XTREME 的基线实验整个流程只有三步非常简单。第一步克隆仓库。使用以下命令获取完整代码git clone https://gitcode.com/gh_mirrors/xt/xtreme第二步安装依赖。仓库假设你已安装 Anaconda 与 Python 3.7然后一条命令装齐transformers、seqeval、jieba、kytea、pythainlp、sacremoses等依赖bash install_tools.sh第三步下载数据。先创建download目录手动下载 panxNER数据集放入其中再运行bash scripts/download_data.sh脚本会自动下载 XNLI、PAWS-X、UD-POS、XQuAD、MLQA、TyDiQA、BUCC、Tatoeba 等全部数据集并完成预处理下载逻辑细节可查看 scripts/download_data.sh。一键微调用 train.sh 训练基线模型数据就绪后训练任何任务都只需一个统一入口 scripts/train.sh用法为bash scripts/train.sh [模型] [任务]例如bash scripts/train.sh xlm-roberta-large udpos训练词性标注bash scripts/train.sh bert-base-multilingual-cased xnli训练自然语言推理bash scripts/train.sh xlm-roberta-large xquad训练阅读理解bash scripts/train.sh xlm-roberta-large bucc2018直接评测句子检索每个任务还配有独立脚本如 scripts/train_panx.sh、scripts/train_qa.sh、scripts/train_xnli.sh 等方便你按需查看具体训练参数。如何提交结果到 XTREME 排行榜如果你训练出了满意的模型可以按官方要求提交到 XTREME 排行榜。提交格式非常规范一个文件夹内包含 9 个以任务命名的子文件夹udpos、panx、xnli、pawsx、xquad、mlqa、tydiqa、bucc2018、tatoeba每个子文件夹内是各语言的预测文件命名为test-{语言代码}.{扩展名}问答任务用json其他任务用tsv。仓库的 mock_test_data/predictions 目录给出了完整的示例结构你可以直接参照它组织自己的提交文件。官方评测命令则是python evaluate.py --prediction_folder [预测目录] --label_folder [标签目录]评测逻辑F1、准确率、EM 等指标的计算都集中在 evaluate.py 中。不止于此XTREME-R 与 MultiCheckListXTREME 生态还在持续扩展仓库中还有两个重要补充XTREME-R相比原版新增了 XCOPA因果推理、LaReQA检索式问答、Mewsli-X多语言实体链接等任务进一步提高了语言和任务的覆盖度。MultiCheckList位于 multichecklist/ 目录基于 CheckList 框架用模板自动生成大规模测试用例在50 种语言上对多语言问答模型做系统性行为测试如比较、程度词、属性、职业与国籍等六类理解能力是发现模型隐藏缺陷的利器。总结XTREME 作为极具影响力的跨语言基准测试用 40 种语言、9 大任务、四大 NLP 范式为预训练多语言模型搭建了一个公平、全面、可复现的竞技场。无论你是想验证模型的多语言能力、复现论文基线还是参与排行榜挑战这个仓库都提供了完整的一键式工具链从 install_tools.sh 的环境安装到 scripts/download_data.sh 的数据下载再到 scripts/train.sh 的模型训练和 evaluate.py 的官方评测整个流程开箱即用。现在就动手用 XTREME 给你的多语言模型做一次全面的跨语言体检吧【免费下载链接】xtremeXTREME is a benchmark for the evaluation of the cross-lingual generalization ability of pre-trained multilingual models that covers 40 typologically diverse languages and includes nine tasks.项目地址: https://gitcode.com/gh_mirrors/xt/xtreme创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考