
文章主要内容总结本文针对藏语作为低资源语言在现有大语言模型中支持不足的问题,提出了一套涵盖数据构建、模型训练与评估的完整方案,旨在提升大语言模型的藏语处理能力。具体内容包括:藏语预训练语料库构建:从开源数据集、大规模网页爬取、合成数据生成、私有数据四大来源收集藏语数据,通过定制化数据清洗与去重流程(包括语言过滤、质量过滤等),最终构建了72GB的高质量藏语语料库,为目前规模最大的藏语预训练数据。模型训练:以多语言模型Qwen2.5-7B-base为基础,通过两阶段持续预训练(语言平衡预训练与长上下文预训练)增强藏语能力,同时扩展词汇表以提升藏语分词效率;后续通过多语言指令微调进一步优化模型的任务适应性,支持藏语、汉语、英语三种语言。评估基准构建:针对藏语标准化评估基准匮乏的问题,通过翻译现有英语基准(如HellaSwag、ARC等)并经母语者校对,构建了4个新的藏语评估基准,结合已有的2个公开基准,形成全面的评估体系。实验结果:所提模型在各类任务中持续且显著优于同规模开源模型和藏语专用模型,部分性能接近更大规模模型,验证了方法的有效性。创新点构建了基础资源:打造了目前最大的高质量藏语预训练语料库,并开发了多个专门针对藏语大语言模型的评估基准,为藏语自然语言处理奠定了基础。