ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

WarriorMath: Enhancing the Mathematical Ability of Large Language Models with a Defect-aware Fram...

WarriorMath: Enhancing the Mathematical Ability of Large Language Models with a Defect-aware Fram... 文章主要内容总结研究背景:大型语言模型(LLMs)在数学问题解决上表现出色,但受限于高质量、多样化训练数据的获取。现有方法通过重述或难度递进扩充数据集,却忽视了LLMs的特定缺陷,导致生成的问题多为模型已能解决的,提升有限。核心方法:提出WarriorMath框架,整合缺陷感知数据合成与渐进式训练:缺陷感知数据合成:由多个专家LLM组成“考试委员会”,协作生成、评价和优化数学问题。仅保留基础模型无法解决的题目,通过专家反馈迭代改进,生成针对性训练数据。渐进式训练:先通过监督微调(SFT)让模型吸收专家知识,再识别模型仍答错的问题,针对这些案例优化模型对优质解答的偏好,迭代提升以修正固有缺陷。实验结果:在6个数学基准测试(如AIME 2024/2025、AMC 2023等)上,WarriorMath平均超越强基线12.57%,达到最先进水平(SOTA),验证了缺陷感知、多专家框架的有效性。创新点提出缺陷感知数据合成管道:从零生成针对基础模型的高质量数据,遵循“因材施教”的教育理念。设计渐进式学习框架:先广泛学习专家知识,再通过迭代优化聚焦模型薄弱点,强化未掌握
返回列表