DART: Difficulty-Adaptive Reasoning Truncation for Efficient Large Language Models 一、文章主要内容总结本文针对大型语言模型(LLMs)链式思维(CoT)推理中存在的“一刀切”问题——无论问题难度如何均生成固定长度(常为过长)的推理链,导致计算冗余和效率低下,提出了一种名为DART(Difficulty-Adaptive Reasoning Truncation)的监督学习框架。该框架核心目标是让LLMs根据问题难度动态调整推理长度,在保证准确性的同时提升计算效率。DART的核心流程分为四步:推理蒸馏(Distilling Short CoTs):从强教师模型中提取简洁且逻辑正确的短推理链,基于基础模型(如Qwen3系列、DeepSeek-R1)微调得到“短链模型”,与原生支持长推理链的“基础模型”形成推理风格两极;模型融合(Creating a Model Spectrum via Fusion):通过融合系数α对基础模型和短链模型的参数进行线性插值,生成从冗长到简洁的连续推理风格谱(Mₐ),无需额外训练即可覆盖不同长度的推理链;自适应数据筛选(Curating the Adaptive Training Data):对每个问题,自动筛选出能得出正确答案的最短推理链,构建“问题-最优推理链-答案”的自适应训练数据集,实现推理长度与问题难度的精准匹配;自适应训练(Training the Adaptive Model):在筛选后的数据集上微调模型,使其学会“适时停止思考”,自主生成最小充分推理链。