Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models 一、文章主要内容总结该研究聚焦于大型语言模型(LLMs)的多目标对齐问题,核心挑战是解决现有方法依赖人工指定偏好权重、用户负担重且训练效率低的痛点。为此,提出了名为PRO(Preference Orchestrator)的轻量级框架,通过一个偏好适配器自动推断与提示词相关的偏好权重,实现提示词感知的多目标对齐。研究背景:LLMs在文本生成、对话交互等任务中表现突出,但多目标对齐(如兼顾帮助性、安全性、诚实性)仍面临挑战。现有方法(如MORLHF、REWARD SOUPS)需人工设置偏好权重或随机采样权重,导致用户操作复杂、训练资源浪费。核心设计:偏好适配器:以输入提示词为输入,输出多目标的权重向量(满足非负且和为1的约束),无需人工干预。训练机制:利用人类偏好数据中“优选响应”的多维度奖励分数,通过归一化和KL散度损失训练适配器,使其学习提示词与最优偏好权重的映射关系。灵活集成:可作为插件模块与现有多目标对齐方法(如MORLHF、RIC)结合,适配训练阶段和测试阶段的不同需求。理论与实验验证:理论证明:在满足奖励函数连续性、目标强凸性等假设下,PRO的自适应权重机制比固定权重方法的对齐差距更小,且数据量足够时可接近最优性能。实验结果:在Reddit Summary、Helpful Assistant、Ultrafeedback等数据集上,P