
文章核心总结与创新点主要内容本文聚焦大型语言模型(LLMs)与全球多元人类价值观的对齐挑战,提出了一种基于伦理推理的新型范式。该范式灵感源自成熟的伦理决策模型,通过结构化的五步法(情境事实收集、层级社会规范识别、备选方案生成、多视角伦理影响分析、反思优化),引导LLMs从快速直觉式的System-1思维转向审慎深思的System-2伦理推理,以解决现有对齐方法存在的表面合规、缺乏文化敏感性和可解释性等问题。研究通过SafeWorld基准数据集(覆盖50个国家、493个地区的多元伦理场景)进行验证,对比传统零样本模型、思维链(CoT)提示和二元道德理论(TDM)等基线方法,证明所提框架在社会规范识别准确率(Sₙₒᵣₘ)和价值观对齐得分(Sₐₗᵢₙ)上均显著提升,且适用于开源/闭源、推理型/非推理型等不同类型LLMs。框架可通过提示工程(快速部署)或有监督微调(SFT,深度嵌入)两种方式实现,兼顾灵活性与实用性。创新点跨学科伦理推理范式:首次从应用伦理学视角出发,整合波特箱模型、马克库拉伦理框架等四种经典人类伦理决策模型的核心要素,设计了专为LLMs量身定制的五步法结构化推理流程,推动模型从表面合规转向深度伦理 deliberation。多维度伦理理论融合:创新性地将义务论、公共善、功利主义和正义论四种互补伦理理论作为分析透镜,实现对伦理影响的全面评估,平衡规则遵守、社区福祉、结果最优和公平性,适配不同文化语境的价值差异。双轨实现与泛化能力/