
1. 从一次失败的“跑分”说起我们真的在评测AI吗去年我们团队接到了一个需求为几款主流的大语言模型做一个横向评测目标是选出一个最适合我们内部知识库问答场景的模型。一开始大家都觉得这事儿挺简单——不就是“跑个分”嘛。我们迅速搭建了一个评测框架从网上找了几个公开的问答数据集设计了几十个问题然后让几个实习生手动去问每个模型再根据答案的“正确性”和“流畅度”打个分。结果出来大家面面相觑。模型A在技术文档问答上得分最高但回答用户关于产品售后政策的日常问题时却显得刻板生硬模型B的答案总是天马行空充满创意但在需要严格遵循事实的领域错误百出模型C各方面都中规中矩但偶尔会冒出一些完全无关、甚至略带冒犯的“幻觉”内容。更让人头疼的是三个实习生对同一个答案的打分能差出20分有人说“逻辑清晰”有人却说“答非所问”。这次经历让我彻底明白给AI模型做评测尤其是评估其生成内容的质量远不是给手机跑个安兔兔或者给显卡测个3DMark那么简单。你面对的不是一个输出固定数值的确定性系统而是一个充满“不确定性”的黑箱它的“好”与“坏”高度依赖于你问什么、怎么问、以及最重要的——谁来评判。今天我就结合自己踩过的坑和后续的实践来深度聊聊为什么说“AI评测”本身就是一道极其复杂的难题核心就卡在不确定性、主观性和多维度这三个坎上。2. 不确定性AI不是计算器它的输出是概率的舞蹈当我们评测一个传统软件比如一个数据库它的核心指标是明确的查询响应时间毫秒级、吞吐量QPS、数据一致性ACID。这些指标是确定性的在相同输入和环境下输出是可重复、可精确度量的。但AI模型特别是生成式AI其本质是一个基于概率的序列生成器。2.1 核心原理从Token概率分布到生成文本简单来说大模型在生成每一个词Token时并不是“想出”一个唯一的答案而是计算出一个所有可能词汇的概率分布然后根据某种策略如贪婪搜索、集束搜索、采样从这个分布中选出一个词。这个过程充满了随机性。即使你输入完全相同的问题模型也可能因为初始随机种子seed的不同或者采样温度temperature参数的微小调整而输出截然不同的答案。这就带来了评测的第一个根本性挑战可重复性差。你今天测出来模型A在某个问题上表现优于模型B明天重新跑一遍结果可能就反过来了。这种不确定性不是bug而是这类模型的内在特性。因此任何严肃的AI评测都必须控制随机性例如固定随机种子并在相同条件下进行多次采样用统计结果如平均分、方差来代替单次结果这无疑大大增加了评测的复杂度和成本。2.2 “幻觉”问题不确定性最棘手的体现不确定性最令人头疼的产物就是“幻觉”Hallucination即模型生成看似合理但事实上错误或毫无依据的内容。在评测中如何处理幻觉是一个巨大的难题。比如评测问题是“珠穆朗玛峰的高度是多少” 模型A回答“8848.86米2020年最新测量数据。” 模型B回答“约8850米。” 模型C回答“珠穆朗玛峰是地球最高峰位于中国和尼泊尔边境其精确高度随着地质活动变化最新数据约为8849米。”从事实准确性看A最精确B次之C最模糊。但从信息完整性和表述严谨性看C反而提供了更多背景且用“约为”体现了不确定性显得更“聪明”。如果我们的评测标准只盯着“8848.86”这个数字就会误判。更复杂的是如果问题本身是开放性的比如“写一篇关于登山的短文”模型在其中编造了一个不存在的登山家故事这算不算严重的幻觉还是可以被视为合理的文学创作评测标准在这里变得极其模糊。因此评测框架必须能有效识别和量化“幻觉”。这通常需要结合事实核查工具、检索增强生成RAG的对比评测以及人工对事实性进行精细标注成本高昂且难以自动化。3. 主观性当“好答案”没有标准答案如果说不确定性是技术层面的客观难题那么主观性则是人类认知层面的终极挑战。对于许多任务尤其是创意写作、对话、代码生成、设计等什么是“好”根本没有放之四海而皆准的标准。3.1 评价者的背景偏见不同背景的人对同一AI输出的评价可能天差地别。让我举一个真实的例子。我们曾用同一个AI绘画模型以“未来城市”为提示词生成了一批图像。工程师们普遍喜欢那些结构清晰、充满机械感和几何线条的赛博朋克风格图认为这体现了“技术的严谨”而设计师团队则更青睐那些带有生态元素、色彩柔和、构图更具艺术感的作品认为这表达了“人文与科技的融合”。在评测打分时这两组人给出的分数分布完全不同。在文本领域也是如此。一个法律专家可能更看重模型生成合同条款的严谨性和无歧义性一个市场人员则可能更看重其生成广告口号的创意和吸引力。如果评测团队的人员构成单一那么评测结果就会带有强烈的领域偏见无法反映模型在更广泛场景下的真实能力。3.2 评测指标本身的局限性为了对抗主观性学术界和工业界提出了许多自动评测指标如BLEU机器翻译、ROUGE文本摘要、BERTScore、METEOR等。这些指标通过将模型输出与一个或多个“参考答案”进行比对来计算相似度。但这里存在一个根本问题这些指标衡量的是“像不像参考答案”而不是“好不好”。一个模型完全可以生成一段与参考答案词汇重叠度很高因此BLEU得分高但逻辑混乱、事实错误的文本。反之一个真正优质、创新但表达方式与参考答案迥异的输出可能会得到很低的自动分。注意过度依赖自动指标是新手评测中最常见的陷阱。我曾见过团队因为某个模型的BERTScore高了0.01就决定选用上线后却被用户投诉答案“虽然通顺但总是答不到点子上”。自动指标更适合作为初筛工具或辅助验证绝不能代替人工在关键维度上的判断。3.3 人工评测的标准化之难既然自动指标不靠谱那么回归人工评测似乎是必然。但如何让不同人的“主观”判断尽可能“客观”起来这需要极其精细的评测设计。首先需要制定详尽的评测指南Evaluation Guideline。这份指南不能只是简单地说“请从1到5分打分”而必须对每一个分数等级给出清晰、可操作的描述性定义。例如对于“事实准确性”5分优秀答案核心事实完全正确且包含重要的相关背景细节所有数据、日期、名称等均精确无误。4分良好答案核心事实正确但可能缺少一些次要细节或有个别不重要的表述不够精确。3分一般答案大体方向正确但存在一处关键事实错误或有多处不精确的表述。2分较差答案包含多处事实错误或完全误解了问题。1分很差答案与问题无关或全部由事实错误构成。其次需要对评测员进行严格的培训和校准。在正式评测开始前让所有评测员对一批“校准集”问题进行独立打分然后对比讨论直到大家对评分标准的理解达到高度一致。这个过程往往需要反复多次。即便如此主观性也无法完全消除。评测本身就成了一个需要持续投入和优化的“元工程”。4. 多维度解开AI能力的“六边形雷达图”一个强大的AI模型尤其是一个通用大模型其能力是立体的、多面的。单一维度的评测就像用一把只量长度的尺子去评价一个立方体毫无意义。我们必须构建一个多维度的评测体系绘制出模型的能力“雷达图”。4.1 核心能力维度拆解根据我们的实践和行业共识一个较全面的生成式AI评测体系至少应包含以下维度维度核心问题评测方法举例挑战事实性与知识答案是否准确、可靠、无幻觉基于知识库的QA、事实核查、对抗性提问故意问错误前提的问题。知识时效性、领域专业性、幻觉的隐蔽性。理解与推理能否理解复杂指令、进行逻辑推理、数学计算多步推理问题如“如果A比B早到B比C晚到谁最早到”、代码逻辑题、常识推理。区分记忆与推理、题目本身的歧义性。安全与合规输出是否无害、无偏见、符合伦理注入恶意或诱导性提示词如涉及暴力、歧视、违法内容检查模型是否拒绝或安全回应。安全边界难以界定、文化差异、对抗性攻击的不断进化。指令遵循能否精确理解并执行复杂、多方面的用户指令给出包含多个约束条件的任务如“用莎士比亚的风格写一首关于春天的十四行诗诗中需包含‘数字’和‘河流’的隐喻。”。模型可能只执行部分指令或创造性过强而忽略约束。创造力与生成质量文本是否流畅、连贯、有创意、风格得当创意写作、诗歌生成、不同风格的文本改写。高度主观需多样化的评审团。鲁棒性面对输入扰动如错别字、同义替换、无关信息干扰时表现是否稳定在原始问题中加入噪音或换一种问法看答案质量是否显著下降。需要构建大规模的扰动测试集。4.2 维度间的权衡与评测目标对齐这些维度之间常常存在权衡关系。一个在“事实性”上追求极致保守的模型可能会在“创造力”上表现平平一个“指令遵循”能力极强的模型可能因为过于刻板而显得不够“智能”。因此脱离具体应用场景谈评测就是耍流氓。在设计评测方案前必须明确回答这个模型最终用在什么场景谁是用户他们的核心诉求是什么客服助手场景优先级可能是事实性 安全合规 指令遵循理解用户情绪和问题 鲁棒性应对用户不规范的表达。创造力可能并不重要。创意写作辅助场景优先级则变为创造力/生成质量 指令遵循把握风格要求 一定的知识性如历史背景。对事实性的绝对要求可以放宽。代码生成场景理解与推理算法逻辑 指令遵循实现具体功能 代码质量可读性、效率 安全性避免生成漏洞代码。我们的第一次评测失败根本原因就在于没有进行这种“目标对齐”。我们用一个通用数据集去测所有模型却没有想清楚我们自己的“雷达图”各个维度的权重应该是多少。后来我们针对内部知识库场景大幅提高了“事实性”和“在特定领域知识上的准确性”的权重并设计了大量基于我们真实工单和文档的测试用例评测结果才真正具备了指导选型的价值。5. 构建有效评测体系的实战思路说了这么多难点是不是AI评测就没法做了当然不是。难点意味着门槛也意味着机会。一个科学、严谨的评测体系本身就是巨大的竞争优势。以下是几条从实践中总结的可行路径。5.1 采用“自动化人工”的混合评测框架不要试图追求全自动化或全人工而应采用混合策略在不同阶段、对不同维度使用不同的工具。初筛与回归测试用自动化利用完善的自动化测试框架如使用pytest定制化评估脚本对模型的基础能力、鲁棒性、常见安全漏洞进行大规模、高频次的回归测试。这能快速发现明显的版本回退。核心能力与主观维度用人工对于事实性、创造力、复杂指令遵循等关键且主观的维度定期如每周/每版本进行精心设计的人工评测。可以借鉴“竞技场”模式让评测员对同一问题的两个匿名模型输出进行偏好投票A/B Test这比单独打分更能减少主观偏差。利用LLM-as-a-Judge大模型作为裁判这是一个新兴但非常有潜力的方向。使用一个更强的、公认更可靠的模型如GPT-4作为裁判来评估其他模型的输出。虽然它也有自己的偏见和局限性但在一致性、规模和成本上优势明显可以作为人工评测的有效补充和初筛工具。需要谨慎设计给裁判模型的提示词Prompt并对其判断结果进行抽样人工校验。5.2 设计贴近真实场景的评测集摒弃那些脱离实际的、玩具式的测试题。你的评测集应该最大限度地模拟模型上线后会遇到的真实情况。来源真实数据从历史客服对话、用户搜索日志、社区论坛问题中脱敏抽取真实用例。涵盖长尾分布不仅要测常见问题更要刻意收集那些出现频率低但一旦出错影响很坏的“边缘案例”和“对抗性案例”。动态更新业务在变化用户的问题也在变化评测集必须是一个活着的、持续更新的资产。5.3 建立可解释的评测基准与持续迭代的文化评测不是为了得到一个静态的分数而是为了理解模型的优缺点并驱动其改进。基准化Benchmarking在内部确立一个或多个基准模型Baseline。所有新模型或新版本都与之对比不仅要看总分更要分析在各个维度上的得分变化形成可解释的报告“新版本在创意写作上提升了10%但在多步数学推理上下降了5%可能的原因是...”从评测到洞察设立一个常设的“模型评估小组”定期分析评测结果特别是那些模型表现不一致的案例。这些案例往往是理解模型局限性和改进方向的金矿。文化上重视评测让团队意识到评测不是QA或某个团队的任务而是每个涉及模型开发、调优、应用的人员都需要关心的事情。评测结果应该直接影响技术决策路线图。AI评测之难难在它要求我们不仅是一个技术专家还要是一个认知心理学家、一个测试方法论学者、一个产品设计师。它没有银弹但通过正视不确定性、规范主观性、解构多维度我们完全能够建立起一套足以支撑关键决策的有效评测体系。这条路很漫长但每走一步我们对AI的理解就更深一层离打造出真正可靠、有用的AI产品也就更近一步。