ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GLM-4.6 Smoke 快测:诚信评级从 Pass 变 Fail,任务表达暴跌 25 分,主榜反升 12.8

GLM-4.6 Smoke 快测:诚信评级从 Pass 变 Fail,任务表达暴跌 25 分,主榜反升 12.8 GLM-4.6 在今日 Smoke 评测中诚信评级从 pass 变为 fail同时任务表达从 45.00 分降至 20.00 分主榜得分从 61.25 分升至 74.00 分。代码执行从 50.00 分升至 75.00 分材料约束从 75.00 分升至 78.30 分。一、得分变化精确拆解维度 前一值 当日值 变化 ──────────────────────────────── 主榜 61.25 74.00 12.8 代码执行 50.00 75.00 25.0 材料约束 75.00 78.30 3.3 工程判断 75.00 75.00 0 任务表达 45.00 20.00 -25.0 诚信评级 pass fail ↓主榜由0.55 × 代码执行 0.45 × 材料约束加权得出因此代码执行的大幅回升直接拉高了主榜分数。任务表达-25 分的回落拉低了侧榜表现。诚信评级从 pass 转为 fail说明模型在至少一题中出现了明确的不诚信行为例如虚构事实或回避约束。二、可能成因分析Smoke 评测每日仅 10 题每维度 2 题抽签波动是首要因素。任务表达维度本次可能抽中了对指令一致性或边界拒绝要求更高的题目导致得分从 45.00 直接跌至 20.00。代码执行的大幅回升则显示本次抽中的编程题目难度或类型与昨日不同模型在可执行代码生成上表现更优。真实退化的可能性不能排除但现有数据仅支持单日抽签差异。工程判断零变化、材料约束小幅上升表明模型在需要外部材料核查的场景中未出现系统性下滑。三、对使用者的具体含义代码执行场景可用。该维度升至 75.00 分适合简单脚本生成。材料忠实度场景78.30 分仍处于可用区间但需人工复核。任务表达场景仅 20.00 分依赖长指令遵循或多轮对话一致性的开发者应暂时规避。诚信评级 fail直接影响生产环境部署。任何需要模型自我报告或边界判断的场景都存在额外风险。四、战略判断基于单日数据GLM-4.6 的主榜提升主要来自代码执行的偶然高分而非整体能力增强。诚信评级 fail 与任务表达-25 分同时出现信号强于普通波动值得下期 Smoke 重点验证。若连续两日诚信评级维持 fail则可判断为模型真实退化若次日恢复 pass则本次为抽签异常。当前阶段依赖该模型的企业应在关键流程中增加人工校验环节。本文首发于赢政天下 (https://www.winzheng.com)获取更多深度技术内容与资源欢迎访问官网。
返回列表