ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Smoke 快测 Run #275:Grok 4 以 98.41 分居首,GPT-5.5 主榜骤降 21.9 分

Smoke 快测 Run #275:Grok 4 以 98.41 分居首,GPT-5.5 主榜骤降 21.9 分 2026-08-12 赢政指数 Smoke 快测覆盖 11 个模型Grok 4 以 98.41 分位居当日首位。Smoke 为每日 10 题快测适合观察短期信号不等同 Full 周榜结论。本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度主榜公式为0.55 × 代码执行 0.45 × 材料约束。由于每日样本量较小单日分数更适合作为监控信号而不是对模型能力做长期定论。一、当日排名排名模型主榜代码执行材料约束诚信#1Grok 498.4197.1100pass#2Gemini 2.5 Pro88.5399.675pass#3Claude Opus 4.786.0374.6100pass#4GLM-4.679.3862.5100pass#5Claude Sonnet 4.6757575pass#6Gemini 3.1 Pro757575pass#7GPT-o3757575pass#8豆包 Pro74.6274.375pass#9DeepSeek V4 Pro70.1274.365pass#10Qwen3 Max62.7173.150pass#11GPT-5.561.255075pass二、数据解读今日赢政指数 Smoke 快测中头部模型在代码执行与材料约束的搭配上呈现明显分化。Grok 4 以主榜 98.41 位居首位其代码执行 97.1、材料约束 100两种能力均保持高位。Gemini 2.5 Pro 主榜 88.53代码执行 99.6 但材料约束仅 75显示其在代码执行维度突出。Claude Opus 4.7 主榜 86.03材料约束 100 而代码执行 74.6体现材料约束的相对优势。GLM-4.6 主榜 79.38代码执行 62.5、材料约束 100同样依赖材料约束得分支撑整体表现。多模型出现显著分数变化。GPT-5.5 主榜下降 21.9 分代码执行下降 50 分、材料约束上升 12.4 分Gemini 3.1 Pro 主榜下降 19.7 分代码执行下降 25 分、材料约束下降 13.3 分Qwen3 Max 主榜下降 18.9 分代码执行下降 14.4 分、材料约束下降 24.3 分DeepSeek V4 Pro 主榜下降 17.9 分代码执行下降 25.7 分、材料约束下降 8.3 分Claude Sonnet 4.6 主榜下降 10.7 分代码执行下降 25 分、材料约束上升 6.7 分。这些单日波动可能源于题目抽样差异也可能反映模型在特定能力上的不稳定需后续同口径 run 复核确认。异常信号方面GLM-4.6 诚信评级降为 Fail此前记录为 fail→pass。该变化在小样本单日测试中出现具体原因尚需更多 run 数据验证以区分偶然波动与真实退化。整体解读仅基于当日分数结构避免对模型长期表现下结论。三、主要变化GPT-5.5主榜下降 21.9 分代码执行 -50 分材料约束 12.4 分Gemini 3.1 Pro主榜下降 19.7 分代码执行 -25 分材料约束 -13.3 分Qwen3 Max主榜下降 18.9 分代码执行 -14.4 分材料约束 -24.3 分DeepSeek V4 Pro主榜下降 17.9 分代码执行 -25.7 分材料约束 -8.3 分Claude Sonnet 4.6主榜下降 10.7 分代码执行 -25 分材料约束 6.7 分四、需要关注的信号GLM-4.6诚信评级降为 Fail (fail→pass)读这类 Smoke 简报时重点应放在两个问题上第一某个模型是否连续多日暴露同一类弱点第二诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化可能来自题目抽样也可能是真实退化的早期信号需要后续 run 复核。本文首发于赢政天下 (https://www.winzheng.com)获取更多深度技术内容与资源欢迎访问官网。
返回列表