- 评估矩阵全档入库: M3 结构层 22/52(30 失败全为 <think> 泄漏进 content, 通道纪律非能力, 接入前置=解析侧剥 think) / v4-pro 52/52 持平但'质量不劣/时延可对照'两证据缺口→头号替补 / 裁判对决 flash 23/25=92% 四维全胜(pro 击穿正向守卫=过杀复发) - 第二批配置定型: 主模型 MiniMax-M2.7 + AUDIT deepseek-v4-flash + max_tokens=4096 固化 - llm_client.py: 显式 max_tokens=4096(推理型空 content 22 次重试实证根治) Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
10 KiB
模型评估矩阵 · 评审长综合报告
日期:2026-06-10 | 仓库 @
d268f50| 评审长独立核验版(不采信自报,逐路对账原始产物后裁决) 四路 leg:①结构层 M3(struct-m3.csv)②结构层 v4-pro(struct-v4pro.csv)③策划质量探针(designer-probe)④裁判对决(judge-duel) 裁决规则(任务铁律):换主力的硬条件 = 结构层 ≥52/52 基线持平 ∧ 策划质量不劣 ∧ 时延可接受;任何缺口 = 留任 M2.7。
一、最终裁决(结论先行)
| 决策位 | 推荐 | 一句话理由 |
|---|---|---|
| 生成主力 | MiniMax-M2.7 留任 | M3 结构层 22/52 直接出局;v4-pro 结构层 52/52 持平但「策划质量不劣」证据不足(单模板小样本+口径不可直比+8/13 句式同质化新风险)+ 时延无基线可比——按「任何缺口=留任」铁律不予转正 |
| 对抗评审裁判(AUDIT/交叉位) | deepseek-v4-flash | 四维独立重算全验证:黄金集 23/25=92%(唯一超 M2.7 基线 88%)、kill 守卫命中不放水、正向守卫 2/2 守住、双跑稳定 5/5、时延为 pro 的约 1/3.6 |
| 第二批配置 | 见 §四 | 主力 M2.7 + 裁判 flash + 显式 max_tokens=4096 铁律固化 |
v4-pro 定位:最有希望的主力替补(结构层满分、通道纯净),但本轮转正缺口明确(§2.3),补齐三项证据后可再议。
二、主力裁决逻辑(硬条件逐项核验)
2.1 候选一 MiniMax-M3:出局(条件一不达标)
| 硬条件 | 实测(评审长重算) | 判定 |
|---|---|---|
| 结构层 ≥52/52 | 22/52 = 42.3%(clicker 5/13、dodge 4/13、runner 6/13、match 7/13),< C2 闸门 60% 线 | 不达标,直接出局 |
- 根因经核验确证:30 例失败 100% 为
<think>推理块内联泄漏进message.content致 json_parse 失败(评审长独立验证 30/30 失败例 config 均以<think>开头);0 例字段级失败——产出纯 JSON 的 22 例逐字段全过。 - 互证:probe 腿对 M3 做了解析侧剥 think 重解析(6/13 响应泄漏,
reparsedThinkStrip标记 6 个与 rawContent 含<think>计数 6 个互证),剥离后 13/13 schema 全过——M3 败在通道纪律而非字段能力。剥 think 或修网关 reasoning 拆分后可另行评测,但本轮按当前配方如实判出局。 - 时延 avg 10383ms(P50 8921ms),失败例均值 13753ms 明显拖长(think 块膨胀输出)。
2.2 候选二 deepseek-v4-pro:三条硬条件逐项核
| 硬条件 | 实测(评审长重算) | 判定 |
|---|---|---|
| ① 结构层 ≥52/52 基线持平 | 52/52 = 100%(四模板各 13/13,零重试零空 content),与 M2.7 基线 52/52 持平 | 达标 |
| ② 策划质量不劣 | P1 检出 2/13 与 M3 持平、P0 0/13;但对照基线 3/13 是 v1.0.0 双 prompt 旧口径不可直比(只能读"同量级");且 8/13 designIntent 为「快速点击/连续点击」开头模式化句式(批量同质化新风险,M2.7 无此记录);样本仅 clicker 单模板 13 创意 | 证据不足 = 缺口 |
| ③ 时延可接受 | 绝对值 avg 7591ms / p50 5671ms / p95 17956ms / max 31938ms,自身可用;但 M2.7 基线未记录逐次时延,无法证明不劣化 | 无法对照 = 缺口 |
按铁律「任何缺口 = 留任 M2.7」→ v4-pro 本轮不予转正。
旁证(非裁决依据,但提示风险):judge-duel 腿中 v4-pro 在温度 0.2 评审位双跑稳定性仅 3/5(两条翻转恰是其自身误报条目 g9011/g9019),同模型输出稳定性存疑。
2.3 v4-pro 转正待补清单(第二批可执行)
- 策划探针扩样:dodge/runner/match 三模板各 13 创意(与 M2.7 同轮同口径对照生成,消除旧口径不可比问题);
- 同质化量化:designIntent 开头句式去重率/多样性指标进探针判定(本轮为人工归纳口径);
- M2.7 同口径时延采集:用本轮 harness(struct_eval.py 已支持逐次 latency_ms)对 M2.7 重跑 52 次补基线时延。
三、裁判推荐:deepseek-v4-flash(四维全占优,独立重算验证)
| 维度 | flash | pro | M2.7 基线(v1.1.1 轮) |
|---|---|---|---|
| 黄金集符合率(doctrine=1.1.1) | 23/25 = 92%(偏离 g9019、w2-4) | 20/25 = 80%(偏离 g9011、g9015、g9019、k-a04dfac9、w2-1) | 22/25 = 88%(偏离 g9011、g9019、w2-1) |
| kill 守卫 k-0cfbc296(须含 P1) | 命中 | 命中 | 命中 |
| 正向守卫 k-26ce4440 / k-a04dfac9(须无 P1) | 2/2 守住(k-a04dfac9 正确降 P2) | 1/2(k-a04dfac9 击穿,过杀复发) | 2/2 守住 |
| 稳定一致率(5 条双跑) | 5/5 = 100% | 3/5 = 60%(g9011、g9019 翻转) | 5/5 = 100% |
| 时延(A 段 25 条) | 中位 5.6s / 均值 8.2s | 中位 19.9s / 均值 20.9s | 未测 |
以上五行数字全部由评审长用 judge-duel-results.json 原始判定字段 + 黄金集 doctrine 版本化标签独立重算复核(含 M2.7 基线 22/25 用 golden-regression-v1.1.1/results.json 复算),与 judge-duel.md 自述零出入;60 次调用零重试(judge-duel-calls.jsonl 台账 60 行 = 25×2 + 5×2)。
用法建议:flash 作 AUDIT/交叉裁判位;保留 M2.7 主裁 + flash 交叉的双裁结构,不建议单换。两点已知风险:
- flash 在 g9019 上有跨轮漂移(v1.1.1 轮交叉复核记 P2,本轮记 P1;本轮双跑内一致)——偏离方向为偏严不放水,可接受但需跟踪;
- flash 曾任 M2.7 v1.1.1 轮黄金回归的交叉复核模型(
results.jsoncrossModel 字段),本轮非完全首测,独立性评估略打折扣。
四、第二批建议配置
| 项 | 值 | 依据 |
|---|---|---|
NEWAPI_MODEL(生成主力) |
MiniMax-M2.7 |
本报告 §二裁决:留任 |
AUDIT_MODEL(对抗评审交叉裁判) |
deepseek-v4-flash |
本报告 §三:四维占优 |
NEWAPI_MAX_TOKENS |
显式 ≥2048,建议 4096(写死在 harness,不留缺省) | C6.1 空 content 22 次重试教训 + 本轮 M3/v4-pro/flash/pro 全部为推理型模型实证(v4-pro smoke 实测 reasoning 163 tokens) |
| 解析纪律 | 只读 message.content;若接 M3 类模型须先剥 <think>...</think> 再 json.loads |
M3 路 30/30 失败根因 + probe 腿剥离后 13/13 全过互证 |
| 温度 | 生成 0.4 / 评审 0.2 | 与基线及本轮四 leg 一致 |
| M3 复测前置条件 | 网关修 reasoning_content 拆分,或配方加剥 think 步骤(任一) | 否则结构层闸门必然复现 42.3% |
| v4-pro 上策划位前置条件 | §2.3 三项补证 + designIntent 句式多样性约束 | 8/13 同质化风险 |
五、各路明细引用(产物索引)
| Leg | 核验状态 | 产物(均在本目录,另注明者除外) |
|---|---|---|
| ① 结构层 M3 | 数字全对账一致 | struct-m3.csv(52 数据行)、struct-m3-run.log、struct-m3-小结.md、harness=struct_eval.py |
| ② 结构层 v4-pro | 数字全对账一致;validate()/build_prompt() 与基线 gen_spike.py 逐字一致已核(无放宽校验水分),config 抽查 3 例真 JSON | struct-v4pro.csv、struct-v4pro-run.log、struct-v4pro-小结.md、harness=struct_eval_v4pro.py |
| ③ 策划探针 | P0/P1、think 泄漏 6/13、句式 8/13(md 精确口径)全部重算/重数一致 | designer-probe.md、designer-probe-results.json(26 rows)、designer-probe-calls.jsonl(52 条:26 gen+26 review)、raw-designer-probe/(52 文件)、designer_probe.py、designer_probe_reparse.py |
| ④ 裁判对决 | 四维 + M2.7 基线全部独立重算一致 | judge-duel.md、judge-duel-results.json、judge-duel-calls.jsonl(60 行)、raw-judge-duel/、judge_duel.py、summarize_duel.py |
| 基线参照 | — | M2.7 结构层=../2026-06-09-generation-spike/spike-eval.csv(52/52);黄金集与 M2.7 评审基线=../2026-06-09-agent-loop-v1/runs/golden-regression-v1.1.1/{golden-set.json,results.json} |
交叉互证亮点:probe 腿两候选双双命中的 P1 创意「海底捞珍珠同时躲开鲨鱼」(ideaIdx=7)正是黄金集 kill 守卫 k-0cfbc296 的同源创意——对抗 v1.1.1 的「核心动作矛盾」锚点在第三、四个模型上继续成立,口径跨模型可迁移。
六、数据缺口与诚实声明(caveats)
- 第四路(judge)自报在编排消息中被截断(probe 自报 summary 亦截尾)——judge 路结论完全基于产物独立核验(重算与
judge-duel.md零出入),无自报可对账;本报告 §三即该路的权威对账版。 struct-m3.csv/struct-v4pro.csv的 acceptable 列全空(harness 未填),通过判定以schema_valid列为准(评审长已按此独立重算,不影响结论)。designer-probe-results.json的 llmCallsUsed=17 与台账不符(designer-probe-calls.jsonl52 条、raw 52 文件为准)——元数据计数字段缺陷,不影响质量结论。- M2.7 基线无逐次时延(spike 轮未记录),v4-pro/M3 时延只能绝对值判读,「时延可接受」无法做相对劣化比较——此为 v4-pro 转正缺口之一。
- 策划探针样本量与口径限制:仅 clicker 单模板 13 创意;M2.7 对照 3/13 为 designer v1.0.0+adversary v1.0.0 旧口径,只能读「同量级」不能读优劣——此为 v4-pro 转正缺口之二。
- v4-pro 句式同质化的自报 JSON 简写「8/13 快速点击开头」口径偏简:精确口径为「快速点击/连续点击」开头句式并集 8/13(严格含「快速点击」字样 6/13、含「快速」字样 9/13)——方向成立,
designer-probe.md内口径定义准确。 - flash 与 M2.7 v1.1.1 轮黄金回归存在角色重叠(曾任 crossModel),且 g9019 跨轮漂移(P2→P1)——推荐 flash 为交叉裁判而非单一裁判的原因之一。
- M3 的 think 泄漏为概率性行为(结构层 30/52 泄漏、probe 腿 6/13 泄漏、跑批前探测一次未泄漏),修复验证需另行成批评测,本轮不外推。
- 执行环境:本轮评审长核验全程在本机完成,无 degraded(未触发 ssh mini-desktop 改道);全程只读核验 + 本报告写入,未跑任何 LLM 批跑、未触碰 staging。