# 模型评估矩阵 · 评审长综合报告 > 日期:2026-06-10 | 仓库 @ d268f50 | 评审长独立核验版(不采信自报,逐路对账原始产物后裁决) > 四路 leg:①结构层 M3(struct-m3.csv)②结构层 v4-pro(struct-v4pro.csv)③策划质量探针(designer-probe)④裁判对决(judge-duel) > 裁决规则(任务铁律):换主力的硬条件 = 结构层 ≥52/52 基线持平 ∧ 策划质量不劣 ∧ 时延可接受;**任何缺口 = 留任 M2.7**。 --- ## 一、最终裁决(结论先行) | 决策位 | 推荐 | 一句话理由 | |---|---|---| | **生成主力** | **MiniMax-M2.7 留任** | M3 结构层 22/52 直接出局;v4-pro 结构层 52/52 持平但「策划质量不劣」证据不足(单模板小样本+口径不可直比+8/13 句式同质化新风险)+ 时延无基线可比——按「任何缺口=留任」铁律不予转正 | | **对抗评审裁判(AUDIT/交叉位)** | **deepseek-v4-flash** | 四维独立重算全验证:黄金集 23/25=92%(唯一超 M2.7 基线 88%)、kill 守卫命中不放水、正向守卫 2/2 守住、双跑稳定 5/5、时延为 pro 的约 1/3.6 | | **第二批配置** | 见 §四 | 主力 M2.7 + 裁判 flash + 显式 max_tokens=4096 铁律固化 | **v4-pro 定位**:最有希望的主力替补(结构层满分、通道纯净),但本轮转正缺口明确(§2.3),补齐三项证据后可再议。 --- ## 二、主力裁决逻辑(硬条件逐项核验) ### 2.1 候选一 MiniMax-M3:出局(条件一不达标) | 硬条件 | 实测(评审长重算) | 判定 | |---|---|---| | 结构层 ≥52/52 | **22/52 = 42.3%**(clicker 5/13、dodge 4/13、runner 6/13、match 7/13),< C2 闸门 60% 线 | **不达标,直接出局** | - 根因经核验确证:30 例失败 **100% 为 `` 推理块内联泄漏进 `message.content`** 致 json_parse 失败(评审长独立验证 30/30 失败例 config 均以 `` 开头);**0 例字段级失败**——产出纯 JSON 的 22 例逐字段全过。 - 互证:probe 腿对 M3 做了解析侧剥 think 重解析(6/13 响应泄漏,`reparsedThinkStrip` 标记 6 个与 rawContent 含 `` 计数 6 个互证),剥离后 13/13 schema 全过——**M3 败在通道纪律而非字段能力**。剥 think 或修网关 reasoning 拆分后可另行评测,但本轮按当前配方如实判出局。 - 时延 avg 10383ms(P50 8921ms),失败例均值 13753ms 明显拖长(think 块膨胀输出)。 ### 2.2 候选二 deepseek-v4-pro:三条硬条件逐项核 | 硬条件 | 实测(评审长重算) | 判定 | |---|---|---| | ① 结构层 ≥52/52 基线持平 | **52/52 = 100%**(四模板各 13/13,零重试零空 content),与 M2.7 基线 52/52 持平 | **达标** | | ② 策划质量不劣 | P1 检出 2/13 与 M3 持平、P0 0/13;但对照基线 3/13 是 **v1.0.0 双 prompt 旧口径不可直比**(只能读"同量级");且 **8/13 designIntent 为「快速点击/连续点击」开头模式化句式**(批量同质化新风险,M2.7 无此记录);样本仅 clicker 单模板 13 创意 | **证据不足 = 缺口** | | ③ 时延可接受 | 绝对值 avg 7591ms / p50 5671ms / p95 17956ms / max 31938ms,自身可用;但 **M2.7 基线未记录逐次时延,无法证明不劣化** | **无法对照 = 缺口** | **按铁律「任何缺口 = 留任 M2.7」→ v4-pro 本轮不予转正。** 旁证(非裁决依据,但提示风险):judge-duel 腿中 v4-pro 在温度 0.2 评审位双跑稳定性仅 3/5(两条翻转恰是其自身误报条目 g9011/g9019),同模型输出稳定性存疑。 ### 2.3 v4-pro 转正待补清单(第二批可执行) 1. **策划探针扩样**:dodge/runner/match 三模板各 13 创意(与 M2.7 同轮同口径对照生成,消除旧口径不可比问题); 2. **同质化量化**:designIntent 开头句式去重率/多样性指标进探针判定(本轮为人工归纳口径); 3. **M2.7 同口径时延采集**:用本轮 harness(struct_eval.py 已支持逐次 latency_ms)对 M2.7 重跑 52 次补基线时延。 --- ## 三、裁判推荐:deepseek-v4-flash(四维全占优,独立重算验证) | 维度 | flash | pro | M2.7 基线(v1.1.1 轮) | |---|---|---|---| | 黄金集符合率(doctrine=1.1.1) | **23/25 = 92%**(偏离 g9019、w2-4) | 20/25 = 80%(偏离 g9011、g9015、g9019、k-a04dfac9、w2-1) | 22/25 = 88%(偏离 g9011、g9019、w2-1)| | kill 守卫 k-0cfbc296(须含 P1) | 命中 | 命中 | 命中 | | 正向守卫 k-26ce4440 / k-a04dfac9(须无 P1) | **2/2 守住**(k-a04dfac9 正确降 P2) | 1/2(**k-a04dfac9 击穿**,过杀复发) | 2/2 守住 | | 稳定一致率(5 条双跑) | **5/5 = 100%** | 3/5 = 60%(g9011、g9019 翻转) | 5/5 = 100% | | 时延(A 段 25 条) | **中位 5.6s / 均值 8.2s** | 中位 19.9s / 均值 20.9s | 未测 | 以上五行数字全部由评审长用 `judge-duel-results.json` 原始判定字段 + 黄金集 doctrine 版本化标签独立重算复核(含 M2.7 基线 22/25 用 `golden-regression-v1.1.1/results.json` 复算),与 `judge-duel.md` 自述零出入;60 次调用零重试(`judge-duel-calls.jsonl` 台账 60 行 = 25×2 + 5×2)。 **用法建议**:flash 作 AUDIT/交叉裁判位;**保留 M2.7 主裁 + flash 交叉的双裁结构**,不建议单换。两点已知风险: - flash 在 g9019 上有**跨轮漂移**(v1.1.1 轮交叉复核记 P2,本轮记 P1;本轮双跑内一致)——偏离方向为偏严不放水,可接受但需跟踪; - flash 曾任 M2.7 v1.1.1 轮黄金回归的交叉复核模型(`results.json` crossModel 字段),本轮非完全首测,独立性评估略打折扣。 --- ## 四、第二批建议配置 | 项 | 值 | 依据 | |---|---|---| | `NEWAPI_MODEL`(生成主力) | `MiniMax-M2.7` | 本报告 §二裁决:留任 | | `AUDIT_MODEL`(对抗评审交叉裁判) | `deepseek-v4-flash` | 本报告 §三:四维占优 | | `NEWAPI_MAX_TOKENS` | **显式 ≥2048,建议 4096**(写死在 harness,不留缺省) | C6.1 空 content 22 次重试教训 + 本轮 M3/v4-pro/flash/pro 全部为推理型模型实证(v4-pro smoke 实测 reasoning 163 tokens) | | 解析纪律 | **只读 `message.content`**;若接 M3 类模型须先剥 `...` 再 `json.loads` | M3 路 30/30 失败根因 + probe 腿剥离后 13/13 全过互证 | | 温度 | 生成 0.4 / 评审 0.2 | 与基线及本轮四 leg 一致 | | M3 复测前置条件 | 网关修 reasoning_content 拆分,或配方加剥 think 步骤(任一) | 否则结构层闸门必然复现 42.3% | | v4-pro 上策划位前置条件 | §2.3 三项补证 + designIntent 句式多样性约束 | 8/13 同质化风险 | --- ## 五、各路明细引用(产物索引) | Leg | 核验状态 | 产物(均在本目录,另注明者除外) | |---|---|---| | ① 结构层 M3 | 数字全对账一致 | `struct-m3.csv`(52 数据行)、`struct-m3-run.log`、`struct-m3-小结.md`、harness=`struct_eval.py` | | ② 结构层 v4-pro | 数字全对账一致;**validate()/build_prompt() 与基线 gen_spike.py 逐字一致已核**(无放宽校验水分),config 抽查 3 例真 JSON | `struct-v4pro.csv`、`struct-v4pro-run.log`、`struct-v4pro-小结.md`、harness=`struct_eval_v4pro.py` | | ③ 策划探针 | P0/P1、think 泄漏 6/13、句式 8/13(md 精确口径)全部重算/重数一致 | `designer-probe.md`、`designer-probe-results.json`(26 rows)、`designer-probe-calls.jsonl`(52 条:26 gen+26 review)、`raw-designer-probe/`(52 文件)、`designer_probe.py`、`designer_probe_reparse.py` | | ④ 裁判对决 | 四维 + M2.7 基线全部独立重算一致 | `judge-duel.md`、`judge-duel-results.json`、`judge-duel-calls.jsonl`(60 行)、`raw-judge-duel/`、`judge_duel.py`、`summarize_duel.py` | | 基线参照 | — | M2.7 结构层=`../2026-06-09-generation-spike/spike-eval.csv`(52/52);黄金集与 M2.7 评审基线=`../2026-06-09-agent-loop-v1/runs/golden-regression-v1.1.1/{golden-set.json,results.json}` | 交叉互证亮点:probe 腿两候选双双命中的 P1 创意「海底捞珍珠同时躲开鲨鱼」(ideaIdx=7)正是黄金集 kill 守卫 k-0cfbc296 的同源创意——对抗 v1.1.1 的「核心动作矛盾」锚点在第三、四个模型上继续成立,口径跨模型可迁移。 --- ## 六、数据缺口与诚实声明(caveats) 1. **第四路(judge)自报在编排消息中被截断**(probe 自报 summary 亦截尾)——judge 路结论完全基于产物独立核验(重算与 `judge-duel.md` 零出入),无自报可对账;本报告 §三即该路的权威对账版。 2. `struct-m3.csv` / `struct-v4pro.csv` 的 **acceptable 列全空**(harness 未填),通过判定以 `schema_valid` 列为准(评审长已按此独立重算,不影响结论)。 3. `designer-probe-results.json` 的 **llmCallsUsed=17 与台账不符**(`designer-probe-calls.jsonl` 52 条、raw 52 文件为准)——元数据计数字段缺陷,不影响质量结论。 4. **M2.7 基线无逐次时延**(spike 轮未记录),v4-pro/M3 时延只能绝对值判读,「时延可接受」无法做相对劣化比较——此为 v4-pro 转正缺口之一。 5. **策划探针样本量与口径限制**:仅 clicker 单模板 13 创意;M2.7 对照 3/13 为 designer v1.0.0+adversary v1.0.0 旧口径,只能读「同量级」不能读优劣——此为 v4-pro 转正缺口之二。 6. v4-pro 句式同质化的自报 JSON 简写「8/13 快速点击开头」口径偏简:精确口径为「快速点击/连续点击」开头句式并集 8/13(严格含「快速点击」字样 6/13、含「快速」字样 9/13)——方向成立,`designer-probe.md` 内口径定义准确。 7. flash 与 M2.7 v1.1.1 轮黄金回归存在**角色重叠**(曾任 crossModel),且 g9019 跨轮漂移(P2→P1)——推荐 flash 为交叉裁判而非单一裁判的原因之一。 8. M3 的 think 泄漏为**概率性**行为(结构层 30/52 泄漏、probe 腿 6/13 泄漏、跑批前探测一次未泄漏),修复验证需另行成批评测,本轮不外推。 9. 执行环境:本轮评审长核验全程在本机完成,**无 degraded**(未触发 ssh mini-desktop 改道);全程只读核验 + 本报告写入,未跑任何 LLM 批跑、未触碰 staging。