zizi 5c54289b56 docs(eval)+fix(orchestrator): 三模型评估矩阵收口——主力 M2.7 留任/裁判 v4-flash + llm_client 固化显式 max_tokens
- 评估矩阵全档入库: M3 结构层 22/52(30 失败全为 <think> 泄漏进 content, 通道纪律非能力,
  接入前置=解析侧剥 think) / v4-pro 52/52 持平但'质量不劣/时延可对照'两证据缺口→头号替补
  / 裁判对决 flash 23/25=92% 四维全胜(pro 击穿正向守卫=过杀复发)
- 第二批配置定型: 主模型 MiniMax-M2.7 + AUDIT deepseek-v4-flash + max_tokens=4096 固化
- llm_client.py: 显式 max_tokens=4096(推理型空 content 22 次重试实证根治)

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-10 04:52:59 +00:00

10 KiB
Raw Blame History

模型评估矩阵 · 评审长综合报告

日期2026-06-10 仓库 @ d268f50 评审长独立核验版(不采信自报,逐路对账原始产物后裁决) 四路 leg①结构层 M3struct-m3.csv②结构层 v4-prostruct-v4pro.csv③策划质量探针designer-probe④裁判对决judge-duel 裁决规则(任务铁律):换主力的硬条件 = 结构层 ≥52/52 基线持平 ∧ 策划质量不劣 ∧ 时延可接受;任何缺口 = 留任 M2.7


一、最终裁决(结论先行)

决策位 推荐 一句话理由
生成主力 MiniMax-M2.7 留任 M3 结构层 22/52 直接出局v4-pro 结构层 52/52 持平但「策划质量不劣」证据不足(单模板小样本+口径不可直比+8/13 句式同质化新风险)+ 时延无基线可比——按「任何缺口=留任」铁律不予转正
对抗评审裁判AUDIT/交叉位) deepseek-v4-flash 四维独立重算全验证:黄金集 23/25=92%(唯一超 M2.7 基线 88%、kill 守卫命中不放水、正向守卫 2/2 守住、双跑稳定 5/5、时延为 pro 的约 1/3.6
第二批配置 见 §四 主力 M2.7 + 裁判 flash + 显式 max_tokens=4096 铁律固化

v4-pro 定位最有希望的主力替补结构层满分、通道纯净但本轮转正缺口明确§2.3),补齐三项证据后可再议。


二、主力裁决逻辑(硬条件逐项核验)

2.1 候选一 MiniMax-M3出局条件一不达标

硬条件 实测(评审长重算) 判定
结构层 ≥52/52 22/52 = 42.3%clicker 5/13、dodge 4/13、runner 6/13、match 7/13< C2 闸门 60% 线 不达标,直接出局
  • 根因经核验确证30 例失败 100% 为 <think> 推理块内联泄漏进 message.content 致 json_parse 失败(评审长独立验证 30/30 失败例 config 均以 <think> 开头);0 例字段级失败——产出纯 JSON 的 22 例逐字段全过。
  • 互证probe 腿对 M3 做了解析侧剥 think 重解析6/13 响应泄漏,reparsedThinkStrip 标记 6 个与 rawContent 含 <think> 计数 6 个互证),剥离后 13/13 schema 全过——M3 败在通道纪律而非字段能力。剥 think 或修网关 reasoning 拆分后可另行评测,但本轮按当前配方如实判出局。
  • 时延 avg 10383msP50 8921ms失败例均值 13753ms 明显拖长think 块膨胀输出)。

2.2 候选二 deepseek-v4-pro三条硬条件逐项核

硬条件 实测(评审长重算) 判定
① 结构层 ≥52/52 基线持平 52/52 = 100%(四模板各 13/13零重试零空 content与 M2.7 基线 52/52 持平 达标
② 策划质量不劣 P1 检出 2/13 与 M3 持平、P0 0/13但对照基线 3/13 是 v1.0.0 双 prompt 旧口径不可直比(只能读"同量级");且 8/13 designIntent 为「快速点击/连续点击」开头模式化句式批量同质化新风险M2.7 无此记录);样本仅 clicker 单模板 13 创意 证据不足 = 缺口
③ 时延可接受 绝对值 avg 7591ms / p50 5671ms / p95 17956ms / max 31938ms自身可用M2.7 基线未记录逐次时延,无法证明不劣化 无法对照 = 缺口

按铁律「任何缺口 = 留任 M2.7」→ v4-pro 本轮不予转正。

旁证非裁决依据但提示风险judge-duel 腿中 v4-pro 在温度 0.2 评审位双跑稳定性仅 3/5两条翻转恰是其自身误报条目 g9011/g9019同模型输出稳定性存疑。

2.3 v4-pro 转正待补清单(第二批可执行)

  1. 策划探针扩样dodge/runner/match 三模板各 13 创意(与 M2.7 同轮同口径对照生成,消除旧口径不可比问题);
  2. 同质化量化designIntent 开头句式去重率/多样性指标进探针判定(本轮为人工归纳口径);
  3. M2.7 同口径时延采集:用本轮 harnessstruct_eval.py 已支持逐次 latency_ms对 M2.7 重跑 52 次补基线时延。

三、裁判推荐deepseek-v4-flash四维全占优独立重算验证

维度 flash pro M2.7 基线v1.1.1 轮)
黄金集符合率doctrine=1.1.1 23/25 = 92%(偏离 g9019、w2-4 20/25 = 80%(偏离 g9011、g9015、g9019、k-a04dfac9、w2-1 22/25 = 88%(偏离 g9011、g9019、w2-1
kill 守卫 k-0cfbc296须含 P1 命中 命中 命中
正向守卫 k-26ce4440 / k-a04dfac9须无 P1 2/2 守住k-a04dfac9 正确降 P2 1/2k-a04dfac9 击穿,过杀复发) 2/2 守住
稳定一致率5 条双跑) 5/5 = 100% 3/5 = 60%g9011、g9019 翻转) 5/5 = 100%
时延A 段 25 条) 中位 5.6s / 均值 8.2s 中位 19.9s / 均值 20.9s 未测

以上五行数字全部由评审长用 judge-duel-results.json 原始判定字段 + 黄金集 doctrine 版本化标签独立重算复核(含 M2.7 基线 22/25 用 golden-regression-v1.1.1/results.json 复算),与 judge-duel.md 自述零出入60 次调用零重试(judge-duel-calls.jsonl 台账 60 行 = 25×2 + 5×2

用法建议flash 作 AUDIT/交叉裁判位;保留 M2.7 主裁 + flash 交叉的双裁结构,不建议单换。两点已知风险:

  • flash 在 g9019 上有跨轮漂移v1.1.1 轮交叉复核记 P2本轮记 P1本轮双跑内一致——偏离方向为偏严不放水可接受但需跟踪
  • flash 曾任 M2.7 v1.1.1 轮黄金回归的交叉复核模型(results.json crossModel 字段),本轮非完全首测,独立性评估略打折扣。

四、第二批建议配置

依据
NEWAPI_MODEL(生成主力) MiniMax-M2.7 本报告 §二裁决:留任
AUDIT_MODEL(对抗评审交叉裁判) deepseek-v4-flash 本报告 §三:四维占优
NEWAPI_MAX_TOKENS 显式 ≥2048建议 4096(写死在 harness不留缺省 C6.1 空 content 22 次重试教训 + 本轮 M3/v4-pro/flash/pro 全部为推理型模型实证v4-pro smoke 实测 reasoning 163 tokens
解析纪律 只读 message.content;若接 M3 类模型须先剥 <think>...</think>json.loads M3 路 30/30 失败根因 + probe 腿剥离后 13/13 全过互证
温度 生成 0.4 / 评审 0.2 与基线及本轮四 leg 一致
M3 复测前置条件 网关修 reasoning_content 拆分,或配方加剥 think 步骤(任一) 否则结构层闸门必然复现 42.3%
v4-pro 上策划位前置条件 §2.3 三项补证 + designIntent 句式多样性约束 8/13 同质化风险

五、各路明细引用(产物索引)

Leg 核验状态 产物(均在本目录,另注明者除外)
① 结构层 M3 数字全对账一致 struct-m3.csv52 数据行)、struct-m3-run.logstruct-m3-小结.md、harness=struct_eval.py
② 结构层 v4-pro 数字全对账一致;validate()/build_prompt() 与基线 gen_spike.py 逐字一致已核无放宽校验水分config 抽查 3 例真 JSON struct-v4pro.csvstruct-v4pro-run.logstruct-v4pro-小结.md、harness=struct_eval_v4pro.py
③ 策划探针 P0/P1、think 泄漏 6/13、句式 8/13md 精确口径)全部重算/重数一致 designer-probe.mddesigner-probe-results.json26 rowsdesigner-probe-calls.jsonl52 条26 gen+26 reviewraw-designer-probe/52 文件)、designer_probe.pydesigner_probe_reparse.py
④ 裁判对决 四维 + M2.7 基线全部独立重算一致 judge-duel.mdjudge-duel-results.jsonjudge-duel-calls.jsonl60 行)、raw-judge-duel/judge_duel.pysummarize_duel.py
基线参照 M2.7 结构层=../2026-06-09-generation-spike/spike-eval.csv52/52黄金集与 M2.7 评审基线=../2026-06-09-agent-loop-v1/runs/golden-regression-v1.1.1/{golden-set.json,results.json}

交叉互证亮点probe 腿两候选双双命中的 P1 创意「海底捞珍珠同时躲开鲨鱼」ideaIdx=7正是黄金集 kill 守卫 k-0cfbc296 的同源创意——对抗 v1.1.1 的「核心动作矛盾」锚点在第三、四个模型上继续成立,口径跨模型可迁移。


六、数据缺口与诚实声明caveats

  1. 第四路judge自报在编排消息中被截断probe 自报 summary 亦截尾——judge 路结论完全基于产物独立核验(重算与 judge-duel.md 零出入),无自报可对账;本报告 §三即该路的权威对账版。
  2. struct-m3.csv / struct-v4pro.csvacceptable 列全空harness 未填),通过判定以 schema_valid 列为准(评审长已按此独立重算,不影响结论)。
  3. designer-probe-results.jsonllmCallsUsed=17 与台账不符designer-probe-calls.jsonl 52 条、raw 52 文件为准)——元数据计数字段缺陷,不影响质量结论。
  4. M2.7 基线无逐次时延spike 轮未记录v4-pro/M3 时延只能绝对值判读,「时延可接受」无法做相对劣化比较——此为 v4-pro 转正缺口之一。
  5. 策划探针样本量与口径限制:仅 clicker 单模板 13 创意M2.7 对照 3/13 为 designer v1.0.0+adversary v1.0.0 旧口径,只能读「同量级」不能读优劣——此为 v4-pro 转正缺口之二。
  6. v4-pro 句式同质化的自报 JSON 简写「8/13 快速点击开头」口径偏简:精确口径为「快速点击/连续点击」开头句式并集 8/13严格含「快速点击」字样 6/13、含「快速」字样 9/13——方向成立designer-probe.md 内口径定义准确。
  7. flash 与 M2.7 v1.1.1 轮黄金回归存在角色重叠(曾任 crossModel且 g9019 跨轮漂移P2→P1——推荐 flash 为交叉裁判而非单一裁判的原因之一。
  8. M3 的 think 泄漏为概率性行为(结构层 30/52 泄漏、probe 腿 6/13 泄漏、跑批前探测一次未泄漏),修复验证需另行成批评测,本轮不外推。
  9. 执行环境:本轮评审长核验全程在本机完成,无 degraded(未触发 ssh mini-desktop 改道);全程只读核验 + 本报告写入,未跑任何 LLM 批跑、未触碰 staging。