zizi 5c54289b56 docs(eval)+fix(orchestrator): 三模型评估矩阵收口——主力 M2.7 留任/裁判 v4-flash + llm_client 固化显式 max_tokens
- 评估矩阵全档入库: M3 结构层 22/52(30 失败全为 <think> 泄漏进 content, 通道纪律非能力,
  接入前置=解析侧剥 think) / v4-pro 52/52 持平但'质量不劣/时延可对照'两证据缺口→头号替补
  / 裁判对决 flash 23/25=92% 四维全胜(pro 击穿正向守卫=过杀复发)
- 第二批配置定型: 主模型 MiniMax-M2.7 + AUDIT deepseek-v4-flash + max_tokens=4096 固化
- llm_client.py: 显式 max_tokens=4096(推理型空 content 22 次重试实证根治)

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-10 04:52:59 +00:00

110 lines
10 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 模型评估矩阵 · 评审长综合报告
> 日期2026-06-10 仓库 @ d268f50 评审长独立核验版(不采信自报,逐路对账原始产物后裁决)
> 四路 leg①结构层 M3struct-m3.csv②结构层 v4-prostruct-v4pro.csv③策划质量探针designer-probe④裁判对决judge-duel
> 裁决规则(任务铁律):换主力的硬条件 = 结构层 ≥52/52 基线持平 ∧ 策划质量不劣 ∧ 时延可接受;**任何缺口 = 留任 M2.7**。
---
## 一、最终裁决(结论先行)
| 决策位 | 推荐 | 一句话理由 |
|---|---|---|
| **生成主力** | **MiniMax-M2.7 留任** | M3 结构层 22/52 直接出局v4-pro 结构层 52/52 持平但「策划质量不劣」证据不足(单模板小样本+口径不可直比+8/13 句式同质化新风险)+ 时延无基线可比——按「任何缺口=留任」铁律不予转正 |
| **对抗评审裁判AUDIT/交叉位)** | **deepseek-v4-flash** | 四维独立重算全验证:黄金集 23/25=92%(唯一超 M2.7 基线 88%、kill 守卫命中不放水、正向守卫 2/2 守住、双跑稳定 5/5、时延为 pro 的约 1/3.6 |
| **第二批配置** | 见 §四 | 主力 M2.7 + 裁判 flash + 显式 max_tokens=4096 铁律固化 |
**v4-pro 定位**最有希望的主力替补结构层满分、通道纯净但本轮转正缺口明确§2.3),补齐三项证据后可再议。
---
## 二、主力裁决逻辑(硬条件逐项核验)
### 2.1 候选一 MiniMax-M3出局条件一不达标
| 硬条件 | 实测(评审长重算) | 判定 |
|---|---|---|
| 结构层 ≥52/52 | **22/52 = 42.3%**clicker 5/13、dodge 4/13、runner 6/13、match 7/13< C2 闸门 60% 线 | **不达标,直接出局** |
- 根因经核验确证30 例失败 **100% 为 `<think>` 推理块内联泄漏进 `message.content`** json_parse 失败评审长独立验证 30/30 失败例 config 均以 `<think>` 开头**0 例字段级失败**——产出纯 JSON 22 例逐字段全过
- 互证probe 腿对 M3 做了解析侧剥 think 重解析6/13 响应泄漏`reparsedThinkStrip` 标记 6 个与 rawContent `<think>` 计数 6 个互证剥离后 13/13 schema 全过——**M3 败在通道纪律而非字段能力**。 think 或修网关 reasoning 拆分后可另行评测但本轮按当前配方如实判出局
- 时延 avg 10383msP50 8921ms失败例均值 13753ms 明显拖长think 块膨胀输出)。
### 2.2 候选二 deepseek-v4-pro三条硬条件逐项核
| 硬条件 | 实测评审长重算 | 判定 |
|---|---|---|
| 结构层 52/52 基线持平 | **52/52 = 100%**四模板各 13/13零重试零空 content M2.7 基线 52/52 持平 | **达标** |
| 策划质量不劣 | P1 检出 2/13 M3 持平P0 0/13但对照基线 3/13 **v1.0.0 双 prompt 旧口径不可直比**只能读"同量级" **8/13 designIntent 为「快速点击/连续点击」开头模式化句式**批量同质化新风险M2.7 无此记录样本仅 clicker 单模板 13 创意 | **证据不足 = 缺口** |
| 时延可接受 | 绝对值 avg 7591ms / p50 5671ms / p95 17956ms / max 31938ms自身可用 **M2.7 基线未记录逐次时延,无法证明不劣化** | **无法对照 = 缺口** |
**按铁律「任何缺口 = 留任 M2.7」→ v4-pro 本轮不予转正。**
旁证非裁决依据但提示风险judge-duel 腿中 v4-pro 在温度 0.2 评审位双跑稳定性仅 3/5两条翻转恰是其自身误报条目 g9011/g9019同模型输出稳定性存疑
### 2.3 v4-pro 转正待补清单(第二批可执行)
1. **策划探针扩样**dodge/runner/match 三模板各 13 创意 M2.7 同轮同口径对照生成消除旧口径不可比问题
2. **同质化量化**designIntent 开头句式去重率/多样性指标进探针判定本轮为人工归纳口径
3. **M2.7 同口径时延采集**用本轮 harnessstruct_eval.py 已支持逐次 latency_ms M2.7 重跑 52 次补基线时延
---
## 三、裁判推荐deepseek-v4-flash四维全占优独立重算验证
| 维度 | flash | pro | M2.7 基线v1.1.1 |
|---|---|---|---|
| 黄金集符合率doctrine=1.1.1 | **23/25 = 92%**偏离 g9019w2-4 | 20/25 = 80%(偏离 g9011g9015g9019k-a04dfac9w2-1 | 22/25 = 88%(偏离 g9011g9019w2-1|
| kill 守卫 k-0cfbc296须含 P1 | 命中 | 命中 | 命中 |
| 正向守卫 k-26ce4440 / k-a04dfac9须无 P1 | **2/2 守住**k-a04dfac9 正确降 P2 | 1/2**k-a04dfac9 击穿**过杀复发 | 2/2 守住 |
| 稳定一致率5 条双跑 | **5/5 = 100%** | 3/5 = 60%g9011、g9019 翻转 | 5/5 = 100% |
| 时延A 25 | **中位 5.6s / 均值 8.2s** | 中位 19.9s / 均值 20.9s | 未测 |
以上五行数字全部由评审长用 `judge-duel-results.json` 原始判定字段 + 黄金集 doctrine 版本化标签独立重算复核 M2.7 基线 22/25 `golden-regression-v1.1.1/results.json` 复算 `judge-duel.md` 自述零出入60 次调用零重试`judge-duel-calls.jsonl` 台账 60 = 25×2 + 5×2)。
**用法建议**flash AUDIT/交叉裁判位**保留 M2.7 主裁 + flash 交叉的双裁结构**不建议单换两点已知风险
- flash g9019 上有**跨轮漂移**v1.1.1 轮交叉复核记 P2本轮记 P1本轮双跑内一致)——偏离方向为偏严不放水可接受但需跟踪
- flash 曾任 M2.7 v1.1.1 轮黄金回归的交叉复核模型`results.json` crossModel 字段本轮非完全首测独立性评估略打折扣
---
## 四、第二批建议配置
| | | 依据 |
|---|---|---|
| `NEWAPI_MODEL`生成主力 | `MiniMax-M2.7` | 本报告 §二裁决留任 |
| `AUDIT_MODEL`对抗评审交叉裁判 | `deepseek-v4-flash` | 本报告 §四维占优 |
| `NEWAPI_MAX_TOKENS` | **显式 ≥2048建议 4096**写死在 harness不留缺省 | C6.1 content 22 次重试教训 + 本轮 M3/v4-pro/flash/pro 全部为推理型模型实证v4-pro smoke 实测 reasoning 163 tokens |
| 解析纪律 | **只读 `message.content`**若接 M3 类模型须先剥 `<think>...</think>` `json.loads` | M3 30/30 失败根因 + probe 腿剥离后 13/13 全过互证 |
| 温度 | 生成 0.4 / 评审 0.2 | 与基线及本轮四 leg 一致 |
| M3 复测前置条件 | 网关修 reasoning_content 拆分或配方加剥 think 步骤任一 | 否则结构层闸门必然复现 42.3% |
| v4-pro 上策划位前置条件 | §2.3 三项补证 + designIntent 句式多样性约束 | 8/13 同质化风险 |
---
## 五、各路明细引用(产物索引)
| Leg | 核验状态 | 产物均在本目录另注明者除外 |
|---|---|---|
| 结构层 M3 | 数字全对账一致 | `struct-m3.csv`52 数据行)、`struct-m3-run.log``struct-m3-小结.md`harness=`struct_eval.py` |
| 结构层 v4-pro | 数字全对账一致**validate()/build_prompt() 与基线 gen_spike.py 逐字一致已核**无放宽校验水分config 抽查 3 例真 JSON | `struct-v4pro.csv``struct-v4pro-run.log``struct-v4pro-小结.md`harness=`struct_eval_v4pro.py` |
| 策划探针 | P0/P1think 泄漏 6/13句式 8/13md 精确口径全部重算/重数一致 | `designer-probe.md``designer-probe-results.json`26 rows)、`designer-probe-calls.jsonl`52 26 gen+26 review)、`raw-designer-probe/`52 文件)、`designer_probe.py``designer_probe_reparse.py` |
| 裁判对决 | 四维 + M2.7 基线全部独立重算一致 | `judge-duel.md``judge-duel-results.json``judge-duel-calls.jsonl`60 )、`raw-judge-duel/``judge_duel.py``summarize_duel.py` |
| 基线参照 | | M2.7 结构层=`../2026-06-09-generation-spike/spike-eval.csv`52/52黄金集与 M2.7 评审基线=`../2026-06-09-agent-loop-v1/runs/golden-regression-v1.1.1/{golden-set.json,results.json}` |
交叉互证亮点probe 腿两候选双双命中的 P1 创意海底捞珍珠同时躲开鲨鱼」(ideaIdx=7正是黄金集 kill 守卫 k-0cfbc296 的同源创意——对抗 v1.1.1 核心动作矛盾锚点在第三四个模型上继续成立口径跨模型可迁移
---
## 六、数据缺口与诚实声明caveats
1. **第四路judge自报在编排消息中被截断**probe 自报 summary 亦截尾)——judge 路结论完全基于产物独立核验重算与 `judge-duel.md` 零出入无自报可对账本报告 §三即该路的权威对账版
2. `struct-m3.csv` / `struct-v4pro.csv` **acceptable 列全空**harness 未填通过判定以 `schema_valid` 列为准评审长已按此独立重算不影响结论)。
3. `designer-probe-results.json` **llmCallsUsed=17 与台账不符**`designer-probe-calls.jsonl` 52 raw 52 文件为准)——元数据计数字段缺陷不影响质量结论
4. **M2.7 基线无逐次时延**spike 轮未记录v4-pro/M3 时延只能绝对值判读,「时延可接受无法做相对劣化比较——此为 v4-pro 转正缺口之一
5. **策划探针样本量与口径限制** clicker 单模板 13 创意M2.7 对照 3/13 designer v1.0.0+adversary v1.0.0 旧口径只能读同量级不能读优劣——此为 v4-pro 转正缺口之二
6. v4-pro 句式同质化的自报 JSON 简写8/13 快速点击开头口径偏简精确口径为快速点击/连续点击开头句式并集 8/13严格含快速点击字样 6/13快速字样 9/13)——方向成立`designer-probe.md` 内口径定义准确
7. flash M2.7 v1.1.1 轮黄金回归存在**角色重叠**曾任 crossModel g9019 跨轮漂移P2P1)——推荐 flash 为交叉裁判而非单一裁判的原因之一
8. M3 think 泄漏为**概率性**行为结构层 30/52 泄漏probe 6/13 泄漏跑批前探测一次未泄漏修复验证需另行成批评测本轮不外推
9. 执行环境本轮评审长核验全程在本机完成** degraded**未触发 ssh mini-desktop 改道全程只读核验 + 本报告写入未跑任何 LLM 批跑未触碰 staging