zizi 5c54289b56 docs(eval)+fix(orchestrator): 三模型评估矩阵收口——主力 M2.7 留任/裁判 v4-flash + llm_client 固化显式 max_tokens
- 评估矩阵全档入库: M3 结构层 22/52(30 失败全为 <think> 泄漏进 content, 通道纪律非能力,
  接入前置=解析侧剥 think) / v4-pro 52/52 持平但'质量不劣/时延可对照'两证据缺口→头号替补
  / 裁判对决 flash 23/25=92% 四维全胜(pro 击穿正向守卫=过杀复发)
- 第二批配置定型: 主模型 MiniMax-M2.7 + AUDIT deepseek-v4-flash + max_tokens=4096 固化
- llm_client.py: 显式 max_tokens=4096(推理型空 content 22 次重试实证根治)

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-10 04:52:59 +00:00

39 lines
4.1 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 结构层评测小结 · deepseek-v4-pro
> 日期2026-06-10 维护:模型评估矩阵子 agent 仓库基线:`d268f50`
> 产物:[`struct_eval_v4pro.py`](./struct_eval_v4pro.py)(可复现 harnesskey 走 env 不入库)、[`struct-v4pro.csv`](./struct-v4pro.csv)52 行,含 latency_ms/attempts`acceptable` 列留空供盲评)、[`struct-v4pro-run.log`](./struct-v4pro-run.log)(逐条运行记录)。
> 配方:与 [`2026-06-09-generation-spike/gen_spike.py`](../2026-06-09-generation-spike/gen_spike.py) **完全同配方**——4 模板clicker/dodge/runner/match× 13 创意 = 52 次直调 new-api`100.64.0.8:3000``response_format=json_object`temperature 0.4validate() 逐字段(类型/范围/枚举/templateId
---
## 1. 结论(先说结论)
- **结构层通过率 = 52/52 = 100%**,四模板各 13/13 全通过,**与 M2.7 spike 基线52/52 = 100%)持平**。含 2 个故意模糊创意("做一个很好玩的游戏""解压点点点")也全过。
- **零重试**52 次调用全部一次过http 通 + content 非空 + JSON 合法 + Schema 全过)。空 content 风险经"显式 max_tokens=4096"前置化解——v4-pro 每次都输出 reasoning_contentsmoke 实测 reasoning 163 tokens若用缺省额度会重现 C6.1 的空 content 故障;本次 0 次触发。
- **时延独立复核52 次最终采纳调用)**avg **7591ms** p50 **5671ms** p95 **17956ms** min 2698ms max 31938ms。
- **预算**LLM 调用共 **53 次**52 正式 + 1 smoke≤70 预算红线内。
## 2. 与 M2.7 基线对比
| 评测 | 模型 | 口径 | 结果 | 时延 |
|---|---|---|---|---|
| spike2026-06-09 | MiniMax-M2.7 | 结构层52 次同配方 | **52/52 = 100%** | 未记录逐次时延spike 产物无该字段) |
| batch-0012026-06-10 | MiniMax-M2.7 | agent 闭环综合20 创意):结构层 20/20=100%;可运行/可接受 **16/20 = 80.0%** | 80.0%accept 口径) | 整批 671s非单次生成时延 |
| **本次2026-06-10** | **deepseek-v4-pro** | **结构层52 次同配方** | **52/52 = 100%** | **avg 7591ms / p50 5671ms / p95 17956ms** |
- **结构层口径**v4-pro 与 M2.7 **持平(均 100%**,远超 C2 闸门 ≥80% 验收线。结构层产合法 GameConfig 的能力,两模型无差异。
- **batch-001 的 80.0% 是综合口径**(可运行五条 AND + 对抗评审 accept与本次纯结构层**不可直接混比**;本次结果只回答"v4-pro 出合法配置是否可靠",答案=可靠。
- **时延对比缺口(如实声明)**M2.7 基线两套产物均未记录逐次生成时延,**对 M2.7 无同口径时延对照**;本次 v4-pro 按 latency_ms/attempts 字段落档,与本矩阵并行各 leg如 MiniMax-M3同字段直接横比。
## 3. 时延形态(推理型代价)
- 按模板的时延分层明显clicker/match 多在 3-7sdodge/runner 常见 8-15s个别 21-32sreasoning 更长)。
- 含义若生成下沉链路M-b 薄轮询执行器,现状 HTTP 18s/UI 27s 体验)切换 v4-pro**p95≈18s 的单次配置生成会显著拉长尾部体验**,结构可靠性虽持平,时延上 v4-pro 不占优;选型需结合价格与可接受层表现再裁决。
## 4. 方法与诚实声明
- **测的是哪一层**:仅 `prompt → GameConfig 结构化参数` 的**结构层**JSON 合法 + 逐字段 Schema。**未测**可运行层runtime 实跑)与可接受层(盲评/对抗评审52 条 config 已落 CSV `acceptable` 列留空待评。
- **推理型适配(不改评测口径)**:显式 `max_tokens=4096`≥2048 红线);解析只读 `message.content`、忽略 reasoning_content空 content/http 失败自动重试(每条 ≤3 次尝试、全局 ≤66 次调用JSON/Schema 失败不重试(那是被测能力本身)。
- **复核方式**:通过率与时延均由独立脚本重读 CSV 重算(非采信 harness 自报52 行 config 的 templateId 与模板全匹配0 失败行。
- **运行环境**:本机直跑(未触发 Bash 拦截,无 degraded