zizi 5c54289b56 docs(eval)+fix(orchestrator): 三模型评估矩阵收口——主力 M2.7 留任/裁判 v4-flash + llm_client 固化显式 max_tokens
- 评估矩阵全档入库: M3 结构层 22/52(30 失败全为 <think> 泄漏进 content, 通道纪律非能力,
  接入前置=解析侧剥 think) / v4-pro 52/52 持平但'质量不劣/时延可对照'两证据缺口→头号替补
  / 裁判对决 flash 23/25=92% 四维全胜(pro 击穿正向守卫=过杀复发)
- 第二批配置定型: 主模型 MiniMax-M2.7 + AUDIT deepseek-v4-flash + max_tokens=4096 固化
- llm_client.py: 显式 max_tokens=4096(推理型空 content 22 次重试实证根治)

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-10 04:52:59 +00:00

4.1 KiB
Raw Blame History

结构层评测小结 · deepseek-v4-pro

日期2026-06-10 维护:模型评估矩阵子 agent 仓库基线:d268f50 产物:struct_eval_v4pro.py(可复现 harnesskey 走 env 不入库)、struct-v4pro.csv52 行,含 latency_ms/attemptsacceptable 列留空供盲评)、struct-v4pro-run.log(逐条运行记录)。 配方:与 2026-06-09-generation-spike/gen_spike.py 完全同配方——4 模板clicker/dodge/runner/match× 13 创意 = 52 次直调 new-api100.64.0.8:3000response_format=json_objecttemperature 0.4validate() 逐字段(类型/范围/枚举/templateId


1. 结论(先说结论)

  • 结构层通过率 = 52/52 = 100%,四模板各 13/13 全通过,与 M2.7 spike 基线52/52 = 100%)持平。含 2 个故意模糊创意("做一个很好玩的游戏""解压点点点")也全过。
  • 零重试52 次调用全部一次过http 通 + content 非空 + JSON 合法 + Schema 全过)。空 content 风险经"显式 max_tokens=4096"前置化解——v4-pro 每次都输出 reasoning_contentsmoke 实测 reasoning 163 tokens若用缺省额度会重现 C6.1 的空 content 故障;本次 0 次触发。
  • 时延独立复核52 次最终采纳调用)avg 7591ms p50 5671ms p95 17956ms min 2698ms max 31938ms。
  • 预算LLM 调用共 53 次52 正式 + 1 smoke≤70 预算红线内。

2. 与 M2.7 基线对比

评测 模型 口径 结果 时延
spike2026-06-09 MiniMax-M2.7 结构层52 次同配方 52/52 = 100% 未记录逐次时延spike 产物无该字段)
batch-0012026-06-10 MiniMax-M2.7 agent 闭环综合20 创意):结构层 20/20=100%;可运行/可接受 16/20 = 80.0% 80.0%accept 口径) 整批 671s非单次生成时延
本次2026-06-10 deepseek-v4-pro 结构层52 次同配方 52/52 = 100% avg 7591ms / p50 5671ms / p95 17956ms
  • 结构层口径v4-pro 与 M2.7 持平(均 100%,远超 C2 闸门 ≥80% 验收线。结构层产合法 GameConfig 的能力,两模型无差异。
  • batch-001 的 80.0% 是综合口径(可运行五条 AND + 对抗评审 accept与本次纯结构层不可直接混比;本次结果只回答"v4-pro 出合法配置是否可靠",答案=可靠。
  • 时延对比缺口(如实声明)M2.7 基线两套产物均未记录逐次生成时延,对 M2.7 无同口径时延对照;本次 v4-pro 按 latency_ms/attempts 字段落档,与本矩阵并行各 leg如 MiniMax-M3同字段直接横比。

3. 时延形态(推理型代价)

  • 按模板的时延分层明显clicker/match 多在 3-7sdodge/runner 常见 8-15s个别 21-32sreasoning 更长)。
  • 含义若生成下沉链路M-b 薄轮询执行器,现状 HTTP 18s/UI 27s 体验)切换 v4-prop95≈18s 的单次配置生成会显著拉长尾部体验,结构可靠性虽持平,时延上 v4-pro 不占优;选型需结合价格与可接受层表现再裁决。

4. 方法与诚实声明

  • 测的是哪一层:仅 prompt → GameConfig 结构化参数结构层JSON 合法 + 逐字段 Schema未测可运行层runtime 实跑)与可接受层(盲评/对抗评审52 条 config 已落 CSV acceptable 列留空待评。
  • 推理型适配(不改评测口径):显式 max_tokens=4096≥2048 红线);解析只读 message.content、忽略 reasoning_content空 content/http 失败自动重试(每条 ≤3 次尝试、全局 ≤66 次调用JSON/Schema 失败不重试(那是被测能力本身)。
  • 复核方式:通过率与时延均由独立脚本重读 CSV 重算(非采信 harness 自报52 行 config 的 templateId 与模板全匹配0 失败行。
  • 运行环境:本机直跑(未触发 Bash 拦截,无 degraded