- 评估矩阵全档入库: M3 结构层 22/52(30 失败全为 <think> 泄漏进 content, 通道纪律非能力, 接入前置=解析侧剥 think) / v4-pro 52/52 持平但'质量不劣/时延可对照'两证据缺口→头号替补 / 裁判对决 flash 23/25=92% 四维全胜(pro 击穿正向守卫=过杀复发) - 第二批配置定型: 主模型 MiniMax-M2.7 + AUDIT deepseek-v4-flash + max_tokens=4096 固化 - llm_client.py: 显式 max_tokens=4096(推理型空 content 22 次重试实证根治) Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
4.1 KiB
4.1 KiB
结构层评测小结 · deepseek-v4-pro
日期:2026-06-10 | 维护:模型评估矩阵子 agent | 仓库基线:
d268f50产物:struct_eval_v4pro.py(可复现 harness,key 走 env 不入库)、struct-v4pro.csv(52 行,含 latency_ms/attempts,acceptable列留空供盲评)、struct-v4pro-run.log(逐条运行记录)。 配方:与2026-06-09-generation-spike/gen_spike.py完全同配方——4 模板(clicker/dodge/runner/match)× 13 创意 = 52 次直调 new-api(100.64.0.8:3000),response_format=json_object,temperature 0.4,validate() 逐字段(类型/范围/枚举/templateId)。
1. 结论(先说结论)
- 结构层通过率 = 52/52 = 100%,四模板各 13/13 全通过,与 M2.7 spike 基线(52/52 = 100%)持平。含 2 个故意模糊创意("做一个很好玩的游戏""解压点点点")也全过。
- 零重试:52 次调用全部一次过(http 通 + content 非空 + JSON 合法 + Schema 全过)。空 content 风险经"显式 max_tokens=4096"前置化解——v4-pro 每次都输出 reasoning_content(smoke 实测 reasoning 163 tokens),若用缺省额度会重现 C6.1 的空 content 故障;本次 0 次触发。
- 时延(独立复核,52 次最终采纳调用):avg 7591ms | p50 5671ms | p95 17956ms | min 2698ms | max 31938ms。
- 预算:LLM 调用共 53 次(52 正式 + 1 smoke),≤70 预算红线内。
2. 与 M2.7 基线对比
| 评测 | 模型 | 口径 | 结果 | 时延 |
|---|---|---|---|---|
| spike(2026-06-09) | MiniMax-M2.7 | 结构层,52 次同配方 | 52/52 = 100% | 未记录逐次时延(spike 产物无该字段) |
| batch-001(2026-06-10) | MiniMax-M2.7 | agent 闭环综合(20 创意):结构层 20/20=100%;可运行/可接受 16/20 = 80.0% | 80.0%(accept 口径) | 整批 671s,非单次生成时延 |
| 本次(2026-06-10) | deepseek-v4-pro | 结构层,52 次同配方 | 52/52 = 100% | avg 7591ms / p50 5671ms / p95 17956ms |
- 结构层口径:v4-pro 与 M2.7 持平(均 100%),远超 C2 闸门 ≥80% 验收线。结构层产合法 GameConfig 的能力,两模型无差异。
- batch-001 的 80.0% 是综合口径(可运行五条 AND + 对抗评审 accept),与本次纯结构层不可直接混比;本次结果只回答"v4-pro 出合法配置是否可靠",答案=可靠。
- 时延对比缺口(如实声明):M2.7 基线两套产物均未记录逐次生成时延,对 M2.7 无同口径时延对照;本次 v4-pro 按 latency_ms/attempts 字段落档,与本矩阵并行各 leg(如 MiniMax-M3)同字段直接横比。
3. 时延形态(推理型代价)
- 按模板的时延分层明显:clicker/match 多在 3-7s;dodge/runner 常见 8-15s,个别 21-32s(reasoning 更长)。
- 含义:若生成下沉链路(M-b 薄轮询执行器,现状 HTTP 18s/UI 27s 体验)切换 v4-pro,p95≈18s 的单次配置生成会显著拉长尾部体验,结构可靠性虽持平,时延上 v4-pro 不占优;选型需结合价格与可接受层表现再裁决。
4. 方法与诚实声明
- 测的是哪一层:仅
prompt → GameConfig 结构化参数的结构层(JSON 合法 + 逐字段 Schema)。未测可运行层(runtime 实跑)与可接受层(盲评/对抗评审);52 条 config 已落 CSVacceptable列留空待评。 - 推理型适配(不改评测口径):显式
max_tokens=4096(≥2048 红线);解析只读message.content、忽略 reasoning_content;空 content/http 失败自动重试(每条 ≤3 次尝试、全局 ≤66 次调用),JSON/Schema 失败不重试(那是被测能力本身)。 - 复核方式:通过率与时延均由独立脚本重读 CSV 重算(非采信 harness 自报);52 行 config 的 templateId 与模板全匹配,0 失败行。
- 运行环境:本机直跑(未触发 Bash 拦截,无 degraded)。