- 评估矩阵全档入库: M3 结构层 22/52(30 失败全为 <think> 泄漏进 content, 通道纪律非能力, 接入前置=解析侧剥 think) / v4-pro 52/52 持平但'质量不劣/时延可对照'两证据缺口→头号替补 / 裁判对决 flash 23/25=92% 四维全胜(pro 击穿正向守卫=过杀复发) - 第二批配置定型: 主模型 MiniMax-M2.7 + AUDIT deepseek-v4-flash + max_tokens=4096 固化 - llm_client.py: 显式 max_tokens=4096(推理型空 content 22 次重试实证根治) Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
39 lines
4.1 KiB
Markdown
39 lines
4.1 KiB
Markdown
# 结构层评测小结 · deepseek-v4-pro
|
||
|
||
> 日期:2026-06-10 | 维护:模型评估矩阵子 agent | 仓库基线:`d268f50`
|
||
> 产物:[`struct_eval_v4pro.py`](./struct_eval_v4pro.py)(可复现 harness,key 走 env 不入库)、[`struct-v4pro.csv`](./struct-v4pro.csv)(52 行,含 latency_ms/attempts,`acceptable` 列留空供盲评)、[`struct-v4pro-run.log`](./struct-v4pro-run.log)(逐条运行记录)。
|
||
> 配方:与 [`2026-06-09-generation-spike/gen_spike.py`](../2026-06-09-generation-spike/gen_spike.py) **完全同配方**——4 模板(clicker/dodge/runner/match)× 13 创意 = 52 次直调 new-api(`100.64.0.8:3000`),`response_format=json_object`,temperature 0.4,validate() 逐字段(类型/范围/枚举/templateId)。
|
||
|
||
---
|
||
|
||
## 1. 结论(先说结论)
|
||
|
||
- **结构层通过率 = 52/52 = 100%**,四模板各 13/13 全通过,**与 M2.7 spike 基线(52/52 = 100%)持平**。含 2 个故意模糊创意("做一个很好玩的游戏""解压点点点")也全过。
|
||
- **零重试**:52 次调用全部一次过(http 通 + content 非空 + JSON 合法 + Schema 全过)。空 content 风险经"显式 max_tokens=4096"前置化解——v4-pro 每次都输出 reasoning_content(smoke 实测 reasoning 163 tokens),若用缺省额度会重现 C6.1 的空 content 故障;本次 0 次触发。
|
||
- **时延(独立复核,52 次最终采纳调用)**:avg **7591ms** | p50 **5671ms** | p95 **17956ms** | min 2698ms | max 31938ms。
|
||
- **预算**:LLM 调用共 **53 次**(52 正式 + 1 smoke),≤70 预算红线内。
|
||
|
||
## 2. 与 M2.7 基线对比
|
||
|
||
| 评测 | 模型 | 口径 | 结果 | 时延 |
|
||
|---|---|---|---|---|
|
||
| spike(2026-06-09) | MiniMax-M2.7 | 结构层,52 次同配方 | **52/52 = 100%** | 未记录逐次时延(spike 产物无该字段) |
|
||
| batch-001(2026-06-10) | MiniMax-M2.7 | agent 闭环综合(20 创意):结构层 20/20=100%;可运行/可接受 **16/20 = 80.0%** | 80.0%(accept 口径) | 整批 671s,非单次生成时延 |
|
||
| **本次(2026-06-10)** | **deepseek-v4-pro** | **结构层,52 次同配方** | **52/52 = 100%** | **avg 7591ms / p50 5671ms / p95 17956ms** |
|
||
|
||
- **结构层口径**:v4-pro 与 M2.7 **持平(均 100%)**,远超 C2 闸门 ≥80% 验收线。结构层产合法 GameConfig 的能力,两模型无差异。
|
||
- **batch-001 的 80.0% 是综合口径**(可运行五条 AND + 对抗评审 accept),与本次纯结构层**不可直接混比**;本次结果只回答"v4-pro 出合法配置是否可靠",答案=可靠。
|
||
- **时延对比缺口(如实声明)**:M2.7 基线两套产物均未记录逐次生成时延,**对 M2.7 无同口径时延对照**;本次 v4-pro 按 latency_ms/attempts 字段落档,与本矩阵并行各 leg(如 MiniMax-M3)同字段直接横比。
|
||
|
||
## 3. 时延形态(推理型代价)
|
||
|
||
- 按模板的时延分层明显:clicker/match 多在 3-7s;dodge/runner 常见 8-15s,个别 21-32s(reasoning 更长)。
|
||
- 含义:若生成下沉链路(M-b 薄轮询执行器,现状 HTTP 18s/UI 27s 体验)切换 v4-pro,**p95≈18s 的单次配置生成会显著拉长尾部体验**,结构可靠性虽持平,时延上 v4-pro 不占优;选型需结合价格与可接受层表现再裁决。
|
||
|
||
## 4. 方法与诚实声明
|
||
|
||
- **测的是哪一层**:仅 `prompt → GameConfig 结构化参数` 的**结构层**(JSON 合法 + 逐字段 Schema)。**未测**可运行层(runtime 实跑)与可接受层(盲评/对抗评审);52 条 config 已落 CSV `acceptable` 列留空待评。
|
||
- **推理型适配(不改评测口径)**:显式 `max_tokens=4096`(≥2048 红线);解析只读 `message.content`、忽略 reasoning_content;空 content/http 失败自动重试(每条 ≤3 次尝试、全局 ≤66 次调用),JSON/Schema 失败不重试(那是被测能力本身)。
|
||
- **复核方式**:通过率与时延均由独立脚本重读 CSV 重算(非采信 harness 自报);52 行 config 的 templateId 与模板全匹配,0 失败行。
|
||
- **运行环境**:本机直跑(未触发 Bash 拦截,无 degraded)。
|