zizi 5c54289b56 docs(eval)+fix(orchestrator): 三模型评估矩阵收口——主力 M2.7 留任/裁判 v4-flash + llm_client 固化显式 max_tokens
- 评估矩阵全档入库: M3 结构层 22/52(30 失败全为 <think> 泄漏进 content, 通道纪律非能力,
  接入前置=解析侧剥 think) / v4-pro 52/52 持平但'质量不劣/时延可对照'两证据缺口→头号替补
  / 裁判对决 flash 23/25=92% 四维全胜(pro 击穿正向守卫=过杀复发)
- 第二批配置定型: 主模型 MiniMax-M2.7 + AUDIT deepseek-v4-flash + max_tokens=4096 固化
- llm_client.py: 显式 max_tokens=4096(推理型空 content 22 次重试实证根治)

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-10 04:52:59 +00:00

39 lines
3.2 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 结构层评测小结 · MiniMax-M34 模板 × 13 创意 = 52 次)
> 日期2026-06-10 仓库 @ d268f50 产物:`struct-m3.csv`、`struct-m3-run.log`、`struct_eval.py`
> 配方:`docs/agent-specs/2026-06-09-generation-spike/gen_spike.py` 的参数化版,提示词/温度 0.4/`response_format=json_object`/校验器与 M2.7 基线**逐字一致**;仅新增显式 `max_tokens=4096`、逐次时延记录、空 content 重试(本次未触发)。调用消耗 53/701 探测 + 52 正式0 重试)。
## 一、结论速览
| 指标 | MiniMax-M3 | M2.7 基线spike-eval.csv |
|---|---|---|
| 结构层通过率 | **22/52 = 42.3%** | **52/52 = 100%** |
| HTTP 通 / JSON 合法 | 52 / 22 | 52 / 52 |
| 平均时延 | **10383ms**P50 8921ms最大 55233ms | 基线未记录时延,不可比 |
| C2 闸门初判 | **<60% 转纯模板填充**按既有闸门规则 | 80% 可接 Dify |
分模板clicker 5/1338.5%)、dodge 4/1330.8%)、runner 6/1346.2%)、match 7/1353.8%)。
## 二、失败明细与归因30 例失败 100% 同根因)
- **30/30 失败全部为 `json_parse` 失败 content 均以 `<think>` 开头**——M3 把推理过程直接泄漏进 `message.content`未拆分到 `reasoning_content`即使已显式 `response_format=json_object` + `max_tokens=4096`
- **0 例字段级 schema 失败**凡产出纯 JSON 22 templateId/数值范围/枚举/非空字符串逐字段全部通过——M3 的字段遵循能力本身没有问题败在输出通道纪律
- 时延旁证失败例均值 13753ms vs 通过例均值 5788msthink 块拉长输出)。
- 行为是**概率性**跑批前同配置探测调用返回过干净 JSON8258ms think)。
- 失败用例索引模板#创意序号clicker#0,1,3,6,7,9,11,12dodge#0,1,3,5,6,8,10,11,12runner#1,5,6,7,8,9,12match#1,3,5,6,9,10
- C6.1 reasoning 吃光额度 content不是同一症状——本次显式 max_tokens 后无任何空 content/重试症状变为 think 文本**内联** content
## 三、判读与建议
1. **按既有闸门规则如实判42.3% < 60%M3 不可在当前配方下直接接入生成链。**
2. 根因是**网关/模型侧 reasoning 分离缺陷**而非生成能力缺陷22 例干净输出 100% 字段合规)。两条可选修复路径均需另行评测不在本次范围
- 解析前剥离 `<think>...</think>` `json.loads`改配方预计通过率显著回升——推断CSV 截断的 config 前缀显示 think 后通常续写 JSON config 列截断 200 字符未全文核实
- 网关侧修 M3 通道的 reasoning_content 拆分
3. 即便修复解析**平均时延 10.4s 也明显偏慢**通过例也要 5.8s对生成链体验是次级风险
## 四、执行可信度声明
- 本机 Bash 全程未被拦截未启用 ssh mini-desktop 降级通道 degraded
- 全部调用显式 `max_tokens=4096`(≥2048温度 0.4解析只读 `message.content`key 仅经命令行环境变量传入未写入任何 repo 文件
- staging 未触碰未运行编排器批跑本评测为对网关的直调脚本