- 评估矩阵全档入库: M3 结构层 22/52(30 失败全为 <think> 泄漏进 content, 通道纪律非能力, 接入前置=解析侧剥 think) / v4-pro 52/52 持平但'质量不劣/时延可对照'两证据缺口→头号替补 / 裁判对决 flash 23/25=92% 四维全胜(pro 击穿正向守卫=过杀复发) - 第二批配置定型: 主模型 MiniMax-M2.7 + AUDIT deepseek-v4-flash + max_tokens=4096 固化 - llm_client.py: 显式 max_tokens=4096(推理型空 content 22 次重试实证根治) Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
39 lines
3.2 KiB
Markdown
39 lines
3.2 KiB
Markdown
# 结构层评测小结 · MiniMax-M3(4 模板 × 13 创意 = 52 次)
|
||
|
||
> 日期:2026-06-10 | 仓库 @ d268f50 | 产物:`struct-m3.csv`、`struct-m3-run.log`、`struct_eval.py`
|
||
> 配方:`docs/agent-specs/2026-06-09-generation-spike/gen_spike.py` 的参数化版,提示词/温度 0.4/`response_format=json_object`/校验器与 M2.7 基线**逐字一致**;仅新增显式 `max_tokens=4096`、逐次时延记录、空 content 重试(本次未触发)。调用消耗 53/70(1 探测 + 52 正式,0 重试)。
|
||
|
||
## 一、结论速览
|
||
|
||
| 指标 | MiniMax-M3 | M2.7 基线(spike-eval.csv) |
|
||
|---|---|---|
|
||
| 结构层通过率 | **22/52 = 42.3%** | **52/52 = 100%** |
|
||
| HTTP 通 / JSON 合法 | 52 / 22 | 52 / 52 |
|
||
| 平均时延 | **10383ms**(P50 8921ms,最大 55233ms) | 基线未记录时延,不可比 |
|
||
| C2 闸门初判 | **<60% → 转纯模板填充**(按既有闸门规则) | ≥80% → 可接 Dify |
|
||
|
||
分模板:clicker 5/13(38.5%)、dodge 4/13(30.8%)、runner 6/13(46.2%)、match 7/13(53.8%)。
|
||
|
||
## 二、失败明细与归因(30 例失败 100% 同根因)
|
||
|
||
- **30/30 失败全部为 `json_parse` 失败,且 content 均以 `<think>` 开头**——M3 把推理过程直接泄漏进 `message.content`(未拆分到 `reasoning_content`),即使已显式 `response_format=json_object` + `max_tokens=4096`。
|
||
- **0 例字段级 schema 失败**:凡产出纯 JSON 的 22 例,templateId/数值范围/枚举/非空字符串逐字段全部通过——M3 的字段遵循能力本身没有问题,败在输出通道纪律。
|
||
- 时延旁证:失败例均值 13753ms vs 通过例均值 5788ms(think 块拉长输出)。
|
||
- 行为是**概率性**的:跑批前同配置探测调用返回过干净 JSON(8258ms,无 think)。
|
||
- 失败用例索引(模板#创意序号):clicker#0,1,3,6,7,9,11,12;dodge#0,1,3,5,6,8,10,11,12;runner#1,5,6,7,8,9,12;match#1,3,5,6,9,10。
|
||
- 注:与 C6.1 的「reasoning 吃光额度→空 content」不是同一症状——本次显式 max_tokens 后无任何空 content/重试,症状变为 think 文本**内联**进 content。
|
||
|
||
## 三、判读与建议
|
||
|
||
1. **按既有闸门规则如实判:42.3% < 60%,M3 不可在当前配方下直接接入生成链。**
|
||
2. 根因是**网关/模型侧 reasoning 分离缺陷**而非生成能力缺陷(22 例干净输出 100% 字段合规)。两条可选修复路径(均需另行评测,不在本次范围):
|
||
- 解析前剥离 `<think>...</think>` 再 `json.loads`(改配方,预计通过率显著回升——推断:CSV 截断的 config 前缀显示 think 后通常续写 JSON,但 config 列截断 200 字符未全文核实);
|
||
- 网关侧修 M3 通道的 reasoning_content 拆分。
|
||
3. 即便修复解析,**平均时延 10.4s 也明显偏慢**(通过例也要 5.8s),对生成链体验是次级风险。
|
||
|
||
## 四、执行可信度声明
|
||
|
||
- 本机 Bash 全程未被拦截,未启用 ssh mini-desktop 降级通道;无 degraded。
|
||
- 全部调用显式 `max_tokens=4096`(≥2048),温度 0.4,解析只读 `message.content`;key 仅经命令行环境变量传入,未写入任何 repo 文件。
|
||
- staging 未触碰;未运行编排器批跑;本评测为对网关的直调脚本。
|