zizi
|
5c54289b56
|
docs(eval)+fix(orchestrator): 三模型评估矩阵收口——主力 M2.7 留任/裁判 v4-flash + llm_client 固化显式 max_tokens
- 评估矩阵全档入库: M3 结构层 22/52(30 失败全为 <think> 泄漏进 content, 通道纪律非能力,
接入前置=解析侧剥 think) / v4-pro 52/52 持平但'质量不劣/时延可对照'两证据缺口→头号替补
/ 裁判对决 flash 23/25=92% 四维全胜(pro 击穿正向守卫=过杀复发)
- 第二批配置定型: 主模型 MiniMax-M2.7 + AUDIT deepseek-v4-flash + max_tokens=4096 固化
- llm_client.py: 显式 max_tokens=4096(推理型空 content 22 次重试实证根治)
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
|
2026-06-10 04:52:59 +00:00 |
|