muse-agent-example/docs/2026-07-19-回放评测-细纲首跑设计与计划.md
zizi ca7d0ada1a 修复: 收紧细纲回放失败关闭边界
外部 runner 各阶段失败写入明确终态,模型阶段保持 ok=false;detector 类别改为闭集并把目标章新角色缺卡归 judge/eval。同步双评编排状态、真实授权边界和离线测试口径。
2026-07-19 20:27:44 +08:00

26 KiB
Raw Blame History

回放评测首跑:细纲智能体单步预测

给执行代理: 本文是评审版设计与实现计划。评审通过前不得启动模型调用、不得写入正式规划或知识、不得把参考书全文复制进仓库。

目标: 在参考书的冻结时点上,验证规划槽位能否根据截至第 N 章可见的大纲、设定摘要和知识卡,预测第 N+1 章的细纲,并初步测量卡的增量价值。

架构: 以 planning purpose 经过统一读取器组装冻结快照;同一个规划智能体运行“无卡 / 正确卡 / 错配卡”三臂,只允许卡注入块不同。输出先经过细纲结构检查和一致性审查,再由独立评委依据目标章事实摘要盲评。参考书只作为评测标准底座,结果落 Shadow 评测产物,不进入正式规划、正文或 Local KB。

技术栈: agent-example 文件版实验台、PostgreSQL muse-example 只读查询、现有 planning/read-context/detect/quality-gate skill、Opus 规划与评审子代理;确定性冻结和校验脚本使用仓库 .venv 的 Python。

执行状态(2026-07-19)

  • 已落地并同步到 agent-example/main:fbb262c(冻结/细纲/评分合同)、a54a3a4(审查反馈收紧与回放编排)、1243d9b(外部 planner execute 链路测试)。
  • 已验证:replay-eval 58 个离线测试、fine-outline 合同 3 个测试全部通过;fake runner 已跑通三臂 planner、逐臂 detector、双 judge 反序盲评、稳定性门和去盲矩阵。测试只使用合成 fixture,不代表参考作品评测结果。
  • 已新增并验证:audit_leakage.py 对公共快照和三臂卡注入区执行内容级事实审计;load_reference_work.py 通过 PostgreSQL 只读事务组装仓库外临时配置,候选卡标记为 eval_draft,不进入生产检索。
  • 已执行真实适配 smoke:work=8、冻结 488、目标 489,组装 31 个完整历史大纲窗、6 个近章细纲摘要、正确/错配卡各 2 张;送入回放仍为 blocked_authorization(example_reference_work 没有授权快照),未生成 snapshot_manifest,未调用模型。
  • 已执行真实数据库前置 smoke:深空之影 work_id=8 的 example_reference_work 表没有不可变授权快照/版权用途字段,结果为 blocked_authorization,三臂均未调用模型。
  • .claude/skills/llm/scripts/test_quota.py 已统一到当前 $24/6000 契约:预算场景使用 $24.5,调用上限场景使用 6000,并增加策略常量断言。
  • 当前允许的结论是“冻结、变量控制、内容级泄露审计、候选结构门、detector/judge 双评编排和安全摘要机制已通”;不能说细纲智能体或知识卡已通过。真实授权接入和 430/489/550 实样仍待完成。

1. 结论边界

1.1 本轮要验证的命题

本轮只验证一个窄命题:

在同一参考作品、同一冻结时点、同一规划模型和同一输出合同下,正确的知识卡是否比没有卡或错配卡更能帮助规划器生成下一章的结构细纲。

它是 next_fine_outline_replay_v0,不是“全书细纲智能体已通过”。单步结果只能说明机制跑通和局部信号,不能代表长篇全书级规划能力。

1.2 明确不做

  • 不在本轮验证“大纲 + 设定”智能体本身;它是后续上游输入生产者。
  • 不把已逆向抽取的目标章细纲喂给规划器;目标章细纲只在评审侧作为代理标准答案。
  • 不让规划器读取第 N+1 章或更晚的正文、细纲、卡里程碑、窗级大纲和终态摘要。
  • 不沿用正文 run3 的文风、文笔评分;细纲没有正文语言质量维度。
  • 不把一次运行的总分写成“卡质量结论”;至少完成多个冻结点和场景类型后,才允许报告方向性信号。
  • 不把候选细纲、参考正文或目标章全文提交到仓库;临时文件只存在于运行目录,最终报告只保留评分、摘要、定位和哈希。

1.3 结论分级

级别 必要证据 允许说什么
机制跑通 1 个样本通过冻结、变量和输出门 快照、双/三臂编排和评分链路可运行
首轮方向性信号 至少 3 个目标章、至少 2 类场景、双评委顺序互换 本轮样本中卡的增量方向,以及哪些维度受益
细纲智能体暂定通过 至少 5 个目标章、不同弧线与场景,连续性和细纲结构门稳定通过 暂定可进入更大规模回归
全书级通过 滚动 N+1→N+2→N+3,状态和伏笔跨章连续,覆盖全书或预注册完整评估集 只能此时使用“全书细纲智能体通过”

2. SoT 对齐

SoT / 现有资产 本轮必须遵守的合同 首跑落法
design-docs/专题-07-知识消费契约与质量闭环.md §2、§4、§7 参考书是标准答案底座;按 purpose 选知识;知识策略、选择、注入和变量控制必须可追踪;不得留存原书全文 运行清单登记评估集版本、快照、知识策略版本、目标定位和结果摘要
design-docs/专题-03-AI编排上下文与质量评测实现规范.md §4、§5.3、§8 Context Assembly 四层、用途授权、来源版本、授权快照、运行权限包和评测输入追踪不可省略 每臂生成输入 manifest;缺 source/version/evidence/authorization 的块不进 prompt
design-docs/专题-04-生成质量门控与创作健康度设计方案.md §10 离线评估要绑定 AI task、agent/prompt/context/authorization/source/quality policy 版本 运行 ID 绑定 planner 版本、skill 版本、快照哈希、评委 rubric 版本
design-docs/专题-06-元数据驱动的智能体架构.md §6.2、§6.4、§7 参考作品面是系统侧证据;读取器按 planning purpose 做字段裁剪;演变历程只在规划侧可见 卡视图只取 章 <= N 的历史,并重新推导 N 时点状态;不把终态存储字段直接透传
.claude/skills/planning/SKILL.md 规划产出按 schema 字段全覆盖,写不出必须显式标“字段存疑”;产物是草稿,不写正文 细纲候选使用 chapter/outline 已有字段,不新造“细纲卡”一级模型
.claude/skills/read-context/SKILL.md 所有作品上下文必须经过统一读取器;planner purpose 看全局规划面;输出裁剪回显 回放脚本负责冻结和登记,实际 prompt 采用 read-context 兼容的四层包结构
.claude/skills/detect/SKILL.md 检查项由 schema 的 detection 字段驱动;只产报告,不修改候选 审查细纲目标、事件顺序、伏笔动作、实体当前态和未来信息来源
.claude/skills/quality-gate/SKILL.md 评分必须有引文证据,评委不可自行放宽标准 为规划回放增加独立 rubric profile;不把正文 8 维直接复用到细纲
docs/2026-07-16-批9c-收官与优化方案.md run3 卡是索引,不能挤掉原文;n=1 不下结论;内容级错位可能造成泄露 规划层把这三条变成输入冻结、样本分层和结论门禁

2.1 现状证据

主代理在只读数据库查询中核实了以下事实:

  • 深空之影 work_id=8 有 594 章,章号 1–594;594 章均有 example_parse_scaffold 细纲。
  • 窗级大纲均有 from_order/to_order,但 window_no 存在乱序,冻结和排序只能使用绝对章号及 from_order/to_order。
  • 活跃升格卡按型为 character 556、item 241、event 174、location 140、faction 58、power_system 9、character_relation 229。
  • 第 489 章已有章级细纲和正文,但它只能作为本轮目标标准的临时运行输入,不能进入规划器快照。

现有正文 run3 资料仍是历史实验遗留;其中包含原书全文,后续首跑不得复制这种产物形态,也不把它当新的合规基线。清理历史遗留物需要单独授权,不在本计划内执行删除。


3. 评测单位与样本

3.1 单个评测单位

一个评测单位固定为:

reference_work=深空之影
freeze_chapter=N
target_chapter=N+1
snapshot_version=冻结快照版本
arm ∈ {outline_only, outline_plus_cards, outline_plus_placebo_cards}

规划器只收到 target_chapter=N+1 和输出合同,不收到“目标章是什么戏”、目标实体清单或目标章标签。目标章场景类型仅用于评估集分层和结果分析。

3.2 首轮样本登记

首轮预注册 3 个候选目标章,先做机械泄露审计,审计失败则从同一场景层替换,不临时挑“卡看起来有优势”的章节:

候选目标章 冻结点 预注册场景层 选择理由
430 429 撤退 / 身份信息揭示 / 审讯承接 老角色与既有关系复用,检验卡对连续设定的帮助
489 488 攻坚 / 反转 / 新角色登场 延续正文 run3 的可比样本,同时暴露单章新角色缺卡问题
550 549 高强度首领战 / 能力跃升 检验力量体系、角色成长和战斗因果的规划价值

这 3 个编号是评估集登记信息,不进入任何 planner prompt。最终样本必须满足:目标章脚手架已完成、前置大纲窗可冻结、目标相关卡可生成 as_of=N 视图、授权双闸通过、内容级泄露审计通过。

3.3 金标准的诚实口径

当前 example_parse_scaffold 是从参考正文逆向抽出的中间资产,不是作者原始细纲。因此本轮将目标章标准称为 reference scaffold proxy:

  • 它用于对账章目标、关键事件、实体、伏笔动作和钩子等可结构化事实。
  • 它不能单独证明“作者原本就这样规划”,也不能用词面相似度判定规划质量。
  • 每个样本要记录 proxy 的抽取状态、版本和覆盖风险;目标脚手架缺字段时,该维度标 gold_uncertain,不把模型错判。
  • 若首轮要升级为“规划方向正确”的结论,需另加独立人工/评审事实摘要,且事实摘要只保留结构化要素和章节定位。

4. 冻结快照设计

4.1 冻结规则

冻结不是简单执行 chapter <= N。快照生成器必须同时执行以下规则:

  1. 章级正文、章级细纲、出场记录和里程碑只允许使用绝对章号 <= N。
  2. 窗级大纲只取 to_order <= N 的完整窗口;跨过 N 的部分窗口整窗排除,不按 window_no 判断。
  3. 卡的演变历程只保留章号或章区间明确落在 N 以前的条目;无法证明上界 <= N 的条目排除并计入 omittedSources。
  4. 终态摘要、当前态、成长弧线、事件结果、关系计划等静态字段不能直接使用;必须从安全历史重新推导 N 时点视图,无法推导就标 unknown,不猜测。
  5. 关系卡的轨迹同样按内容级章号冻结;带 [窗N]、无绝对章号或只写模糊阶段的记录不得作为已发生事实注入。
  6. 由目标章反向推导出的实体清单、目标章主题词和目标章事件不得参与 planner 侧卡选择;卡召回只依据 N 时点已经可见的主线、状态和已知实体。
  7. 任何内容审计发现未来事实疑似被错误标成 <=N,该评测单位整体标记 invalid_snapshot,不通过重试掩盖。

4.2 快照分区

每个运行单元产生临时 snapshot_manifest,只保存哈希、来源定位、字段裁剪和大小,不保存原书全文:

分区 内容 两臂/三臂关系
L0 任务:target_chapter=N+1、细纲输出合同、未知项纪律、字数/字段约束 完全相同
L1 N 时点的当前叙事状态、前几章结构摘要、活动线程摘要 完全相同
L2 截至 N 的完整窗级大纲、作品核心/世界摘要、规划所需的安全事实 完全相同
L2-card 正确卡的规划视图:实体/关系/事件的当前态、演变历史、章号指针 仅正确卡臂
L2-placebo 同型、近似数量和近似体量的非目标错配卡 仅错配卡臂
回显 omittedFields、omittedSources、来源版本、权限和预算结果 完全记录

outline_only 不是“什么都不给”:它保留与卡无关的安全大纲、状态和作品摘要;这样测的是“加入正确卡块的增量”,而不是把一个饥饿输入与完整输入比较。

4.3 授权与来源门

运行前必须同时满足:

  • reference_work 的版权状态不是 unauthorized,并且有不可变授权快照;
  • 授权快照的 allowedPurpose 明确包含离线评测;
  • 来源状态、版本、检查时间和过期/重验条件已登记;
  • 参考正文只作为受控运行时输入,最终报告不留全文;
  • 当前实验台若不能从权威记录机械读出上述字段,直接 BLOCKED_AUTHORIZATION,不拿 notes 或本地口头许可冒充授权合同。

4.4 内容级防泄露审计

冻结脚本完成后,另跑审计脚本,审计过程可以读取目标章的结构化标准,但不能修改 planner 快照:

  • 检查快照中的事件/实体/专名是否只在目标章或之后首次出现;
  • 检查卡里程碑文本是否包含目标章关键反转、结果或未来专名;
  • 检查完整大纲窗口是否跨过 N;
  • 检查正确卡、错配卡和无卡臂的来源集合差异是否符合预注册;
  • 任何可疑匹配都输出定位和哈希,样本作废,不用评委“酌情忽略”。

5. 三臂变量控制

5.1 三臂定义

臂 输入 目的
A outline_only 公共冻结快照,不含 Local KB 卡块 无卡基线
B outline_plus_cards A + 截至 N 的正确卡规划视图 测正确卡的增量
C outline_plus_placebo_cards A + 同型/近量/错配卡 排除“只要多给文字就能得分”的假阳性

三臂使用同一个 planner 身份段、同一个 fine-outline 功能段、同一个模型路由、同一个预算、同一个输出 schema 和同一个任务说明。唯一输入差异是卡注入分区;运行时必须对三份 manifest 做机器 diff,出现其他差异即整组作废。

5.2 卡选择纪律

  • 正确卡只能依据 N 时点的活动线程、已知实体和规划选择契约召回,不能使用目标章的出场列表。
  • 错配卡从同书、同型、同冻结点的其他线程抽取,保持卡数量、类型和字符量在预注册容差内;不能故意使用明显无关的垃圾文本。
  • 没有可证明的卡选择记录时,不能声称“卡检索有效”,只能把 B 臂当成手工注入实验。
  • 关系卡向量未补齐时,不能混用“向量召回”和“直接全量查询”两种策略;首跑必须固定一种,并在 manifest 标明策略版本。

5.3 规划器输出合同

候选细纲只允许输出以下结构字段:

  1. 目标章号与章节目标;
  2. 有序关键事件,每项包含参与者、触发因果和结果方向;
  3. 出场实体及其本章作用;
  4. 伏笔动作:埋 / 推进 / 回收 / 不确定,不得把未知项静默写成已知事实;
  5. N 时点状态变化和章末钩子;
  6. unknowns / assumptions:卡和冻结资料无法证明的内容;
  7. 来源引用只允许回指冻结快照中的来源 ID,不得粘贴原文。

字段缺失、章号错误、事件顺序无法解析、输出夹带正文或未来来源引用,先判 schema_invalid,不进入质量分。


6. 审查与评分

6.1 审查智能体

审查使用现有 detector,但要新增“细纲候选”输入分支;它只看到冻结到 N 的 writer/planner 基线加检测增量,不看到目标章标准事实。检查:

  • 细纲字段是否完整、事件顺序是否自洽;
  • 角色/势力/地点/能力是否违反 N 时点已知事实;
  • 伏笔动作是否与 N 时点台账冲突;
  • 是否把 unknown 写成确定事实;
  • 是否出现候选自身引用未来来源的证据。

审查只产报告,不改候选;高严重度阻断项不进入盲评。“卡里缺少目标新角色”需要目标章标准事实才能判断,由 judge/eval 侧单列,detector 不得判断或输出该类别。

6.2 细纲专用评委

使用现有 judge 保护节点,新增 fine_outline_replay rubric profile;不沿用正文 style_fit、readability、文笔 等维度。建议维度如下:

维度 评分问题 证据来源
结构完整 目标、事件、出场、伏笔、状态、钩子是否齐全 候选结构 + 输出合同
方向与因果 关键冲突和结果方向是否命中,因果是否成立 proxy fact summary
顺序与节拍 事件的先后和章内推进是否接近标准 proxy fact summary
实体与状态 角色、势力、能力层级和 N 时点状态是否一致 冻结快照 + proxy
伏笔动作 埋、推、收的动作和时机是否正确 proxy fact summary
承接与钩子 是否能从 N 时点自然承接,并把下一步悬念立住 N 时点快照 + proxy

每维 1–5 分,每个分数必须附结构化证据摘要。评委不得根据目标章全文自由发挥,也不得因为候选“写得好看”给细纲加分。

6.3 盲评与归因

  • 每个目标章至少两次独立评审,候选标签随机化并把 A/B/C 顺序互换。
  • 评委只看到候选、冻结快照和标准事实摘要,不看到 arm 名称、卡 manifest 或其他评委结果。
  • 汇总同时报告每维分数、结构门通过率、B-A 卡增量、C-A placebo 差异和评委间最大差异。
  • 不用一个加权总分掩盖“事件命中下降但文案完整度上升”的情况;结论以维度级方向为主。
  • 若同一维两次评分差异大于 0.5,先判评委稳定性不足,不进入卡效用结论。

6.4 假阴 / 假阳清单

类型 可能原因 首跑控制
假阴 正确卡未被召回、关系卡缺失、冻结过度、目标场景天然依赖原文、proxy 漏事件 三臂、卡选择 manifest、至少两类场景、proxy 不确定维度降权/剔除
假阴 planner 以为卡已足够而少用公共大纲 三臂输入共用大纲,记录实际检索/引用卡 ID
假阳 未来事件/终态摘要泄露、错配卡只是额外文字、目标章信息参与召回 内容级泄露审计、placebo 臂、目标实体禁入选择器
假阳 评委偏爱词面相似、参考细纲本身有误 结构化事实评分、两评委、proxy confidence、禁止正文文风维度
误归因 新角色无卡但某臂猜中、模型随机性、模型路由不一致 judge/eval 单列新角色缺卡;固定路由/预算;重复评审;不以 n=1 判决

7. 产物与隐私边界

7.1 临时产物

运行目录保存:

  • 三臂冻结 manifest、来源版本、哈希、裁剪回显;
  • planner 候选和 judge 输入,只在运行期间保留;
  • 审查报告和原始评分中间件;
  • 目标标准的结构化事实摘要临时文件。

这些文件必须进入 gitignore 或 /tmp,不得复制原书正文、原章全文或完整外部知识到仓库。

7.2 最终报告

提交到 docs/replay/ 的只能是:

  • run_id、评估集版本、策略/skill/agent/prompt 版本;
  • 目标章节定位和冻结点,不留原文;
  • 三臂每维分数、结构门结果、评委一致性;
  • 卡命中/使用统计的摘要;
  • 失败样本的类别、原因、哈希和重跑建议;
  • 假阴/假阳分析和结论边界。

不得写入:原书正文、完整目标细纲、模型完整 prompt/response、token、密钥、供应商原始响应或未脱敏授权资料。


8. 实现计划

Task 1:冻结快照与合规预检

Files:

  • Create: .claude/skills/replay-eval/SKILL.md

  • Create: .claude/skills/replay-eval/scripts/build_snapshot.py

  • Create: .claude/skills/replay-eval/scripts/check_snapshot.py

  • Create: .claude/skills/replay-eval/scripts/audit_leakage.py

  • Create: .claude/skills/replay-eval/scripts/load_reference_work.py

  • Test: .claude/skills/replay-eval/scripts/test_snapshot.py

  • Test: .claude/skills/replay-eval/scripts/test_audit_leakage.py

  • Test: .claude/skills/replay-eval/scripts/test_load_reference_work.py

  • 建立 next_fine_outline_replay_v0 manifest:作品、N、目标章、评估集版本、策略版本、授权快照、来源版本、运行权限包和臂配置。

  • 按绝对章号构造 L0/L1/L2;完整窗口必须使用 to_order <= N,不能依赖 window_no。

  • 将卡生成 as_of=N 规划视图,剔除终态字段、未来里程碑、无绝对上界条目和无法溯源字段。

  • 预检授权双闸、来源状态、目标章禁读、候选卡选择来源和原书全文不落最终报告。

  • 用离线 fixture 覆盖未来里程碑、跨 N 窗口、章号归一化、嵌套章记录、终态裁剪、缺授权失败关闭和三臂公共区哈希一致。

  • 增加目标章内容级事实泄露审计,发现错位事件或臂内卡未来记录时整例作废;审计结果只保留路径和哈希。

  • 增加 PostgreSQL 只读参考作品适配器;只读取结构化大纲/细纲摘要和预注册卡,目标章仅进入临时审计 proxy,缺授权不放行。

Task 2:细纲智能体功能合同

Files:

  • Create: .claude/skills/fine-outline/SKILL.md

  • Modify: .claude/agents/planner.md

  • Modify: meta/chains/README.md

  • Test: .claude/skills/fine-outline/scripts/test_contract.py

  • 把细纲定义为 planner 的一个 planning 场景,不新造一级知识模型或新 agent 类型。

  • 固定候选字段、未知项纪律、不得写正文/正式规划的 Shadow 边界。

  • 登记 fine_outline 链:read-context(planning replay view) → planner → detector → judge;用户确认不在离线回放内执行。

  • 结构校验覆盖字段缺失、章号错误、重复事件、未来来源引用、嵌套字段闭集和正文误输出。

Task 3:细纲审查与评分合同

Files:

  • Modify: .claude/skills/detect/SKILL.md

  • Modify: .claude/skills/quality-gate/SKILL.md

  • Modify: .claude/agents/judge.md

  • Test: .claude/skills/replay-eval/scripts/test_rubric.py

  • 给 detector 增加细纲候选的检查对象、严重度和证据格式。

  • 给 judge 增加 fine_outline_replay rubric profile,明确不评正文文风和文笔。

  • 在回放编排中固定两个独立 judge、匿名 arm 和第二评委候选顺序反转;fake runner 已覆盖双评、rubric 合同和稳定性失败关闭,真实样本尚未越过授权门。

  • 机械测试确保 rubric 不包含正文质量维度,且每个分数必须有证据字段。

Task 4:回放编排与最小首跑

Files:

  • Create: .claude/skills/replay-eval/scripts/run_replay.py

  • Create: .claude/skills/replay-eval/scripts/write_report.py

  • Test: .claude/skills/replay-eval/scripts/test_run_replay.py

  • Create: docs/replay/<run-id>-summary.md

  • 先用合成 fixture 完成一个机制 dry-run,并用 fake planner 验证 execute 链路;真实样本尚未越过授权门。

  • 编排器支持每个目标章 A/B/C 三臂,planner 使用相同身份段、功能段、预算和输出合同;尚未运行参考作品目标章。

  • 两个独立 judge 对每章候选做顺序互换盲评;detector 阻断样本不送 judge。当前由 fake runner 离线测试验证,尚无真实样本结果。

  • 运行时原始候选和标准事实摘要只放仓库外临时目录;安全报告只写摘要、定位、评分入口、哈希和失败类别。

  • 接入真实数据库只读适配 smoke;授权缺失时维持 blocked_authorization,不启动 planner。

  • 产出真实卡增量矩阵和样本级假阴/假阳说明;不能用机制 smoke 的合成结果代替。

Task 5:滚动评估门

Files:

  • Modify: docs/2026-07-19-回放评测-细纲首跑设计与计划.md

  • Modify: docs/2026-07-16-批9c-收官与优化方案.md

  • 只有 3 样本首轮通过后,才登记 5+ 样本的扩展评估集。

  • 只有连续 N+1→N+2→N+3 的状态和伏笔检查通过后,才允许使用“全书细纲”表述。

  • 每次知识选择/注入策略变化必须新建策略版本并重新回放,不能覆盖历史结果。

  • 将可复用结论回填到专题-07 或对应 .agents 长期知识;一次性运行噪音从 docs/ 蒸馏后清理。


9. 评审门与执行顺序

评审版先由独立审查确认以下事项,再进入实现:

  1. 是否同意本轮只测单步 fine_outline,不宣称全书智能体通过;
  2. 是否同意深空之影 430/489/550 为预注册候选,内容审计失败时按同层替换;
  3. 是否接受三臂(正确卡 / 无卡 / 错配卡)而不是只做有卡/无卡;
  4. 是否有可验证的 reference_work 授权快照,且 allowedPurpose 含离线评测;
  5. 是否接受当前逆向脚手架只能称 proxy standard,不把它当作者原始大纲;
  6. 是否同意首跑只保存评分、摘要、定位和哈希,原始正文/细纲只在临时运行目录存在。

未通过任一门禁时,状态为 blocked_before_run,不得以“先跑看看”绕过设计。

10. 已验证事实、推断与假设

已验证事实

  • 专题-07 §4 明确三条回放线、两道授权闸和原书全文不留存约束。
  • agent-example 的 planning、read-context、detect、quality-gate 目前都是流程/合同文件,不是完整的回放执行器。
  • 深空之影 work=8 的 594 章细纲和升格卡已在实验库可查;窗号与章号不是同一稳定键。
  • 正文 run3 已完成:它验证的是正文 writer 层,不是细纲智能体。

推断

  • 细纲首跑最小正确单位应是“冻结到 N,预测 N+1”,而不是一次生成整本细纲。
  • 细纲评估应复用 planner agent 身份,通过新增功能合同区分细纲输出,不宜新造一个与 SoT 不对应的 agent 类型。
  • 错配卡臂能帮助识别“卡只是额外上下文”造成的假阳性,但仍不能单独证明卡内容质量。

待确认假设

  • 实验库能提供可被审计的离线评测授权快照;若不能,先补授权记录,不以本地文件替代。
  • 430、489、550 的目标章均能通过内容级冻结审计;若不能,按同场景层替换。
  • 当前升格卡的关系信息可用固定结构选择或在首跑前完成向量补齐;两种策略不得混跑。