muse-agent-example/docs/2026-08-20-质量收敛环运行手册.md
zizi 9e6f1c4481 R2 改造交付:新版模块化单体全量成果
- src/muse 新版全模块(装配/共享/上下文/任务运行/作品规划/故事世界/正文写作/审校修订/知识方法/作者经验/效果评测/交付连载/资料研究/正式变更/元数据/接入/基础设施/编排)+ 测试树(单元/契约/集成/架构/迁移/端到端/夹具)
- 129 项功能全部实现与自动验证(功能覆盖.json/矩阵),含 W31 补齐的规则与代价/节奏安排/伏笔与承诺
- 旧实现按处置清单退出(702 条中 324 删,保护合同与未迁移条目留存有据);web/app.py 旧工作台退役,新工作台为唯一写入口
- 数据库/旧库迁移:真实旧库内容批次迁移链(端点守卫/PG作品正文映射/质量资产缺省投影)
- 运行手册 docs/运行手册.md;W30 本机服务阶段一已运行(infra PG 为正式内容权威)
- R2 执行证据与私有运行材料在 .agents.local/改造/R2-20260909/(不入库)
2026-09-15 12:47:42 +08:00

1.8 KiB
Raw Blame History

质量收敛环运行手册(实验性)

状态:历史实验流程,不是任何 Skill 的现行合同。现行归因入口是 optimize-content-quality(只出建议);评分归 score-content-quality;Gate 终态归 adjudicate-quality-gate。

目标

把某一章(或某类场景)的生成质量收敛到叙事关键三维全部 ≥4.0(专题-04 达标口径;非关键维只出建议),并把「怎么达标的」沉淀成可复用资产。

环(n=5)

  1. 评:派 judge 对候选章打分(结构化报告落库或临时评测目录;不引用不存在的 评审/ 固定路径)。
  2. 诊:取最低两维,归因到 prompt / 上下文 / 设定三层之一(详见 optimize-content-quality 归因表)。
  3. 改:每轮只改一个变量;框架层改动须走正常 Git 流程与用户授权,设定层走 decide-candidate / confirm-knowledge-draft。
  4. 产:重新生成该章(新候选覆盖工作区),回到第 1 步。
  5. 止:叙事关键三维全部 ≥4.0,或连续两轮无提升,或满 5 轮。

收口

  • 达标:样张章文件 + 评分报告 + 当轮 agent prompt 的 git hash 固化到项目约定的金标目录(如 review-knowledge-cards 使用的 golden/ 范式),作为回归基线。
  • 不达标:把卡点(哪一维、试了什么、为什么没用)如实报给用户,不硬凑分数。

纪律

  • 评分必须有引文证据;禁止为了分数让 judge 放水。
  • 同一 rubric 复评分差 >0.5 时先查评委稳定性再查正文。
  • 正文离线 A/B/C 回放不走本环,走 writer_replay profile(见 score-content-quality)。