6.3 KiB
Raw Blame History

name, description, disable-model-invocation
name description disable-model-invocation
review-knowledge-cards 以三种编辑视角审核公共知识卡的成立性、创作可用性和跨书复用性,并写回 pass、revise 或 reject。拆书产出公共卡后使用;不负责生成卡或确认作品私有知识。 true

审核公共知识卡

创始人拍板(2026-07-13):审核是流程内可复用资产,不是每批都请 claude 角色扮演——

  • 常设执行:MiniMax-M3 扮三角色(番茄作家=爽点商业性 / 起点作家=结构工艺 / 主编=资产 vs 噪声),每批拆书产出的卡过一遍;
  • fable/opus 职责:起量前出金标准校准本 skill(golden/),起量后做一次总审核;
  • 判定写回 draft_payload.审核 节(批次/均分/判定/三角色分与判词),可追溯可复审。

用法

# 审核(全部或指定书的活卡;三角色各一次 M3 调用)
.venv/bin/python muse/content/entity/skills/review/review-knowledge-cards/scripts/review_cards.py review --batch <批次> [--work-id N] [--dry-run]

# 校准:与 golden/scores.json(opus 金标准)对照(换模型/改 prompt 后必跑);过线则写 golden/calibrate-stamp.json
.venv/bin/python muse/content/entity/skills/review/review-knowledge-cards/scripts/review_cards.py calibrate --batch cal-002

判定阈值:三角色九维均分 ≥3.5 pass / ≥2.5 revise / 其余 reject。

统一判定闸(自 opus 金标准三评审蒸馏,内嵌于审核 prompt)

换书测试(抹专名换题材仍成立?)· 命名黑话检测 · 装置标签判定(信息差/契诃夫之枪/身份错认各有硬定义)· 伪精确检测(编造的间隔数字)· 同功重复(family 换皮)· 干货位检查(失败模式比手法值钱=手法空洞)· 专名泄漏。

校准记录

日期 批次 结果
2026-07-13 cal-001(19 卡试拆批) 平均绝对偏差 0.45(合格线 ≤0.5)、平均偏差 -0.08(无系统倾向)、最大背离 1.33<1.5;8 卡偏差 ≤0.11。M3 三角色总评独立复现金标准全部四大系统病(同功撞车/命名黑话/伪精确/专名污染)。已知弱点:对「场景级走位 vs 可复用范式」辨别偏松(《路人搭讪道具借用式情报截流》金 2.67 → M3 4.0)。
2026-07-16 cal-002(30 卡放量终态批,星环/机动跨五型伪随机抽样,opus 盲评金标准=golden/scores-cal002.json) 背景:批9 全量审核开跑前未复验旧校准(卡形态已经窗级重构+三轮治理大改),创始人叫停纠正。旧尺子实测 MAE 0.489 压线、bias +0.215 系统性偏松、判定一致 70%、金标 revise 被放行 5/14(pass 假阳 36%)。修法:CRITERIA 增评分硬规则(伪精确无实测标注→can≤3 / 标签错贴→cheng≤3 / 同功换皮家族仅最佳一张正常分 / 审慎默认拿不准往低打 / 4 分以上须自证)。复验:MAE 0.326、bias -0.156(略偏严=安全方向:错杀进 revise 桶可复审救回,假阳进库不可救)、判定一致 77%、放行降至 1 张。教训固化:卡形态变更后校准必须复验——先校准后放量,不能拿三天前的合格证直接放量。

金标准:golden/金标准-{番茄作家,起点作家,主编}-2026-07-13.md + golden/scores.json(19 卡九维均分)+ golden/scores-cal002.json(cal-002 30 卡 opus 盲评)。

金标准对拆书 prompt 的改进清单(B4 优化环的输入,未实施)

  1. 技法指纹先行+跨章聚类去重(母卡+多出处实例,消灭 family 换皮);
  2. 换书测试闸门+强制占位符(专名/数字打回);
  3. 两类卡模板:结构型伏笔卡(埋点/回收点/隔章记忆维持三件套)vs 场景型手法卡(复用节奏/异质化/每章上限)——不再硬套埋设/履约框架;
  4. 装置类型闭合枚举+判定测试;禁「信息差」当万能主标签;
  5. 翻转重心:每卡强制可迁移因果原则「当X做Y因为读者会Z」+触发条件+滥用反例;砍编造数字;
  6. 补「读者收益」字段(代入/掌控/期待/打脸/意外);命名用作者短语(「先知降压」),长名降副标题;
  7. 采样扩到中段爽点章(打脸/升级/反转),别只啃前三章。

输入

  • 活卡或指定 --work-id 的 muse_knowledge_draft 公共范式卡(draft_payload 含技法字段与实例章号)。
  • 可选:golden/scores.json 或 golden/scores-cal002.json 金标准(校准子命令)。

输出

  • 写回每张卡的 draft_payload.审核:批次 id、三角色九维均分、判定(pass/revise/reject)与判词摘要。
  • calibrate 产出与金标准的 MAE、bias、判定一致率报告(不写库时可 stdout)。

数据边界

  • 读取:muse_knowledge_draft 与关联作品元数据;校准读 golden/ 本地金标准。
  • 写入:仅更新卡 draft_payload.审核 节与审核时间戳;不确认卡、不改作品私有知识、不直接改 knowledge/ Git 资产。
  • 模型:常设审核走 M3 三角色;fable/opus 只用于金标准产出与起量后总审核,不进每批循环。

红线

  • 不负责生成卡或确认作品私有知识;确认归 confirm-knowledge-draft / 管理员 G3 门。
  • 判定阈值固定:三角色九维均分 ≥3.5 pass / ≥2.5 revise / 其余 reject;不得为放量放水。
  • 卡形态或 prompt 变更后必须重跑 calibrate 刷新 stamp,禁止复用过期合格证。
  • --dry-run 必须可完整走通推理链但不写库。

复利合同

  • 非 dry-run 写回审核节后经 propose_lesson_dedup 登记 example_lesson(绑 work_id / batch / 判定统计)。
  • 升格仍走人工评审;系统性假阳须先 calibrate 再放量。

失败关闭

  • LLM 推理阶段不持写连接;写库在全新短连接批量 UPDATE,中途异常整批回滚。
  • --dry-run 可完整走通推理链但不写库、不登记 lesson。
  • 三角色全链敏感 → 卡标 blocked 写入遗留项,不静默跳过;整批无卡可写时仍可提交 blocked 审计。
  • 放量写库(--batch 不以 cal- 开头)必须持有 golden/calibrate-stamp.json:判定闸指纹吻合且 MAE≤0.5、单卡背离<1.5;过期或未过线一律拒绝。
  • 校准批次 cal-* 允许在无 stamp 时写库,专供产出对照样本;calibrate 写 stamp,合格后才可放量。

输入