6.3 KiB
6.3 KiB
name, description, disable-model-invocation
| name | description | disable-model-invocation |
|---|---|---|
| 审核知识卡 | 以三种编辑视角审核公共知识卡的成立性、创作可用性和跨书复用性,并写回 pass、revise 或 reject。拆书产出公共卡后使用;不负责生成卡或确认作品私有知识。 | true |
审核公共知识卡
创始人拍板(2026-07-13):审核是流程内可复用资产,不是每批都请 claude 角色扮演——
- 常设执行:MiniMax-M3 扮三角色(番茄作家=爽点商业性 / 起点作家=结构工艺 / 主编=资产 vs 噪声),每批拆书产出的卡过一遍;
- fable/opus 职责:起量前出金标准校准本 skill(golden/),起量后做一次总审核;
- 判定写回
draft_payload.审核节(批次/均分/判定/三角色分与判词),可追溯可复审。
用法
# 审核(全部或指定书的活卡;三角色各一次 M3 调用)
.venv/bin/python muse/content/entity/skills/review/审核知识卡/scripts/review_cards.py review --batch <批次> [--work-id N] [--dry-run]
# 校准:与 golden/scores.json(opus 金标准)对照(换模型/改 prompt 后必跑);过线则写 golden/calibrate-stamp.json
.venv/bin/python muse/content/entity/skills/review/审核知识卡/scripts/review_cards.py calibrate --batch cal-002
判定阈值:三角色九维均分 ≥3.5 pass / ≥2.5 revise / 其余 reject。
统一判定闸(自 opus 金标准三评审蒸馏,内嵌于审核 prompt)
换书测试(抹专名换题材仍成立?)· 命名黑话检测 · 装置标签判定(信息差/契诃夫之枪/身份错认各有硬定义)· 伪精确检测(编造的间隔数字)· 同功重复(family 换皮)· 干货位检查(失败模式比手法值钱=手法空洞)· 专名泄漏。
校准记录
| 日期 | 批次 | 结果 |
|---|---|---|
| 2026-07-13 | cal-001(19 卡试拆批) | 平均绝对偏差 0.45(合格线 ≤0.5)、平均偏差 -0.08(无系统倾向)、最大背离 1.33<1.5;8 卡偏差 ≤0.11。M3 三角色总评独立复现金标准全部四大系统病(同功撞车/命名黑话/伪精确/专名污染)。已知弱点:对「场景级走位 vs 可复用范式」辨别偏松(《路人搭讪道具借用式情报截流》金 2.67 → M3 4.0)。 |
| 2026-07-16 | cal-002(30 卡放量终态批,星环/机动跨五型伪随机抽样,opus 盲评金标准=golden/scores-cal002.json) |
背景:批9 全量审核开跑前未复验旧校准(卡形态已经窗级重构+三轮治理大改),创始人叫停纠正。旧尺子实测 MAE 0.489 压线、bias +0.215 系统性偏松、判定一致 70%、金标 revise 被放行 5/14(pass 假阳 36%)。修法:CRITERIA 增评分硬规则(伪精确无实测标注→can≤3 / 标签错贴→cheng≤3 / 同功换皮家族仅最佳一张正常分 / 审慎默认拿不准往低打 / 4 分以上须自证)。复验:MAE 0.326、bias -0.156(略偏严=安全方向:错杀进 revise 桶可复审救回,假阳进库不可救)、判定一致 77%、放行降至 1 张。教训固化:卡形态变更后校准必须复验——先校准后放量,不能拿三天前的合格证直接放量。 |
金标准:golden/金标准-{番茄作家,起点作家,主编}-2026-07-13.md + golden/scores.json(19 卡九维均分)+ golden/scores-cal002.json(cal-002 30 卡 opus 盲评)。
金标准对拆书 prompt 的改进清单(B4 优化环的输入,未实施)
- 技法指纹先行+跨章聚类去重(母卡+多出处实例,消灭 family 换皮);
- 换书测试闸门+强制占位符(专名/数字打回);
- 两类卡模板:结构型伏笔卡(埋点/回收点/隔章记忆维持三件套)vs 场景型手法卡(复用节奏/异质化/每章上限)——不再硬套埋设/履约框架;
- 装置类型闭合枚举+判定测试;禁「信息差」当万能主标签;
- 翻转重心:每卡强制可迁移因果原则「当X做Y因为读者会Z」+触发条件+滥用反例;砍编造数字;
- 补「读者收益」字段(代入/掌控/期待/打脸/意外);命名用作者短语(「先知降压」),长名降副标题;
- 采样扩到中段爽点章(打脸/升级/反转),别只啃前三章。
输入
- 活卡或指定
--work-id的muse_knowledge_draft公共范式卡(draft_payload含技法字段与实例章号)。 - 可选:
golden/scores.json或golden/scores-cal002.json金标准(校准子命令)。
输出
- 写回每张卡的
draft_payload.审核:批次 id、三角色九维均分、判定(pass/revise/reject)与判词摘要。 calibrate产出与金标准的 MAE、bias、判定一致率报告(不写库时可 stdout)。
数据边界
- 读取:
muse_knowledge_draft与关联作品元数据;校准读golden/本地金标准。 - 写入:仅更新卡
draft_payload.审核节与审核时间戳;不确认卡、不改作品私有知识、不直接改knowledge/Git 资产。 - 模型:常设审核走 M3 三角色;fable/opus 只用于金标准产出与起量后总审核,不进每批循环。
红线
- 不负责生成卡或确认作品私有知识;确认归
确认知识草稿/ 管理员 G3 门。 - 判定阈值固定:三角色九维均分 ≥3.5 pass / ≥2.5 revise / 其余 reject;不得为放量放水。
- 卡形态或 prompt 变更后必须重跑
calibrate刷新 stamp,禁止复用过期合格证。 --dry-run必须可完整走通推理链但不写库。
复利合同
- 非 dry-run 写回审核节后经
propose_lesson_dedup登记example_lesson(绑 work_id / batch / 判定统计)。 - 升格仍走人工评审;系统性假阳须先
calibrate再放量。
失败关闭
- LLM 推理阶段不持写连接;写库在全新短连接批量 UPDATE,中途异常整批回滚。
--dry-run可完整走通推理链但不写库、不登记 lesson。- 三角色全链敏感 → 卡标
blocked写入遗留项,不静默跳过;整批无卡可写时仍可提交 blocked 审计。 - 放量写库(
--batch不以cal-开头)必须持有golden/calibrate-stamp.json:判定闸指纹吻合且 MAE≤0.5、单卡背离<1.5;过期或未过线一律拒绝。 - 校准批次
cal-*允许在无 stamp 时写库,专供产出对照样本;calibrate写 stamp,合格后才可放量。