From ee74e2f567be107541313968d2e8e3f291bbf47b Mon Sep 17 00:00:00 2001 From: lili Date: Thu, 9 Jul 2026 08:42:32 -0700 Subject: [PATCH] =?UTF-8?q?=E6=A1=86=E6=9E=B6:=20judge=E8=AF=84=E5=88=86?= =?UTF-8?q?=E7=BB=B4=E5=BA=A6=E5=AF=B9=E9=BD=90=E4=B8=93=E9=A2=98-04(3?= =?UTF-8?q?=E5=8F=99=E4=BA=8B=E5=85=B3=E9=94=AE=E5=AE=9A=E8=BE=BE=E6=A0=87?= =?UTF-8?q?=E7=BA=BF+5=E9=9D=9E=E5=85=B3=E9=94=AE=E5=87=BA=E5=BB=BA?= =?UTF-8?q?=E8=AE=AE,=E6=9B=BF=E6=8D=A2=E8=87=AA=E9=80=A0=E5=85=AD?= =?UTF-8?q?=E7=BB=B4);LLM=E5=8A=9F=E8=83=BD=E5=85=A8=E8=A6=86=E7=9B=96?= =?UTF-8?q?=E5=AF=B9=E7=85=A7=E5=85=A5README=E9=98=B2=E6=BC=8F=E9=85=8D?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Co-Authored-By: Claude Fable 5 --- .claude/agents/judge.md | 29 +++++++++++++++++++---------- .claude/skills/eval/SKILL.md | 4 ++-- README.md | 10 ++++++---- 3 files changed, 27 insertions(+), 16 deletions(-) diff --git a/.claude/agents/judge.md b/.claude/agents/judge.md index fb5db8f..088a2ae 100644 --- a/.claude/agents/judge.md +++ b/.claude/agents/judge.md @@ -1,26 +1,35 @@ --- name: judge -description: 质量评委——按六维 rubric 给候选章打分,证据引文制,输出到评审目录。质量收敛环(eval)的打分器。 +description: 质量评委——按专题-04 质量维度体系给候选章打分(3 叙事关键+5 非关键),证据引文制,输出到评审目录。质量收敛环(eval)的打分器。 tools: Read, Grep, Glob, Write model: opus --- 你是质量评委,只做一件事:给候选章打分并指出最值得改的三点。报告落 `works/<书>/评审/第NNN章-评分.md`,除此不写任何文件。 -## 六维 rubric(各 1–5 分,五档描述) +## 评分维度(对齐 SoT 专题-04 §4;硬阻断三维 source_safety/output_compliance/static_contract 属规则层检查,不在评委职权) + +**叙事关键维度**(各 1–5;这三维定达标线,不达标触发 eval 环重写建议) | 维度 | 5 分长什么样 | |---|---| -| 连贯衔接 | 与上章即时局面无缝,场景转换不硬切 | -| 人物一致 | 语言指纹可辨认——遮住名字能认出谁在说话 | -| 文风达标 | 对照文风画像与达标样张无违和;AI 味黑名单零命中 | -| 情节推进 | 章目标完成,信息/关系/局面至少一样发生不可逆变化 | -| 张力与钩子 | 场景三件套齐整,章末钩子让人想点下一章 | -| 意外且合理 | 有出乎意料处,且回看全在设定与伏笔之内 | +| 设定一致性 canon_compliance | 与已确认正文/知识卡/正式规划/状态台账零冲突;有出乎意料处,回看全在设定与伏笔之内 | +| 角色声音 character_voice | 语言指纹可辨认——遮住名字能认出谁在说话;行为符合行事逻辑与近期章节表现 | +| 场景结构 scene_structure | 场景三件套(目标/推进/收束)齐整,因果与视角不断裂,与上章即时局面无缝衔接 | + +**非关键维度**(各 1–5;只产生建议,不单独否决候选) + +| 维度 | 5 分长什么样 | +|---|---| +| 文风贴合 style_fit | 对照文风画像与达标样张无违和;AI 味黑名单零命中 | +| 节奏张力 pacing_tension | 章目标完成,局面发生不可逆变化;章末钩子让人想点下一章 | +| 信息密度 information_density | 不过度解释不空泛;新信息与埋设按需给,无灌水段 | +| 情绪连续 emotional_continuity | 情绪变化有过渡,不突兀跳变 | +| 可读性 readability | 段落长度与句式无阅读阻力 | ## 打分纪律 - **每维给分必附一句引文证据**(好在哪/差在哪,引原句);没有证据的分数无效。 -- 总分 = 六维均值,保留一位小数;≥4.0 视为达标。 +- 达标判定(对齐专题-04 语义):**叙事关键三维全部 ≥4.0 = 过门**;非关键维度低分不否决候选,只进改进建议。 - 末尾「最值得改的三点」按提升空间排序,每点给:问题→根因猜测(prompt/上下文/设定卡哪一层)→具体改法。 -- 打分对事不对人:同一 rubric 复评同一章时分差应 ≤0.5,刻意维持严格与稳定。 +- 打分对事不对人:同一维度复评同一章时分差应 ≤0.5,刻意维持严格与稳定。 diff --git a/.claude/skills/eval/SKILL.md b/.claude/skills/eval/SKILL.md index 2cb9a93..829cdba 100644 --- a/.claude/skills/eval/SKILL.md +++ b/.claude/skills/eval/SKILL.md @@ -5,7 +5,7 @@ description: 质量收敛环——judge 打分、锁最低维、单变量改进( # 质量收敛环(n=5) -目标:把某一章(或某类场景)的生成质量收敛到总分 ≥4.0,并把"怎么达标的"沉淀成资产。 +目标:把某一章(或某类场景)的生成质量收敛到**叙事关键三维全部 ≥4.0**(专题-04 达标口径;非关键维只出建议),并把"怎么达标的"沉淀成资产。 ## 环 @@ -16,7 +16,7 @@ description: 质量收敛环——judge 打分、锁最低维、单变量改进( - 设定层:卡本身空洞(如说话方式全是空词)→ 改卡(改动走用户确认)。 3. **改**:**每轮只改一个变量**,否则归因失效;框架层改动可直接提交(`框架: …`),设定层改动走 confirm。 4. **产**:重新生成该章(新候选覆盖工作区),回到第 1 步。 -5. **止**:总分 ≥4.0,或连续两轮无提升,或满 5 轮。 +5. **止**:叙事关键三维全部 ≥4.0,或连续两轮无提升,或满 5 轮(对齐专题-04「重写次数有限」语义,本环即实验版有限重写)。 ## 收口 diff --git a/README.md b/README.md index 2730e59..5001312 100644 --- a/README.md +++ b/README.md @@ -66,9 +66,11 @@ agent-example/ | planner | 一层 · 规划(规划链槽位) | 设定包/大纲/细纲候选;字段全覆盖或标「字段存疑」;未确认不进后续生成上下文 | C2 | | extractor | 一层 · 拆书/分析(Analysis 槽位) | 两用场:**拆书**(B2,按库内 schema 产知识行草稿+出处链;系统级只产抽象范式、不留原文)与**章后抽取**(C5);冲突标「⚠ 冲突待裁决」不覆盖 | B2 / C5 | | detector | 一层 · 检测(Detection 槽位) | 一致性/伏笔/设定违背检查,只产解释与定位落 `评审/`,不改正文与知识 | C4 伴随 | -| judge | **二层 · 保护节点(质量门控与 LLM-Judge)**——不可被装配替换,即 G2 判据的活体 | 六维 rubric 1–5 打分,引文证据制,≥4.0 达标 | C6 / eval 内 | +| judge | **二层 · 保护节点(质量门控与 LLM-Judge)**——不可被装配替换,即 G2 判据的活体 | 按专题-04 §4 维度体系评分:3 叙事关键(定达标线,全部 ≥4.0 过门)+5 非关键(只出建议),引文证据制 | C6 / eval 内 | -SoT 第三层「知识基座」(检索/切块/入库,明文不是 app)在实验里即 **skill 层**(db/import/embed/search)——正好印证「所有 API/工具皆 skill」。分工判据:需要 LLM 判断的进 agent;确定性的取数、写库、外部调用、流程管控进 skill。agent 只经 skill 拿上下文与落库。 +SoT 第三层「知识基座」(检索/切块/入库,明文不是 app)在实验里即 **skill 层**(db/import/embed/search)——正好印证「所有 API/工具皆 skill」。分工判据:需要 LLM 判断的进 agent;确定性的取数、写库、外部调用、流程管控进 skill;LLM 参与但属主权裁决的落保护节点(不开放装配)。agent 只经 skill 拿上下文与落库。 + +**LLM 能力功能全覆盖对照**(SoT 功能 → 实验落点,防漏配):写作 7 功能(续写/改写/扩写/润色/纠错/去AI味/角色声音)→writer;规划 5 动作(生成/补全/整理/检查/多方案,产品-03 §3.5)→planner;分析 6 功能(目标分析/实体解析/候选草稿提取/全书解析/章节抽取/结构拆解)→extractor;检测 5 检查(风险/一致性/角色声音/文风/语义偏离)→detector;质量评分 8 维(专题-04:3 叙事关键+5 非关键)→judge;**有限重写**(≤2 次,专题-04 §5)→eval 环承担(judge 诊断+writer 重生成,人在环);**合规与语义围栏**→不镜像(阶段一由平台安全层承担,阶段二真后端承接);**组装内摘要化**(超预算先摘要低层)→read-context 流程内动作;**嵌入/重排**→embed/search skill(第三层模型能力,非 agent);**硬阻断 3 维**(来源安全/输出合规/静态结构)→规则层检查,skill/流程承担,不进评委职权。 ### 上下文组装结构(SoT=[专题-03 §4 四层上下文](../design-docs/专题-03-AI编排上下文与质量评测实现规范.md) + [专题-06 §7 统一读取器](../design-docs/专题-06-元数据驱动的智能体架构.md);操作细节以 read-context skill 为准) @@ -132,7 +134,7 @@ SoT 第三层「知识基座」(检索/切块/入库,明文不是 app)在 | U6 | 增强·槽位替换(§5.3) | 换绑写手件,证「元数据驱动」 | 链与流程零改动,产出风格切换 | | U7 | 导入解析旅程(§3.7) | 导入旧稿→解析分章→逐章审阅确认→知识草稿 | 解析结果先入待审;确认按章 | | U8 | 导出交付(§3.8) | 编译全书正文+设定导出 | 导出走确认后内容,含来源标注 | -| — | 质量收敛(伴随 U3 循环,专题-04 简化) | judge 六维 + eval n=5 收敛,达标固化 `golden/` | 评分有引文证据;≥4.0 达标 | +| — | 质量收敛(伴随 U3 循环,专题-04 简化) | judge 按专题-04 维度评分 + eval n=5 收敛,达标固化 `golden/` | 评分有引文证据;叙事关键三维 ≥4.0 达标 | 产品红线原样生效:候选决策只有三类(原样接受/修改后合并/丢弃);采纳正文≠确认知识;未确认规划不进生成上下文;绑定≠写入;保护节点不可替换(§1.1-12)。 @@ -178,7 +180,7 @@ flowchart LR | C3 | U5 绑定全局库 | 装配绑定已确认范式库,确认生效 | 绑定行;解绑即从上下文消失 | 装配暂存待确认 | | C4 | U3 续写三决策 | read-context 升 PG 检索版→候选→原样接受/修改后合并/丢弃 | 回显含裁剪清单;决策前 Canonical 零变化 | 文件版演练过一轮 | | C5 | U4 知识确认旅程 | 章后抽取→草稿→自动确认(自有正文+无冲突)/冲突入待确认队列;**新知识回库供下一章=作品内环闭合** | 采纳正文≠确认知识;冲突必人工 | 未做 | -| C6 | 质量收敛(伴随 C4) | judge 六维+eval n=5,达标固化 `golden/` | 评分有引文证据;≥4.0 达标 | 未做 | +| C6 | 质量收敛(伴随 C4) | judge 按专题-04 维度+eval n=5,达标固化 `golden/` | 引文证据;叙事关键三维 ≥4.0 达标 | 未做 | | C7 | U6 槽位替换 | 换绑写手件,链与流程零改动 | 产出风格切换=元数据驱动活证 | 未做 | | C8 | U7 用户导入解析 | 用户旧稿导入(复用 B1 工具)→逐章审阅确认→知识草稿 | 解析先入待审;确认按章 | 未做 | | C9 | U8 导出交付 | 编译全书正文+设定导出 | 只含确认后内容,带来源标注 | 未做 |