zizi
|
e36cd57010
|
框架: 评测合同与提示词去支架化 + skill 三层重组(Phase 0-4)
【评测合同与提示词】
- writer/detector/judge 评测提示词去支架化:删评测身份/输出格式叮嘱/盲化反向叮嘱/机器字段
(改由运行时 --json-schema/--tools ""/--strict-mcp-config/输入设计强制),装回各角色本业纪律
- writer 加写作纪律:戏剧化节拍禁抄细纲概述句、具体压倒抽象、每场戏三件套、篇幅用场景写够不注水不缩水
- 篇幅自纠环修订指令区分偏短(加场景)/偏长(删冗余);机械门要求清单(章末钩子/硬事件/角色/伏笔)注入写手硬约束
- 引文校验从「必须恰好1次」放宽为「0次失败关闭、≥1次绑首次」(检测+盲评同口径)
- llm 立 chat_governed 为主入口(chat 降为仅调试),clean_detect 改用 chat_governed 弃自带降级链
- rewrite/expansion/polish 输出合同对齐 writer.md(返回文本、写手不读写工作区、主会话落工作区)
- 修复 confirm/replay-eval 探针两组坏自测(夹具适配现行合同、探针测试自包含不硬编码漂移哈希);补 clean_detect 离线测试
- AGENTS.md 新增 §10「Agent 提示词与 Skill 审查标准」
【skill 三层重组:单向依赖 底座→能力→编排,断两环+修生产倒挂】
- Phase 0: 新建 runtime 底座(claude_runtime/file_cas/raw_vault),断环 C1、修 continuation 生产倒挂
- Phase 1: 评分尺+门判(writer_rubric/fine_outline_rubric/writer_gate/gate_input_builder)收进 quality-gate,断环 C2、名实相符
- Phase 2: 升格管线从 parse-book 独立成 upgrade skill(备份审计契约键名稳定、仅改路径定位)
- Phase 3: replay-eval 瘦成纯编排
- read-context 共用簇(build_snapshot/audit_leakage/check_snapshot/load_reference_work)下沉到新 snapshot skill,消除能力层向上引用
- Phase 4: run_writer_replay.py(130KB)拆成包(_common/budget/authorization/sample/blind/execute),__init__ 全量 re-export 测试零改动
【base 配置】三角色 effort 提 high;提示词更新;探针重测绑定 writer 合同;预算 writer 45 次/总 450 美元(含篇幅修订)
全量离线测试 36 个文件全绿;函数逻辑零改动(仅搬位置/改 import/改文档,capture_code_identity 仅改路径定位)。
|
2026-07-26 03:28:22 +08:00 |
|
zizi
|
abadaa15e9
|
框架: 正文评测链职责重构收口(writer/detector/judge 单一职责)+决策修复+加固门+探针刷新
- writer/detector/judge 按父仓专题-03/04 单一职责拆分:WriterDraft v2(仅 candidateBody)、CandidateEnvelope v2(adapter 确定性绑定)、SemanticDetection v3(quote 唯一匹配/unknown-gapReason)、blind judge v3(双盲第三评中位);预算两层(启动预留=Σ plannedCalls×cap,修正旧 maxCalls×cap 的 $2250 阻断 bug)。
- 决策修复:补第六类混淆项「场景选择偏差」(集合级、只标注不改终态);模型归属口径(planner/writer/judge 固定 opus,extractor/detector 可用它模型,拆书走 M3 不经角色派发);eval 评分尺改链接+一句话引用 quality-gate。
- 加固执行门:探针合同绑定(probe.executionProfileSha256 须等于 writer profile 身份哈希),陈旧探针被机械阻断 EXECUTE_PROBE_CONTRACT_MISMATCH。
- 新增探针刷新工具 refresh_runtime_probe.py(可注入 invoker+失败关闭+重签同源 canonical_sha256),并已按新合同真实重测探针(绑定 9d319ea0,成本 $0.155)。
- 逐行复核后修复:省略号被当路径穿越误杀(claude_runtime 共用精确判定 contains_path_traversal,盲评/检测统一引用);检测 failed 分支测试缺口;评委报告↔模型原始输出绑定恢复(reviewerStructuredOutputs,防一致篡改报告评分);上下文 purpose 词汇两层对齐;盲评死代码清理。
- 全量离线测试约 800+ 项全绿(continuation/detect/quality-gate/read-context/replay-eval/parse-book 572/llm),不连库不调模型。
|
2026-07-25 04:44:10 +08:00 |
|
zizi
|
166372c8ae
|
实现: 封闭正文智能体离线评测闭环
|
2026-07-22 18:43:30 +08:00 |
|
zizi
|
fa922f8cc5
|
实现: 装配正文五章真实冻结评测
将卡稳定选择器、冻结历史正文和目标 scaffold 绑定到同一只读快照;固定上下文预算并净化诊断索引,收紧盲评输入边界,防止目标事实和选卡信息泄漏。
|
2026-07-21 16:09:23 +08:00 |
|
zizi
|
843d5d77d3
|
合并: 细纲智能体冻结回放与授权链
# Conflicts:
# .claude/skills/replay-eval/SKILL.md
# .claude/skills/replay-eval/scripts/load_reference_work.py
|
2026-07-20 21:07:09 +08:00 |
|
zizi
|
8727eeaa46
|
实现: 以完整卡索引驱动冻结原文回读
|
2026-07-20 20:59:49 +08:00 |
|
zizi
|
44ba281328
|
实现: 建立正文双证据上下文基础设施
|
2026-07-20 18:42:35 +08:00 |
|
zizi
|
fbb262cb57
|
框架: 建立细纲回放评测冻结与评分合同
|
2026-07-19 13:54:22 +08:00 |
|
zizi
|
178603568e
|
feat(parse-book): 升格卡改造前向落地——实体成长「演变历程」骨架+真实章号里程碑+渐进披露+语义判重
schema(6型 item/power_system/faction/location/event/character):加「演变历程」(里程碑对象数组{章,台阶,周期},aiContext[detection,extraction]=续写不给防上万字过载、仅一致性检查与判重可见)+「演变概括」现状层+「前身/后继」串链;character「成长弧线」语义回归'未来计划'。已重跑 seed_schemas 灌字段合同(6型合同均含演变历程,亲验)。
parse_upgrade.py:里程碑对象合并去重按真实章号(不用运行时窗号)+撤销靠内部_win键(防同窗重跑重复追加)+当前态字段干净纪律(治升级线塞错字段病根)+observe/update提示词记进化台阶与登场→结局生命周期+语义判重(embed≥0.78召回+M3终判,同型自动并/跨型仅串链候选,--semantic-dedup默认关)。
migrate_upgrade_windows.py:存量[窗N]→真实章号迁移(全脚本只读零写库;人工精确化=无内嵌章号处再抽原文定章;全库563卡待迁/6616条待LLM/669内嵌自动精确)。read-context/detect SKILL.md 补渐进披露与演变连续性检查说明。待gate未执行:真迁移落库/开语义判重。设计+拍板见 docs/2026-07-16-升格卡改造设计.md。
创始人4项拍板:①里程碑结构化对象②五型全补③character一起改④存量人工精确化(+主代理定演变概括独立)。
|
2026-07-17 06:13:18 +08:00 |
|
lili
|
bc84c47ff4
|
框架: 功能细节下沉skill——新建9只功能skill(每只带'元数据驱动'节:字段合同即结构/检查项由detection字段生成/黑名单来自style实例);5个agent瘦身成身份段;chains改功能链登记表;skill两族16只
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
2026-07-09 09:26:58 -07:00 |
|
lili
|
8d3d5f32fb
|
框架: prompt三段式定版——身份段(agent.md)×功能指令段(meta/chains/新目录,每scenario一份只拼本次)×L0特化;scenario/purpose两概念分离;skill辅助映射入README
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
2026-07-09 09:03:53 -07:00 |
|
lili
|
fea8adbb5f
|
框架: 采纳创始人纠偏——跨agent缓存复用成立:章级基线包(writer视图)共享前缀+角色指令后置+增量只加不减;judge改可见面=writer基线;阶段一钉系统位记落地口径
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
2026-07-09 08:54:08 -07:00 |
|
lili
|
dd34f17715
|
框架: read-context补归属判据——agent prompt=系统位在四层之前,换作品不变进prompt/随作品变进L2/随回合变进L0
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
2026-07-09 08:48:49 -07:00 |
|
lili
|
58cecf992c
|
框架: 拼装序按创始人纠偏——L2作品事实最前,L3授权资料(检索结果随回合变)移到细纲后,L0拆稳定部/易变部,用户意图绝对尾置;附检索查询从细纲构造的缓存注记
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
2026-07-09 08:31:34 -07:00 |
|
lili
|
ed7f326875
|
框架: read-context修两处——L0定义+拼装序与预算序分离(L0尾置吃前缀缓存);恢复被四层化吞掉的逐来源取数细节(层=骨架,来源=操作单元)
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
2026-07-09 08:23:51 -07:00 |
|
lili
|
3aec0263ae
|
框架: 上下文统合策略——SoT四层骨架×按agent差异矩阵入read-context(五向规律:生成防剧透/规划看全局/抽取忠原文/检测持基准/评审最小独立);本机psql 18.4装通
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
2026-07-09 08:04:19 -07:00 |
|
lili
|
e91bb98590
|
框架: 对齐SoT纠偏——agent按专题-06§3三层清单标身份(4槽位件+judge保护件),上下文包改专题-03§4四层口径,skill形态定python脚本封装(.venv直连PG实测通)
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
2026-07-09 07:59:07 -07:00 |
|
lili
|
c34a715dd3
|
框架: 创作实验台 v3 落地——章程/23型schema设计稿/5智能体/3工具/knowledge层
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
2026-07-09 04:40:58 -07:00 |
|