zizi
|
abadaa15e9
|
框架: 正文评测链职责重构收口(writer/detector/judge 单一职责)+决策修复+加固门+探针刷新
- writer/detector/judge 按父仓专题-03/04 单一职责拆分:WriterDraft v2(仅 candidateBody)、CandidateEnvelope v2(adapter 确定性绑定)、SemanticDetection v3(quote 唯一匹配/unknown-gapReason)、blind judge v3(双盲第三评中位);预算两层(启动预留=Σ plannedCalls×cap,修正旧 maxCalls×cap 的 $2250 阻断 bug)。
- 决策修复:补第六类混淆项「场景选择偏差」(集合级、只标注不改终态);模型归属口径(planner/writer/judge 固定 opus,extractor/detector 可用它模型,拆书走 M3 不经角色派发);eval 评分尺改链接+一句话引用 quality-gate。
- 加固执行门:探针合同绑定(probe.executionProfileSha256 须等于 writer profile 身份哈希),陈旧探针被机械阻断 EXECUTE_PROBE_CONTRACT_MISMATCH。
- 新增探针刷新工具 refresh_runtime_probe.py(可注入 invoker+失败关闭+重签同源 canonical_sha256),并已按新合同真实重测探针(绑定 9d319ea0,成本 $0.155)。
- 逐行复核后修复:省略号被当路径穿越误杀(claude_runtime 共用精确判定 contains_path_traversal,盲评/检测统一引用);检测 failed 分支测试缺口;评委报告↔模型原始输出绑定恢复(reviewerStructuredOutputs,防一致篡改报告评分);上下文 purpose 词汇两层对齐;盲评死代码清理。
- 全量离线测试约 800+ 项全绿(continuation/detect/quality-gate/read-context/replay-eval/parse-book 572/llm),不连库不调模型。
|
2026-07-25 04:44:10 +08:00 |
|
zizi
|
8ed0f5b2e7
|
框架: 会话章程加呈报纪律——汇报先答'你需要做什么',禁裸用内部代号与英文行话(创始人2026-07-13纠正固化)
|
2026-07-13 18:59:01 +08:00 |
|
zizi
|
2b6f83c097
|
框架: M3管线P0/P1——llm skill统一入口+clean四道守卫三级匹配+执行计划落仓(README§九/CLAUDE.md同步拍板)
|
2026-07-13 14:03:36 +08:00 |
|
lili
|
e91bb98590
|
框架: 对齐SoT纠偏——agent按专题-06§3三层清单标身份(4槽位件+judge保护件),上下文包改专题-03§4四层口径,skill形态定python脚本封装(.venv直连PG实测通)
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
2026-07-09 07:59:07 -07:00 |
|
lili
|
f216e8bff2
|
框架: 能力清单定版7skill×5agent+上下文包六分区合同入README,公约'所有API/工具皆skill'入章程
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
2026-07-09 07:36:18 -07:00 |
|
lili
|
c34a715dd3
|
框架: 创作实验台 v3 落地——章程/23型schema设计稿/5智能体/3工具/knowledge层
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
2026-07-09 04:40:58 -07:00 |
|