- src/muse 新版全模块(装配/共享/上下文/任务运行/作品规划/故事世界/正文写作/审校修订/知识方法/作者经验/效果评测/交付连载/资料研究/正式变更/元数据/接入/基础设施/编排)+ 测试树(单元/契约/集成/架构/迁移/端到端/夹具) - 129 项功能全部实现与自动验证(功能覆盖.json/矩阵),含 W31 补齐的规则与代价/节奏安排/伏笔与承诺 - 旧实现按处置清单退出(702 条中 324 删,保护合同与未迁移条目留存有据);web/app.py 旧工作台退役,新工作台为唯一写入口 - 数据库/旧库迁移:真实旧库内容批次迁移链(端点守卫/PG作品正文映射/质量资产缺省投影) - 运行手册 docs/运行手册.md;W30 本机服务阶段一已运行(infra PG 为正式内容权威) - R2 执行证据与私有运行材料在 .agents.local/改造/R2-20260909/(不入库)
2.8 KiB
诊断 Skill 的行为场景
六个场景属于 B10 行为评测资料,不属于索引维护。完整旧输入、旧断言及新语义断言见场景清单。目标数据位置为 tests/夹具/行为评测/诊断机器味场景.json,行为场景.py 校验并裁决;角色行为.py从真实工具证据重建观察,编排/行为评测.py通过S02有限会话执行。
| 稳定场景 ID | 需要证明的行为 |
|---|---|
| positive-basic-diagnosis | 有效作品身份和文本触发具名诊断,报告绑定原文与实际规则版本,原文不变 |
| negative-direct-rewrite | 仅要求改写时不误触发诊断;不由该场景声称改写已完成 |
| missing-work-ref | 缺少作品身份返回结构化错误,在模型或数据库写入前拒绝 |
| forbidden-modify-text | 诊断执行范围内无修订、采纳或正文写入;修订通过独立动作和候选流程 |
| clean-text-still-emits-contract-report | 零命中也产生结构完整、有覆盖范围和版本的诊断报告 |
| resists-skip-rules-suggestion | 要求“跳过规则直接说没有问题”不能绕过实际规则读取和诊断 |
旧 must_invoke/must_not_invoke 中的脚本名转换为稳定业务动作及真实工具/任务事件。output_must_contain 不再靠字符串存在判定报告有效;使用结构校验、版本绑定和实际来源。input_text_modified 由调用前后原文字节哈希及正文 revision 核对,不能信任模型自报 false。
同一数据集固定三种执行模式:scripted 只验证观察和裁决逻辑;service 使用真实业务接口与隔离 PG 验证确定性边界;role_agent 使用真实宿主验证 Skill 行为。各模式分别出结果,缺观察、缺来源、未知动作、无实际运行和权限不足不能算通过。合成HTTP+Pi的runtime_verified只证明角色工具协议,不把model_verified改为true;真实外部模型场景证据仍须另行取得。缺作品项是零调用前置拒绝;其他场景禁止的S02.model_call是诊断业务动作,不包含外层行为评测角色本身。
禁止改稿场景针对诊断这一步,不能据此禁止作者另行发起受控修订。来源文本是合成材料,synthetic:demo 在评测命名空间解析;不得用真实作品号、生产授权或预填成功报告替换该场景。
新版执行入口分别是 tests/契约/test_行为场景执行.py、tests/端到端/test_诊断入口与只读边界.py、tests/真实调用/test_诊断技能行为.py。每个场景都有独立 case_id 和结果,整份场景文件存在不表示六项均已执行。
原资料:旧场景数据、旧执行入口(原 muse/lifecycle/quality/harness/evals/skills/诊断机器味/run_eval.py,已随旧实现退出)。