接续 88dd570,保存 W20–W24 已实现的共享接口、业务入口、迁移、工作台、测试与文档。 W20/W22/W23 保持 in_progress,W21/W24 保持 verified;此提交不宣称方法或规则正式启用、多轮返修、真实角色评测完成。 W25 新增实验、标定、逐调用交付与角色执行及其迁移/测试/索引留在实施工作树,原有私人和旧实现保留项不纳入。 验证:离线 571、前端 33 通过;PG 469 项通过、2 项浏览器未启用,2 项误带入的 W25 用例已移出本提交;最终任务与交付边界 37 项通过。make 检查、最终类型、84 项资源及 diff 检查通过。未重跑浏览器或 Pi 宿主,不以合成调用认证外部模型效果。 独立整体审查四维通过;证据保存在 R2-20260909/提交W20-W24。
4.0 KiB
B10 效果评测
职责与对象
独立数据集实验、逐例结果和可追溯的启用判断。
实例归属以总体架构为准;结构、状态和公开外壳分别引用数据模型与接口契约。
公开接口
| 用例 | 输入责任 | 输出与后果 |
|---|---|---|
| create_experiment | 固定变更、条件、数据集和分割 | 实验身份 |
| execute_samples | 实验、隔离权限和预算 | 逐例任务及产物 |
| assign_blind_review | 固定样本对和评委范围 | 匿名输入与受控映射 |
| compare_results | 完整逐例结果 | 胜负、平局、分歧和不确定性 |
| check_activation | 目标版本、实验与判据 | 有依据的允许或拒绝 |
所有接口在本模块的接口.py 暴露。输入输出类型由同一公开表面导出,外部不导入私有模型或 SQL。
内部职责
| 文件 | 职责 |
|---|---|
| 接口.py | 效果评测公开用例和可导入合同 |
| 模型.py | 效果评测稳定对象、外壳及内部状态 |
| 存储.py | 效果评测所属记录的 SQL 与版本读写 |
| 数据集.py | 来源、样本、分割及保留集 |
| 行为场景.py | 行为输入、实际调用观察、禁止动作与逐例裁决 |
| 实验条件.py | 冻结目标版本、模型、输入和预算 |
| 逐例执行.py | 逐例尝试和完整证据 |
| 盲评.py | 匿名样本、评委身份及答案隔离 |
| 成对比较.py | 原文、候选、平局与分歧 |
| 指标汇总.py | 逐例结果、缺失项、覆盖及成本 |
| 启用判据.py | 核对实际启用的是已测版本 |
| 提示词/独立评审.md | 固定条件的独立评审模板 |
完整路径及运行模板见目标文件清单。逐文件意图、边界与目标见文件合同。
实现约束
- 发现、校准和保留集用途分开;生产和生成角色看不到答案或匿名映射。
- 每个样本保存实际执行,外部人工填汇总不能替代逐例结果。
- 规则有效性、保真、文学偏好和运行可靠性分层判断。
- 未知成本、失败指标、缺样本和未标定维度不能被填零或忽略。
协作与失败
S02 承担同一可靠执行机制,使用独立数据库权限;B07 申请实验,B04/B06 对实际启用负责。
答案可见性异常阻止运行;样本缺失或变更哈希不一致阻止启用;评测产物不能直接转生产。
Skill 行为场景由本模块执行和裁决,索引工具只负责发现。六个诊断场景按行为场景合同分别验证;scripted 管道、真服务边界和真实角色行为分别留结果,不合并为同一种通过。
验收行为
- 目标章答案不进入生成输入。
- 逐例结果能回查。
- 原文胜出和平局有效。
- 实际启用严格对应已测版本。
验收入口和替换条件见迁移与验收;这些条目是目标行为,不是已通过测试的声明。
行为场景执行证据
W24的场景数据固定合成文本哈希、明确业务动作和预期观察。scripted只运行观察裁决;service通过真实B06/B05公开接口获取调用、正文前后版本、实际规则库及报告读回。service接收的是明确业务动作,不据此证明自然语言路由正确;自然语言提示词的选工具行为由W25真实role_agent执行验证。
裁决核对逐次动作、完整观察、正文可见字节哈希和结构版本。诊断报告须与实际规则库重算一致,并且保存后读回相同;字段名字符串、调用方success标记和模型自报“正文未改”均不作为证据。零命中仍验证完整覆盖,未审语义范围保持未审。当前规则为空时如实记录空库,不把缺少已启用规则当作文学无缺陷。
本包不接收role_agent观察自报通过。真实宿主执行必须绑定S02调用和工具事件证据,留给W25接入。各模式独立汇报,不将service或scripted结果合并成真实模型行为通过。