zizi cf0f4fb985 W20–W24:保存知识方法、迁移框架、审校修订与案例行为的集成成果
接续 88dd570,保存 W20–W24 已实现的共享接口、业务入口、迁移、工作台、测试与文档。
W20/W22/W23 保持 in_progress,W21/W24 保持 verified;此提交不宣称方法或规则正式启用、多轮返修、真实角色评测完成。

W25 新增实验、标定、逐调用交付与角色执行及其迁移/测试/索引留在实施工作树,原有私人和旧实现保留项不纳入。

验证:离线 571、前端 33 通过;PG 469 项通过、2 项浏览器未启用,2 项误带入的 W25 用例已移出本提交;最终任务与交付边界 37 项通过。make 检查、最终类型、84 项资源及 diff 检查通过。未重跑浏览器或 Pi 宿主,不以合成调用认证外部模型效果。
独立整体审查四维通过;证据保存在 R2-20260909/提交W20-W24。
2026-09-13 16:24:42 +08:00

4.0 KiB
Raw Blame History

B10 效果评测

职责与对象

独立数据集实验、逐例结果和可追溯的启用判断。

实例归属以总体架构为准;结构、状态和公开外壳分别引用数据模型与接口契约。

公开接口

用例 输入责任 输出与后果
create_experiment 固定变更、条件、数据集和分割 实验身份
execute_samples 实验、隔离权限和预算 逐例任务及产物
assign_blind_review 固定样本对和评委范围 匿名输入与受控映射
compare_results 完整逐例结果 胜负、平局、分歧和不确定性
check_activation 目标版本、实验与判据 有依据的允许或拒绝

所有接口在本模块的接口.py 暴露。输入输出类型由同一公开表面导出,外部不导入私有模型或 SQL。

内部职责

文件 职责
接口.py 效果评测公开用例和可导入合同
模型.py 效果评测稳定对象、外壳及内部状态
存储.py 效果评测所属记录的 SQL 与版本读写
数据集.py 来源、样本、分割及保留集
行为场景.py 行为输入、实际调用观察、禁止动作与逐例裁决
实验条件.py 冻结目标版本、模型、输入和预算
逐例执行.py 逐例尝试和完整证据
盲评.py 匿名样本、评委身份及答案隔离
成对比较.py 原文、候选、平局与分歧
指标汇总.py 逐例结果、缺失项、覆盖及成本
启用判据.py 核对实际启用的是已测版本
提示词/独立评审.md 固定条件的独立评审模板

完整路径及运行模板见目标文件清单。逐文件意图、边界与目标见文件合同。

实现约束

  • 发现、校准和保留集用途分开;生产和生成角色看不到答案或匿名映射。
  • 每个样本保存实际执行,外部人工填汇总不能替代逐例结果。
  • 规则有效性、保真、文学偏好和运行可靠性分层判断。
  • 未知成本、失败指标、缺样本和未标定维度不能被填零或忽略。

协作与失败

S02 承担同一可靠执行机制,使用独立数据库权限;B07 申请实验,B04/B06 对实际启用负责。

答案可见性异常阻止运行;样本缺失或变更哈希不一致阻止启用;评测产物不能直接转生产。

Skill 行为场景由本模块执行和裁决,索引工具只负责发现。六个诊断场景按行为场景合同分别验证;scripted 管道、真服务边界和真实角色行为分别留结果,不合并为同一种通过。

验收行为

  • 目标章答案不进入生成输入。
  • 逐例结果能回查。
  • 原文胜出和平局有效。
  • 实际启用严格对应已测版本。

验收入口和替换条件见迁移与验收;这些条目是目标行为,不是已通过测试的声明。

行为场景执行证据

W24的场景数据固定合成文本哈希、明确业务动作和预期观察。scripted只运行观察裁决;service通过真实B06/B05公开接口获取调用、正文前后版本、实际规则库及报告读回。service接收的是明确业务动作,不据此证明自然语言路由正确;自然语言提示词的选工具行为由W25真实role_agent执行验证。

裁决核对逐次动作、完整观察、正文可见字节哈希和结构版本。诊断报告须与实际规则库重算一致,并且保存后读回相同;字段名字符串、调用方success标记和模型自报“正文未改”均不作为证据。零命中仍验证完整覆盖,未审语义范围保持未审。当前规则为空时如实记录空库,不把缺少已启用规则当作文学无缺陷。

本包不接收role_agent观察自报通过。真实宿主执行必须绑定S02调用和工具事件证据,留给W25接入。各模式独立汇报,不将service或scripted结果合并成真实模型行为通过。