3.0 KiB
3.0 KiB
B10 效果评测
职责与对象
独立数据集实验、逐例结果和可追溯的启用判断。
实例归属以总体架构为准;结构、状态和公开外壳分别引用数据模型与接口契约。
公开接口
| 用例 | 输入责任 | 输出与后果 |
|---|---|---|
| create_experiment | 固定变更、条件、数据集和分割 | 实验身份 |
| execute_samples | 实验、隔离权限和预算 | 逐例任务及产物 |
| assign_blind_review | 固定样本对和评委范围 | 匿名输入与受控映射 |
| compare_results | 完整逐例结果 | 胜负、平局、分歧和不确定性 |
| check_activation | 目标版本、实验与判据 | 有依据的允许或拒绝 |
所有接口在本模块的接口.py 暴露。输入输出类型由同一公开表面导出,外部不导入私有模型或 SQL。
内部职责
| 文件 | 职责 |
|---|---|
| 接口.py | 效果评测公开用例和可导入合同 |
| 模型.py | 效果评测稳定对象、外壳及内部状态 |
| 存储.py | 效果评测所属记录的 SQL 与版本读写 |
| 数据集.py | 来源、样本、分割及保留集 |
| 行为场景.py | 行为输入、实际调用观察、禁止动作与逐例裁决 |
| 实验条件.py | 冻结目标版本、模型、输入和预算 |
| 逐例执行.py | 逐例尝试和完整证据 |
| 盲评.py | 匿名样本、评委身份及答案隔离 |
| 成对比较.py | 原文、候选、平局与分歧 |
| 指标汇总.py | 逐例结果、缺失项、覆盖及成本 |
| 启用判据.py | 核对实际启用的是已测版本 |
| 提示词/独立评审.md | 固定条件的独立评审模板 |
完整路径及运行模板见目标文件清单。逐文件意图、边界与目标见文件合同。
实现约束
- 发现、校准和保留集用途分开;生产和生成角色看不到答案或匿名映射。
- 每个样本保存实际执行,外部人工填汇总不能替代逐例结果。
- 规则有效性、保真、文学偏好和运行可靠性分层判断。
- 未知成本、失败指标、缺样本和未标定维度不能被填零或忽略。
协作与失败
S02 承担同一可靠执行机制,使用独立数据库权限;B07 申请实验,B04/B06 对实际启用负责。
答案可见性异常阻止运行;样本缺失或变更哈希不一致阻止启用;评测产物不能直接转生产。
Skill 行为场景由本模块执行和裁决,索引工具只负责发现。六个诊断场景按行为场景合同分别验证;scripted 管道、真服务边界和真实角色行为分别留结果,不合并为同一种通过。
验收行为
- 目标章答案不进入生成输入。
- 逐例结果能回查。
- 原文胜出和平局有效。
- 实际启用严格对应已测版本。
验收入口和替换条件见迁移与验收;这些条目是目标行为,不是已通过测试的声明。