63 lines
3.0 KiB
Markdown
63 lines
3.0 KiB
Markdown
# B10 效果评测
|
||
|
||
## 职责与对象
|
||
|
||
独立数据集实验、逐例结果和可追溯的启用判断。
|
||
|
||
实例归属以[总体架构](../总体架构.md)为准;结构、状态和公开外壳分别引用数据模型与接口契约。
|
||
|
||
## 公开接口
|
||
|
||
| 用例 | 输入责任 | 输出与后果 |
|
||
|------|----------|------------|
|
||
| create_experiment | 固定变更、条件、数据集和分割 | 实验身份 |
|
||
| execute_samples | 实验、隔离权限和预算 | 逐例任务及产物 |
|
||
| assign_blind_review | 固定样本对和评委范围 | 匿名输入与受控映射 |
|
||
| compare_results | 完整逐例结果 | 胜负、平局、分歧和不确定性 |
|
||
| check_activation | 目标版本、实验与判据 | 有依据的允许或拒绝 |
|
||
|
||
所有接口在本模块的接口.py 暴露。输入输出类型由同一公开表面导出,外部不导入私有模型或 SQL。
|
||
|
||
## 内部职责
|
||
|
||
| 文件 | 职责 |
|
||
|------|------|
|
||
| 接口.py | 效果评测公开用例和可导入合同 |
|
||
| 模型.py | 效果评测稳定对象、外壳及内部状态 |
|
||
| 存储.py | 效果评测所属记录的 SQL 与版本读写 |
|
||
| 数据集.py | 来源、样本、分割及保留集 |
|
||
| 行为场景.py | 行为输入、实际调用观察、禁止动作与逐例裁决 |
|
||
| 实验条件.py | 冻结目标版本、模型、输入和预算 |
|
||
| 逐例执行.py | 逐例尝试和完整证据 |
|
||
| 盲评.py | 匿名样本、评委身份及答案隔离 |
|
||
| 成对比较.py | 原文、候选、平局与分歧 |
|
||
| 指标汇总.py | 逐例结果、缺失项、覆盖及成本 |
|
||
| 启用判据.py | 核对实际启用的是已测版本 |
|
||
| 提示词/独立评审.md | 固定条件的独立评审模板 |
|
||
|
||
完整路径及运行模板见[目标文件清单](../项目目录与文件职责.md)。逐文件意图、边界与目标见[文件合同](../文件设计/后端-B10-效果评测.md)。
|
||
|
||
## 实现约束
|
||
|
||
- 发现、校准和保留集用途分开;生产和生成角色看不到答案或匿名映射。
|
||
- 每个样本保存实际执行,外部人工填汇总不能替代逐例结果。
|
||
- 规则有效性、保真、文学偏好和运行可靠性分层判断。
|
||
- 未知成本、失败指标、缺样本和未标定维度不能被填零或忽略。
|
||
|
||
## 协作与失败
|
||
|
||
S02 承担同一可靠执行机制,使用独立数据库权限;B07 申请实验,B04/B06 对实际启用负责。
|
||
|
||
答案可见性异常阻止运行;样本缺失或变更哈希不一致阻止启用;评测产物不能直接转生产。
|
||
|
||
Skill 行为场景由本模块执行和裁决,索引工具只负责发现。六个诊断场景按[行为场景合同](../验证设计/诊断行为场景.md)分别验证;scripted 管道、真服务边界和真实角色行为分别留结果,不合并为同一种通过。
|
||
|
||
## 验收行为
|
||
|
||
- 目标章答案不进入生成输入。
|
||
- 逐例结果能回查。
|
||
- 原文胜出和平局有效。
|
||
- 实际启用严格对应已测版本。
|
||
|
||
验收入口和替换条件见[迁移与验收](../迁移与验收.md);这些条目是目标行为,不是已通过测试的声明。
|