zizi 0e3964da2c W00 固定工作树、资料与数据边界:新版设计文档树、改造计划与验证清单基线;工作树资料与数据边界。
按 R2 串行阶段整理提交;包内文件为该阶段交付(含后续小增量),状态以工作包清单为准。
2026-09-10 19:25:40 +08:00

63 lines
3.0 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# B10 效果评测
## 职责与对象
独立数据集实验、逐例结果和可追溯的启用判断。
实例归属以[总体架构](../总体架构.md)为准;结构、状态和公开外壳分别引用数据模型与接口契约。
## 公开接口
| 用例 | 输入责任 | 输出与后果 |
|------|----------|------------|
| create_experiment | 固定变更、条件、数据集和分割 | 实验身份 |
| execute_samples | 实验、隔离权限和预算 | 逐例任务及产物 |
| assign_blind_review | 固定样本对和评委范围 | 匿名输入与受控映射 |
| compare_results | 完整逐例结果 | 胜负、平局、分歧和不确定性 |
| check_activation | 目标版本、实验与判据 | 有依据的允许或拒绝 |
所有接口在本模块的接口.py 暴露。输入输出类型由同一公开表面导出,外部不导入私有模型或 SQL。
## 内部职责
| 文件 | 职责 |
|------|------|
| 接口.py | 效果评测公开用例和可导入合同 |
| 模型.py | 效果评测稳定对象、外壳及内部状态 |
| 存储.py | 效果评测所属记录的 SQL 与版本读写 |
| 数据集.py | 来源、样本、分割及保留集 |
| 行为场景.py | 行为输入、实际调用观察、禁止动作与逐例裁决 |
| 实验条件.py | 冻结目标版本、模型、输入和预算 |
| 逐例执行.py | 逐例尝试和完整证据 |
| 盲评.py | 匿名样本、评委身份及答案隔离 |
| 成对比较.py | 原文、候选、平局与分歧 |
| 指标汇总.py | 逐例结果、缺失项、覆盖及成本 |
| 启用判据.py | 核对实际启用的是已测版本 |
| 提示词/独立评审.md | 固定条件的独立评审模板 |
完整路径及运行模板见[目标文件清单](../项目目录与文件职责.md)。逐文件意图、边界与目标见[文件合同](../文件设计/后端-B10-效果评测.md)。
## 实现约束
- 发现、校准和保留集用途分开;生产和生成角色看不到答案或匿名映射。
- 每个样本保存实际执行,外部人工填汇总不能替代逐例结果。
- 规则有效性、保真、文学偏好和运行可靠性分层判断。
- 未知成本、失败指标、缺样本和未标定维度不能被填零或忽略。
## 协作与失败
S02 承担同一可靠执行机制,使用独立数据库权限;B07 申请实验,B04/B06 对实际启用负责。
答案可见性异常阻止运行;样本缺失或变更哈希不一致阻止启用;评测产物不能直接转生产。
Skill 行为场景由本模块执行和裁决,索引工具只负责发现。六个诊断场景按[行为场景合同](../验证设计/诊断行为场景.md)分别验证;scripted 管道、真服务边界和真实角色行为分别留结果,不合并为同一种通过。
## 验收行为
- 目标章答案不进入生成输入。
- 逐例结果能回查。
- 原文胜出和平局有效。
- 实际启用严格对应已测版本。
验收入口和替换条件见[迁移与验收](../迁移与验收.md);这些条目是目标行为,不是已通过测试的声明。