zizi f76c3cd04a docs(架构): 归档R2历史留痕并清理过程计划与实施分期标签
- 归档并收敛 R2 历史留痕至 docs/实现回顾/R2改造历史留痕.md,删除已退出生命周期的改造计划、旧文件处置及验证过程文档
- 现行测试用例身份收敛至 tests/用例清单.json(1358条扁平登记),适配 conftest、索引维护与测试执行验证
- 清理源码、配置、SQL迁移头、测试夹具及规则文档中的 Wxx 实施分期标签与过时过程描述
- 同步重新打包构建资源清单,通过全量离线测试、模块边界、类型检查与索引双向强核验
2026-09-16 19:09:14 +08:00

334 lines
15 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 后端-B10-效果评测:文件合同
本页从[目标文件清单](../目标文件清单.json)投影,共 29 个目标条目。测试身份与行为合同在现行用例清单;文件和目标合同不代表实现或验收已完成。
[返回目录](目录.md) · [完整项目树](../项目目录与文件职责.md) · [现行用例清单](../../../../tests/用例清单.json)
## 本部分文件树
```text
agent-example/
└── src/
└── muse/
└── 效果评测/
├── __init__.py # Python 包身份
├── 启用凭据.py # 从原S02实际效果重算导出目标证明,按来源停止与发布版本核对
├── 启用判据.py # 核对实际启用的是已测版本
├── 存储.py # 效果评测所属记录的 SQL 与版本读写
├── 实验条件.py # 冻结目标版本、模型、输入和预算
├── 工作面.py # 入口、标定和报告共用同事务逐例核验投影;不产生第二套结果权威
├── 成对比较.py # 原文、候选、平局与分歧
├── 指标汇总.py # 逐例结果、缺失项、覆盖及成本
├── 接口.py # 效果评测公开用例和可导入合同
├── 提示词/
│ ├── 文学评分.md # 独立五维评分、共同来源及原字证据提示
│ └── 独立评审.md # 固定条件的独立评审模板
├── 效果标准.json # 随发布包冻结的效果门槛、分母与固定场景要求
├── 数据集.py # 来源、样本、分割及保留集
├── 文学执行.py # 冻结并核对文学评判依据和原交付视图
├── 文学评分.py # 五维评分、真实引文核验与独立评审的稳定性计算
├── 方法对照.py # 确切方法目标、授权和双臂输入差异
├── 条件第三.py # 从原S02初评交付重算、登记及核验第三评必要性
├── 标定.py # 固定标定策略、维护金标准、逐调用偏差与只追加凭据
├── 标定消费.py # 逐评委核验实际标定、来源隔离与派发绑定;停止后保留合法历史
├── 模型.py # 效果评测稳定对象、外壳及内部状态
├── 混淆项.py # 从冻结输入与实际判断派生混淆项及前置输入审计
├── 盲评.py # 匿名样本、评委身份及答案隔离
├── 行为场景.py # 行为场景结构、输入版本、实际观察与裁决
├── 规则诊断.py # 非语义规则逐例验证与最小诊断资格凭据
├── 角色行为.py # 诊断角色限定工具、实际会话观察和业务读回
├── 评分标准.json # 随发布包冻结的四项通用标准及五类场景评分锚点
├── 语义检测.py # 单份原生成、共同依据与B06检测核验的执行接缝
├── 返修比较.py # 固定真实返修文本对的盲评适配与最小公共证明
└── 逐例执行.py # 逐例尝试和完整证据
```
## 逐文件合同
<a id="file-f08dde7c60c43908"></a>
### `src/muse/效果评测/接口.py`
- 归属与种类:B10;源码。
- 意图:让调用方通过稳定用例操作效果评测,隐藏模块内部组织。
- 职责:效果评测公开用例和可导入合同。
- 边界:唯一跨模块表面;导出输入输出合同,不暴露私有 SQL 或任意处理器。
- 目标:HTTP、CLI 和编排对相同用例得到一致验证、失败与结果。
- 合同依据:业务公开接口。
<a id="file-e27b1036334dd32e"></a>
### `src/muse/效果评测/模型.py`
- 归属与种类:B10;源码。
- 意图:把效果评测的稳定数据骨架与执行实现分开。
- 职责:效果评测稳定对象、外壳及内部状态。
- 边界:纯模型和状态合同;不联网或写库,不把题材属性写死为类字段。
- 目标:稳定外壳可校验,动态内容携带结构绑定并在所属校验链验证。
- 合同依据:稳定模型。
<a id="file-ad8e47f9cab3757a"></a>
### `src/muse/效果评测/存储.py`
- 归属与种类:B10;源码。
- 意图:将效果评测的数据访问与版本写入局限在本模块。
- 职责:效果评测所属记录的 SQL 与版本读写。
- 边界:只操作本模块记录并使用调用方事务;不跨 owner 写表或调用模型。
- 目标:版本读写及回滚可验证,不产生第二个独立事务结果。
- 合同依据:模块存储。
<a id="file-d957fbedd8662739"></a>
### `src/muse/效果评测/数据集.py`
- 归属与种类:B10;源码。
- 意图:固定实验样本来源与用途分割。
- 职责:来源、样本、分割及保留集。
- 边界:维护数据集和授权;oracle 不给生产或生成角色。
- 目标:重复、变体与相邻来源按分割规则处理,样例可追源。
- 合同依据:专属业务职责。
<a id="file-93e1bd07b64d173f"></a>
### `src/muse/效果评测/实验条件.py`
- 归属与种类:B10;源码。
- 意图:使变更对照具有相同可解释条件。
- 职责:冻结目标版本、模型、输入和预算。
- 边界:固定模型、提示、代码、输入和预算;不事后改目标或阈值。
- 目标:实验结果只支持当时目标版本和适用范围。
- 合同依据:专属业务职责。
<a id="file-72058a5632561d9a"></a>
### `src/muse/效果评测/逐例执行.py`
- 归属与种类:B10;源码。
- 意图:用真实样例运行代替人工汇总。
- 职责:逐例尝试和完整证据。
- 边界:逐例调 S02 并保存结果;不进入生产写入通道。
- 目标:失败、超时、拒改和部分输出不从样本集合消失。
- 合同依据:专属业务职责。
<a id="file-06bfc6918df72b84"></a>
### `src/muse/效果评测/盲评.py`
- 归属与种类:B10;源码。
- 意图:隔离身份提示与评委权限。
- 职责:匿名样本、评委身份及答案隔离。
- 边界:匿名化和分配;不把答案映射给写手,不假称模型是独立读者。
- 目标:评委只见允许材料,映射受控且可审计。
- 合同依据:专属业务职责。
<a id="file-ff9d62d4832aad95"></a>
### `src/muse/效果评测/成对比较.py`
- 归属与种类:B10;源码。
- 意图:允许原文与不同候选在相同条件下比较。
- 职责:原文、候选、平局与分歧。
- 边界:汇总实际选择;不强制某一候选胜出。
- 目标:原文更好、候选更好、平局、都差和分歧均可记录。
- 合同依据:专属业务职责。
<a id="file-580daed52cf97d68"></a>
### `src/muse/效果评测/指标汇总.py`
- 归属与种类:B10;源码。
- 意图:保留完整结果与不确定性。
- 职责:逐例结果、缺失项、覆盖及成本。
- 边界:只从逐例证据计算;未知用量、缺样本和失败不填零。
- 目标:报告能回到样例,缺项和覆盖范围明确。
- 合同依据:专属业务职责。
<a id="file-7e07bba1fd92e3ff"></a>
### `src/muse/效果评测/启用判据.py`
- 归属与种类:B10;源码。
- 意图:阻止未经验证或版本不一致的变更生效。
- 职责:核对实际启用的是已测版本。
- 边界:检查已测版本与适用判据;实际启用仍归目标模块。
- 目标:目标哈希变化、缺证据或未标定必需项时拒绝启用。
- 合同依据:专属业务职责。
<a id="file-ba21ce5c46d442e0"></a>
### `src/muse/效果评测/提示词/独立评审.md`
- 归属与种类:B10;源码。
- 意图:为效果评测的“独立评审”任务提供可版本化表达。
- 职责:固定条件的独立评审模板。
- 边界:仅定义本任务提示;角色身份、字段结构、权限和预算从各自权威装配。
- 目标:模板可随发布包加载且记录哈希,不含固定作品内容或测试答案。
- 合同依据:业务提示资源。
<a id="file-c7414664f785eecf"></a>
### `src/muse/效果评测/__init__.py`
- 归属与种类:工程;源码。
- 意图:明确安装包和模块的导入身份。
- 职责:Python 包身份。
- 边界:只声明包及必要公开导出;不读取运行数据、连接网络或启动任务。
- 目标:正常安装后可从任意 cwd 导入,导入无运行副作用。
- 合同依据:Python 包身份。
<a id="file-9a857b451f304d47"></a>
### `src/muse/效果评测/行为场景.py`
- 归属与种类:B10;源码。
- 意图:把场景的禁止动作和预期后果落实到逐例执行。
- 职责:行为场景结构、输入版本、实际观察与裁决。
- 边界:不凭关键词或脚本名判断完成;scripted 观察只验证管道,不证明模型行为。
- 目标:六类诊断场景完整执行,缺观察不通过且结果带固定版本。
- 合同依据:专属合同。
<a id="file-431af45bd68cdd34"></a>
### `src/muse/效果评测/文学评分.py`
- 意图:五维评分、真实引文核验与独立评审的稳定性计算。
- 职责:五维评分、真实引文核验与独立评审的稳定性计算。
- 边界:汇总实际选择;不强制某一候选胜出。
- 目标:原文更好、候选更好、平局、都差和分歧均可记录。
- 合同依据:专属业务职责。
<a id="file-4bfd76032e052a9a"></a>
### `src/muse/效果评测/评分标准.json`
- 意图:随发布包冻结的四项通用标准及五类场景评分锚点。
- 职责:随发布包冻结的四项通用标准及五类场景评分锚点。
- 边界:仅保存评分标准,不保存样本/模型输出或启用决定。
- 目标:实际字节及版本随资源构建固定,评测不能静默改变标准。
- 合同依据:业务提示资源。
<a id="file-1d6aa45c5403fd38"></a>
### `src/muse/效果评测/文学执行.py`
- 意图:冻结并核对文学评判依据和原交付视图。
- 职责:冻结并核对文学评判依据和原交付视图。
- 边界:不确认正式创作内容、不标定文学效果或授予启用许可。
- 目标:与冻结数据、实际S02调用和原交付可核对,失败不能增加未批准的调用。
- 合同依据:模块设计/B10-效果评测.md。
<a id="file-1c97a6e7a463ac49"></a>
### `src/muse/效果评测/条件第三.py`
- 意图:从原S02初评交付重算、登记及核验第三评必要性。
- 职责:从原S02初评交付重算、登记及核验第三评必要性。
- 边界:不确认正式创作内容、不标定文学效果或授予启用许可。
- 目标:与冻结数据、实际S02调用和原交付可核对,失败不能增加未批准的调用。
- 合同依据:模块设计/B10-效果评测.md。
<a id="file-4934aae377986518"></a>
### `src/muse/效果评测/提示词/文学评分.md`
- 意图:独立五维评分、共同来源及原字证据提示。
- 职责:独立五维评分、共同来源及原字证据提示。
- 边界:不确认正式创作内容、不标定文学效果或授予启用许可。
- 目标:与冻结数据、实际S02调用和原交付可核对,失败不能增加未批准的调用。
- 合同依据:模块设计/B10-效果评测.md。
<a id="file-ff4004f4f337fb30"></a>
### `src/muse/效果评测/标定.py`
- 意图:固定标定策略、维护金标准、逐调用偏差与只追加凭据。
- 职责:固定标定策略、维护金标准、逐调用偏差与只追加凭据。
- 边界:不写正式内容,不用旧金标准或人工汇总授予启用权限。
- 目标:只从原候选、金标准与实际S02交付推导当前标定记录。
- 合同依据:模块设计/B10-效果评测.md。
<a id="file-ee36ee313d2132ad"></a>
### `src/muse/效果评测/标定消费.py`
- 意图:逐评委核验实际标定、来源隔离与派发绑定;停止后保留合法历史。
- 职责:逐评委核验实际标定、来源隔离与派发绑定;停止后保留合法历史。
- 边界:不把标定引用或合成服务测试当作效果、生产启用通过。
- 目标:资格调用绑定已核验原标定,缺失失败或范围不符明确拒绝。
- 合同依据:模块设计/B10-效果评测.md。
<a id="file-2c2d6793ebf8fdfa"></a>
### `src/muse/效果评测/工作面.py`
- 意图:入口、标定和报告共用同事务逐例核验投影;不产生第二套结果权威。
- 职责:入口、标定和报告共用同事务逐例核验投影;不产生第二套结果权威。
- 边界:不把标定引用或合成服务测试当作效果、生产启用通过。
- 目标:资格调用绑定已核验原标定,缺失失败或范围不符明确拒绝。
- 合同依据:模块设计/B10-效果评测.md。
<a id="file-b53b3124601ddce4"></a>
### `src/muse/效果评测/语义检测.py`
- 意图:单份原生成、共同依据与B06检测核验的执行接缝。
- 职责:单份原生成、共同依据与B06检测核验的执行接缝。
- 边界:不写正式事实,不把检测回合当文学效果或生产启用证明。
- 目标:独立检测产物可从原调用和原文重新核验。
- 合同依据:模块设计/B10-效果评测.md;模块设计/B06-审校修订.md。
<a id="file-f9866e110c17f86f"></a>
### `src/muse/效果评测/效果标准.json`
- 意图:随发布包冻结的效果门槛、分母与固定场景要求。
- 职责:随发布包冻结的效果门槛、分母与固定场景要求。
- 边界:效果评测和凭据读回;不替代目标模块正式启用。
- 目标:固定目标、来源、分母与未定因素均可核对。
- 合同依据:模块设计/B10-效果评测.md。
<a id="file-473272f4484a3948"></a>
### `src/muse/效果评测/混淆项.py`
- 意图:从冻结输入与实际判断派生混淆项及前置输入审计。
- 职责:从冻结输入与实际判断派生混淆项及前置输入审计。
- 边界:不把疑似分歧当独立真值,不回显禁入事实,不直接批准启用。
- 目标:完整范围与未测状态可追查。
- 合同依据:专属业务职责。
<a id="file-fa21bcaf3d2762d7"></a>
### src/muse/效果评测/角色行为.py
诊断角色限定工具、实际会话观察和业务读回。合同见[效果评测](../模块设计/B10-效果评测.md)。只通过所属模块公开接口;合成角色循环不作为真实模型效果或启用证明。
<a id="file-8d6b4b8b8832c85e"></a>
### src/muse/效果评测/方法对照.py
确切方法目标、授权和双臂输入差异。合同见[效果评测](../模块设计/B10-效果评测.md#方法版本对照)。生产生效版本仍由B04与作者批准控制,隔离消费不能直接启用。
<a id="file-0f17ec545c5eafe0"></a>
### `src/muse/效果评测/启用凭据.py`
- 归属与种类:B10;源码。
- 职责与目标:从原S02实际效果重算导出目标证明,按来源停止与发布版本核对。
- 边界:只交接确切已测写手方法;生产不读答案,B04维护状态,合成结果不作生产批准。
- 合同依据:[目标启用凭据](../模块设计/B10-效果评测.md)。
<a id="file-61a756e896937d0a"></a>
### `src/muse/效果评测/返修比较.py`
- 维护者:B10。
- 职责:固定真实返修文本对的盲评适配与最小公共证明。
- 合同:[模块合同](../模块设计/B06-审校修订.md)。
<a id="file-fae5a67c608db278"></a>
### `src/muse/效果评测/规则诊断.py`
- 维护者:B10。
- 职责:非语义规则逐例验证与最小诊断资格凭据。
- 合同:[模块合同](../模块设计/B10-效果评测.md)。