zizi f76c3cd04a docs(架构): 归档R2历史留痕并清理过程计划与实施分期标签
- 归档并收敛 R2 历史留痕至 docs/实现回顾/R2改造历史留痕.md,删除已退出生命周期的改造计划、旧文件处置及验证过程文档
- 现行测试用例身份收敛至 tests/用例清单.json(1358条扁平登记),适配 conftest、索引维护与测试执行验证
- 清理源码、配置、SQL迁移头、测试夹具及规则文档中的 Wxx 实施分期标签与过时过程描述
- 同步重新打包构建资源清单,通过全量离线测试、模块边界、类型检查与索引双向强核验
2026-09-16 19:09:14 +08:00

15 KiB
Raw Permalink Blame History

后端-B10-效果评测:文件合同

本页从目标文件清单投影,共 29 个目标条目。测试身份与行为合同在现行用例清单;文件和目标合同不代表实现或验收已完成。

返回目录 · 完整项目树 · 现行用例清单

本部分文件树

agent-example/
└── src/
    └── muse/
        └── 效果评测/
            ├── __init__.py  # Python 包身份
            ├── 启用凭据.py  # 从原S02实际效果重算导出目标证明,按来源停止与发布版本核对
            ├── 启用判据.py  # 核对实际启用的是已测版本
            ├── 存储.py  # 效果评测所属记录的 SQL 与版本读写
            ├── 实验条件.py  # 冻结目标版本、模型、输入和预算
            ├── 工作面.py  # 入口、标定和报告共用同事务逐例核验投影;不产生第二套结果权威
            ├── 成对比较.py  # 原文、候选、平局与分歧
            ├── 指标汇总.py  # 逐例结果、缺失项、覆盖及成本
            ├── 接口.py  # 效果评测公开用例和可导入合同
            ├── 提示词/
            │   ├── 文学评分.md  # 独立五维评分、共同来源及原字证据提示
            │   └── 独立评审.md  # 固定条件的独立评审模板
            ├── 效果标准.json  # 随发布包冻结的效果门槛、分母与固定场景要求
            ├── 数据集.py  # 来源、样本、分割及保留集
            ├── 文学执行.py  # 冻结并核对文学评判依据和原交付视图
            ├── 文学评分.py  # 五维评分、真实引文核验与独立评审的稳定性计算
            ├── 方法对照.py  # 确切方法目标、授权和双臂输入差异
            ├── 条件第三.py  # 从原S02初评交付重算、登记及核验第三评必要性
            ├── 标定.py  # 固定标定策略、维护金标准、逐调用偏差与只追加凭据
            ├── 标定消费.py  # 逐评委核验实际标定、来源隔离与派发绑定;停止后保留合法历史
            ├── 模型.py  # 效果评测稳定对象、外壳及内部状态
            ├── 混淆项.py  # 从冻结输入与实际判断派生混淆项及前置输入审计
            ├── 盲评.py  # 匿名样本、评委身份及答案隔离
            ├── 行为场景.py  # 行为场景结构、输入版本、实际观察与裁决
            ├── 规则诊断.py  # 非语义规则逐例验证与最小诊断资格凭据
            ├── 角色行为.py  # 诊断角色限定工具、实际会话观察和业务读回
            ├── 评分标准.json  # 随发布包冻结的四项通用标准及五类场景评分锚点
            ├── 语义检测.py  # 单份原生成、共同依据与B06检测核验的执行接缝
            ├── 返修比较.py  # 固定真实返修文本对的盲评适配与最小公共证明
            └── 逐例执行.py  # 逐例尝试和完整证据

逐文件合同

src/muse/效果评测/接口.py

  • 归属与种类:B10;源码。
  • 意图:让调用方通过稳定用例操作效果评测,隐藏模块内部组织。
  • 职责:效果评测公开用例和可导入合同。
  • 边界:唯一跨模块表面;导出输入输出合同,不暴露私有 SQL 或任意处理器。
  • 目标:HTTP、CLI 和编排对相同用例得到一致验证、失败与结果。
  • 合同依据:业务公开接口。

src/muse/效果评测/模型.py

  • 归属与种类:B10;源码。
  • 意图:把效果评测的稳定数据骨架与执行实现分开。
  • 职责:效果评测稳定对象、外壳及内部状态。
  • 边界:纯模型和状态合同;不联网或写库,不把题材属性写死为类字段。
  • 目标:稳定外壳可校验,动态内容携带结构绑定并在所属校验链验证。
  • 合同依据:稳定模型。

src/muse/效果评测/存储.py

  • 归属与种类:B10;源码。
  • 意图:将效果评测的数据访问与版本写入局限在本模块。
  • 职责:效果评测所属记录的 SQL 与版本读写。
  • 边界:只操作本模块记录并使用调用方事务;不跨 owner 写表或调用模型。
  • 目标:版本读写及回滚可验证,不产生第二个独立事务结果。
  • 合同依据:模块存储。

src/muse/效果评测/数据集.py

  • 归属与种类:B10;源码。
  • 意图:固定实验样本来源与用途分割。
  • 职责:来源、样本、分割及保留集。
  • 边界:维护数据集和授权;oracle 不给生产或生成角色。
  • 目标:重复、变体与相邻来源按分割规则处理,样例可追源。
  • 合同依据:专属业务职责。

src/muse/效果评测/实验条件.py

  • 归属与种类:B10;源码。
  • 意图:使变更对照具有相同可解释条件。
  • 职责:冻结目标版本、模型、输入和预算。
  • 边界:固定模型、提示、代码、输入和预算;不事后改目标或阈值。
  • 目标:实验结果只支持当时目标版本和适用范围。
  • 合同依据:专属业务职责。

src/muse/效果评测/逐例执行.py

  • 归属与种类:B10;源码。
  • 意图:用真实样例运行代替人工汇总。
  • 职责:逐例尝试和完整证据。
  • 边界:逐例调 S02 并保存结果;不进入生产写入通道。
  • 目标:失败、超时、拒改和部分输出不从样本集合消失。
  • 合同依据:专属业务职责。

src/muse/效果评测/盲评.py

  • 归属与种类:B10;源码。
  • 意图:隔离身份提示与评委权限。
  • 职责:匿名样本、评委身份及答案隔离。
  • 边界:匿名化和分配;不把答案映射给写手,不假称模型是独立读者。
  • 目标:评委只见允许材料,映射受控且可审计。
  • 合同依据:专属业务职责。

src/muse/效果评测/成对比较.py

  • 归属与种类:B10;源码。
  • 意图:允许原文与不同候选在相同条件下比较。
  • 职责:原文、候选、平局与分歧。
  • 边界:汇总实际选择;不强制某一候选胜出。
  • 目标:原文更好、候选更好、平局、都差和分歧均可记录。
  • 合同依据:专属业务职责。

src/muse/效果评测/指标汇总.py

  • 归属与种类:B10;源码。
  • 意图:保留完整结果与不确定性。
  • 职责:逐例结果、缺失项、覆盖及成本。
  • 边界:只从逐例证据计算;未知用量、缺样本和失败不填零。
  • 目标:报告能回到样例,缺项和覆盖范围明确。
  • 合同依据:专属业务职责。

src/muse/效果评测/启用判据.py

  • 归属与种类:B10;源码。
  • 意图:阻止未经验证或版本不一致的变更生效。
  • 职责:核对实际启用的是已测版本。
  • 边界:检查已测版本与适用判据;实际启用仍归目标模块。
  • 目标:目标哈希变化、缺证据或未标定必需项时拒绝启用。
  • 合同依据:专属业务职责。

src/muse/效果评测/提示词/独立评审.md

  • 归属与种类:B10;源码。
  • 意图:为效果评测的“独立评审”任务提供可版本化表达。
  • 职责:固定条件的独立评审模板。
  • 边界:仅定义本任务提示;角色身份、字段结构、权限和预算从各自权威装配。
  • 目标:模板可随发布包加载且记录哈希,不含固定作品内容或测试答案。
  • 合同依据:业务提示资源。

src/muse/效果评测/__init__.py

  • 归属与种类:工程;源码。
  • 意图:明确安装包和模块的导入身份。
  • 职责:Python 包身份。
  • 边界:只声明包及必要公开导出;不读取运行数据、连接网络或启动任务。
  • 目标:正常安装后可从任意 cwd 导入,导入无运行副作用。
  • 合同依据:Python 包身份。

src/muse/效果评测/行为场景.py

  • 归属与种类:B10;源码。
  • 意图:把场景的禁止动作和预期后果落实到逐例执行。
  • 职责:行为场景结构、输入版本、实际观察与裁决。
  • 边界:不凭关键词或脚本名判断完成;scripted 观察只验证管道,不证明模型行为。
  • 目标:六类诊断场景完整执行,缺观察不通过且结果带固定版本。
  • 合同依据:专属合同。

src/muse/效果评测/文学评分.py

  • 意图:五维评分、真实引文核验与独立评审的稳定性计算。
  • 职责:五维评分、真实引文核验与独立评审的稳定性计算。
  • 边界:汇总实际选择;不强制某一候选胜出。
  • 目标:原文更好、候选更好、平局、都差和分歧均可记录。
  • 合同依据:专属业务职责。

src/muse/效果评测/评分标准.json

  • 意图:随发布包冻结的四项通用标准及五类场景评分锚点。
  • 职责:随发布包冻结的四项通用标准及五类场景评分锚点。
  • 边界:仅保存评分标准,不保存样本/模型输出或启用决定。
  • 目标:实际字节及版本随资源构建固定,评测不能静默改变标准。
  • 合同依据:业务提示资源。

src/muse/效果评测/文学执行.py

  • 意图:冻结并核对文学评判依据和原交付视图。
  • 职责:冻结并核对文学评判依据和原交付视图。
  • 边界:不确认正式创作内容、不标定文学效果或授予启用许可。
  • 目标:与冻结数据、实际S02调用和原交付可核对,失败不能增加未批准的调用。
  • 合同依据:模块设计/B10-效果评测.md。

src/muse/效果评测/条件第三.py

  • 意图:从原S02初评交付重算、登记及核验第三评必要性。
  • 职责:从原S02初评交付重算、登记及核验第三评必要性。
  • 边界:不确认正式创作内容、不标定文学效果或授予启用许可。
  • 目标:与冻结数据、实际S02调用和原交付可核对,失败不能增加未批准的调用。
  • 合同依据:模块设计/B10-效果评测.md。

src/muse/效果评测/提示词/文学评分.md

  • 意图:独立五维评分、共同来源及原字证据提示。
  • 职责:独立五维评分、共同来源及原字证据提示。
  • 边界:不确认正式创作内容、不标定文学效果或授予启用许可。
  • 目标:与冻结数据、实际S02调用和原交付可核对,失败不能增加未批准的调用。
  • 合同依据:模块设计/B10-效果评测.md。

src/muse/效果评测/标定.py

  • 意图:固定标定策略、维护金标准、逐调用偏差与只追加凭据。
  • 职责:固定标定策略、维护金标准、逐调用偏差与只追加凭据。
  • 边界:不写正式内容,不用旧金标准或人工汇总授予启用权限。
  • 目标:只从原候选、金标准与实际S02交付推导当前标定记录。
  • 合同依据:模块设计/B10-效果评测.md。

src/muse/效果评测/标定消费.py

  • 意图:逐评委核验实际标定、来源隔离与派发绑定;停止后保留合法历史。
  • 职责:逐评委核验实际标定、来源隔离与派发绑定;停止后保留合法历史。
  • 边界:不把标定引用或合成服务测试当作效果、生产启用通过。
  • 目标:资格调用绑定已核验原标定,缺失失败或范围不符明确拒绝。
  • 合同依据:模块设计/B10-效果评测.md。

src/muse/效果评测/工作面.py

  • 意图:入口、标定和报告共用同事务逐例核验投影;不产生第二套结果权威。
  • 职责:入口、标定和报告共用同事务逐例核验投影;不产生第二套结果权威。
  • 边界:不把标定引用或合成服务测试当作效果、生产启用通过。
  • 目标:资格调用绑定已核验原标定,缺失失败或范围不符明确拒绝。
  • 合同依据:模块设计/B10-效果评测.md。

src/muse/效果评测/语义检测.py

  • 意图:单份原生成、共同依据与B06检测核验的执行接缝。
  • 职责:单份原生成、共同依据与B06检测核验的执行接缝。
  • 边界:不写正式事实,不把检测回合当文学效果或生产启用证明。
  • 目标:独立检测产物可从原调用和原文重新核验。
  • 合同依据:模块设计/B10-效果评测.md;模块设计/B06-审校修订.md。

src/muse/效果评测/效果标准.json

  • 意图:随发布包冻结的效果门槛、分母与固定场景要求。
  • 职责:随发布包冻结的效果门槛、分母与固定场景要求。
  • 边界:效果评测和凭据读回;不替代目标模块正式启用。
  • 目标:固定目标、来源、分母与未定因素均可核对。
  • 合同依据:模块设计/B10-效果评测.md。

src/muse/效果评测/混淆项.py

  • 意图:从冻结输入与实际判断派生混淆项及前置输入审计。
  • 职责:从冻结输入与实际判断派生混淆项及前置输入审计。
  • 边界:不把疑似分歧当独立真值,不回显禁入事实,不直接批准启用。
  • 目标:完整范围与未测状态可追查。
  • 合同依据:专属业务职责。

src/muse/效果评测/角色行为.py

诊断角色限定工具、实际会话观察和业务读回。合同见效果评测。只通过所属模块公开接口;合成角色循环不作为真实模型效果或启用证明。

src/muse/效果评测/方法对照.py

确切方法目标、授权和双臂输入差异。合同见效果评测。生产生效版本仍由B04与作者批准控制,隔离消费不能直接启用。

src/muse/效果评测/启用凭据.py

  • 归属与种类:B10;源码。
  • 职责与目标:从原S02实际效果重算导出目标证明,按来源停止与发布版本核对。
  • 边界:只交接确切已测写手方法;生产不读答案,B04维护状态,合成结果不作生产批准。
  • 合同依据:目标启用凭据。

src/muse/效果评测/返修比较.py

  • 维护者:B10。
  • 职责:固定真实返修文本对的盲评适配与最小公共证明。
  • 合同:模块合同。

src/muse/效果评测/规则诊断.py

  • 维护者:B10。
  • 职责:非语义规则逐例验证与最小诊断资格凭据。
  • 合同:模块合同。