- src/muse 新版全模块(装配/共享/上下文/任务运行/作品规划/故事世界/正文写作/审校修订/知识方法/作者经验/效果评测/交付连载/资料研究/正式变更/元数据/接入/基础设施/编排)+ 测试树(单元/契约/集成/架构/迁移/端到端/夹具) - 129 项功能全部实现与自动验证(功能覆盖.json/矩阵),含 W31 补齐的规则与代价/节奏安排/伏笔与承诺 - 旧实现按处置清单退出(702 条中 324 删,保护合同与未迁移条目留存有据);web/app.py 旧工作台退役,新工作台为唯一写入口 - 数据库/旧库迁移:真实旧库内容批次迁移链(端点守卫/PG作品正文映射/质量资产缺省投影) - 运行手册 docs/运行手册.md;W30 本机服务阶段一已运行(infra PG 为正式内容权威) - R2 执行证据与私有运行材料在 .agents.local/改造/R2-20260909/(不入库)
43 KiB
B10 效果评测
职责与对象
独立数据集实验、逐例结果和可追溯的启用判断。
实例归属以总体架构为准;结构、状态和公开外壳分别引用数据模型与接口契约。
公开接口
| 用例 | 输入责任 | 输出与后果 |
|---|---|---|
| create_experiment | 固定变更、条件、数据集和分割 | 实验身份 |
| execute_samples | 实验、隔离权限和预算 | 逐例任务及产物 |
| assign_blind_review | 固定样本对和评委范围 | 匿名输入与受控映射 |
| 发布返修比较数据集 / 创建返修比较实验 | B06确切会话、轮次、候选、作者批准及两名独立评委配置 | 封存固定原文对并只创建比较任务;不生成新候选,不写production正文 |
| 导出返修比较证明 | 已启动的固定返修比较实验及同作者维护连接 | 从实际报告导出无正文只读证明;完整性、失败、费用、验证模式和未标定状态原样保留 |
| compare_results | 完整逐例结果 | 胜负、平局、分歧和不确定性 |
| check_activation | 目标版本、实验与判据 | 有依据的允许或拒绝 |
| read_effect_assessment / seal_effect_assessment | 已有实验身份;不接受手工报告 | 重算工程与效果阈值、保存合格统计凭据;正式启用仍由目标owner批准 |
| publish_method_evaluation_dataset | 维护作者、B04确认版本、样本、许可、批准及到期时间 | B04只读核验后封存方法用途投影和答案分区,返回确切目标与材料哈希,不改变方法状态 |
| 导出启用凭据 | 评测作者、实际实验ID、同库维护连接、明确批准与期限 | 持停止保护重算原S02/标定及已封存效果,维护入口仅写最小目标证明;不直接启用目标 |
| 读取启用凭据 / 核对启用凭据 | 同库业务事务、作者、证明ID及确切目标 | 只读公开投影与当前停止状态,核对版本、材料、资源、策略、用途和期限,不授予oracle或评测候选读取权 |
| 发布规则诊断数据集 / 执行规则诊断验证 | B06精确非语义版本、独立样本、原字区间金标、来源组和授权 | oracle隔离金标,逐例运行B06核心并只从全部存证计算专用硬门 |
| 读取规则诊断数据集目标 / 读取规则诊断验证定位 | 同作者评测身份与确切数据集或运行ID | 只返回数据集哈希与目标,或实际run_id、target与结果哈希;不返回逐例、原文或oracle |
| 导出 / 读取 / 核对 / 停止规则诊断凭据 | 实际规则诊断运行、明确维护批准和期限 | 只对真实来源holdout的完整逐例通过导出最小公开凭据;不暴露原文或金标 |
所有接口在本模块的接口.py 暴露。输入输出类型由同一公开表面导出,外部不导入私有模型或 SQL。
内部职责
| 文件 | 职责 |
|---|---|
| 接口.py | 效果评测公开用例和可导入合同 |
| 模型.py | 效果评测稳定对象、外壳及内部状态 |
| 存储.py | 效果评测所属记录的 SQL 与版本读写 |
| 数据集.py | 来源、样本、分割及保留集 |
| 行为场景.py | 行为输入、实际调用观察、禁止动作与逐例裁决 |
| 实验条件.py | 冻结目标版本、模型、输入和预算 |
| 逐例执行.py | 逐例尝试和完整证据 |
| 盲评.py | 匿名样本、评委身份及答案隔离 |
| 成对比较.py | 原文、候选、平局与分歧 |
| 返修比较.py | B06固定原文对封存、专用实验条件与public只读证明 |
| 指标汇总.py | 逐例结果、缺失项、覆盖及成本 |
| 启用判据.py | 核对实际启用的是已测版本 |
| 规则诊断.py | B06非语义规则的样本封存、真实核心逐例、完整硬门与最小凭据 |
| 提示词/独立评审.md | 固定条件的独立评审模板 |
完整路径及运行模板见目标文件清单。逐文件意图、边界与目标见文件合同。
实现约束
- 发现、校准和保留集用途分开;生产和生成角色看不到答案或匿名映射。
- 每个样本保存实际执行,外部人工填汇总不能替代逐例结果。
- 规则有效性、保真、文学偏好和运行可靠性分层判断。
- 未知成本、失败指标、缺样本和未标定维度不能被填零或忽略。
协作与失败
S02 承担同一可靠执行机制,使用独立数据库权限;B07 申请实验,B04/B06 对实际启用负责。
答案可见性异常阻止运行;样本缺失或变更哈希不一致阻止启用;评测产物不能直接转生产。
Skill 行为场景由本模块执行和裁决,索引工具只负责发现。六个诊断场景按行为场景合同分别验证;scripted 管道、真服务边界和真实角色行为分别留结果,不合并为同一种通过。
验收行为
- 目标章答案不进入生成输入。
- 逐例结果能回查。
- 原文胜出和平局有效。
- 实际启用严格对应已测版本。
验收入口和替换条件见迁移与验收;这些条目是目标行为,不是已通过测试的声明。
行为场景执行证据
W24的场景数据固定合成文本哈希、明确业务动作和预期观察。scripted只运行观察裁决;service通过真实B06/B05公开接口获取调用、正文前后版本、实际规则库及报告读回。service接收的是明确业务动作,不据此证明自然语言路由正确;自然语言提示词的选工具行为由W25真实role_agent执行验证。
裁决核对逐次动作、完整观察、正文可见字节哈希和结构版本。诊断报告须与实际规则库重算一致,并且保存后读回相同;字段名字符串、调用方success标记和模型自报“正文未改”均不作为证据。零命中仍验证完整覆盖,未审语义范围保持未审。当前规则为空时如实记录空库,不把缺少已启用规则当作文学无缺陷。
不接收role_agent观察自报通过。W25的角色行为由编排/行为评测.py固定真实合成正文、规则、已发布技能、planner配置及完整初始请求,复用S02有限角色会话与Pi/直接宿主。只安装read_review_rules、create_diagnosis、read_diagnosis、read_selection_scope四个工具;工具参数不接受作者、作品或截止变更。诊断工具经B06保存派生报告,不修改B05正文、候选或正式内容。源服务须显式配置,任务仅在evaluation执行;不得从默认库推导资料服务。
场景的expected、required_actions等断言仅供裁决,不进入角色系统提示或用户消息。角色只收到已发布诊断技能、自然语言请求和固定工具描述。缺作品场景在业务参数校验时拒绝,返回preflight_only与零模型调用,不把该项记作模型运行。外层planner是行为评测的角色回合,场景禁止的S02.model_call指诊断业务另行调用模型,二者单列。
角色行为报告按S02真实模型回合顺序重建工具回传,逐次核对完整请求哈希、唯一工具调用、响应、工具来源与B05/B06业务读回。缺原始证据、跳过规则或伪称完成不能通过;正文和规则漂移在新回合前阻断。角色恢复重放已结算完整回合,不重做已保存工具结果;未知费用、未完成或撤销保留不签通过。S02保留授权与领取界限仍生效,历史查询不延长授权、不派发。
CLI 行为评测 场景.json --配置 评测.toml --业务配置 合成资料.toml --动作 准备 --目标 请求.json冻结任务并返回具体可审请求;--动作 执行/报告 --目标 任务ID分别点名执行和只读核验。点名领取同时限制作者和任务,不消费其他排队任务。准备请求明示配置版本、调用/工具/输出上限、费用、批准引用和期限;实际执行保留获准的有限会话字节。各模式独立汇报:runtime_verified仅表示真实S02工具循环,model_verified保持false直到取得独立的真实外部模型执行证据,合成HTTP和真实Pi宿主均不能代替外部角色验收。
匿名分配与成对判断
实验先固定目标版本、样本集合及评估维度。预注册版本balanced-experiment-v1包含两张独立顺序表:运行按SHA-256(数据集版本ID+样本ID)排序;盲化按SHA-256(writer-blind-assignment-v1:+数据集版本ID+:+样本ID)排序。两张表各自从固定臂顺序起循环旋转,每个位置上的各臂数量差不超过一,不逐例随意洗牌。匿名身份仍包含实验UUID,不能跨实验复用。公开条件只存运行表、盲化命名空间及私有表哈希,完整盲化表属于oracle,不进入生成或评委材料。
S02任务按冻结运行表的样本和臂次序创建;比较依赖按独立盲化表绑定,同一文本对的第二名评委交换两侧。每名评委拥有独立任务、配置、调用及原文授权,不携带前一评委的报告、会话历史或工具。在冻结执行计划前,逐项核对两表、完整样本和臂集合及私有表哈希,失衡、改表或缺少此版预注册条件均拒绝。运行表表示调度优先顺序,真实并发开始/完成次序仍以S02回合证据为准,不能用预注册表反推实际时序。公开盲评材料仅有匿名文本和维度要求,不含哈希、原文/候选身份、模型名、实验臂名或金标准。
新比较合同quote-only-v2只要求模型选择left、right、tie、both_bad或unknown,并逐维提供理由和两侧精确原文引文。模型不能提交位置、哈希、身份或回执字段,包括嵌套字段。确定性核验按冻结维度顺序重排,对每条引文按Unicode码点定位首次原样出现;不归一空白、换行、组合字符,不把UTF-16偏移当码点。重复原文绑定首次出现位置,未出现引文以PAIRWISE_QUOTE_NOT_FOUND拒绝;空侧仅接受空引文并派生0—0范围,非空侧拒绝空引文。维度集合必须完整、唯一、与冻结条件相同。总体选择保留原文、候选、平局、都差或不确定,多个独立评委不一致时保留分歧,不用多数投票掩盖。
S02留存并核对原始模型输出,B10单独保存由实际生成文本和原始引文派生的定位报告及哈希。报告、恢复和下游读取时重算定位报告并与保存结果核对;重签B10定位结果不能替换原回合。已有位置合同只供旧回合历史核验与合法在途保存,不能作为新比较请求的输出合同。原始输出哈希和派生判断哈希在逐例报告中分别展示。
B10留存的运行快照不是第二份运行权威。每次读取同时核对快照的作者、角色步骤、尝试、输入、派发和响应元数据及输出哈希,空快照或副本字段被改写均拒绝。任务、步骤和尝试状态保留保存时的历史值,不要求与后续完成或恢复状态相同;报告中的当前状态由S02另行读取。
生成与检测失败后的显式恢复沿原单元、原任务和冻结调用额度执行,失败的尝试与费用不删除。最终产物须绑定S02具名成功确认,不按费用列表的展示顺序推断哪个回合最后成功。具有已知费用的前次失败不使后续成功作废,费用未知则继续阻断;最后仍失败时不得产生有效检测或合格判据。恢复不重置原额度,也不接受调用方列举的回执数组扩充次数。
有界引文纠正由实验条件max_judge_corrections登记(0—2,默认1),每个比较单元的实际上限不超过其原有调用配额减一;固定计划明确实际允许次数。只对S02已保存、结构有效但引文缺失的回合执行,其他协议/结构错误不自动复发;费用未结算或未知时不自动发送下一次。纠正沿原评委、原两侧文本和维度,附上该评委上次结构有效草稿、固定错误提示及两侧原文开头至多160码点的原字提示;不注入其他评委判断、内部身份或回执。相同来源保护、停止、截止和预算检查逐次生效。
V0038将结构有效的判断拒绝按单元追加保存,绑定原任务/尝试/调用、用户输入哈希、原始输出、拒绝码及前序记录哈希。只有PAIRWISE_QUOTE_NOT_FOUND可进入自动纠正;其他判断合同错误记PAIRWISE_NOT_EXECUTED并终止。记录只追加,不删除或覆盖失败来重置次数;读回和恢复都经S02反查原交付并按实际生成文本复算该拒绝。达到上限后保留缺失判断和失败状态,不产生成功报告或额外调用。已通过的交付保留原始输出与定位结果,并能追查全部被纠正回合及其实际费用。
若S02已确认回复而B10登记事务失败,工作面列出具名未登记交付,生成和比较均禁止直接重发。作者可经补登记交付(CLI请求JSON或POST /api/v1/evaluation/deliveries/restore)提供原始输出;同一作者、固定单元及最早未登记回合的S02原尝试、输入/结构/输出哈希全部核验后,在失败或暂停任务上补登原结果或拒绝。不重新调用模型、不增加纠正次数;重复补登原样幂等,错作者/内容/调用及已停止实验拒绝。没有原始输出时保持未完成,不能靠新生成结果替代历史。保存和补登记与停止决定共用共享/排他保护,提交顺序明确。
判断中的模型身份由S02实际派发证据供给,不从模型输出读取;同一改写模型不能作为独立选择模型,缺理由或引用合同不符视为未执行。纯函数只核结构、引用和选择一致性,不认证真实模型调用或生成启用许可;运行层仍须核对真实结构化交付及固定版本后保存。
固定返修文本对适配器
fixed_revision_pair_v1只消费B06公开用例核验出的一个确切返修来源,可以是诊断授权,也可以是同一持久会话中的作者选段授权。维护发布请求只提交数据集身份、会话/轮次/候选定位、作者批准引用和期限,不接收原文、候选文本、模型名、比较结果或通过标记。B06在生产用途连接中核对原正文、授权与保护区、保真报告、B05候选及S02原任务/交付;B10只把两侧实际文本写入oracle,把作者、目标、内容哈希、任务/调用、配置/资源和保真引用的最小投影写入evaluation公开清单。诊断数据集保持fixed-revision-pair-dataset-v1,选段数据集使用fixed-revision-pair-dataset-v2,但两者复用同一比较执行本体,不生成候选。相同版本只能原样重放;任何原文、候选、授权、保护区、配置、资源或批准变化都不能覆盖旧版本。
专用实验固定original/candidate两臂及恰好两名评委,不创建writer生成单元。两名评委分别拿到互换左右位置的匿名文本、共同维度与原quote-only-v2合同;实际选择仍走S02任务、预算、配置验证、派发保护、原字引文定位、拒绝补正、失败恢复和逐例报告。评委模型必须彼此不同且都不同于原修订模型。当前正式judge策略只有单模型白名单,尚不能构造真实双模型配置;隔离测试只能临时注入合成策略与合成HTTP,并保留offline_contract,不得修改正式策略或转述为真实外部模型运行。
导出返修比较证明从同一只读快照重算实验报告,证明中保存两名评委的原任务、调用、实际模型及输出/判断哈希,但不保存正文、引文、oracle或匿名映射。比较未完成、费用未知/待结算/超额、评委分歧,或结果为原文、平局、都差、未知时,B06只呈现保留原文的原因;稳定候选结果也不自动采纳。证明固定记录未标定、验证模式与activation_status=not_evaluated,不能签发方法/规则启用或生产切换许可。证明只追加,同一报告重放幂等;恢复后的新报告产生新证明,旧证明保持原结论。muse_revision_comparison_status额外投影当前停止状态,GET类消费者只能读取它,不能借读取触发派发。
文学评分目标合同
writer-replay-rubric-v3是随发布包冻结的评分标准(评分标准.json)。沿用设定实体保真、细纲保真、声音一致、场景执行和可读性五维;每项0—10分、0.5步长,布尔值/字符串/非有限数不算分数。战斗、人物对话、转折、信息揭示和老角色回归分别使用已登记标准,保留narrative_tension身份但按具体场景解释;不允许任意未登记场景或仅改版本号替换锚点。
文学评判的共同依据由维护者封存于数据集oracle部分,与生成输入分离。只投影明确的细纲、历史文本、事实断言及预注册约束给评委,不能将整个answer对象或目标正文答案、卡片索引混入。依据的版本/内容哈希由B10保存,不让模型自报。每对文本的两侧、共同依据、评分标准和模型原交付均可回查。
模型对完整的两侧×五维给出分数、理由和原字引文;每个评分须包含该侧候选证据,保真/声音维度还须有相应共同材料或事实依据。模型只引用本次给出的局部来源身份,不给位置、哈希或运行身份。代码按实际文本定位引文,推断只能引用本维度已核对证据的稳定ID;未提供的来源、缺项、重复项和跨维借用均拒绝。事实断言及硬约束按两侧×全部稳定ID逐项判断,unknown不能当有效保真结论。原字引文的纠正与实际调用仍沿同一S02链和固定上限。
文学模式预先固定两名评委和最多一名候补评委及预算。两名反向独立评委同一分项差异超过0.5分,或事实/约束/偏好判定不一致时才需要第三评;第三评不读前两份报告。第三评必须绑定相同文本对、来源、场景与评分标准。仅在每项存在稳定分数对、判定可形成一致对时给出仲裁结果;原始分歧和全部回执继续保留,没有稳定对则保持不稳定且无胜出。仲裁稳定性不是文学质量标定,未经独立标定的指标继续为null,也不产生启用许可。此节是完整实现目标,验收以实际逐例执行证据为准。
数据集与实验封存
混淆项与冻结输入审计
报告的独立confounders段始终逐样本提供疑似漏报、疑似误报、输入泄漏、评委不稳定和声明新角色缺卡五类观察。其版本为evaluation-confounders-v1,绑定原实验条件、计划及已核验逐例证据。它不改变writer-effect-v1已封存统计凭据的计算依据;既有凭据不能因增加报告展示字段而失效。
疑似漏报/误报仅比较主对照中同臂、同类、同命题ID的检测与稳定评委判定,不把评委当独立真值。分母保留主对照全部已登记命题,缺一侧检测不缩小分母;未知或未完成保留依据不全。输入审计未做或有命中时,疑似误报也保持未完成。初评存在分歧即保留不稳定观察,第三评收敛不会抹除原分歧。泄漏审计分母按每个事实在每个主对照臂的系统提示、用户输入各计一次。
维护发布可在oracle答案中提供writer_audit;真实回放使用样本audit入口,写入同一oracle字段。writer-input-audit-v1固定标注来源、历史截止位置、可选禁入事实与可选声明新实体ID;缺项不是空集合。真实回放的截止位置必须与B09已封存历史一致,实体比对使用实际导出的稳定对象ID,不猜名称或硬编码实体类型。该比对只说明维护者声明集合在当前输入卡片中是否缺失,不自动认证角色在历史时点尚未出现。
禁入事实必须晚于声明截止位置。机械审计对冻结系统提示和用户材料核对预登记事实片段:宽窄字符及标点归一后至少六字精确片段,或三个长度至少三字且总计至少九字、覆盖事实片段一半的共同锚点。命中在启动和发送前拒绝,不调用模型;报告和错误只保存哈希及原因,不回显禁入事实。此方法只覆盖给定事实和该机械规则,不认证语义泄漏为零;明确空清单只表示审计范围为空。
审计依据哈希进入原实验条件和生成单元,再由S02单元派发哈希绑定。来源或声明变化拒绝新消费及报告伪造。声明本体不进入生成或评委输入;未配置的历史实验仍显示未测,不能凭后补JSON变成已审计。
标定实验与金标准
标定采用显式calibration分割及预注册calibration_policy,只适用于文学评分模式。策略固定最小样本数、独立来源组数、平均绝对偏差上限、单项绝对偏差的严格上限和事实/约束一致率下限。阈值是本次版本策略,不从旧项目固定样本数或文件名前缀推断。普通实验的空策略不改变既有命令身份。
先完成全部生成单元,再由维护用途的同一作者封存这批候选的金标准,最后创建评委任务。标注必须完整覆盖全部候选、五维及相应事实/约束ID,并绑定原生成回执和输出哈希;不能拿另一文本的分数比较。金标准与推进共用实验锁,写入与停止保护串行;任一评委已登记后拒绝追加或改写金标准。同一原样请求可重放,但标签不能覆盖。
金标准保存在oracle,只给确定性标定计算使用,不进入生成或评委材料。实际评委派发另绑定金标准哈希;保存、读取和标定都反查原S02交付与该哈希,重签本地金标准或汇总不能替代原回执。标注是有明确批准引用的维护声明,不自称模型运行证据。
标定逐评委、文本对、候选与维度计算偏差,不用仲裁均值掩盖某个评委的背离。所有必需单元、费用和稳定性齐全后才判断阈值;缺项和空对照保持未完成,已完成但偏差超限记录失败。均差可正负抵消,合格判断必须看绝对偏差和最差单项。来源独立性按共享source_groups连通分量计算,不能通过给同一样本加多个标签提高独立组数。
封存标定凭据时记录完整策略、标准、样本、金标准及实际调用依据;失败凭据也只追加。读取重算并核对,不接受调用方传入passed、mae或平均分。合成配置验证模式与真实配置证据保留,统计符合给定金标准不自动成为生产启用许可;后续启用仍复检已测目标和所需证据层次。
tests/夹具/方法审核/历史标定/按原字节保留旧方法卡评分与三份人工金标准说明,仅供迁移追溯。旧字段、尺度与批次不能自动变成当前文学评分的金标准,更不能据旧stamp授权新启用。当前标注必须走对应实际候选的维护封存入口。
资格实验消费标定
实验目的默认为diagnostic;申请qualification必须使用文学模式、独立holdout分割及明确的calibration_use。后者固定所需策略和一至八份标定实验/凭据哈希。目的表示将按资格要求收集证据,不表示已通过效果或生产启用判据。默认空引用不改变旧命令身份;标定实验不能再引用其他标定。
创建、启动、推进和每次实际派发均从本作者原标定实验、金标准及真实S02回合重算。只接受已封存且通过的记录,所需策略必须完全一致。两名初评及候补的准确配置、发布资源、角色策略和场景评分标准必须被覆盖;按配置独立重算样本/来源数、五维偏差与事实/约束一致率,不能用全体均值遮蔽某位评委失败,也不能把未执行的候补算作已标定。可由多份已完成标定覆盖不同评委,但每名评委至少有一份独立完整的合格样本集,不拼接不足样本凑阈值。
资格样本与每份标定核对source_groups、公开底稿内容及原文/共同细纲和历史文本的精确内容哈希;换数据集、样本名或来源标签不能复用同一文本。此检查能拒绝已知分组与精确重复,不声称能识别未声明的同书关系或改写相似度。标定覆盖的是评委与尺度,不要求资格实验的生成器或待测目标与标定实验相同。
标定使用依据进入冻结条件、单元计划和S02派发元数据,不进入模型可见材料。实际回复模型必须与已标定身份相同,允许的模型别名也不能静默替换。当前发布资源/角色策略或评分标准变化、来源停止均阻断新调用;发送事务持有来源的停止保护。此前已合法发送的交付按原依据保存和回查,停止不抹历史记录,也不授权补发。工作面和报告显示原引用、各评委实际覆盖和当前停止状态;原回执被替换或证据重算不符仍拒绝。
文学执行使用comparison_profile=writer_rubric,准确指定两名judges及一名arbitrator配置。维护发布的每个样本在answer.judging_basis封存场景、共同来源、事实断言和预注册约束。真实ABC回放只允许维护者声明场景和命题(judging);细纲与历史正文由B09实际封存材料自动投影,不接受另填的正文。目标章答案始终不合并进评判材料。实验登记只公开依据哈希和各场景评分标准快照;实际比较按相同oracle版本读取并复检。新发送要求当前发布标准相同,历史交付按原标准回查。
writer-rubric-v1单元沿原S02创建、预算、派发、交付及引文纠正链。调用前固定完整JSON合同、模板、两侧生成依赖与依据哈希;实际S02交付保留原始字段,B10另存归一评分、代码定位引文与派生哈希。所有下游消费反查原S02调用,不接受自报或局部重签报告。评委的实际模型、调用引用和候选身份由控制器从回执投影,不进入模型可填字段。
V0039保存不可变的条件第三决议。启动时为每对的两次初评和一项候补分别预留完整费用及调用上限;无需第三评的配额不转移给其他单元。两次初评必须全部完成、费用已知且未超预算,才能根据实际交付登记required、not_required或invalid_inputs。决议保存与第三任务创建处于同一事务,重复推进串行核对原决议。稳定双评不建第三任务;初评无效、失败、费用未知或实验停止不启动第三。发送、交付和报告重算都复核决议及其原调用依据;第三评不接收初评报告。
报告分别保留初评差异、所有原始评分/偏好和收敛结果。分数或判定无法形成稳定对时没有汇总分数和赢家,但全部样本、调用及费用仍在分母与记录中。只有被持久化证明无需第三的单元可记为not_required,不把它列为漏执行。评分收敛和已完成S02调用不证明文学质量,标定指标及启用状态继续单独验收。
数据集由maintenance维护入口发布,公开输入与答案在同一事务中分别写入evaluation和oracle;生产角色无权读取二者。发布请求逐样本明确来源引用、许可说明、来源组和discovery/calibration/holdout分割。相同底稿(原文与背景的组合)或同一来源组不得跨分割;没有底稿的纯指令任务按指令内容去重。有底稿时,改写指令不能绕过分割。分割为空可如实存在,但实验选择必须非空,启用另核完整保留集与标定证据。历史金标准可封存为答案,不自动成为当前有效标定。
模型输入外壳仅含instruction、original和context,样本ID、实验臂、来源元信息、答案、匿名映射及内部配置不合并进模型输入。context是已选公开背景的JSON值;维护者负责输入来源的合法选择,来源声明不是模型自报授权。真实来源的消费复检由后续S02派发接缝负责,数据集发布本身不启动模型、不批准正式内容。
同一数据集名称的版本严格递增;同版本只能原样重放,公开输入相同而答案改变也拒绝覆盖。普通评测角色不能修改已发布输入或答案。匿名映射由B10在创建实验时追加,muse_eval仅获得该映射表的INSERT,不扩宽对答案的写权限;模型进程不持有数据库凭据,也不能直接访问评测编排的oracle查询。
实验请求固定数据集版本/哈希、分割、全部所选样本、目标版本/哈希、生成与评委配置引用、维度、实验臂、总预算及每样本调用上限。配置内容从S02实际版本读取后保存哈希,不接受调用方自报实际模型或费用。新实验状态为registered,表示条件已登记;真实目标读取、配置启用、逐例S02派发和证据复检均是执行阶段前置,不将registered当作已执行或可启用。
固定逐例执行与停止
显式detector配置为每份实际生成文本登记独立语义检测单元,前置为该生成任务完成且费用已结算。检测角色与写手模型分离,预算、配置、原文保留、发送和恢复沿同一S02执行器;未配置检测器的实验保持未检测,不把不存在的结果写成零残留。检测只读取单份候选和维护封存的共同依据,不读取另一臂、评委报告或整个oracle答案。
语义检测合同由B06连续性审校维护:事实陈述须绑定候选原字引文及已给依据,已知断言与硬约束须完整逐项覆盖;缺证据保留unknown,模型不能填总通过、位置、哈希或执行回执。声明新事实必须引用细纲依据,新设定仅作为未决建议留在评测结果,不写B02。B10按原生成、冻结依据和S02输出重算发现、命题判定与计数,保留原输出与派生报告各自哈希。高严重度发现、冲突或失败命题不能被常量无缺陷报告覆盖;未知和缺失不算通过。结构错误不自动重发,原S02交付可按既有补登规则核验。
普通偏好请求的命令身份沿用引入文学模式前的规范内容:默认comparison_profile=preference及空arbitrator不增加命令哈希字段。显式文学模式与候补配置属于实际条件,必须进入命令哈希;不能利用归一重放其他条件。
启动实验时保存不可变执行计划和完整单元集合。生成单元与比较单元各绑定独立S02任务和准确配置;任务、已启用配置、预算及单元绑定同事务提交。每个单元预先分配调用数、费用上限和截止时间,不能在失败后删掉该单元或增加总预算。比较只在两侧有真实交付、任务完成且费用已结算后创建。
当前direct_writer_prompt_v1适配器验证合成来源的control/treatment提示词对照:control使用固定角色与通用创作指令,treatment使用B05发布包的生成模板,两侧共用B05输出合同。独立评委使用发布包评审模板,材料仅包含匿名文本和维度。此适配器的范围不承接旧ABC来源策略、方法/规则消费、技能选工具或真实来源授权;其他目标和宿主须由相应消费验证器接入后运行。测试中的独立模型只属于隔离策略,验证模式如实保留offline_contract。
执行计划冻结完整系统提示(角色职责、任务模板和输出合同)及实际字节。发送时由S02把即将外发的真实请求交给B10,在停止保护事务中核对公开输入、完整提示词、输出结构、模型配置、工具/历史和调用上限;偏离时不外发。派发回执保存单元身份、单元哈希与实际系统提示哈希。模板随发布资源登记,不能从未纳入构建身份的散落文件加载。
单元交付必须通过S02结构化核验。读报告、恢复和下游比较时,再查询原任务、原尝试、实际输出哈希、派发单元、系统提示、配置验证回执与预算记录;重签B10局部哈希不能替换S02交付。业务产物保存后步骤中断,恢复引用原尝试而不重发。工作面列出完整固定单元、失败及未执行状态;费用读取该任务全部尝试,失败费用保留,未知费用不能计为零。
停止决定先持久化,再逐个收敛S02任务。它与发送检查共用排他/共享停止保护,防止已停止实验继续派发;停止后的迟到结果不产生新B10交付,已经发送的费用继续保留。重复取消可继续收敛未完成的任务,不能复活未开始的评委。已完成产物保持可追查。执行完成、统计完成和启用批准是不同状态,当前工作面不生成启用许可。
逐例报告
方法版本对照
writer_method_v1以method-evaluation-dataset-v1封存B04具体确认版本,目标为method/B04.method:<方法ID>/具体版本/确认内容哈希。维护入口经B04核对作者、当前版本、原确认提案、内容与证据及S04 generation/evaluation投影,再封存许可、批准和期限。未确认、已撤回、非当前版本、非作者或被改写的版本不能发布;确认只说明内容版本可测,不预先启用方法。CLI为评测 <维护配置> 发布方法数据集 <请求JSON>,HTTP为POST /api/v1/evaluation/method-datasets。
两臂共同使用当前B05模板、相同公开任务/底稿/背景和输出合同,仅treatment的context增加B04原样渲染的“方法材料”;公共样本不能预填该保留槽位。实际请求、方法材料哈希、目标、任务、模型交付和配置继续受原S02逐例保护。方法身份和批准说明不进入匿名评委材料,评委仍只看匿名正文。其他阶段的方法、真实私人正文、规则和Skill对照不由这个写手适配器代替。
方法资料是一次具名批准的不可变历史快照,与正文回放相同,版本不追随正式方法后续编辑。新创建、启动、每次派发和新封存效果凭据均核封存作者、期限与当前S04字段策略;评测账号不获得查询正式方法表的权限。停止某次实验沿既有停止入口;封存版本并不延续或重建生产启用。历史合法交付和费用保留,过期快照不可新消费;正式启用仍由B04对当前确切版本和目标所需效果证据再次核验。
固定效果判据
目标启用凭据交接
方法写手对照通过且已有完整运行验证、标定和效果凭据后,B10可以导出target-enablement-v1。导出入口只收实际实验ID,不收调用方报告、总分或passed。它在evaluation连接中持有实验及所有标定来源的停止共享锁,从原S02重新核验;只有validation_modes恰为runtime、当前资源/角色/效果标准一致且完整效果通过才可继续。离线配置、未知费用、失败或未标定不能导出。runtime是配置运行证据等级,测试中的合成配置验证器不构成真实外部模型文学验收。
写入由显式同作者maintenance连接完成,两连接核对实际数据库名、服务器启动身份及服务端地址/端口,并再次核对目标库原效果凭据。生产、评测账号均不能写public.muse_enablement_receipt;记录只追加,绑定目标、方法材料、全部来源实验、原凭据、版本哈希、批准及期限。公开视图muse_enablement_status只给证明及来源是否停止,不暴露答案、匿名映射、评审原文或候选。生产读取仍无evaluation/oracle表权限。
目标owner在同一业务事务中按与实验停止相同的锁键保护证明,随后重读停止状态。实验或任一标定停止、证明过期、资源或角色策略变更、目标/材料不一致均阻断新启用及该证明支持的新消费;既有正式状态与历史消费不被B10改写。导出不是作者启用,B04必须再核当前确切版本、生产写手投影与受测投影一致,并接收作者明确状态命令。
rule-diagnostic-qualification-v1是与writer-effect-v1分离的明确用途,只评验B06.readonly_deterministic_diagnosis。运行前固定完整规则/例证哈希和全部数值硬门:holdout至少3例,正例、负例、保护表达各至少1例,独立来源至少3组,误报、漏报、处置不符、保护破坏和未知项上限均为0。任一硬失败不得被平均数抵消。
B07交接只使用两个最小只读投影:数据集投影在执行前返回dataset_version_id/dataset_hash/target,不读取或暴露oracle;运行投影从完整已保存验证重算后只返回run_id/target/result_hash。B07据此登记实际专用验证,不得把它转换成普通实验、模型任务或自签报告。
规则定义内的sf/snf/boundary/regression只作训练与回归例证,名字不构成金标,其样本ID、原文哈希和已声明来源与holdout去重。每个holdout另行封存标注状态、原字区间/预期处置、负例、保护区间、许可和来源组。缺标注样本仍真实运行B06核心并记录actual,但判为证据不足;工程合成样本最多得到engineering_only,不导出启用凭据。最小公开凭据只含目标、策略、数据集/证据哈希、计数、授权和期限;production不能读取oracle金标、样本原文或逐例评测表。
CLI为评测 <评测配置> 导出启用凭据 <请求JSON> --维护配置 <同库维护配置>;请求只含experiment_id、approval_ref、valid_until。作者在方法详情页先核对证明与当前版本,再确认启用写手用途。该证明不授权规划、审阅、规则或资源发布,后者仍须各自适配器和目标owner。
正文实验可预注册effect_policy=writer-effect-v1,准确阈值以效果标准为唯一数值定义。创建时冻结标准内容与哈希,须有文学评分及独立检测;标准变化阻断新启动、推进和派发,原报告按原标准回查。该标准用于当前正文提示词、来源及写手方法对照,仍只证明标准明确要求的正文收益,不泛化为所有方法阶段的效果;不套用于规则精确率、Skill选工具或其他未接适配器的目标。
A阶段先看实际任务失败、费用未知/未结算和超额,再看固定样本及五场景覆盖,最后核目标臂的实际检测与完整执行。确定失败、缺证据与目标语义未决分别保留。B阶段须通过A,使用合格标定的holdout样本,满足作品、每作品样本及独立来源数量、不稳定比例和分组覆盖要求;再检查整体、场景与非空角色分层的退化,最后判断保真增益。来源独立性沿共享来源组连通性计算,不靠给同一来源增加标签凑数量。
主指标只从固定主比较的稳定评分得出:ABC取C减A,其他比较单列诊断;提示词对照取treatment减control。空或未稳定评分不补零,平均值明确稳定样本数,增益/退化比例仍使用完整固定样本分母。非空场景或角色分层缺少稳定结果保持证据不足;已知组内退化不能由整体收益掩盖。达不到收益阈值为no_gain,不生成合格凭据。
普通数据集可由维护者提供stratification(作品引用、标注引用、新角色比例),作为有来源的实验分层声明,不是模型或业务事实验证。真实回放的作品身份取实际selection,提供声明时必须一致。缺作品保持未定,新角色比例分为zero、low、high、unresolved;只有明确比例才分层,未定组仍展示并检查退化。元信息不进入生成或评委输入;未提供新声明时不改变旧数据集的字节与重放身份。
公开效果入口只接受实验ID,在同一快照中复检原任务、调用、候选、检测和标定后重算。合格统计凭据在evaluation只追加,绑定准确目标、数据集、计划、标准及逐例证据;非通过、标准过期或已停止时不签新凭据。读取重算并与原凭据核对,重签本地汇总不能替代原S02。停止后的已有记录仅供历史回查;生产角色不能读取该表。统计凭据保留本实验及标定来源的验证模式,不直接批准目标启用,后续目标owner仍须核对已测版本、所需证据层次和作者批准。
同一次工作面读取只复用已经完整核验、已结算且未超额的交付值,作用域限定为当前连接和作者;缺失与不确定交付不缓存,下一次读取重新核验。停止、配置、任务状态和费用的独立检查保留,不跨请求或事务缓存合格结论。
维护入口发布回放数据集按明确作品和章位调用B09封存ABC材料,并将目标正文置于oracle。公开输入只保存共同任务与已投影细纲,分臂材料、真实来源及字段策略指纹另存封存快照;普通数据集发布不能提交这类内部载荷。同书及相同历史原文自动形成来源组,禁止跨发现/校准/保留集分割。资料批准限定作者与模型使用到期时间;登记或读取历史报告不延长期限。
writer_source_abc_v1评测目标为当前构建的B09.writer-replay代码版本,A/B/C共用B05提示词和输出合同,只改变经B09准备的来源材料。实际执行只读取已封存评测资料,不查询正式业务表;新派发要求本作者资料批准有效、执行截止不晚于批准到期、S04字段策略与封存指纹一致。发送短事务保护字段策略,策略收紧后旧资料不能继续发送。生成三臂后独立评委分别比较全部三组文本对,A/C是主比较,A/B与B/C作为诊断,不能混成一个平均胜率。
字段策略或发布资源在合法发送后变化,不抹去该回合:保存交付按原不可变单元核对S02真实派发、输入和结构化输出。当前领取及实验停止决定仍须有效,明确停止后的迟到结果依旧不保存。新的生成、比较和恢复继续核当前资料条件;历史报告可追查旧判断,不能据此绕过现行启用检查。
读取实验报告只接受实验身份,在同一只读快照中从冻结样本、执行计划、S02核验交付及全尝试费用计算。单元清单须与固定计划完全一致,不能由调用方提供总分、过滤后的样本或重签报告替换真实证据。返回内容包含条件/计划/数据集哈希、每例结果和调用引用,并按来源组及评价维度展示结果分布;不同来源组可能重叠,分组计数不能相加当总样本数。
匿名left/right经计划中两侧依赖映射回实际实验臂。只有全部指定评委完成才产生该例一致选择;已有判断仍逐委保留。评委意见不同记disagreement,缺少任一评委记incomplete,tie、both_bad和unknown保持原意。缺例始终在固定分母中,不能通过删除失败样本提高覆盖率。运行可靠性、文学选择、成本及未标定项分别列出;当前无标定凭据的文学指标为null,不从平局或平均胜率推定启用通过。
已发送的失败尝试纳入费用和调用数,预留后未发送即释放的调用单列。任一费用未知或未结算时总成本为null,已知小计仍可查看。停止后的报告保留已有选择与未完成范围,不给新产物或启用许可。报告哈希只表示当前可追查读回内容,不是发布或启用回执。
规则诊断标准同时冻结实际安装资源的构建身份。程序/资源变化使旧凭据不再满足当前标准,不能新导出或用于作者启用;历史验证和凭据保留,重新验证产生新运行身份。此边界与方法凭据的发布身份核对一致,不把未测试的新诊断程序沿用旧资格。