zizi 0260bcd8e2 设计文档:SoT 同步与生成物重出
- 新版设计各域 SoT 按本轮实现同步:总体架构、模块设计、接口契约、数据模型、功能规格、文件设计与决策记录。
- 接口契约生成物重新导出(openapi 与前端客户端随契约一致)。
- 实现回顾与专项检查台账保留历史结论;本轮收尾发现另见 .agents.local 下的收尾报告与审查处置。
2026-09-18 01:15:18 +08:00

44 KiB
Raw Blame History

B10 效果评测

职责与对象

独立数据集实验、逐例结果和可追溯的启用判断。

实例归属以总体架构为准;结构、状态和公开外壳分别引用数据模型与接口契约。

公开接口

用例 输入责任 输出与后果
create_experiment 固定变更、条件、数据集和分割 实验身份
execute_samples 实验、隔离权限和预算 逐例任务及产物
assign_blind_review 固定样本对和评委范围 匿名输入与受控映射
发布返修比较数据集 / 创建返修比较实验 B06确切会话、轮次、候选、作者批准及两名独立评委配置 封存固定原文对并只创建比较任务;不生成新候选,不写production正文
导出返修比较证明 已启动的固定返修比较实验及同作者维护连接 从实际报告导出无正文只读证明;完整性、失败、费用、验证模式和未标定状态原样保留
compare_results 完整逐例结果 胜负、平局、分歧和不确定性
check_activation 目标版本、实验与判据 有依据的允许或拒绝
read_effect_assessment / seal_effect_assessment 已有实验身份;不接受手工报告 重算工程与效果阈值、保存合格统计凭据;正式启用仍由目标owner批准
publish_method_evaluation_dataset 维护作者、B04确认版本、样本、许可、批准及到期时间 B04只读核验后封存方法用途投影和答案分区,返回确切目标与材料哈希,不改变方法状态
导出启用凭据 评测作者、实际实验ID、同库维护连接、明确批准与期限 持停止保护重算原S02/标定及已封存效果,维护入口仅写最小目标证明;不直接启用目标
读取启用凭据 / 核对启用凭据 同库业务事务、作者、证明ID及确切目标 只读公开投影与当前停止状态,核对版本、材料、资源、策略、用途和期限,不授予oracle或评测候选读取权
发布规则诊断数据集 / 执行规则诊断验证 B06精确非语义版本、独立样本、原字区间金标、来源组和授权 oracle隔离金标,逐例运行B06核心并只从全部存证计算专用硬门
读取规则诊断数据集目标 / 读取规则诊断验证定位 同作者评测身份与确切数据集或运行ID 只返回数据集哈希与目标,或实际run_id、target与结果哈希;不返回逐例、原文或oracle
导出 / 读取 / 核对 / 停止规则诊断凭据 实际规则诊断运行、明确维护批准和期限 只对真实来源holdout的完整逐例通过导出最小公开凭据;不暴露原文或金标

所有接口在本模块的接口.py 暴露。输入输出类型由同一公开表面导出,外部不导入私有模型或 SQL。

内部职责(关键文件节选)

文件 职责
接口.py 效果评测公开用例和可导入合同
模型.py 效果评测稳定对象、外壳及内部状态
存储.py 效果评测所属记录的 SQL 与版本读写
数据集.py 来源、样本、分割及保留集
行为场景.py 行为输入、实际调用观察、禁止动作与逐例裁决
实验条件.py 冻结目标版本、模型、输入和预算
逐例执行.py 逐例尝试和完整证据
盲评.py 匿名样本、评委身份及答案隔离
成对比较.py 原文、候选、平局与分歧
返修比较.py B06固定原文对封存、专用实验条件与public只读证明
指标汇总.py 逐例结果、缺失项、覆盖及成本
启用判据.py 核对实际启用的是已测版本
启用凭据.py 从合格实验导出、核对、停止最小公开凭据
标定.py / 标定消费.py 标定记录及资格消费复检
条件第三.py 初评分歧后的独立第三评委执行
文学执行.py / 文学评分.py 文学单元执行与逐例评分核验
规则诊断.py B06非语义规则的样本封存、真实核心逐例、完整硬门与最小凭据
提示词/独立评审.md 固定条件的独立评审模板

当前完整文件位置以效果评测源码目录为准;目标文件清单与文件合同保留历史设计目标,不作为当前文件枚举。

实现约束

  • 发现、校准和保留集用途分开;生产和生成角色看不到答案或匿名映射。
  • 每个样本保存实际执行,外部人工填汇总不能替代逐例结果。
  • 规则有效性、保真、文学偏好和运行可靠性分层判断。
  • 未知成本、失败指标、缺样本和未标定维度不能被填零或忽略。

协作与失败

S02 承担同一可靠执行机制,使用独立数据库权限;B07 申请实验,B04/B06 对实际启用负责。

答案可见性异常阻止运行;样本缺失或变更哈希不一致阻止启用;评测产物不能直接转生产。

Skill 行为场景由本模块执行和裁决,索引工具只负责发现。六个诊断场景按行为场景合同分别验证;scripted 管道、真服务边界和真实角色行为分别留结果,不合并为同一种通过。

验收行为

  • 目标章答案不进入生成输入。
  • 逐例结果能回查。
  • 原文胜出和平局有效。
  • 实际启用严格对应已测版本。

验收入口和替换条件见迁移与验收;这些条目是目标行为,不是已通过测试的声明。

行为场景执行证据

诊断场景数据固定合成文本哈希、明确业务动作和预期观察。scripted只运行观察裁决;service通过真实B06/B05公开接口获取调用、正文前后版本、实际规则库及报告读回。service接收的是明确业务动作,不据此证明自然语言路由正确;自然语言提示词的选工具行为由真实role_agent执行验证。

裁决核对逐次动作、完整观察、正文可见字节哈希和结构版本。诊断报告须与实际规则库重算一致,并且保存后读回相同;字段名字符串、调用方success标记和模型自报“正文未改”均不作为证据。零命中仍验证完整覆盖,未审语义范围保持未审。当前规则为空时如实记录空库,不把缺少已启用规则当作文学无缺陷。

不接收role_agent观察自报通过。角色行为由编排/行为评测.py固定真实合成正文、规则、已发布技能、planner配置及完整初始请求,复用S02有限角色会话与Pi/直接宿主。只安装read_review_rules、create_diagnosis、read_diagnosis、read_selection_scope四个工具;工具参数不接受作者、作品或截止变更。诊断工具经B06保存派生报告,不修改B05正文、候选或正式内容。源服务须显式配置,任务仅在evaluation执行;不得从默认库推导资料服务。

场景的expected、required_actions等断言仅供裁决,不进入角色系统提示或用户消息。角色只收到已发布诊断技能、自然语言请求和固定工具描述。缺作品场景在业务参数校验时拒绝,返回preflight_only与零模型调用,不把该项记作模型运行。外层planner是行为评测的角色回合,场景禁止的S02.model_call指诊断业务另行调用模型,二者单列。

角色行为报告按S02真实模型回合顺序重建工具回传,逐次核对完整请求哈希、唯一工具调用、响应、工具来源与B05/B06业务读回。缺原始证据、跳过规则或伪称完成不能通过;正文和规则漂移在新回合前阻断。角色恢复重放已结算完整回合,不重做已保存工具结果;未知费用、未完成或撤销保留不签通过。S02保留授权与领取界限仍生效,历史查询不延长授权、不派发。

CLI 行为评测 场景.json --配置 评测.toml --业务配置 合成资料.toml --动作 准备 --目标 请求.json冻结任务并返回具体可审请求;--动作 执行/报告 --目标 任务ID分别点名执行和只读核验。点名领取同时限制作者和任务,不消费其他排队任务。准备请求明示配置版本、调用/工具/输出上限、费用、批准引用和期限;实际执行保留获准的有限会话字节。各模式独立汇报:runtime_verified仅表示真实S02工具循环,model_verified保持false直到取得独立的真实外部模型执行证据,合成HTTP和真实Pi宿主均不能代替外部角色验收。

匿名分配与成对判断

实验先固定目标版本、样本集合及评估维度。预注册版本balanced-experiment-v1包含两张独立顺序表:运行按SHA-256(数据集版本ID+样本ID)排序;盲化按SHA-256(writer-blind-assignment-v1:+数据集版本ID+:+样本ID)排序。两张表各自从固定臂顺序起循环旋转,每个位置上的各臂数量差不超过一,不逐例随意洗牌。匿名身份仍包含实验UUID,不能跨实验复用。公开条件只存运行表、盲化命名空间及私有表哈希,完整盲化表属于oracle,不进入生成或评委材料。

S02任务按冻结运行表的样本和臂次序创建;比较依赖按独立盲化表绑定,同一文本对的第二名评委交换两侧。每名评委拥有独立任务、配置、调用及原文授权,不携带前一评委的报告、会话历史或工具。在冻结执行计划前,逐项核对两表、完整样本和臂集合及私有表哈希,失衡、改表或缺少此版预注册条件均拒绝。运行表表示调度优先顺序,真实并发开始/完成次序仍以S02回合证据为准,不能用预注册表反推实际时序。公开盲评材料仅有匿名文本和维度要求,不含哈希、原文/候选身份、模型名、实验臂名或金标准。

新比较合同quote-only-v2只要求模型选择left、right、tie、both_bad或unknown,并逐维提供理由和两侧精确原文引文。模型不能提交位置、哈希、身份或回执字段,包括嵌套字段。确定性核验按冻结维度顺序重排,对每条引文按Unicode码点定位首次原样出现;不归一空白、换行、组合字符,不把UTF-16偏移当码点。重复原文绑定首次出现位置,未出现引文以PAIRWISE_QUOTE_NOT_FOUND拒绝;空侧仅接受空引文并派生0—0范围,非空侧拒绝空引文。维度集合必须完整、唯一、与冻结条件相同。总体选择保留原文、候选、平局、都差或不确定,多个独立评委不一致时保留分歧,不用多数投票掩盖。

S02留存并核对原始模型输出,B10单独保存由实际生成文本和原始引文派生的定位报告及哈希。报告、恢复和下游读取时重算定位报告并与保存结果核对;重签B10定位结果不能替换原回合。已有位置合同只供旧回合历史核验与合法在途保存,不能作为新比较请求的输出合同。原始输出哈希和派生判断哈希在逐例报告中分别展示。

B10留存的运行快照不是第二份运行权威。每次读取同时核对快照的作者、角色步骤、尝试、输入、派发和响应元数据及输出哈希,空快照或副本字段被改写均拒绝。任务、步骤和尝试状态保留保存时的历史值,不要求与后续完成或恢复状态相同;报告中的当前状态由S02另行读取。

生成与检测失败后的显式恢复沿原单元、原任务和冻结调用额度执行,失败的尝试与费用不删除。最终产物须绑定S02具名成功确认,不按费用列表的展示顺序推断哪个回合最后成功。具有已知费用的前次失败不使后续成功作废,费用未知则继续阻断;最后仍失败时不得产生有效检测或合格判据。恢复不重置原额度,也不接受调用方列举的回执数组扩充次数。

有界引文纠正由实验条件max_judge_corrections登记(0—2,默认1),每个比较单元的实际上限不超过其原有调用配额减一;固定计划明确实际允许次数。只对S02已保存、结构有效但引文缺失的回合执行,其他协议/结构错误不自动复发;费用未结算或未知时不自动发送下一次。纠正沿原评委、原两侧文本和维度,附上该评委上次结构有效草稿、固定错误提示及两侧原文开头至多160码点的原字提示;不注入其他评委判断、内部身份或回执。相同来源保护、停止、截止和预算检查逐次生效。

V0038将结构有效的判断拒绝按单元追加保存,绑定原任务/尝试/调用、用户输入哈希、原始输出、拒绝码及前序记录哈希。只有PAIRWISE_QUOTE_NOT_FOUND可进入自动纠正;其他判断合同错误记PAIRWISE_NOT_EXECUTED并终止。记录只追加,不删除或覆盖失败来重置次数;读回和恢复都经S02反查原交付并按实际生成文本复算该拒绝。达到上限后保留缺失判断和失败状态,不产生成功报告或额外调用。已通过的交付保留原始输出与定位结果,并能追查全部被纠正回合及其实际费用。

若S02已确认回复而B10登记事务失败,工作面列出具名未登记交付,生成和比较均禁止直接重发。作者可经补登记交付(CLI请求JSON或POST /api/v1/evaluation/deliveries/restore)提供原始输出;同一作者、固定单元及最早未登记回合的S02原尝试、输入/结构/输出哈希全部核验后,在失败或暂停任务上补登原结果或拒绝。不重新调用模型、不增加纠正次数;重复补登原样幂等,错作者/内容/调用及已停止实验拒绝。没有原始输出时保持未完成,不能靠新生成结果替代历史。保存和补登记与停止决定共用共享/排他保护,提交顺序明确。

判断中的模型身份由S02实际派发证据供给,不从模型输出读取;同一改写模型不能作为独立选择模型,缺理由或引用合同不符视为未执行。纯函数只核结构、引用和选择一致性,不认证真实模型调用或生成启用许可;运行层仍须核对真实结构化交付及固定版本后保存。

固定返修文本对适配器

fixed_revision_pair_v1只消费B06公开用例核验出的一个确切返修来源,可以是诊断授权,也可以是同一持久会话中的作者选段授权。维护发布请求只提交数据集身份、会话/轮次/候选定位、作者批准引用和期限,不接收原文、候选文本、模型名、比较结果或通过标记。B06在生产用途连接中核对原正文、授权与保护区、保真报告、B05候选及S02原任务/交付;B10只把两侧实际文本写入oracle,把作者、目标、内容哈希、任务/调用、配置/资源和保真引用的最小投影写入evaluation公开清单。诊断数据集保持fixed-revision-pair-dataset-v1,选段数据集使用fixed-revision-pair-dataset-v2,但两者复用同一比较执行本体,不生成候选。相同版本只能原样重放;任何原文、候选、授权、保护区、配置、资源或批准变化都不能覆盖旧版本。

专用实验固定original/candidate两臂及恰好两名评委,不创建writer生成单元。两名评委分别拿到互换左右位置的匿名文本、共同维度与原quote-only-v2合同;实际选择仍走S02任务、预算、配置验证、派发保护、原字引文定位、拒绝补正、失败恢复和逐例报告。评委模型必须彼此不同且都不同于原修订模型。当前正式judge策略只有单模型白名单,尚不能构造真实双模型配置;隔离测试只能临时注入合成策略与合成HTTP,并保留offline_contract,不得修改正式策略或转述为真实外部模型运行。

导出返修比较证明从同一只读快照重算实验报告,证明中保存两名评委的原任务、调用、实际模型及输出/判断哈希,但不保存正文、引文、oracle或匿名映射。比较未完成、费用未知/待结算/超额、评委分歧,或结果为原文、平局、都差、未知时,B06只呈现保留原文的原因;稳定候选结果也不自动采纳。证明固定记录未标定、验证模式与activation_status=not_evaluated,不能签发方法/规则启用或生产切换许可。证明只追加,同一报告重放幂等;恢复后的新报告产生新证明,旧证明保持原结论。muse_revision_comparison_status额外投影当前停止状态,GET类消费者只能读取它,不能借读取触发派发。

文学评分目标合同

writer-replay-rubric-v3是随发布包冻结的评分标准(评分标准.json)。沿用设定实体保真、细纲保真、声音一致、场景执行和可读性五维;每项0—10分、0.5步长,布尔值/字符串/非有限数不算分数。战斗、人物对话、转折、信息揭示和老角色回归分别使用已登记标准,保留narrative_tension身份但按具体场景解释;不允许任意未登记场景或仅改版本号替换锚点。

文学评判的共同依据由维护者封存于数据集oracle部分,与生成输入分离。只投影明确的细纲、历史文本、事实断言及预注册约束给评委,不能将整个answer对象或目标正文答案、卡片索引混入。依据的版本/内容哈希由B10保存,不让模型自报。每对文本的两侧、共同依据、评分标准和模型原交付均可回查。

模型对完整的两侧×五维给出分数、理由和原字引文;每个评分须包含该侧候选证据,保真/声音维度还须有相应共同材料或事实依据。模型只引用本次给出的局部来源身份,不给位置、哈希或运行身份。代码按实际文本定位引文,推断只能引用本维度已核对证据的稳定ID;未提供的来源、缺项、重复项和跨维借用均拒绝。事实断言及硬约束按两侧×全部稳定ID逐项判断,unknown不能当有效保真结论。原字引文的纠正与实际调用仍沿同一S02链和固定上限。

文学模式预先固定两名评委和最多一名候补评委及预算。两名反向独立评委同一分项差异超过0.5分,或事实/约束/偏好判定不一致时才需要第三评;第三评不读前两份报告。第三评必须绑定相同文本对、来源、场景与评分标准。仅在每项存在稳定分数对、判定可形成一致对时给出仲裁结果;原始分歧和全部回执继续保留,没有稳定对则保持不稳定且无胜出。仲裁稳定性不是文学质量标定,未经独立标定的指标继续为null,也不产生启用许可。此节是完整实现目标,验收以实际逐例执行证据为准。

数据集与实验封存

混淆项与冻结输入审计

报告的独立confounders段始终逐样本提供疑似漏报、疑似误报、输入泄漏、评委不稳定和声明新角色缺卡五类观察。其版本为evaluation-confounders-v1,绑定原实验条件、计划及已核验逐例证据。它不改变writer-effect-v1已封存统计凭据的计算依据;既有凭据不能因增加报告展示字段而失效。

疑似漏报/误报仅比较主对照中同臂、同类、同命题ID的检测与稳定评委判定,不把评委当独立真值。分母保留主对照全部已登记命题,缺一侧检测不缩小分母;未知或未完成保留依据不全。输入审计未做或有命中时,疑似误报也保持未完成。初评存在分歧即保留不稳定观察,第三评收敛不会抹除原分歧。泄漏审计分母按每个事实在每个主对照臂的系统提示、用户输入各计一次。

维护发布可在oracle答案中提供writer_audit;真实回放使用样本audit入口,写入同一oracle字段。writer-input-audit-v1固定标注来源、历史截止位置、可选禁入事实与可选声明新实体ID;缺项不是空集合。真实回放的截止位置必须与B09已封存历史一致,实体比对使用实际导出的稳定对象ID,不猜名称或硬编码实体类型。该比对只说明维护者声明集合在当前输入卡片中是否缺失,不自动认证角色在历史时点尚未出现。

禁入事实必须晚于声明截止位置。机械审计对冻结系统提示和用户材料核对预登记事实片段:宽窄字符及标点归一后至少六字精确片段,或三个长度至少三字且总计至少九字、覆盖事实片段一半的共同锚点。命中在启动和发送前拒绝,不调用模型;报告和错误只保存哈希及原因,不回显禁入事实。此方法只覆盖给定事实和该机械规则,不认证语义泄漏为零;明确空清单只表示审计范围为空。

审计依据哈希进入原实验条件和生成单元,再由S02单元派发哈希绑定。来源或声明变化拒绝新消费及报告伪造。声明本体不进入生成或评委输入;未配置的历史实验仍显示未测,不能凭后补JSON变成已审计。

标定实验与金标准

标定采用显式calibration分割及预注册calibration_policy,只适用于文学评分模式。策略固定最小样本数、独立来源组数、平均绝对偏差上限、单项绝对偏差的严格上限和事实/约束一致率下限。阈值是本次版本策略,不从旧项目固定样本数或文件名前缀推断。普通实验的空策略不改变既有命令身份。

先完成全部生成单元,再由维护用途的同一作者封存这批候选的金标准,最后创建评委任务。标注必须完整覆盖全部候选、五维及相应事实/约束ID,并绑定原生成回执和输出哈希;不能拿另一文本的分数比较。金标准与推进共用实验锁,写入与停止保护串行;任一评委已登记后拒绝追加或改写金标准。同一原样请求可重放,但标签不能覆盖。

金标准保存在oracle,只给确定性标定计算使用,不进入生成或评委材料。实际评委派发另绑定金标准哈希;保存、读取和标定都反查原S02交付与该哈希,重签本地金标准或汇总不能替代原回执。标注是有明确批准引用的维护声明,不自称模型运行证据。

标定逐评委、文本对、候选与维度计算偏差,不用仲裁均值掩盖某个评委的背离。所有必需单元、费用和稳定性齐全后才判断阈值;缺项和空对照保持未完成,已完成但偏差超限记录失败。均差可正负抵消,合格判断必须看绝对偏差和最差单项。来源独立性按共享source_groups连通分量计算,不能通过给同一样本加多个标签提高独立组数。

封存标定凭据时记录完整策略、标准、样本、金标准及实际调用依据;失败凭据也只追加。读取重算并核对,不接受调用方传入passed、mae或平均分。合成配置验证模式与真实配置证据保留,统计符合给定金标准不自动成为生产启用许可;后续启用仍复检已测目标和所需证据层次。

tests/夹具/方法审核/历史标定/按原字节保留旧方法卡评分与三份人工金标准说明,仅供迁移追溯。旧字段、尺度与批次不能自动变成当前文学评分的金标准,更不能据旧stamp授权新启用。当前标注必须走对应实际候选的维护封存入口。

资格实验消费标定

实验目的默认为diagnostic;申请qualification必须使用文学模式、独立holdout分割及明确的calibration_use。后者固定所需策略和一至八份标定实验/凭据哈希。目的表示将按资格要求收集证据,不表示已通过效果或生产启用判据。默认空引用不改变旧命令身份;标定实验不能再引用其他标定。

创建、启动、推进和每次实际派发均从本作者原标定实验、金标准及真实S02回合重算。只接受已封存且通过的记录,所需策略必须完全一致。两名初评及候补的准确配置、发布资源、角色策略和场景评分标准必须被覆盖;按配置独立重算样本/来源数、五维偏差与事实/约束一致率,不能用全体均值遮蔽某位评委失败,也不能把未执行的候补算作已标定。可由多份已完成标定覆盖不同评委,但每名评委至少有一份独立完整的合格样本集,不拼接不足样本凑阈值。

资格样本与每份标定核对source_groups、公开底稿内容及原文/共同细纲和历史文本的精确内容哈希;换数据集、样本名或来源标签不能复用同一文本。此检查能拒绝已知分组与精确重复,不声称能识别未声明的同书关系或改写相似度。标定覆盖的是评委与尺度,不要求资格实验的生成器或待测目标与标定实验相同。

标定使用依据进入冻结条件、单元计划和S02派发元数据,不进入模型可见材料。实际回复模型必须与已标定身份相同,允许的模型别名也不能静默替换。当前发布资源/角色策略或评分标准变化、来源停止均阻断新调用;发送事务持有来源的停止保护。此前已合法发送的交付按原依据保存和回查,停止不抹历史记录,也不授权补发。工作面和报告显示原引用、各评委实际覆盖和当前停止状态;原回执被替换或证据重算不符仍拒绝。

文学执行使用comparison_profile=writer_rubric,准确指定两名judges及一名arbitrator配置。维护发布的每个样本在answer.judging_basis封存场景、共同来源、事实断言和预注册约束。真实ABC回放只允许维护者声明场景和命题(judging);细纲与历史正文由B09实际封存材料自动投影,不接受另填的正文。目标章答案始终不合并进评判材料。实验登记只公开依据哈希和各场景评分标准快照;实际比较按相同oracle版本读取并复检。新发送要求当前发布标准相同,历史交付按原标准回查。

writer-rubric-v1单元沿原S02创建、预算、派发、交付及引文纠正链。调用前固定完整JSON合同、模板、两侧生成依赖与依据哈希;实际S02交付保留原始字段,B10另存归一评分、代码定位引文与派生哈希。所有下游消费反查原S02调用,不接受自报或局部重签报告。评委的实际模型、调用引用和候选身份由控制器从回执投影,不进入模型可填字段。

V0039保存不可变的条件第三决议。启动时为每对的两次初评和一项候补分别预留完整费用及调用上限;无需第三评的配额不转移给其他单元。两次初评必须全部完成、费用已知且未超预算,才能根据实际交付登记required、not_required或invalid_inputs。决议保存与第三任务创建处于同一事务,重复推进串行核对原决议。稳定双评不建第三任务;初评无效、失败、费用未知或实验停止不启动第三。发送、交付和报告重算都复核决议及其原调用依据;第三评不接收初评报告。

报告分别保留初评差异、所有原始评分/偏好和收敛结果。分数或判定无法形成稳定对时没有汇总分数和赢家,但全部样本、调用及费用仍在分母与记录中。只有被持久化证明无需第三的单元可记为not_required,不把它列为漏执行。评分收敛和已完成S02调用不证明文学质量,标定指标及启用状态继续单独验收。

数据集由maintenance维护入口发布,公开输入与答案在同一事务中分别写入evaluation和oracle;生产角色无权读取二者。发布请求逐样本明确来源引用、许可说明、来源组和discovery/calibration/holdout分割。相同底稿(原文与背景的组合)或同一来源组不得跨分割;没有底稿的纯指令任务按指令内容去重。有底稿时,改写指令不能绕过分割。分割为空可如实存在,但实验选择必须非空,启用另核完整保留集与标定证据。历史金标准可封存为答案,不自动成为当前有效标定。

模型输入外壳仅含instruction、original和context,样本ID、实验臂、来源元信息、答案、匿名映射及内部配置不合并进模型输入。context是已选公开背景的JSON值;维护者负责输入来源的合法选择,来源声明不是模型自报授权。真实来源的消费复检由后续S02派发接缝负责,数据集发布本身不启动模型、不批准正式内容。

同一数据集名称的版本严格递增;同版本只能原样重放,公开输入相同而答案改变也拒绝覆盖。普通评测角色不能修改已发布输入或答案。匿名映射由B10在创建实验时追加,muse_eval仅获得该映射表的INSERT,不扩宽对答案的写权限;模型进程不持有数据库凭据,也不能直接访问评测编排的oracle查询。

实验请求固定数据集版本/哈希、分割、全部所选样本、目标版本/哈希、生成与评委配置引用、维度、实验臂、总预算及每样本调用上限。配置内容从S02实际版本读取后保存哈希,不接受调用方自报实际模型或费用。新实验状态为registered,表示条件已登记;真实目标读取、配置启用、逐例S02派发和证据复检均是执行阶段前置,不将registered当作已执行或可启用。

固定逐例执行与停止

显式detector配置为每份实际生成文本登记独立语义检测单元,前置为该生成任务完成且费用已结算。检测角色与写手模型分离,预算、配置、原文保留、发送和恢复沿同一S02执行器;未配置检测器的实验保持未检测,不把不存在的结果写成零残留。检测只读取单份候选和维护封存的共同依据,不读取另一臂、评委报告或整个oracle答案。

语义检测合同由B06连续性审校维护:事实陈述须绑定候选原字引文及已给依据,已知断言与硬约束须完整逐项覆盖;缺证据保留unknown,模型不能填总通过、位置、哈希或执行回执。声明新事实必须引用细纲依据,新设定仅作为未决建议留在评测结果,不写B02。B10按原生成、冻结依据和S02输出重算发现、命题判定与计数,保留原输出与派生报告各自哈希。高严重度发现、冲突或失败命题不能被常量无缺陷报告覆盖;未知和缺失不算通过。结构错误不自动重发,原S02交付可按既有补登规则核验。

普通偏好请求的命令身份沿用引入文学模式前的规范内容:默认comparison_profile=preference及空arbitrator不增加命令哈希字段。显式文学模式与候补配置属于实际条件,必须进入命令哈希;不能利用归一重放其他条件。

启动实验时保存不可变执行计划和完整单元集合。生成单元与比较单元各绑定独立S02任务和准确配置;任务、已启用配置、预算及单元绑定同事务提交。每个单元预先分配调用数、费用上限和截止时间,不能在失败后删掉该单元或增加总预算。比较只在两侧有真实交付、任务完成且费用已结算后创建。

当前direct_writer_prompt_v1适配器验证合成来源的control/treatment提示词对照:control使用固定角色与通用创作指令,treatment使用B05发布包的生成模板,两侧共用B05输出合同。独立评委使用发布包评审模板,材料仅包含匿名文本和维度。此适配器的范围不承接旧ABC来源策略、方法/规则消费、技能选工具或真实来源授权;其他目标和宿主须由相应消费验证器接入后运行。测试中的独立模型只属于隔离策略,验证模式如实保留offline_contract。

执行计划冻结完整系统提示(角色职责、任务模板和输出合同)及实际字节。发送时由S02把即将外发的真实请求交给B10,在停止保护事务中核对公开输入、完整提示词、输出结构、模型配置、工具/历史和调用上限;偏离时不外发。派发回执保存单元身份、单元哈希与实际系统提示哈希。模板随发布资源登记,不能从未纳入构建身份的散落文件加载。

单元交付必须通过S02结构化核验。读报告、恢复和下游比较时,再查询原任务、原尝试、实际输出哈希、派发单元、系统提示、配置验证回执与预算记录;重签B10局部哈希不能替换S02交付。业务产物保存后步骤中断,恢复引用原尝试而不重发。工作面列出完整固定单元、失败及未执行状态;费用读取该任务全部尝试,失败费用保留,未知费用不能计为零。

停止决定先持久化,再逐个收敛S02任务。它与发送检查共用排他/共享停止保护,防止已停止实验继续派发;停止后的迟到结果不产生新B10交付,已经发送的费用继续保留。重复取消可继续收敛未完成的任务,不能复活未开始的评委。已完成产物保持可追查。执行完成、统计完成和启用批准是不同状态,当前工作面不生成启用许可。

逐例报告

方法版本对照

writer_method_v1以method-evaluation-dataset-v1封存B04具体确认版本,目标为method/B04.method:<方法ID>/具体版本/确认内容哈希。维护入口经B04核对作者、当前版本、原确认提案、内容与证据及S04 generation/evaluation投影,再封存许可、批准和期限。未确认、已撤回、非当前版本、非作者或被改写的版本不能发布;确认只说明内容版本可测,不预先启用方法。CLI为评测 <维护配置> 发布方法数据集 <请求JSON>,HTTP为POST /api/v1/evaluation/method-datasets。

两臂共同使用当前B05模板、相同公开任务/底稿/背景和输出合同,仅treatment的context增加B04原样渲染的“方法材料”;公共样本不能预填该保留槽位。实际请求、方法材料哈希、目标、任务、模型交付和配置继续受原S02逐例保护。方法身份和批准说明不进入匿名评委材料,评委仍只看匿名正文。其他阶段的方法、真实私人正文、规则和Skill对照不由这个写手适配器代替。

方法资料是一次具名批准的不可变历史快照,与正文回放相同,版本不追随正式方法后续编辑。新创建、启动、每次派发和新封存效果凭据均核封存作者、期限与当前S04字段策略;评测账号不获得查询正式方法表的权限。停止某次实验沿既有停止入口;封存版本并不延续或重建生产启用。历史合法交付和费用保留,过期快照不可新消费;正式启用仍由B04对当前确切版本和目标所需效果证据再次核验。

固定效果判据

目标启用凭据交接

方法写手对照通过且已有完整运行验证、标定和效果凭据后,B10可以导出target-enablement-v1。导出入口只收实际实验ID,不收调用方报告、总分或passed。它在evaluation连接中持有实验及所有标定来源的停止共享锁,从原S02重新核验;只有validation_modes恰为runtime、当前资源/角色/效果标准一致且完整效果通过才可继续。离线配置、未知费用、失败或未标定不能导出。runtime是配置运行证据等级,测试中的合成配置验证器不构成真实外部模型文学验收。

写入由显式同作者maintenance连接完成,两连接核对实际数据库名、服务器启动身份及服务端地址/端口,并再次核对目标库原效果凭据。生产、评测账号均不能写public.muse_enablement_receipt;记录只追加,绑定目标、方法材料、全部来源实验、原凭据、版本哈希、批准及期限。公开视图muse_enablement_status只给证明及来源是否停止,不暴露答案、匿名映射、评审原文或候选。生产读取仍无evaluation/oracle表权限。

目标owner在同一业务事务中按与实验停止相同的锁键保护证明,随后重读停止状态。实验或任一标定停止、证明过期、资源或角色策略变更、目标/材料不一致均阻断新启用及该证明支持的新消费;既有正式状态与历史消费不被B10改写。导出不是作者启用,B04必须再核当前确切版本、生产写手投影与受测投影一致,并接收作者明确状态命令。

rule-diagnostic-qualification-v1是与writer-effect-v1分离的明确用途,只评验B06.readonly_deterministic_diagnosis。运行前固定完整规则/例证哈希和全部数值硬门:holdout至少3例,正例、负例、保护表达各至少1例,独立来源至少3组,误报、漏报、处置不符、保护破坏和未知项上限均为0。任一硬失败不得被平均数抵消。

B07交接只使用两个最小只读投影:数据集投影在执行前返回dataset_version_id/dataset_hash/target,不读取或暴露oracle;运行投影从完整已保存验证重算后只返回run_id/target/result_hash。B07据此登记实际专用验证,不得把它转换成普通实验、模型任务或自签报告。

规则定义内的sf/snf/boundary/regression只作训练与回归例证,名字不构成金标,其样本ID、原文哈希和已声明来源与holdout去重。每个holdout另行封存标注状态、原字区间/预期处置、负例、保护区间、许可和来源组。缺标注样本仍真实运行B06核心并记录actual,但判为证据不足;工程合成样本最多得到engineering_only,不导出启用凭据。最小公开凭据只含目标、策略、数据集/证据哈希、计数、授权和期限;production不能读取oracle金标、样本原文或逐例评测表。

CLI为评测 <评测配置> 导出启用凭据 <请求JSON> --维护配置 <同库维护配置>;请求只含experiment_id、approval_ref、valid_until。作者在方法详情页先核对证明与当前版本,再确认启用写手用途。该证明不授权规划、审阅、规则或资源发布,后者仍须各自适配器和目标owner。

正文实验可预注册effect_policy=writer-effect-v1,准确阈值以效果标准为唯一数值定义。创建时冻结标准内容与哈希,须有文学评分及独立检测;标准变化阻断新启动、推进和派发,原报告按原标准回查。该标准用于当前正文提示词、来源及写手方法对照,仍只证明标准明确要求的正文收益,不泛化为所有方法阶段的效果;不套用于规则精确率、Skill选工具或其他未接适配器的目标。

A阶段先看实际任务失败、费用未知/未结算和超额,再看固定样本及五场景覆盖,最后核目标臂的实际检测与完整执行。确定失败、缺证据与目标语义未决分别保留。B阶段须通过A,使用合格标定的holdout样本,满足作品、每作品样本及独立来源数量、不稳定比例和分组覆盖要求;再检查整体、场景与非空角色分层的退化,最后判断保真增益。来源独立性沿共享来源组连通性计算,不靠给同一来源增加标签凑数量。

主指标只从固定主比较的稳定评分得出:ABC取C减A,其他比较单列诊断;提示词对照取treatment减control。空或未稳定评分不补零,平均值明确稳定样本数,增益/退化比例仍使用完整固定样本分母。非空场景或角色分层缺少稳定结果保持证据不足;已知组内退化不能由整体收益掩盖。达不到收益阈值为no_gain,不生成合格凭据。

普通数据集可由维护者提供stratification(作品引用、标注引用、新角色比例),作为有来源的实验分层声明,不是模型或业务事实验证。真实回放的作品身份取实际selection,提供声明时必须一致。缺作品保持未定,新角色比例分为zero、low、high、unresolved;只有明确比例才分层,未定组仍展示并检查退化。元信息不进入生成或评委输入;未提供新声明时不改变旧数据集的字节与重放身份。

公开效果入口只接受实验ID,在同一快照中复检原任务、调用、候选、检测和标定后重算。合格统计凭据在evaluation只追加,绑定准确目标、数据集、计划、标准及逐例证据;非通过、标准过期或已停止时不签新凭据。读取重算并与原凭据核对,重签本地汇总不能替代原S02。停止后的已有记录仅供历史回查;生产角色不能读取该表。统计凭据保留本实验及标定来源的验证模式,不直接批准目标启用,后续目标owner仍须核对已测版本、所需证据层次和作者批准。

同一次工作面读取只复用已经完整核验、已结算且未超额的交付值,作用域限定为当前连接和作者;缺失与不确定交付不缓存,下一次读取重新核验。停止、配置、任务状态和费用的独立检查保留,不跨请求或事务缓存合格结论。

维护入口发布回放数据集按明确作品和章位调用B09封存ABC材料,并将目标正文置于oracle。公开输入只保存共同任务与已投影细纲,分臂材料、真实来源及字段策略指纹另存封存快照;普通数据集发布不能提交这类内部载荷。同书及相同历史原文自动形成来源组,禁止跨发现/校准/保留集分割。资料批准限定作者与模型使用到期时间;登记或读取历史报告不延长期限。

writer_source_abc_v1评测目标为当前构建的B09.writer-replay代码版本,A/B/C共用B05提示词和输出合同,只改变经B09准备的来源材料。实际执行只读取已封存评测资料,不查询正式业务表;新派发要求本作者资料批准有效、执行截止不晚于批准到期、S04字段策略与封存指纹一致。发送短事务保护字段策略,策略收紧后旧资料不能继续发送。生成三臂后独立评委分别比较全部三组文本对,A/C是主比较,A/B与B/C作为诊断,不能混成一个平均胜率。

字段策略或发布资源在合法发送后变化,不抹去该回合:保存交付按原不可变单元核对S02真实派发、输入和结构化输出。当前领取及实验停止决定仍须有效,明确停止后的迟到结果依旧不保存。新的生成、比较和恢复继续核当前资料条件;历史报告可追查旧判断,不能据此绕过现行启用检查。

读取实验报告只接受实验身份,在同一只读快照中从冻结样本、执行计划、S02核验交付及全尝试费用计算。单元清单须与固定计划完全一致,不能由调用方提供总分、过滤后的样本或重签报告替换真实证据。返回内容包含条件/计划/数据集哈希、每例结果和调用引用,并按来源组及评价维度展示结果分布;不同来源组可能重叠,分组计数不能相加当总样本数。

匿名left/right经计划中两侧依赖映射回实际实验臂。只有全部指定评委完成才产生该例一致选择;已有判断仍逐委保留。评委意见不同记disagreement,缺少任一评委记incomplete,tie、both_bad和unknown保持原意。缺例始终在固定分母中,不能通过删除失败样本提高覆盖率。运行可靠性、文学选择、成本及未标定项分别列出;当前无标定凭据的文学指标为null,不从平局或平均胜率推定启用通过。

已发送的失败尝试纳入费用和调用数,预留后未发送即释放的调用单列。任一费用未知或未结算时总成本为null,已知小计仍可查看。停止后的报告保留已有选择与未完成范围,不给新产物或启用许可。报告哈希只表示当前可追查读回内容,不是发布或启用回执。

规则诊断标准同时冻结实际安装资源的构建身份。程序/资源变化使旧凭据不再满足当前标准,不能新导出或用于作者启用;历史验证和凭据保留,重新验证产生新运行身份。此边界与方法凭据的发布身份核对一致,不把未测试的新诊断程序沿用旧资格。