zizi af08551d7b 智能体能力与规则:导航元信息、技能目录与执行纪律
- 能力文件补 导航元信息(内容描述/使用场景/使用要求),技能目录按目录派生;索引检查与磁盘逐条一致。
- 规则:计划与提交新增「验证期冻结源码」「全量只跑一次」两条纪律并写清与生成、验收数据库的关系;
  模块依赖、任务与证据、文档与资源生成、测试隔离等规则同步本轮口径。
- 角色合同与配置的模型白名单保持一致;技能正文不再夹带索引注记(与后端资源加载同口径)。
2026-09-18 01:15:12 +08:00

5.6 KiB
Raw Blame History

id, name, category, contract_version, description, commands
id name category contract_version description commands
operation.run-evaluation 运行效果评测 operation 1 封存隔离资料、固定对照条件、运行逐例评测并读取比较、标定与效果依据。
publish_evaluation_dataset
publish_method_evaluation_dataset
publish_writer_replay_dataset
create_evaluation_experiment
read_evaluation_experiment
read_evaluation_generation_input
start_evaluation_execution
advance_evaluation_execution
read_evaluation_execution
stop_evaluation_execution
read_evaluation_report
restore_evaluation_delivery
publish_calibration_gold
read_calibration
seal_calibration
read_effect_assessment
seal_effect_assessment
run_rule_diagnostic_validation
read_rule_diagnostic_validation
stop_rule_diagnostic_validation

运行效果评测

用于运行已明确目标、数据来源和预算的隔离对照。评测记录不改变正式正文,不自动启用方法、规则或资源。

先核对具体目标版本、待比较材料和授权范围;外部调用必须已有相应数据使用与预算批准。不能用文件名、目录存在、人工总分或调用成功代替实际逐例证据。当前执行适配器支持B05提示词对照、B09正文来源ABC回放及B04具体方法版本的写手对照;未接入的目标应明确失败,不静默改为另一实验。

方法对照先由维护入口publish_method_evaluation_dataset核对B04确切确认版本并封存generation/evaluation投影、批准和期限;两臂共用B05模板,只有处理组携带方法。生产使用、规划方法和正式启用仍须各自完整合同,不能由这次写手对照代替。

维护用途通过publish_evaluation_dataset或publish_writer_replay_dataset封存来源、许可、分割和答案。真实回放从业务owner读取已授权细纲、历史正文和卡片,目标正文只进入答案区。评测用途不能直接读正式业务表;生成输入和评委材料都不拼入整个oracle。

评测用途调用create_evaluation_experiment,固定真实配置版本、全部样本、目标哈希、维度、费用及调用上限。用start_evaluation_execution登记批准引用和截止时间,再由S02执行。通过advance_evaluation_execution推进已满足依赖的任务;失败、未知费用及未执行单元保留。先read_evaluation_execution和read_evaluation_report,不用新建实验掩盖失败。停止使用stop_evaluation_execution,不能恢复已停止实验。

文学模式writer_rubric固定五维、两名初评和一名候补。稳定双评不需要第三评;规定分歧才创建预注册第三任务,且第三评看不到前评判断。有界引文纠正保留原回合和费用;若S02已保存但B10登记中断,通过restore_evaluation_delivery补登相同原始交付,不直接重发。

标定使用calibration分割和显式calibration_policy。全部候选生成后,维护入口依据已批准的逐候选标注调用publish_calibration_gold;标注必须对应实际文本哈希,完整覆盖五维及事实/约束,不能从评委结果反推答案。金标准先于评委冻结,之后只允许原样重放。read_calibration读取逐调用偏差,seal_calibration保存已完成的合格或失败记录;它们不授予生产启用权。

申请资格评测时显式设置evaluation_goal=qualification,使用holdout及calibration_use的策略、原实验ID和凭据哈希。服务逐位复检初评与候补的实际完整标定,不把未执行候补、整体均差或旧文件stamp当作有效引用。来源、资源、尺度变化拒绝新调用;报告保留原覆盖和当前停止状态。此目的仍不表示已通过效果或启用判据;完整消费合同见../../../../docs/系统架构/新版设计/模块设计/B10-效果评测.md。

需要语义检测时在实验条件显式选择detector配置。服务为每份实际候选独立执行检测,完整命题、原字证据、未知项和高严重度发现进入报告;未配置或失败不能当零残留。检测与评审分别留调用和费用,新设定建议保持未决,检测状态不授予效果或生产启用。

正文效果实验预注册effect_policy=writer-effect-v1,并显式配置独立检测。分层声明要有作品与标注来源,不能猜缺失比例。read_effect_assessment按原S02、检测与标定重算;只有满足固定效果阈值才可seal_effect_assessment,未通过或无增益不生成合格记录。已有记录保留验证模式和目标绑定,不直接批准正式启用。

CLI统一为muse 评测 <对应用途配置> <动作> <请求JSON或实验ID>,请求字段以实际CLI帮助和API合同为准。报告工作台可查看逐例证据及保存标定记录。分别说明合成调用、真实服务、真实模型及浏览器证据;未知费用、缺样本、未标定或不稳定不得填零或当作通过。

非语义规则使用独立确定性分支:维护CLI发布规则样本点名规则版本、独立样本与金标,--来源配置为同作者生产配置;评测用途用run_rule_diagnostic_validation执行、read_rule_diagnostic_validation回查,必要时stop_rule_diagnostic_validation停止。维护CLI导出规则凭据只根据完整逐例通过签发特定诊断用途凭据;未知、缺项、合成来源或失败保留。此分支不创建模型任务、不套用写手文学判据。B06另经作者审阅决定启停,报告或凭据本身不会启用规则。