docs(资料研究): 场景片段检索语料池设计SSOT——切片账本、向量代次、场景检索与片段参考契约

- B03:确定性段落聚合切片(窗计划哈希)、哈希bigram向量代次、reference_reading授权过滤、构建命令接口
- B09:场景检索入口与混合检索平行,两路等权,键带slice:前缀,v1不接偏好重排
- B06:参考材料两类载体(方法/片段),片段不登记方法消费,授权边界为来源用途+内容哈希
- B07:参考挑选反馈增语料类型字段,片段挑选只落账不进信号轨
This commit is contained in:
zizi 2026-09-19 23:27:24 +08:00
parent 5a10d9680b
commit 97f2e4cb95
4 changed files with 23 additions and 4 deletions

View File

@ -86,6 +86,19 @@ S02检查点是执行证据而非第二分析读取路径。运行中的完成
验收入口和替换条件见[迁移与验收](../迁移与验收.md);这些条目是目标行为,不是已通过测试的声明。
## 场景片段切片与索引
参考书原文可确定性切片入检索池,为参考改写提供场景原文语料。切片是纯函数:按段落边界聚合至目标窗长(1200~2400 字符,不足并入邻窗),切片参数与窗口清单记入窗计划哈希;同一来源版本只认一个窗计划,重算不一致即拒绝为陈旧。切片只追加不改删,原文以 `muse_source_version` 为权威,切片表只存定位与检索文本。
片段向量索引与方法索引同构:哈希 bigram embedder(零模型成本、确定性)、代次台账 active 唯一、检索时对不上即拒绝为陈旧。索引构建是显式命令(CLI/HTTP),不耦合导入入口;构建入口按当前具备 `reference_reading` 用途的来源版本全量对账,来源版本更新或用途撤回后重算。切片身份与授权解耦:授权变化只影响检索候选与材料读取,不删历史切片。
读取授权:只有来源当前具备 `reference_reading` 用途,其切片才进入检索候选与参考材料读取;B03 经既有 `核对来源授权` 核验。片段材料必须逐字取自冻结时声明的来源版本内容哈希;版本漂移即失效,不默换新版本。
| 用例 | 输入责任 | 输出与后果 |
|------|----------|------------|
| 构建场景索引 | 认证作者 | 当前授权来源的全量切片与向量索引,代次台账更新 |
| 读取场景切片 | 作者、slice 身份清单 | 切片定位、检索文本与来源版本哈希;核对 reference_reading 用途 |
## 当前用途授权
`变更来源用途`经S01命令回执、作者归属和来源行锁更新当前用途集合;接受空集合。请求包含source_id、expected_authorization_revision、uses和reason;授权版本独立于内容revision,无变化命令保留回执且不增加授权版本。HTTP为POST /api/v1/sources/{source_id}/authorized-uses,CLI为`muse 研究 <配置> 授权 <请求JSON>`。

View File

@ -179,9 +179,9 @@ HTTP的`revision-tasks`及CLI的`审校 模型修订/修订报告`共用请求
参考改写不新建流程,扩展选段写作授权(mode=rewrite)的既有受控模型修订链。作者挑选参考发生在流程发起之前:检索候选→偏好重排→作者挑选参考方法版本(可不挑)并可点踩;挑选与点踩经 B07 参考挑选反馈落账,选中的 method_version_id 清单作为授权的一部分进入冻结输入。流程内无暂停点,冻结语义不变;人挑是授权构造的输入,不是流程内交互。
冻结修订步骤在既有“修订目标+声音”之外补充两类材料绑定:作者活跃偏好的偏好材料(与生成正文冻结回放同合同)与选中参考方法的原文材料(可选材料语义,受字节预算约束,超预算记省略原因不截断)。两类绑定均入快照;任一来源漂移则快照当前失效,沿用既有依赖复检。
冻结修订步骤在既有“修订目标+声音”之外补充三类材料绑定:作者活跃偏好的偏好材料(与生成正文冻结回放同合同)、选中参考方法的原文材料(可选材料语义,受字节预算约束,超预算记省略原因不截断)与选中场景片段的原文材料(同一可选语义,材料键 `参考片段:` 前缀)。参考材料支持两类载体:方法参考(method_version_id)与片段参考(slice 身份);授权 references 节按载体分记,任一来源漂移则快照当前失效,沿用既有依赖复检。片段参考不登记方法消费(不是方法版本);其授权边界是 B03 `reference_reading` 用途与来源版本内容哈希,由依赖复检同合同保护。
入选参考在修订候选真实交付后登记方法消费(kind=review,与完整审校同合同:核对派发回执与快照入选依据,发送即事实,交付后停用不抹掉已发送;blocked 交付不登记、不产候选)。只有装配入选的参考登记;未入选参考未进入模型输入,不登记。消费由该登记进入 B04 消费台账,构成 B09 偏好重排的强信号路;与 B07 参考挑选的弱信号分列,不混算。
入选参考在修订候选真实交付后登记方法消费(kind=review,与完整审校同合同:核对派发回执与快照入选依据,发送即事实,交付后停用不抹掉已发送;blocked 交付不登记、不产候选)。只有装配入选的方法参考登记;未入选参考未进入模型输入,不登记。消费由该登记进入 B04 消费台账,构成 B09 偏好重排的强信号路;与 B07 参考挑选的弱信号分列,不混算。
工作台交互合同:候选默认高亮重排前三,支持键盘多选;每张候选卡显示推荐理由(双路得分分项+历史选用次数),使挑选是知情的。点踩与选用在发起改写时一并落账为 B07 参考挑选反馈,记录的是作者最终选择状态;发起前点踩只是本地状态,作者未发起即离开不留痕。跳过不设显式控件:不挑参考直接发起即等价跳过,不阻塞流程。落账失败不阻断改写,但对作者可见。

View File

@ -23,7 +23,7 @@
| 读取运行观察来源 | 真实S02任务、指定尝试及可选的具名业务来源 | 作者与用途核验后的技术摘要、版本和哈希;只读,不生成观察 |
| 记录运行观察 | 上述确切来源定位、具名现象、原话、背景和可选问题键 | 只追加运行观察;同命令和同来源现象幂等,改内容拒绝 |
| 读取运行观察 / 列出运行观察 / 检索重复问题 | 当前作者、观察或任务身份、可选问题键 | 历史观察与按实际任务计数的重复问题,不生成效果判断 |
| 记录参考挑选反馈 | 检索回执引用、领域标签、选中与拒绝的方法版本清单 | 只追加参考挑选反馈;进入数值信号轨,不直接生成文本偏好 |
| 记录参考挑选反馈 | 检索回执引用、领域标签、语料类型(方法/场景片段)、选中与拒绝清单 | 只追加参考挑选反馈;方法语料进入数值信号轨,片段语料仅留痕,均不直接生成文本偏好 |
| 读取挑选信号 | 作者、可选领域 | 选用/拒绝计数与位次聚合,供 B09 偏好重排消费;只读,不改台账 |
| 汇总推断偏好建议 | 作者、可选领域 | 确定性聚合的只读建议(含真实原话依据与内联证据);不落库,采纳走既有保存→确认链 |
| 读取复利度量 | 作者 | 台账统计:首稿采纳率、点踩率等;分母为零保持空值,不构成因果结论 |
@ -59,7 +59,7 @@
反馈对只接受B05已存在的确切正文或候选版本,核对作者、作品、章节、分支及内容哈希后保存引用、作者原话和决定;不复制正文或修改原候选决定,不把自报反馈当S01采纳证明。反馈幂等键改变内容时拒绝。B07通过公开读取接口恢复版本对;缺失来源不得伪造。
反馈台账是通用只追加 payload 账本,按 payload 内 `种类` 字段判别:`改写对照`(默认;存量无该字段的记录按改写对照兼容读取)与 `参考挑选`。改写对照沿用下述版本对合同;参考挑选记录作者在方法检索结果上的挑选与点踩:检索查询、领域标签、检索回执引用(含索引代次与有序结果)、选中与拒绝的 method_version_id 清单及挑选时可从回执恢复的位次。位次用于标记位置偏置。参考挑选反馈不引用正文版本、不构成 before/after 对照,幂等键、不可变守卫与评测角色隔离同改写对照。
反馈台账是通用只追加 payload 账本,按 payload 内 `种类` 字段判别:`改写对照`(默认;存量无该字段的记录按改写对照兼容读取)与`参考挑选`。改写对照沿用下述版本对合同;参考挑选记录作者在检索结果上的挑选与点踩:检索查询、领域标签、语料类型(方法或场景片段,缺省方法,存量兼容)、检索回执引用(含索引代次与有序结果)、选中与拒绝清单(方法版本身份或 slice 身份)及挑选时可从回执恢复的位次。位次用于标记位置偏置。参考挑选反馈不引用正文版本、不构成 before/after 对照,幂等键、不可变守卫与评测角色隔离同改写对照。仅方法语料的挑选进入偏好重排信号轨;场景片段挑选只落账留痕,不进入 v1 信号聚合。
物理迁移使用追加的V0044承接原预留V0011,已执行的其他迁移保持不变。偏好、反馈、改进与观察版本由数据库不可变守卫(V0044–V0046、V0055 的 BEFORE UPDATE OR DELETE 触发器)保证只追加;读路径按已存内容返回,不重算内容哈希——内容身份在写入与边界核对时确认,只报警不恢复的读时重算不进入读路径。该段工程完成不代替具体改进评测、目标owner启停、长期观察或完整经验闭环验证。

View File

@ -99,6 +99,12 @@ A使用连续历史基线及一般关键词补充原文,B仅使用时点卡片
重排结果的审计链由两处承担:检索回执记录权重表版本、每个候选的偏好分项(选用/拒绝/消费计数与偏好值)及探索位标记;作者的挑选动作经 B07 参考挑选反馈落账,固化索引代次与权重版本。检索本身不是冻结任务的来源;作者实际选定的参考版本经任务范围 references 节冻结并受依赖复检(见 B06 参考改写),沿用偏好绑定先例的是该节而非检索回执。
### 场景片段检索
`场景检索` 与方法检索平行,服务参考改写语料源切换:关键词与向量两路 RRF 等权,语料为 B03 当前具备 `reference_reading` 用途来源的场景切片(授权过滤在查询时 join,代次只管向量新鲜度)。候选键带 `slice:` 前缀,与方法版本身份键空间不混。结果行携带书名、窗位置与原文预览,供作者知情挑选。
v1 不接偏好重排:重排信号语义是方法卡的选用/消费,场景切片无消费概念;检索入口保留与信号表同构的接缝,待片段挑选信号积累后另行评估。授权撤回、来源版本更新或代次陈旧时相应切片退出候选,不扩大为全池不可用。
### 读取前预算与摘要分页
新建任务在 `source_scope` 冻结 `context_policy_version=2` 和 `context_read_budget`。预算唯一默认值在 S02 `上下文预算.py`;输入字节与模型输出 token 分开核算。旧任务不补字段、不改回放哈希,超过部署硬上界返回 `CONTEXT_POLICY_REAUTH_REQUIRED`,由作者重新授权。