muse-agent-example/docs/2026-07-13-M3清洗拆书执行计划.md

76 lines
5.4 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# M3 清洗+拆书执行计划2026-07-13待创始人批准后开工
> 版本 v1 读者:创始人 边界:只覆盖「全语料清洗 + 试拆管线 M3 化」,不含 B2 放量拆书(已拍:先不批量拆)
## 一、拍板回执(本计划的前提)
| 拍板项 | 结论 |
|--------|------|
| 清洗/拆书的内容生产 LLM | **全部改为 New-API 的 MiniMax-M3 直调**已验通模型在列、JSON 输出干净) |
| Fable5主会话角色 | 只做四件事:固化 agent/提示词、写 skill、发起调用、守卫验证与呈报——**不亲自生产内容** |
| 密钥 | New-API token 明文写入 skill 脚本(仓库政策允许) |
| 清洗范围 | **所有书**8 本 ≈3,300 万字) |
| 清洗结果 | **删除落库前必须创始人质检样张** |
| 拆书 | 先不批量拆;试拆改用 M3 重做opus 已产的机动风暴第 1 章留作对比基准 |
## 二、分工模型
```mermaid
flowchart LR
A[Fable5 主会话<br/>固化skill/提示词<br/>发起调用/呈报] -->|每窗一调| B[MiniMax-M3<br/>只当探测器/抽取器<br/>输出JSON]
B --> C[脚本守卫<br/>精确匹配/长度界/20%顶<br/>泄漏检查/审计入库]
C -->|样张| D[创始人<br/>质检确认门]
D -->|放行| C
```
- **M3 永远不直接改库**:清洗它只报「待删段逐字原文」,拆书它只报「脚手架/范式卡 JSON」落库动作全部由带守卫的脚本执行LLM 建议 ≠ 必删/必收。
- 源 txt 永远不动,任何一步可整书重导回滚。
## 三、步骤(从最基础开始)
### P0 — llm skill 固化 + 首窗真跑(我自行决策,无确认门)
1. 新建 `.claude/skills/llm/`:封装 New-API chat 调用(默认 MiniMax-M3——超时/重试、`<think>` 剥离、JSON 提取容错、token 用量审计打印。所有后续调用走这一个入口,不裸调。
2. clean/parse-book 两个 skill 的文档与参数改口:模型标注 haiku→MiniMax-M3编排方式从「Workflow 派子代理」改为「skill 脚本直调 M3」。
3. **首窗真跑**机破星河最脏书win-001第 139 章10.1 万字)探测一次 → 验证窗口不超限、JSON 可解析、exact 逐字命中率。
- 若 10 万字窗超限或命中率差 → 我自行降窗(如 5 万字/窗,总调用数约 ×2量级仍可接受呈报时说明。
### P1 — 清洗演示(★确认门①:创始人质检)
4. 机破星河前 ~50 章M3 探测 → `clean_apply --dry-run` 对账 → **呈报样张**:删什么/理由/次数、守卫拒了什么、我抽查的误伤扫描结论。
5. **等质检放行**后该批真删落库呈报前后对比字数变化、审计行、quality_report 复扫)。
### P2 — 清洗放量(所有书;门①过后我自行执行)
6. 8 本 ≈340 窗 ≈350 次 M3 调用(输入 ~35M token若降窗则 ~700 次。断点续跑manifest 标记已处理窗),书间顺序跑,每书收口报一行。
7. 收口交**全局清洗报告**(每书删除段/字数/理由分布/拒绝率/抽查样张 + 垃圾残留复扫对比)→ 创始人复核。此为呈报非阻塞门:源 txt 可回滚,发现异常再处理。
### P3 — 拆书管线 M3 化 + 试拆(★确认门②:创始人质检样张)
8. 把 workflow 里的 scaffold/patterns 提示词(含 extractor 身份段、五型合同)移植固化为 parse-book skill 的 M3 直调脚本状态仍全在库example_parse_task断点续跑。**skill 固化可与 P2 放量并行**(不花 M3 调用)。
9. 试拆5 本试拆书(机动风暴/超神机械师/机战无限/深空之影/星环使命)各前 3 章 = 15 章 ≈30 次 M3 调用。机动风暴第 1 章与 opus 基准**并排呈报**(细纲/实体/范式卡样张 + 泄漏检查)。
10. **等质检**。质检后呈报 B2 放量编排与成本量级,**硬停等新指令**(已拍:先不批量拆)。
## 四、确认门汇总
| 类型 | 事项 |
|------|------|
| **需创始人确认才继续** | 门① 清洗样张质检P1→P2 真删与放量的前提);门② M3 试拆样张质检B2 放量拆书(硬停,等新指令);单章删除超 20% 顶等守卫异常若成批出现(升级呈报) |
| **我自行决策** | skill 实现细节(重试/容错/断点续跑、窗口大小调整、dry-run 与 12 次量级的试跑、演示书选择、框架文档同步与「框架:」提交推送 |
| **纪律不变** | 库内 LLM 产物一律不 commit确认=commit 仅创始人指令触发 |
## 五、成本量级(全部 MiniMax-M3
| 事项 | 调用数 | 输入量级 |
|------|--------|----------|
| P0 首窗试跑 | 1 | ~0.06M token实测10万字窗 in=5.9万 out=2k 耗时24s |
| P1 清洗演示(机破前 50 章) | 2 | ~0.08M token实测收口 |
| P2 清洗放量8 本全语料) | ~340 | **~19M token**(实测 M3 中文 0.58 token/字,比预估砍半;输出极小) |
| P3 试拆5 本×3 章×两 pass | ~30 | ~0.5M token |
## 六、风险与回滚
- **误删正文**三层防护——M3 只报逐字原文、守卫4500 字/不碰章题/单章≤20%)、门① 人工质检;全程审计入 example_clean_log源 txt 不动可整书重导。
- **M3 长窗退化**P0 首窗真跑先验,退化即降窗,不带病放量。
- **M3 拆书质量不如 opus**:试拆并排对比呈报,由创始人裁决质量是否可接受,不预设结论。