范围(不含 design-story-foundation、docs/、humanization/README.md 等进行中改动):
1. 新增 harness/ 控制平面
- skill_harness.py 静态审计:32 个运行时 Skill 的 frontmatter/manifest/文档污染,当前 0 问题
- run_selected.py 选择性执行器:manifest 与磁盘一一对账、依赖阻断、
空跑与 skip-only 失败关闭、AST 测试形状门
- manifests/skills.json:32 个 Skill 的合同责任方与协作领域登记
- manifests/test-inventory.json:81 个测试资产登记
- specs/skill-testing.md 与 README.md:测试分层、证据边界与 harness 职责
2. 实现测试从 .claude/skills/*/scripts/ 迁至 tests/skills/<skill>/
- 71 个测试文件迁移并修复项目根与临时目录运行导入
- 数据库触发器测试宽泛异常收窄为 psycopg.errors.RaiseException
- 抽取离线大测试拆出真实 PG smoke(默认阻断,不计入离线通过)
- 抽取 presence 去重边界拆出独立测试:493 + 78 = 571 项检查不变
3. 运行时文档清理
- 13 个 SKILL.md 移除自测/离线验证段落、测试命令与测试文件事实源表述,
只保留运行时合同;业务运行合同、额度、授权与离线模式均保留
4. SoT 同步
- AGENTS.md:新增 Skill 领域索引(7 个合同责任方分组,覆盖 32 个运行时 Skill)
- 领域 07:测试入口改由 harness/manifests/ 登记,SKILL.md 不承载测试命令
- humanization 覆盖矩阵:活动测试路径同步迁移
验证证据: harness 自测 15 项 + runner 自测 13 项通过;静态审计 32 Skill / 0 问题;
73 个非数据库测试通过;8 个集成条目中 6 个 PostgreSQL 项被依赖门明确阻断;
py_compile 与 git diff --check 通过。未连接 PostgreSQL、网络、真实模型或额度。
已知边界: 真正 skill_behavior_eval 仍为 0,尚未验证任何 Skill 自然语言行为;
evaluate-frozen-replay 的 raw 存储边界冲突留待单独治理。
4.6 KiB
4.6 KiB
name, description
| name | description |
|---|---|
| call-content-model | 通过 New-API 的统一治理入口调用内容模型,执行额度窗口、模型降级、重试和 JSON 提取。清洗、拆书或知识审核需要 MiniMax 等内容模型时使用;不得裸调外部服务。 |
调用内容模型
创始人拍板(2026-07-13):清洗与拆书的内容生产 LLM 全部走 New-API 的 MiniMax-M3;主会话(Fable5)只固化 agent/提示词/skill 与发起调用。本 skill 是唯一出口。
管线内容生产调用的标准入口是 chat_governed(受 5 小时额度窗 + 全局降级链治理);chat/chat CLI 是不受治理的直连,仅供调试。治理政策的机械事实源是运行配置、共享额度账本 example_llm_quota 和模型运行适配器(llm.py),模型链切换必须由该 skill 治理并留下日志。
用法
管线内所有内容生产型 LLM 调用(清洗探测、拆书抽取、知识卡审核等)必须用 chat_governed:
# 其他 skill 内 import(clean_detect / deconstruct-book / review-knowledge-cards 的标准姿势)
sys.path.insert(0, str(pathlib.Path(__file__).resolve().parents[2] / "llm" / "scripts"))
from llm import chat_governed, extract_json
content, usage, used_model = chat_governed(prompt, system=IDENTITY)
if used_model is None:
# 全链耗尽(所有模型敏感/不可用):失败关闭,由调用方裁决
# (拆书硬停 / 判重保守 keep / 审核标 blocked / 清洗该窗跳过),绝不拿空内容当成功
...
data = extract_json(content)
治理合同(chat_governed)
- 5 小时额度窗:共享账本
example_llm_quota按窗计钱计次(窗起点 00/05/10/15/20 点,末窗 20–24=4h)。- MiniMax 模型(M3/M2.7)累计花费 ≥ $24/窗 → 本窗降级链去掉 MiniMax 前缀,只剩
glm-5.2 → deepseek-v4-flash; - 全模型成功调用 ≥ 6000 次/窗 → 打日志、睡到下一窗边界(睡眠期不持 DB 连接)续跑。
- MiniMax 模型(M3/M2.7)累计花费 ≥ $24/窗 → 本窗降级链去掉 MiniMax 前缀,只剩
- 全局降级链
BUDGET_CHAIN=MiniMax-M3 → MiniMax-M2.7 → glm-5.2 → deepseek-v4-flash。 调用方不自写降级链;model参数仅作兼容保留,实际用哪个模型由全局额度策略决定。 - 立即熔断:上游内容安全拦截(
SensitiveError)或模型 Token Plan 耗尽(PlanQuotaExhausted) 不在同模型退避(退避必再触发、空烧),立即沿链换下一个模型;普通 429/5xx 仍指数退避重试。 - 返回值合同:成功 →
(content, usage, actual_model)三元组;全链耗尽 →(None, None, None)。 调用方必须判used_model is None走失败关闭,不得静默拿空内容当成功。 - 记账:只有 MiniMax 模型计入 $24/窗预算,其余模型成本计 0(只占调用数)。
调试入口(chat / chat CLI)——仅调试,不受额度治理,不得用于管线内容生产
chat() 是直连单轮对话(返回 (content, usage)),不进额度账本、不走全局降级链:
网络错/5xx/普通 429 指数退避重试,撞敏感/Token Plan 耗尽直接抛异常。仅供人工调试与单点验证;
任何烧真实余额的管线内容生产一律走 chat_governed。chat CLI 同理:
# 仅调试:读 prompt 文件直连调用,内容打到 stdout(token 用量与重试日志走 stderr)
.venv/bin/python .claude/skills/call-content-model/scripts/llm.py chat --prompt-file /tmp/p.txt [--model MiniMax-M3] [--max-tokens 32000] [--out /tmp/resp.txt] [--extract-json]
内建保障(chat 与 chat_governed 共用的单次调用机制,调用方不必重复实现)
trust_env=False:本机代理环境变量会劫持内网直连(教训固化);- 超时 900s + 网络错/5xx/普通 429 指数退避重试 2 次;
max_tokens仅对有实测硬上限的模型(M2.7/GLM)请求前主动裁剪,避免依赖含混的 HTTP 400 文案;system段与任务材料分离(角色遵从更稳、身份段利于上游缓存);extract_json()三级容错:直接解析 → 首尾括号截取 → json-repair 兜底(修中文引号/缺逗号/尾逗号——opus 试拆已实测两类 JSON 病,任何模型都可能犯);- 每次调用向 stderr 打印 token 用量与耗时(成本审计)。
凭据与约束
- token 为 New-API 普通令牌(明文入仓是仓库政策);严禁改用管理令牌打 /v1。
- 可用模型以
/v1/models为准(2026-07-13 在列:MiniMax-M3 / M2.x 系 / deepseek-v4-* / glm-5.2 / Qwen 嵌入与重排)。 - 嵌入调用不走本 Skill(已有
embed-knowledge,模型与维度钉死)。