- src/muse 新版全模块(装配/共享/上下文/任务运行/作品规划/故事世界/正文写作/审校修订/知识方法/作者经验/效果评测/交付连载/资料研究/正式变更/元数据/接入/基础设施/编排)+ 测试树(单元/契约/集成/架构/迁移/端到端/夹具) - 129 项功能全部实现与自动验证(功能覆盖.json/矩阵),含 W31 补齐的规则与代价/节奏安排/伏笔与承诺 - 旧实现按处置清单退出(702 条中 324 删,保护合同与未迁移条目留存有据);web/app.py 旧工作台退役,新工作台为唯一写入口 - 数据库/旧库迁移:真实旧库内容批次迁移链(端点守卫/PG作品正文映射/质量资产缺省投影) - 运行手册 docs/运行手册.md;W30 本机服务阶段一已运行(infra PG 为正式内容权威) - R2 执行证据与私有运行材料在 .agents.local/改造/R2-20260909/(不入库)
28 KiB
新版 agent-example:去味、声音与评测代码借鉴
资料状态:研究快照。正文中的“本轮”“当前”和测试结果均指原研究记录的核对时点。本次整理未重跑这些业务测试;新版目标以设计阅读指南及其主题文件为准。
研究日期:2026-09-08。范围:
git/human-writer/的 16 个仓库。本文为新版架构的研究输入,尚未成为正式设计。未修改业务代码、原仓配置或既有研究报告,未调用模型、网络或数据库。已读项目综合研究 去除写作 AI 味的开源方案研究(原路径 ../../../../../.agents/knowledge/ai-writing-humanization-open-source-research.md,已随旧实现退出,见固定基线) 和 16 仓原有
docs/research/ai-humanizer-analysis.md的身份、结论与证据入口。重点直接复核avoid-ai-writing、shuorenhua、im-not-ai、no-ai-slop、human-writing的当前源码/规则;其余项目只作机制选取,不声称本轮完成全仓审计。inkos、neuro-book、Openwrite不在本子任务的深入范围。
1. 架构结论
新版应保留 诊断、裁决、受控修改、保真验证、候选比较 这条质量流程,把它实现为可导入的业务模块。模型负责提出具名发现和修改候选;确定性代码负责范围、版本、定位、结构校验和结果留痕。质量模块没有直接改正式正文、自动修改作者偏好或自行启用规则的权限。
应分别建立三个有业务含义的模块:
- 质量审阅:发现问题,保护事实与声音,生成修订候选;复用统一任务和候选基础设施。
- 声音与偏好:维护作者明确要求、作品声音、角色声音及其来源版本;向写作和审阅提供同一份冻结选择结果。
- 评测与改进:管理样本、独立运行、逐例结果、盲评及规则版本启停;消费创作反馈,但不把一次接受或一次成功执行直接解释为方法有效。
这些是模块职责,不要求拆成独立服务,也不要求每一步新建一个 Agent。优先用普通函数、结构化数据和现有运行器完成;真正需要语义判断的步骤才调用模型。
2. 16 仓逐项取舍
“采用机制”指按本系统合同重写或吸收方法,并非整仓搬入;“只作案例”不进入生产判定;“不采用”指不采用所列链路为去味核心,不否认其其他产品价值。完整提交号是本轮本地 git rev-parse HEAD 的结果。除 PaperSpine 工作树干净外,其余 15 仓只有原有研究报告未跟踪,无业务源码差异。
| 项目与当前提交 | 取舍 | 借鉴或排除依据 |
|---|---|---|
humanizer 9862685f575c65a8247f90369951df1b3416e3d6 |
采用机制(提示词合同) | 作者样本优先、保护信息、按文本类型选规则;当前 SKILL.md:36 又明确豁免 fiction 的新增细节限制,不能把它直接用作“只改表达”的小说修订合同。当前仍以 Markdown 为文本处理核心;旧报告(原路径 ../../../../../git/human-writer/humanizer/docs/research/ai-humanizer-analysis.md,已随旧实现退出,见固定基线) 与当前 SKILL.md:35–44 对照。 |
stop-slop 8da1f030185bdfe8471220585162991eaeb970e9 |
只作案例 | 可收集元话语、虚假深刻等模式;SKILL.md:48–60 的五维 35/50 自评分及无条件标点/副词禁令不进入自动门禁。纯提示词,无文本执行器;报告(原路径 ../../../../../git/human-writer/stop-slop/docs/research/ai-humanizer-analysis.md,已随旧实现退出,见固定基线)。 |
Humanizer-zh 91f3d394db8419c20d67ebe22a96cf8fee0a404b |
只作反例 | 中文改写示例可用于“不得新增无源数字、机构、经历”的回归陷阱;没有检测、修订或保真代码。不能把英文模式翻译当中文小说规则验证;报告(原路径 ../../../../../git/human-writer/Humanizer-zh/docs/research/ai-humanizer-analysis.md,已随旧实现退出,见固定基线)。 |
no-ai-slop 000650b156983f5159695b441477f4e63b25dc85 |
采用机制(提示词合同) | Detect/Edit 分流、引用问题原句、保留个人声音、最小有效修改;eval.md 是同模型自检,Python 仅打包。采用交互合同,不把自检叫独立评测;见 §3.4。 |
academic-humanizer 94b88b23703bed7df507acae7d6d5876209a0cdf |
采用机制(资料与事实段) | 主张与证据对应、合法不确定性、先审计再改写,可用于作品研究材料;纯 Markdown,学术句长阈值和写作 move 不迁成小说硬规则;报告(原路径 ../../../../../git/human-writer/academic-humanizer/docs/research/ai-humanizer-analysis.md,已随旧实现退出,见固定基线)。 |
avoid-ai-writing a465548fe813969dc7006c2e042efa305c09c96f |
采用局部实现 | 独立保真函数、错误/警告分离、必须命中/必须放行成对测试;不用作者身份分类、伪概率或“命中数增加即失败”作质量标准。见 §3.1。 |
human-writing 4fda173f3fef7fb808f3eba991eeb2528ea4b189 |
采用边界,规则作案例 | Python lint 明确只报告、不自动改文;现实/虚构分流有用。其硬禁冒号、破折号与固定词表不能成为通用中文小说标准,见 §3.5。 |
PaperSpine 1fe46f0e76aab800db381b0a0c392cebe14d86bf |
采用机制(局部) | 旧报告中有改写矩阵、段落功能、证据校验和审计脚本;当前项目已扩展,未在本轮重审完整新产品。只吸收“原功能—目标—依据—操作”记录,不把论文工作流或闭卷全文重写搬进小说去味;报告(原路径 ../../../../../git/human-writer/PaperSpine/docs/research/ai-humanizer-analysis.md,已随旧实现退出,见固定基线)。 |
im-not-ai 9747f036cdc28a1a8aea4dc71fef1f7846eb96f7 |
采用局部实现 | 长文按区间分割/重组、源哈希、按句对应的情态保留、歧义时报告;不能套用韩文阈值、占位 baseline 或生产依赖测试树。当前已修生产检查依赖测试目录的问题,见 §3.3。 |
talk-normal d89cf329e775e640181427fae071652198264c7e |
只作案例 | 常驻 prompt 注入和漏例回归文档,可用于 Agent 汇报文风;不是作者正文修订器。Bash benchmark 依赖 curl/jq 与模型服务,历史自评分不构成小说质量证据;报告(原路径 ../../../../../git/human-writer/talk-normal/docs/research/ai-humanizer-analysis.md,已随旧实现退出,见固定基线)。 |
shuorenhua d2d0ce27da295581c3cf87a30ab65deb7d0ddfb8 |
采用局部实现与合同 | 场景、保护类型、修改范围双轴、匿名样本生成、逐例解析和有来源的人类对照语料校验;不搬固定字符比例作所有小说任务的限制。当前代码比旧报告增加了实质语料与评测机制,见 §3.2。 |
speak-human-tw 0dab31809a1691198ad6db2b8bd539d2c1f71b75 |
采用样本组织方法 | 同一表面模式配“该修/不该修”例,繁中用语留在语言包;主要为提示词和合成 benchmark。自旧报告以来仅星图改变,不存在新增正文校验器的证据;报告(原路径 ../../../../../git/human-writer/speak-human-tw/docs/research/ai-humanizer-analysis.md,已随旧实现退出,见固定基线)。 |
humanize-text e43ca3ad79328da197f48a72e0fdc57196634009 |
不采用去味链路 | Python 标准入口的多轮改写与回译需要 LLM、Google、Niutrans;代码没有与扰动幅度相称的事实、声音和回退合同。不通过改词/翻译扰动追求 detector 降分;报告(原路径 ../../../../../git/human-writer/humanize-text/docs/research/ai-humanizer-analysis.md,已随旧实现退出,见固定基线)。 |
AIWriteX 738fc3e8b85c9da2519959b55bcab387f84d54b8 |
不采用去味核心 | 原有 CrewAI 内容生成/发布和二次维度改写,未形成独立保真去味模块;旧研究提交至当前只增 README 与宣传图,不能按新宣传升级实现判断。依赖 Python/CrewAI、Web 服务与模型;报告(原路径 ../../../../../git/human-writer/AIWriteX/docs/research/ai-humanizer-analysis.md,已随旧实现退出,见固定基线)。 |
AI_paper 079e751ba1a1db0a8d0f80301188cd471b0bb099 |
只作反例 | 学术桌面工具的启发式“AI 率”、模型自判、降重提示不进入小说质量目标;保留报告导入/人工纠错作为交互案例。真实应用依赖 GUI、文档库、API;报告(原路径 ../../../../../git/human-writer/AI_paper/docs/research/ai-humanizer-analysis.md,已随旧实现退出,见固定基线)。 |
unslop edcb62386d129c65e4395f0cfcc9168eb1ba2148 |
采用实验思路,暂不引入执行器 | 按固定模型批量取样并发现重复模式,可产生规则候选;Python CLI 依赖外部 claude,视觉分支依赖 Playwright。生成负向 profile 不等于已证明的正文修订效果,候选必须独立评测;报告(原路径 ../../../../../git/human-writer/unslop/docs/research/ai-humanizer-analysis.md,已随旧实现退出,见固定基线)。 |
3. 五个重点项目的当前证据
3.1 avoid-ai-writing:最值得借的是独立保真接口与双向回归
直接接口是 validate(original, rewritten, options),返回 ok/errors/warnings/stats,不负责发起模型或保存用户稿。源码(原路径 ../../../../../git/human-writer/avoid-ai-writing/detector/validate.js,已随旧实现退出,见固定基线):165–184 行验证参数、统一 CRLF;186–245 行分别检查代码块、frontmatter、引用、表格、代码标识、URL、路径;248–270 行将标题结构与数字变化分级处理。
可迁移的是每种保护项单独产出错误码,允许合法格式变化。例如 CRLF 与 LF 只变行尾可放行,代码内单独 \r 仍不能被吞掉。这种边界在 validate.test.js(原路径 ../../../../../git/human-writer/avoid-ai-writing/detector/validate.test.js,已随旧实现退出,见固定基线):109 有专门测试,不靠模型回读。
不能直接迁入的有三点:
validate.js:266–269的数字丢失仅警告;它没有检查“数字仍在但改了归属”的关系变化。小说里的年龄、伤势、时间、道具数量应使用原文定位和实体/命题关联校验。validate.js:280–301把检测命中数增加视为错误,这会把未经本项目标定的风格偏好带进保真门禁。新系统应分别报告语义保护失败与风格候选变化。- patterns.js(原路径 ../../../../../git/human-writer/avoid-ai-writing/detector/patterns.js,已随旧实现退出,见固定基线):2308–2383 根据手工阈值生成
HUMAN_ONLY/MIXED/AI_ONLY和概率;它不是本系统判断稿件好坏、是否可采纳的依据。
依赖:Node ≥18,校验器零第三方依赖。文本改写仍由宿主 LLM 完成。本轮实际运行 node detector/validate.test.js,28 项通过;没有运行全量 detector/corpus 测试、模型改写或中文效果评测。
3.2 shuorenhua:值得借的是范围合同与真实评测资料管理
其 SKILL.md(原路径 ../../../../../git/human-writer/shuorenhua/SKILL.md,已随旧实现退出,见固定基线):175–241 将“改写力度”和“结构可变范围”分开;359–381 要求先做保真回读,再检查残留,区分逐字保护与含义保护。它们是模型提示合同,并不是代码已经能验证人物、世界设定或伏笔。
当前新增的可执行部分明显多于旧报告:
- make_blind.py(原路径 ../../../../../git/human-writer/shuorenhua/automation/eval/make_blind.py,已随旧实现退出,见固定基线):27–63 校验样例形状;66–107 将原文与期望分离,固定种子生成匿名输入和映射。解析漂移直接报错。
- hard_metrics.py(原路径 ../../../../../git/human-writer/shuorenhua/automation/eval/hard_metrics.py,已随旧实现退出,见固定基线):972–1004 检查语料 schema;1195–1237 检查文件边界、SHA256 和去重;1264–1304 分别校验样本组成与直接适配场景。评测资料具备明确身份。
hard_metrics.py:1641–1653的--human-stats只读语料并统计;该统计成功不等于人类盲评通过。- eval README(原路径 ../../../../../git/human-writer/shuorenhua/automation/eval/README.md,已随旧实现退出,见固定基线):114–119 明确连词密度、引号等分布不足以设通用阈值;相同计数可以分别是无功能包装与人物对白。能记录负结论并撤去不可靠阈值比多加指标更值得迁移。
本轮用 Python runpy.run_path 只读调用 load_human_corpus、validate_human_cohort、validate_human_representativeness:10 篇 active、9 个作者组、6 篇 proxy、4 篇 direct,direct 覆盖 docs/public-writing/status,校验通过。未联网核验作者与许可真实性。人类语料 README(原路径 ../../../../../git/human-writer/shuorenhua/evals/human-corpus/README.md,已随旧实现退出,见固定基线):57–59 仍写 8 篇和代表性缺口,已落后于当前 manifest 与代码实测;不能沿用旧数字。
仍然不能照搬为本系统完整 holdout:
make_blind.py:77–78和 eval README:16 明确隔离主要靠 prompt 纪律,答案仍在同一工作区;新运行器应从工具能力和可读文件上隔离答案。- run-manifest.md(原路径 ../../../../../git/human-writer/shuorenhua/evals/run-manifest.md,已随旧实现退出,见固定基线):3–5 说明原始模型输出通常只在维护者本地;本地快照不能完整重查这些历史执行。
- results-v2.4.0.md(原路径 ../../../../../git/human-writer/shuorenhua/evals/results-v2.4.0.md,已随旧实现退出,见固定基线):19、30–43 记录冻结样本与 34 条受影响面验证;36 行说明静态逐条复核取代了曾漏报真问题的模型 judge。这是具体运行记录,不能外推全量 120 条或独立读者文学偏好。
依赖:评测脚本使用 Python 标准库;改写和语义判分依赖外部模型。本轮未运行改写、judge、采集脚本或大套测试。
3.3 im-not-ai:采用局部修复、长文完整性与运行边界测试
当前 restore_modality.py(原路径 ../../../../../git/human-writer/im-not-ai/scripts/restore_modality.py,已随旧实现退出,见固定基线):157–208 对齐原文与结果的句子,检查情态消失,保留低相似、合句、拆句信息;211 起只在能安全定位时局部恢复。它避免用整篇“可能/应该”的净数量判断保真:另一句增加限定词不能抵消当前句把“可能发生”改成“已经发生”。
高价值反例位于 test_restore_modality.py(原路径 ../../../../../git/human-writer/im-not-ai/tests/test_restore_modality.py,已随旧实现退出,见固定基线):43–97:合句、吸收新命题、拆句、摘要引用抢走原文对齐、低相似。既测该修,也测有歧义时不得动手。本轮 python3 -B -m unittest discover -s tests -p test_restore_modality.py -v 12 项通过。只证明这些韩文样例的程序行为,中文需重新实现分句、对齐和语义标记。
长文 reassemble_chunks.py(原路径 ../../../../../git/human-writer/im-not-ai/scripts/reassemble_chunks.py,已随旧实现退出,见固定基线):62–109 校验源哈希、区间拼接、缺失结果、空块;这种输入清单值得复用,不能只按前 N 字评审后宣称整章通过。该完整性机制不证明块内含义和跨块声音保真。
运行组织有一个与 agent-example 高度相关的修正:verify_gates.py(原路径 ../../../../../git/human-writer/im-not-ai/scripts/verify_gates.py,已随旧实现退出,见固定基线):49–60 已将生产检查 checks.py 移出测试树;test_runtime_boundary.py(原路径 ../../../../../git/human-writer/im-not-ai/tests/test_runtime_boundary.py,已随旧实现退出,见固定基线):64–85 用不含 tests/ 的部署副本运行入口。这种“按真正交付包验证”的行为测试应吸收,不能只增加检查 sys.path 字符串的静态规则。
指标仍有边界:当前 verify_gates.py:281–288 会在指标计算异常时清空 z-score,只打印该轴不可判断;baseline_v2.json:2–5 仍明确是 placeholder。另一方面,baseline.json:3–4 已新增来源和用户语料描述,不能再笼统说当前全部标定都只是占位。新版必须逐指标保留 已验证/未标定/执行失败/不适用;缺检查不能与全部通过同态。
依赖:Python 标准库,当前修订由外部 LLM 执行;部分仓内测试另需 pytest。本轮只执行上述 12 项纯函数测试;门禁/部署/分块测试仅阅读,没有模型、网络或数据库调用。
3.4 no-ai-slop:只采用交互合同,不建立一个假的评分器
SKILL.md(原路径 ../../../../../git/human-writer/no-ai-slop/skills/no-ai-slop/SKILL.md,已随旧实现退出,见固定基线):10–14 定义 Edit 与 Detect,检测模式引用问题原句,禁止替用户改写、打分或猜 AI 作者;26–30 要求保留声音、最小修改、不加事实;90–97 是同一模型阅读与自检流程。
应把这些约定转为新系统的明确动作:诊断只生成发现;申请修订带授权范围;保留记录叙事功能理由;询问作者记录具体分歧。保存了诊断报告不应自动开始重写。
eval.md(原路径 ../../../../../git/human-writer/no-ai-slop/skills/no-ai-slop/eval.md,已随旧实现退出,见固定基线):1–12 的 pass/fail 是自检清单;build_plugin.py(原路径 ../../../../../git/human-writer/no-ai-slop/scripts/build_plugin.py,已随旧实现退出,见固定基线):25–51 只验证插件文件和元数据。仓库没有正文检测器、保真执行器或独立评测器。运行依赖是 Agent/LLM;Python 是打包工具。本轮只读,不运行打包或模型。
3.5 human-writing:借“只报问题”,不借全局中文禁令
check_prose.py(原路径 ../../../../../git/human-writer/human-writing/human-writing/scripts/check_prose.py,已随旧实现退出,见固定基线):1–2 明确只报警不改文;443–463 对部分词汇保留语境说明。这适合成为质量模块的廉价诊断插件。
但是同文件 90–95 将冒号、破折号列为禁用标点;300–301 对句长变异系数的注释直接概括“人写长短差距大、模型句长接近”,没有本轮可复跑的中文小说证据。新系统不应把这些仓库偏好提升为所有题材、所有人物的硬约束。硬错误只能来自已确认任务合同或确定性内容损坏;风格倾向先进入观察。
依赖:Python 标准库,改稿依赖外部 Agent。检查器本轮只读,未执行。
4. 新质量模块的接口与数据归属建议
以下是设计建议,不是外部仓库已完成的事实。
| 模块内职责 | 输入与输出 | 硬边界 |
|---|---|---|
| 建立审阅任务 | 输入正文版本、任务意图、允许范围、事实/声音/承诺引用、规则集版本;输出不可变任务快照 | 不让诊断模型重定义原文版本和授权范围。检查过程只读。 |
| 执行诊断 | 表层检查与语义检查输出同一类具名发现:位置、引文、理由、适用规则、严重度、置信与是否需上下文 | 检查失败和不适用有独立状态;没有覆盖全文不能标“整章已审”。 |
| 裁决发现 | 每项形成修、留、问或否决,并记录上下文与作者决定 | 命中规则不是修订命令;普通风格告警不阻断作者保留原文。 |
| 构造修订 | 输入已选发现、保护合同;输出唯一定位的 patch 或明确结构调整候选 | 范围外正文不得变化;位置不唯一、源哈希漂移、patch 重叠即拒绝应用。 |
| 验证修订 | 逐字保护、数字/实体/关系/否定/情态/视角与知识时点、声音偏移、承诺检查 | 确定性违反阻断候选;语义不确定转作者决定;每个检查保留产物和版本。 |
| 比较与交付 | 比较原稿与合法候选,保留原文胜出、平局、零修改;生成可审阅候选和差异 | 只有统一候选确认服务可写正式内容;质量模块不另建 adopt、版本库或运行器。 |
可以用中文领域名组织 质量/诊断.py、质量/修订.py、质量/保护.py、质量/裁决.py,外部统一导出少量业务入口;按实际复杂度再拆子模块。规则词表和文体提示是版本化数据,不散落在 UI、Skill 和 SQL 脚本三处。中文名称服务于业务可读性,现有第三方协议名与固定字段名保留;不为翻译而引入两套实体。
最少持久化对象建议为 审阅任务、诊断报告、问题项、问题裁决、修订候选、检查结果。引用统一正文版本和运行记录;已有候选/产物表能承载时,优先扩展类型而非重复建表。每份报告带 输入正文哈希 + 已覆盖范围 + 规则版本 + 声音快照 + 运行身份,正文或上游变化即可明确显示陈旧原因。
5. 声音与作者偏好应如何组织
声音是“此作品/角色怎样说话”的可追源描述;偏好是“作者希望系统怎样协作/写作”的指令。 二者不能共用一张自动学习的标签表。
- 作者偏好区分作者、作品、角色、任务作用域;本次指令可覆盖本次选择,但不自动覆盖长期记录。
- 声音档案至少保存认可样张及其版本、叙述/对白类型、说话人、文体与题材、来源位置;观察到的统计只作描述,不能自动规定目标句长和标点配额。
- 明确要求可记录为待生效或已确认偏好;从一次拒稿、一次修改推断出的偏好先是候选,作者可以否定、替换或撤回。
- 写前冻结“本次使用哪些偏好/声音版本及为什么”;修订与生成消费同一冻结选择,不各自临场归纳一个作者画像。
- 用修改前后对与作者理由保留证据;正文被接受仅证明作者选择,不证明每个局部变化都值得跨书复用。
- 撤回后停止新任务消费,历史任务仍保留当时版本与依据;不回写历史输入,不让新的偏好无声改变旧报告。
最小接口是记录明确偏好、提出推断、确认/撤回、为任务选择适用版本、回读实际消费。先完成这些行为,不先造通用人格图谱、自动权重学习器或多 Agent 作者模拟层。
6. 真实 holdout 与规则升格
真实 holdout 至少需要以下完整数据流,不能只接收调用方给的“通过数/总数”:
- 冻结样本清单:样本 ID、来源版本与哈希、题材、作者/作品分组、场景、保护约束、数据集用途、撤回状态。SF、SNF、需判断、修坏陷阱四类俱全,包含应该零修改的原稿。
- 按作者和来源作品拆分:开发样本、已知回归集、冻结 holdout 分开;同书相邻段落、改写变体和重复样本不得横跨集合。规则调参不能反复偷看 holdout 答案后继续称其独立。
- 按能力隔离执行:改写运行只拿匿名原文、题材与公开任务约束,不能读取期望、映射、judge 记录;评分运行使用独立权限。清理提示里的答案路径不足以证明隔离。
- 真实逐例执行:记录规则/代码/模型/提示词版本、输入清单、解码参数、预算、原始输出、是否中断、候选与检查。失败、拒改、超时、不完整结果均保留,不能从分母消失。
- 三层评价分开:规则判别看误报/漏报;修改安全看事实、声音、视角、范围与承诺;产品质量用同任务匿名成对阅读判断。模型 judge 可辅助,不能改名为独立读者。
- 允许原文与无差异结果:保留原文更好、候选更好、无差异、两者都差,以及评审分歧;控制条件后才分析采纳质量、返工、作者审阅时间和可接受稿件总成本。
- 按版本启用:评测结果只能支持某个规则/方法候选版本及其适用范围;人审确认后应用具体变更,运行时回读实际启用版本,最后观察回归与退役。单独更新
promoted状态不是实施完成。
规则集建议有 草拟、评测中、可确认、已启用、已退役 五个状态;评测运行和线上创作运行沿用统一运行底座,以用途和数据权限隔离。不要为“评测 Agent”“观察 Agent”“升格 Agent”分别发明独立任务协议。
阈值来自本项目数据并注明适用范围;未标定、证据不足、模型故障都能阻止宣称效果成立。不是所有暂缺阈值都阻止作者写作:可以退回仅诊断或人工决定,但状态必须说明是哪项未判定。
7. 新增、修改与删除清单
| 动作 | 对象 | 结果与完成证据 |
|---|---|---|
| 新增 | 审阅任务快照、报告覆盖范围、版本化检查结果 | 报告能回到确切正文与实际材料;改正文后旧报告自动陈旧。 |
| 新增 | 声音/偏好确认与实际消费接口 | 作者可确认、替换、撤回;新任务使用与历史任务回查分别正确。 |
| 新增 | 冻结数据集清单、隔离执行、逐例评测产物和成对评审 | 用执行记录证明跑了哪一例、看到了什么、失败是否计入;不以汇总数代替执行。 |
| 修改 | 现有去味与质量实现的依赖 | 收进普通业务包;Skill/CLI/API 调同一入口,生产配置不从测试树或评测配置倒灌。 |
| 修改 | 发现与改写关系 | 具名问题先裁决;修订只在授权范围内生成候选,保真检查与风格观察分开。 |
| 修改 | 经验登记与方法启用 | 运行成功是运行事件;接受是作者事件;方法有效需要独立评测和实际版本应用。 |
| 修改 | 检查失败与结果展示 | 缺模型输出、解析错误、缺样本、缺声音证据显示未判定/失败,不变成通过或零问题。 |
| 删除/不引入 | AI 作者概率、人味总分、统一句长/标点/禁词配额 | UI 展示具体可处理问题;测试检查事实与任务合同,不奖励“分低就是好”。 |
| 删除/不引入 | 全文反复重写、跨语言回译降分、无来源的具体化 | 保留原文与最佳合法候选,设预算与停止条件;重写需要明确的结构修改任务。 |
| 删除/替换 | win → 自动升格、一次拒稿自动改作者画像 |
观察与确认分离;没有证据的经验不进入正式消费。 |
| 删除/替换 | 大段规则在多个 Skill/页面/脚本重复、运行时依赖测试目录、用路径插入修复依赖 | 单一规则版本与可导入模块;部署包不含测试树也可执行质量入口。 |
| 不新增 | 只转述上下文的多角色链、空的通用评测/人格/插件抽象 | 每个抽象都要有真实调用方和失败/恢复路径;需要时才扩大接口。 |
以上删除均属于新实现覆盖后的替换条件,不意味着本轮删除任何当前文件或历史证据。
8. 本轮验证边界
| 检查 | 结果 | 能证明什么 |
|---|---|---|
16 仓 HEAD 与工作树状态读取 |
完成 | 本文提交清单对应当前本地源码;不代表上游最新版本。 |
avoid-ai-writing 保真测试 |
28 项通过 | 对代码/引用/表格/路径/行尾与合法改动的本地规则行为。 |
im-not-ai 情态恢复测试 |
12 项通过 | 韩文既有样例中局部恢复、歧义跳过与摘要隔离行为。 |
shuorenhua 当前语料加载、组成与代表性检查 |
10 篇 active,全部检查通过 | 本地 schema、哈希、组成及场景标签满足代码合同;未验证外部来源真实性。 |
| 其余重点测试与报告 | 只读 | 确认存在性、接口与断言;没有宣称本轮测试通过。 |
未执行全量 CI、模型改写、真实盲评、数据库或发布流程;没有基于这些源码声称中文小说文学质量已提高。