No AI Slop:有证据的编辑、打包与效果评估
评估 No AI Slop:事实保留、返工负担与模型费用
建立干净基线,分别记录编辑质量、自检、重试和人工修复,不把清单存在误写成已经测出的提升分数。
你将学会
- 选择读者真正需要的结果
- 使用独立对话和独立审阅
- 记录完整编辑循环的代价
开始前需要
- 一份事实可以核对的原稿
- 理解助手指令与插件安装范围
检查模式证据、保护原意,并区分包验证与未测量的编辑效果。
先看结论
- 事实保留优先于字数减少。
- 自检文件不等于公开效果基准。
- 测量重试和人工修复,而不只看单次回答。
选择读者真正需要的结果
目标可以是更容易理解、保留作者声音,或减少没有依据的断言,但这些结果和字数更少不是同一件事。比较前先写出受保护事实与少量风格特征。如果候选稿删除了真实限制,即使节奏更讨喜、消耗更少 token,也应该判为失败。
仓库中的 eval.md 提供自检问题,没有给出已运行的效果基准表。仅凭该文件存在,不能推导质量提升、延迟或费用节省。我们执行的打包案例只说明校验函数行为,不提供读者理解程度或模型编辑能力方面的证据。
使用独立对话和独立审阅
让基线和候选条件收到相同原稿、读者、体裁及保留约束,分别在新对话中运行,固定助手与模型版本并保存提示和输出。如果基线已经继承候选技能,就不能隔离技能本身的影响;只重复一个漂亮例子,也不能覆盖声音、引文和不确定性。
测试材料可包括更新说明、个人经历、技术术语和引用段落,先检查事实保留,再判断风格,最好不让审阅者知道条件标签。记录遗漏、新增断言和人工修复。本段是一项评测设计,没有招募真实读者,也没有执行模型试验。
记录完整编辑循环的代价
分别记录输入上下文、输出、重试和审阅用时。规则与自检清单会增加上下文,修复循环还可能增加工作,缓存和推理计费则取决于具体服务。没有测量的 token 与费用字段保持未知,不能自动变成便宜或免费的编辑承诺。
采用结论可以很有限:在某一类内部稿件上满足事实保留和审阅负担要求,但暂时排除引文或专业材料。失败案例也应与成功案例一起公布,平均偏好分数不能掩盖某个虚构客户主张,而这种错误可能足以阻止你的真实文章发布。
如何选择
| 比较维度 | 方案 A | 方案 B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
实施步骤
- 1
定义受保护事实与作者特征。
- 2
比较干净的基线和候选对话。
- 3
先检查遗漏,再比较风格偏好。
- 4
分开记录模型用量与人工返工。
可复制示例
{
"draftId": "synthetic-release-note",
"protectedFacts": 3,
"factsRetained": null,
"unsupportedAdditions": null,
"inputTokens": null,
"outputTokens": null,
"humanRepairMinutes": null,
"modelTrialExecuted": false
}常见问题
这次测得了多少质量提升?
没有。本系列给出评测设计,并将其与打包测试明确分开。
能保证降低 token 费用吗?
不能。规则、自检与重试可能增加成本,需要测量具体助手和流程。
资料来源
- No AI Slop / skills/no-ai-slop/eval.md来源核查 2026-09-14
- No AI Slop / skills/no-ai-slop/SKILL.md来源核查 2026-09-14