Matt Pocock 技能集
如何评估 Skills 成本:上下文、人工决策与维护工作
区分模型上下文、人类导航和更新维护成本,通过受控试验评估,而不是根据指令变短就宣称节省 Token。
你将学会
- 成本并不只有一种
- 比较相同任务和验收条件
- 为所选分发方式预留维护成本
开始前需要
- 理解基础仓库、工单系统与测试概念
- 能够区分指令内容和执行权限
选择采用方式,并追踪相关文件、权限边界和验证证据。
先看结论
- 模型用量、人工决策和维护是不同成本。
- 相同验收条件比更短的聊天记录更重要。
- 技能清单数量不是 Token 或性能实测。
成本并不只有一种
技能机制文档把可发现性描述为一种取舍:模型可自动触达的描述占用上下文,用户专属入口则需要人记住何时使用,路由入口可以减轻这种记忆负担。具体加载行为和 Token 计费仍取决于宿主;统计 Markdown 字符数不是对实际计费用量的测量。
安装目录很大,不代表某个任务会加载全部内容;反过来,一个很短的入口也可能引出长参考资料、反复澄清与多轮审查。应在允许观察的范围内记录完整任务轨迹,分别统计输入、输出、经过时间和人工决策时间,不要把它们压成一个模糊的效率分数。
比较相同任务和验收条件
为基线与技能试验使用相同起始仓库和明确验收条件,尽量保持模型、宿主版本、工具权限与任务难度可比,并在多个案例中重复。记录结果是否真正工作,而不只是会话是否更快结束。这些是建议的实验控制条件,不是本系列已经完成的基准测试。
还应包含代价较高但可能有价值的分支:一次澄清阻止错误实现,一个测试发现缺陷,或者一次审查重新打开未完成变更。较长但正确的会话可能优于短而错误的会话。报告时间与用量时,应同时披露未解决工作及审查者要求的修正。
为所选分发方式预留维护成本
上游指令变化时,可编辑副本需要审查和合并;托管分发把部分更新机制交给渠道,但仍需要核对实际到达的版本与清单。固定源码中的 25 个正式条目、33 个开发链接候选和 37 个技能文件,描述的是不同范围,没有一个数字代表运行速度。
版本同步探针证明了一个小型确定性维护检查,不代表端到端 Agent 效率。本系列没有实测 Token 降幅、吞吐优势或金额节省可供宣传。在取得真实测量,并清楚界定统计范围之前,应让评估记录中的未知数值保持为空。
实施步骤
- 1
固定任务、模型、宿主与可用工具。
- 2
用相同验收条件记录基线和技能试验。
- 3
计入修正、失败与人工介入时间。
- 4
只发布实测数值,未知指标明确留空。
可复制示例
{
"evaluationStatus": "proposed",
"modelInputTokens": null,
"modelOutputTokens": null,
"humanDecisionMinutes": null,
"acceptedChanges": null,
"costSavingPercent": null
}常见问题
描述更短就能推断节省了吗?
不能。加载参考、重复轮次、模型行为和宿主计费方式都会影响真实用量。
25 个技能一定比 37 个更快吗?
它们是分发清单数量,不是可比的运行时测量,需要针对真实任务试验。
资料来源
- .claude-plugin/plugin.json来源核查 2026-09-08
- scripts/link-skills.sh来源核查 2026-09-08
- scripts/list-skills.sh来源核查 2026-09-08
- skills/productivity/writing-for-agents/SKILL-MECHANICS.md来源核查 2026-09-08