CLI-Anything 入门:让 Agent 调用真正的软件
评估 CLI-Anything:统计有效文件,而非命令数量
测量原生输出的制作、检查与修正成本。
评估 CLI-Anything:统计有效文件,而非命令数量知识学习CN编辑简报更新 2026-09-26
你将学会
- 设定任务集
- 分层测量
- 与人工基线比较
开始前需要
- Python 打包基础
- 具备实际后端的合法 GUI 软件
发布社区命令之前,先完成窄范围概念验证。
先看结论
- 有效原生文件才是分母。
- 安装与复核时间属于成本。
- 项目测试总数不是本地实测。
设定任务集
为同一个应用选取创建、编辑、导出、重开和修改等五项操作。每项都要定义人或独立解析器能验证的文件条件。
README 公布了项目整体测试数量,不能直接当成你的系统和应用版本上 harness 可用的证明。
分层测量
分别记录命令生成、原生后端调用、输出检查和人工修正的时间与失败。安装和依赖配置时间也要算进去。
命令返回零却生成损坏文件,应计为失败。预览漂亮但最终导出损坏,同样应计入失败样本。
与人工基线比较
让人用 GUI 完成同样的任务,看 harness 是否提升效率且没有隐藏新的审稿负担。
本文未运行基准或 GUI。这只是针对某个应用的测量方案,不是 CLI-Anything 整体评分。
如何选择
| 比较维度 | 方案 A | 方案 B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
实施步骤
- 1
定义五项真实任务及文件属性。
- 2
保存进程结果、文件哈希和 GUI 打开测试。
- 3
将总修正时间与人工操作比较。
可复制示例
csv
task,backend_exit,artifact_opened,review_minutes,total_cost常见问题
怎样算导出成功?
能在原生应用打开,并通过该任务的内容检查。
复现了 README 的测试总数吗?
没有,仍属于上游声明。
资料来源
- CLI-Anything / README.md来源核查 2026-09-26
- CLI-Anything / cli-anything-plugin/HARNESS.md来源核查 2026-09-26