Cua 是什么:给 Agent 使用的电脑、驱动和评测
用 Cua Bench 评估电脑操作 Agent
让环境的最终状态决定任务是否完成。
用 Cua Bench 评估电脑操作 Agent知识学习CN编辑简报更新 2026-09-29
你将学会
- 建立可验证任务
- 拆分 Agent 与环境费用
- 不要借用上游成绩
开始前需要
- 可丢弃目标和获准执行的任务
- 理解宿主与客机状态的区别
为一个小型桌面任务保存观察、动作、策略和最终状态。
先看结论
- 任务成功应来自观察到的状态。
- 冷热环境成本不同。
- 参考任务不证明泛化能力。
建立可验证任务
Cua Bench 支持模拟任务及更重的应用环境。README 的首个任务可不依赖虚拟机、Docker 或模型密钥;参考解和评估器是起始检查。
定义初始状态、允许动作和最终状态条件。Agent 声称已填写表单,不等于评估器在应用里找到了正确字段值。
拆分 Agent 与环境费用
分别记录任务准备、运行时间、模型 token、沙箱启动和 Fleet 容量成本。复用预热池会改变延迟与价格,不能直接与冷启动本地试验并列。
保留轨迹及失败案例,包括超时与点击错位。参考解得到 1.0 奖励只能说明该任务的评估路径可工作,不代表模型的普遍能力。
不要借用上游成绩
仓库有模型研究与评测组件,但本系列没有运行它们。报告分数时应附数据集、Agent 版本、环境和评估流程。
决定是否采用时,选择贴近自己应用和权限边界的任务。未测得的数据保持空白,别用上游图表填补。
如何选择
| 比较维度 | 方案 A | 方案 B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
实施步骤
- 1
建一个模拟任务并运行参考解。
- 2
用同样条件评估 Agent。
- 3
按组件报告失败、耗时和费用。
可复制示例
csv
任务,Agent版本,环境,参考奖励,Agent奖励,启动毫秒,模型费用,结论
计算器,,,,,,,未运行常见问题
可以不用模型密钥开始吗?
README 的首个模拟 Bench 任务不需要模型 API 密钥。
本文复现了 Cua 基准吗?
没有,只审阅源码并说明评估方法。
资料来源
- Cua / README.md来源核查 2026-09-29
- Cua / docs/content/docs/concepts/what-is-cua-bench.mdx来源核查 2026-09-29
- Cua / docs/content/docs/concepts/how-sandboxes-work.mdx来源核查 2026-09-29