《AI Agent Book》阅读路线:从原理到可复现实验
怎么评估 Agent 实验:完成、正确与消耗
别把一次成功或项目宣传推广成普遍性能结论。
怎么评估 Agent 实验:完成、正确与消耗知识学习CN编辑简报更新 2026-09-26
你将学会
- 预先写好问题
- 把结果拆成多列
- 诚实报告不确定性
开始前需要
- Python 环境基础
- 运行实时实验时所需的模型服务商账号
把一节上下文课变成有记录的实验和设计判断。
先看结论
- 比较模式时要控制服务商与任务。
- 实验条件失败会使性能对比失效。
- 每个分数旁边都应有样本量。
预先写好问题
说明预计哪个上下文模式会改变何种行为。选择需要不同工具的多项任务,重复每组条件,并尽量固定模型、任务和温度。
一次成功可能只是采样波动;API 调用失败也不能说明某个上下文策略较差,应单独记录为运行错误。
把结果拆成多列
运行脚本记录完成与正确性检查,也统计 token。自己的笔记还要补充重试、工具错误和服务商延迟,区分实验条件失败与任务失败。
如果 no_tool_results 在某服务商下没有真正移除可见工具结果,就应停止与 full 模式比较分数。
诚实报告不确定性
展示样本量和原始结果。书中的 109 项实验跨越不同主题,第一章的一次试跑无法选出通用 Agent 架构。
这些文章没有调用模型或运行任何基准。这里提供的是需要读者在自身环境执行的测量方案,不是实测结果。
如何选择
| 比较维度 | 方案 A | 方案 B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
实施步骤
- 1
先写假设和任务集。
- 2
重复每种模式并保留原始轨迹。
- 3
同时报告条件、结果、token 与失败。
可复制示例
csv
task,mode,contract_ok,completed,correct,tokens,tool_error,latency_ms常见问题
哪种模式最快?
取决于模型、任务和实现,本次审阅没有测量。
token 更少就一定更好吗?
还要确保任务质量与隐含成本可以接受。
资料来源
- AI Agent Book / chapter1/context/README.md来源核查 2026-09-26
- AI Agent Book / chapter1/context/run_experiment_1_1.py来源核查 2026-09-26