Hindsight 入门:Agent 跨会话记忆到底保存了什么
动手做一个 Hindsight 记忆评估笔记本
保存更正、误召回和费用,让下一次测试能重现同样的问题。
动手做一个 Hindsight 记忆评估笔记本知识学习CN编辑简报更新 2026-09-26
你将学会
- 先建立 bank 记录表
- 保存每次操作的证据
- 设一个有用的验收条件
开始前需要
- Python 客户端基础
- 合成记忆测试样例和明确的部署边界
保存更正、误召回和费用,让下一次测试能重现同样的问题。
先看结论
- 可复现实验不需要私人数据。
- 变化的答案要保留单独记录。
- 未知指标保持未知。
先建立 bank 记录表
使用虚构人物和决定。每条写入内容都注明来源 ID、时间戳与目标 bank。之后更正其中一个事实,再设计能区分新旧状态的问题。这个记录表是根据文档 API 设计的练习,不是 Hindsight 自带功能。
样例放进独立测试 bank,并固定服务版本。无需导入私人聊天记录来增加“真实感”;合成记录已经足够验证报告流程。
保存每次操作的证据
把 retain 响应、recall 候选和 reflect 答案与查询一起保存。每个预期答案都能指向原始记录,并标出过期或无依据的输出。另设字段记录模型提供方与版本。
重启后再跑相同问题;如有后台归并,也在其完成后再测一次。若答案变化,保留两次结果和间隔时间,不能覆盖旧记录让差异消失。
设一个有用的验收条件
笔记本要显示哪些问题通过、失败或尚未执行。只有服务或平台真正记录到延迟与 token 费用时才填写数字,不能拿上游基准图填本地空格。
最终产物是一份能追到输入、且保留未解决失败的本地报告。本站尚未搭建或运行这个笔记本,下面的结构只供读者开始自己的试点。
如何选择
| 比较维度 | 方案 A | 方案 B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
实施步骤
- 1
创建带一次更正的合成记录。
- 2
保存响应和预期依据。
- 3
让失败与未运行案例继续可见。
可复制示例
json
{"case":"correction-1","bank":"fictional-project","expected_source":"record-2","actual_source":null,"verdict":"not-run","latency_ms":null}常见问题
Hindsight 自带这份笔记本吗?
没有,它是围绕文档 API 设计的练习。
什么情况算通过?
答案要在既定预算内引用当前正确的证据。
资料来源
- Hindsight / README.md来源核查 2026-09-26
- Hindsight / hindsight-clients/python/hindsight_client/hindsight_client.py来源核查 2026-09-26