Hindsight 入门:Agent 跨会话记忆到底保存了什么
评估 Hindsight:同时看检索质量、延迟和模型费用
先做能暴露错误的小型评测,再判断公开基准是否适用于自己的任务。
评估 Hindsight:同时看检索质量、延迟和模型费用知识学习CN编辑简报更新 2026-09-26
你将学会
- 调参前先写问题
- 分开记录运营成本
- 正确使用上游数据
开始前需要
- Python 客户端基础
- 合成记忆测试样例和明确的部署边界
保存更正、误召回和费用,让下一次测试能重现同样的问题。
先看结论
- recall 与 reflect 需要不同判分方式。
- 后台任务会影响测量时点。
- 本系列没有执行基准测试。
调参前先写问题
建立带别名与时间变化的虚构事实集。每个问题都要有预期依据和可接受的回答形式。测试集若只包含容易改写的同义句,就抓不到旧记忆和跨主题误召回。
recall 要检查目标记录、范围和时间戳;reflect 要检查结论是否由检索证据支持。语言流畅却添了无依据判断,应记为失败。
分开记录运营成本
retain 可能调用模型提取事实,recall 会融合和重排候选,reflect 还会生成推理。用同一批样例分别记录耗时、token 使用量和提供方费用。README 列出了监控能力,但本站没有采集遥测。
冷态与热态要分别记录。后台归并可能让结果随时间变化,问题执行时间应与写入时间关联。还要注明提供方和模型版本,否则两次测试看似可比,实际使用的推理服务可能不同。
正确使用上游数据
项目发布了 LongMemEval 相关成绩及独立基准页面。数字属于上游的测试条件。本站没有复现,也没有在同一硬件和数据上比较其他记忆系统。
决策表里未测的项目应保持空白。如果本地试用没有达到准确率或费用目标,应保留失败,而不是用厂商图表补上缺失的实测值。
如何选择
| 比较维度 | 方案 A | 方案 B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
实施步骤
- 1
建立有时间信息的虚构事实和预期答案。
- 2
分别测量三个操作。
- 3
把失败与费用放在正确结果旁边。
可复制示例
csv
operation,bank,question,expected_evidence,actual_evidence,latency_ms,input_tokens,output_tokens,verdict
recall,fictional-project,,,,,,,pending常见问题
本站复现了 LongMemEval 成绩吗?
没有。文中只给出可用于本地测试的评估设计。
什么指标决定是否采用?
应结合自身任务的正确性、延迟与实测费用。
资料来源
- Hindsight / README.md来源核查 2026-09-26