Hindsight: qué puede conservar un agente entre sesiones
Construir un cuaderno de evaluación de memoria con Hindsight
Guarda correcciones, recuperaciones erróneas y costes para repetir la prueba.
Qué aprenderás
- Crear un registro de banco
- Guardar las pruebas de cada operación
- Definir una aceptación útil
Antes de empezar
- Uso básico del cliente Python
- Un caso de prueba sintético y un límite de despliegue
Guarda correcciones, recuperaciones erróneas y costes para repetir la prueba.
Conclusiones clave
- Una muestra reproducible no necesita datos privados.
- Una respuesta distinta merece un registro aparte.
- Una medida desconocida queda desconocida.
Crear un registro de banco
Usa personas y decisiones ficticias. Cada entrada lleva ID de origen, fecha y banco previsto. Corrige después un hecho y escribe preguntas que distingan estados antiguo y nuevo. Este registro es un ejercicio sobre la API documentada; Hindsight no lo entrega como producto.
Mantén la muestra en un banco de pruebas independiente y fija la versión del servicio. No hace falta importar conversaciones privadas para que la prueba parezca realista. Los datos sintéticos bastan para comprobar el método de informe.
Guardar las pruebas de cada operación
Conserva respuesta de retain, candidatos de recall y texto de reflect junto con la consulta. Enlaza cada respuesta esperada con el registro original y marca resultados caducados o sin soporte. Añade proveedor y modelo como campos separados.
Repite las preguntas tras reiniciar y, si aplica, tras la consolidación de fondo. Si cambia una respuesta, guarda ambos resultados y el intervalo transcurrido; sobrescribir la primera ejecución ocultaría una diferencia relevante.
Definir una aceptación útil
El informe debe mostrar casos aprobados, fallidos y sin ejecutar. Rellena demora y coste solo cuando el servicio o la plataforma los mida. Nunca uses una cifra de la gráfica del proyecto para completar una casilla local vacía.
El resultado es un informe local con entradas rastreables y errores pendientes. No hemos construido ni ejecutado el cuaderno aquí; el esquema siguiente ayuda a iniciar una prueba propia.
Cómo elegir
| Criterio | Opción A | Opción B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
Pasos de implementación
- 1
Crea registros sintéticos con una corrección.
- 2
Guarda respuestas y evidencia esperada.
- 3
Deja visibles fallos y casos no ejecutados.
Ejemplo para copiar
{"case":"correction-1","bank":"fictional-project","expected_source":"record-2","actual_source":null,"verdict":"not-run","latency_ms":null}Preguntas frecuentes
¿El cuaderno viene con Hindsight?
No. Es un ejercicio propuesto a partir de la API documentada.
¿Qué cuenta como éxito?
La respuesta debe citar evidencia vigente dentro del presupuesto definido.
Fuentes
- Hindsight / README.mdFuente verificada 2026-09-26
- Hindsight / hindsight-clients/python/hindsight_client/hindsight_client.pyFuente verificada 2026-09-26