Hindsight: qué puede conservar un agente entre sesiones
Evaluar Hindsight: calidad de búsqueda, latencia y coste del modelo
Diseña una prueba pequeña que pueda fallar antes de adoptar cifras de un benchmark público.
Qué aprenderás
- Escribir las preguntas antes de ajustar
- Medir el coste de cada operación
- Mantener el alcance de los resultados ajenos
Antes de empezar
- Uso básico del cliente Python
- Un caso de prueba sintético y un límite de despliegue
Guarda correcciones, recuperaciones erróneas y costes para repetir la prueba.
Conclusiones clave
- Recall y reflect necesitan criterios distintos.
- Las tareas de fondo afectan el momento de medida.
- Esta serie no ejecutó benchmarks.
Escribir las preguntas antes de ajustar
Crea un conjunto fijo de hechos ficticios con cambios de fecha y alias. Cada pregunta necesita evidencia esperada y una forma aceptable de respuesta. Un conjunto compuesto solo por paráfrasis fáciles no detectará recuerdos caducados ni resultados de otro tema.
Evalúa recall por la presencia del registro correcto, su alcance y fecha. Evalúa reflect por la relación entre conclusión y evidencia recuperada. Una síntesis fluida con afirmaciones sin respaldo cuenta como fallo.
Medir el coste de cada operación
Retain puede usar un LLM para extraer hechos; recall fusiona y reordena candidatos; reflect añade generación. Registra latencia, tokens y facturación por operación con la misma muestra. El README menciona observabilidad, pero esta revisión no recogió telemetría.
Separa pruebas en frío y en caliente. La consolidación de fondo puede cambiar las respuestas, de modo que anota cuándo se preguntó respecto de la ingestión. Incluye proveedor y versión del modelo para que dos ejecuciones sean comparables.
Mantener el alcance de los resultados ajenos
El proyecto publica resultados de LongMemEval y otro sitio de benchmarks. Esos valores pertenecen a las condiciones del equipo que los obtuvo. Aquí no se reprodujeron ni se compararon sistemas distintos con datos y hardware equivalentes.
Deja en blanco las filas sin medición. Si la prueba local no cumple precisión o coste objetivo, conserva el fallo en vez de rellenarlo con una gráfica del proveedor.
Cómo elegir
| Criterio | Opción A | Opción B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
Pasos de implementación
- 1
Prepara hechos ficticios fechados y respuestas esperadas.
- 2
Mide las tres operaciones por separado.
- 3
Publica fallos y costes junto a los aciertos.
Ejemplo para copiar
operation,bank,question,expected_evidence,actual_evidence,latency_ms,input_tokens,output_tokens,verdict
recall,fictional-project,,,,,,,pendingPreguntas frecuentes
¿Se reprodujo la cifra de LongMemEval?
No. Este capítulo propone cómo evaluarla con una tarea local.
¿Qué métrica decide la adopción?
Correctitud, latencia y coste medidos en el trabajo concreto.
Fuentes
- Hindsight / README.mdFuente verificada 2026-09-26