AI Agent Book: una ruta de estudio para construir agentes
Medir experimentos de agentes: terminar, acertar y gastar
Evitar que una muestra o afirmación editorial se convierta en cifra general.
Qué aprenderás
- Registrar la hipótesis
- Guardar varias columnas
- Presentar la incertidumbre
Antes de empezar
- Entorno básico de Python
- Acceso a un proveedor de modelos para ensayos en vivo
Convertir una lección de contexto en experimento y decisión documentados.
Conclusiones clave
- Controlar proveedor y tarea al comparar.
- Un contrato fallido invalida la comparación.
- Toda puntuación necesita tamaño de muestra.
Registrar la hipótesis
Explica qué modo debería afectar a qué conducta. Usa varias tareas con herramientas distintas y repite cada condición, manteniendo proveedor, modelo y texto cuando sea posible.
Un éxito aislado puede ser azar de muestreo. Un fallo de API no demuestra inferioridad de una estrategia de contexto.
Guardar varias columnas
El ejecutor registra finalización, corrección y tokens. Añade reintentos, errores de herramientas y latencia del proveedor. Separa fallos del contrato de fallos de la tarea.
Si no_tool_results no oculta resultados visibles en un proveedor, detén la comparación de puntuaciones con full.
Presentar la incertidumbre
Publica tamaños de muestra y salidas crudas. Los 109 ejercicios tratan ámbitos diferentes; una prueba del capítulo 1 no elige una arquitectura universal.
No ejecutamos modelos ni benchmarks para esta serie. Se ofrece un plan de medida, no resultados observados.
Cómo elegir
| Criterio | Opción A | Opción B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
Pasos de implementación
- 1
Escribir hipótesis y tareas antes de correr.
- 2
Repetir modos y guardar trayectorias.
- 3
Informar de contrato, resultado, tokens y errores.
Ejemplo para copiar
task,mode,contract_ok,completed,correct,tokens,tool_error,latency_msPreguntas frecuentes
¿Qué modo es más rápido?
Depende de modelo, tarea e implementación; aquí no se midió.
¿Menos tokens es automáticamente mejor?
Solo si calidad y costes ocultos siguen siendo aceptables.
Fuentes
- AI Agent Book / chapter1/context/README.mdFuente verificada 2026-09-26
- AI Agent Book / chapter1/context/run_experiment_1_1.pyFuente verificada 2026-09-26