Cua: ordenadores, controladores y pruebas para agentes
Evaluar un agente de ordenador con Cua Bench
Definir éxito desde el entorno, no desde la narración del agente.
Qué aprenderás
- Crear una tarea verificable
- Separar costes
- No heredar puntuaciones
Antes de empezar
- Un destino desechable y una tarea permitida
- Distinguir estado del host y del invitado
Guardar observación, acción, política y estado final de una tarea pequeña.
Conclusiones clave
- El estado observado decide el éxito.
- Entornos fríos y calientes tienen costes distintos.
- Una referencia no demuestra generalización.
Crear una tarea verificable
Cua Bench admite tareas simuladas y aplicaciones más pesadas. El README señala una primera tarea que no necesita VM, Docker ni clave de modelo; solución de referencia y evaluador permiten comprobar el montaje.
Define estado inicial, acciones permitidas y condición final. Que el agente diga que completó un formulario no significa que sus campos contengan los valores pedidos.
Separar costes
Anota preparación, tiempo de ejecución, tokens, arranque de sandbox y capacidad Fleet por separado. Una piscina caliente cambia precio y latencia frente a un arranque local en frío.
Guarda trayectorias y fallos, incluidos tiempos agotados y clics errados. Un reward 1.0 de la solución de referencia valida esa ruta de evaluación, no la capacidad general de un modelo.
No heredar puntuaciones
El repositorio tiene modelos y benchmarks, pero esta serie no los ejecutó. Cualquier cifra publicada necesita conjunto de datos, versión del agente, entorno y procedimiento.
Para decidir adopción, prueba tareas parecidas a tus aplicaciones y límites de permisos. Deja vacías las medidas ausentes en vez de copiar un gráfico del proyecto.
Cómo elegir
| Criterio | Opción A | Opción B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
Pasos de implementación
- 1
Crea una tarea simulada y corre la referencia.
- 2
Evalúa al agente con el mismo criterio final.
- 3
Presenta fallos, latencia y coste por componente.
Ejemplo para copiar
tarea,agente,entorno,recompensa_referencia,recompensa_agente,arranque_ms,coste,veredicto
calculadora,,,,,,,sin-ejecutarPreguntas frecuentes
¿Puedo comenzar sin clave de modelo?
El primer ejercicio simulado del README no la exige.
¿Se reprodujo aquí un benchmark Cua?
No. Se revisó el diseño de evaluación y su documentación.
Fuentes
- Cua / README.mdFuente verificada 2026-09-29
- Cua / docs/content/docs/concepts/what-is-cua-bench.mdxFuente verificada 2026-09-29
- Cua / docs/content/docs/concepts/how-sandboxes-work.mdxFuente verificada 2026-09-29