FirstMate: equipos de agentes, evidencia duradera y autoridad de entrega
Coste y rendimiento de FirstMate: separa supervisión, trabajo e integración
Interpreta de forma limitada la espera sin tokens y mide entregables aceptados, uso real del modelo y esfuerzo humano de recuperación.
Qué aprenderás
- Un supervisor Shell en espera no hace gratuito al equipo
- Mide fases sin inventar aceleraciones
- Optimiza el cuello de botella observado
Antes de empezar
- Bases de árboles Git y solicitudes de cambios
- Comprender agentes de terminal y alcance de credenciales
Definir entregables e inspeccionar evidencia de estado y autoridad sin atribuir garantías no probadas.
Conclusiones clave
- Esperar sin tokens no significa trabajar sin tokens.
- Mide entregables aceptados y reparación humana.
- Tiempo paralelo y consumo agregado son métricas distintas.
Un supervisor Shell en espera no hace gratuito al equipo
El README habla de supervisión sin tokens porque un proceso Bash puede esperar sin solicitar una respuesta al modelo. Al despertar para razonar, repartir o revisar, el agente principal vuelve a consumir. Las tareas del equipo, los reintentos y las llamadas opcionales de supervisión también tienen uso propio.
Cuenta el trabajo que alcanza el entregable acordado. Tres agentes activos no equivalen a tres cambios terminados. Un borrador rápido puede perder su ventaja por revisión, competencia de pruebas o integración. El resultado relevante son informes aceptados o cambios entregados con seguridad, no ventanas abiertas.
Mide fases sin inventar aceleraciones
En una prueba acotada registra recepción, reparto, implementación, espera, revisión y entrega. Conserva fallos y reintentos junto al uso que informe el anfitrión real. Distingue tiempo transcurrido y tiempo agregado de trabajadores: el paralelismo puede reducir el primero mientras aumenta el segundo.
Compara un agente y un equipo con la misma definición de tarea y aceptación. Empieza por tareas independientes; modificar la misma API introduce acoplamiento. Incluye minutos humanos de inspección y recuperación. Esta serie no ejecutó mediciones de rendimiento, latencia ni ahorro monetario.
Optimiza el cuello de botella observado
Si los despertares repetidos dominan el consumo, inspecciona sus causas antes de reducir vigilancia. Si las pruebas saturan la máquina, más agentes pueden retrasar la entrega. Si domina la integración, mejora límites y orden de revisión. Son hipótesis basadas en medición, no una afirmación sobre el tamaño óptimo del equipo.
La rama de supervisión Pi documentada permite seleccionar modelo y esfuerzo aparte de la conversación del capitán. Es una capacidad de configuración, no una promesa de calidad equivalente con una opción más barata. Prueba esa configuración concreta y conserva los fallos de escalado en los resultados.
Cómo elegir
| Criterio | Opción A | Opción B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
Pasos de implementación
- 1
Usa un contrato de aceptación común.
- 2
Registra fases, consumo, reintentos y revisión humana.
- 3
Identifica el cuello de botella con evidencia.
- 4
Cambia una configuración cada vez y repite.
Ejemplo para copiar
{
"propuesta": true,
"entregablesAceptados": null,
"minutosTranscurridos": null,
"minutosAgregados": null,
"usoModelo": null,
"minutosRevisionHumana": null,
"benchmarkEjecutado": false
}Preguntas frecuentes
¿Cuánto dinero ahorra FirstMate?
No medimos ahorro; registra uso real del anfitrión y esfuerzo de revisión en tu prueba.
¿Más agentes terminan siempre antes?
No. Pruebas compartidas, cambios acoplados e integración pueden limitar el avance.
Fuentes
- FirstMate / README.mdFuente verificada 2026-09-14
- FirstMate / docs/architecture.mdFuente verificada 2026-09-14
- FirstMate / docs/configuration.mdFuente verificada 2026-09-14