Colibri: expertos MoE entre disco, RAM y VRAM
Colibri: expertos MoE entre disco, RAM y VRAM
Distingue capacidad del modelo y velocidad real antes de evaluar tu hardware.
Qué aprenderás
- Capacidad y velocidad son distintas
- Separar motor y herramientas
- Delimitar las mediciones citadas
Antes de empezar
- Conocimientos básicos de Python y terminal
- Inventario de hardware y almacenamiento
Construye trazabilidad antes de intentar otra optimización de inferencia.
Conclusiones clave
- Que quepa no garantiza rapidez.
- Hay herramientas Python alrededor del motor.
- Pesos y motor tienen requisitos separados.
Capacidad y velocidad son distintas
Colibri ejecuta modelos de mezcla de expertos compatibles usando almacenamiento, RAM y VRAM como niveles de colocación. Mueve pesos sin exigir que todos los expertos residan en memoria rápida.
Eso no elimina el tiempo de lectura. Un modelo puede cargar y aun así incumplir la latencia interactiva. Empieza por inventario de hardware y objetivo de respuesta, no por una cifra de parámetros.
Separar motor y herramientas
El motor se describe como C puro, pero lanzador, gateway y preparación utilizan Python. La entrada pip delega en c/coli; las dependencias del motor no describen toda la experiencia de uso.
Los pesos se descargan aparte y tienen formato, versión y licencia propios. Apache-2.0 del motor no concede derechos sobre cualquier modelo ni justifica una descarga de cientos de gigabytes.
Delimitar las mediciones citadas
El README presenta resultados de máquinas y cargas concretas. Esta serie inspecciona 9d5d05d, el wrapper y el protocolo de medición; no reproduce esos ensayos.
No se descargaron pesos ni se compiló o midió el motor. Las hojas posteriores sirven para recoger latencia, rendimiento y calidad propios, no como resultados obtenidos aquí.
Cómo elegir
| Criterio | Opción A | Opción B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
Pasos de implementación
- 1
Define hardware y latencia.
- 2
Elige formato compatible y revisa licencia.
- 3
Separa resultados publicados y evidencia local.
Ejemplo para copiar
evaluation:
engine_revision: 9d5d05d
model_revision: record-separately
hardware: inventory-first
latency_target: define-before-downloadPreguntas frecuentes
¿Es obligatoria una GPU?
La guía documenta una ruta CPU; su utilidad depende del modelo y hardware.
¿Se reprodujeron las velocidades anunciadas?
No. Es un análisis de fuentes sin benchmark de modelos.
Fuentes
- Colibri / README.mdFuente verificada 2026-09-23
- Colibri / docs/quickstart.mdFuente verificada 2026-09-23
- Colibri / colibri/cli.pyFuente verificada 2026-09-23