Bonsai Demo: inferencia local con un runtime específico
Bonsai Demo: inferencia local con un runtime específico
Separar repositorio, pesos y programa de inferencia antes de evaluar sus afirmaciones.
Qué aprenderás
- Tres artefactos distintos
- La ruta por defecto
- Mantener una prueba pequeña
Antes de empezar
- Un equipo con memoria y disco medidos
- Permiso para revisar los modelos y binarios descargados
Registrar artefactos exactos y un fallo de corrección antes de proclamar disponibilidad.
Conclusiones clave
- Demo, pesos y runtime son artefactos separados.
- Bonsai 2 necesita por ahora el fork PrismML.
- Las cifras originales no son mediciones nuestras.
Tres artefactos distintos
Bonsai Demo incluye scripts, interfaz opcional, ejemplos de agentes y documentación para Bonsai 2 27B. Los pesos se descargan de otro repositorio en Hugging Face. El instalador obtiene además el fork llama.cpp de PrismML, porque la versión principal todavía no incorpora las transformaciones necesarias.
El README anuncia un modelo ternario compacto y cifras de calidad. Son afirmaciones de pruebas del propio proyecto. Esta serie inspecciona fuente fijada sin descargar los pesos ni medir esa calidad.
La ruta por defecto
En la revisión estudiada, `./setup.sh` selecciona Bonsai 2 y PQ2_0; `start_llama_server.sh` inicia después el endpoint local. Instalación y servidor son pasos distintos, lo que permite revisar las descargas primero.
El README también presenta MLX en Apple Silicon, Open WebUI, herramientas y visión. Cada formato y función depende del backend y del archivo exacto; consulta la matriz antes de asumir compatibilidad.
Mantener una prueba pequeña
Un primer ensayo puede usar preguntas de texto fijas y registrar archivo, binario y hardware, para comprobar coherencia. Una respuesta HTTP 200 no demuestra que se hayan aplicado las transformaciones del modelo.
Los capítulos siguientes tratan instalación, compatibilidad, código, medidas, seguridad y elección. Ninguna cifra upstream se presenta como benchmark realizado aquí.
Cómo elegir
| Criterio | Opción A | Opción B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
Pasos de implementación
- 1
Distingue código, pesos y binario del fork.
- 2
Consulta la matriz de backend de tu dispositivo.
- 3
Comprueba corrección antes de medir velocidad.
Ejemplo para copiar
scripts -> binario fork llama.cpp
repositorio de modelos -> pesos PQ2_0 o PTQ1_0
binario + pesos -> inferencia local -> prueba de correccionPreguntas frecuentes
¿Funciona con llama.cpp principal?
README y matriz fijados piden el fork PrismML para las variantes GGUF Bonsai 2.
¿Están los pesos en GitHub?
No. El instalador los obtiene de otra distribución.
Fuentes
- Bonsai Demo / README.mdFuente verificada 2026-09-29
- Bonsai Demo / MODEL-FORMATS.mdFuente verificada 2026-09-29
- Bonsai Demo / BACKEND-SUPPORT.mdFuente verificada 2026-09-29