Prism ML lanzó Bonsai 27B, una versión del modelo de lenguaje de gran tamaño Qwen 3.6 que cabe en un teléfono móvil. Al comprimir los 54 GB originales a menos de 4 GB mediante cuantización de 1 bit, la empresa logra una reducción de tamaño de 14 veces y permite a los usuarios ejecutar el modelo localmente, sin llamadas a APIs en la nube.

Por qué es importante la compresión

Los LLM suelen necesitar una GPU de nivel de escritorio o una API de pago porque sus pesos ocupan decenas de gigabytes. La cuantización —el uso de menos bits por peso— reduce el tamaño del modelo, pero también puede eliminar conocimientos. Bonsai ofrece dos extremos: una variante ternaria (tres valores de peso posibles, 7,2 GB) y una variante agresiva de 1 bit (3,9 GB). El equilibrio entre tamaño y capacidad es lo que motiva la prueba.

Cómo se desempeñan los modelos en la recuperación de hechos

El Qwen 3.6 original respondió correctamente a todas las preguntas sobre fechas históricas en la suite de pruebas. El Bonsai ternario falló cinco de seis, y la versión de 1 bit falló en cada una de las consultas de fechas. Como era de esperar, la compresión agresiva descarta primero los hechos raros y específicos, preservando únicamente los patrones lingüísticos generales que impulsan la fluidez.

El rendimiento en programación cuenta una historia diferente

Cuando los prompts pasaron a tareas de programación, los resultados se invirtieron. Los tres modelos resolvieron errores clásicos de concurrencia sin fallos. En un exigente desafío de animación con React, el Bonsai de 1 bit terminó en dos intentos, mientras que el original necesitó cuatro porque pasó tiempo extra analizando el código. La versión ternaria requirió diez intentos y finalmente hizo colapsar el servidor de pruebas.

Obstáculos prácticos

Bonsai no se ejecuta en el popular entorno de ejecución Ollama. El modelo de 1 bit necesita una capa de ejecución personalizada proporcionada por Prism ML, por lo que los usuarios deben instalar software no estándar para hacerlo funcionar. Esta dependencia limita el atractivo del modelo a aquellos que se sienten cómodos ajustando su entorno.

Quién debería considerar Bonsai y quién debería evitarlo

  • Chat de propósito general – La drástica pérdida de detalles factuales hace que Bonsai no sea adecuado como asistente de base de conocimientos. Para obtener respuestas precisas sobre historia, ciencia o eventos actuales, quédese con el modelo original o una API en la nube.
  • Ayudante de programación local – Los desarrolladores que deseen una herramienta offline que pueda sugerir código, detectar errores y ejecutarse en un teléfono o una laptop de gama baja encontrarán que la versión de 1 bit ofrece velocidad y un bajo coste de almacenamiento. No es un agente autónomo, pero maneja la lógica y la sintaxis de manera eficiente.

Conclusión

Bonsai 27B demuestra que se puede comprimir un LLM de 54 GB a unos 3,9 GB aptos para un teléfono y aun así obtener sugerencias de código sorprendentemente rápidas y competentes. El precio es una erosión casi total de la recuperación de hechos específicos, por lo que el modelo pertenece a la caja de herramientas de los desarrolladores que valoran la velocidad offline por encima del conocimiento enciclopédico.