El nuevo modelo de 1 bit Bonsai 27B de PrismML cabe en un archivo de 3,9 GB y funciona a unos 11 tokens por segundo en un iPhone 17 Pro Max, lo que demuestra que un modelo de lenguaje de 27 mil millones de parámetros puede residir en un smartphone de consumo. Esta afirmación es importante porque amplía los límites de la IA en el dispositivo (on-device AI), prometiendo asistentes sin conexión más completos sin necesidad de enviar datos a la nube.

Por qué es importante la reducción

El Bonsai 27B de precisión completa pesa 54,7 GB. Al cuantizar el modelo a una representación de un solo bit, PrismML lo redujo a 3,9 GB, lo que supone una reducción de tamaño de 14 veces. Esa compresión hace que el modelo sea técnicamente almacenable en iPhones de gama alta, un umbral que anteriormente excluía cualquier cosa que superara unos pocos cientos de megabytes.

Cómo rinde el modelo en el hardware de Apple

PrismML desarrolló el modelo para el stack MLX de Apple, el conjunto de APIs que permite a los desarrolladores ejecutar redes neuronales directamente en el neural engine. En sus propias pruebas, el modelo generó aproximadamente 11 tokens por segundo en un iPhone 17 Pro Max. En 15 pruebas de referencia (benchmarks) estándar de modelos de lenguaje, la versión de 1 bit conservó el 89,5 % de las puntuaciones de calidad del modelo original, lo que sugiere que la compresión no ha mermado su utilidad.

Límites prácticos que encontrarás

  • Presión de memoria – El archivo de 3,9 GB cabe, pero el modelo también necesita un caché de clave-valor (KV cache) para almacenar el contexto reciente. Ese caché crece con la longitud de la conversación y puede aumentar el uso de la memoria RAM del teléfono, lo que podría ralentizar la velocidad.
  • Calor y batería – Ejecutar una red de 27 mil millones de parámetros exige mucho al neural engine. Los teléfonos tienden a calentarse bajo una carga sostenida, y la gestión térmica de Apple reducirá el rendimiento para proteger el hardware. PrismML no ha publicado cifras concretas sobre el consumo de batería, por lo que el coste real en un patrón de uso diario sigue siendo desconocido.
  • Especificidad del dispositivo – La afirmación de rendimiento se aplica al último iPhone 17 Pro Max. Los iPhones más antiguos, los dispositivos iOS de gama baja o los teléfonos Android carecen de las mismas capacidades de neural engine y experimentarán una inferencia más lenta o podrían no ser capaces de alojar el modelo en absoluto.

Quiénes se beneficiarán y quiénes podrían quedarse atrás

Los desarrolladores de aplicaciones centradas en la privacidad ahora pueden alojar un modelo de lenguaje extenso en el dispositivo, manteniendo los datos del usuario en el teléfono. Eso podría traducirse en asistentes de voz más receptivos, traducción sin conexión o generación de texto contextual sin necesidad de una suscripción a la nube.

Los fabricantes de Android y los usuarios de teléfonos de gama media se quedan fuera. El modelo depende del stack propietario de Apple, por lo que la misma compresión no funcionará automáticamente en otros ecosistemas.

Lo que queda por probar

Las cifras de PrismML provienen de benchmarks internos. Los evaluadores independientes deben verificar las tasas de tokens por segundo en sesiones prolongadas, medir el consumo real de la batería y evaluar con qué rapidez se degrada el rendimiento a medida que el KV cache se expande. El uso en el mundo real —chatear durante una hora, transmitir contenido o ejecutar el modelo junto con otras aplicaciones— revelará si la cifra de 11 tokens por segundo se mantiene fuera de un laboratorio controlado.

Conclusión

Bonsai 27B demuestra que los modelos de lenguaje de 27 mil millones de parámetros pueden comprimirse lo suficiente como para residir en un iPhone de gama alta, ofreciendo una calidad casi completa a una velocidad modesta. El avance depende del stack MLX de Apple y aún enfrenta obstáculos prácticos: sobrecarga de memoria, estrangulamiento térmico (thermal throttling) e impacto desconocido en la batería. Si las pruebas de seguimiento confirman las afirmaciones, la IA en el dispositivo podría pasar de ser demostraciones de nicho a aplicaciones cotidianas, siempre que se reduzca la brecha de hardware entre los flagships de iOS y el resto del mercado.