Сообщается, что Apple ведет предварительные переговоры с PrismML, стартапом при поддержке Khosla Ventures, с целью интеграции передовой технологии сжатия моделей в свою экосистему. Этот шаг направлен на то, чтобы перенести сложный искусственный интеллект непосредственно на iPhone, преодолевая разрыв между ограничениями мобильного оборудования и огромными вычислительными требованиями современных больших языковых моделей (LLM).

Решение проблемы ограничений ИИ на устройстве

С выпуском iOS 18 и обновленной Siri компания сталкивается с серьезным техническим препятствием: высокопроизводительные модели ИИ обычно требуют огромного объема памяти и вычислительной мощности, превышающих возможности стандартных смартфонов. Интегрируя технологию PrismML, Apple стремится перенести обработку данных из облака непосредственно на само устройство.

Этот сдвиг имеет решающее значение для стратегического позиционирования Apple. ИИ на устройстве снижает задержку, уменьшает дорогостоящие затраты на облачные вычисления и подкрепляет ключевое обещание Apple в области конфиденциальности, гарантируя, что конфиденциальные данные пользователей остаются на смартфоне. Кроме того, это позволяет основным функциям ИИ работать даже без активного интернет-соединения.

Как PrismML уменьшает массивные модели ИИ

Компания PrismML, выросшая из исследований в Калифорнийском технологическом институте, использует сложный метод упрощения хранения внутренних значений модели. В то время как традиционные методы могут сокращать разрядность с 16 бит до 4 бит, PrismML идет еще дальше, сводя каждое значение к одному или трем возможным вариантам.

Прирост эффективности значителен. Недавно PrismML продемонстрировала это, сжав модель Qwen с открытым исходным кодом от Alibaba с огромных 54 ГБ до менее чем 4 ГБ. Такое сжатие позволяет всем 27 миллиардам параметров модели работать на iPhone 15 или более новых моделях. По словам генерального директора Babak Hassibi, эти сжатые модели обладают рядом преимуществ в производительности:

  • Эффективность памяти: использует до 15 раз меньше памяти.
  • Скорость: работает в 6–8 раз быстрее.
  • Энергопотребление: потребляет до 6 раз меньше энергии.

Хотя Hassibi отметил небольшое снижение производительности — в частности, в области воспроизведения фактов — модели сохраняют высокую эффективность в способностях к рассуждению и написанию кода.

Последствия для рынков полупроводников и оборудования

Потенциальное внедрение такой технологии сжатия таким гигантом, как Apple, может изменить ландшафт для производителей оборудования. В настоящее время аналитики, такие как Morgan Stanley, прогнозируют, что затраты Apple на память могут резко вырасти к 2027 финансовому году для поддержки ИИ, что может привести к повышению цен на iPhone.

Однако, если технология PrismML станет стандартом, потребность в массивных модулях памяти в смартфонах может снизиться, даже несмотря на растущую потребность в высокоскоростной и эффективной локальной обработке. По мере того как PrismML переходит к сжатию других крупных моделей, таких как Google Gemma, цель остается ясной: сделать высокоуровневый интеллект локальным, быстрым и доступным на потребительском оборудовании.

Ключевые выводы

  • Масштабное сжатие: PrismML может уменьшить модель ИИ размером 54 ГБ до менее чем 4 ГБ, что делает ее пригодной для флагманских смартфонов, таких как iPhone 15.
  • Прирост эффективности: технология обещает снижение использования памяти до 15 раз и энергопотребления до 6 раз, что жизненно важно для поддержания времени автономной работы при выполнении задач ИИ.
  • Конфиденциальность и скорость: перенос ИИ из облака на устройство снизит задержку и повысит конфиденциальность пользователей, что является краеугольным камнем философии продуктов Apple.

Риски и открытые вопросы

Результаты PrismML многообещающие, но все еще находятся на ранней стадии.

На что обратить внимание

  • Официальное подтверждение: Apple не объявляла о партнерстве, поэтому любой пресс-релиз или примечание к бета-версии iOS 18 о локальных LLM станет ключевым сигналом.

Итог: Сжатие от PrismML может позволить iPhone запускать по-настоящему большие языковые модели без чрезмерного потребления памяти или разрядки аккумулятора, обеспечивая более быстрый и конфиденциальный опыт работы с ИИ.