Ollama 0.32.14 прекращает поддержку GPU для видеокарт серии RTX 30, исключая ядра CUDA sm_86, из-за чего среда выполнения незаметно переключается на CPU, а генерация моделей замедляется до минимума.

Что изменилось в 0.32.14

Новый бинарный файл собран только для вычислительных архитектур 7.5, 8.9, 10.0 и 12.0. Архитектура 8.6 — кодовое название для NVIDIA RTX 30-й серии, A40 и A6000 — отсутствует. Когда загрузчик ищет подходящее ядро, он не находит его, сообщает о «разделении» (split) GPU в ollama ps и продолжает работу без ускорения.

Почему старый механизм отката больше не работает

В предыдущих версиях был предусмотрен резервный путь: если основные ядра не срабатывали, загружалась библиотека CUDA 12. Эта библиотека все еще содержала код для sm_86, что позволяло тому же оборудованию запускать модель. В версии 0.32.14 код отката был непреднамеренно удален, поэтому загрузчик полностью игнорирует GPU и работает на центральном процессоре хоста.

Кто пострадает

Все, кто использует RTX 3080, 3080 Ti, 3090, 3090 Ti, A40, A6000 или любую другую карту на базе вычислительной способности (compute capability) 8.6, заметят замедление. Изменение незаметно — нет ни сообщений об ошибках, ни сбоев — только ощутимое падение пропускной способности.

Как проверить, что вы работаете на CPU

  1. Запустите генерацию и в другом терминале выполните nvidia-smi. Если столбец «Memory-Used» остается на уровне 0 MiB, работа выполняется на CPU.
  2. Проверьте логи Ollama на наличие строки, содержащей library=CUDA compute=8.6. Ее отсутствие подтверждает, что механизм отката не сработал.
  3. Сравните количество токенов в секунду с известным базовым показателем GPU; большая модель, которая требовала несколько минут в предыдущих версиях, теперь будет работать десятки минут.

Установка переменных окружения, таких как CUDA_VISIBLE_DEVICES, не решает проблему, так как отсутствие ядер — это ошибка на этапе компиляции, а не флаг времени выполнения.

Быстрое решение: зафиксируйте версию 0.32.13

Windows

  • Удалите текущую установку Ollama.
  • Скачайте установщик 0.32.13 со страницы релизов проекта на GitHub.
  • Запустите установщик и перезапустите службу Ollama.

Linux

sudo systemctl stop ollama
# replace <package> with the 0.32.13 .deb or .rpm you downloaded
sudo dpkg -i <package>   # for Debian-based
# or sudo rpm -Uvh <package>   # for RPM-based
sudo systemctl start ollama

После отката версии повторите проверку через nvidia-smi; вы должны увидеть ненулевое использование VRAM и резкий скачок скорости генерации.

На что обратить внимание в будущих релизах

Отсутствие sm_86, по всей видимости, является недосмотром в скрипте сборки, а не намеренным отказом от поддержки. Пока разработчики не восстановят недостающие ядра или не снова включат откат на CUDA 12, любое обновление выше 0.32.13 несет тот же риск. Следите за трекером задач (issue tracker) проекта на предмет патча, который вернет ядра 8.6, и проверяйте использование GPU сразу после каждого обновления.

Итог: релиз 0.32.14 непреднамеренно отключает ускорение для серии RTX 30. Проверяйте активность GPU с помощью nvidia-smi, и если вы используете эти карты, откатитесь до версии 0.32.13, пока недостающие ядра не будут восстановлены.