Чому моделі з відкритими вагами мають значення саме зараз

Американські лідери у сфері ШІ, такі як OpenAI, Google та Anthropic, тримають свої найпотужніші моделі у закритому коді. Користувачі отримують до них доступ через хмарні API, що дозволяє провайдерам контролювати програмне забезпечення, дані, які через нього проходять, та дохід від кожного запиту. Китайські стартапи — DeepSeek, Qwen та Moonshot — роблять навпаки. Вони публікують сирі ваги, дозволяючи будь-кому завантажувати файли, донавчати їх та виконувати інференс на власному обладнанні.

Для країни, яка не може імпортувати найновіші GPU, надання моделі замість обчислювальних потужностей зберігає її актуальність. Користувач у Сенегалі, середня фірма в Бразилії або університет в Індії можуть запустити сервер на будь-якому доступному обладнанні та використовувати китайську модель, навіть не торкаючись хмарних сервісів США. Дані ніколи не залишають юрисдикції користувача, що є вагомим аргументом для урядів, які з настороженістю ставляться до американських правил доступу до даних.

Дипломатичний аспект

Пекін позиціонує ШІ як «колективну мудрість людства», щоб представити себе як альтернативу, що базується на співпраці, на противагу тому, що він називає «ексклюзивною монополією» Сполучених Штатів. У цьому наративі стверджується, що Захід приховує свої найпотужніші моделі під приводом національної безпеки, тоді як Китай пропонує відкритий спільний ресурс. Якщо достатня кількість розробників у всьому світі перейде на китайські моделі, може виникнути паралельна екосистема — побудована на архітектурі, інструментарії та результатах досліджень китайського походження.

Така екосистема надала б Пекіну м'яку силу, що виходить далеко за межі звичайних торговельних чи інфраструктурних проєктів. Країни, які будують свої стеки ШІ на основі китайських моделей, можуть ближче орієнтуватися на китайські стандарти управління даними, кібербезпеки та геополітики.

Сувора правда: обчислювальні потужності все ще залишаються вузьким місцем

Стратегія відкритих ваг не усуває розриву в обладнанні. Навчання великої мовної моделі — це одноразові витрати. Наприклад, модель V3 від DeepSeek була навчена приблизно на 2000 GPU H800 — це чималий, але керований кластер для добре фінансованої лабораторії. Надання послуг моделі (serving) — обробка мільярдів запитів на інференс щодня — потребує постійно зростаючого парку GPU.

Американські компанії вже планують розгортання, що перевищує мільйон GPU. Ці цифри демонструють масштаб, необхідний для того, щоб модель залишалася чуйною для мільйонів користувачів по всьому світу. Китайські фірми не можуть зрівнятися з таким масштабом, оскільки експортні обмеження, що зупинили потік передових GPU, також обмежили можливості внутрішніх заводів, таких як SMIC, які все ще відстають у виробництві найсучасніших техпроцесів.

Публікуючи ваги моделей, китайські компанії перекладають тягар обчислень на користувачів. Користувачі надають обладнання, оплачують рахунки за електроенергію та беруть на себе операційні витрати. У теорії це дозволяє обійти внутрішній дефіцит чипів; на практиці це перетворює китайські сервіси ШІ з моделі «як послуга» (as-a-service) на модель «як завантаження» (as-a-download). Компроміс очевидний: модель залишається доступною, але продуктивність і затримка залежать від обладнання кінцевого

Прихильники стверджують, що відкритість стимулює інновації швидше, ніж будь-яка закрита платформа окремої компанії. Можливість для будь-кого модифікувати модель дозволяє з'являтися нішевим застосункам, які великі постачальники ніколи б не поставили у пріоритет. Розподілена модель обчислень також може бути більш стійкою; глобальна мережа незалежних серверів може підтримувати роботу сервісу, навіть якщо дата-центр одного з постачальників вийде з ладу.

Недоліком є те, що межа продуктивності залишається прив'язаною до апаратного забезпечення, яке може собі дозволити кожен користувач. Підприємства, яким потрібен час відгуку менше секунди у величезних масштабах, все ще отримують переваги від хмарної моделі.

На що звернути увагу далі

  • Зміни в експортній політиці – Будь-яке пом'якшення або посилення контролю США над експортом чипів безпосередньо вплине на здатність Китаю навчати новіші моделі та може змусити повернутися до більш закритих пропозицій.

Висновок

Прагнення Китаю до моделей ШІ з відкритими вагами — це прагматичний спосіб обійти дефіцит апаратного забезпечення, спричинений експортними заборонами. Цей крок демонструє дипломатичну прихильність і пропонує недорогий вхідний квиток для глобальних розробників, але він не вирішує фундаментального дефіциту обчислювальних потужностей. Для таких країн, як Індія, ця стратегія є водночас і зразком для побудови незалежності в галузі ШІ, і повчальною історією про ризики залежності від іноземних ланцюгів постачання напівпровідників. Наступні кілька місяців покажуть, чи стануть моделі з відкритими вагами тривалим стовпом екосистеми ШІ, чи залишаться тимчасовим рішенням, поки розрив у забезпеченні чипами не скоротиться.