Сатья Наделла только что вступил в открытый конфликт с теми самыми лабораториями, в создании которых помогала его компания. Глава Microsoft выступил с резким предупреждением о том, как крупнейшие ИИ-компании переписывают правила владения данными, и это сообщение было воспринято с необычайной силой. В недавнем посте в блоге Наделла обвинил передовые лаборатории, включая OpenAI и Anthropic, в создании манипулятивного рынка. Они собирают публичные данные для обучения массивных моделей, а затем используют свои условия использования, чтобы запретить кому-либо учиться на результатах работы этих моделей. В результате, утверждает он, происходит односторонний перенос ценности, при котором предприятия оплачивают счета, одновременно отказываясь от своих проприетарных знаний.
Двойные стандарты дистилляции
Чтобы понять суть претензии, полезно рассмотреть метод, который эти лаборатории так стремятся заблокировать. Дистилляция — это распространенный метод обучения, при котором меньшая специализированная модель учится на результатах работы более крупной модели, а не поглощает необработанные тексты из интернета с нуля. Стартап или исследовательская группа могут подавать миллионы промптов в передовую модель, фиксировать ответы и использовать этот богатый сигнал для обучения компактной модели, которая работает локально или решает узкоспециализированную задачу. Это дешевле и требует гораздо меньше энергии, чем создание базовой модели с нуля.
OpenAI и Anthropic запрещают эту практику в своих условиях использования. Когда они обнаруживают систематическую дистилляцию, они расценивают это как нарушение. Правоприменение часто направлено против конкурентов, особенно ИИ-компаний из Китая, которых обвиняют в использовании этого метода для сокращения технологического разрыва без сопоставимых миллиардных затрат на оригинальное обучение.
Наделла подчеркнул напряженность, лежащую в основе этой политики. Те же самые лаборатории создавали свои флагманские модели, сканируя открытый интернет, собирая книги, форумы, репозитории кода и статьи — и всё это на основании юридического аргумента о том, что обучение на общедоступных данных является «добросовестным использованием» (fair use). Они использовали общественное достояние. Однако теперь они возводят юридические барьеры, чтобы никто не мог использовать результаты их моделей в качестве учебного материала в ответ. Они словно говорят: «Вы можете учиться на открытых знаниях мира, но никто не может учиться у нас».
Эта асимметрия важна не только для академических дискуссий. Она устанавливает иерархию, в которой горстка поставщиков инфраструктуры контролирует, кто и что может знать. Если «добросовестное использование» оправдывает их поглощение опубликованного человечеством интеллекта, то результаты работы этих моделей начинают напоминать приватизированное общественное достояние. Конкурентам и клиентам запрещено перерабатывать этот сигнал в новые инструменты. Все дороги ведут только к крупнейшим лабораториям.
Двойная оплата за собственный интеллект
Наделла придумал фразу для описываемой им экономической ловушки: «обратный информационный парадокс». По его мнению, предприятия в настоящее время платят за искусственный интеллект дважды, и только один из этих платежей отображается в счетах.
Первая составляющая затрат очевидна. Компании покупают кредиты API, подписываются на Copilot или лицензируют сервисы чат-ботов. Вторая составляющая скрыта. Каждый раз, когда сотрудник исправляет галлюцинацию, оценивает ответ как полезный или дорабатывает сгенерированный отчет, это действие порождает то, что Наделла называет «побочными данными» (exhaust). Это след из исправлений, данных о предпочтениях и логов взаимодействия, генерируемых в процессе реальной работы.
Эти побочные данные — не цифровой мусор. Они часто содержат с трудом добытую бизнес-логику. Команда логистов может использовать промпты для оптимизации маршрутов доставки с учетом внутренних ограничений, на разработку которых компания потратила годы. Юридический отдел может итеративно исправлять формулировки контрактов, пока результат не будет соответствовать корпоративному стилю. Группа фармацевтических исследований может запрашивать клинические данные таким образом, который раскрывает стратегические приоритеты. Когда эти взаимодействия проходят через сторонний API, провайдер видит весь обмен данными. Модель понимает, как выглядят хорошие ответы именно для этой конкретной области.
Со временем эта обратная связь делает общую модель провайдера более точной в тех самых задачах, для выполнения которых клиент ее нанял. Затем провайдер может перепродать эту улучшенную возможность конкуренту клиента или запустить смежный продукт, имитирующий специализированный рабочий процесс. Первоначальное предприятие оплатило подписку, пожертвовало своими проприетарными знаниями и, по сути, обучило своего собственного конкурента.
Почему суверенный ИИ превращается из модного слова в стратегию
Логичным ответом на эту утечку является возвращение контроля над циклом обучения. Аргументация Наделлы явно направлена на то, чтобы позиционировать Microsoft как арендодателя иного типа. Вместо того чтобы настаивать на том, чтобы клиенты скармливали свой интеллект централизованному «черному ящику», он выступает за создание сред, в которых ключи остаются у клиента.
Именно здесь дискуссия о суверенном ИИ обретает практическую значимость. Запуск моделей внутри частного облака, локального (on-premise) дата-центра или строго контролируемой виртуальной сети означает, что данные взаимодействия никогда не покидают периметр организации. Предприятие по-прежнему получает выгоду от современных базовых моделей, но веса, промпты и данные о предпочтениях остаются в границах, которыми управляет сама компания.
Microsoft построила свой облачный бизнес Azure именно на этом обещании — возможности частного развертывания и регионального хранения данных. В своем посте Наделла дал понять, что Microsoft хочет стать платформой, на которой предприятия смогут самостоятельно проводить обучение и инференс, не рискуя непреднамеренно отправить свою интеллектуальную собственность удаленному провайдеру моделей. Суть предложения проста: используйте мощный ИИ, но сохраняйте свои побочные данные.
Другие вендоры делают подобные заявления, но слова Наделлы имеют особый вес из-за глубокого партнерства Microsoft с OpenAI. Для генерального директора, чей...
