ИИ-лаборатории — троянские кони корпоративных данных

Генеральный директор Microsoft Сатья Наделла выступил с резким предупреждением для компаний, активно использующих технологии искусственного интеллекта. В воскресном посте на блоге он присоединился к растущему числу экспертов, которые тревожатся о том, что крупные ИИ-лаборатории ведут себя подобно троянским коням. По их мнению, стартапы и корпорации, использующие модели от OpenAI и Anthropic, невольно предоставляют этим компаниям всё более глубокий доступ к своей наиболее конфиденциальной бизнес-информации — и те могут использовать эти знания для создания собственных конкурентов.

Такие предупреждения звучат не только от венчурных инвесторов вроде Джейсона Калачаниса или генерального директора Palantir Алекса Карпа. Теперь к ним присоединился глава одной из крупнейших технологических корпораций мира.

Двойная цена: деньги и знания

Наделла сформулировал проблему предельно ясно: пользователи ИИ «платят дважды». Первый платёж — за токены и вычислительные ресурсы. Второй — неосознанный, но куда более дорогой: компании раскрывают модели свои проприетарные знания. «Вы по сути платите за интеллект дважды — один раз деньгами, а второй раз чем-то ещё более ценным: проприетарными знаниями, которые вы обязаны раскрыть, чтобы этот интеллект стал полезным. Чем лучше вы хотите, чтобы модель работала, тем больше таких знаний вы должны ей передать», — пишет Наделла.

По его словам, предприятия буквально учат модели тонкостям своего бизнеса. «Модели обучаются на «выбросах» — на промптах, которые пишут люди, на инструментах, которые используют агенты, и особенно на исправлениях, которые люди вносят, когда модель ошибается. Каждое исправление перерабатывается в институциональное ноу-хау», — подчёркивает Наделла. Именно этого знания, по его словам, «конкурент никогда не сможет купить», однако предприятия добровольно его передают.

Дистилляция: ответный ход корпораций

Наделла предложил принципиально новый подход к балансу сил. Если ИИ-компании свободно собирают данные из интернета для обучения своих моделей, то, по его логике, предприятиям должно быть позволено изучать — или «дистиллировать» — эти модели в ответ. Дистилляция — это практика использования собственных выходных данных модели, чтобы понять, как она работает, и на основе этих инсайтов обучить новую, часто более дешёвую модель.

Его аргументация прямолинейна: «Пока инновации, порождённые тем, что провайдеры моделей имеют право на добросовестное использование для обучения на публичных данных, необходимы, я нахожу ироничным, что сложившийся порядок вещей предполагает введение ограничительных условий на дистилляцию». Особенно Наделла обеспокоен случаи, когда создатели моделей «зарезервируют за собой право обучаться на данных об использовании и взаимодействии клиентов».

Стоит отметить, что в феврале Anthropic обвинила китайские модели с открытым исходным кодом в отправке миллионов промптов к Claude с целью улучшения собственных моделей и призвала правительство США ужесточить экспортный контроль. Позиция Наделлы вписывается в эту логику: создатели моделей не могут иметь всё сразу — свободно учиться на мировых данных, но при этом ограничивать обратный процесс.

Открытый код и собственные серверы: новый тренд в корпоративном ИИ

Решение Наделлы — типичная рекомендация для CEO гигантского облачного провайдера. Он призывает компании «сохранять право собственности» на свои данные, включая промпты и обратную связь, и строить собственные «проприетарные среды обучения» в облаке — где их данные, скорее всего, уже хранятся, и где, к слову, это может означать облачную платформу Microsoft Azure. Кроме того, он предлагает внедрять «слои оркестрации» — механизмы, позволяющие легко переключаться между моделями ИИ от разных провайдеров, вместо того чтобы быть привязанным к одному поставщику. Инструменты вроде ИИ-шлюзов, дающие именно такую возможность, становятся всё более популярными.

При этом Наделла никогда не произносит слова «открытый исходный код», но подтекст очевиден. И крупные компании уже движутся в этом направлении: многие из них, помимо облачных решений, сохраняют собственные дата-центры и переходят на open-source модели, развёрнутые на собственных серверах («on-prem» в отраслевой терминологии).

Идит Левин, основательница и генеральный директор Solo.io — компании, разрабатывающей сетевое и защитное ПО для управления ИИ-системами предприятий, — подтверждает этот сдвиг на собственном опыте. После экспериментов с проприетарными моделями их клиенты начинают задавать вопрос: «Могу ли я взять open-source модель и запустить её на собственных серверах? Она сделает почти 90% того, что делает большая модель, но будет стоить значительно дешевле». Среди клиентов Solo.io — T-Mobile, ADP и SAP. В прошлом году технологии компании были выбраны для проекта Agentgateway Linux Foundation.

Левин видит в этом следующую большую волну корпоративного использования ИИ. Она не одна в этом мнении: Vercel, известная как платформа для создания и хостинга сайтов, недавно добавившая инструменты переключения между ИИ-моделями, и OpenRouter, помогающая разработчикам направлять запросы к разным моделям ИИ, фиксируют резкий рост трафика к открытым моделям. По последним данным, open-source модели уже составляют 29% всего трафика к ИИ-сервисам — и эта цифра продолжает расти.