Технологическое равенство

Согласно отчету некоммерческой организации SaferAI, китайская модель с открытыми весами GLM-5.2 от компании Z.ai практически сравнялась по возможностям с лидерами индустрии — GPT-5.5 от OpenAI и Claude Opus 4.7 от Anthropic. В тестах на кибербезопасность и биологические задачи разрыв между ними составляет всего несколько месяцев.

Однако за равенство в возможностях приходится платить отсутствием контроля. Если передовые модели от Anthropic настолько строго соблюдают правила безопасности, что не позволяют даже завершить тесты на кибербезопасность, то GLM-5.2 не отклонила ни одну из поставленных ей задач по проведению вредоносных атак.

Проблема открытых весов

Главное отличие заключается в том, как именно работают защитные механизмы. Разработчики закрытых систем, таких как OpenAI, используют классификаторы и специальные инструкции, чтобы ограничивать помощь в совершении кибератак или создании биологического оружия. Эти меры не идеальны и могут быть обойдены с помощью специальных методов манипуляции, но они существуют.

В случае с моделями с открытыми весами, такими как GLM-5.2, любые встроенные ограничения становятся бесполезными, как только пользователь скачивает веса модели. На собственном оборудовании человек может легко удалить или изменить любые защитные протоколы, изменить системные инструкции или провести дообучение модели под свои нужды.

Методы защиты и их сложности

Существует несколько способов снизить риски. Один из них — фильтрация данных на этапе обучения. Удаление опасной информации из обучающего набора может снизить риски в биологии, не ухудшая общие способности ИИ. Однако в сфере кибербезопасности это сделать крайне сложно: трудно создать модель, которая была бы великолепным программистом, но при этом не умела бы взламывать системы.

Поэтому разработчики переходят к другим методам. Например, Anthropic ограничивает возможности своей модели Opus 5: она может искать уязвимости в исходном коде, но не в скомпилированном программном обеспечении. Также компании проводят предварительные тесты безопасности и публикуют отчеты о рисках. В случае с Z.ai таких отчетов или обязательств по тестированию опубликовано не было.

Разные подходы к регулированию

Подходы к управлению рисками в США и Китае различаются. В США эксперты больше обеспокоены экзистенциальными рисками — катастрофическими последствиями применения ИИ. В Китае регулирование сосредоточено на контроле за политическим контентом, дезинформацией и социальной стабильностью. Китайские власти подчеркивают важность открытых моделей, но настаивают на том, что ИИ должен оставаться под строгим человеческим контролем.

Сторонники открытого доступа утверждают, что это необходимо для кибербезопасности: знание новых угроз помогает компаниям, таким как Hugging Face, быстрее защищаться от атак. Однако критики предупреждают, что злоумышленники адаптируются к новым инструментам гораздо быстрее, чем защитники успевают внедрять меры противодействия.

Что это значит

Разрыв между возможностями ИИ и методами обеспечения его безопасности продолжает расти. Пока передовые модели становятся всё мощнее, открытый характер их распространения делает опасные технологии доступными для любого пользователя без возможности применить к ним стандартные механизмы контроля.