Новые стандарты для корпоративного ИИ

С развитием больших языковых моделей компаниям требуется более надежная архитектура для их коммерческого использования. OpenAI представила Frontier Governance Framework (FGF) — документ, описывающий, как организация оценивает и снижает системные риски. Этот фреймворк напрямую соотносится с требованиями законодательства, такими как Кодекс практики ИИ общего назначения в ЕС и закон Калифорнии о прозрачности передового ИИ (TFAIA).

Фреймворк служит практическим шаблоном для построения безопасных систем машинного обучения. Он помогает компаниям структурировать процессы развертывания моделей, обеспечивая их безопасность на протяжении всего жизненного цикла.

Определение системных рисков

В рамках документа системным риском называются предсказуемые события, которые могут привести к серьезному ущербу. К ним относятся сценарии, в которых один инцидент может привести к гибели более 50 человек или материальному ущербу на сумму более 1 миллиарда долларов.

Несмотря на крайне низкую вероятность таких событий, их четкое определение позволяет командам разработчиков заранее создавать необходимые защитные механизмы. Это помогает предприятиям эффективно распределять вычислительные ресурсы и инженерные часы на непрерывный мониторинг и аудит со стороны третьих лиц.

Категории угроз и уровни сложности

OpenAI классифицирует угрозы по нескольким направлениям: кибератаки, химические, биологические, радиологические и ядерные риски (CBRN), манипуляция поведением человека и потеря контроля над системой. Для оценки возможностей моделей используются уровни риска.

Например, в категории кибератак третий уровень (Tier 3) означает, что модель может самостоятельно находить и создавать эксплойты для защищенных систем без участия человека. В категории CBRN модель третьего уровня способна помочь эксперту в создании опасных биологических угроз или автономно завершить цикл синтеза опасного агента.

Для предотвращения манипуляций поведением человека, таких как вмешательство в выборы, OpenAI рекомендует использовать методы мониторинга в реальном времени после развертывания модели. Что касается риска потери контроля, то модели третьего уровня способны работать автономно длительное время, обладая высокой ситуационной осведомленностью и способностью скрывать свои действия от систем мониторинга.

Защита данных и инфраструктура

Для обеспечения безопасности OpenAI использует международные стандарты, такие как ISO 27001, 27017, 27018 и 27701, а также оценки SOC 2 Type II. Для защиты весов моделей применяются шифрование данных, многофакторная аутентификация и протоколы многостороннего одобрения. Все вычисления происходят в изолированной среде (песочнице) с ограниченным доступом.

При интеграции моделей в корпоративные данные часто используются векторные базы данных. Чтобы защитить их от попыток извлечения данных или вредоносных запросов, OpenAI применяет классификаторы безопасности: каждый запрос проверяется перед обращением к базе данных, а полученный контекст — перед генерацией ответа.

Внешний аудит и реагирование на инциденты

Для поддержания актуальных стандартов безопасности OpenAI привлекает внешних экспертов и независимых аудиторов. Они проводят стресс-тесты систем и предоставляют независимые заключения внутреннему консультативному совету по безопасности.

В компании также действует план реагирования на инциденты безопасности ИИ (AIRP). Он определяет порядок расследования и устранения последствий серьезных сбоев, которые могут быть выявлены через автоматический мониторинг или отзывы пользователей. Раз в год проводится формальная оценка фреймворка на предмет изменений в законодательстве и новых возможностей моделей.

Что это значит

Внедрение подобных структур позволяет компаниям, использующим автономных агентов в логистике или финансах, создавать надежные механизмы аварийного отключения и поддерживать контроль со стороны человека.