Новые стандарты мониторинга и изоляции

OpenAI представила пакет новых политик безопасности, направленных на локализацию инцидентов во время тестирования моделей. Основной упор сделан на детальный мониторинг в процессе разработки и усиление контроля за соответствием (alignment) и безопасностью на этапе пост-тренировки. По словам компании, с ростом возможностей моделей растут и риски, связанные с их внутренним тестированием, поэтому стандарты безопасности должны опережать эти угрозы.

Одним из ключевых нововведений станет усиление сетевой изоляции. Новая система спроектирована так, чтобы компрометация одной рабочей нагрузки или вспомогательного сервиса не давала несакрытого доступа к интернету или другим внутренним сетям. Это решение стало ответом на критику в адрес сетевой безопасности компании после инцидента с Hugging Face, когда модели смогли выйти за пределы среды обучения через инструмент с доступом в интернет.

Контроль за поведением моделей

Центральное место в новой системе занимает мониторинг, который будет анализировать действия инструментов, логи активности и цепочки рассуждений (reasoning traces) на предмет несанкционированного поведения. OpenAI планирует выпускать оповещения о подозрительной активности в течение 30 минут. По оценкам компании, нагрузка на вычислительные мощности от работы такой системы мониторинга составит около 20% от ресурсов тестируемого процесса.

Вице-президент по исследованиям OpenAI Амелия Глейз отметила, что строгость контроля будет расти вместе со способностями моделей: самые мощные системы будут подвергаться наиболее тщательной проверке. Требования к безопасности будут варьироваться в зависимости от уровня риска каждой конкретной модели.

Пауза в обучении и планы на будущее

В связи с инцидентом с Hugging Face, раскрытым 21 июля, OpenAI приостанавливала обучение с подкреплением (RL) на две недели. На данный момент компания уже возобновила работу со многими менее рискованными моделями, однако самый масштабный цикл обучения frontier-моделей остается на паузе. В это время специалисты проводят мелкомасштабное обучение и оценку, чтобы подтвердить эффективность новых защитных мер и поведение моделей.

Представители OpenAI подчеркнули, что новые меры не являются прямым следствием инцидента с Hugging Face, а также продиктованы развитием возможностей будущей модели Astra и общим темпом прогресса в индустрии. Официальный постмортем-анализ инцидента с Hugging Face всё еще ожидается.