Возвращение флагманских моделей
Компания Anthropic официально запустила новую модель Claude Sonnet 5 и восстановила доступ к своим передовым системам Fable и Mythos. Это решение последовало за восемнадцатидневным перерывом в работе, который был вызван директивой правительства США об экспортном контроле.
Причиной ограничений послужило исследование ученых из Amazon. Они обнаружили способ обхода защитных механизмов модели Fable 5, который позволял системе выявлять уязвимости в программном обеспечении и генерировать код для их эксплуатации. В результате временного приостановления доступа из-за отсутствия системы проверки гражданства в реальном времени, доступ к моделям был полностью закрыт для всех пользователей по всему миру.
Новый механизм безопасности
Чтобы снять ограничения, инженеры Anthropic разработали обновленный автоматизированный классификатор. Этот программный слой анализирует запросы разработчиков и блокирует те из них, которые имеют высокую статистическую вероятность вредоносного умысла. В ходе испытаний новый механизм предотвратил использование уязвимости более чем в 99% случаев.
Если запрос пользователя попадает в «серую зону» и вызывает срабатывание защитных границ, система автоматически перенаправляет задачу на более старую архитектуру Opus 4.8. Это позволяет поддерживать непрерывность работы, не допуская потенциально опасных действий. Однако использование такого широкого защитного контура приводит к тому, что система может чаще помечать безобидные запросы как подозрительные во время отладки программного обеспечения.
Возможности Claude Sonnet 5
Новая модель Claude Sonnet 5 ориентирована на решение сложных автономных задач. Она способна выполнять многоэтапные планы, работать в терминале и самостоятельно перемещаться в браузере без участия человека. Компании переходят на эту архитектуру для управления автономными агентами, чтобы снизить операционные расходы при сохранении высокой производительности.
Практическое применение модели уже демонстрируют крупные компании. Например, в Rakuten система самостоятельно обрабатывает сложные запросы на изменение кода, выполняя тесты и проверяя результаты перед тем, как представить готовое решение инженерам. Компания Zapier использует модель для автоматизации административных задач, таких как обновление уровней аккаунтов в Salesforce и рассылка уведомлений, выполняя весь цикл действий без вмешательства человека.
Разработчик инструментов Zed применил систему для автоматического поиска и исправления ошибок. Модель самостоятельно создала сценарий для воспроизведения бага, применила исправление и проверила его эффективность. Аналогично компания Factory использует архитектуру для работы в сложных кодовых базах, где система справляется с задачами, которые раньше приводили к сбоям или превышению лимитов времени ожидания.
Безопасность и сотрудничество
Несмотря на высокую автономность, Claude Sonnet 5 не обладает специализированными возможностями для проведения кибератак. Инженеры намеренно исключили из процесса обучения специализированные наборы данных по кибербезопасности, ограничив модель только защитными техническими задачами. Исследования, проведенные совместно с Mozilla, показали нулевой процент успеха при попытках модели создать рабочие эксплойты для браузера Firefox.
Ситуация с ограничениями со стороны государства подтолкнула Anthropic, Amazon, Microsoft и Google к созданию общей отраслевой базы для оценки нарушений безопасности. Сейчас у провайдеров нет единой метрики для классификации серьезности обхода систем защиты. Предлагаемый стандарт позволит координировать защитные действия при обнаружении критических уязвимостей, способных нарушить работу финансовых или энергетических систем.
Что это значит
Anthropic переходит к модели тесного взаимодействия с государственными регуляторами, предоставляя исследователям ранний доступ к новым архитектурам для аудита безопасности перед их коммерческим выпуском.
