Физический ИИ — новая парадигма автоматизации

Вопросы управления вокруг Physical AI становятся всё сложнее по мере того, как автономные ИИ-системы переходят от цифровых сред к роботам, датчикам и промышленному оборудованию. Проблема заключается не только в том, могут ли ИИ-агенты выполнять задачи, но и в том, как их действия тестируются, контролируются и останавливаются при взаимодействии с реальными системами.

Промышленная роботика уже создаёт обширную базу для этой дискуссии. По данным Международной федерации робототехники, в 2024 году по всему миру было установлено 542 000 промышленных роботов — более чем вдвое больше, чем годовой показатель десять лет назад. Ожидается, что к 2025 году объём установок достигнет 575 000 единиц, а к 2028 году превысит 700 000 единиц.

Исследователи рынка также применяют термин «Physical AI» к более широкой группе систем, включая робототехнику, граничные вычисления и автономные машины. По оценке Grand View Research, глобальный рынок Physical AI составил 81,64 млрд долларов в 2025 году и, по прогнозам, достигнет 960,38 млрд долларов к 2033 году, хотя Сэма категория зависит от того, как вендоры определяют интеллект в физических системах.

Google DeepMind и семейство Gemini Robotics

Google DeepMind представила Gemini Robotics и Gemini Robotics-ER в марте 2025 года, описав их как модели, построенные на базе Gemini 2.0 для робототехники и воплощённого ИИ. Gemini Robotics — это модель «зрение — язык — действие», предназначенная для прямого управления роботами, тогда как Gemini Robotics-ER сфокусирована на воплощённом рассуждении, включая пространственное понимание и планирование задач.

Робот, использующий такую модель, должен уметь идентифицировать объект, понять инструкцию и спланировать последовательность движений. Ему также необходимо оценить, выполнена ли задача корректно. Всё это создаёт управленческую задачу, охватывающую как поведение модели, так и механические ограничения системы.

Google DeepMind подчёркивает, что полезные роботы нуждаются в универсальности, интерактивности и ловкости. Универсальность охватывает незнакомые объекты и среды, интерактивность связана с человеческим вводом и изменяющимися условиями, а ловкость относится к физическим задачам, требующим точных движений. В материалах запуска компания отметила, что Gemini Robotics способна следовать инструкциям на естественном языке и выполнять многошаговые задачи манипуляции, включая складывание бумаги, упаковку предметов в сумку и работу с объектами, не встречавшимися в ходе обучения.

Технические требования к Physical AI шире, чем понимание языка. Системам необходимы визуальное восприятие и пространственное рассуждение, а также планирование задач и обнаружение успешного выполнения. В робототехнике обнаружение успеха критично, поскольку система должна решить, завершена ли задача, нужно ли повторить попытку или следует остановиться.

Gemini Robotics-ER 1.6, представленная Google в апреле 2026 года, демонстрирует, как эти функции упаковываются в более новых моделях. Компания описывает модель как поддерживающую пространственную логику, планирование задач и обнаружение успеха с возможностью рассуждения через промежуточные шаги и принятия решения — продолжать ли или попробовать снова. В документации для разработчиков Google указано, что Gemini Robotics-ER 1.6 доступна в режиме предпросмотра через Gemini API. Документация описывает её как модель «зрение — язык», которая переносит агентные возможности Gemini в робототехнику, включая визуальную интерпретацию, пространственное рассуждение и планирование по командам на естественном языке.

Безопасность и управление: многоуровневая задача

Управление становится сложнее, когда такие системы могут вызывать инструменты, генерировать код или инициировать действия. Контроли должны определять, к каким данным система может получить доступ, какие инструменты она может использовать, какие действия требуют одобрения человека и как фиксируется активность для последующего аудита.

Безопасность в робототехнике включает также физическое поведение машины. Google DeepMind описывает безопасность роботов как многоуровневую задачу, охватывающую нижний уровень управления — такие механизмы, как предотвращение столкновений, ограничение усилия и стабильность, — а также высший уровень рассуждений о том, является ли запрошенное действие безопасным в данном контексте. Компания также представила набор данных ASIMOV для оценки семантической безопасности в робототехнике.

Корпоративное управление ИИ: уроки McKinsey

Исследование McKinsey по доверию к ИИ 2026 года указывает на ту же проблему в корпоративном ИИ в целом. Согласно исследованию, лишь около трети организаций сообщили о уровне зрелости стратегии, управления и управления агентным ИИ на уровне три или выше, даже когда ИИ-системы берут на себя всё более автономные функции. Этот разрыв между скоростью внедрения Physical AI и зрелостью управленческих практик остаётся одним из ключевых вызовов отрасли.