Новая архитектура для работы с ИИ

На конференции Google Cloud Next компании Google и NVIDIA представили план развития оборудования, направленный на снижение стоимости инференса (процесса выполнения запросов ИИ) в масштабах всей индустрии. Речь идет о новых инстансах A5X, которые работают на базе систем NVIDIA Vera Rubin NVL72.

Благодаря совместной разработке оборудования и программного обеспечения, новая архитектура способна снизить стоимость обработки одного токена в 10 раз по сравнению с предыдущими поколениями. При этом эффективность использования электроэнергии выросла в 10 раз: теперь на каждый ватт мощности приходится в 10 раз больше обработанных токенов.

Масштабируемость и сетевые технологии

Для эффективной работы тысяч процессоров требуется огромная пропускная способность, чтобы избежать задержек. В инстансах A5X эта задача решается за счет сочетания сетевых адаптеров NVIDIA ConnectX-9 SuperNIC и технологии Google Virgo. Такая конфигурация позволяет объединять до 80 000 графических процессоров NVIDIA Rubin в одном кластере и до 960 000 процессоров в распределенной сети.

Управление такими масштабами требует точной синхронизации данных между миллионами параллельных процессоров, чтобы избежать простоев вычислительных мощностей.

Безопасность и конфиденциальность данных

Для крупных компаний, особенно в финансовом и медицинском секторах, критически важна защита данных. Чтобы решить проблему суверенитета данных, модели Google Gemini на базе графических процессоров NVIDIA Blackwell теперь доступны в сервисе Google Distributed Cloud. Это позволяет организациям хранить свои самые чувствительные данные и модели внутри подконтрольной им среды.

Безопасность обеспечивается на аппаратном уровне с помощью технологии NVIDIA Confidential Computing. Она гарантирует, что данные и запросы остаются зашифрованными даже во время обучения или настройки моделей, и их не смогут увидеть даже операторы облачной инфраструктуры.

Автоматизация обучения и сложных систем

Создание сложных ИИ-агентов требует интеграции языковых моделей с множеством программных интерфейсов и синхронизации баз данных. Для упрощения этих процессов на платформе Gemini Enterprise Agent Platform стала доступна модель NVIDIA Nemotron 3 Super, которая помогает разработчикам создавать системы, способные к рассуждению и планированию.

Также Google и NVIDIA внедрили управляемые кластеры для обучения (Managed Training Clusters). Эта система автоматизирует подбор размера кластера и восстановление после сбоев во время длительных циклов обучения, позволяя специалистам сосредоточиться на качестве моделей, а не на управлении «железом».

Применение в промышленности и реальном секторе

Инфраструктура NVIDIA и Google Cloud также нацелена на промышленность. С помощью библиотек NVIDIA Omniverse и фреймворка Isaac Sim компании могут создавать точные цифровые двойники заводов и симуляции робототехники. Это позволяет тестировать производственные процессы в виртуальной среде перед их внедрением в реальности.

Технологии уже находят применение на практике: OpenAI использует системы NVIDIA на Google Cloud для работы ChatGPT, а фармацевтические компании, такие как Schrödinger, сокращают время проведения симуляций по поиску новых лекарств с нескольких недель до нескольких часов.

Что это значит

Интеграция передовых графических процессоров NVIDIA и облачной инфраструктуры Google позволяет компаниям переходить от экспериментов с ИИ к масштабному промышленному внедрению, значительно снижая при этом затраты на вычисления и повышая безопасность данных.