Новый подход к ускорению ИИ

В то время как рынок активно обсуждает специализированные чипы для нейросетей, французский стартап Kog предлагает другой путь. Компания делает ставку на оптимизацию программного обеспечения для стандартных графических процессоров (GPU), которые уже есть в распоряжении предприятий, таких как модели AMD MI300X и Nvidia H200.

Основная цель проекта — решить проблему низкой скорости генерации текста (инференса) и высокой стоимости вычислений. Kog стремится доказать, что существующее оборудование может работать значительно быстрее, если использовать более эффективные алгоритмы обработки запросов.

Потенциальные клиенты и задачи

Разработчики Kog уже получили сотни запросов от потенциальных заказчиков. В первую очередь интерес проявляют профессионалы, использующие ИИ в рабочих процессах, где задержки в ответах критичны. Например, разработчики программного кода часто сталкиваются с длительным ожиданием результатов работы ИИ-помощников.

Также в число партнеров компании вошли сервисы, которые позволяют создавать игры и приложения с помощью текстовых запросов. Для таких продуктов высокая скорость работы движка напрямую влияет на доходность бизнеса.

Технологический вызов: от малых моделей к большим

В демонстрационном тесте Kog показала впечатляющую скорость — 3000 токенов в секунду. Однако этот результат был достигнут на небольшой модели с 2 миллиардами параметров (Laneformer 2B). Переход к работе с полноценными большими языковыми моделями (LLM) — это гораздо более сложная задача из-за их огромного объема.

Несмотря на скептицизм, руководство Kog уверено, что их метод сработает и с большими моделями. По словам генерального директора компании Гаэля Делало, современные GPU обладают огромной пропускной способностью памяти, которую текущее программное обеспечение просто не использует в полной мере.

Метод «взлома» железа

Подход Kog основан на глубоком понимании физики процессов и архитектуры видеокарт. Основатель компании Гаэль Делало применил опыт из сферы кибербезопасности, где он занимался реверс-инжинирингом — процессом обратной разработки кода до уровня машинных команд. Это позволяет находить способы использования оборудования не так, как это было задумано изначально.

Однако такой метод требует огромных временных затрат. Команде из 11 человек приходится тратить недели и месяцы на изучение каждой новой модели видеокарт, чтобы адаптировать под них свои алгоритмы. В будущем компания планирует автоматизировать этот процесс с помощью агентных систем.

Что это значит

Если Kog удастся достичь десятикратного ускорения работы больших моделей, как планируется в сентябре, это может изменить экономику использования ИИ. Успех компании позволит клиентам получать результаты работы нейросетей значительно быстрее, используя уже имеющееся в дата-центрах оборудование без необходимости закупки дорогостоящих специализированных чипов.