Анонимный запуск модели под кодовым именем Ox Alpha на платформе OpenRouter оказался масштабным полевым испытанием новой разработки от китайской компании Z.ai. За неделю работы без указания разработчика модель обработала десятки триллионов токенов, собрав около 500 тысяч пользователей и став самым крупным запуском в истории площадки. 26 августа Z.ai официально подтвердила, что Ox Alpha — это GLM-5.3-Flash.
Технические особенности и архитектура
GLM-5.3-Flash представляет собой мультимодальную модель на базе архитектуры Mixture-of-Experts (MoE). При общем объеме в 320 млрд параметров в каждый момент времени активны только 18 млрд. Модель поддерживает контекстное окно в один миллион токенов и была обучена на мультимодальном корпусе объемом 30 трлн токенов, что позволяет ей нативно работать с визуальными данными.
Ключевым техническим новшеством стала гибридная архитектура внимания. Она сочетает линейное внимание для локальных зависимостей и разреженное внимание для глобального контекста. Чтобы оптимизировать работу с длинным контекстом, инженеры внедрили механизм IndexPool, который сжимает векторы индексатора. По заявлениям Z.ai, это позволило сократить вычисления на внимание в три раза, а размер KV-кэша — в 4,4 раза по сравнению с предыдущей версией GLM-5.3.
Результаты тестов и возможности агентов
В ходе анонимного тестирования Ox Alpha показала выдающиеся результаты в агентских задачах. Пользователи фиксировали случаи, когда модель за несколько часов самостоятельно развертывала полноценный программный стек: покупала домены, настраивала Vercel, подключала базы данных Supabase и реализовывала сложную бизнес-логику. Также была продемонстрирована способность к длительным сессиям (более 10 часов) для генерации 3D-сцен, где модель в цикле «рендер — самопроверка — правка» корректировала шейдеры на основе визуального фидбека.
Согласно данным Artificial Analysis, модель заняла 10-е место в общем рейтинге Intelligence Index с 57 баллами. В сравнении с Claude Opus 4.8 результаты неоднозначны: Flash обходит конкурента в задачах автоматизации и использовании инструментов, но уступает в некоторых бенчмарках на логику и работу с терминалом. При этом стоимость использования модели значительно ниже, чем у флагманских решений конкурентов.
Инфраструктура на китайских чипах
Разработка и обслуживание Ox Alpha проходили полностью на китайском оборудовании. По данным South China Morning Post, для модели использовался кластер из порядка 100 тысяч чипов. Чтобы компенсировать ограничения памяти и пропускной способности локального железа по сравнению с решениями Nvidia, Z.ai разработала специализированный инференс-движок EPD (Encode — Prefill — Decode).
Эта архитектура разделяет процессы кодирования, префилла и декодирования на независимые пулы воркеров, что позволило увеличить производительность обслуживания в три раза и приблизить стоимость токена к уровню мейнстримных GPU.
