Новая архитектура и мультимодальность
Alibaba представила модель Qwen3.8-27B с открытыми весами под лицензией Apache 2.0. Это плотная мультимодальная модель, которая принимает на вход текст, изображения и видео. В отличие от стандартных трансформеров, архитектура Qwen3.8-27B использует чередование слоев: 48 слоев Gated DeltaNet (линейное внимание) сменяются 16 слоями Gated Attention в соотношении 3:1. Только эти 16 слоев имеют KV-кэш, что позволяет сократить объем необходимой памяти примерно на 75% по сравнению с обычными 64-слойными моделями.
Модель обладает контекстным окном в 262 144 токена, которое можно расширить до миллиона с помощью технологии YaRN при использовании сервера. По умолчанию в модели включен режим «размышления» (reasoning) с максимальным уровнем усилий.
Производительность и тесты
Согласно внутренним данным разработчиков, Qwen3.8-27B демонстрирует значительный рост показателей по сравнению с предыдущей версией Qwen3.6-27B. В тестах по программированию модель не уступает передовым API. Однако стоит учитывать, что на данный момент независимые лаборатории еще не смогли полностью воспроизвести результаты компании, а некоторые данные были получены на скорректированных датасетах.
При использовании режима рассуждений модель может быть крайне многословной: в циклах работы агентов она способна генерировать до 10 000 токенов там, где конкуренты обходятся одним. Также пользователи сообщают о технических ошибках в шаблонах чатов при попытке отключить режим мышления (enable_thinking=false).
Требования к оборудованию
Запуск модели требует внушительного объема памяти из-за работы KV-кэша. Для 4-битной квантованной версии необходимо минимум 17–18 ГБ памяти, не считая кэша. Для комфортной работы на Mac оптимальным считается объем 32–48 ГБ. При использовании контекста в 128K требуется около 8 ГБ памяти только под кэш.
Для эффективного использования модели на Apple Silicon рекомендуется использовать формат GGUF через llama.cpp или LM Studio, так как преимущество бэкенда MLX нивелируется при работе с моделями тяжелее 27 млрд параметров. Для профессионального использования, где важна конфиденциальность данных (например, в юридической или медицинской сферах), рекомендуется использовать мощные решения вроде Mac Studio с большим объемом памяти или видеокарты уровня RTX 5090.
