Архитектура и возможности

Alibaba выпустила Qwen3.8-27B — новую плотную (dense) мультимодальную модель с 27,78 млрд параметров. В отличие от архитектуры MoE, здесь все веса работают одновременно при инференсе. Модель использует гибридный подход: из 64 слоев только 16 являются классическими слоями с полным вниманием (full attention), остальные 48 — это линейные слои Gated DeltaNet. Такая схема позволяет поддерживать контекст в 262 144 токена «из коробки» с возможностью расширения до миллиона через YaRN, при этом не перегружая KV-кэш.

Модель доступна в форматах BF16 (вес около 55,6 ГБ) и блочном FP8 (около 30,9 ГБ). Несмотря на то, что архитектурно она идентична предыдущей версии Qwen3.6-27B, значительный прирост производительности достигнут за счет улучшений в процессе обучения.

Результаты бенчмарков и агентские задачи

Qwen3.8-27B ориентирована не только на чат, но и на выполнение функций ИИ-агента (браузер, терминал, интерфейсы). Это подтверждается ростом показателей в специализированных тестах: OSWorld-Verified вырос с 63,9 до 84,3, WebArena — с 48,8 до 64,8, а SWE-MM — с 25,7 до 38,6. В некоторых тестах модель сопоставима с закрытой Claude Opus 4.6.

Однако эксперты указывают на нюансы: часть бенчмарков (QwenSWEBench, CoWorkBench, RecreationBench) являются внутренними разработками Alibaba, а сравнение с Opus в тесте SWE-bench Pro не совсем корректно, так как результаты Anthropic были взяты из готовых публикаций, а не прогнаны через тот же набор задач.

Проблемы «избыточного мышления» и галлюцинаций

Одной из главных особенностей модели стал режим рассуждений (reasoning), который по умолчанию установлен на уровень xhigh. Это приводит к эффекту «overthinking»: модель может тратить десятки минут и тысячи токенов на решение тривиальных задач. Например, при написании простого эссе модель может начать вручную пересчитывать слова, чтобы строго соблюсти лимит.

Пользователи также отмечают ряд проблем:

  • Склонность к галлюцинациям в сложных задачах (например, ссылки на несуществующие последовательности в OEIS).
  • Ошибки при выполнении простых инструкций (например, невозможность развернуть строку задом наперед).
  • Игнорирование части инструкций или самопроизвольное изменение условий задачи в процессе рассуждений.
Подобные сложности связаны с тем, что локальная модель на 27 млрд параметров всё еще уступает по объему знаний и точности фактологии гигантским облачным моделям вроде Claude или GPT.

Мультимодальные возможности

Модель демонстрирует высокие способности к генерации графики через код (SVG). Тесты показывают, что Qwen3.8-27B способна создавать детализированные изображения (например, пеликана на велосипеде) с высокой точностью композиции, что ставит её в один ряд с топовыми решениями при использовании специализированных методов квантования.