Архитектура и возможности
Alibaba выпустила Qwen3.8-27B — новую плотную (dense) мультимодальную модель с 27,78 млрд параметров. В отличие от архитектуры MoE, здесь все веса работают одновременно при инференсе. Модель использует гибридный подход: из 64 слоев только 16 являются классическими слоями с полным вниманием (full attention), остальные 48 — это линейные слои Gated DeltaNet. Такая схема позволяет поддерживать контекст в 262 144 токена «из коробки» с возможностью расширения до миллиона через YaRN, при этом не перегружая KV-кэш.
Модель доступна в форматах BF16 (вес около 55,6 ГБ) и блочном FP8 (около 30,9 ГБ). Несмотря на то, что архитектурно она идентична предыдущей версии Qwen3.6-27B, значительный прирост производительности достигнут за счет улучшений в процессе обучения.
Результаты бенчмарков и агентские задачи
Qwen3.8-27B ориентирована не только на чат, но и на выполнение функций ИИ-агента (браузер, терминал, интерфейсы). Это подтверждается ростом показателей в специализированных тестах: OSWorld-Verified вырос с 63,9 до 84,3, WebArena — с 48,8 до 64,8, а SWE-MM — с 25,7 до 38,6. В некоторых тестах модель сопоставима с закрытой Claude Opus 4.6.
Однако эксперты указывают на нюансы: часть бенчмарков (QwenSWEBench, CoWorkBench, RecreationBench) являются внутренними разработками Alibaba, а сравнение с Opus в тесте SWE-bench Pro не совсем корректно, так как результаты Anthropic были взяты из готовых публикаций, а не прогнаны через тот же набор задач.
Проблемы «избыточного мышления» и галлюцинаций
Одной из главных особенностей модели стал режим рассуждений (reasoning), который по умолчанию установлен на уровень xhigh. Это приводит к эффекту «overthinking»: модель может тратить десятки минут и тысячи токенов на решение тривиальных задач. Например, при написании простого эссе модель может начать вручную пересчитывать слова, чтобы строго соблюсти лимит.
Пользователи также отмечают ряд проблем:
- Склонность к галлюцинациям в сложных задачах (например, ссылки на несуществующие последовательности в OEIS).
- Ошибки при выполнении простых инструкций (например, невозможность развернуть строку задом наперед).
- Игнорирование части инструкций или самопроизвольное изменение условий задачи в процессе рассуждений.
Мультимодальные возможности
Модель демонстрирует высокие способности к генерации графики через код (SVG). Тесты показывают, что Qwen3.8-27B способна создавать детализированные изображения (например, пеликана на велосипеде) с высокой точностью композиции, что ставит её в один ряд с топовыми решениями при использовании специализированных методов квантования.
