Сравнение 18 конфигураций моделей Ornith-1.5 и Qwen3.8 на базе RTX PRO 6000 (96 ГБ) выявило прямую зависимость между весом квантования, скоростью генерации и качеством ответов. Тестирование проводилось на 22 реальных задачах, включая написание кода, рассуждения на русском языке и форматирование.

Скорость и архитектура MoE

Архитектура Mixture of Experts (MoE) в модели Ornith-1.5-35B (35 млрд параметров, ~3 млрд активных на токен) обеспечивает кратное преимущество в скорости. При использовании Ollama модель выдает 159–198 токенов в секунду, в то время как Qwen3.8-27B показывает лишь 54–57 токенов в секунду. Основным ограничителем производительности выступает пропускная способность памяти: чем меньше данных требуется перечитывать на каждый токен, тем выше скорость работы.

Влияние квантования на качество

Эксперименты подтвердили, что использование слишком низкого битрейта критически снижает полезность модели. Так, Qwen3.8-27B на квантовании UD2_XXS (7.27 ГБ) выдала пустые ответы в двух практических задачах на Python и Ansible. Модели ниже 3-бит часто не справляются с ответом вовсе. При этом Ornith-35B продемонстрировала языковой дефект в задаче на логику: модель вставила арабское слово в русское предложение и выдала физически невозможный результат деления яблок, хотя арифметика была верной. В то же время более легкая Ornith-9B и Qwen3.8-27B справились с этой задачей корректно.

Проблемы совместимости и железа

Тестирование осложнилось особенностями софта: поддержка архитектуры гибрида Gated DeltaNet + MoE в плагине vLLM для GGUF появилась только в августе и требует специфических багфиксов. Из-за этого корректное сравнение скорости между Ollama и vLLM в продакшн-режиме пока затруднено. Что касается аппаратных требований, для одновременного запуска обеих моделей в высоком качестве (NVFP4) требуется около 91 ГБ видеопамяти, что делает использование RTX PRO 6000 оптимальным решением по сравнению с потребительскими картами.