Результаты бенчмарка: компактная модель против гиганта
В ходе тестирования новой модели Qwen3.8-27B на бенчмарке из 50 задач, включающем стратегические документы и архитектурные решения, выяснилось, что она показывает результаты, сопоставимые с DeepSeek V4 Flash 0731. Разница в баллах составила всего 0,004, однако задержка (latency) у компактной модели оказалась почти в пять раз ниже, чем у API-решения.
При использовании API у DeepSeek V4 Flash наблюдаются серьезные проблемы с производительностью: P99 по сквозной задержке достигает 788 секунд, а ошибки структурированного вывода составляют 13,45%. Для сравнения, локальный запуск Qwen3.8-27B обеспечивает TTFT (время до первого токена) на уровне 27 секунд.
Проблемы масштабирования и контекста
Тестирование выявило критическую зависимость качества работы от объема контекста для reasoning-режима. При ограничении в 4096 токенов модель не успевала завершить рассуждения, выдавая пустой ответ (finish_reason=length). При увеличении лимита до 32 768 токенов задача, ранее не решавшаяся, показала результат 0,87.
Также зафиксированы расхождения в оценках различных LLM-судей. Например, Gemini стабильно ставит низкий балл (2/10) за галлюцинации, в то время как GPT-5.1 и Opus-4.8 оценивают тот же ответ значительно выше (9/10 и 8/10 соответственно). Это указывает на то, что использование нескольких судей необходимо для корректной верификации сложных ответов.
Экономика локального запуска
Для запуска тяжелых моделей, таких как DeepSeek с 304 млрд параметров, требуется значительное оборудование. На двух картах RTX PRO 6000 (96 ГБ) доступный объем памяти под контекст составляет всего 4,46 ГБ, что не позволяет использовать окно в 256K токенов. Оптимальный вариант для работы с такими весами — две системы DGX Spark стоимостью около 700 тысяч рублей.
С точки зрения окупаемости, использование собственного оборудования становится выгодным при объеме в 11 400 прогонов бенчмарка в месяц. Учитывая результаты тестов, Qwen3.8-27B признана эффективной моделью для локальной работы.
