Проблема выбора метода сжатия

При работе с большими языковыми моделями (LLM) на домашнем железе часто возникает дилемма: использовать ли стандартное сжатие Q4 или пытаться сэкономить память с помощью более агрессивных методов. Существует мнение, что использование квантов ниже уровня Q4 — это пустая трата времени, а модели становятся «лоботомированными» уже на уровне Q8. Однако на практике всё гораздо сложнее, и теоретические показатели качества (например, KLD или PPL) не всегда подтверждаются реальными задачами.

Для проверки это было недостаточно: тесты на синтетических бенчмарках вроде MMLU не дают понимания, как модель поведет себя в реальном кодинге. Поэтому был выбран практический подход: исправление багов в существующем коде и очистка файлов от мусора. Тест проводился на конфигурации с видеокартой RTX 3060 Ti на 16 ГБ VRAM.

Результаты тестирования Qwen

В ходе эксперимента модели Qwen3.6 27b и Qwen3.5 9b показали разные результаты. Модель Qwen3.6 27b в версии iq3m (fine-tune Fable-Fus-711) оказалась единственной, кто успешно справился со всеми задачами, при этом не только исправив баги, но и оптимизировав алгоритмы генерации. Однако при использовании других методов сжатия или версий без тонкой настройки модель часто не справлялась с заданиями или даже ломала структуру кода.

Модели Qwen3.5 9b показали себя нестабильно. Версия с fine-tune «defiant fable» показала лучший результат среди малых моделей, справившись с задачей не с первого раза, в то время как другие версии просто не могли выполнить условия теста. Это подтверждает, что для малых моделей (9-12b) выбор правильного метода сжатия и настройки критически важен.

Особенности fine-tune моделей

Анализ показал, что большинство специализированных fine-tune моделей не превосходят базовые версии по интеллекту. Зачастую их «усиленный» процесс рассуждений лишь увеличивает потребление видеопамяти, не давая качественного скачка в решении задач. Исключением стали модели, настроенные под очень специфические задачи: например, для поддержания определенного литературного стиля или отыгрыша конкретных персонажей.

Для задач программирования и общей логики базовые модели часто оказываются более стабильными. Fine-tune может быть полезен, если нужно заставить модель говорить на редком языке или придать ей специфический характер, но в задачах на логику он часто вносит нестабильность в ответы.

Сравнение методов квантования

Опыт показал, что даже внутри одного уровня сжатия результаты могут сильно различаться в зависимости от автора весов. Например, алгоритмы Unsloth показали отличные результаты для Qwen3.5, но при переходе к Qwen3.6 магия исчезла: модель стала работать медленнее и потреблять больше памяти, при этом качество не выросло.

Также выяснилось, что использование продвинутых методов сжатия (например, i-matrix) не гарантирует превосходства. Это напоминает «рулетку»: более качественный номинально квант может оказаться хуже стандартного из-за особенностей алгоритма. При жестких ограничениях по памяти выбор метода сжатия становится крайне индивидуальным и требует тщательного сравнения.

Что это значит

При использовании моделей с сильным сжатием (ниже Q4) результат становится непредсказуемым и сильно зависит от конкретного метода квантования и автора весов. Для задач программирования на ограниченном железе лучше выбирать стабильные версии, так как многие специализированные настройки (fine-tune) могут только замедлить работу и увеличить потребление памяти без реального улучшения интеллекта.