Эффективный вес комитета

Использование нескольких LLM в качестве судей для оценки качества ответов (например, на предмет галлюцинаций) кажется логичным способом повысить точность за счет голосования. Однако исследование на бенчмарке RAGTruth показало, что разнообразие провайдеров не обеспечивает независимость ошибок. Комитет из шести моделей, представляющих четыре лаборатории из трёх стран, по своей информационной ценности (n_eff) эквивалентен всего 1,9 независимым судьям.

Средняя попарная корреляция ошибок моделей составляет ρ̄ ≈ 0,42. Это означает, что ошибки судей сильно скоррелированы: они склонны совершать одни и те же промахи на сложных примерах, что нивелирует преимущества голосования. Вместо шести независимых источников информации система получает лишь два.

Связь между моделями и провайдерами

Анализ матрицы корреляций показал, что принадлежность к разным компаниям не является залогом независимости. Самые тесно связанные пары моделей оказались межлабораторными и межстрановыми (например, DeepSeek и Amazon Nova-Pro с корреляцией 0,66). В то же время две модели из одного семейства Qwen-2.5 показали минимальную корреляцию ошибок (0,11), что опровергает теорию о том, что общие обучающие корпуса — единственный источник общих ошибок.

При этом наиболее независимой в ростерe оказалась самая слабая модель — Qwen-2.5–7B. Её удаление из комитета не делает систему более надежной, а лишь снижает её общую эффективность, так как остальные сильные модели образуют тесно связанный блок с высокой корреляцией ошибок (ρ̄ ≈ 0,63).

Методологические ловушки

Исследование также выявило риск при выборе формата взаимодействия с моделью. Попытка оптимизировать парсинг ответов через формат «сначала вердикт, без рассуждений» (verdict-first) приводит к обвалу точности до случайных 50% на сложных задачах. Это происходит из-за того, что модель вынуждена угадывать ответ, лишаясь возможности использовать цепочку рассуждений (Chain of Thought).

Таким образом, при оценке эффективности судей важно учитывать не только количество моделей, но и разнообразие их режимов отказа. Для получения достоверных результатов необходимо использовать формат, допускающий рассуждения перед вынесением вердикта.