Новый подход к анализу изображений
Разработчики из Paige и Microsoft создали модель PRISM2, которая способна интерпретировать целые патологические слайды. В отличие от традиционных систем, которые просто классифицируют пиксели, PRISM2 генерирует текстовые ответы на диагностические вопросы. Для этого модель обучалась одновременно на изображениях тканей и клинических диалогах, извлеченных из патологоанатомических отчетов.
В процессе обучения использовались 2,3 миллиона целых слайдов. Чтобы превратить медицинские отчеты в обучающие данные, компания использовала GPT-4o, которая преобразовала 685 507 отчетов из центра Memorial Sloan Kettering в пары «вопрос-ответ».
Двухэтапное обучение модели
Архитектура PRISM2 состоит из двух фаз. На первом этапе обучается энкодер — специальный компонент, который собирает признаки из отдельных фрагментов (тайлов) изображения в единый вектор, соответствующий языку медицинских отчетов. На втором этапе энкодер фиксируется, а основная работа переходит к языковой модели, которая учится понимать профессиональную терминологию патологов.
Для обучения энкодера применяются два метода одновременно. Один метод заставляет модель сопоставлять изображения с текстом, а другой — учит модель генерировать текст напрямую. Это позволяет избежать проблем, когда модель хорошо находит похожие изображения, но плохо генерирует текст, или наоборот.
Точность диагностики и сравнение с конкурентами
PRISM2 демонстрирует результаты, сопоставимые или превосходящие существующие коммерческие продукты для диагностики рака молочной железы и простаты. В задачах классификации лимфатических узлов молочной железы модель показала результат выше, чем специализированное решение от Paige. В тестах на обнаружение различных видов рака модель также показала высокую эффективность, уступая в точности только при работе с редкими типами тканей из-за нехватки обучающих примеров.
Кроме того, PRISM2 успешно справляется с задачами прогнозирования выживаемости пациентов. При сравнении с моделью, обученной специально для прогнозирования выживаемости при раке толстой кишки, PRISM2 показала более высокие результаты, используя при этом базовые возможности своего энкодера.
Ограничения и особенности работы
Несмотря на высокие показатели, у модели есть технические особенности. PRISM2 не учитывает взаимное расположение структур на слайде, так как в её архитектуре нет механизма пространственного мышления. Также обучение проводилось на изображениях с фиксированным разрешением, что оставляет открытым вопрос о работе модели при изменении масштаба увеличения.
При проверке качества врачами-патологами было выявлено, что ошибки модели чаще всего связаны с «галлюцинациями» или пропуском информации, а не с фактическим противоречием исходному изображению. Самый высокий процент ошибок наблюдался при ответах на простые вопросы, требующие подтверждения «да/нет».
Что это значит
PRISM2 доказывает, что использование клинических диалогов в качестве обучающих данных значительно повышает точность диагностики и позволяет модели решать задачи, выходящие за рамки простой классификации изображений.
