Новое партнерство GSK и Relation Therapeutics

Компания GSK заключила соглашение с британской биотехнологической фирмой Relation Therapeutics на сумму до 110 миллионов долларов. Цель сотрудничества — расширение совместных разработок в области поиска лекарств с помощью искусственного интеллекта.

В рамках этого соглашения Relation будет создавать масштабные наборы данных, которые показывают, как человеческие клетки реагируют на генетические изменения и воздействие лекарственных препаратов. Эти данные станут основой для обучения ИИ-моделей, включая платформу MORGAN, предназначенную для поиска потенциальных мишеней для лекарств.

Подход Lab-in-the-Loop

Метод работы Relation Therapeutics, называемый Lab-in-the-Loop, объединяет лабораторные эксперименты с компьютерным анализом. Компания проводит исследования тканей, секвенирование и валидацию мишеней, используя машинное обучение для планирования экспериментов и приоритизации целей.

Одним из практических результатов такого подхода стал проект Osteomics. Это специализированный атлас костной ткани, созданный на основе образцов пациентов. Он объединяет данные секвенирования, визуализацию и клинические показатели для изучения причин остеопороза и поиска новых методов его лечения.

Проблемы обучения моделей на открытых данных

Хотя публичные репозитории, такие как Human Cell Atlas, предоставляют миллионы данных о клетках, их использование сопряжено с техническими трудностями. Разные исследования могут использовать разные протоколы и методы обработки, что создает «технический шум» в данных.

Существует также проблема дублирования: одни и те же клетки могут встречаться в разных базах данных. Это создает риск «утечки данных», когда обучающие и тестовые выборки пересекаются, что искажает результаты работы модели. Поэтому создание качественных, уникальных и очищенных наборов данных становится не менее важным, чем архитектура самой нейросети.

Отсутствие прямой зависимости от объема данных

Исследования показывают, что в биологических задачах не всегда работает правило «чем больше данных, тем лучше», которое характерно для языковых моделей (LLM). В ходе экспериментов с 22,2 миллионами клеток было замечено, что производительность моделей может достигать плато, даже если использовать лишь часть доступного массива данных.

Ученые пришли к выводу, что для создания эффективных моделей необходимо соблюдать баланс между мощностью модели, объемом данных и вычислительными ресурсами, а не просто бесконечно увеличивать количество обучающего материала.

Что это значит

На рынке фармацевтики наметился тренд: компании переходят к закупке и созданию специализированных, высококачественных биологических датасетов. Доступ к уникальным данным о конкретных заболеваниях становится главным ограничивающим фактором в разработке ИИ-решений для медицины.