Новое партнерство GSK и Relation Therapeutics
Компания GSK заключила соглашение с британской биотехнологической фирмой Relation Therapeutics на сумму до 110 миллионов долларов. Цель сотрудничества — расширение совместных разработок в области поиска лекарств с помощью искусственного интеллекта.
В рамках этого соглашения Relation будет создавать масштабные наборы данных, которые показывают, как человеческие клетки реагируют на генетические изменения и воздействие лекарственных препаратов. Эти данные станут основой для обучения ИИ-моделей, включая платформу MORGAN, предназначенную для поиска потенциальных мишеней для лекарств.
Подход Lab-in-the-Loop
Метод работы Relation Therapeutics, называемый Lab-in-the-Loop, объединяет лабораторные эксперименты с компьютерным анализом. Компания проводит исследования тканей, секвенирование и валидацию мишеней, используя машинное обучение для планирования экспериментов и приоритизации целей.
Одним из практических результатов такого подхода стал проект Osteomics. Это специализированный атлас костной ткани, созданный на основе образцов пациентов. Он объединяет данные секвенирования, визуализацию и клинические показатели для изучения причин остеопороза и поиска новых методов его лечения.
Проблемы обучения моделей на открытых данных
Хотя публичные репозитории, такие как Human Cell Atlas, предоставляют миллионы данных о клетках, их использование сопряжено с техническими трудностями. Разные исследования могут использовать разные протоколы и методы обработки, что создает «технический шум» в данных.
Существует также проблема дублирования: одни и те же клетки могут встречаться в разных базах данных. Это создает риск «утечки данных», когда обучающие и тестовые выборки пересекаются, что искажает результаты работы модели. Поэтому создание качественных, уникальных и очищенных наборов данных становится не менее важным, чем архитектура самой нейросети.
Отсутствие прямой зависимости от объема данных
Исследования показывают, что в биологических задачах не всегда работает правило «чем больше данных, тем лучше», которое характерно для языковых моделей (LLM). В ходе экспериментов с 22,2 миллионами клеток было замечено, что производительность моделей может достигать плато, даже если использовать лишь часть доступного массива данных.
Ученые пришли к выводу, что для создания эффективных моделей необходимо соблюдать баланс между мощностью модели, объемом данных и вычислительными ресурсами, а не просто бесконечно увеличивать количество обучающего материала.
Что это значит
На рынке фармацевтики наметился тренд: компании переходят к закупке и созданию специализированных, высококачественных биологических датасетов. Доступ к уникальным данным о конкретных заболеваниях становится главным ограничивающим фактором в разработке ИИ-решений для медицины.
