Фармацевтика ускорилась: как AWS сократила циклы разработки на 87%

Развёртывание GraphRAG на базе AWS позволило сократить циклы исследований и разработок лекарственных препаратов на 87 процентов. Исторически начальные этапы сбора и первичного анализа данных занимали более шести месяцев на каждую итерацию, при этом процент успешных результатов составлял всего пять. Ключевые наборы данных — от клинических метрик до внутренних инженерных и лабораторных записей — были изолированы в разных хранилищах, что фактически блокировало возможность для специалистов по данным обнаруживать скрытые корреляции. Уход сотрудников из проектов означал утрату критически важного контекста и остановку активных исследований.

AWS выстроила решение, объединяющее разрозненные системы: графовые базы данных интегрируются с технологиями обработки естественного языка. В основе архитектуры лежит фреймворк GraphRAG, использующий Amazon Neptune Analytics и Amazon Bedrock для превращения разрозненных точек данных в поисковую сеть. Пользователи могут отправлять стандартные запросы на естественном языке и получать ответы, привязанные к проверенным доменным публикациям и внутренним наборам данных.

Архитектура GraphRAG: от неструктурированных данных к графу знаний

Система объединяет изолированные проприетарные наборы данных с неструктурированными открытыми репозиториями, включая базу PubMed. Amazon Comprehend Medical сканирует текст и извлекает стандартные медицинские коды. Amazon Bedrock, работающий на модели Anthropic Claude 4.5 Sonnet, суммирует содержание документов и определяет тематическую релевантность. Функции AWS Lambda и массовая загрузка через Amazon S3 направляют обработанные элементы в Amazon Neptune Analytics.

Полученный граф знаний структурирует данные в отдельные узлы, представляющие ключевые сущности: доменно-специфические классы, авторов, исходные журналы и фрагменты текста. Рёбра графа определяют связи между узлами, отображая иерархические классификации и ассоциации сущностей. Такое структурированное представление обеспечивает детерминистическую основу, необходимую для точного извлечения информации. Схема базы данных задаёт строгие границы процесса обнаружения RAG: узлы структурированы для фиксации конкретных условий и их иерархического отображения на установленные онтологии, а узлы авторов и журналов обеспечивают прослеживаемость опубликованных исследований.

Длинные документы разбиваются на усвояемые текстовые сегменты с помощью стратегий чанкинга Amazon Bedrock Knowledge Base, а специализированные узлы классификации привязывают неструктурированные текстовые данные к стандартизированным диагностическим метрикам. Компонент EntityLinker выравнивает термины естественного языка из пользовательских запросов со структурированной схемой данных. Этот процесс нечёткого сопоставления обрабатывает присущий сложным корпоративным наборам данных шум и разнообразную терминологию, гарантируя, что пользователи получают правильные узлы даже при использовании неточного языка.

Стоимость и облачная инфраструктура

Эксплуатация данной графовой архитектуры требует конкретных облачных ресурсов. Стандартный граф Amazon Neptune Analytics с 16 выделенными единицами памяти обходится в 0,48 доллара в час. Среды разработки, такие как ноты Amazon SageMaker Jupyter на экземплярах t3.medium, добавляют базовые расходы на вычисления и хранение. Организации также должны учитывать расходы на динамическое потребление токенов, генерируемых моделью Amazon Bedrock Claude 4.5 Sonnet в процессе обработки запросов и формирования аннотаций.

Модульность и вызовы нормализации данных

GraphRAG-набор инструментов выступает в качестве исполнительного слоя между пользовательским интерфейсом и базой данных. Специальный компонент Knowledge Graph Linker обрабатывает входящие запросы на естественном языке, извлекает релевантные сущности с помощью индексирования нечётких строк и сопоставляет их с существующими узлами графа. Система обходит сетевые пути для генерации правдоподобных связей перед формированием ответа через языковую модель, размещённую на Bedrock.

Единообразие изолированных проприетарных наборов данных с неструктурированными открытыми репозиториями по-прежнему создаёт значительные проблемы нормализации, требующие строгого управления схемами для предотвращения неточного картографирования связей и снижения риска галлюцинаций. Компании могут подключать собственные графы знаний. Архитектура разделяет три ключевые функции: инициализацию языковой модели, взаимодействие с графом и связывание сущностей. Благодаря модульности команды могут заменять языковую модель или корректировать структуру графа без необходимости перестраивать всё приложение целиком.