Отчёт OpenAI: агенты в научных вычислениях

OpenAI опубликовала новый полевой отчёт, в котором прослеживается применение кодогенерирующих агентов в восьми проектах научных вычислений. В пяти случаях использовался исключительно Codex, ещё в трёх — комбинация Codex и Anthropic Claude Code. Стоит отметить, что это опрос, проведённый вендором собственного продукта на основе кейсов, написанных самими участниками проектов. Однако это не умаляет ценности выявленной закономерности.

Задачи, которые агенты решали в этих проектах, разделились на три категории: упаковка и наведение порядка в системах сборки, оптимизация производительности существующего кода, а также полное языковое или бэкенд-переносное переписывание. Проекты охватывают геномику, иммунологию, статистику и секвенирование РНК.

Проблема технического долга в научном ПО

Исследовательское программное обеспечение страдает от хронической проблемы сопровождения. Инструменты, созданные для поддержки одной публикации небольшими академическими командами без выделенных инженеров, неизбежно накапливают технический долг, на погашение которого у них нет ни бюджета, ни мандата. OpenAI утверждает, что агенты способны помочь с этим долгом — и восемь приведённых в отчёте проектов это подтверждают.

Кейсы: геномика, иммунология и статистика

Библиотека cyvcf2 для чтения геномных файлов вариантов получила новую унифицированную систему сборки и упаковки вместо устаревшей. Соавтор проекта Брент Педерсен подчеркнул: «Быстро работать с агентами — одно, но в науке по-прежнему нужны экспертное руководство, понимание, вкус и внимание к деталям».

HI.SIM — генератор симуляций чтений ДНК-секвенирования — прошёл два в основном автономных цикла оптимизации на GPT-5.2 и GPT-5.6. По словам соавтора Эндрю Хо, это сократило время выполнения на 31% в репрезентативной тестовой выборке без изменения результата. Хо, который сам не является специалистом по геномике и не программирует на C, назвал результат «чистой магией» с точки зрения конечного пользователя — ранее он тратил время на баги производительности и проблемы упаковки, которые мог распознать, но не мог исправить самостоятельно.

Hifiasm, инструмент для сборки геномов на данных PacBio HiFi, получил сокращение времени выполнения на 25% в целевой задаче оптимизации и примерно на 15% на отдельных данных секвенирования человека. Соавтор Суяш Шрингарпур отметил, что агент самостоятельно выстраивал бенчмарк-инфраструктуру и предлагал кандидаты, однако предоставление результатов профилирования и удержание модели от повторения ошибочных режимов оставались задачами, которые может решить только человек.

MHCflurry, предсказывающий фрагменты белков, представляемые Т-клеткам, перенёс бэкенд с TensorFlow/Keras на PyTorch, сохранив совместимость с ранее выпущенными весами модели. Соавторы Алекс Рубинштейн, Сергей Фельдман и Тимоти О'Доннелл охарактеризовали это как «незатейливый, трудоёмкий уход», который позволяет проектам открытой науки жить, а не приходить в упадок.

bayesm-rs — порт статистических моделей из пакета bayesm языка R на Rust — воспроизвёл оценки оригинального ПО в заданных допусках и работал в 2,3–2,7 раза быстрее на одном потоке процессора, а на восьми потоках — в 4,4–9,5 раза быстрее. По словам соавторов Эндрю Бай и Эндрю Хо, агенты быстро и корректно справлялись с тем, что можно проверить по прямой ссылке, тогда как расширения, требующие статистического суждения, не зафиксированного в оригинальном коде, нуждались в непосредственной человеческой валидации.

Rust-портирование и пересборка инструментов

Три проекта — rustar-aligner, svb и kuva — связаны со сборками на Rust с помощью кодогенерирующих агентов, включая полное воссоздание STAR, широко используемого инструмента выравнивания РНК-последовательностей, утратившего активное сопровождение. Соавтор Джеймс М. Фергюсон заявил, что агенты изменили саму картину возможного: переписывать 20 000-строчный выравниватель вручную — неразумное использование времени, но с агентом это становится неделями направляемой работы. При этом верификация — отдельная история: модель может утверждать, что график выглядит корректно, но проверка более 900 из них перед выпуском по-прежнему ложится на человека.

RustQC объединил 15 отдельных инструментов контроля качества секвенирования РНК в одну программу, что, по словам соавтора Фила Ивелса, сократило время выполнения в 60 раз, а ввод-вывод на диск — в 25 раз. Спутниковые пересборки FastQC-Rust и Trim Galore работают в 7 и 3 раза быстрее соответственно, сохраняя поведение оригинальных инструментов. Ивелс также указал на обратную сторону: дешёвые пересборки несут собственные риски, поскольку инструменты, расходящиеся в поведении, фрагментируют сообщество и делают результаты разных лабораторий несопоставимыми во времени. «Технология — это лёгкая часть, — сказал он. — Сопровождение остаётся открытым вопросом».

HelixForge — GPU-нативная пересборка инструмента моделирования мутаций BAMSurgeon — сократила время выполнения примерно в 60 раз на бенчмарке с реальными данными человека, по словам соавторов Мамада Ахангари, Варуна Гояла и Хассана Масуди. Также отмечено, что инструмент выдаёт частоты мутаций ближе к запрошенным целевым значениям и устраняет ряд ошибок, порождавших артефакты в оригинале.

Итоги и перспективы

Общая картина, которую рисуют все описания проектов, сводится к тому, что агенты компетентно справляются с чётко ограниченными запросами на реализацию. При этом ключевую роль продолжают играть люди: от постановки задач и профилирования до финальной верификации результатов. OpenAI подчёркивает, что агенты не заменяют исследователей, а снимают с них рутинную инженерную нагрузку, позволяя сосредоточиться на науке.