От инструментов к агентам: новый уровень управления
Использование ИИ в работе с данными переходит от вспомогательных функций — написания запросов или подготовки документов — к полноценной автоматизации повторяющихся задач. Теперь нейросети подключают к корпоративным системам и инструментам разработки в виде агентов. Это требует внедрения концепции Data Governance 2.0, которая дополняет классическое управление данными (владельцами, качеством и доступом) управлением моделями, промптами, цепочками вызовов, а также контролем стоимости и рисков ИИ.
Для обеспечения безопасности и эффективности компании внедряют формальные манифесты. В них фиксируются источники данных, права доступа агента, условия его остановки и роль человека в контуре управления. Это позволяет ограничить автономность системы: например, агент может искать информацию в каталоге, но не имеет права самостоятельно изменять исходные данные или выдавать права доступа.
Оценка качества и автоматизация аналитики
При работе с ИИ важно оценивать не только финальный ответ, но и промежуточные этапы: точность поиска релевантных фрагментов (precision), долю найденных документов (hit rate) и наличие корректных ссылок на источники (citation rate). Такой подход позволяет понять, возникла ошибка в самой модели или в процессе поиска данных.
В аналитике данных внедрение специализированных «скиллов» (наборов инструкций) позволяет автоматизировать рутину. Например, создание бизнес-требований на основе задач из Jira сократилось с 8 часов до получаса. При этом роль специалиста смещается от подготовки типовых артефактов к проектированию, проверке результатов и принятию сложных решений.
Вызовы дата-инжиниринга и Text2SQL
В дата-инжиниринге автоматизация кода не гарантирует эффективности. Пример из практики MWS показал, что сгенерированная ИИ программа может работать 30 часов там, где оптимизированный код справляется за 20 минут. Поэтому фокус смещается на контроль производительности и нагрузки на инфраструктуру. В перспективе ожидается появление Spark-оптимайзеров, которые будут самостоятельно предлагать изменения в коде на основе логов выполнения.
Другой сложной задачей остается генерация SQL-запросов (Text2SQL) в условиях огромных корпоративных хранилищ. Чтобы нейросеть не путалась в множестве похожих таблиц, предлагается использовать онтологию — разделение на смысловой уровень (бизнес-сущности) и физический (реализация в полях). Использование машиночитаемых манифестов в формате YAML позволяет связать эти уровни, что на пилотных проектах обеспечило точность в 90%.
