AI-агенты для данных: как закрыть разрыв в 10 пунктов
Исследователи из Пекинского университета, Zhongguancun Academy и Института передовых алгоритмов Шанхая опубликовали результаты тестирования фреймворка DataFlow-Harness — инструмента, который направляет AI-агента на построение структурированных пайплайнов обработки данных вместо генерации разовых скриптов.
Центральная проблема, которую решает разработка, хорошо знакома инженерным командам. Когда AI-агент получает задачу написать отдельный Python-скрипт, он справляется быстро и точно. Но когда ту же модель просят выстроить производственный пайплайн — с поглощением тысяч документов, разбивкой текста на фрагменты, оценкой качества и фильтрацией шума — результатом становится набор одноразовых скриптов, не связанных с управляемыми рабочими процессами, которые использует команда MLOps.
Что такое NL2Pipeline-разрыв и почему он важен для бизнеса
Авторы DataFlow-Harness дали этой проблеме название — «NL2Pipeline-разрыв»: расстояние между тем, как пользователь описывает задачу на естественном языке, и тем, что требует производственная среда — структурированные, постоянные, проверяемые активы пайплайна.
Исследователи количественно измерили этот разрыв. Когда стандартный Claude Code генерировал произвольные скрипты с доступом к кодовой базе платформы, он достигал успеха в 94,2% случаев. Когда ту же модель ограничивали только встроенными блоками платформы для построения нативного рабочего графа — успех падал до 83,3%. Разрыв в 10,9 процентного пункта означает, что каждый девятый пайплайн, созданный без специального инструментария, оказывается нерабочим именно потому, что AI галлюцинирует зависимости, ссылается на недоступные операторы или игнорирует реальную схему данных.
Для бизнеса это не абстрактная инженерная проблема. Одноразовые скрипты накапливают технический долг: их сложно проверить на соответствие требованиям безопасности, почти невозможно передать другому инженеру без потери контекста, и они не интегрируются в стандартные инструменты управления рабочими процессами.
Как работает DataFlow-Harness и какие результаты он показал
Фреймворк организует синтез рабочего процесса вокруг четырёх компонентов. Data Pipeline Backend хранит пайплайн в виде направленного ациклического графа (DAG) — структурированной карты, содержащей источники данных, настроенные модули обработки и зависимости выполнения. AI-агент взаимодействует с этим бэкендом через типизированные изменения — добавить оператор, соединить узлы — а не генерирует произвольный код.
DataFlow-Skills — это markdown-файлы, которые внедряют узкоспециализированные знания в контекстное окно модели: правила совместимости операторов, процедуры вывода схем, паттерны сборки. Вместо того чтобы AI угадывал, как соединить компоненты, Skills задают ему конкретные правила.
Слой MCP Tools предоставляет агенту доступ к реестру операторов и текущему состоянию рабочего процесса, валидируя каждое предложенное изменение до его применения. DataFlow-WebUI обеспечивает два интерфейса: разговорный — для описания задач на естественном языке, и визуальный редактор DAG — для прямого просмотра и ручной корректировки предложений агента.
На бенчмарке из 12 задач по шести промышленным сценариям обработки данных — включая генерацию вопросов и ответов, управление ревью и нормализацию схем — DataFlow-Harness достиг 93,3% сквозного прохождения. Это на 10,0 процентного пункта выше, чем у подхода MCP без Skills, и всего на 0,9 пункта ниже, чем у агента с полным доступом к кодовой базе.
Не менее важны показатели стоимости и скорости. По сравнению со стандартным Claude Code фреймворк снизил затраты на API на 72,5% и сократил задержку ответа на 49,9%. По сравнению с Context-Aware CC — снижение стоимости на 42,8% и ускорение на 17,6%.
На задаче извлечения вопросов и ответов из учебников — требующей разбора PDF, распознавания текста, извлечения иллюстраций и мультимодального понимания — DataFlow-Harness достиг точности 97,2% при покрытии 87,3%, превзойдя все базовые подходы. В задаче очистки математических данных пайплайн, построенный DataFlow-Harness, подготовил данные, на которых обученная модель показала более высокую среднюю точность на бенчмарках AIME24 и AIME25, чем данные из пайплайна стандартного Claude Code.
Фреймворк распространяется под лицензией Apache 2.0, исходный код доступен в репозитории GitHub.
Вместе с тем авторы фреймворка честно обозначают его ограничения. Текущая реализация нативна для платформы DataFlow и не является готовым плагином для Airflow, Prefect или Spark. Чтобы использовать эти системы как исполнительный бэкенд, командам потребуется написать адаптер. Кроме того, организации должны инвестировать в поддержание реестра операторов, определение схем и кодирование повторяющихся процедур в виде Skills.
- Фреймворк не рекомендуется для небольших разовых трансформаций, где достаточно простого скрипта.
- Он не подходит для устаревших сред, которые не могут предоставить надёжные метаданные.
- Платформа предотвращает некорректные соединения через валидацию структуры, но не заменяет политику соответствия требованиям, контроль доступа и журналирование аудита.
Первый автор статьи Runming He сформулировал цель фреймворка так: агенты выполняют повторяющееся строительство в явных границах, тогда как инженеры сохраняют ответственность за семантику, политики и решения, требующие профессиональной подотчётности.
Это разграничение важно для любой компании, которая рассматривает AI-агентов как замену инженерной команды: DataFlow-Harness не автоматизирует принятие решений — он автоматизирует их исполнение внутри заранее определённых правил.
Практический вывод: если ваша команда использует AI-агентов для построения пайплайнов обработки данных и сталкивается с трудностями при аудите, передаче или интеграции результатов в производственную среду, оцените фреймворки, которые направляют агента через структурированные изменения с валидацией — это снижает технический долг и делает AI-генерируемые рабочие процессы проверяемыми без существенного снижения точности.