needhelp
← Back to blog

AIDA: агент, который находит бизнес-инсайты без запроса

by needhelp
ai
agents
business-intelligence
reinforcement-learning
arxiv

Каждое корпоративное хранилище данных — это кладбище необнаруженных инсайтов. Данные есть — 200+ метрик, 100+ измерений, годы истории — но узким местом всегда были люди-аналитики: они могут задать лишь ограниченное количество вопросов, исследовать лишь ограниченное количество измерений, проверить лишь ограниченное количество гипотез.

Новая статья Towards Autonomous Business Intelligence via Data-to-Insight Discovery Agent (arXiv:2605.07202) предлагает AIDA (Autonomous Insight Discovery Agent) — сквозной фреймворк, позволяющий LLM-агенту автономно исследовать корпоративные данные и находить действенные бизнес-инсайты без предварительно написанных запросов.


Ключевая проблема: SQL — узкое место

Спросите любого аналитика данных, что их замедляет — и они скажут: написание SQL. Дело не в том, что SQL сложен — проблема в том, что отображение бизнес-вопроса в корректный SQL — потерянное. «Почему упала конверсия во вторник?» требует джойнов по 5 таблицам, фильтра временного окна, определения когорты и проверки статистической значимости. Каждый шаг — возможность для SQL быть тонно неправильным.

Существующие решения «Text-to-SQL» пытались решить это с помощью LLM, генерирующих SQL из естественного языка. Проблема: они настолько же хороши, насколько хорош заданный вопрос. Если вы не додумались спросить о корреляции погодных условий с процентом брошенных корзин, LLM тоже не спросит.

AIDA переворачивает подход. Вместо ожидания человеческого вопроса агент активно исследует пространство данных в поиске интересных паттернов.


Архитектура: DSL-мост

Ключевое архитектурное новшество AIDA — предметно-ориентированный язык (DSL), находящийся между рассуждением на естественном языке и исполнением SQL:

Намерение на естественном языке
DSL (структурированный, точный)
SQL (исполняемый, корректный)

DSL служит семантически точным промежуточным представлением. Он захватывает бизнес-концепции вроде «когорта», «этап воронки» и «статистическая значимость» в формально определенном словаре. LLM рассуждает на естественном языке, переводит намерение в DSL, а DSL компилируется в гарантированно корректный SQL.

Почему не заставить LLM писать SQL напрямую? Потому что LLM делают тонкие ошибки в генерации SQL — неправильные условия джойна, некорректная логика агрегации, несоответствие таймзон. DSL устраняет эту поверхность ошибок, ограничивая вывод LLM формально верифицированной грамматикой.


Движок исследования: Pareto-управляемое RL

С мостом DSL, обеспечивающим корректность запросов, следующая задача — поиск. Пространство 200 метрик × 100 измерений содержит экспоненциальное количество возможных анализов. Полный перебор невозможен.

AIDA использует обучение с подкреплением (RL), управляемое принципом Парето:

  1. Состояние: текущее понимание агентом пространства данных (граф исследованных измерений и обнаруженных паттернов)
  2. Действие: выбор измерения для углубления, метрики для корреляции или временного окна для расширения
  3. Награда: статистическая значимость и бизнес-релевантность обнаруженных инсайтов (размер эффекта × доверительный интервал × важность домена)
  4. Политика: поиск с Парето-оптимизацией — фокус 80% бюджета исследования на 20% измерений, исторически давших наиболее значимые инсайты

Почему это побеждает workflow-агентов

Большинство современных «агентных BI» инструментов — workflow-основанные: предварительно прописанные последовательности SQL-запросов с LLM-генерированными сводками в конце. Они могут ответить «что произошло», но не «что интересного происходит, о чем мы не додумались спросить».

Аспект Workflow-Based Agent AIDA
Инициация запроса Человек задает вопрос Агент исследует сам
Область Ограничена воображением человека Ограничена бюджетом вычислений
Глубина Линейное погружение (один путь) Многомерное (ветвящееся)
Новизна Подтверждает/опровергает гипотезы Находит незаданные паттерны
Ошибки Запрос упал → правка вручную DSL не скомпилировался → авто-ретрей

Авторы демонстрируют, что AIDA «значительно превосходит workflow-агентов» как в обнаружении инсайтов, так и в восприятии окружения.


Инженерные выводы

DSL — настоящее новшество. Любая команда, строящая LLM-интерфейсы к базам данных, должна рассмотреть формальный промежуточный язык. Это дополнительная работа на старте, но гарантия корректности запросов устраняет целый класс отказов в продакшене.

Бюджет исследования становится новым гиперпараметром. В отличие от традиционных BI-инструментов, где аналитик решает, насколько глубоко копать, AIDA вводит бюджет исследования как настраиваемый параметр.

Ограничения: DSL предметно-зависим по дизайну; дизайн функции награды нетривиален; код пока не опубликован.


Более широкая картина

AIDA представляет категориальный сдвиг в том, как мы думаем об AI для корпоративных данных. Парадигма была: человек задает вопрос → AI отвечает. AIDA предлагает: AI исследует автономно → человек просматривает находки.

Это тот же сдвиг, что произошел в шахматах и открытии лекарств. Когда пространство поиска слишком велико для человеческого познания, роль AI меняется с «ответчика» на «исследователя».

AIDA не заменит аналитиков данных. Но изменит их работу с «написание SQL-запросов» на «проверку и применение AI-обнаруженных паттернов».

Share this page