Исследователи предложили новый метод обучения стратегий (policy learning) с использованием RAG, адаптированный для задач причинно-следственного вывода. Подход формулирует выбор действий через фреймворк потенциальных исходов, где векторный поиск используется для подбора релевантных доказательств. Это позволяет моделям точнее оценивать ожидаемые результаты и оптимизировать принятие решений на основе эмпирических данных из векторных баз.

В основе работы лежит концепция интерпретации векторного поиска как механизма сопоставления ближайших соседей для оценки эффектов воздействия. Авторы разработали одношаговый и двухшаговый методы обучения. В двухшаговом сценарии система сначала извлекает контекстные данные об аналогичных действиях, затем генеративная модель оценивает ожидаемые исходы или их контрасты, после чего применяется правило выбора оптимального действия.

Такой подход расширяет возможности RAG, переходя от простого поиска ответов к поддержке принятия решений в условиях неопределенности. Использование векторных пространств для поиска «соседних» сценариев позволяет модели опираться на исторические данные при оценке гипотетических вмешательств, что критически важно для областей, где требуется обоснованный выбор стратегии на основе прошлых результатов.

Ключевые факты

  • Предложены одношаговые и двухшаговые методы интеграции RAG в обучение стратегий.
  • Метод опирается на фреймворк потенциальных исходов (potential outcome framework) для выбора действий.
  • Векторный поиск используется для извлечения доказательств, специфичных для конкретных действий, в пространстве эмбеддингов.
  • Генеративная модель оценивает условные ожидаемые исходы для формирования итогового правила принятия решений.