Исследователи представили систему для автоматизированного принятия торговых решений по биткоину и акциям Tesla, используя глубокое обучение с подкреплением. Модель анализирует исторические рыночные данные в сочетании с новостным сентиментом, формулируя задачу как марковский процесс принятия решений. Сравнительный анализ четырех алгоритмов показал эффективность подхода Alpha-Reward для оптимизации стратегий «лонг», «шорт» или удержания активов.

В рамках задачи FinMMEval 2026 авторы сфокусировались на интеграции текстовых данных из новостных источников с количественными показателями рынка. Использование сентимент-анализа позволяет модели динамически корректировать веса в процессе обучения, что помогает учитывать эмоциональный фон рынка при формировании торговых сигналов. Такой подход минимизирует задержки в реакции на значимые информационные поводы, влияющие на волатильность активов.

Сравнение алгоритмов Policy Gradient (PG), Proximal Policy Optimization (PPO) и других методов глубокого обучения с подкреплением позволило выявить оптимальные конфигурации для работы с финансовыми временными рядами. Результаты демонстрируют, как агент может адаптироваться к изменяющимся рыночным условиям, используя комбинированные сигналы для максимизации доходности при заданных рисках.

Ключевые факты

  • Объекты анализа: криптовалюта Bitcoin (BTC) и акции компании Tesla (TSLA).
  • Методология: формулировка задачи как марковского процесса принятия решений (MDP) с дискретными действиями.
  • Алгоритмы: сравнительное тестирование Policy Gradient (PG), Proximal Policy Optimization (PPO) и других методов глубокого обучения с подкреплением.
  • Контекст: участие в задаче Task 3 лаборатории CLEF 2026 FinMMEval.
  • Цель: автоматизация ежедневных торговых решений на основе анализа новостей и исторических данных.