Исследователи представили систему для автоматизированного принятия торговых решений по биткоину и акциям Tesla, используя глубокое обучение с подкреплением. Модель анализирует исторические рыночные данные в сочетании с новостным сентиментом, формулируя задачу как марковский процесс принятия решений. Сравнительный анализ четырех алгоритмов показал эффективность подхода Alpha-Reward для оптимизации стратегий «лонг», «шорт» или удержания активов.
В рамках задачи FinMMEval 2026 авторы сфокусировались на интеграции текстовых данных из новостных источников с количественными показателями рынка. Использование сентимент-анализа позволяет модели динамически корректировать веса в процессе обучения, что помогает учитывать эмоциональный фон рынка при формировании торговых сигналов. Такой подход минимизирует задержки в реакции на значимые информационные поводы, влияющие на волатильность активов.
Сравнение алгоритмов Policy Gradient (PG), Proximal Policy Optimization (PPO) и других методов глубокого обучения с подкреплением позволило выявить оптимальные конфигурации для работы с финансовыми временными рядами. Результаты демонстрируют, как агент может адаптироваться к изменяющимся рыночным условиям, используя комбинированные сигналы для максимизации доходности при заданных рисках.
Ключевые факты
- Объекты анализа: криптовалюта Bitcoin (BTC) и акции компании Tesla (TSLA).
- Методология: формулировка задачи как марковского процесса принятия решений (MDP) с дискретными действиями.
- Алгоритмы: сравнительное тестирование Policy Gradient (PG), Proximal Policy Optimization (PPO) и других методов глубокого обучения с подкреплением.
- Контекст: участие в задаче Task 3 лаборатории CLEF 2026 FinMMEval.
- Цель: автоматизация ежедневных торговых решений на основе анализа новостей и исторических данных.