Исследователи протестировали возможности китайской языковой модели Kimi K3 в решении задач по заполнению американских налоговых деклараций. Использование специализированного бенчмарка TaxCalcBench позволило оценить точность расчетов и следование сложным юридическим инструкциям. Результаты показывают, насколько современные LLM справляются с узкоспециализированными финансовыми вычислениями, требующими строгого соблюдения актуального налогового законодательства США.
Бенчмарк TaxCalcBench представляет собой набор данных и инструментов, предназначенных для проверки способности моделей интерпретировать налоговые формы и выполнять корректные математические операции в соответствии с правилами IRS. В ходе эксперимента модель Kimi K3 столкнулась с задачами, требующими не только понимания контекста, но и точного применения налоговых ставок, вычетов и специфических формул, заложенных в американскую систему отчетности.
Подобные исследования критически важны для понимания применимости генеративного ИИ в финтех-секторе. Автоматизация налоговой отчетности требует высокой степени надежности, так как ошибки в расчетах могут привести к серьезным финансовым и юридическим последствиям для пользователей. Тестирование моделей на таких наборах данных помогает выявить «галлюцинации» и пробелы в логических цепочках, которые возникают при работе с формализованными документами.
Ключевые факты
- TaxCalcBench — специализированный бенчмарк для оценки точности ИИ при заполнении налоговых деклараций США.
- Kimi K3 — одна из ведущих китайских LLM, участвовавшая в тестировании на соответствие американским налоговым стандартам.
- Основная цель исследования — проверка способности моделей корректно применять налоговые вычеты и правила IRS в автоматизированном режиме.
- Бенчмарк фокусируется на выявлении ошибок в логике расчетов, которые критичны для финансовой отчетности.