FINESSE-Bench: как мы обновили финансовый бенчмарк для LLM
- Мы обновили часть данных и исправили проблемные вопросы в CFA-like Level 1, добавили новый набор данных по техническому анализу — CFTe-like Level 1
- Мы расширили пул моделей, усилили расчёт метрик за счёт бутстрап-оценки и аккуратного агрегирования результатов по группам бенчмарков, а также отдельно посмотрели на различающую способность и насыщение самих наборов вопросов
- FINESSE-Bench позволяет смотреть не только на усреднённый результат, но и на поведение моделей в разных срезах финансового домена
В Лаборатории искусственного интеллекта «Финама» мы изучаем и развиваем применение ИИ в финансовом домене: от бенчмаркинга LLM до прикладных сценариев в трейдинге, аналитике и управлении рисками. В предыдущей статье мы рассказывали о первой версии нашего набора бенчмарков для оценки финансовых знаний моделей. С тех пор проект вырос, получил отдельную страницу FINESSE-Bench и заметно изменился — и по объёму, и по качеству, и по строгости методологии.
Почему нам вообще важна эта тема? Потому что в финансах недостаточно проверить модель на нескольких популярных открытых QA-бенчмарках и сделать вывод, что она «хорошо понимает домен». На практике мы постоянно видим, что сильные результаты на привычных публичных наборах данных далеко не всегда переносятся на более прикладные, экзаменационные или ориентированные на трейдинг задачи.
По этой причине мы продолжаем развивать FINESSE-Bench как набор бенчмарков, который позволяет оценивать не только среднюю точность модели, но и то, как она ведёт себя при росте сложности, как переносит качество между разными типами задач и насколько уверенно работает в специализированных финансовых сценариях.
Что изменилось после первой статьи
После первой статьи проект изменился сразу в нескольких направлениях.
Во-первых, мы перепроверили CFA-like Level 1 и исправили 169 вопросов: одни вопросы оказалась устаревшей, другие содержали неочевидные проблемы в формулировках или разметке. Это не самый заметный апдейт снаружи, но очень важный для качества итоговой оценки.
Во-вторых, мы расширили trading/TA-направление и добавили новый датасет CFTe-like Level 1. Раньше в этой trading области у нас уже были специализированные наборы задач, а теперь появился ещё и более базовый блок, который лучше закрывает фундаментальный уровень знаний по technical analysis.
В-третьих, мы улучшили расчёт метрик. Вместо того чтобы смотреть только на одну точечную accuracy, мы перешли к оценке с бутстрапированием и стали считать доверительные интервалы для результатов. Это сделало сравнение моделей заметно более устойчивым и честным.
В-четвёртых, мы сохранили логику анализа по группам бенчмарков, но сделали ранжирование моделей на уровне групп более аккуратным: теперь для агрегированных оценок используем стратифицированное бутстрапирование с учётом размеров датасетов.
В-пятых, мы отдельно оценили различающую способность и насыщение бенчмарков. Нам было важно понять не только то, как модели отвечают, но и то, насколько сами наборы вопросов хорошо различают сильные и слабые системы.
В-шестых, мы существенно расширили пул моделей: на момент подготовки этой статьи через FINESSE-Bench прошло уже более 60 систем, а для основных сравнительных таблиц мы оставляем 33 модели с полным покрытием по всем одиннадцати бенчмаркам (8 FINESSE + 3 public). Это дало более репрезентативную картину и по лидерам, и по динамике качества на разных типах финансовых задач.
Наконец, проект получил отдельный GitHub-репозиторий, страницу FINESSE-Bench, а вся работа оформилась в полноценную статью на arXiv и карточку на Hugging Face Papers.
FINESSE-Bench сегодня
На текущем этапе FINESSE-Bench — это уже не просто набор отдельных финансовых тестов, а более цельный инструмент для оценки финансовой компетентности LLM.
В актуальной версии он включает восемь специализированных датасетов общим объёмом 3993 вопроса:
- CFA-like Level 1,
- CFA-like Level 2,
- CFA-like Level 3,
- CMT-like Level 2,
- CFTe-like Level 1,
- VLigaBench-ru,
- Trading_TA,
- Trading_derivatives.
Внутри набора сочетаются несколько типов задач: экзаменационные датасеты, прикладные trading/TA-задачи и русскоязычный олимпиадный блок. За счёт этого FINESSE-Bench позволяет смотреть не только на усреднённый результат, но и на поведение моделей в разных срезах финансового домена.
Основные характеристики датасетов FINESSE-Bench
| Датасет | Вопросы | Формат | Средняя длина, символов | Язык |
| CFA-like Level 1 | 1069 | MCQ | 348 | en |
| CFA-like Level 2 | 293 | MCQ | 2965 | en |
| CFA-like Level 3 | 318 | MCQ | 3951 | en |
| CMT-like Level 2 | 251 | MCQ | 297 | en |
| CFTe-like Level 1 | 781 | MCQ | 368 | en |
| VLigaBench-ru | 324 | NAQ/SAQ | 596 | ru |
| Trading_TA | 413 | NAQ/SAQ | 280 | en |
| Trading_derivatives | 544 | NAQ/SAQ | 292 | en |
| Total | 3993 | mixed | 833 | en/ru |
MCQ — вопросы с выбором ответа; NAQ — задачи с числовым ответом; SAQ — задачи с кратким ответом.
Более подробно обо всех изменениях и улучшениях читайте в нашем блоге на «Хабре».
Комментарии