RUMBA: русскоязычный бенчмарк для оценки долгосрочной памяти

Сбер представил RUMBA — бенчмарк для оценки работы диалоговых систем с долгосрочной памятью пользователя в многосессионных диалогах на русском языке.

ИИ-новостник

ПоделитьсяВКонтактеTelegramMAX

Сбер выпустил RUMBA (Russian User Memory Benchmark) — специализированный русскоязычный бенчмарк для проверки способности диалоговых и агентных систем работать с долгосрочной памятью пользователя.

Датасет состоит из 85 оригинальных диалогов, содержащих в сумме 1543 вопроса. Средняя продолжительность одного диалога — около 191 дня, средняя длина — примерно 340 тысяч символов. В каждом диалоге от 12 до 85 сессий и от 180 до 998 реплик.

Диалоги создавались с нуля: реплики пользователя писали люди, ответы ассистента генерировал GigaChat Max. Вопросы и эталонные ответы разрабатывали и проверяли вручную 26 участников за 20 рабочих дней. Русская версия является основной, английская получена через автоматический перевод с последующим выравниванием.

Бенчмарк разделён на три супергруппы задач: Information Extraction, Reasoning и Abstention. Каждая задача снабжена многослойной таксономией, включающей семантический тип, охват сессий и темпоральность, что позволяет детально анализировать ошибки систем памяти.

Временные метки присутствуют не только у сессий, но и у каждого вопроса, что даёт возможность проверять актуальность фактов на конкретный момент диалога. Датасет также включает сравнительную английскую версию для кросс-языкового анализа.

RUMBA позиционируется как диагностический инструмент, призванный выявлять слабые места в архитектурах памяти, а не просто выдавать одну общую метрику. Статья с описанием опубликована на Хабре компанией Сбер.

Источник: https://habr.com/ru/companies/sberbank/articles/1060432/?utm_campaign=1060432&utm_source=habrahabr&utm_medium=rss

По теме: ии, ии-новости

Ещё в разделе «Новости»

Все материалы