Аннотация:
Представлен RusHallu-RAG – первый комплексный бенчмарк для обнаружения галлюцинаций в русскоязычных RAG-системах. Набор данных из 1000 пар «запрос – ответ» охватывает области общего знания и научных текстов с контролируемой балансировкой релевантности контекста. Предложена детализированная таксономия из шести типов галлюцинаций, использованная для разметки на уровне всего ответа и отдельных его фрагментов с привлечением экспертов и больших языковых моделей.
Для обучения детектора собран сбалансированный тренировочный датасет объемом 3000 примеров с применением синтетических методов генерации. На его основе методом SFT обучен детектор на базе YandexGPT-5-Lite-8B. Проведена оценка 15 моделей с открытыми и закрытыми весами, а также обученного детектора. Результаты показали, что число параметров не гарантирует высокой производительности: модели среднего размера (20–33 млрд) иногда превосходят более крупные. Обученный детектор достигает средней точности 63.7%, занимая второе место после закрытой Gemini-2.5-Pro, с приростом 47.2 п.п. относительно исходной модели. Разрыв между закрытыми и открытыми моделями сокращается с 20–35 до 8.4 п.п., что подтверждает эффективность подхода. Бенчмарк, код и обученная модель опубликованы в открытом доступе.