Аннотация:
Рассмотрена проблема формального представления знаний о дезинформации в малоресурсном двуязычном медиапространстве. Автоматическое обнаружение фейковых новостей традиционно сводится к бинарной классификации REAL/FAKE, которая не описывает внутреннюю структуру недостоверного сообщения: тип фейкового контента, применённую технику дезинформации, коммуникативное намерение автора, характеристики источника и доказательной базы.
В работе представлены два взаимосвязанных ресурса. Первый – двуязычный корпус KazFakeCorpus: 4276 текстов на казахском и русском языках, сбалансированных по классам внутри каждого языка; класс REAL сформирован из официальных материалов портала Gov.kz, класс FAKE – из их контролируемых трансформаций. Разметку по многоуровневой семантической схеме выполнили в среде Label Studio два независимых эксперта; значения Krippendorff’s Alpha по основным уровням составили 0,79–0,88. Второй ресурс – онтология KazFakeOnto, переводящая схему разметки из плоского реляционного представления в формальную модель на языке OWL 2 DL: 38 классов, 26 объектных свойств, 22 свойства данных, 112 индивидов, 1155 утверждённых триплетов. Одиннадцать определяемых классов не утверждаются вручную, а выводятся ризонером из значений свойств; цепочка свойств связывает материал с аннотатором через объект аннотации. Непротиворечивость проверена с помощью HermiT, запросный слой апробирован на пятнадцати SPARQL- и тринадцати DL-запросах.
Показано, что онтологический слой обеспечивает воспроизводимую спецификацию схемы разметки, автоматический вывод содержательных категорий и единую формальную среду для постановки корпусно-лингвистических вопросов и анализа ошибок моделей машинного обучения. Обсуждаются ограничения подхода и направления масштабирования онтологии на полный корпус и на естественно возникающую дезинформацию.