• Main Navigation
  • Main Content
  • Sidebar

Электронные библиотеки

  • Главная
  • О нас
    • О журнале
    • Цели и задачи
    • Тематика
    • Главный редактор
    • Редакция
    • Отправка материалов
    • Заявление об открытом доступе
    • Заявление о конфиденциальности
    • Контакты
  • Текущий выпуск
  • Архивы
  • Регистрация
  • Вход
  • Поиск
Издается с 1998 года
ISSN 1562-5419
16+
Language
  • Русский
  • English

Найти

Расширенные фильтры

Результаты поиска

От размеченного корпуса к онтологии: формальная модель многоуровневой семантической разметки фейковых новостей в казахско-русском медиапространстве (KazFakeCorpus / KazFakeOnto)

Анаргуль Аймуратовна Некесова, Елена Анатольевна Сидорова, Жанар Бейбутовна Ламашева, Мадина Аралбаевна Самбетбаева, Айгерим Сембековна Еримбетова, Мира Жорабековна Калдарова, Ақсәуле Абзалқызы Назымхан
2158-2187
Аннотация:

Рассмотрена проблема формального представления знаний о дезинформации в малоресурсном двуязычном медиапространстве. Автоматическое обнаружение фейковых новостей традиционно сводится к бинарной классификации REAL/FAKE, которая не описывает внутреннюю структуру недостоверного сообщения: тип фейкового контента, применённую технику дезинформации, коммуникативное намерение автора, характеристики источника и доказательной базы.


В работе представлены два взаимосвязанных ресурса. Первый – двуязычный корпус KazFakeCorpus: 4276 текстов на казахском и русском языках, сбалансированных по классам внутри каждого языка; класс REAL сформирован из официальных материалов портала Gov.kz, класс FAKE – из их контролируемых трансформаций. Разметку по многоуровневой семантической схеме выполнили в среде Label Studio два независимых эксперта; значения Krippendorff’s Alpha по основным уровням составили 0,79–0,88. Второй ресурс – онтология KazFakeOnto, переводящая схему разметки из плоского реляционного представления в формальную модель на языке OWL 2 DL: 38 классов, 26 объектных свойств, 22 свойства данных, 112 индивидов, 1155 утверждённых триплетов. Одиннадцать определяемых классов не утверждаются вручную, а выводятся ризонером из значений свойств; цепочка свойств связывает материал с аннотатором через объект аннотации. Непротиворечивость проверена с помощью HermiT, запросный слой апробирован на пятнадцати SPARQL- и тринадцати DL-запросах.


Показано, что онтологический слой обеспечивает воспроизводимую спецификацию схемы разметки, автоматический вывод содержательных категорий и единую формальную среду для постановки корпусно-лингвистических вопросов и анализа ошибок моделей машинного обучения. Обсуждаются ограничения подхода и направления масштабирования онтологии на полный корпус и на естественно возникающую дезинформацию.

Ключевые слова: обнаружение фейковых новостей, онтология, OWL 2, SPARQL, логический вывод, двуязычный корпус, казахский язык, многоуровневая аннотация, техники дезинформации, объяснимый NLP, малоресурсные языки, KazFakeCorpus, KazFakeOnto..

Типы эмбеддингов и их применение в интеллектуальной академической генеалогии

Андреас Хачатурович Мариносян
240-261
Аннотация:

Рассмотрена проблема построения интерпретируемых векторных представлений научных текстов для задач интеллектуальной академической генеалогии. Предложена типология эмбеддингов, включающая три класса: статистические, выученные нейросетевые и структурированные символьные. Обоснована необходимость объединения достоинств нейросетевых (высокая семантическая точность) и символьных (интерпретируемость измерений) подходов. Для реализации такого гибридного подхода предложен алгоритм построения выученных символьных эмбеддингов путем регрессионного преобразования вектора внутреннего представления нейросетевой модели в интерпретируемый набор оценок.


Экспериментальная оценка алгоритма проведена на корпусе фрагментов авторефератов диссертаций по педагогическим наукам. Компактный трансформерный энкодер с регрессионной головой обучался воспроизводить тематические оценки, сгенерированные передовой генеративной языковой моделью. Сравнение шести режимов обучения (три типа регрессионной головы и два состояния энкодера) показало, что дообучение верхних слоев энкодера является ключевым фактором повышения качества. По результатам тестирования была выбрана наилучшая конфигурация, которая достигла коэффициента детерминации R² = 0.57 и точности определения трех наиболее релевантных концептов, равной 74%. Результаты подтверждают, что для определенного рода задач, в которых требуется формальное представление выходных данных, возможна аппроксимация поведения генеративной модели компактным энкодером с регрессионной головой при существенно меньших вычислительных затратах. В более широкой перспективе разработка алгоритмов построения выученных символьных эмбеддингов будет способствовать созданию такой модели формальной репрезентации научного знания, в которой конвергенция нейросетевых и символьных методов обеспечит как масштабируемость обработки научных текстов, так и интерпретируемость векторных представлений, кодирующих содержание.

Ключевые слова: эмбеддинги, академическая генеалогия, трансформерный энкодер, регрессионная голова, символьные эмбеддинги, тематический профиль, обработка естественного языка, интерпретируемость, большие языковые модели, наукометрия.

Адаптивная RAG-архитектура для задачи интеллектуального поиска в корпусе документов образовательных учреждений

Анна Дмитриевна Будревич, Михаил Михайлович Абрамский, Искандер Айратович Валишин
1338-1360
Аннотация:

 


Решена задача повышения качества интеллектуального поиска в корпусе документов образовательных учреждений, включающем учебные планы, рабочие программы дисциплин и нормативные акты. Классические архитектуры подхода «генерация, дополненная поиском» (Retrieval-Augmented Generation, RAG), основанные на единственном модуле поиска по обычному тексту, демонстрируют низкую точность работы на документах, включающих таблицы, логические связи между сущностями и строгие формулировки нормативных документов. Предложена адаптивная RAG-архитектура из четырех слоев, каждый из которых учитывает специфику хранения данных в подобных документах. Результаты показали, что учет структуры документов и адаптивная маршрутизация запросов существенно повышают фактическую корректность ответов. Предложенная архитектура может быть использована при проектировании интеллектуальных ассистентов для административных и учебно-методических сервисов высших учебных заведений.

Ключевые слова: RAG, RAG-архитектура, документы образовательных учреждений, интеллектуальный поиск, искусственный интеллект, обработка документов, семантические модели.
1 - 3 из 3 результатов
Информация
  • Для читателей
  • Для авторов
  • Для библиотек
Отправить материал
Текущий выпуск
  • Логотип Atom
  • Логотип RSS2
  • Логотип RSS1

Электронные библиотеки

ISSN 1562-5419

Информация

  • О журнале
  • Цели и задачи
  • Тематика
  • Руководство для авторов
  • Отправка материалов
  • Заявление о конфиденциальности
  • Контакты
  • eLIBRARY.RU
  • dblp computer science bibliography

Отправить статью

Авторам нужно зарегистрироваться в журнале перед отправкой материалов, или, если вы уже зарегистрированы, можно просто войти со своей учетной записью и начать процесс отправки, состоящий из пяти шагов.

Отправить материал
Больше информации об этой издательской системе, платформе и рабочем процессе от OJS/PKP.

© 2015-2026 Казанский (Приволжский) федеральный университет; Институт развития информационного общества