• Main Navigation
  • Main Content
  • Sidebar

Электронные библиотеки

  • Главная
  • О нас
    • О журнале
    • Цели и задачи
    • Тематика
    • Главный редактор
    • Редакция
    • Отправка материалов
    • Заявление об открытом доступе
    • Заявление о конфиденциальности
    • Контакты
  • Текущий выпуск
  • Архивы
  • Регистрация
  • Вход
  • Поиск
Издается с 1998 года
ISSN 1562-5419
16+
Language
  • Русский
  • English

Найти

Расширенные фильтры

Результаты поиска

Модель лингвистического графа знаний «Turklang» как база для создания инструментов обучения тюркским языкам

Айрат Рафизович Гатиатуллин, Николай Аркадиевич Прокопьев
251-265
Аннотация:

Описаны элементы модели лингвистического графа знаний «Turklang», разработанного в Институте прикладной семиотики АН РТ и используемого в качестве базы для создания ряда лингвистических ресурсов и инструментов: портал «Тюркская морфема», электронный корпус татарского языка «Туган Тел», лингвистические процессоры.


Для создания образовательной среды необходимы предметно-ориентированные графы знаний, для получения которых не применимы методы создания общих и открытых графов. В работе описаны лингвистические графы знаний, которые отображают, с одной стороны, потенциальные возможности тюркских языков, с другой стороны, примеры реального использования в текстах. Особенность этих графов знаний заключается в том, что они содержат лингвистические единицы разных языковых уровней, а также семантические универсалии, соответствующие значениям этих лингвистических единиц, которые встроены в единую модель лингвистического графа знаний. Структура такого графа знаний позволяет формировать учебные курсы, строить индивидуальную образовательную траекторию, а также создавать задания и средства автоматизированной проверки в рамках контроля знаний при обучении тюркским языкам. Это дает возможность разрабатывать впоследствии, на основе этих графов, программы обучения с учетом структурно-функциональных особенностей тюркских языков, а также способствует реализации индивидуальных целей обучающихся.

Ключевые слова: граф знаний, база знаний, лингвистический ресурс, лингвистическая единица, малоресурсные языки, тюркские языки, веб-портал, электронное образование, контроль знаний, автоматизированная оценка ответа.

Семантический анализ документов в системе управления цифровыми научными коллекциями

Шамиль Махмутович Хайдаров
61-85
Аннотация: Предложены методы семантического анализа документов в системе управления цифровыми научными коллекциями, в том числе электронными научными журналами. Рассмотрены методы обработки документов, содержащих математические формулы, а также способы конвертации этих документов из формата OpenXML в формат TeX. Разработан алгоритм поиска по формулам в коллекциях математических документов, хранящихся в формате OpenXML. Алгоритм реализован в виде онлайн-сервиса на платформе science.tatarstan.
Ключевые слова: семантический анализ, издательские системы.

Цифровая инфраструктура электронного научного журнала: автоматизация редакционно-издательских процессов и система сервисов

Миляуша Салахутдиновна Галявиева, Александр Михайлович Елизаров, Евгений Константинович Липачёв
408-465
Аннотация:

Описаны современные модели и средства публикации и распространения научных знаний. Охарактеризованы современные информационные системы управления научными изданиями и сервисы, определяющие их функциональность.

Введено понятие цифровой инфраструктуры электронного научного журнала как комплекса, который объединяет программную платформу, реализующую основные рабочие процессы управления электронным журналом, и информационные системы, которые обеспечивают функционирование как основных, так и дополнительных сервисов, учитывающих, в частности, специфику предметной области журнала.

Представлен подход к организации цифровой инфраструктуры электронного научного журнала на основе открытой программной системы Open Journal Systems (OJS). Предложены сервисы, расширяющие функциональные возможности этой системы и учитывающие специфику предметной области научных журналов. На основе технологии расширения функционала OJS созданы программные модули, обеспечивающие автоматизацию ряда редакционных процессов электронного научного журнала.

Представлена система сервисов автоматической обработки коллекций научных документов. Эти сервисы обеспечивают проверку соответствия документов коллекций принятым правилам формирования коллекций и преобразования документов в установленные форматы; структурный анализ документов и извлечение метаданных, а также их интеграцию в научное информационное пространство. Система сервисов позволяет автоматически выполнять набор операций, который не реализуем за практически приемлемое время при традиционной «ручной» обработке электронного контента, и предназначена для обработки больших коллекций научных документов.

Охарактеризованы алгоритмы автоматической стилевой валидации текстов на этапе регистрации статьи в информационной системе электронного научного журнала, автоматического подбора рецензентов, рассылки уведомлений и контроля сроков рецензирования.

Представлены методы обработки документов, содержащих математические формулы, в частности, алгоритм поиска по формулам в коллекциях математических документов. Указаны основные идеи, подходы и уже полученные результаты по разработке семантических технологий управления математическими знаниями, в том числе, подход к построению рекомендательных систем на основе онтологий математического знания и метод автоматизации процесса первичной обработки научной статьи, использующей TеX-нотацию.

Охарактеризована проблема построения системы анализа и оценки информационного и социального воздействия публикуемого научного контента на его пользователей. Проведено сопоставление традиционных (библиометрических и наукометрических) и альтернативных показателей такой оценки. Описан мировой опыт использования информетрических сервисов на сайтах научных журналов. Обсуждены варианты реализации этих подходов в рамках цифровой инфраструктуры электронного научного журнала.

Ключевые слова: издательские системы, современные модели публикации и распространения научных знаний, информационное общество, электронный научный журнал, информационные системы управления научными изданиями и публикациями, интеграция электронных ресурсов.

Программный модуль формирования цифрового математического пространства на основе графов знаний

Вадим Игоревич Гурьянов, Александр Михайлович Елизаров
622-639
Аннотация:

Современное информационное пространство содержит множество данных, однако они зачастую слабо структурированы, трудно находимы и не всегда корректны. Это создаёт дополнительные трудности при исследованиях, поэтому в настоящее время формируются цифровые пространства научных знаний, в частности, на основе графов знаний.


Для обеспечения качества информации такие графы часто наполняются данными вручную, что требует больших затрат времени. Поэтому создание инструмента, предоставляющего возможность автоматического наполнения графа данными, а также обеспечивающего контроль их качества, позволит упростить и ускорить процесс формирования цифровых пространств научных знаний.


Предложены методы автоматизации наполнения графа данными, обеспечивающие параллельный контроль их целостности. На основе предложенных методов разработан программный модуль, описаны механизмы его функционирования и его архитектура.

Ключевые слова: цифровое пространство научных знаний, формирование цифровых пространств научных знаний, графы знаний, автоматизация построения графов знаний.

Библиотека научных предметных областей SciLibRu

Ольга Муратовна Атаева, Наталия Павловна Тучкова, Кирилл Борисович Теймуразов, Айдин Абдышов, Михаил Геннадьевич Кобук
1324-1345
Аннотация:

Работа посвящена проблеме интеграции данных для представления научных предметных областей на основе их семантического описания в цифровой библиотеке SciLibRu. В качестве модели данных использованы онтология и граф знаний библиотеки LibMeta. Наполнение библиотеки SciLibRu осуществляется путем добавления данных научных журналов. Показано, как реализованы этапы анализа слабоструктурированных научных публикаций для их встраивания в онтологию библиотеки. При прохождении всех этапов предобработки данных формируется датасет, который может быть использован в обучении языковых моделей для запросов в русскоязычных научных предметных областях.


Приложение работы заключается в создании рекомендательных систем для работы с научными русскоязычными журналами.

Ключевые слова: икладная онтология, граф знаний, источники данных, анализ слабоструктурированных научных публикаций.

От информационно-аналитической среды для поддержки научных исследований в геологии к единому цифровому пространству геологических научных знаний

Вера Викторовна Наумова, Виталий Сергеевич Ерёменко, Александр Сергеевич Еременко, Алексей Андреевич Загумённов, Михаил Иванович Патук
15-41
Аннотация:

Описаны все стадии развития Информационной системы для создания, развития и поддержки научных исследований в геологии: от Информационно-аналитической среды до Единого цифрового пространства геологических научных знаний. Современная разрабатываемая стадия Проекта – это шаг вперед от традиционной территориально распределенной геологической системы к цифровой среде будущего.

Ключевые слова: Веб-сервисы, облачные сервисы, обработка геологических данных, геологическая программная платформа, программная экосистема для геологических исследований, единое цифровое пространство геологических научных знаний.

Технологии семантического веба для поддержки фундаментальных исследований в геологии

Игорь Вячеславович Бычков, Евгений Александрович Черкашин, Цзинь Чжан, Татьяна Юрьевна Черкашина, Виктория Алексеевна Попова, Оксана Анатольевна Мазаева, Оксана Викторовна Лунина
740-780
Аннотация:

Представлена инновационная методология применения технологий семантического веба для поддержки фундаментальных геологических исследований. Рассмотрена проблема семантической интеграции разнородных геологических данных, характеризующихся масштабом разного уровня и междисциплинарностью. Разработана пятиэтапная методология, включающая анализ предметной области, онтологическое концептуальное моделирование, трансформацию данных в граф знаний, развертывание инфраструктуры распределенного доступа к данным на основе концептуальной модели, а также интеграцию с процедурами обработки и анализа. Практическая апробация проведена на трех кейсах: анализе геохимических данных для оценки уровня загрязнения территории, создании информационной системы о разломах и исследовании динамики береговой зоны водохранилищ. Предложенный онтологический подход обеспечивает соответствие FAIR-принципам и преодоление «семантического барьера» в геологических исследованиях. Показано, что технологии семантического веба позволяют перейти от фрагментированных информационных массивов к целостному семантическому пространству геологических знаний, что открывает новые возможности для генерации комплексных научных гипотез и кросс-дисциплинарных исследований.

Ключевые слова: семантический веб, графы знаний, онтологическое моделирование, семантическое пространство научных знаний, фундаментальные геологические исследования.

Формирование структурированных представлений научных журналов для интеграции в граф знаний и семантического поиска

Ольга Муратовна Атаева, Михаил Геннадьевич Кобук
1306-1323
Аннотация:

Работа посвящена проблеме развития библиотеки научных предметных областей SciLibRu, как продолжения семантического описания научных трудов проекта LibMeta. В основе этой библиотеки лежит концептуальная модель данных, структура и семантика которой сформированы на принципах онтологического моделирования. Такой подход обеспечивает строгое описание предметной области, формализацию взаимосвязей между сущностями и возможность дальнейшего автоматизированного анализа данных. Целью настоящего исследования были разработка и экспериментальное применение методов структуризации содержимого научных журналов в формате LaTeX для их интеграции в онтологию библиотеки и обеспечения семантического поиска.


Предложен алгоритм трансляции в формат XML данных, представленных множеством файлов, для интеграции в онтологию библиотеки. Реализован модуль векторного поиска, основанный на вычислении эмбеддингов с использованием языковых моделей. Выявлены закономерности распределения эмбеддингов и факторы, влияющие на точность ранжирования результатов поиска. Проведено тестирование двух названых компонентов.


Разработанный метод составляет основу для автоматического включения содержимого научных журналов в граф знаний SciLibRu и создания обучающих корпусов для языковых моделей, ограниченных рамками научных предметных областей. Полученные результаты способствуют развитию систем навигации по графу знаний журналов, а также рекомендательных механизмов и инструментов интеллектуального поиска по русскоязычным научным текстам.

Ключевые слова: полуструктурированные данные, онтология текста, LaTeX, векторное представление текста, полнотекстовый поиск, семантический поиск.

Оркестрация методов анализа научных данных в процессах рецензирования

Ольга Муратовна Атаева, Наталия Павловна Тучкова
655-680
Аннотация:

Исследована проблема сочетания методов в задаче семантического анализа научных данных и публикаций при рецензировании. На разных этапах обработки данных в системе SciLibRu использованы различные методы, построена многоуровневая онтология, наполнен граф знаний, что приводит к формированию новой структуры данных, отличной от исходной. Каждый метод по отдельности приобретает свое назначение в такой системе, при этом в совокупности их сочетание приводит к возникновению новых свойств, которые стали предметом настоящих исследований. Приведен пример автоматического агента рецензирования с объяснимым результатом.

Ключевые слова: оркестрация методов, семантический анализ, онтология предметной области, граф знаний, большие языковые модели, системы, категории, динамические структуры.

Об онтологии адресата в математической предметной области

Александр Александрович Муромский, Наталия Павловна Тучкова
506-533
Аннотация: Обсуждена проблема представления математических предметных областей в цифровых библиотеках и полезности этих ресурсов для специалистов. Дан вариант представления математических предметных областей в интернете. В качестве информационной модели для единицы записи выбрана статья тезауруса. Реализация схемы показана на примере уравнений с частными производными. Предложен подход к организации информационного пространства автора, основанный на использовании тезауруса адресата. На основе описаний предметных областей индивидуумов предполагается построение онтологии научного междисциплинарного сообщества, что, по мнению авторов, позволит не утерять новый результат или открытие в науке, соблюсти приоритеты авторов, встроить новое знание в устоявшуюся систему классических предметных областей.
Ключевые слова: контролируемая лексика, дескрипторные словари, тезауруса адресата, онтология адресата.

Онтология вспомогательных и политематических предметных классов единого цифрового пространства научных знаний

Светлана Александровна Власова, Николай Евгеньевич Каленов, Александр Николаевич Сотников
22-42
Аннотация:

Одними из основных компонентов Единого Цифрового Пространства Научных Знаний (ЕЦПНЗ) являются предметные онтологии отдельных тематических подпространств, включающие в себя основные понятия, относящиеся к данному научному направлению. Задача построения предметных онтологий на первом этапе требует формирования массива ключевых терминов в заданной области науки с последующим установлением связей между ними. Настоящая работа является развитием исследований, проводимых авторами в области создания ЕЦПНЗ. В рамках предыдущих исследований была предложена унифицированная структура представления онтологии элементов ЕЦПНЗ (подпространств, классов и атрибутов объектов, связей между объектами или атрибутами). В процессе моделирования онтологии на примере универсального и ряда тематических подпространств ЕЦПНЗ выявилась необходимость некоторой корректировки структуры онтологии, касающейся справочников ЕЦПНЗ, для обеспечения возможности описания вложенных атрибутов данных. Кроме того, в онтологию введено понятие «тип словаря значений атрибутов данных», определены два типа словарей – «статические» и «динамические». Эта информация позволяет упростить алгоритмы формально-логического контроля при формировании контента ЕЦПНЗ. Указание на тип словаря введено в структуру справочников атрибутов объектов. В представленной работе описана модифицированная структура онтологии на примере 11-ти вспомогательных и 10-ти предметных классов универсального подпространства (УПП) ЕЦПНЗ. Приведены примеры справочников каждого класса, построенные в соответствии с моделью структуры онтологии, перечень атрибутов объектов и примеры статических словарей.

Ключевые слова: цифровое пространство научных знаний, онтология, классы объектов, атрибуты, структуризация, связанные данные.

Мультиагентная система для цифровой интеллектуальной сферы геологических знаний

Виталий Сергеевич Еременко, Вера Викторовна Наумова
2433-2445
Аннотация:

Предложен новый подход к построению территориально-распределенных информационных систем на основе мультиагентной архитектуры, позволяющий отказаться от жесткой унификации протоколов и каталогизации ресурсов в пользу динамической интеграции источников данных. Ключевым элементом системы является агент верификации, обеспечивающий проверку достоверности результатов научных исследований через формальный контроль и использование нескольких больших языковых моделей. Разработанный прототип, реализованный на платформе GeologyScience.ru, устраняет недостатки существующего ИИ-ассистента, связанные с галлюцинациями и недостоверностью информации, и создает основу для накопления проверенных знаний.

Ключевые слова: мультиагентные системы, территориально-распределенные информационные системы, верификация результатов, большие языковые модели (LLM), ИИ-агенты.

Нейросетевая архитектура воплощенного интеллекта

Айрат Рафкатович Нурутдинов
598-655
Аннотация:

В последние годы достижения в области искусственного интеллекта (ИИ) и машинного обучения обусловлены успехами в разработке больших языковых моделей (LLM) на основе глубоких нейронных сетей. В то же время, несмотря на существенные возможности, LLM имеет такие принципиальные ограничения, как спонтанная недостоверность в фактах и суждениях; допущение простых ошибок, диссонирующих с высокой компетентностью в целом; легковерие, проявляющееся в готовности принимать за истину заведомо ложные утверждения пользователя; отсутствие сведений о событиях, произошедших после завершения обучения.


Вероятно, ключевой причиной является то, что обучение биологического интеллекта происходит через усвоение неявных знаний воплощенной формой интеллекта, позволяющей решать интерактивные физические задачи реального мира. Биоинспирированные исследования нервных систем организмов позволяют рассматривать мозжечок, координирующий движения и поддерживающий равновесие, в качестве главного кандидата для раскрытия методов реализации воплощенного физического интеллекта. Его простая повторяющаяся структура и способность управлять сложными движениями дают надежду на возможность создания аналога адаптивным нейронным сетям.


В настоящей работе изучается биоинспирированная архитектура мозжечка как форма аналоговых вычислительных сетей, способная моделировать сложные физические системы реального мира. В качестве простого примера представлена реализация воплощенного ИИ в виде многокомпонентной модели щупальца осьминога, демонстрирующей потенциал в создании адаптивных физических систем, обучающихся и взаимодействующих с окружающей средой.

Ключевые слова: Искусственные нейронный сети, большие языковые модели, неявное обучение, мозжечок, аналоговые компьютеры, воплощенный интеллект, мягкие роботы, осьминоги.

Семантический анализ корпуса научных статей на основе графового представления

Вадим Андреевич Чунихин, Сергей Александрович Зайцев, Ольга Муратовна Атаева
1253-1268
Аннотация:

Проблема эффективной навигации и поиска релевантной информации в постоянно растущем объеме научных публикаций требует перехода от классических методов полнотекстового поиска к семантическим моделям. В работе предложен подход к структурированию гетерогенного корпуса научных текстов путем построения графа знаний. Разработан конвейер обработки данных, включающий извлечение метаданных, ключевых слов и структурных элементов статей, а затем их интеграцию в единый граф. На основе построенного графа знаний реализованы методы анализа явных и извлечения неявных связей между публикациями. Результаты исследования демонстрируют эффективность графового представления научной информации для выявления скрытых закономерностей в предметных областях и поддержки интеллектуальной навигации.

Ключевые слова: семантический анализ, корпус научных статей, граф знаний, онтология, RDF, SPARQL, большие языковые модели, извлечение информации, графовые базы данных.

Интернет-портал «История земли: геологический ракурс». Высокотехнологичная популяризация научных геологических знаний

Александр Сергеевич Еременко, Вера Викторовна Наумова, Алексей Андреевич Загумённов, Виталий Сергеевич Ерёменко, Анастасия Николаевна Злобина
604-621
Аннотация:

Работа посвящена разработке высокотехнологичного научно-популярного интернет-портала «История Земли: геологический ракурс». Разрабатываемый ресурс ставит своей основной целью популяризацию современных научных геологических знаний с использованием научно-популярного мультимедиа-контента и программного инструментария для интерактивного взаимодействия с ним. Интернет-ресурс предназначен для школьников и студентов, а также широкого круга пользователей интернета.

Ключевые слова: история Земли, геология Земли, научно-популярный портал, научно-образовательный ресурс, популяризация науки.

Онтологическая модель интеграции когнитивных и социологических данных для оценки персонала

Юрий Алексеевич Халин, Анна Алексеевна Ильина
627-650
Аннотация:

В условиях цифровой трансформации организаций и роста объемов данных появляется запрос на более прозрачные и объяснимые подходы к оценке сотрудников. Цель проведенного исследования состояла в проектировании и верификации онтологической модели (OWL 2/SHACL), которая интегрирует когнитивные показатели и социологические характеристики работников в единое пространство знаний для поддержки HR (Human Resources)-процессов – процессор управления человеческими ресурсами. Научная новизна работы заключается в разработке единой семантической модели, связывающей данные когнитивных тестов, опросников, контекста труда и показателей результативности; в формулировании компетентностных вопросов, запускающих механизм вывода в графе знаний; и в разработке паттернов для прогнозирования дефицитов компетенций, выявления риска перегрузки/выгорания с контролем этики и недискриминации. Предлагаемый подход опирается на методологии инженерии онтологий – METHONTOLOGY и NeOn, концепции семантического веба и методы психометрики.

Ключевые слова: онтология, OWL 2, SHACL, компетентностные вопросы (CQ), HR‑оценка, компетенции, когнитивные тесты, социологические опросники, reasoning, SPARQL, KPI/OKR, fairness, выгорание.

Типизация кооперативных механик многопользовательских видеоигр

Данил Азатович Хаматнуров, Алексей Витальевич Шубин
328-345
Аннотация:

Проведена типизация кооперативных механик многопользовательских видеоигр. Кооперативные игровые механики представляют собой ключевые элементы геймдизайна, определяющие способы взаимодействия игроков в совместном игровом процессе. Проанализированы существующие исследования в данной области и выделены основные принципы, влияющие на успешность кооперативного взаимодействия. Выделены и классифицированы восемь типов кооперативных механик: совместные, кооперативно-эмергентные, альтруистические, социально-экономические, комплементарные, механики одновременного управления, штрафующие и цепные.


Сделан вывод, что успешные кооперативные механики строятся на принципах комплементарности ролей, сочетании различных способностей и необходимости распределения задач ради достижения общей цели. Предложенная классификация способствует систематизации знаний в области геймдизайна и может быть полезна разработчикам многопользовательских видеоигр. В дальнейшем классификация может быть уточнена и расширена с учетом эволюции индустрии и появления новых форм кооперации.

Ключевые слова: игровая механика, кооперативные механики, многопользовательские видеоигры, геймдизайн, классификация, видеоигры.

RusHallu-RAG: комплексный подход к обнаружению галлюцинаций в русскоязычных RAG-системах

Федор Алексеевич Садковский, Регина Руслановна Насырова, Алексей Андреевич Сорокин
2188-2214
Аннотация:

Представлен RusHallu-RAG – первый комплексный бенчмарк для обнаружения галлюцинаций в русскоязычных RAG-системах. Набор данных из 1000 пар «запрос – ответ» охватывает области общего знания и научных текстов с контролируемой балансировкой релевантности контекста. Предложена детализированная таксономия из шести типов галлюцинаций, использованная для разметки на уровне всего ответа и отдельных его фрагментов с привлечением экспертов и больших языковых моделей.


Для обучения детектора собран сбалансированный тренировочный датасет объемом 3000 примеров с применением синтетических методов генерации. На его основе методом SFT обучен детектор на базе YandexGPT-5-Lite-8B. Проведена оценка 15 моделей с открытыми и закрытыми весами, а также обученного детектора. Результаты показали, что число параметров не гарантирует высокой производительности: модели среднего размера (20–33 млрд) иногда превосходят более крупные. Обученный детектор достигает средней точности 63.7%, занимая второе место после закрытой Gemini-2.5-Pro, с приростом 47.2 п.п. относительно исходной модели. Разрыв между закрытыми и открытыми моделями сокращается с 20–35 до 8.4 п.п., что подтверждает эффективность подхода. Бенчмарк, код и обученная модель опубликованы в открытом доступе.

Ключевые слова: обнаружение галлюцинаций, дополненная поиском генерация, большие языковые модели, бенчмаркинг, обработка естественного языка, вопросно-ответные системы, оценка моделей, дообучение с учителем, таксономия галлюцинаций.

Аудиовизуальная запись синхронных занятий при очном и дистанционном обучениях

Феликс Освальдович Каспаринский
451-472
Аннотация: Современная информационная среда предоставляет беспрецедентные возможности по сочетанию high-tech и high-touch подходов в обучении. Можно ожидать, что в ближайшее время всеобщим трендом станет использование аудиовизуальных записей синхронных занятий, которые целесообразно применять для последующего закрепления, повторения, контроля, обобщения и систематизации знаний. В статье резюмированы результаты 10-летнего опыта создания и использования аудиовизуальных записей очных и дистанционных занятий в университетских и школьных аудиториях.
Ключевые слова: аудиовизуальная запись, дистанционное обучение, очное обучение, интернет, Skype, Video, high-touch, high-tech, синхронные занятия.

Преподавание математических дисциплин с использованием цифровой образовательной платформы Мирера

Александр Георгиевич Леонов
312-323
Аннотация:

Изложен опыт цифровой трансформации математических дисциплин на базе авторской цифровой образовательной платформы (ЦОП) Мирера. ЦОП Мирера оптимизирована на российскую систему организации высшего образования, ориентирована на разработку и проведение курсов, в которых сочетаются онлайн- и оффлайн-технологии проведения учебного процесса. ЦОП Мирера предоставляет авторам курсов инструменты разработки компьютеризированных курсов с автоматизированной проверкой правильности и самостоятельности выполненных обучаемыми текущих и контрольных заданий с помощью методов искусственного интеллекта. В платформу встроены различные оригинальные типы тестов, поддерживающие как в описании задач, так и в вариантах ответов, контент в различных форматах, включая формульные фрагменты в TeX-нотации, последовательности элементов (для автоматизированной проверки знания студентом структуры доказательства теорем курса или схем решения типовых задач), смысловой анализ текстовых ответов и т. п.

Ключевые слова: адаптивное обучение, цифровая образовательная платформа, ЦОП Мирера, программирование, web-приложения.

От размеченного корпуса к онтологии: формальная модель многоуровневой семантической разметки фейковых новостей в казахско-русском медиапространстве (KazFakeCorpus / KazFakeOnto)

Анаргуль Аймуратовна Некесова, Елена Анатольевна Сидорова, Жанар Бейбутовна Ламашева, Мадина Аралбаевна Самбетбаева, Айгерим Сембековна Еримбетова, Мира Жорабековна Калдарова, Ақсәуле Абзалқызы Назымхан
2158-2187
Аннотация:

Рассмотрена проблема формального представления знаний о дезинформации в малоресурсном двуязычном медиапространстве. Автоматическое обнаружение фейковых новостей традиционно сводится к бинарной классификации REAL/FAKE, которая не описывает внутреннюю структуру недостоверного сообщения: тип фейкового контента, применённую технику дезинформации, коммуникативное намерение автора, характеристики источника и доказательной базы.


В работе представлены два взаимосвязанных ресурса. Первый – двуязычный корпус KazFakeCorpus: 4276 текстов на казахском и русском языках, сбалансированных по классам внутри каждого языка; класс REAL сформирован из официальных материалов портала Gov.kz, класс FAKE – из их контролируемых трансформаций. Разметку по многоуровневой семантической схеме выполнили в среде Label Studio два независимых эксперта; значения Krippendorff’s Alpha по основным уровням составили 0,79–0,88. Второй ресурс – онтология KazFakeOnto, переводящая схему разметки из плоского реляционного представления в формальную модель на языке OWL 2 DL: 38 классов, 26 объектных свойств, 22 свойства данных, 112 индивидов, 1155 утверждённых триплетов. Одиннадцать определяемых классов не утверждаются вручную, а выводятся ризонером из значений свойств; цепочка свойств связывает материал с аннотатором через объект аннотации. Непротиворечивость проверена с помощью HermiT, запросный слой апробирован на пятнадцати SPARQL- и тринадцати DL-запросах.


Показано, что онтологический слой обеспечивает воспроизводимую спецификацию схемы разметки, автоматический вывод содержательных категорий и единую формальную среду для постановки корпусно-лингвистических вопросов и анализа ошибок моделей машинного обучения. Обсуждаются ограничения подхода и направления масштабирования онтологии на полный корпус и на естественно возникающую дезинформацию.

Ключевые слова: обнаружение фейковых новостей, онтология, OWL 2, SPARQL, логический вывод, двуязычный корпус, казахский язык, многоуровневая аннотация, техники дезинформации, объяснимый NLP, малоресурсные языки, KazFakeCorpus, KazFakeOnto..
1 - 21 из 21 результатов
Информация
  • Для читателей
  • Для авторов
  • Для библиотек
Отправить материал
Текущий выпуск
  • Логотип Atom
  • Логотип RSS2
  • Логотип RSS1

Электронные библиотеки

ISSN 1562-5419

Информация

  • О журнале
  • Цели и задачи
  • Тематика
  • Руководство для авторов
  • Отправка материалов
  • Заявление о конфиденциальности
  • Контакты
  • eLIBRARY.RU
  • dblp computer science bibliography

Отправить статью

Авторам нужно зарегистрироваться в журнале перед отправкой материалов, или, если вы уже зарегистрированы, можно просто войти со своей учетной записью и начать процесс отправки, состоящий из пяти шагов.

Отправить материал
Больше информации об этой издательской системе, платформе и рабочем процессе от OJS/PKP.

© 2015-2026 Казанский (Приволжский) федеральный университет; Институт развития информационного общества