Найти

Технология наполнения предметных онтологий пространства научных знаний

Николай Евгеньевич Каленов

101-115

Аннотация:

Под предметной онтологией в контексте этой статьи понимается совокупность ключевых понятий, относящихся к некоторой области науки, с их семантическими связями, дополненная индексами различных классификационных систем, описывающих данную научную область. Предметные онтологии являются необходимой составляющей каждого подпространства, входящего в Единое цифровое пространство научных знаний (ЕЦПНЗ). В данной статье приводятся результаты исследований, связанных с построением предметных онтологий на базе созданной автоматизированной системы поддержки терминологических словарей и предлагается методология выделения новых ключевых терминов отдельной области науки. Предлагаемая методология базируется на использовании существующих классификационных систем в совокупности с базами данных цитирования (БДЦ), такими как Web of Science и Scopus для англоязычных публикаций и Российский индекс цитирования (РИНЦ) – для русскоязычных. Методология предполагает разбиение научной области на ряд разделов в соответствии с выбранной классификационной системой, выделение из БДЦ ядра статей, относящихся к каждому разделу, а из статей – новых авторских ключевых терминов, которые и должны составлять, в совокупности с соответствующими разделами классификационных систем, основу предметной онтологии данной научной области.

Ключевые слова: пространство научных знаний, предметная онтология, базы данных цитирования, ключевые термины, тезаурус для онтологии знаний, классификационные системы.

Семантический рекомендательный сервис присвоения кода УДК математическим статьям

Ольга Авенировна Невзорова, Дамир Альбертович Альмухаметов

203-224

Аннотация:

Классификация документов с присвоением кодов-классификаторов является традиционным способом систематизации и поиска документов по определенной тематике. Универсальная десятичная классификация (УДК) лежит в основе систематизации знаний, представленных в библиотеках, базах данных и других хранилищах информации. В России УДК является обязательным реквизитом всей книжной продукции и информации по естественным и техническим наукам. Выбор классификационных кодов связан с анализом структуры дерева классификатора и традиционно выполняется автором научной статьи.

В настоящей работе предложено решение задачи автоматизации подбора классификационного кода УДК для математической статьи на основе специального ресурса – онтологии OntoMath^PRO профессиональной математики, разработанной в Казанском федеральном университете. Подходом к решению задачи автоматизации является создание «кодовых карт» для каждого классифицирующего кода в дереве УДК в области математики. Под «кодовой картой» понимается взвешенный набор всех математических именованных сущностей, извлеченных с помощью онтологии OntoMath^PRO из коллекции статей с заданным кодом УДК. Создание «кодовых карт» основано на гипотезе о том, что выбор кода УДК обуславливается определённым набором классифицирующих признаков, которые можно представить классами из онтологии OntoMath^PRO. Предложенная гипотеза проверена и подтверждена: проверка гипотезы проведена на коллекции математических статей, опубликованных в журнале «Известия ВУЗов. Математика» в течение 1999–2009 гг.

Ключевые слова: Универсальная десятичная классификация, кодовая карт, кодовая карта, онтология OntoMathPRO, математическая статья.

Метод автоматической классификации полнотекстовых описаний кернов с использованием словарей

Алексей Петрович Антонов, Сергей Александрович Афонин, Александр Сергеевич Козицын, Владимир Михайлович Староверов

3-23

Аннотация:

Использование методов автоматической обработки текстов, в том числе методов классификации полнотекстовых описаний, позволяет достичь существенного снижения трудозатрат при обработке экспериментальных данных. В настоящей работе рассмотрено применение метода автоматической классификации текстов в области обработки и классификации элементов керна и определения литофаций. Литофациями называют одновозрастные геологические тела (отложения), которые по своему составу или строению отличаются от соседних слоев.

При проведении оценки нефтегазового потенциала месторождений требуется выполнять построение карт и схем распространения литофаций. Для этого необходимо осуществить классификацию большого количества полнотекстовых описаний участков керна, выполненных специалистами. Алгоритм, представленный в статье, позволяет на основе заданных правил и словарей провести классификацию с учетом порядка и значимости ключевых слов в предложениях. Преимуществами такого подхода являются возможность различать близкие литофации, возможность использования архивных данных, простота настройки на новые классы, адаптация к русскоязычным описаниям кернов и возможность локального использования без необходимости передавать описания кернов сторонним приложениям.

Ключевые слова: классификация текстов, литофации, словари, информационные системы.

Классификация изображений с помощью сверточных нейронных сетей

Сергей Алексеевич Филиппов

366-382

Аннотация:

Для классификации изображений в настоящее время можно применить множество различных инструментов, каждый из которых направлен на решение определенного спектра задач. В статье проведен краткий обзор библиотек и технологий для классификации изображений. Построена архитектура простой свёрточной нейронной сети для классификации изображений.

Были проведены эксперименты по распознаванию изображений с такими популярными нейронными сетями, как VGG16 и ResNet 50. Обе нейронные сети показали хорошие результаты. Однако ResNet 50 переобучилась из-за того, что в наборе данных присутствовали однотипные изображения для обучения, поскольку в данной нейронной сети больше слоев, позволяющих считывать признаки объектов на изображениях. С обученными моделями был проведен сравнительный анализ по распознаванию изображений, специально подготовленных для этого эксперимента.

Для классификации изображений в настоящее время можно применить множество различных инструментов, каждый из которых направлен на решение определенного спектра задач. В статье проведен краткий обзор библиотек и технологий для классификации изображений. Построена архитектура простой свёрточной нейронной сети для классификации изображений.

Были проведены эксперименты по распознаванию изображений с такими популярными нейронными сетями, как VGG16 и ResNet 50. Обе нейронные сети показали хорошие результаты. Однако ResNet 50 переобучилась из-за того, что в наборе данных присутствовали однотипные изображения для обучения, поскольку в данной нейронной сети больше слоев, позволяющих считывать признаки объектов на изображениях. С обученными моделями был проведен сравнительный анализ по распознаванию изображений, специально подготовленных для этого эксперимента.

Ключевые слова: распознавание изображений, нейронная сеть, сверточная нейронная сеть, классификация изображений, машинное обучение.

Классификация изображений с использованием обучения с подкреплением

Артем Александрович Елизаров, Евгений Викторович Разинков

1172-1191

Аннотация:

В последнее время активно развивается такое направление машинного обучения, как обучение с подкреплением. Как следствие предпринимаются попытки использования обучения с подкреплением для решения задач компьютерного зрения, в частности для решения задачи классификации изображений. Задачи компьютерного зрения являются на сегодняшний день одними из наиболее актуальных задач искусственного интеллекта.

В статье предложен метод классификации изображений в виде глубокой нейронной сети с использованием обучения с подкреплением. Идея разработанного метода сводится к решению задачи о контекстном многоруком бандите с помощью различных стратегий достижения компромисса между эксплуатацией и исследованием и алгоритмов обучения с подкреплением. Рассмотрены такие стратегии, как -жадная, -softmax, -decay-softmax и метод UCB1, и такие алгоритмы обучения с подкреплением, как DQN, REINFORCE и A2C. Проведен анализ влияния различных параметров на эффективность работы.

Ключевые слова: машинное обучение, классификация изображений, обучение с подкреплением, задача о контекстном многоруком бандите.

Проектирование инструментария для создания игрового процесса через систематизацию игровых механик

Алексей Витальевич Шубин, Влада Владимировна Кугуракова

774-795

Аннотация:

Представлен новый подход к разработке инструмента, направленного на упрощение рабочего процесса игрового дизайнера. Выработаны требования, разработан сценарий работы и уточнены основные параметры для разрабатываемого инструмента. Основная задача инструмента заключается в ускорении и облегчении выбора подходящих игровых механик без необходимости тратить ценное время на длительный анализ других видеоигровых проектов.

Чтобы обеспечить более эффективную работу геймдизайнеров при подборе игровых механик, был проведён анализ разнообразных подходов к классификации игровых механик. В процессе исследования были рассмотрены различные методы классификации игровых механик, их разбор и анализ показали, какие классификации в большей степени подходят для декомпозиции игровой механики. Результаты исследования позволили выявить ключевые аспекты игровой механики, которые будут служить фундаментом для разработки инструмента.

Настоящее исследование представляет собой важный этап в создании инструмента, который, будучи внедренным, позволит оптимизировать процесс геймдизайна и ускорить разработку видеоигр.

Ключевые слова: игровой дизайн, классификация, игровые механики, автоматизация, видеоигры.

Формализация процессов формирования пользовательских коллекций в цифровом пространстве научных знаний

Николай Евгеньевич Каленов, Ирина Николаевна Соболевская, Александр Николаевич Сотников

433-450

Аннотация: Исследована задача формирования цифрового пространства научных знаний (ЦПНЗ). Рассмотрено отличие этого понятия от общего понятия пространства знаний. ЦПНЗ представлено как множество, содержащее объекты, верифицированные мировым научным сообществом. Формой структурированного представления цифрового пространства знаний является семантическая сеть, основной принцип организации которой основан на системе классификации объектов и последующем построении их иерархии, в частности, по принципу наследования. Введена классификация объектов, составляющих контент ЦПНЗ. Предложена модель ЦПНЗ как совокупности непересекающихся множеств, содержащих цифровые образы реальных объектов и их характеристики, обеспечивающие отбор и визуализацию объектов в соответствии с многоаспектными пользовательскими запросами. Определено понятие пользовательской коллекции, предложена иерархическая классификация типов пользовательских коллекций. Использование понятий теории множеств при построении ЦПНЗ позволяет разбивать информацию по уровням детализации и формализовать алгоритмы обработки пользовательских запросов, что проиллюстрировано конкретными примерами.

Ключевые слова: семантическая сеть, информационное пространство, научные знания, электронная библиотека, уровни детализации, иерархия информационных объектов.

Использование синтаксиса для анализа тональности твитов на русском языке

Юлия Владимировна Адаскина, Полина Вадимовна Паничева, Андрей Михайлович Попов

163-184

Аннотация:

Представлен подход к решению задачи анализа тональности в рамках тестирования SentiRuEval – открытого соревнования систем анализа тональности на русском языке. Описанный алгоритм был применен в дорожке по анализу тональности твитов о банках и телекоммуникационных компаниях. Для этих данных была разработана и оценена классификация на три класса: положительный, отрицательный и нейтральный.

Для решения поставленной задачи использовались различные алгоритмы машинного обучения. Признаками для классификатора являлись лингвистические данные, полученные из текста с помощью разработанного нами морфо-синтаксического анализатора. Нормализованные слова, а также синтаксические связи, оказались решающими признаками для достижения наилучшего результата, который был получен с помощью статистического алгоритма опорных векторов.

Оценка, проведенная организаторами конкурса, выявила высокое качество предложенного подхода, который занял первую строчку по трем из четырех мерам качества.

Ключевые слова: анализ тональности, синтаксические связи, русский язык, статистические методы, классификация текстов.

Повышение устойчивости классификации коротких текстов к стохастическому шуму на основе плотностной очистки обучающих выборок

Басар Бауржанович Баишев, Андрей Петрович Халов

681-698

Аннотация:

Рассмотрена задача классификации коротких текстовых заявок в условиях значительного дисбаланса классов и зашумленности реальных потоков обращений. Показана ограниченная эффективность методов синтетического расширения выборки при работе с зашумленной разметкой. Предложен гибридный метод, сочетающий предварительную плотностную очистку данных и многоуровневое ансамблирование моделей. Применение алгоритма плотностной кластеризации позволило исключить 16.5% информационного шума от общего объема выборки. Финальная модель представлена двухуровневой архитектурой и оптимизирована с помощью байесовского поиска гиперпараметров. На отложенной тестовой выборке достигнуто значение метрики R@3, равное 97.4%. Предложенный метод позволяет автоматизировать процесс распределения заявок, существенно снижая нагрузку на операторов и сокращая время диспетчеризации обращений.

Ключевые слова: обработка естественного языка, зашумленные текстовые данные, ансамблевое обучение, робастная классификация, фильтрация шума.

Методы автоматического присвоения кодов УДК математическим статьям: оценка классических и нейросетевых подходов

Булат Тимурович Гизатуллин, Ольга Авенировна Невзорова

699-718

Аннотация:

Универсальная десятичная классификация (УДК) – это иерархическая система индексирования, в рамках которой одной публикации могут соответствовать один или несколько кодов. Ручное присвоение кодов УДК трудоемко и нередко оказывается неоднородным. В работе рассмотрена задача автоматического присвоения кодов УДК русскоязычным математическим статьям. Цель исследования – сравнить различные сочетания текстовых представлений и моделей классификации на едином корпусе и определить наиболее эффективные конфигурации. Для этого был сформирован корпус из 4194 статей с ресурса Math-Net.Ru, включающий полные тексты, аннотации, метаданные и коды УДК; были выполнены извлечение текста из PDF-файлов, очистка артефактов верстки и нормализация кодов. В эксперименте сопоставлялись текстовые представления TF-IDF, Word2Vec, SciRus-tiny и SciRus-tiny3.5 в сочетании с моделями логистической регрессии, Complement Naive Bayes (CNB) и CatBoost. Наилучшие результаты в обеих постановках – однозначной (single-label) и многозначной (multi-label) – показала модель TF-IDF + LogReg; близкие результаты продемонстрировала конфигурация TF-IDF + CNB. Полученные результаты могут быть использованы при разработке систем автоматической рубрикации научных публикаций, рекомендательных сервисов для авторов и редакторов, а также средств контроля качества тематической разметки.

Ключевые слова: автоматическая классификация, универсальная десятичная классификация, УДК, обработка научных текстов, машинное обучение, иерархическая классификация, многозначная классификация, математические тексты, цифровые библиотеки, векторизация текста.

Цифровая экосистема OntoMath как подход к построению пространства математических знаний

Александр Михайлович Елизаров, Александр Витальевич Кириллович, Евгений Константинович Липачёв, Ольга Авенировна Невзорова

154-202

Аннотация:

Представлены результаты по созданию методов управления математическим знанием в контексте цифровых математических библиотек. Программные инструменты, разработанные на основе этих методов, являются частью цифровой экосистемы OntoMath, в рамках которой осуществляется их взаимодействие. Приведено краткое описание архитектуры экосистемы OntoMath, выделены уровни предметных онтологий и внешних онтологий, а также уровень программных инструментов и сервисов. В отдельную категорию выделены семантические сервисы. Этим термином обозначены программные инструменты, в функционале которых используются запросы к предметным онтологиям для обеспечения управления объектами знаний. Даны общие описания разрабатываемых предметных онтологий: образовательной математической онтологии OntoMath^Edu и онтологии профессиональной математики OntoMath^PRO. Отражено развитие образовательной онтологии в направлении включения образовательных пререквизитных связей между классами. Среди программных инструментов цифровой экосистемы выделены сервисы поиска по математическим электронным коллекциям, сервис семантического аннотирования математических документов, инструменты семантической разметки образовательных математических документов, а также система автоматической генерации проверочных тестов по математическим образовательным дисциплинам.

В рамках цифровой экосистемы OntoMath развиваются рекомендательные системы специального назначения. В текущей версии экосистемы представлены рекомендательная система формирования списка близких статей, основанная на онтологии OntoMath^PRO, рекомендательная система назначения экспертов для поддержки процесса научного рецензирования и рекомендательные системы подбора предметных классификаторов УДК и кодов Mathematics Subject Classification для математических документов. Приведены также результаты, полученные в направлении создания фабрики метаданных цифровой библиотеки, включающей сервисы и инструменты извлечения, уточнения, пополнения и нормализации метаданных документов электронных математических коллекций. Отметим, что экосистема OntoMath разрабатывается как технологическая основа цифровой математической библиотеки Lobachevskii-DML.

Ключевые слова: цифровая экосистема, экосистема OntoMath, цифровая математическая библиотека, Lobachevskii-DML, онтология, математическая онтология OntoMathPRO, образовательная онтология OntoMathEdu.

Где находятся лучшие признаки? Послойный анализ слоев трансформера для эффективной классификации эндоскопических изображений

Ахмад Таха, Рустам А. Лукманов

1207-1229

Аннотация:

В поисках путей развития медицинского искусственного интеллекта показано, что предварительно обученный Vision Transformer с линейным классификатором может достигать высокой и конкурентоспособной производительности в классификации эндоскопических изображений. Представлен систематический послойный анализ, который выявляет источник наиболее важных признаков, оспаривая общепринятую эвристику использования только последнего слоя. Установлен отчетливый феномен «пика перед концом», когда поздне-промежуточный слой предлагает более обобщаемое представление для последующей медицинской задачи. На стандартных наборах данных Kvasir и HyperKvasir предложенный подход с малым количеством параметров не только получить достаточно высокую точность, но и значительно сокращает вычислительные затраты. Полученные работы могут быть рекомендованы в качестве практического руководства по эффективному использованию признаков общих базовых моделей в клинических условиях.

Ключевые слова: классификация эндоскопических изображений, замороженный кодировщик, извлечение признаков, послойный анализ, визуальный трансформер (ViT), перенос обучения, самоконтролируемое обучение (SSL), медицинский искусственный интеллект.

Типизация кооперативных механик многопользовательских видеоигр

Данил Азатович Хаматнуров, Алексей Витальевич Шубин

328-345

Аннотация:

Проведена типизация кооперативных механик многопользовательских видеоигр. Кооперативные игровые механики представляют собой ключевые элементы геймдизайна, определяющие способы взаимодействия игроков в совместном игровом процессе. Проанализированы существующие исследования в данной области и выделены основные принципы, влияющие на успешность кооперативного взаимодействия. Выделены и классифицированы восемь типов кооперативных механик: совместные, кооперативно-эмергентные, альтруистические, социально-экономические, комплементарные, механики одновременного управления, штрафующие и цепные.

Сделан вывод, что успешные кооперативные механики строятся на принципах комплементарности ролей, сочетании различных способностей и необходимости распределения задач ради достижения общей цели. Предложенная классификация способствует систематизации знаний в области геймдизайна и может быть полезна разработчикам многопользовательских видеоигр. В дальнейшем классификация может быть уточнена и расширена с учетом эволюции индустрии и появления новых форм кооперации.

Ключевые слова: игровая механика, кооперативные механики, многопользовательские видеоигры, геймдизайн, классификация, видеоигры.

Рейтинг журнала в библиографической базе

Михаил Михайлович Горбунов-Посадов, Татьяна Алексеевна Полилова

1060-1089

Аннотация:

Инструмент построения рейтингов научных журналов является одним из востребованных сервисов библиографических баз. Задача построения рейтинга обычно делится на две основные подзадачи: определение референтной группы журналов и вычисление показателя рейтинга для журналов этой группы. Практика показывает, что для корректного сопоставления журналов необходимым условием является ограничение референтной группы исключительно журналами определенной тематики. В случае методических ошибок, допущенных на этапе выделения референтной группы, значения показателя журналов в рейтинге могут сильно отличаться от ожидаемых.

Например, в рейтинге журналов в Российском индексе научного цитирования (РИНЦ) по двухлетнему импакт-фактору в тематическом направлении «Математика» классические фундаментальные математические журналы вопреки ожиданиям не выходят на первые позиции рейтинга. Первые позиции заняли журналы, для которых математика не является доминирующей профильной дисциплиной. Анализ статистических данных о тематике публикуемых статей и цитирований в журналах, занимающих лидирующие позиции рейтинга РИНЦ, показывает, что на показатели рейтинга существенно повлияла мультидисциплинарность этих журналов.

Отмеченное недоразумение подводит к мысли о том, что в подсчет рейтинга в данном случае следовало вовлекать не все статьи журнала, а только относящиеся к данному тематическому направлению. Вместе с тем вопросы вызывает и сложившаяся схема тематической классификации направлений. Более перспективной представляется набирающая популярность классификация «снизу вверх», работающая на представительном массиве статей. Здесь тематические кластеры вычленяются на основе понятия близости статей, трактуемого как близость их библиографических связей. И далее тематическая принадлежность статьи не назначается волевым решением автора или редакции, а строго формально вычисляется на основе ее библиографического списка.

Ключевые слова: научная публикация, цитирование, рейтинг журналов, тематическая классификация, импакт-фактор, мультидисциплинарность, библиографическая ссылка, со-цитирование, классификация снизу вверх, тематическая кластеризация, Citation Topics.

Наукометрические измерения в электронных библиотеках на основе рубрикаторов научной информации

М.Р. Когаловский, С.И. Паринов

Аннотация: Ряд научных систем электронных библиотек располагает средствами статистических измерений востребованности (количества просмотров и загрузок) содержащихся в них информационных объектов. Результаты этих измерений могут агрегироваться по их авторам и организациям, в которых созданы эти информационные объекты. Вместе с тем, большой интерес представляет также тематически структурированная статистика востребованности. Для идентификации тематики информационных объектов могут использоваться широко признанные научные классификационные системы или рубрикаторы научной информации. В данной статье рассматриваются функции сервиса системы Соционет, обеспечивающего указанные тематически структурированные статистические измерения.

Ключевые слова: электронная библиотека, наукометрия, рубрикатор научной информации, система Соционет, наукометрический сервис, тематический запрос, ГРНТИ, JEL.

Детекция галлюцинаций на основе внутренних состояний больших языковых моделей

Тимур Рустемович Айсин, Татьяна Вячеславовна Шамардина

1282-1305

Аннотация:

В последние годы большие языковые модели (Large Language Models, LLM) достигли значительных успехов в области обработки естественного языка и стали ключевым инструментом для решения широкого спектра прикладных и исследовательских задач. Однако с ростом их масштабов и возможностей все более острой становится проблема галлюцинаций – генерации ложной, недостоверной или несуществующей информации, представленной в достоверной форме. В связи с этим вопросы анализа природы галлюцинаций и разработки методов их выявления приобретают особую научную и практическую значимость.

В работе изучен феномен галлюцинаций в больших языковых моделях, рассмотрены их существующая классификация и возможные причины. На базе модели Flan-T5 также исследованы различия внутренних состоянии модели при генерации галлюцинаций и верных ответов. На основе этих расхождений представлены два способа детектирования галлюцинаций: с помощью карт внимания и скрытых состояний модели. Эти методы протестированы на данных из бенчмарков HaluEval и Shroom 2024 в задачах суммаризации, ответов на вопросы, перефразирования, машинного перевода и генерации определений. Кроме того, исследована переносимость обученных детекторов между различными типами галлюцинаций, что позволило оценить универсальность предложенных методов для различных типов задач.

Ключевые слова: большие языковые модели, галлюцинации, детекция, Flan-T5, обработка естественного языка, карты внимания, внутренние состояния, HaluEval, Shroom.

Тестирование методов анализа тональности текста, основанных на словарях

Елена Викторовна Тутубалина, Владимир Владимирович Иванов, Мария Загулова, Никита Мингазов, Ильсеяр Алимова, Валентин Малых

138-162

Аннотация:

Технологии анализа тональности текста развиваются интенсивно, что обусловлено ростом объемов открытых источников, представляющих мнения пользователей интернета по различным вопросам. В статье описаны методы для анализа тональности текстов отзывов и коротких сообщений (твитов), приводятся результаты оценки их качества, которая производилась в рамках российского семинара SentiRuEval-2015.

Ключевые слова: извлечение информации, анализ тональности, классификация текстов, машинное обучение с учителем.

Применение методов машинного обучения для повышения качества тестов

Рамиль Радикович Минюков, Михаил Михайлович Абрамский

701-717

Аннотация:

Работа посвящена применению методов машинного обучения для повышения качества тестов. Проведен обзор предметной области и реализованы два метода повышения качества: поиск похожих вопросов и оценка качества дистракторов. Первый включает тестирование пяти моделей трансформеров для получения векторного представления текста и шесть алгоритмов кластеризации. Второй метод основан на использовании тех же моделей трансформеров совместно с тремя алгоритмами классификации. Результаты экспериментов показали высокую эффективность предложенных решений при решении обеих задач.

Ключевые слова: анализ тестовых вопросов, дистракторы, машинное обучение, прохождение тестов, тесты, повышение качества тестов.

Поиск слов в рукописном тексте на основе штриховой сегментации

Иван Дмитриевич Морозов, Леонид Моисеевич Местецкий

1435-1453

Аннотация:

Рукописные архивные документы составляют фундаментальную часть культурного наследия человечества, однако их анализ остается трудоемкой задачей для профессиональных исследователей-историков, филологов и лингвистов. В отличие от коммерческих приложений систем OCR (Optical Character Recognition, оптического распознавания символов), работа с историческими рукописями требует принципиально иного подхода из-за чрезвычайного многообразия почерков, наличия правок и деградации материалов.

Предложен метод поиска в рукописных текстах, основанный на штриховой сегментации. Вместо полного распознавания текста, часто недостижимого для исторических документов, метод позволяет эффективно отвечать на поисковые запросы исследователей. Ключевая идея заключается в декомпозиции текста на элементарные штрихи, формировании семантических векторных представлений с помощью контрастного обучения, последующей кластеризации и классификации для создания адаптивного словаря почерка.

Экспериментально показано, что поиск сравнением кортежей редуцированных последовательностей наиболее информативных штрихов по расстоянию Левенштейна обеспечивает достаточное качество для рассматриваемой задачи. Метод демонстрирует устойчивость к индивидуальным особенностям почерка и вариациям написания, что особенно важно для работы с авторскими архивами и историческими документами.

Предложенный подход открывает новые возможности для ускорения научных исследований в гуманитарной сфере, позволяя сократить время поиска нужной информации с недель до минут, что качественно меняет возможности исследовательской работы с большими архивами рукописных документов.

Ключевые слова: рукописный текст, поиск, штриховый анализ, сегментация, векторное представление, контрастное обучение, кластеризация.

Виртуальная выставка как средство интеграции в единое цифровое пространство научных знаний и информационные системы в области науки и культуры

Ирина Николаевна Соболевская, Александр Николаевич Сотников

98-114

Аннотация:

Рассмотрен принцип формирования виртуальных выставок как средства интеграции в Единое Цифровое Пространство Научных Знаний (ЕЦПНЗ) информационных систем в области науки и культуры с целью продвижения науки, обеспечения доступа к информации в разных областях науки, привлечения внимания к актуальным проблемам и достижениям в научной сфере. Представлены основные методы создания виртуальных выставок, включая выбор контента и разделение на основные разделы. Кроме того, предложена классификация виртуальных выставок на автономные, удаленные и комбинированные. Особое внимание уделено методологии формирования виртуальных выставок в МСЦ РАН. На примере межведомственной комбинированной виртуальной выставки предоставлено подробное описание выставки «Госпожа Пенициллин», посвященной создательнице пенициллина З. В. Ермольевой.

Ключевые слова: виртуальная выставка, Единое Цифровое Пространство Научных Знаний, Госпожа Пенициллин, связанные данные, З.В. Ермольева.

Использование аутентичных научных текстов в процессе обучения студентов решению задач дифференциальной геометрии

Инесса Васильевна Игнатушина

601-608

Аннотация: Представлена классификация задач по дифференциальной геометрии, в основе которой лежит характер связей между элементами задачи и соотношение между воспроизводящей и творческой деятельностью студентов при их решении. Показано, что важным источником для выбора текстов задач и методов их решения являются труды ученых – создателей классической дифференциальной геометрии. Работа с соответствующим научным текстом позволяет обучающемуся освоить такую образовательную стратегию, как методологическая редукция.

Ключевые слова: дифференциальная геометрия, решение задач, исторический материал.

Систематизации парадигм программирования по приоритетам принятия решений

Лидия Васильевна Городняя

666-696

Аннотация: Цель статьи – описание методики сравнения парадигм и языков программирования, отражающей выразительную силу языков, трудоёмкость реализации систем программирования и приспособленность к обоснованию практичных, объективных критериев декомпозиции программ, что можно рассматривать как подход к решению проблемы факторизации весьма усложнённых определений языков программирования и систем их поддержки. Представлены результаты анализа наиболее известных основных парадигм программирования и намечен подход к навигации в современном расширяющемся пространстве языков программирования. Систематизация парадигм учитывает особенности постановок задач программирования и семантические характеристики языков и систем программирования с акцентом на критерии качества программ и приоритеты в принятии решений при их реализации и обучении программистов.

Ключевые слова: определение языков программирования, парадигмы программирования, классификация сложных определений, семантические системы.

Условная генерация электрокардиограмм с помощью иерархических вариационных автокодировщиков

Иван Анатольевич Свиридов, Константин Сергеевич Егоров

1186-1206

Аннотация:

Сердечно-сосудистые заболевания являются одной из основных причин смертности. Автоматический анализ электрокардиограмм (ЭКГ) может существенно облегчить работу врачей, но его эффективность ограничена нехваткой и несбалансированностью данных. Создание синтетических ЭКГ помогает частично решить эти проблемы. Хотя чаще всего для этого применяются генеративно-состязательные сети (GAN), но последние исследования показали, что вариационные автокодировщики (VAE) могут обеспечивать сопоставимое качество.

В работе представлена модель cNVAE-ECG — модификация Nouveau VAE (NVAE), способная генерировать 12 отведений 10-секундных ЭКГ с различными патологиями. Используя компактную схему работы с каналами и встроенные представления классов для условной генерации, cNVAE-ECG улучшает результаты в задачах бинарной и multi-label классификации, обеспечивая прирост метрики AUROC до 2% по сравнению с моделями на основе GAN. Модель представлена в открытом доступе: https://github.com/univanxx/cNVAE_ECG.

Ключевые слова: ЭКГ, вариационный автокодировщик, условная генерация, GAN.

Метод предварительной оценки ответов обучающихся на основе векторной модели документов

Чулпан Бакиевна Миннегалиева, Гульшат Альфисовна Сабитова, Алмаз Маратович Гаялиев

324-339

Аннотация:

Рассмотрено применение векторных моделей для предварительного анализа ответов студентов, сформулированных в свободной форме. Векторные представления слов и документов получены при помощи моделей word2vec, doc2vec, BERT. Сходство ответа, данного обучающимся, и корректного ответа определялось с использованием косинусной меры. Выявлено, что векторные модели позволяют определить явно неверные ответы с достаточной точностью. Для ответов, которые близки по формулировке, предлагается провести дополнительный этап проверки. При помощи word2vec выполнена двоичная классификация ответов на определенные вопросы, приведены оценки точности, полноты, F1-меры.

Ключевые слова: векторная модель, word2vec, doc2vec, BERT, косинусное сходство, векторное представление.

Результаты поиска