• Main Navigation
  • Main Content
  • Sidebar

Электронные библиотеки

  • Главная
  • О нас
    • О журнале
    • Цели и задачи
    • Тематика
    • Главный редактор
    • Редакция
    • Отправка материалов
    • Заявление об открытом доступе
    • Заявление о конфиденциальности
    • Контакты
  • Текущий выпуск
  • Архивы
  • Регистрация
  • Вход
  • Поиск
Издается с 1998 года
ISSN 1562-5419
16+
Language
  • Русский
  • English

Найти

Расширенные фильтры

Результаты поиска

Исследование устойчивости совместной модели к возмущению начальных данных

Константин Павлович Беляев, Гурий Михайлович Михайлов, Алексей Николаевич Сальников, Наталия Павловна Тучкова
615-633
Аннотация: Задача устойчивости рассматривается в терминах классического определения Ляпунова. Для этого задается множество начальных условий, состоящих их данных предварительных расчетов, и анализируется разброс траекторий, полученных в результате численного моделирования. Эта процедура реализована как серия ансамблевых экспериментов с совместной моделью MPI-ESM института метеорологии М. Планка (Германия). Для численного моделирования задавалась серия различных начальных значений полей характеристик, и модель интегрировалась, начиная с каждого из этих полей, на различные временные периоды. Изучались экстремальные характеристики уровня океана за период 30 лет. Строилось их статистическое распределение, оценивались параметры этого распределения, изучался статистический прогноз на 5 лет вперед. Показано, что статистический прогноз уровня соответствует расчетному прогнозу, полученному по модели. Изучалась локализация экстремальных значений уровня и проводился анализ этих результатов. Численные расчеты выполнялись на суперкомпьютере Ломоносов-2 Московского государственного университета имени М.В. Ломоносова.
Ключевые слова: нелинейные модели циркуляции, численные ансамблевые эксперименты, анализ устойчивости модельных траекторий.

Проблема построения синтетических психологических данных: опыт моделирования реакций на фрустрацию

Анфиса Анваровна Чуганская, Данил Алексеевич Киреев, Иван Валентинович Смирнов, Олег Георгиевич Григорьев
1235-1252
Аннотация:

Вопрос генерации синтетических данных для психологических исследований остается актуальным и сложным. Проблемы конфиденциальности, надежности, достоверности, валидности выводов остаются неравномерно представленными для различных областей психологии и фактически оказываются взаимосвязанными с решением вопроса использования синтетических данных в смежных науках – медицине, социологии, истории, политологии, экономике. Изучение различных психологических феноменов в рамках исследований больших социальных групп сопряжено с проблемами анализа сложно формализуемых конструктов. Под синтетическими общем виде понимают данные, искусственно сгенерированные на основе алгоритмов и моделирования.


В качестве основы настоящего исследования была выбрана классификация типов реакции на фрустрацию С. Розенцвейга. При анализе сетевого дискурса существует проблема малочисленности некоторых типов. Особенно это касается класса импунитивных реакций. В работе проанализирована возможность создания корпуса синтетических данных (на примере корпуса текстов реакций на фрустрацию), сгенерированными с помощью больших языковых моделей. При проведении экспериментов экспертами были созданы промпты и выполнена генерация примеров импунитивных реакций с помощью четырех больших языковых моделей, по 10 примеров каждого типа реакций. Была также дана проведена оценка контекстной достоверности и качества генерации. Полученные результаты позволяют определить слабые стороны генерации текстов со сложными психологическими феноменами для обучения нейросетевых моделей.

Ключевые слова: фрустрация, большая языковая модель (LLM), синтетические данные, искусственный интеллект, промпт, сетевая дискуссия, классификация Розенцвейга.

О представлении результатов научного института в виде графа знаний в семантической библиотеке

Ольга Муратовна Атаева, Владимир Алексеевич Серебряков, Наталия Павловна Тучкова
798-818
Аннотация:

Новый взгляд на пространство знаний научного института составляет естественный этап развития веб-технологий. Заложенная в предыдущих исследований структура данных, позволяет организовать поиск и навигацию по ним с помощью графа знаний, как версия семантической библиотеки LibMeta. Граф знаний дает более полное и качественное представление о пространстве знаний, зачастую снимает когнитивную нагрузку в восприятии сложных структур и связей данных.

Ключевые слова: цифровая библиотека LibMeta, прикладная онтология, граф знаний, источники данных, разработка онтологии, научные результаты в цифровой среде, научный институт.

Библиотека научных предметных областей SciLibRu

Ольга Муратовна Атаева, Наталия Павловна Тучкова, Кирилл Борисович Теймуразов, Айдин Абдышов, Михаил Геннадьевич Кобук
1324-1345
Аннотация:

Работа посвящена проблеме интеграции данных для представления научных предметных областей на основе их семантического описания в цифровой библиотеке SciLibRu. В качестве модели данных использованы онтология и граф знаний библиотеки LibMeta. Наполнение библиотеки SciLibRu осуществляется путем добавления данных научных журналов. Показано, как реализованы этапы анализа слабоструктурированных научных публикаций для их встраивания в онтологию библиотеки. При прохождении всех этапов предобработки данных формируется датасет, который может быть использован в обучении языковых моделей для запросов в русскоязычных научных предметных областях.


Приложение работы заключается в создании рекомендательных систем для работы с научными русскоязычными журналами.

Ключевые слова: икладная онтология, граф знаний, источники данных, анализ слабоструктурированных научных публикаций.

Формирование расширенных поисковых запросов на основе тезауруса предметной области в онтологии знаний семантической библиотеки

271-291
Аннотация: Обсуждены возможности расширения поискового запроса при наличии тезауруса предметной области. Роль контекста, задаваемого связями терминов тезауруса, заключается как в уточнении запроса, так и в увеличении масштабов выборки по запросу. Особое значение процесс расширения запроса имеет для научных предметных областей, где поиск опирается на специальную терминологию. В этом случае необходимо использовать тезаурусы предметных областей, чтобы минимизировать появление информационного шума. Предлагаемый подход позволяет учитывать особенности применения аналогичной терминологии в различных предметных областях. Примеры использования тезауруса отдельных разделов уравнений математической физики и смежных областей демонстрируют эффективность выбранного подхода исследований. Благодаря связям с понятиями информационных ресурсов других областей знаний, расширение информационного запроса захватывает поисковые поля отдаленных предметных областей и различных типов данных, текстов, символьных, звуковых и видеоархивов. Исследования показали, что расширение запроса на основе семантики контекста улучшает качество поиска научных публикаций в цифровой информации и повышает эффективность научных междисциплинарных исследований.
Ключевые слова: сравнение научных текстов, семантический поиск, тезаурус для онтологии знаний, информационный запрос с помощью тезауруса, семантические библиотеки.

Уверенность LLM при построении семантических классификаций аргументов

Даниил Сергеевич Ларионов, Елена Николаевна Никитина, Иван Валентинович Смирнов
1155-1173
Аннотация:

Исследована проблема квантификации уверенности больших языковых моделей (Large Language Model, LLM) при автоматической семантической классификации аргументов при эмотивных предикатах. На материале русскоязычных сообщений социальных сетей проанализированы глаголы страха (пугать, бояться и др.) и эмоционального отношения (нравиться, любить) с семантическими ролями экспериенцера, каузатора и объекта. В работе дано сравнение самооценки уверенности LLM Claude Sonnet 4.5 с экспертной оценкой текстов рассуждений модели при классификации аргументов по тематической области «Здравоохранение». В эксперименте использована стратифицированная выборка из 300 примеров с применением цепочки рассуждений на русском языке и четырехступенчатой шкалы уверенности. Результаты показали умеренную корреляцию Спирмена между оценками эксперта и модели. Статистически значимая связь установлена только между самооценкой модели и фактической корректностью классификации, тогда как экспертная оценка лингвистических характеристик рассуждений не зависит от точности. Сделан вывод о том, что эксплицитные рассуждения LLM не связаны напрямую с самооценкой по степени уверенности и не влияют на процесс принятия решений; они могут являться важной функциональной частью пользовательского интерфейса, но не исследовательского.   

Ключевые слова: семантическая роль, классификация аргументов, эмотивный предикат, большие языковые модели, рассуждение LLM, уверенность LLM.

О цунамиопасности япономорских землетрясений

Дмитрий Евгеньевич Золотухин, Татьяна Николаевна Ивельская
77-87
Аннотация:

Использовав численное моделирование цунами, мы рассмотрели зависимость цунамиопасности подводных землетрясений в Японском море от магнитуды и глубины гипоцентра. Полученные данные крайне востребованы в работе сахалинского Центра цунами. Они могут быть использованы для детализации магнитудно-географического критерия цунамиопасности с целью сокращения числа как ложных тревог, так и пропусков цунами на Дальнем Востоке России.

Ключевые слова: землетрясение, цунами, цунамиопасность, магнитуда, гипоцентр, тревога цунами, магнитудно-географический критерий цунамиопасности, Японское море, Дальний Восток России, сахалинский Центр цунами.

Интернет вещей – «цифровым аборигенам» и их родителям

Диана Александровна Богданова
72-81
Аннотация: На основании публикаций в западной научной литературе и средствах массовой информации рассмотрено разнообразие интернет-игрушек, предлагаемых на рынке в настоящее время. Сформулированы ожидания по взаимодействию компаний-производителей с потребителями продукции. Приведены рекомендации для родителей по покупке и пользованию интернет-игрушками.
Ключевые слова: интернет-игрушки, безопасность интернет-игрушек, соблюдение конфиденциальности, персональные данные, защита конфиденциальности, цифровые аборигены, игрушки «в реале», «Хелло, Барби!».

Тенденции развития технологий обработки больших данных и инструментария хранения разноформатных данных и аналитики

Марат Рамилевич Биктимиров, Александр Михайлович Елизаров, Андрей Юрьевич Щербаков
390-407
Аннотация:

Статья посвящена анализу тенденций развития технологий обработки Больших Данных и инструментария хранения разноформатных данных и аналитики, который проведен в рамках работ по программе фундаментальных исследований Отделения математических наук РАН «Алгебраические и комбинаторные методы математической кибернетики и информационные системы нового поколения», а также гранта РФФИ № 14-07-00783 «Способы хранения и обработки большого объема научно-справочных данных на современных аппаратных платформах».

Ключевые слова: большие данные, анализ, информация, программное обеспечение, распределенные вычисления, системы хранения, облачные технологии.

Об онтологии адресата в математической предметной области

Александр Александрович Муромский, Наталия Павловна Тучкова
506-533
Аннотация: Обсуждена проблема представления математических предметных областей в цифровых библиотеках и полезности этих ресурсов для специалистов. Дан вариант представления математических предметных областей в интернете. В качестве информационной модели для единицы записи выбрана статья тезауруса. Реализация схемы показана на примере уравнений с частными производными. Предложен подход к организации информационного пространства автора, основанный на использовании тезауруса адресата. На основе описаний предметных областей индивидуумов предполагается построение онтологии научного междисциплинарного сообщества, что, по мнению авторов, позволит не утерять новый результат или открытие в науке, соблюсти приоритеты авторов, встроить новое знание в устоявшуюся систему классических предметных областей.
Ключевые слова: контролируемая лексика, дескрипторные словари, тезауруса адресата, онтология адресата.

Вопросы интеграции управления идентификацией пользователей сетевых, вычислительных и информационных сервисов

А.В. Созыкин, Г.Ф. Масич, А.Г. Масич, А.Н. Бездушный
Аннотация: В статье рассматривается подход к управлению идентификацией пользователей корпоративной сети учреждений РАН. Управление идентификацией представляет собой процесс, охватывающий весь жизненный цикл учетных записей пользователей и контроль над правами доступа в распределенных средах. Рассматриваемый подох позволяет интегрировать управление идентификацией пользователей сетевых, вычислительных и информационных сервисов. Архитектура предлагаемого решения основывается на открытых стандартах, использовании многоуровневой компонентной архитектуры LDAP-систем (OpenLDAP, iPlanet Directory) и доступа к ним как через локальные, так и через глобальные сети. Эти работы поддержаны грантами РФФИ 03-07-90140в, 04-07-96003, 02-07-90305ск.
В качестве основного вида хранилищ конфигурационной информации сетевых сервисов сейчас обычно рассматриваются LDAP каталоги. Во множестве конфигурационной информации сетевых сервисов выделяются данные, представляющие интерес для информационно-справочных сервисов – так называемые «метаданные сетевых сервисов».
Поскольку LDAP каталоги часто используются в качестве корпоративных справочников общего назначения, чтобы осуществить принципы «единой точки доступа», «согласованной модификации данных» как информационной, так и сетевой и вычислительной инфраструктур научного учреждения, проводится сравнение схем метаданных информационно-справочных системы ИСИР и стандартных схем LDAP каталогов.
Кроме того, уделяется внимание и такому варианту использования LDAP каталогов как репозитория хранимых объектов информационно-справочных сервисов. Предлагается способы отображения RDFS схемы данных в LDAP схемы.

Оркестрация методов анализа научных данных в процессах рецензирования

Ольга Муратовна Атаева, Наталия Павловна Тучкова
655-680
Аннотация:

Исследована проблема сочетания методов в задаче семантического анализа научных данных и публикаций при рецензировании. На разных этапах обработки данных в системе SciLibRu использованы различные методы, построена многоуровневая онтология, наполнен граф знаний, что приводит к формированию новой структуры данных, отличной от исходной. Каждый метод по отдельности приобретает свое назначение в такой системе, при этом в совокупности их сочетание приводит к возникновению новых свойств, которые стали предметом настоящих исследований. Приведен пример автоматического агента рецензирования с объяснимым результатом.

Ключевые слова: оркестрация методов, семантический анализ, онтология предметной области, граф знаний, большие языковые модели, системы, категории, динамические структуры.

Разделение процессов потоков тепла в Северной Атлантике на различные составляющие и их анализ

Наталия Павловна Тучкова, Константин Павлович Беляев, Гурий Михайлович Михайлов, Ксения Алексеевна Ромашина
486-502
Аннотация:

Изучено распределение потоков тепла в Северной Атлантике, рассчитанное по схеме стохастического разностного уравнения, а именно по авторегрессионной схеме первого порядка со случайными коэффициентами. Использована база данных ERA 5, содержащая геофизические данные за 40 лет, с 1979 по 2018 г. Коэффициенты для последовательности авторегрессии определены на основе этих данных ранее и показано, что условия на коэффициенты обеспечивают существование и единственность решения этого разностного уравнения. Метод расчета распределений основан на последовательном интегрировании с использованием авторегрессионной схемы. Выполнены численные эксперименты и проведен их анализ. Установлено, что теоретически рассчитанные распределения хорошо соответствуют своим эмпирическим аналогам. Кроме того, при разбиении исходного временного ряда на выделенное среднее (тренд) и остаток, последний проанализирован как стационарный случайный процесс. Построены выборочные корреляционные функции и показано, что они хорошо аппроксимируются известными аналитическими выражениями, которые допускают фильтрацию и прогноз искомого процесса в явном виде. Численные расчеты выполнены на суперкомпьютере «Ломоносов-2» Московского государственного университета имени М. В. Ломоносова.

Ключевые слова: анализ данных наблюдений, диффузионный стохастический процесс, изменчивость теплового потока, уравнение Фоккера–Планка–Колмогорова, стохастическое разностное уравнение, уравнение Фредгольма.

Управление качеством математической подготовки в общем и высшем образовании

Тамара Ильинична Уткина
455-464
Аннотация: Обсуждается актуальность управления качеством математической подготовки обучающихся, осваивающих программы общего и высшего образования. Даны характеристика этого процесса, проблематика, обозначены управленческие действия на уровне организации. Представлены результаты педагогических исследований образовательных организаций общего и высшего образования Восточной зоны Оренбургской области, полученные в рамках выполнения научного исследования «Управление качеством в общем и профессиональном образовании» (номер госрегистрации НИОКТР № 01201151519).
Ключевые слова: качество, математическая подготовка, управление, общее, высшее, образование.

Анализ внутригодовой изменчивости потоков тепла в Северной Атлантике на основе аппроксимации траекторий стохастического диффузионного процесса

Наталия Павловна Тучкова, Константин Павлович Беляев, Гурий Михайлович Михайлов, Ксения Алексеевна Ромашина
1090-1108
Аннотация:

Для анализа потоков тепла использованы данные наблюдений за 1979–2018 гг. в районе Северной Атлантики. Пространственно-временная изменчивость полного потока тепла моделировалась стохастическим диффузионным процессом. Коэффициенты стохастического дифференциального уравнения были оценены методами непараметрической статистики. Ранее существование и единственность решения в сильном смысле стохастического дифференциального уравнения, порожденного построенным диффузионным процессом, были доказаны при выполнении условий Колмогорова. В настоящей работе коэффициенты уравнения аппроксимировались по времени тригонометрическими полиномами, амплитуды и фазы которых зависели от значений потока. По заданному ряду длиной 40 лет с 1979 по 2018 г. были построены пространственные карты и временные кривые. Результаты показаны для 1999 и 2018 годов., а также произведен их сравнительный анализ. Численные расчеты были проведены на суперкомпьютере «Ломоносов-2» МГУ имени М.В. Ломоносова.

Ключевые слова: анализ временных рядов, климатический сезонный ход, максимальные и минимальные значения тепловых потоков и температуры внутри климатического года, аппроксимация коэффициентов стохастического дифференциального уравнения.

Реализация одного решения при переходе с CentOS на РЕД ОС для кластера высокой доступности

Гурий Михайлович Михайлов, Наталия Павловна Тучкова, Андрей Михайлович Чернецов
145-155
Аннотация:

Представлен краткий аналитический обзор популярных отечественных дистрибутивов операционных систем, разработанных в рамках реализации задач технологической независимости в области программного обеспечения и средств телекоммуникации. Описано одно из решений перехода с системы CentOS на систему РЕД ОС (RED OS) для кластера высокой доступности на базе Pacemaker и распределенной файловой системы DRBD, обеспечившего работу сайта организации и сервера баз данных MySQL.

Ключевые слова: импортозамещение, РЕД ОС-сертифицированная, Pacemaker.

Из опыта использования метода ступенчатых представлений при подготовке школьников к научно-практическим фестивалям

Владимир Иванович Кругленко, Мансур Файзрахманович Гильмуллин
619-626
Аннотация: Цифровизация экономики России требует соответствующих преобразований в системе образования и подготовки кадров. Преобразования в системе среднего образования нужно начинать в предметной области «Математика и информатика». В работе показан опыт подготовки и участия учащихся школ в секциях математики, информатики, биоинформатики научно-практических конференций.
Ключевые слова: ступенчатые представления, научно-практические конференции, представление обыкновенных дробей, воспроизведение двоичных последовательностей, моделирование биологических объектов, моделирование хаотических структур.

Повышение устойчивости классификации коротких текстов к стохастическому шуму на основе плотностной очистки обучающих выборок

Басар Бауржанович Баишев, Андрей Петрович Халов
681-698
Аннотация:

Рассмотрена задача классификации коротких текстовых заявок в условиях значительного дисбаланса классов и зашумленности реальных потоков обращений. Показана ограниченная эффективность методов синтетического расширения выборки при работе с зашумленной разметкой. Предложен гибридный метод, сочетающий предварительную плотностную очистку данных и многоуровневое ансамблирование моделей. Применение алгоритма плотностной кластеризации позволило исключить 16.5% информационного шума от общего объема выборки. Финальная модель представлена двухуровневой архитектурой и оптимизирована с помощью байесовского поиска гиперпараметров. На отложенной тестовой выборке достигнуто значение метрики R@3, равное 97.4%. Предложенный метод позволяет автоматизировать процесс распределения заявок, существенно снижая нагрузку на операторов и сокращая время диспетчеризации обращений.

Ключевые слова: обработка естественного языка, зашумленные текстовые данные, ансамблевое обучение, робастная классификация, фильтрация шума.

Управление Сетевыми Электронными Службами Проект CANDLE

Харлампос Фармакис, Эндрю Кокс, Дракулис Мартакос

Онтологический подход к проектированию микросервисной архитектуры

Евгений Александрович Малых, Андрей Алексеевич Блощук, Ольга Муратовна Атаева
822-841
Аннотация:

Несмотря на широкое использование микросервисной архитектуры в разработке программных систем, в настоящее время не существует формализованного подхода, обеспечивающего согласованное и гарантированное взаимодействие микросервисов на уровне передаваемых данных, что приводит к возникновению интеграционных ошибок и усложняет сопровождение распределенных систем. В работе предложен подход к организации взаимодействия микросервисов на основе онтологического моделирования, обеспечивающего формализацию структур данных и автоматизированную валидацию сообщений. Предложен метод преобразования в онтологических моделей формальных описаний схем данных основанный на спецификации схем GraphQL. Он позволяет автоматизировать процесс валидации данных и снизить количество интеграционных ошибок. Разработана также онтологическая модель, обеспечивающая анализ зависимостей между микросервисами и механизм валидации контрактов сообщений.


Практическая значимость работы заключается в достижении согласованного описания микросервисов, операций и форматов сообщений в результате использования онтологического подхода. Представление онтологии в виде графа позволяет анализировать зависимости между микросервисами и упрощает сопровождение крупных распределенных систем.

Ключевые слова: онтология, GraphQL Schema, интеграция данных, микросервисная архитектура, потоки сообщений, валидация данных, межсервисное взаимодействие, онтологическая модель, согласованность данных, управление схемами, шина данных.

Служба управления потоками работ по манипулированию ресурсами репозитория

А.К. Нестеренко, А.А. Бездушный, Т.М. Сысоев, А.Н. Бездушный, В.А. Серебряков
Аннотация: В работе рассматриваются проблемы и задачи, возникающие при манипулировании ресурсами репозиториев цифровых библиотек, информационных Интернет систем и порталов. Анализируются соответствующие требования к службе управления потоками работ, которая в этом случае должна обеспечить управление созданием и модификацией информационных ресурсов произвольных типов. Описывается реализация такой службы, ее роль и место в новой версии системы ИСИР [8, 9, 10]. Реализация следует стандартам WfMC [4]; канонической модели и языку спецификации потоков работ [5]. Решение демонстрируется в применении к управлению потоками работ по сопровождению ресурсов Информационного Web-портала РАН [11].

VR-телеуправление «многорукими» устройствами: проблемы, гипотезы, постановка задачи

Влада Владимировна Кугуракова, Игорь Дмитриевич Сергунин, Евгений Юрьевич Зыков, Олег Дмитриевич Сергунин, Алексей Валерьевич Уланов, Динара Рустамовна Габдуллина, Артем Шамилевич Гилемянов
441-471
Аннотация:

Рассмотрены различные решения, существующие в области дистанционного управления роботизированными устройствами, оснащенными манипуляторами. Представлены новые подходы к организации совместного телеуправления множеством манипуляторов, с использованием различных пользовательских входов. Проанализированы следующие сценарии использования: архитектура системы с множеством манипуляторов и пользовательские интерфейсы управления, включая такие перспективные направления, как глубокое машинное обучение и нейроинтерфейсы.

Ключевые слова: виртуальная реальность, телеуправление, робот, ко-бот, робототехника, совместное телеуправление, телеимпенданс, когнитивное радио.

Система тестирования контроллеров, основанная на распознавании текста на экране

Александр Александрович Докукин
1368-1384
Аннотация:

Описано решение задачи тестирования контроллеров на основе чтения информации с их экрана. Для этого разработана программно-аппаратная система, состоящая из камеры и программных модулей, реализующих необходимые алгоритмы и методы: модуля предобработки изображения; модуля определения типа меню; модуля обработки символов шрифта; модуль чтения текста, в том числе, написанного различными шрифтами; собственно модуля тестирования. Система реализована для контроллеров определенного типа с монохромным дисплеем 128 х 64 точек. Все методы реализованы на языке Python с использованием популярных библиотек. Система внедрена в эксплуатацию и на данный момент осуществляет автоматизацию нескольких наиболее трудоемких тестов. Поддерживается расширение их набора в виде плагинов.

Ключевые слова: компьютерное зрение, распознавание текста, тестирование контроллеров.

Управление рисками и факторы уязвимости критической инфраструктуры

Надежда Павловна Комендантова
88-108
Аннотация:

Рассмотрены подходы к управлению рисками для таких сложных систем критической инфраструктуры, как система энергетики, и факторы, влияющие на уязвимость критической энергетической инфраструктуры в странах Европейского Союза.

Ключевые слова: факторы уязвимости, управление рисками, оценка рисков, каскадные эффекты, местный, национальный и межрегиональный уровни управления, линии передачи и распределения электроэнергии, тотальное отключение электричества.

Разработка интеллектуальной системы поиска для математического архива публикаций

Алексей Алексеевич Насибулин, Ольга Муратовна Атаева
860-876
Аннотация:

В работе проведено исследование, связанное с поиском схожих документов по математике. Разработан рекомендательный алгоритм нахождения похожих научных статей по данной тематике, использующий приоритетный поиск по математическим формулам с текстовым подкреплением.


Выполнен перевод текста из графического в текстовое представление через технологию OCR для последующего анализа и индексации. В процессе анализа реализовано разбиение текста на блоки с последующим извлечением из текста значимых формул, ключевых слов и фраз. В процессе индексации сформирована векторная база данных на основе векторных представлений формул, полученных через процесс эмбеддинга. Результаты индексации использованы при поиске статей, имеющих сходство с документом, подаваемым пользователем на вход алгоритма. Получен список похожих статей с сортировкой результатов по метрике близости векторных представлений формул.


Исходные данные представляют собой около 5000 научных статей, посвященных различным исследованиями по математической тематике и представленных в виде PDF-файлов.


Эксперимент проведен на основе данных конкретного контента библиотечной системы, но предложенная технология может быть распространена на другие библиотечные системы, в том числе содержащие статьи по другим тематикам, например, по физике и другим точным наукам.

Ключевые слова: поиск по формулам, семантика, извлечение знаний, математический поиск, семантический поиск.
1 - 25 из 40 результатов 1 2 > >> 
Информация
  • Для читателей
  • Для авторов
  • Для библиотек
Отправить материал
Текущий выпуск
  • Логотип Atom
  • Логотип RSS2
  • Логотип RSS1

Электронные библиотеки

ISSN 1562-5419

Информация

  • О журнале
  • Цели и задачи
  • Тематика
  • Руководство для авторов
  • Отправка материалов
  • Заявление о конфиденциальности
  • Контакты
  • eLIBRARY.RU
  • dblp computer science bibliography

Отправить статью

Авторам нужно зарегистрироваться в журнале перед отправкой материалов, или, если вы уже зарегистрированы, можно просто войти со своей учетной записью и начать процесс отправки, состоящий из пяти шагов.

Отправить материал
Больше информации об этой издательской системе, платформе и рабочем процессе от OJS/PKP.

© 2015-2026 Казанский (Приволжский) федеральный университет; Институт развития информационного общества