• Main Navigation
  • Main Content
  • Sidebar

Электронные библиотеки

  • Главная
  • О нас
    • О журнале
    • Цели и задачи
    • Тематика
    • Главный редактор
    • Редакция
    • Отправка материалов
    • Заявление об открытом доступе
    • Заявление о конфиденциальности
    • Контакты
  • Текущий выпуск
  • Архивы
  • Регистрация
  • Вход
  • Поиск
Издается с 1998 года
ISSN 1562-5419
16+
Language
  • Русский
  • English

Найти

Расширенные фильтры

Результаты поиска

Проблема построения синтетических психологических данных: опыт моделирования реакций на фрустрацию

Анфиса Анваровна Чуганская, Данил Алексеевич Киреев, Иван Валентинович Смирнов, Олег Георгиевич Григорьев
1235-1252
Аннотация:

Вопрос генерации синтетических данных для психологических исследований остается актуальным и сложным. Проблемы конфиденциальности, надежности, достоверности, валидности выводов остаются неравномерно представленными для различных областей психологии и фактически оказываются взаимосвязанными с решением вопроса использования синтетических данных в смежных науках – медицине, социологии, истории, политологии, экономике. Изучение различных психологических феноменов в рамках исследований больших социальных групп сопряжено с проблемами анализа сложно формализуемых конструктов. Под синтетическими общем виде понимают данные, искусственно сгенерированные на основе алгоритмов и моделирования.


В качестве основы настоящего исследования была выбрана классификация типов реакции на фрустрацию С. Розенцвейга. При анализе сетевого дискурса существует проблема малочисленности некоторых типов. Особенно это касается класса импунитивных реакций. В работе проанализирована возможность создания корпуса синтетических данных (на примере корпуса текстов реакций на фрустрацию), сгенерированными с помощью больших языковых моделей. При проведении экспериментов экспертами были созданы промпты и выполнена генерация примеров импунитивных реакций с помощью четырех больших языковых моделей, по 10 примеров каждого типа реакций. Была также дана проведена оценка контекстной достоверности и качества генерации. Полученные результаты позволяют определить слабые стороны генерации текстов со сложными психологическими феноменами для обучения нейросетевых моделей.

Ключевые слова: фрустрация, большая языковая модель (LLM), синтетические данные, искусственный интеллект, промпт, сетевая дискуссия, классификация Розенцвейга.

Исследование устойчивости совместной модели к возмущению начальных данных

Константин Павлович Беляев, Гурий Михайлович Михайлов, Алексей Николаевич Сальников, Наталия Павловна Тучкова
615-633
Аннотация: Задача устойчивости рассматривается в терминах классического определения Ляпунова. Для этого задается множество начальных условий, состоящих их данных предварительных расчетов, и анализируется разброс траекторий, полученных в результате численного моделирования. Эта процедура реализована как серия ансамблевых экспериментов с совместной моделью MPI-ESM института метеорологии М. Планка (Германия). Для численного моделирования задавалась серия различных начальных значений полей характеристик, и модель интегрировалась, начиная с каждого из этих полей, на различные временные периоды. Изучались экстремальные характеристики уровня океана за период 30 лет. Строилось их статистическое распределение, оценивались параметры этого распределения, изучался статистический прогноз на 5 лет вперед. Показано, что статистический прогноз уровня соответствует расчетному прогнозу, полученному по модели. Изучалась локализация экстремальных значений уровня и проводился анализ этих результатов. Численные расчеты выполнялись на суперкомпьютере Ломоносов-2 Московского государственного университета имени М.В. Ломоносова.
Ключевые слова: нелинейные модели циркуляции, численные ансамблевые эксперименты, анализ устойчивости модельных траекторий.

Формирование расширенных поисковых запросов на основе тезауруса предметной области в онтологии знаний семантической библиотеки

271-291
Аннотация: Обсуждены возможности расширения поискового запроса при наличии тезауруса предметной области. Роль контекста, задаваемого связями терминов тезауруса, заключается как в уточнении запроса, так и в увеличении масштабов выборки по запросу. Особое значение процесс расширения запроса имеет для научных предметных областей, где поиск опирается на специальную терминологию. В этом случае необходимо использовать тезаурусы предметных областей, чтобы минимизировать появление информационного шума. Предлагаемый подход позволяет учитывать особенности применения аналогичной терминологии в различных предметных областях. Примеры использования тезауруса отдельных разделов уравнений математической физики и смежных областей демонстрируют эффективность выбранного подхода исследований. Благодаря связям с понятиями информационных ресурсов других областей знаний, расширение информационного запроса захватывает поисковые поля отдаленных предметных областей и различных типов данных, текстов, символьных, звуковых и видеоархивов. Исследования показали, что расширение запроса на основе семантики контекста улучшает качество поиска научных публикаций в цифровой информации и повышает эффективность научных междисциплинарных исследований.
Ключевые слова: сравнение научных текстов, семантический поиск, тезаурус для онтологии знаний, информационный запрос с помощью тезауруса, семантические библиотеки.

Уверенность LLM при построении семантических классификаций аргументов

Даниил Сергеевич Ларионов, Елена Николаевна Никитина, Иван Валентинович Смирнов
1155-1173
Аннотация:

Исследована проблема квантификации уверенности больших языковых моделей (Large Language Model, LLM) при автоматической семантической классификации аргументов при эмотивных предикатах. На материале русскоязычных сообщений социальных сетей проанализированы глаголы страха (пугать, бояться и др.) и эмоционального отношения (нравиться, любить) с семантическими ролями экспериенцера, каузатора и объекта. В работе дано сравнение самооценки уверенности LLM Claude Sonnet 4.5 с экспертной оценкой текстов рассуждений модели при классификации аргументов по тематической области «Здравоохранение». В эксперименте использована стратифицированная выборка из 300 примеров с применением цепочки рассуждений на русском языке и четырехступенчатой шкалы уверенности. Результаты показали умеренную корреляцию Спирмена между оценками эксперта и модели. Статистически значимая связь установлена только между самооценкой модели и фактической корректностью классификации, тогда как экспертная оценка лингвистических характеристик рассуждений не зависит от точности. Сделан вывод о том, что эксплицитные рассуждения LLM не связаны напрямую с самооценкой по степени уверенности и не влияют на процесс принятия решений; они могут являться важной функциональной частью пользовательского интерфейса, но не исследовательского.   

Ключевые слова: семантическая роль, классификация аргументов, эмотивный предикат, большие языковые модели, рассуждение LLM, уверенность LLM.

О представлении результатов научного института в виде графа знаний в семантической библиотеке

Ольга Муратовна Атаева, Владимир Алексеевич Серебряков, Наталия Павловна Тучкова
798-818
Аннотация:

Новый взгляд на пространство знаний научного института составляет естественный этап развития веб-технологий. Заложенная в предыдущих исследований структура данных, позволяет организовать поиск и навигацию по ним с помощью графа знаний, как версия семантической библиотеки LibMeta. Граф знаний дает более полное и качественное представление о пространстве знаний, зачастую снимает когнитивную нагрузку в восприятии сложных структур и связей данных.

Ключевые слова: цифровая библиотека LibMeta, прикладная онтология, граф знаний, источники данных, разработка онтологии, научные результаты в цифровой среде, научный институт.

Библиотека научных предметных областей SciLibRu

Ольга Муратовна Атаева, Наталия Павловна Тучкова, Кирилл Борисович Теймуразов, Айдин Абдышов, Михаил Геннадьевич Кобук
1324-1345
Аннотация:

Работа посвящена проблеме интеграции данных для представления научных предметных областей на основе их семантического описания в цифровой библиотеке SciLibRu. В качестве модели данных использованы онтология и граф знаний библиотеки LibMeta. Наполнение библиотеки SciLibRu осуществляется путем добавления данных научных журналов. Показано, как реализованы этапы анализа слабоструктурированных научных публикаций для их встраивания в онтологию библиотеки. При прохождении всех этапов предобработки данных формируется датасет, который может быть использован в обучении языковых моделей для запросов в русскоязычных научных предметных областях.


Приложение работы заключается в создании рекомендательных систем для работы с научными русскоязычными журналами.

Ключевые слова: икладная онтология, граф знаний, источники данных, анализ слабоструктурированных научных публикаций.

Управление качеством математической подготовки в общем и высшем образовании

Тамара Ильинична Уткина
455-464
Аннотация: Обсуждается актуальность управления качеством математической подготовки обучающихся, осваивающих программы общего и высшего образования. Даны характеристика этого процесса, проблематика, обозначены управленческие действия на уровне организации. Представлены результаты педагогических исследований образовательных организаций общего и высшего образования Восточной зоны Оренбургской области, полученные в рамках выполнения научного исследования «Управление качеством в общем и профессиональном образовании» (номер госрегистрации НИОКТР № 01201151519).
Ключевые слова: качество, математическая подготовка, управление, общее, высшее, образование.

Анализ внутригодовой изменчивости потоков тепла в Северной Атлантике на основе аппроксимации траекторий стохастического диффузионного процесса

Наталия Павловна Тучкова, Константин Павлович Беляев, Гурий Михайлович Михайлов, Ксения Алексеевна Ромашина
1090-1108
Аннотация:

Для анализа потоков тепла использованы данные наблюдений за 1979–2018 гг. в районе Северной Атлантики. Пространственно-временная изменчивость полного потока тепла моделировалась стохастическим диффузионным процессом. Коэффициенты стохастического дифференциального уравнения были оценены методами непараметрической статистики. Ранее существование и единственность решения в сильном смысле стохастического дифференциального уравнения, порожденного построенным диффузионным процессом, были доказаны при выполнении условий Колмогорова. В настоящей работе коэффициенты уравнения аппроксимировались по времени тригонометрическими полиномами, амплитуды и фазы которых зависели от значений потока. По заданному ряду длиной 40 лет с 1979 по 2018 г. были построены пространственные карты и временные кривые. Результаты показаны для 1999 и 2018 годов., а также произведен их сравнительный анализ. Численные расчеты были проведены на суперкомпьютере «Ломоносов-2» МГУ имени М.В. Ломоносова.

Ключевые слова: анализ временных рядов, климатический сезонный ход, максимальные и минимальные значения тепловых потоков и температуры внутри климатического года, аппроксимация коэффициентов стохастического дифференциального уравнения.

Реализация одного решения при переходе с CentOS на РЕД ОС для кластера высокой доступности

Гурий Михайлович Михайлов, Наталия Павловна Тучкова, Андрей Михайлович Чернецов
145-155
Аннотация:

Представлен краткий аналитический обзор популярных отечественных дистрибутивов операционных систем, разработанных в рамках реализации задач технологической независимости в области программного обеспечения и средств телекоммуникации. Описано одно из решений перехода с системы CentOS на систему РЕД ОС (RED OS) для кластера высокой доступности на базе Pacemaker и распределенной файловой системы DRBD, обеспечившего работу сайта организации и сервера баз данных MySQL.

Ключевые слова: импортозамещение, РЕД ОС-сертифицированная, Pacemaker.

Из опыта использования метода ступенчатых представлений при подготовке школьников к научно-практическим фестивалям

Владимир Иванович Кругленко, Мансур Файзрахманович Гильмуллин
619-626
Аннотация: Цифровизация экономики России требует соответствующих преобразований в системе образования и подготовки кадров. Преобразования в системе среднего образования нужно начинать в предметной области «Математика и информатика». В работе показан опыт подготовки и участия учащихся школ в секциях математики, информатики, биоинформатики научно-практических конференций.
Ключевые слова: ступенчатые представления, научно-практические конференции, представление обыкновенных дробей, воспроизведение двоичных последовательностей, моделирование биологических объектов, моделирование хаотических структур.

О цунамиопасности япономорских землетрясений

Дмитрий Евгеньевич Золотухин, Татьяна Николаевна Ивельская
77-87
Аннотация:

Использовав численное моделирование цунами, мы рассмотрели зависимость цунамиопасности подводных землетрясений в Японском море от магнитуды и глубины гипоцентра. Полученные данные крайне востребованы в работе сахалинского Центра цунами. Они могут быть использованы для детализации магнитудно-географического критерия цунамиопасности с целью сокращения числа как ложных тревог, так и пропусков цунами на Дальнем Востоке России.

Ключевые слова: землетрясение, цунами, цунамиопасность, магнитуда, гипоцентр, тревога цунами, магнитудно-географический критерий цунамиопасности, Японское море, Дальний Восток России, сахалинский Центр цунами.

Интернет вещей – «цифровым аборигенам» и их родителям

Диана Александровна Богданова
72-81
Аннотация: На основании публикаций в западной научной литературе и средствах массовой информации рассмотрено разнообразие интернет-игрушек, предлагаемых на рынке в настоящее время. Сформулированы ожидания по взаимодействию компаний-производителей с потребителями продукции. Приведены рекомендации для родителей по покупке и пользованию интернет-игрушками.
Ключевые слова: интернет-игрушки, безопасность интернет-игрушек, соблюдение конфиденциальности, персональные данные, защита конфиденциальности, цифровые аборигены, игрушки «в реале», «Хелло, Барби!».

Тенденции развития технологий обработки больших данных и инструментария хранения разноформатных данных и аналитики

Марат Рамилевич Биктимиров, Александр Михайлович Елизаров, Андрей Юрьевич Щербаков
390-407
Аннотация:

Статья посвящена анализу тенденций развития технологий обработки Больших Данных и инструментария хранения разноформатных данных и аналитики, который проведен в рамках работ по программе фундаментальных исследований Отделения математических наук РАН «Алгебраические и комбинаторные методы математической кибернетики и информационные системы нового поколения», а также гранта РФФИ № 14-07-00783 «Способы хранения и обработки большого объема научно-справочных данных на современных аппаратных платформах».

Ключевые слова: большие данные, анализ, информация, программное обеспечение, распределенные вычисления, системы хранения, облачные технологии.

Об онтологии адресата в математической предметной области

Александр Александрович Муромский, Наталия Павловна Тучкова
506-533
Аннотация: Обсуждена проблема представления математических предметных областей в цифровых библиотеках и полезности этих ресурсов для специалистов. Дан вариант представления математических предметных областей в интернете. В качестве информационной модели для единицы записи выбрана статья тезауруса. Реализация схемы показана на примере уравнений с частными производными. Предложен подход к организации информационного пространства автора, основанный на использовании тезауруса адресата. На основе описаний предметных областей индивидуумов предполагается построение онтологии научного междисциплинарного сообщества, что, по мнению авторов, позволит не утерять новый результат или открытие в науке, соблюсти приоритеты авторов, встроить новое знание в устоявшуюся систему классических предметных областей.
Ключевые слова: контролируемая лексика, дескрипторные словари, тезауруса адресата, онтология адресата.

Вопросы интеграции управления идентификацией пользователей сетевых, вычислительных и информационных сервисов

А.В. Созыкин, Г.Ф. Масич, А.Г. Масич, А.Н. Бездушный
Аннотация: В статье рассматривается подход к управлению идентификацией пользователей корпоративной сети учреждений РАН. Управление идентификацией представляет собой процесс, охватывающий весь жизненный цикл учетных записей пользователей и контроль над правами доступа в распределенных средах. Рассматриваемый подох позволяет интегрировать управление идентификацией пользователей сетевых, вычислительных и информационных сервисов. Архитектура предлагаемого решения основывается на открытых стандартах, использовании многоуровневой компонентной архитектуры LDAP-систем (OpenLDAP, iPlanet Directory) и доступа к ним как через локальные, так и через глобальные сети. Эти работы поддержаны грантами РФФИ 03-07-90140в, 04-07-96003, 02-07-90305ск.
В качестве основного вида хранилищ конфигурационной информации сетевых сервисов сейчас обычно рассматриваются LDAP каталоги. Во множестве конфигурационной информации сетевых сервисов выделяются данные, представляющие интерес для информационно-справочных сервисов – так называемые «метаданные сетевых сервисов».
Поскольку LDAP каталоги часто используются в качестве корпоративных справочников общего назначения, чтобы осуществить принципы «единой точки доступа», «согласованной модификации данных» как информационной, так и сетевой и вычислительной инфраструктур научного учреждения, проводится сравнение схем метаданных информационно-справочных системы ИСИР и стандартных схем LDAP каталогов.
Кроме того, уделяется внимание и такому варианту использования LDAP каталогов как репозитория хранимых объектов информационно-справочных сервисов. Предлагается способы отображения RDFS схемы данных в LDAP схемы.

Оркестрация методов анализа научных данных в процессах рецензирования

Ольга Муратовна Атаева, Наталия Павловна Тучкова
655-680
Аннотация:

Исследована проблема сочетания методов в задаче семантического анализа научных данных и публикаций при рецензировании. На разных этапах обработки данных в системе SciLibRu использованы различные методы, построена многоуровневая онтология, наполнен граф знаний, что приводит к формированию новой структуры данных, отличной от исходной. Каждый метод по отдельности приобретает свое назначение в такой системе, при этом в совокупности их сочетание приводит к возникновению новых свойств, которые стали предметом настоящих исследований. Приведен пример автоматического агента рецензирования с объяснимым результатом.

Ключевые слова: оркестрация методов, семантический анализ, онтология предметной области, граф знаний, большие языковые модели, системы, категории, динамические структуры.

Разделение процессов потоков тепла в Северной Атлантике на различные составляющие и их анализ

Наталия Павловна Тучкова, Константин Павлович Беляев, Гурий Михайлович Михайлов, Ксения Алексеевна Ромашина
486-502
Аннотация:

Изучено распределение потоков тепла в Северной Атлантике, рассчитанное по схеме стохастического разностного уравнения, а именно по авторегрессионной схеме первого порядка со случайными коэффициентами. Использована база данных ERA 5, содержащая геофизические данные за 40 лет, с 1979 по 2018 г. Коэффициенты для последовательности авторегрессии определены на основе этих данных ранее и показано, что условия на коэффициенты обеспечивают существование и единственность решения этого разностного уравнения. Метод расчета распределений основан на последовательном интегрировании с использованием авторегрессионной схемы. Выполнены численные эксперименты и проведен их анализ. Установлено, что теоретически рассчитанные распределения хорошо соответствуют своим эмпирическим аналогам. Кроме того, при разбиении исходного временного ряда на выделенное среднее (тренд) и остаток, последний проанализирован как стационарный случайный процесс. Построены выборочные корреляционные функции и показано, что они хорошо аппроксимируются известными аналитическими выражениями, которые допускают фильтрацию и прогноз искомого процесса в явном виде. Численные расчеты выполнены на суперкомпьютере «Ломоносов-2» Московского государственного университета имени М. В. Ломоносова.

Ключевые слова: анализ данных наблюдений, диффузионный стохастический процесс, изменчивость теплового потока, уравнение Фоккера–Планка–Колмогорова, стохастическое разностное уравнение, уравнение Фредгольма.

Коммуникативная предвзятость ASR при распознавании атипичной речи на русском языке

Анастасия Владимировна Колмогорова, Екатерина Валерьевна Явшиц, Милана Святославна Майорова, Софья Владимировна Дмитриева
2134-2157
Аннотация:

Статья посвящена проблеме коммуникативной предвзятости систем автоматического распознавания речи при работе с атипичной речью на русском языке. Актуальность исследования обусловлена активным внедрением технологий искусственного интеллекта в социальную сферу и государственное управление в России, что предполагает обеспечение их доступности для различных категорий граждан, включая людей с речевыми нарушениями. Введено понятие коммуникативной предвзятости ASR-моделей как свойства системы в условиях неопределенности (атипичная речь, шум, паузы) принимать решения о заполнении смысловых и акустических лакун на основе собственной обучающей выборки. В эмпирической базы исследования выбран корпус RuAphasiaBank, включающий записи речи пациентов с различными типами афазии (моторной, сенсорной, семантической, сенсомоторной) разной степени тяжести, а также нейротипичных информантов. Для сравнительного анализа были отобраны шесть ASR-моделей, работающих с русским языком: две открытые (GigaAM, T-One) и четыре коммерческие (Yandex SpeechKit, Any2Text, Charla, Speech2Text). Качество распознавания оценено с использованием метрик WER и CER, а также с помощью  анализа соотношения вставок, удалений и замен на уровне слов и символов. Результаты показали, что модели реализуют различные стратегии при столкновении с атипичной речью: «паническое укорачивание» (GigaAM, Yandex SpeechKit), «лексическое сохранение» в ущерб точности (T-One) и «стабильная» стратегия сбалансированных ошибок (Any2Text, Speech2Text, Charla). Лингвистический анализ выявил, что каждая модель порождает специфический искаженный коммуникативный стиль: от разговорной диалогической речи до стиля, ассоциируемого с когнитивными нарушениями или употреблением молодежного сленга. На основе полученных данных моделируются потенциальные риски для социального самочувствия и правовой защищенности пациентов с афазией при использовании голосовых помощников в государственных учреждениях.

Ключевые слова: речевые технологии, речевая база данных, автоматическое распознавание речи, атипичная речь, афазия, коммуникативная предвзятость, голосовые ассистенты, ассистивные технологии, инклюзивность.

Фреймворк для облачного видеомониторинга через IP-камеры с интуитивно-понятным интерфейсом

Анастасия Сергеевна Гришина, Влада Владимировна Кугуракова
225-238
Аннотация: Описаны основные моменты процесса создания системы, которая позволяет управлять несколькими камерами одновременно, сохраняя данные на сервере. Система имеет возможность подключать IP-камеры и камеры на мобильных устройствах, предоставлять доступ другим пользователям, а также позволяет осуществлять просмотр видео в онлайн-режиме. Выявлены и описаны «горячие точки» в архитектуре системы. Разработан отдельный Angular-модуль, использованы паттерны проектирования. Описано взаимодействие системы с пользователем. Предложены этапы дальнейшего развития облачного видеомониторинга через IP-камеры с легкодоступным управлением для конечного пользователя.
Ключевые слова: IP-камера, система, сервер, приложение, видеонаблюдение.

Базовые сервисы фабрики метаданных цифровой математической библиотеки Lobachevskii-DML

336-381
Аннотация: Решен ряд задач, связанных с построением фабрики метаданных цифровой математической библиотеки Lobachevskii-DML. Под фабрикой метаданных понимается система взаимосвязанных программных инструментов, направленных на создание, обработку, хранение и управление метаданными объектов цифровых библиотек и позволяющих интегрировать создаваемые электронные коллекции в агрегирующие цифровые научные библиотеки. С целью выбора оптимальных таких программных инструментов из существующих и их модернизации: обсуждены особенности представления метаданных документов различных электронных коллекций, связанные как с применяемыми форматами, так и с изменениями состава и полноты набора метаданных в течение всего времени издания соответствующего научного журнала;представлены и охарактеризованы программные инструменты управления научным контентом и методы организации автоматизированной интеграции репозиториев математических документов с другими информационными системами;обсуждена такая важная функция фабрики метаданных цифровой библиотеки, как нормализация метаданных в соответствии с форматами других агрегирующих библиотек.В результате разработки фабрики метаданных цифровой математической библиотеки Lobachevskii-DML предложена система сервисов автоматизированного формирования метаданных электронных математических коллекций; разработан xml-язык представления метаданных, основанный на Journal Archiving and Interchange Tag Suite (NISO JATS); созданы программные инструменты нормализации метаданных электронных коллекций научных документов в форматах, разработанных международными организациями – агрегаторами ресурсов по математике и Computer Science; разработан алгоритм приведения метаданных к формату oai_dc и генерации структуры архивов для импорта в цифровое хранилище DSpace; предложены и реализованы методы интеграции электронных математических коллекций Казанского университета в отечественные и зарубежные цифровые математические библиотеки.
Ключевые слова: цифровые библиотеки, цифровая математическая библиотека, формирование метаданных, извлечение метаданных, нормализация метаданных, фабрика метаданных, NISO JATS, семантические связи, Lobachevskii-DML.

Технологии получения доверенной электронной почты. Обзор и реализация

Гурий Михайлович Михайлов, Андрей Михайлович Чернецов
1055-1063
Аннотация:

Представлен обзор современных технологий, применяемых при обработке почтовых сообщений для решения задачи получения доверенной электронной почты, проведено их описание. Приведены рекомендуемые настройки для успешного функционирования.

Ключевые слова: e-mail, SPF, DMARC, DKIM.

Требования к архитектуре системы управления научными данны-ми и выбор решений для реализации ее компонентов

Кирилл Валерьевич Гарев
2307-2329
Аннотация:

Рассмотрена задача выбора технических решений для компонентов системы управления научными данными. Последние разделены на три категории: научные датасеты, научно-техническая и наукометрическая информации – различающиеся по структуре, объему, характеру обновления, профилю доступа и требованиям к метаданным, что усложняет эффективное управление ими в рамках единого универсального хранилища. На основе типологизации данных и сценариев использования для ключевых ролей (исследователь, аналитик, инженер данных, администратор) сформированы требования к компонентам системы. Был проведен сравнительный анализ альтернативных решений по каждому компоненту и предложена модульная архитектура, разграничивающая исходные данные и их производные представления. Определены согласованный набор технологий, совместимый с локальным развертыванием, а также сквозные механизмы идентификации, авторизации и управления ресурсами.

Ключевые слова: управление научными данными, научные датасеты, научно-техническая информация, наукометрическая информация, программная архитектура, требования к системе, распределенное хранение, семантический поиск.

Управление знаниями – фактор повышения эффективности непрерывного библиотечно-информационного образования: опыт Республиканского медицинского библиотечно-информационного центра

Юлия Николаевна Дрешер
379-390
Аннотация:

Описано создание системы управления знаниями в Республиканском медицинском библиотечно-информационном центре (РМБИЦ, Казань). Раскрыты особенности управления знаниями в библиотеках. Приведена информация о программах повышения квалификации библиотекарей, формах и методах обучения.

Ключевые слова: управление знаниями, непрерывное библиотечно-информационное образование, программа повышения квалификации библиотекарей, формы обучения, методы обучения, виды обучения, информационное обеспечение самообразования.

Формирование структурированных представлений научных журналов для интеграции в граф знаний и семантического поиска

Ольга Муратовна Атаева, Михаил Геннадьевич Кобук
1306-1323
Аннотация:

Работа посвящена проблеме развития библиотеки научных предметных областей SciLibRu, как продолжения семантического описания научных трудов проекта LibMeta. В основе этой библиотеки лежит концептуальная модель данных, структура и семантика которой сформированы на принципах онтологического моделирования. Такой подход обеспечивает строгое описание предметной области, формализацию взаимосвязей между сущностями и возможность дальнейшего автоматизированного анализа данных. Целью настоящего исследования были разработка и экспериментальное применение методов структуризации содержимого научных журналов в формате LaTeX для их интеграции в онтологию библиотеки и обеспечения семантического поиска.


Предложен алгоритм трансляции в формат XML данных, представленных множеством файлов, для интеграции в онтологию библиотеки. Реализован модуль векторного поиска, основанный на вычислении эмбеддингов с использованием языковых моделей. Выявлены закономерности распределения эмбеддингов и факторы, влияющие на точность ранжирования результатов поиска. Проведено тестирование двух названых компонентов.


Разработанный метод составляет основу для автоматического включения содержимого научных журналов в граф знаний SciLibRu и создания обучающих корпусов для языковых моделей, ограниченных рамками научных предметных областей. Полученные результаты способствуют развитию систем навигации по графу знаний журналов, а также рекомендательных механизмов и инструментов интеллектуального поиска по русскоязычным научным текстам.

Ключевые слова: полуструктурированные данные, онтология текста, LaTeX, векторное представление текста, полнотекстовый поиск, семантический поиск.

Повышение устойчивости классификации коротких текстов к стохастическому шуму на основе плотностной очистки обучающих выборок

Басар Бауржанович Баишев, Андрей Петрович Халов
681-698
Аннотация:

Рассмотрена задача классификации коротких текстовых заявок в условиях значительного дисбаланса классов и зашумленности реальных потоков обращений. Показана ограниченная эффективность методов синтетического расширения выборки при работе с зашумленной разметкой. Предложен гибридный метод, сочетающий предварительную плотностную очистку данных и многоуровневое ансамблирование моделей. Применение алгоритма плотностной кластеризации позволило исключить 16.5% информационного шума от общего объема выборки. Финальная модель представлена двухуровневой архитектурой и оптимизирована с помощью байесовского поиска гиперпараметров. На отложенной тестовой выборке достигнуто значение метрики R@3, равное 97.4%. Предложенный метод позволяет автоматизировать процесс распределения заявок, существенно снижая нагрузку на операторов и сокращая время диспетчеризации обращений.

Ключевые слова: обработка естественного языка, зашумленные текстовые данные, ансамблевое обучение, робастная классификация, фильтрация шума.
1 - 25 из 44 результатов 1 2 > >> 
Информация
  • Для читателей
  • Для авторов
  • Для библиотек
Отправить материал
Текущий выпуск
  • Логотип Atom
  • Логотип RSS2
  • Логотип RSS1

Электронные библиотеки

ISSN 1562-5419

Информация

  • О журнале
  • Цели и задачи
  • Тематика
  • Руководство для авторов
  • Отправка материалов
  • Заявление о конфиденциальности
  • Контакты
  • eLIBRARY.RU
  • dblp computer science bibliography

Отправить статью

Авторам нужно зарегистрироваться в журнале перед отправкой материалов, или, если вы уже зарегистрированы, можно просто войти со своей учетной записью и начать процесс отправки, состоящий из пяти шагов.

Отправить материал
Больше информации об этой издательской системе, платформе и рабочем процессе от OJS/PKP.

© 2015-2026 Казанский (Приволжский) федеральный университет; Институт развития информационного общества