• Main Navigation
  • Main Content
  • Sidebar

Электронные библиотеки

  • Главная
  • О нас
    • О журнале
    • Цели и задачи
    • Тематика
    • Главный редактор
    • Редакция
    • Отправка материалов
    • Заявление об открытом доступе
    • Заявление о конфиденциальности
    • Контакты
  • Текущий выпуск
  • Архивы
  • Регистрация
  • Вход
  • Поиск
Издается с 1998 года
ISSN 1562-5419
16+
Language
  • Русский
  • English

Найти

Расширенные фильтры

Результаты поиска

Стилометрический анализ в задаче поиска заимствований текстов на татарском языке

Изида Зуфаровна Хаялеева, Михаил Михайлович Абрамский
1267-1278
Аннотация:

Рассмотрена возможность применения методов стилометрического анализа для поиска заимствований в текстах на татарском языке. Разработаны соответствующие инструменты, в которых использованы алгоритмы машинного обучения, включая кластеризацию (метод k-средних), классификацию (метод случайного леса, метод опорных векторов, наивный байесовский классификатор) и гибридный подход (модель FastText + логистическая регрессия). Особое внимание уделено адаптации лингвистических метрик для татарского языка.

Ключевые слова: поиск заимствований, обработка естественного языка, стилометрический анализ, татарский язык.

Опровержение слуха средствами массовой информации: Математическая модель и численные эксперименты

371-386
Аннотация:

Рассмотрен процесс, при котором в социуме распространяется недостоверный слух, которому противодействует вещание средств массовой информации. Недостоверность слуха в данном случае понимается так, что информация СМИ содержит опровержение и тем самым инокулирует индивидов, то есть делает их невосприимчивыми к слуху. В то же время индивиды, успевшие принять слух, перестают доверять средствам массовой информации и тем самым становятся недоступными для переубеждения. Для данного процесса предложена математическая модель в двух вариантах. Вариант с непрерывным временем позволяет выявить некоторые математические свойства модели. Вариант с дискретным временем более удобен для анализа реальных процессов, так как позволяет оценить параметры модели. Для оценки этих параметров использованы данные о рейтингах основных социально-политических программ российских телеканалов. Приведено несколько сценарных расчетов модели с этими параметрами. Основной вывод состоит в том, что если информация, распространяемая средствами массовой информации, не является вирусной, то есть не пересказывается зрителями своим соседям по социуму, то СМИ оказываются не в состоянии противостоять слухам.

Ключевые слова: математическое моделирование, информационное противоборство, численный эксперимент, слухи.

Методы автоматизированного извлечения параметров и описаний программ для интеграции их на вычислительные комплексы

Тимофей Владимирович Санников, Алексей Николаевич Сальников
919-936
Аннотация:

Рассмотрена проблема координации разнородных программных средств в гетерогенных средах распределенного запуска приложений. Ручное конфигурирование параметров запуска для вновь устанавливаемых программ на вычислительный кластер (таких как ключи командной строки, значения переменных окружения и настройки конфигурационных файлов) создает серьезные трудности для исследователей предметных областей из-за больших объемов служебной информации и необходимости сохранения и агрегации информации в некотором фиксированном формате. Предложен метод автоматизированного извлечения параметров запуска, базирующийся на гибридной архитектуре обучения нейронной сети, сочетающей генерацию обучающей выборки большими языковыми моделями и последующее дообучение компактного трансформерного энкодера. Реализация подхода исключает зависимость от дорогостоящих графических ускорителей за счет применения методики низкоранговой адаптации (Low-Rank Adaptation) для моделей размером до 1 млрд параметров, что обеспечивает возможность выполнения модели (инференса) на обычных центральных процессорах управляющих узлов. Для формализации качества извлечения разработана двухкомпонентная метрика, агрегирующая структурную корректность выходной JSON-схемы (наличие в полученных данных обязательных полей, типов параметров программы) и семантическую точность значений параметров (соответствие описания в документации). Экспериментальная оценка метода ориентирована на корпус документации программных пакетов (man-страницы, README). Результаты проектирования подтверждают возможность аппроксимации процесса анализа документации компактной моделью, что способствует автоматизации жизненного цикла развертывания программного обеспечения и снижению ошибок управления потоками задач в распределенных вычислительных комплексах.

Ключевые слова: низкоранговая адаптация, извлечение данных, анализ программного кода, автоматизация запуска, обработка естественного языка, научная рабочая среда, высокопроизводительные вычисления.

О реализации национального проекта «Образование» при подготовке математических кадров в вузе

Николай Иванович Попов, Елена Васильевна Яковлева, Людмила Николаевна Губарь
432-439
Аннотация: Статья посвящена анализу взаимосвязи национального проекта «Образование» государственной программы Российской Федерации «Развитие образования» с подготовкой преподавателей математики и информатики в вузе. Выделены основные направления указанного проекта, которые должны стать основой модернизации образовательных программ, направленных на подготовку специалистов в области математики и информатики, педагогов рассматриваемых предметных областей.
Ключевые слова: модернизация системы образования, обучение математике и информатике, информационные технологии, междисциплинарный подход.

Технология ситуационного моделирования в системах виртуального окружения

Михаил Васильевич Михайлюк, Дмитрий Алексеевич Кононов, Дмитрий Михайлович Логинов
889-901
Аннотация:

Обсуждена технология моделирования различных ситуаций в системах виртуального окружения, которые являются компьютерными трехмерными моделями реальной или искусственной среды. Пользователь может рассматривать эти сцены непосредственно на экране компьютера, настенном экране, в стерео очках, в очках виртуальной реальности и т. д. Он также может перемещаться внутри виртуальной сцены и взаимодействовать с ее объектами. В свою очередь среда также может изменяться. Это позволяет проводить в системе виртуального окружения моделирование различных ситуаций (ситуационное моделирование). При таком моделировании задается некоторая статическая или динамическая обстановка в системе виртуального окружения, в которой оператор должен выполнить поставленные перед ним задачи.


Предложен механизм задания ситуаций путем изменения виртуальной трехмерной сцены с помощью конфигурационных файлов и виртуальных пультов управления. Для записи конфигурационных файлов разработан специальный язык, а для создания виртуальных пультов управления – специальный редактор. Представлена апробация предложенных методов на примере двух виртуальных сцен: полигона для мобильных роботов и реактивного рюкзака спасения космонавта в открытом космосе.

Ключевые слова: открытый доступ, система виртуального окружения, ситуационное моделирование, трехмерная сцена, конфигурационный файл, виртуальный пульт управления.

Исследование таксономии с помощью рассуждающих больших языковых моделей и вызова функций

Фёдор Алексеевич Садковский, Михаил Михайлович Тихомиров, Наталья Валентиновна Лукашевич
1212-1234
Аннотация:

Рассмотрена задача пополнения таксономий – иерархических структур для организации понятий. Предложена архитектура на основе подхода ReAct (Reasoning + Acting), позволяющая пополнять таксономию в режиме zero-shot без дообучения больших языковых моделей. Система реализована в двух сценариях: автономная навигация от корневых узлов и верификация гипотез, сгенерированных другими моделями. Эксперименты на материале диахронического датасета RuWordNet показали, что прямое исследование таксономии от корня сталкивается с ограничениями, связанными со сложностью графа (MAP@3 = 24.6%). В то же время использование системы в качестве верификатора позволило улучшить качество предсказаний базовых моделей: прирост MAP@3 составил 9.5 п.п. для FastText и 1.1 п.п. для TaxoYandexGPT-5-Lite. Ключевыми преимуществами подхода являются универсальность, отсутствие необходимости дообучения и интерпретируемость за счет явных цепочек рассуждений.

Ключевые слова: таксономия, пополнение таксономий, извлечение гиперонимов, LLM, цепочка рассуждений, вызов функций, RuWordNet, переранжирование, компьютерная семантика.

Классификация изображений с помощью сверточных нейронных сетей

Сергей Алексеевич Филиппов
366-382
Аннотация:

Для классификации изображений в настоящее время можно применить множество различных инструментов, каждый из которых направлен на решение определенного спектра задач. В статье проведен краткий обзор библиотек и технологий для классификации изображений. Построена архитектура простой свёрточной нейронной сети для классификации изображений.


Были проведены эксперименты по распознаванию изображений с такими популярными нейронными сетями, как VGG16 и ResNet 50. Обе нейронные сети показали хорошие результаты. Однако ResNet 50 переобучилась из-за того, что в наборе данных присутствовали однотипные изображения для обучения, поскольку в данной нейронной сети больше слоев, позволяющих считывать признаки объектов на изображениях. С обученными моделями был проведен сравнительный анализ по распознаванию изображений, специально подготовленных для этого эксперимента.


Для классификации изображений в настоящее время можно применить множество различных инструментов, каждый из которых направлен на решение определенного спектра задач. В статье проведен краткий обзор библиотек и технологий для классификации изображений. Построена архитектура простой свёрточной нейронной сети для классификации изображений.


Были проведены эксперименты по распознаванию изображений с такими популярными нейронными сетями, как VGG16 и ResNet 50. Обе нейронные сети показали хорошие результаты. Однако ResNet 50 переобучилась из-за того, что в наборе данных присутствовали однотипные изображения для обучения, поскольку в данной нейронной сети больше слоев, позволяющих считывать признаки объектов на изображениях. С обученными моделями был проведен сравнительный анализ по распознаванию изображений, специально подготовленных для этого эксперимента.

Ключевые слова: распознавание изображений, нейронная сеть, сверточная нейронная сеть, классификация изображений, машинное обучение.

О модели поиска синонимов

Ольга Муратовна Атаева, Владимир Алексеевич Серебряков, Наталия Павловна Тучкова
1006-1022
Аннотация:

Рассмотрена задача нахождения наиболее релевантных документов в результате расширенного и уточненного запроса. Для ее решения предложены модель поиска и механизм предварительной обработки текста, а также совместное использование поисковой системы и модели, построенной на основе индекса с помощью алгоритмов word2vec для генерации расширенного запроса с синонимами и уточнения результатов поиска на основе подбора похожих документов в цифровой семантической библиотеке. В работе исследуется построение векторного представления документов применительно к массиву данных цифровой семантической библиотеки LibMeta. Решалась задача обогащения пользовательских запросов синонимами. При построении модели поиска совместно с алгоритмами word2vec использован подход «сначала индексация, затем обучение», что позволяет получить более точные результаты поиска. Обучение модели проводилось на базе контента библиотеки для предметной области «Математика». Приведены примеры расширенного запроса с использованием синонимов.

Ключевые слова: модель поиска, алгоритм word2vec, синонимы, информационный запрос, расширение запроса.

Библиотека научных предметных областей SciLibRu

Ольга Муратовна Атаева, Наталия Павловна Тучкова, Кирилл Борисович Теймуразов, Айдин Абдышов, Михаил Геннадьевич Кобук
1324-1345
Аннотация:

Работа посвящена проблеме интеграции данных для представления научных предметных областей на основе их семантического описания в цифровой библиотеке SciLibRu. В качестве модели данных использованы онтология и граф знаний библиотеки LibMeta. Наполнение библиотеки SciLibRu осуществляется путем добавления данных научных журналов. Показано, как реализованы этапы анализа слабоструктурированных научных публикаций для их встраивания в онтологию библиотеки. При прохождении всех этапов предобработки данных формируется датасет, который может быть использован в обучении языковых моделей для запросов в русскоязычных научных предметных областях.


Приложение работы заключается в создании рекомендательных систем для работы с научными русскоязычными журналами.

Ключевые слова: икладная онтология, граф знаний, источники данных, анализ слабоструктурированных научных публикаций.

Принципы справедливости как честности в издательской деятельности в сфере образования

Наталья Владимировна Родионова
46-66
Аннотация: Представлены результаты исследования проблемы плагиата. Рассматриваются причины его распространения в издательской и образовательной деятельности и способы искоренения. Обоснованы такие корневые причины этого явления, как утрата традиции доверия в издательской деятельности с обновлением состава авторов; нечувствительность к издательской этике современных авторов, выращенных в период лояльности к плагиату; коммерциализация способов борьбы с плагиатом; слабая мотивация авторов к издательской деятельности. Для обоснования методологического подхода к решению проблемы нечестности в издательской деятельности, включая плагиат, предложена концепция справедливости как честности Дж. Ролза. С ее помощью обоснована идея о формировании системы взаимоотношений «издательство–авторы» на основе принципов справедливости как честности. Предложен подход к формированию этического рамочного порядка в цепи взаимоотношений «издательство–авторы –студенты–разработчики ПО–работодатели» на основе принципов справедливости, таких, как равенство прав требований собственных выгод, взаимной честности; этических ограничений на действия, наносящие ущерб находящимся в наихудшем положении, которыми являются студенты-читатели. Предложена процедура разработки и согласования принципов справедливости в издательской деятельности с помощью сайта издательства. Эти принципы целесообразно отражать в этическом кодексе издательской деятельности.
Ключевые слова: смена поколений авторов, нечувствительность к издательской этике, несправедливость издательств, сотворение справедливости, справедливость как жестокость, справедливость как честность.

Применение машинного обучения к задаче генерации поисковых запросов

Александр Михайлович Гусенков, Алина Рафисовна Ситтикова
272-293
Аннотация:

Исследованы две модификации рекуррентных нейронных сетей: сети с долгой краткосрочной памятью и сети с управляемым рекуррентным блоком с добавлением механизма внимания к обеим сетям, а также модель Transformer в задаче генерации запросов к поисковым системам. В качестве модели Transformer использована модель GPT-2 от OpenAI, которая обучалась на запросах пользователей. Проведен латентно-семантический анализ для определения семантических сходств между корпусом пользовательских запросов и запросов, генерируемых нейронными сетями. Для проведения анализа корпус был переведен в формат bag of words, к нему применена модель TFIDF, проведено сингулярное разложение. Семантическое сходство вычислялось на основе косинусной меры. Также для более полной оценки применимости моделей к задаче был проведен экспертный анализ для оценки связности слов в искусственно созданных запросах.

Ключевые слова: обработка естественного языка, генерация естественного языка, машинное обучение, нейронные сети.

Увеличение робастности нейронных сетей за счет генерации векторных представлений, инвариантных к атрибутам

Марат Рушанович Газизов, Карен Альбертович Григорян
1142-1154
Аннотация:

Робастность модели к незначительным отклонениям в распределении исходных данных является важным критерием во многих задачах. Нейронные сети могут показывать высокую точность (accuracy) на обучающей выборке, но при этом качество на тестовой выборке может сильно падать из-за разного распределения данных, причем ситуация только усугубляется на уровне подгрупп внутри каждой категории.


В данной статье мы показываем, как робастность модели на уровне подгрупп может быть значительно улучшена с помощью подхода, основанного на доменной адаптации векторных представлений. Мы обнаружили, что применение состязательного подхода к ограничению векторных представлений дает существенный прирост метрики точности (accuracy) в сложной подгруппе по сравнению с предыдущими моделями. Метод протестирован на двух независимых наборах данных, точность в сложной подгруппе на наборе данных Waterbirds составляет 90.3 {y : waterbirds;a : landbackground}, а на наборе данных CelebA – 92.22 {y : blondhair;a : male}.

Ключевые слова: робастная классификация, классификация изображений, генеративно-состязатель сети, доменная адаптация.

Проект NewsAgent for Libraries: Персонифицированная служба оперативного информационного обеспечения

Р. Йетс
Аннотация: There are three main ways of obtaining information: searching, browsing and alerting. The first two are being widely developed by libraries using the Web, but the last has been somewhat neglected. The NewsAgent for Libraries project was originally funded under the eLib Programme by JISC (Joint Information Systems Committee of the UK higher education funding councils) as a two-year collaborative project started in April 1996.
Several small publishers of library and information science journals worked with network specialists, market evaluators and commercial software developers to design an open, distributed architecture for disseminating information via email and personalised Web pages. Dublin Core metadata was used, enhanced by NewsAgent specific keywords, to map stored user subject profiles against information feeds. Metadata was harvested using software robots to build an Oracle database where both user profiles and document attributes were stored.
Users can join the service via a Web page, to receive information updates by email or as a personalised Web page. Users can select predefined Topics in which they are interested, or create new named ones (stored queries). They can also modify existing Topics. Topics are presented in groups, called Channels.
A major part of the project was an extensive study of the potential end users of the service, before and after a prototype service was created. The project was considered a success, although further development of both software and marketing strategy were needed before a full scale launch could be planned. This is now expected in autumn 1999. In addition to this service, the software is being applied to other services by different organisations, targetted at groups such as small businesses, medical information and environmental information. It is expected that a commercial software package will be available from Fretwell-Downing Informatics as a result of the project.

Тактическая сортировка управленческих задач при их администрировании посредством меток Приоритетов, Спецификаций и Аффилиаций

Феликс Освальдович Каспаринский
733-745
Аннотация: Проанализирована специфика функционала программ управления стратегическими, тактическими и оперативными задачами. Предложена методика предварения названий оперативных задач тактическими метками Приоритетов, Спецификаций и Аффилиаций. Аббревиатуры меток формируются таким образом, чтобы обеспечить правильную расстановку приоритетов при сортировке задач по алфавитному порядку. Квадранты матрицы Приоритетов Д. Эйзенхауэра обозначаются двухбуквенными метками: важно срочно (IF – Important, Fast); важно бессрочно (IS – Important, Slow); не важно, но оперативно (UF – Unimportant, Fast): не важно и не срочно (US – Unimportant, Slow). Метки матрицы Спецификаций информационной среды (RA, RI, SA, SI) компонуются из взаимоисключающих свойств доступности Сети (I – Internet и A – Autonomous) и наличия редуцированного или специального функционала (R– Reduced и S – Special). Метки Транспортной спецификации (TA, TB, TC, TP) позволяют сортировать задачи, требующие перемещения (T – Translocation) на самолёте (A – Airplane), автобусе (B – Bus), автомобиле (C – Car) и пешком (P – Pedestrian), соответственно. Трёхбуквенные метки Аффилиации (принадлежности физическому или юридическому лицу) формируются из первых букв имени, отчества и фамилии или наименования лаборатории, компании, проекта. Тактические метки ускоряют принятие решений при формировании ежедневного списка оперативных задач.
Ключевые слова: задача, планирование, управление, приоритет, спецификация, аффилиация, метка, оперативный, тактический.

Определение дефектов на стальных листах с использованием сверточных нейронных сетей

Родион Дмитриевич Гаскаров, Алексей Михайлович Бирюков, Алексей Федорович Никонов, Даниил Владиславович Агниашвили, Данил Айдарович Хайрисламов
1155-1171
Аннотация:

Сталь в наши дни является одним из важнейших производственных материалов, который используется повсеместно, от медицины до промышленных отраслей. Своевременное обнаружение и распознавание дефектов на стальных листах после проката – одна из ключевых проблем этого производства с учетом его сложности и необходимости затрат большого количества времени на проведение вручную проверок каждого листа и каждой заготовки. Одними из целей настоящей работы были автоматизация и упрощение данного процесса. Для решения соответствующих задач была использована, в первую очередь, модель сверточной нейронной сети под названием UNet, которая уже зарекомендовала себя как отличный инструмент решения таких задач — при высокой результативности она требует меньшего количества учебных данных. В основе этой модели лежат последовательная, производимая в несколько шагов свертка изображения до приемлемого размера (иными словами, сжатие или кодирование), а затем развертка, восстановление изображения к исходному размеру и соотношению сторон, после чего на выходе будет получена маска изображения с классами элементов, которые необходимо было найти. В дополнение к этой нейронной сети в качестве кодирующего (сворачивающего) слоя была использована другая модель — ResNet34, предварительно обученная на датасете (наборе данных) ImageNet1000. В этой модели также был модифицирован выходной слой — вместо 34 слоев с классами на выходе возвращалось лишь 4, что сократило время обработки и позволило использовать наиболее удачные определения в результатах. Используя данный подход и проведя все необходимые проверки, при подведении итогов, мы получили результат в 94,8% точности определения дефектов на стальных листах.

Ключевые слова: сверточные нейронные сети, нейронные сети, машинное обучение, сталь, искусственный интеллект, UNet, ResNet, определение дефектов, сегментация, классификация.

HaRuCo: новый русскоязычный корпус научно-популярных текстов с разметкой кореференции

Роман Денисович Шувалов, Елена Анатольевна Сидорова
1293-1303
Аннотация:

Представлен новый русскоязычный корпус с разметкой кореференции HaRuCo (Habr Russian Coreference Corpus). В качестве основы для корпуса взяты научно-популярные статьи, относящиеся к предметной области «Компьютерная лингвистика». Предложена методика разметки кореференции для текстов узких предметных областей, которая включает четыре основных этапа: синтаксический анализ текста; сборку именных групп и выделение местоимений для построения упоминаний (спанов); классификацию упоминаний классами предметной области; кластеризацию упоминаний в соответствии с цепочками кореферентно-связанных спанов. Аннотирование кореферентных связей осуществлено с применением синтаксического парсера и большой языковой модели, оно прошло ручную проверку и корректировку. Созданный корпус включает 3727 сущностей, 9905 упоминаний и 2683 кореферентных цепочек. Он может быть использован для обучения и оценки моделей разрешения кореференции для русского языка.

Ключевые слова: разрешение кореференции, разметка кореференции, корпус текстов, научно-популярный текст, методика разметки, разметка упоминаний, кластеризация упоминаний, кореферентная связь.

Отечественные системы видеоконференцсвязи

Гурий Михайлович Михайлов, Михаил Алексеевич Жижченко, Андрей Михайлович Чернецов
946-961
Аннотация:

Представлен обзор части существующих отечественных систем видеоконференцсвязи, проведено их сравнение между собой, с зарубежными аналогами, а также со свободно распространяемыми средствами. Рассмотрены особенности свободно распространяемых систем, проанализированы их характеристики и недостатки.

Ключевые слова: видеоконференцсвязь, Zoom, Mind, VirtualRoom, Sber Jazz, Яндекс Телемост.

Модель и архитектура многоуровневого анализа сходства Android-приложений по статическим признакам

Валерий Владимирович Петров
877-897
Аннотация:

Рассмотрена задача многоуровневого анализа сходства приложений для платформы Android по статическим признакам в цифровых коллекциях мобильных приложений. В таких коллекциях встречаются дубликаты, ответвленные версии, перепакованные приложения и иные модифицированные варианты; вредоносная нагрузка рассматривается как возможный частный случай модификации, а не как синоним перепаковки.


Формализована функция сходства приложений по статическим признакам, построена статическая модель приложения и предложена архитектура анализа, разделяющая предварительный отбор кандидатов, углубленное сопоставление, интерпретацию результата и слой формирования заключения. Показано, что значимая информация о близости приложений содержится не только в байткоде classes.dex, но и в манифесте AndroidManifest.xml, ресурсах, APK-внутренних метаданных и библиотечных зависимостях. Численная оценка сходства вычисляется только при успешном построении статических моделей сравниваемых приложений; в противном случае фиксируется отдельный служебный технический статус с нормализованной причиной отказа.


На локальном пилотном наборе из пяти основных пар и двух граничных случаев наблюдалось, что явный учет библиотечных зависимостей и раздельная фиксация технических ограничений прототипа позволяют получить более интерпретируемый результат, однако эти данные следует рассматривать как предварительные и не дающие оснований для окончательной валидации архитектуры на больших коллекциях.

Ключевые слова: приложение для платформы Android, статический анализ, анализ сходства программ, поиск модифицированных вариантов, перепакованные приложения, библиотечная зависимость, интерпретация результата, цифровая коллекция приложений.

Адаптивная RAG-архитектура для задачи интеллектуального поиска в корпусе документов образовательных учреждений

Анна Дмитриевна Будревич, Михаил Михайлович Абрамский, Искандер Айратович Валишин
1338-1360
Аннотация:

 


Решена задача повышения качества интеллектуального поиска в корпусе документов образовательных учреждений, включающем учебные планы, рабочие программы дисциплин и нормативные акты. Классические архитектуры подхода «генерация, дополненная поиском» (Retrieval-Augmented Generation, RAG), основанные на единственном модуле поиска по обычному тексту, демонстрируют низкую точность работы на документах, включающих таблицы, логические связи между сущностями и строгие формулировки нормативных документов. Предложена адаптивная RAG-архитектура из четырех слоев, каждый из которых учитывает специфику хранения данных в подобных документах. Результаты показали, что учет структуры документов и адаптивная маршрутизация запросов существенно повышают фактическую корректность ответов. Предложенная архитектура может быть использована при проектировании интеллектуальных ассистентов для административных и учебно-методических сервисов высших учебных заведений.

Ключевые слова: RAG, RAG-архитектура, документы образовательных учреждений, интеллектуальный поиск, искусственный интеллект, обработка документов, семантические модели.

Электронные библиотеки в Вычислительном центре Российской академии наук – основные разработки

Владимир Алексеевич Серебряков
534-566
Аннотация: Рассмотрены основные проекты, которые были реализованы в Вычислительном центре им. А.А. Дородницына Российской академии наук (ВЦ РАН) за последние 20 лет, т. е. с 1998 года. Одним из первых был реализован пилотный проект «Интегрированной системы информационных ресурсов (ИСИР) РАН». Успешное завершение этого проекта позволило развернуть работы по интеграции разнородных научных информационных ресурсов в общеакадемическую научную информационную систему. Важным этапом был проект создания Единого Научного Информационного Пространства (ЕНИП) РАН. Этот проект основывался на подсистеме «Научный институт РАН», созданной в ВЦ РАН и Центре научных телекоммуникаций (ЦНТК) РАН. Учитывая важность формирования цифровых библиотек, Российская академия наук приняла в 2006 году целевую научную программу «Создание ЦБ «Научное наследие России»», в соответствии с которой была реализована цифровая библиотека. Созданный портал «ГеоМета» – это стандартизированная и децентрализованная среда управления пространственной информацией, разработанная для доступа к базам геоданных, картографическим продуктам и связанным с ними метаданным из различных источников, облегчающая обмен пространственной информацией между организациями и ее совместное использование посредством интернета. В настоящее время основное направление работ – цифровая персональная семантическая библиотека LibMena. Основная задача этой системы заключается в предоставлении пользователю унифицированного представления для возможности автоматизированного извлечения интересующей его информации по определенной предметной области.
Ключевые слова: предметная область, научная предметная область, научная информация, научные знания, обобщенное представление научной предметной области, таксономии, тезаурусы, глобальные онтологии, поисковые системы, организация научных знаний, цифровые библиотеки.

Генерация трехмерных синтетических датасетов

Влада Владимировна Кугуракова, Виталий Денисович Абрамов, Даниил Иванович Костюк, Регина Айратовна Шараева, Рим Радикович Газизов, Мурад Рустэмович Хафизов
622-652
Аннотация:

Работа посвящена описанию процесса разработки универсального инструментария для генерации синтетических данных для обучения разных нейронных сетей. Используемый подход показал свою успешность и эффективность в решении различных задач, в частности, обучения нейросети для распознавания покупательского поведения внутри магазинов через камеры наблюдения и пространств устройствами дополненной реальности без использования вспомогательных инфракрасных камер. Обобщающие выводы позволяют спланировать дальнейшее развитие технологий генерации трехмерных синтетических данных.

Ключевые слова: синтетические данные, датасет, искусственный интеллект, нейронные сети, машинное обучение, компьютерное зрение, трехмерные модели, metahuman, игровые движки, Unreal Engine.

Методика построения информационно-справочной системы по истории математической науки

В.Б. Барахнин, А.М. Федотов
Аннотация: В работе изложена методика построения информационно-справочной системы по истории науки. В качестве одного из возможных подходов предлагаются следующие основные принципы построения таких систем. Информация группируется вокруг персон, при этом подробно структурируются биографические данные в плане хронологии, географии и т.п. Библиографический список в описании персоны включает в себя, наряду с публикациями данного ученого, и публикации о нем самом. Четко отражена связь научной деятельности исследователя со структурированным описанием предметной области, в которой этот исследователь работал. Приведенное описание включает в себя информационную модель справочника, особенности реализации подсистем создаваемой информационной системы, а также основные виды информационных запросов пользователя, необходимых для полноценной работы с системой.

Использование матриц смежности для визуализации больших графов

Зинаида Владимировна Апанович
2-36
Аннотация: Экспоненциальный рост размеров таких графов, как социальные сети, интернет-графы и др., требует новых подходов к их визуализации. Наряду с представлениями типа «диаграммы связей вершин» все чаще используются визуализации матриц смежностей, а также разнообразные комбинации этих представлений. В данном обзоре рассмотрены новые подходы к визуализации графов большого объема при помощи матриц смежностей и приведены примеры приложений, где эти подходы применяются. Описаны различные типы шаблонов, возникающие при упорядочении матриц смежностей, соответствующих современным сетям, и алгоритмы, позволяющие выделять эти шаблоны. В частности, продемонстрировано, как использование методов упорядочения матриц совместно с алгоритмами поиска таких шаблонов, как звезды, ложные звезды, цепи, почти клики, полные клики, двудольные ядра и почти двудольные ядра, позволяют создавать понятные визуализации графов, имеющих миллионы вершин и ребер. Также приведены примеры гибридных визуализаций, использующих диаграммы связей вершин для представления неплотных частей графа, а матрицы смежностей – для представления плотных частей и их приложений. Гибридные методы используются для визуализации сетей соавторства, глубоких нейронных сетей, сравнения сетей связности человеческого мозга и др.
Ключевые слова: графы большого объема, визуализация, матрицы смежности, жгуты ребер, гибридная визуализация.

Использование общедоступных архивов данных обработки ионограмм вертикального радиозондирования в роли первоначальной разметки для машинного обучения

Андрей Олегович Щирый
532-545
Аннотация:

В работе выдвинута идея использования имеющихся больших массивов результатов обработки ионограмм вертикального радиозондирования ионосферы в качестве обучающих датасетов для построения предиктивных моделей методами машинного обучения. Рассмотрены наиболее популярные форматы сохранения результатов обработки ионограмм, а также некоторые интернет-ресурсы с архивами свободно доступных файлов этих форматов. Указанные датасеты используются для построения предиктивных моделей, в том числе временных рядов критических частот ионосферных слоев. Отмечена также возможность использования некоторых датасетов результатов обработки ионограмм для обучения моделей, предназначенных для автоматической обработки ионограмм.

Ключевые слова: ионосфера, радиозондирование, вертикальное зондирование ионосферы, ионограмма, характеристики ионосферы, метаданные.

Разработка модуля проверки данных для удовлетворения метрики устаревания

Айгуль Ильдаровна Сибгатуллина, Азат Шавкатович Якупов
159-178
Аннотация:

Из года в год возрастает объем мирового рынка больших данных. Их анализ является неотъемлемой частью для принятия немедленных и надежных решений. Технологии больших данных ведут к значительному снижению стоимости за счет использования облачных сервисов, распределенных файловых систем, когда возникает потребность в хранении больших объемов информации. Их аналитика неразрывно связана с понятием качества данных, что особенно важно, если они имеют определенный срок хранения – метрику устаревания – и мигрируют из одного источника в другой, увеличивая риск потери данных. Предупреждение негативных последствий достигается за счет процесса сверки данных – комплексной проверки больших объемов информации с целью подтверждения их согласованности.


В статье рассмотрены вероятностные структуры данных, которые могут быть использованы для решения задачи, а также предложена реализация – модуль проверки целостности данных с использованием фильтра Блума с подсчетом. Данный модуль интегрирован в Apache Airflow для автоматизации процесса.

Ключевые слова: большие данные, метрика устаревания, партиция, parquet файл, фильтр Блума.
51 - 75 из 435 результатов << < 1 2 3 4 5 6 7 8 9 10 > >> 
Информация
  • Для читателей
  • Для авторов
  • Для библиотек
Отправить материал
Текущий выпуск
  • Логотип Atom
  • Логотип RSS2
  • Логотип RSS1

Электронные библиотеки

ISSN 1562-5419

Информация

  • О журнале
  • Цели и задачи
  • Тематика
  • Руководство для авторов
  • Отправка материалов
  • Заявление о конфиденциальности
  • Контакты
  • eLIBRARY.RU
  • dblp computer science bibliography

Отправить статью

Авторам нужно зарегистрироваться в журнале перед отправкой материалов, или, если вы уже зарегистрированы, можно просто войти со своей учетной записью и начать процесс отправки, состоящий из пяти шагов.

Отправить материал
Больше информации об этой издательской системе, платформе и рабочем процессе от OJS/PKP.

© 2015-2026 Казанский (Приволжский) федеральный университет; Институт развития информационного общества