• Main Navigation
  • Main Content
  • Sidebar

Электронные библиотеки

  • Главная
  • О нас
    • О журнале
    • Цели и задачи
    • Тематика
    • Главный редактор
    • Редакция
    • Отправка материалов
    • Заявление об открытом доступе
    • Заявление о конфиденциальности
    • Контакты
  • Текущий выпуск
  • Архивы
  • Регистрация
  • Вход
  • Поиск
Издается с 1998 года
ISSN 1562-5419
16+
Language
  • Русский
  • English

Найти

Расширенные фильтры

Результаты поиска

Разработка методики сегментации пользователей с помощью алгоритмов кластеризации и расширенной аналитики

Даниил Андреевич Клинов, Карен Альбертович Григорян
137-147
Аннотация:

Статья посвящена созданию эффективного решения по сегментации пользователей. Представлены анализ существующих сервисов сегментации пользователей и подходов к их сегментации (ABCDx сегментация, демографическая сегментация, сегментация на основании карты пути пользователя), а также анализ алгоритмов кластеризации (K-means, Mini-Batch K-means, DBSCAN, Agglomerative Clustering, Spectral Clustering). Исследование названных подходов нацелено на создание решения по сегментации, «гибкого» и адаптирующегося под каждую пользовательскую выборку. Также применены дисперсионный анализ (тест ANOVA) и разбор метрик кластеризации для оценки качества сегментации пользователей. С помощью указанных методов разработано эффективное решение по сегментации пользователей с использованием технологии расширенной аналитики и машинного обучения.

Ключевые слова: Сегментация, кластеризация, дисперсионный анализ, машинное обучение, расширенная аналитика, тест ANOVA, продуктовая аналитика.

Стилометрический анализ в задаче поиска заимствований текстов на татарском языке

Изида Зуфаровна Хаялеева, Михаил Михайлович Абрамский
1267-1278
Аннотация:

Рассмотрена возможность применения методов стилометрического анализа для поиска заимствований в текстах на татарском языке. Разработаны соответствующие инструменты, в которых использованы алгоритмы машинного обучения, включая кластеризацию (метод k-средних), классификацию (метод случайного леса, метод опорных векторов, наивный байесовский классификатор) и гибридный подход (модель FastText + логистическая регрессия). Особое внимание уделено адаптации лингвистических метрик для татарского языка.

Ключевые слова: поиск заимствований, обработка естественного языка, стилометрический анализ, татарский язык.

Применение методов машинного обучения для повышения качества тестов

Рамиль Радикович Минюков, Михаил Михайлович Абрамский
701-717
Аннотация:

Работа посвящена применению методов машинного обучения для повышения качества тестов. Проведен обзор предметной области и реализованы два метода повышения качества: поиск похожих вопросов и оценка качества дистракторов. Первый включает тестирование пяти моделей трансформеров для получения векторного представления текста и шесть алгоритмов кластеризации. Второй метод основан на использовании тех же моделей трансформеров совместно с тремя алгоритмами классификации. Результаты экспериментов показали высокую эффективность предложенных решений при решении обеих задач.

Ключевые слова: анализ тестовых вопросов, дистракторы, машинное обучение, прохождение тестов, тесты, повышение качества тестов.

Применение графовых моделей учебных планов для анализа образовательных программ по специальностям высшего образования

Данил Александрович Ли, Инна Геннадьевна Олгина
1989-2008
Аннотация:

Проектирование учебных планов в условиях динамики образовательных стандартов смещается от статичного набора дисциплин к системному моделированию. Этот подход должен учитывать многоуровневые взаимосвязи и логику формирования сквозных компетенций. Целью исследования являются создание и апробация методического инструментария для анализа образовательных программ вузов на основе методов сетевого анализа. Учебный план формализован в виде неориентированного графа, где вершинами выступают дисциплины, а ребрами – связи через общие компетенции. В работе применен многоаспектный сетевой анализ, включающий расчет мер центральности: степени связности, посредничества, близости к другим узлам, степени влиятельности – и ключевых топологических метрик: плотности, модулярности, диаметра и коэффициента кластеризации. Эмпирическую базу составили данные учебных планов трех вузов города Омска. Проведенный анализ выявил существенные структурно-топологические различия в архитектуре образовательных программ, обусловленные их ведомственной принадлежностью и целевыми моделями подготовки. Сетевые метрики позволяют количественно оценить междисциплинарную связность и модульность программ, что недоступно для традиционных подходов. Полученные результаты подтверждают высокий диагностический потенциал сетевого анализа для обоснованной оптимизации учебных планов и верификации соответствия профессиональным компетенциям.

Ключевые слова: сетевой анализ, учебные дисциплины, граф, социальные сети.

О некоторых свойствах графов сотрудничества учёных в Math-Net.ru

Андрей Анатольевич Печников, Дмитрий Евгеньевич Чебуков
184-196
Аннотация:

Проведено исследование двух графов научного сотрудничества, построенных на основе соавторства и цитирования по данным Общероссийского математического портала Math-Net.Ru. Граф научного сотрудничества на основе цитирования представляет собой ориентированный граф без петель и кратных ребер, вершинами которого являются авторы публикаций, а дуги связывают их, когда имеется хотя бы одна публикация первого автора, цитирующая публикацию второго автора. Граф соавторства – это неориентированный граф, в котором вершинами являются авторы, а ребра фиксируют соавторство двух авторов хотя бы в одной статье. Проводится традиционное исследование основных характеристик обоих графов: диаметр и среднее расстояние, компоненты связности и кластеризация. В обоих графах мы наблюдаем схожую структуру связности – наличие гигантской компоненты и большое количество маленьких компонент. Отмечается сходство и различие научного сотрудничества через соавторство и цитирование.

Ключевые слова: научное сотрудничество, цитирование, соавторство, граф, математический портал Math-Net.Ru.

HaRuCo: новый русскоязычный корпус научно-популярных текстов с разметкой кореференции

Роман Денисович Шувалов, Елена Анатольевна Сидорова
1293-1303
Аннотация:

Представлен новый русскоязычный корпус с разметкой кореференции HaRuCo (Habr Russian Coreference Corpus). В качестве основы для корпуса взяты научно-популярные статьи, относящиеся к предметной области «Компьютерная лингвистика». Предложена методика разметки кореференции для текстов узких предметных областей, которая включает четыре основных этапа: синтаксический анализ текста; сборку именных групп и выделение местоимений для построения упоминаний (спанов); классификацию упоминаний классами предметной области; кластеризацию упоминаний в соответствии с цепочками кореферентно-связанных спанов. Аннотирование кореферентных связей осуществлено с применением синтаксического парсера и большой языковой модели, оно прошло ручную проверку и корректировку. Созданный корпус включает 3727 сущностей, 9905 упоминаний и 2683 кореферентных цепочек. Он может быть использован для обучения и оценки моделей разрешения кореференции для русского языка.

Ключевые слова: разрешение кореференции, разметка кореференции, корпус текстов, научно-популярный текст, методика разметки, разметка упоминаний, кластеризация упоминаний, кореферентная связь.

Формирование академических групп и проектных команд на основе сбора данных об обучающихся

Наталья Александровна Коргутлова, Светлана Юрьевна Басаргина, Михаил Михайлович Абрамский, Марат Альбертович Солнцев, Таисия Сергеевна Бузукина
193-208
Аннотация: Обсуждены вопросы использования данных об обучающихся, представленных в электронном виде, в задачах генерации распределений обучающихся по академическим группам, элективам и проектным командам. Проиллюстрировано применение алгоритмов машинного обучения для этих задач. Показана возможность использования данных, собранных из социальных сетей.
Ключевые слова: личностный портрет студента, кластеризация, распределение по компетенциям, анализ социальных сетей.

Повышение устойчивости классификации коротких текстов к стохастическому шуму на основе плотностной очистки обучающих выборок

Басар Бауржанович Баишев, Андрей Петрович Халов
681-698
Аннотация:

Рассмотрена задача классификации коротких текстовых заявок в условиях значительного дисбаланса классов и зашумленности реальных потоков обращений. Показана ограниченная эффективность методов синтетического расширения выборки при работе с зашумленной разметкой. Предложен гибридный метод, сочетающий предварительную плотностную очистку данных и многоуровневое ансамблирование моделей. Применение алгоритма плотностной кластеризации позволило исключить 16.5% информационного шума от общего объема выборки. Финальная модель представлена двухуровневой архитектурой и оптимизирована с помощью байесовского поиска гиперпараметров. На отложенной тестовой выборке достигнуто значение метрики R@3, равное 97.4%. Предложенный метод позволяет автоматизировать процесс распределения заявок, существенно снижая нагрузку на операторов и сокращая время диспетчеризации обращений.

Ключевые слова: обработка естественного языка, зашумленные текстовые данные, ансамблевое обучение, робастная классификация, фильтрация шума.

Поиск слов в рукописном тексте на основе штриховой сегментации

Иван Дмитриевич Морозов, Леонид Моисеевич Местецкий
1435-1453
Аннотация:

Рукописные архивные документы составляют фундаментальную часть культурного наследия человечества, однако их анализ остается трудоемкой задачей для профессиональных исследователей-историков, филологов и лингвистов. В отличие от коммерческих приложений систем OCR (Optical Character Recognition, оптического распознавания символов), работа с историческими рукописями требует принципиально иного подхода из-за чрезвычайного многообразия почерков, наличия правок и деградации материалов.


Предложен метод поиска в рукописных текстах, основанный на штриховой сегментации. Вместо полного распознавания текста, часто недостижимого для исторических документов, метод позволяет эффективно отвечать на поисковые запросы исследователей. Ключевая идея заключается в декомпозиции текста на элементарные штрихи, формировании семантических векторных представлений с помощью контрастного обучения, последующей кластеризации и классификации для создания адаптивного словаря почерка.


Экспериментально показано, что поиск сравнением кортежей редуцированных последовательностей наиболее информативных штрихов по расстоянию Левенштейна обеспечивает достаточное качество для рассматриваемой задачи. Метод демонстрирует устойчивость к индивидуальным особенностям почерка и вариациям написания, что особенно важно для работы с авторскими архивами и историческими документами.


Предложенный подход открывает новые возможности для ускорения научных исследований в гуманитарной сфере, позволяя сократить время поиска нужной информации с недель до минут, что качественно меняет возможности исследовательской работы с большими архивами рукописных документов.

Ключевые слова: рукописный текст, поиск, штриховый анализ, сегментация, векторное представление, контрастное обучение, кластеризация.
1 - 9 из 9 результатов
Информация
  • Для читателей
  • Для авторов
  • Для библиотек
Отправить материал
Текущий выпуск
  • Логотип Atom
  • Логотип RSS2
  • Логотип RSS1

Электронные библиотеки

ISSN 1562-5419

Информация

  • О журнале
  • Цели и задачи
  • Тематика
  • Руководство для авторов
  • Отправка материалов
  • Заявление о конфиденциальности
  • Контакты
  • eLIBRARY.RU
  • dblp computer science bibliography

Отправить статью

Авторам нужно зарегистрироваться в журнале перед отправкой материалов, или, если вы уже зарегистрированы, можно просто войти со своей учетной записью и начать процесс отправки, состоящий из пяти шагов.

Отправить материал
Больше информации об этой издательской системе, платформе и рабочем процессе от OJS/PKP.

© 2015-2026 Казанский (Приволжский) федеральный университет; Институт развития информационного общества