• Main Navigation
  • Main Content
  • Sidebar

Электронные библиотеки

  • Главная
  • О нас
    • О журнале
    • Цели и задачи
    • Тематика
    • Главный редактор
    • Редакция
    • Отправка материалов
    • Заявление об открытом доступе
    • Заявление о конфиденциальности
    • Контакты
  • Текущий выпуск
  • Архивы
  • Регистрация
  • Вход
  • Поиск
Издается с 1998 года
ISSN 1562-5419
16+
Language
  • Русский
  • English

Найти

Расширенные фильтры

Результаты поиска

Формирование и разметка корпуса русскоязычных новостных текстов для автоматизированного выявления политических манипуляций

Нина Леонидовна Кулюлина
782-797
Аннотация:

Исследована проблема создания специализированных корпусных ресурсов для задач автоматизированного анализа политических манипуляций в русскоязычных текстах. Несмотря на активное развитие методов семантического и вычислительного анализа текстов, существующие корпусные ресурсы и схемы разметки в основном ориентированы на англоязычные данные и плохо учитывают языковую и контекстуальную специфику русскоязычных новостных средств массовой информации (СМИ).


Целями исследования были создание специализированного корпуса русскоязычных новостных текстов и разработка схемы разметки, ориентированной на автоматизированный анализ политических манипуляций с учетом особенностей русскоязычного медиапространства. 


В рамках проведенного исследования сформирован корпус фраз, извлеченных из русскоязычных новостных текстов и опубликованных в период 2010–2019 гг., и разработана схема разметки манипулятивных техник. В основе разметки лежит адаптация международных классификаций манипулятивных стратегий, сведенных к ограниченному числу интерпретируемых техник, релевантных для анализа русскоязычных новостных текстов. Предлагаемая схема охватывает эмоциональные, аргументативные и контекстуальные формы манипулятивного воздействия.


Полученные корпус и схема разметки могут использоваться в качестве эмпирической основы для разработки и тестирования методов автоматизированного анализа политических манипуляций в русскоязычных новостных СМИ, а также дальнейших исследований политических и медиа-текстов.

Ключевые слова: медиа-манипуляции, русскоязычные СМИ, корпус текстов, разметка данных, манипулятивные техники, политическая коммуникация, семантический анализ, вычислительный дискурс-анализ.

Прагматические границы приветствий и прощаний: оценка LLM на материале мультимедийного корпуса речевого этикета

Ксения Сергеевна Клокова, Максим Aнисимович Кронгауз, Валерий Александрович Шульгинов, Татьяна Александровна Юдина
2080-2104
Аннотация:

 


Исследована способность больших языковых моделей выявлять в русскоязычных диалогах последовательности приветствий и прощаний и определять их точные прагматические границы. Рассмотрены YandexGPT 5.1 Pro, GigaChat 2 Max и GPT-5 с целью: классификации диалогов по наличию указанных последовательностей и извлечении отдельных высказываний с учетом их интенциональных границ. На материале 216-ти диалогов из «Мультимедийного корпуса речевого этикета русского языка» проведен эксперимент, позволивший учесть широкий коммуникативный и социальный контекст взаимодействия. GPT-5 продемонстрировал наиболее высокое качество классификации на уровне диалога, тогда как YandexGPT и GigaChat достигли почти идеальной точности за счет консервативных стратегий. При извлечении точных границ качество всех моделей заметно снижается. Анализ ошибок показал, что модели систематически включают лишние контекстуальные невербальные действия и пропускают нестандартные маркеры: жесты, формы обращения, дискурсивные маркеры и импликатуры, указывающие на будущий контакт. Представлены актуализированное описание корпуса, его веб-интерфейс, а также возможности формирования диагностических подкорпусов и бенчмарков. Полученные результаты подчеркивают необходимость более точного учета структуры дискурса и контекстуальной вариативности повседневного общения.

Ключевые слова: большие языковые модели, мультимедийный корпус речевого этикета, приветствие, прощание, речевой этикет, прагматические границы, формулы вежливости, анализ диалога.

HaRuCo: новый русскоязычный корпус научно-популярных текстов с разметкой кореференции

Роман Денисович Шувалов, Елена Анатольевна Сидорова
1293-1303
Аннотация:

Представлен новый русскоязычный корпус с разметкой кореференции HaRuCo (Habr Russian Coreference Corpus). В качестве основы для корпуса взяты научно-популярные статьи, относящиеся к предметной области «Компьютерная лингвистика». Предложена методика разметки кореференции для текстов узких предметных областей, которая включает четыре основных этапа: синтаксический анализ текста; сборку именных групп и выделение местоимений для построения упоминаний (спанов); классификацию упоминаний классами предметной области; кластеризацию упоминаний в соответствии с цепочками кореферентно-связанных спанов. Аннотирование кореферентных связей осуществлено с применением синтаксического парсера и большой языковой модели, оно прошло ручную проверку и корректировку. Созданный корпус включает 3727 сущностей, 9905 упоминаний и 2683 кореферентных цепочек. Он может быть использован для обучения и оценки моделей разрешения кореференции для русского языка.

Ключевые слова: разрешение кореференции, разметка кореференции, корпус текстов, научно-популярный текст, методика разметки, разметка упоминаний, кластеризация упоминаний, кореферентная связь.

Автоматический морфологический анализ для осетинского языка на материале устного корпуса

Анна Сергеевна Шатских, Алексей Андреевич Сорокин
2215-2239
Аннотация:

Работа посвящена созданию первого корпуса для осетинского языка с морфологической разметкой в формате Universal Dependencies. Корпус состоит из размеченных вручную текстов Устного корпуса осетинского языка, содержит 5454 предложения и имеет суммарный объём 73 042 токена. Также в работе представлен морфологический анализатор на основе архитектуры BERT, достигающий пословной корректности 95,60%. Кроме того, в работе приведены результаты экспериментов по улучшению качества классификации. Показано, что фильтрация выдачи модели с помощью бесконтекстного анализатора и многозадачный подход не приводят к значительному улучшению. Наконец, в работе представлены результаты тестирования анализатора на внедоменных данных и показано, что на них модель достигает пословной корректности 91,45%. Статья является расширением статьи конференции «Диалог».

Ключевые слова: осетинский язык, иронский далект, морфологический анализ, Universal Dependencies.

От размеченного корпуса к онтологии: формальная модель многоуровневой семантической разметки фейковых новостей в казахско-русском медиапространстве (KazFakeCorpus / KazFakeOnto)

Анаргуль Аймуратовна Некесова, Елена Анатольевна Сидорова, Жанар Бейбутовна Ламашева, Мадина Аралбаевна Самбетбаева, Айгерим Сембековна Еримбетова, Мира Жорабековна Калдарова, Ақсәуле Абзалқызы Назымхан
2158-2187
Аннотация:

Рассмотрена проблема формального представления знаний о дезинформации в малоресурсном двуязычном медиапространстве. Автоматическое обнаружение фейковых новостей традиционно сводится к бинарной классификации REAL/FAKE, которая не описывает внутреннюю структуру недостоверного сообщения: тип фейкового контента, применённую технику дезинформации, коммуникативное намерение автора, характеристики источника и доказательной базы.


В работе представлены два взаимосвязанных ресурса. Первый – двуязычный корпус KazFakeCorpus: 4276 текстов на казахском и русском языках, сбалансированных по классам внутри каждого языка; класс REAL сформирован из официальных материалов портала Gov.kz, класс FAKE – из их контролируемых трансформаций. Разметку по многоуровневой семантической схеме выполнили в среде Label Studio два независимых эксперта; значения Krippendorff’s Alpha по основным уровням составили 0,79–0,88. Второй ресурс – онтология KazFakeOnto, переводящая схему разметки из плоского реляционного представления в формальную модель на языке OWL 2 DL: 38 классов, 26 объектных свойств, 22 свойства данных, 112 индивидов, 1155 утверждённых триплетов. Одиннадцать определяемых классов не утверждаются вручную, а выводятся ризонером из значений свойств; цепочка свойств связывает материал с аннотатором через объект аннотации. Непротиворечивость проверена с помощью HermiT, запросный слой апробирован на пятнадцати SPARQL- и тринадцати DL-запросах.


Показано, что онтологический слой обеспечивает воспроизводимую спецификацию схемы разметки, автоматический вывод содержательных категорий и единую формальную среду для постановки корпусно-лингвистических вопросов и анализа ошибок моделей машинного обучения. Обсуждаются ограничения подхода и направления масштабирования онтологии на полный корпус и на естественно возникающую дезинформацию.

Ключевые слова: обнаружение фейковых новостей, онтология, OWL 2, SPARQL, логический вывод, двуязычный корпус, казахский язык, многоуровневая аннотация, техники дезинформации, объяснимый NLP, малоресурсные языки, KazFakeCorpus, KazFakeOnto..

Анализ эффективности субсловных токенизаторов в малоресурсной лингвистической среде: опыт реализации на таджикском языке

Муллошараф Курбонович Арабов, Светлана Сергеевна Хайбуллина
546-564
Аннотация:

Рассмотрены современные подходы к субсловной токенизации текстов применительно к малоресурсному таджикскому языку, характеризуемому сложной морфологической структурой и высокой вариативностью словоформ. В ходе исследования был сформирован и предварительно обработан масштабный разнородный корпус, включающий 99 книг и 134497 текстовых статей различных жанров и тематик, общий объем которого превышает 33 млн токенов. Корпус был очищен от шумов, нормализован и использован в качестве основы для обучения и последующего тестирования субсловных моделей.


На базе названного корпуса были обучены и проанализированы пять моделей токенизации, реализующих алгоритмы BPE, WordPiece и Unigram с использованием библиотек Hugging Face Tokenizers и SentencePiece. Сравнительная оценка проведена по ряду ключевых показателей, включая долю неизвестных слов (OOV), степень сжатия текстового представления, скорость токенизации, а также характеристики распределения n-грамм, позволяющие оценить способность моделей отражать морфологическую и структурную организацию языка. Результаты экспериментов позволили выявить сильные и слабые стороны различных подходов к субсловной сегментации и определить наиболее эффективные стратегии токенизации в условиях морфологической сложности
таджикского языка. Полученные выводы могут быть использованы при разработке языковых моделей и прикладных NLP-инструментов для таджикского и других малоресурсных языков, способствуя расширению их присутствия в цифровой среде.

Ключевые слова: таджикский язык, субсловная токенизация, малоресурсные языки, BPE, Word-Piece, Unigram, Hugging Face Tokenizers, SentencePiece, корпусная лингвистика, обработка естественного языка (NLP).

Нейросимволический подход к дополненной генерации текста на основе автоматизированной индукции морфотактических правил

Марат Вильданович Исангулов, Александр Михайлович Елизаров, Айгиз Ражапович Кунафин, Айрат Рафизович Гатиатуллин, Николай Аркадиевич Прокопьев
1085-1102
Аннотация:

Представлен гибридный нейросимволический метод, который объединяет большую языковую модель (LLM) и конечный автомат (FST) для обеспечения морфологической корректности при генерации текста на агглютинативных языках.
Система автоматически извлекает правила из корпусных данных: для локальных примеров словоформ LLM формирует цепочки морфологического разбора, которые затем агрегируются и упорядочиваются в компактные описания правил морфотактики (LEXC) и выбора алломорфов (regex). На этапе генерации LLM и FST работают совместно: если токен не распознается автоматом, LLM извлекает из контекста пару «лемма + теги», а FST реализует корректную поверхностную форму. В качестве набора данных использован корпус художественной литературы (~1600 предложений). Для списка из 50 существительных извлечено 250 словоформ. По предложенному алгоритму LLM сгенерировала 110 контекстных regex-правил вместе с LEXC-морфотактикой, на основе чего был скомпилирован FST, распознавший 170/250 форм (~70%). В прикладном тесте машинного перевода на подкорпусе из 300 предложений интеграция данного FST в цикл LLM повысила качество с BLEU 16.14 / ChrF 45.13 до BLEU 25.71 / ChrF 50.87 без дообучения переводчика. Подход применим к иным частям речи и другим агглютинативным и малоресурсным языкам, где он может быть использован для наполнения словарных и грамматических ресурсов.

Ключевые слова: нейросимволический подход, большая языковая модель, конечные автоматы, двухуровневая морфология, LEXC морфотактика, машинный перевод, агглютинативные языки, башкирский язык.

Морфологические формы глагола в задаче распознавания эмоций: характеристики данных и результаты классификации

Полина Владимировна Ярошенко, Анастасия Алексеевна Петрова, Наталья Валентиновна Лукашевич
2240-2264
Аннотация:

Распознавание эмоций в тексте является одной из актуальных задач обработки естественного языка. В работе исследовано влияние морфологической формы глагола на качество эмоциональной классификации моделями-энкодерами и выявлены факторы, определяющие морфологическую чувствительность языковых моделей. Для эксперимента использованы три модели (ruBERT-tiny2, ruBERT-base, ruRoBERTa-large), дообученные на объединенном корпусе из четырех русскоязычных датасетов (22852 примера). Каждая модель классифицировала 5676 морфологических форм 473 глаголов из Russian Emotion Lexicon. В результате зафиксировано систематическое влияние морфологии: различия в качестве классификации между формами по метрике F1 достигают 20–25% для всех моделей. Для объяснения установленных закономерностей был проведен анализ характеристик обучающих данных. Показано, что частотность морфологических форм в корпусе частично коррелирует с качеством классификации, однако не является единственным определяющим фактором. При анализе распределения эмоций по морфологическим формам выявлено, что в обучающем корпусе императив преимущественно встречается в контекстах с эмоцией «Радость». Однако глаголы класса «Грусть» в форме повелительного наклонения систематически классифицируются энкодерами как «Злость». Это расхождение между характеристиками обучающих данных и результатами классификации указывает на то, что императив в сочетании с семантикой грусти интерпретируется моделями как выражение агрессии, что свидетельствует о взаимодействии грамматической формы с семантикой глагола при определении эмоционального класса.

Ключевые слова: классификация эмоций, BERT, обработка естественного языка, русский язык, морфология.

Применение ручного редактора и полуавтоматического парсера исходных текстов для формирования корпуса игровых сценариев

Никита Рамильевич Нурлыгаянов
1610-1639
Аннотация:

Предложен практический подход к формированию специализированного корпуса игровых сценариев на основе сочетания ручной разметки и полуавтоматического парсинга исходных текстов. Метод объединяет графический редактор для экспертной разметки, модульный парсер, выполняющий первичную структуризацию исходных текстов на основе формальных правил и эвристик, а также визуализацию связей между сценами. Такое сочетание обеспечивает итеративный цикл экспертной валидации, необходимый для получения корректного и воспроизводимого корпуса.

Ключевые слова: NLP, разработка видеоигр, парсинг, валидация, визуализация, игровые сценарии, корпус текстов.

Применение машинного обучения к задаче генерации поисковых запросов

Александр Михайлович Гусенков, Алина Рафисовна Ситтикова
272-293
Аннотация:

Исследованы две модификации рекуррентных нейронных сетей: сети с долгой краткосрочной памятью и сети с управляемым рекуррентным блоком с добавлением механизма внимания к обеим сетям, а также модель Transformer в задаче генерации запросов к поисковым системам. В качестве модели Transformer использована модель GPT-2 от OpenAI, которая обучалась на запросах пользователей. Проведен латентно-семантический анализ для определения семантических сходств между корпусом пользовательских запросов и запросов, генерируемых нейронными сетями. Для проведения анализа корпус был переведен в формат bag of words, к нему применена модель TFIDF, проведено сингулярное разложение. Семантическое сходство вычислялось на основе косинусной меры. Также для более полной оценки применимости моделей к задаче был проведен экспертный анализ для оценки связности слов в искусственно созданных запросах.

Ключевые слова: обработка естественного языка, генерация естественного языка, машинное обучение, нейронные сети.

Проблема построения синтетических психологических данных: опыт моделирования реакций на фрустрацию

Анфиса Анваровна Чуганская, Данил Алексеевич Киреев, Иван Валентинович Смирнов, Олег Георгиевич Григорьев
1235-1252
Аннотация:

Вопрос генерации синтетических данных для психологических исследований остается актуальным и сложным. Проблемы конфиденциальности, надежности, достоверности, валидности выводов остаются неравномерно представленными для различных областей психологии и фактически оказываются взаимосвязанными с решением вопроса использования синтетических данных в смежных науках – медицине, социологии, истории, политологии, экономике. Изучение различных психологических феноменов в рамках исследований больших социальных групп сопряжено с проблемами анализа сложно формализуемых конструктов. Под синтетическими общем виде понимают данные, искусственно сгенерированные на основе алгоритмов и моделирования.


В качестве основы настоящего исследования была выбрана классификация типов реакции на фрустрацию С. Розенцвейга. При анализе сетевого дискурса существует проблема малочисленности некоторых типов. Особенно это касается класса импунитивных реакций. В работе проанализирована возможность создания корпуса синтетических данных (на примере корпуса текстов реакций на фрустрацию), сгенерированными с помощью больших языковых моделей. При проведении экспериментов экспертами были созданы промпты и выполнена генерация примеров импунитивных реакций с помощью четырех больших языковых моделей, по 10 примеров каждого типа реакций. Была также дана проведена оценка контекстной достоверности и качества генерации. Полученные результаты позволяют определить слабые стороны генерации текстов со сложными психологическими феноменами для обучения нейросетевых моделей.

Ключевые слова: фрустрация, большая языковая модель (LLM), синтетические данные, искусственный интеллект, промпт, сетевая дискуссия, классификация Розенцвейга.

Автоматические и полуавтоматические методы построения графа знаний предметной области и расширения онтологии

Андрей Петрович Халов, Ольга Муратовна Атаева
1481-1519
Аннотация:

Рассмотрен цикл построения графа знаний и расширения онтологии для специальной предметной области, описывающей процесс управления потоками данных в службах информационной поддержки. Предложена методика формирования корпуса данных для наполнения онтологии с автоматической псевдоразметкой, включающей специальные категории для фиксации ранее не представленных классов и отношений. Обучена специализированная модель извлечения именованных сущностей на корпусе данных объемом 3 млн токенов с 92 метками. Результаты были использованы для интеграции извлеченных фактов, что увеличило граф знаний до 0.98 млн триплетов, при этом коэффициент расширения графа (отношение общего числа фактов к явным триплетам) увеличился с 2.65 до 3.52 при сохранении логической согласованности. Наборы токенов с одинаковыми метками были преобразованы в устойчивые семантические множества, что позволило полуавтоматически расширить онтологию. В онтологию добавлены 12 новых классов, которые были извлечены из неструктурированных текстовых данных. Показан прикладной пример запросов и дальнейшей аналитики.

Ключевые слова: онтология, DOLCE, граф знаний, NER, BIO-разметка, RDF/OWL, SPARQL.

Адаптивная RAG-архитектура для задачи интеллектуального поиска в корпусе документов образовательных учреждений

Анна Дмитриевна Будревич, Михаил Михайлович Абрамский, Искандер Айратович Валишин
1338-1360
Аннотация:

 


Решена задача повышения качества интеллектуального поиска в корпусе документов образовательных учреждений, включающем учебные планы, рабочие программы дисциплин и нормативные акты. Классические архитектуры подхода «генерация, дополненная поиском» (Retrieval-Augmented Generation, RAG), основанные на единственном модуле поиска по обычному тексту, демонстрируют низкую точность работы на документах, включающих таблицы, логические связи между сущностями и строгие формулировки нормативных документов. Предложена адаптивная RAG-архитектура из четырех слоев, каждый из которых учитывает специфику хранения данных в подобных документах. Результаты показали, что учет структуры документов и адаптивная маршрутизация запросов существенно повышают фактическую корректность ответов. Предложенная архитектура может быть использована при проектировании интеллектуальных ассистентов для административных и учебно-методических сервисов высших учебных заведений.

Ключевые слова: RAG, RAG-архитектура, документы образовательных учреждений, интеллектуальный поиск, искусственный интеллект, обработка документов, семантические модели.

Абстрактивная суммаризация новостей внешней торговли на основе нового специализированного корпуса данных

Дарья Андреевна Лютова, Валентин Андреевич Малых
1120-1137
Аннотация:

Представлен TradeNewsSum — корпус для абстрактивной генерации аннотаций к новостям внешней торговли, охватывающий русско- и англоязычные публикации из профильных источников. Все рефераты подготовлены вручную по унифицированным правилам. Проведены эксперименты с дообучением трансформерных и seq2seq-моделей и автоматическую оценку по схеме LLM-as-a-judge. Наилучшие результаты показала LLaMA 3.1 в режиме инструкционного промптинга, продемонстрировав высокие значения по метрикам, включая фактологическую полноту.

Ключевые слова: абстрактивное реферирование, многоязычный корпус, новости внешней торговли, санкции, торговые режимы, TradeNewsSum, трансформеры, большие языковые модели, LLM-as-a-judge, NER-оценка сущностей.

Особенности создания электронного ресурса "материалы к синтаксическому словарю"

А.А. Котов, Г.Б. Гурин, А.В. Седов, М.Ю. Некрасов, Ю.В. Сидоров, А.А. Рогов
Аннотация: В статье описывается размеченный корпус текстов публицистики XIX века в оригинальной графике (http://smalt.karelia.ru/corpus/index.phtml), обосновывается выбор теории и параметров разметки, обсуждаются некоторые сложности аннотирования. Основу корпуса составляют тексты В. И. Даля, Ф. М. Достоевского и близких ему публицистов.
Ключевые слова: морфология, дореволюционная графика, публицистика XIX века, тексты В.И. Даля и Ф.М. Достоевского, параметры разметки, аннотирование, грамматические параметры, морфоанализатор.

Методы автоматического присвоения кодов УДК математическим статьям: оценка классических и нейросетевых подходов

Булат Тимурович Гизатуллин, Ольга Авенировна Невзорова
699-718
Аннотация:

Универсальная десятичная классификация (УДК) – это иерархическая система индексирования, в рамках которой одной публикации могут соответствовать один или несколько кодов. Ручное присвоение кодов УДК трудоемко и нередко оказывается неоднородным. В работе рассмотрена задача автоматического присвоения кодов УДК русскоязычным математическим статьям. Цель исследования – сравнить различные сочетания текстовых представлений и моделей классификации на едином корпусе и определить наиболее эффективные конфигурации. Для этого был сформирован корпус из 4194 статей с ресурса Math-Net.Ru, включающий полные тексты, аннотации, метаданные и коды УДК; были выполнены извлечение текста из PDF-файлов, очистка артефактов верстки и нормализация кодов. В эксперименте сопоставлялись текстовые представления TF-IDF, Word2Vec, SciRus-tiny и SciRus-tiny3.5 в сочетании с моделями логистической регрессии, Complement Naive Bayes (CNB) и CatBoost. Наилучшие результаты в обеих постановках – однозначной (single-label) и многозначной (multi-label) – показала модель TF-IDF + LogReg; близкие результаты продемонстрировала конфигурация TF-IDF + CNB. Полученные результаты могут быть использованы при разработке систем автоматической рубрикации научных публикаций, рекомендательных сервисов для авторов и редакторов, а также средств контроля качества тематической разметки.

Ключевые слова: автоматическая классификация, универсальная десятичная классификация, УДК, обработка научных текстов, машинное обучение, иерархическая классификация, многозначная классификация, математические тексты, цифровые библиотеки, векторизация текста.

Подход к созданию корпуса текстов видеоигр на основе универсальной структуры

Никита Рамильевич Нурлыгаянов, Влада Владимировна Кугуракова
578-597
Аннотация:

Рассмотрена проблема высокой и увеличивающейся стоимости разработки видеоигр, для её решения предложено применить процедурную генерацию контента, что позволит снизить затраты на разработку.


Работа является частью масштабного исследования по автоматическому созданию прототипов видеоигр и посвящена обработке игровых сценариев, то есть текстов на естественном языке. Предложено выделять из сценариев необходимые сущности и передавать их дальнейшим шагам алгоритма, который по текстовым описаниям будет генерировать игровые ресурсы.


Существует несколько публикацией, посвящённых обработке игровых текстов, в которых предложено несколько различных структур хранения выделенной информации. В настоящей статье предложен универсальный формат, который подойдёт для обработки текста любой видеоигры и позволит создать корпус текстов для использования в дальнейших исследованиях и автоматической генерации игровых прототипов.

Ключевые слова: PCG, NLP, разработка видеоигр.

Семантический анализ корпуса научных статей на основе графового представления

Вадим Андреевич Чунихин, Сергей Александрович Зайцев, Ольга Муратовна Атаева
1253-1268
Аннотация:

Проблема эффективной навигации и поиска релевантной информации в постоянно растущем объеме научных публикаций требует перехода от классических методов полнотекстового поиска к семантическим моделям. В работе предложен подход к структурированию гетерогенного корпуса научных текстов путем построения графа знаний. Разработан конвейер обработки данных, включающий извлечение метаданных, ключевых слов и структурных элементов статей, а затем их интеграцию в единый граф. На основе построенного графа знаний реализованы методы анализа явных и извлечения неявных связей между публикациями. Результаты исследования демонстрируют эффективность графового представления научной информации для выявления скрытых закономерностей в предметных областях и поддержки интеллектуальной навигации.

Ключевые слова: семантический анализ, корпус научных статей, граф знаний, онтология, RDF, SPARQL, большие языковые модели, извлечение информации, графовые базы данных.

Атрибуция архивных рукописных писем с использованием сиамских нейронных сетей

Наталия Михайловна Пронина
1454-1480
Аннотация:

Предложен метод автоматической атрибуции архивных рукописных писем на основе сиамской нейронной сети, решающий ключевую проблему цифровой гуманитаристики – установление авторства исторических документов. Актуальность исследования обусловлена массовой оцифровкой архивов XVII–XIX вв., атрибуция которых затруднена из-за неполных исходных сведений об авторах.


Метод адаптирован к работе с реальным корпусом текстов и учитывает характерные для архивов проблемы: некачественные оцифровки, значительную вариативность почерка и выраженный дисбаланс классов (от 1 до 50 и более образцов на автора). Применение сиамской архитектуры позволяет получать дискриминативные векторные представления, эмбеддинги, на основе которых выполняется не только классификация документов известных авторов, но и эффективно выявляются рукописи, не принадлежащие ни одному из них. Это сужает круг кандидатов для последующей экспертной проверки.


Представлен алгоритм предобработки данных и проведено сравнительное исследование двух подходов к анализу текста: на уровне фрагментов изображения (300 × 300 пикселей) и уровне отдельных строк. Разработанный инструмент предлагает архивным работникам и филологам эффективное решение для предварительной сортировки и атрибуции крупных массивов рукописных документов.

Ключевые слова: сиамская нейронная сеть, идентификация, верификация, атрибуция, рукописный текст, архивные документы, сверточная нейронная сеть, рекуррентная нейронная сеть.

Методы автоматизированного извлечения параметров и описаний программ для интеграции их на вычислительные комплексы

Тимофей Владимирович Санников, Алексей Николаевич Сальников
919-936
Аннотация:

Рассмотрена проблема координации разнородных программных средств в гетерогенных средах распределенного запуска приложений. Ручное конфигурирование параметров запуска для вновь устанавливаемых программ на вычислительный кластер (таких как ключи командной строки, значения переменных окружения и настройки конфигурационных файлов) создает серьезные трудности для исследователей предметных областей из-за больших объемов служебной информации и необходимости сохранения и агрегации информации в некотором фиксированном формате. Предложен метод автоматизированного извлечения параметров запуска, базирующийся на гибридной архитектуре обучения нейронной сети, сочетающей генерацию обучающей выборки большими языковыми моделями и последующее дообучение компактного трансформерного энкодера. Реализация подхода исключает зависимость от дорогостоящих графических ускорителей за счет применения методики низкоранговой адаптации (Low-Rank Adaptation) для моделей размером до 1 млрд параметров, что обеспечивает возможность выполнения модели (инференса) на обычных центральных процессорах управляющих узлов. Для формализации качества извлечения разработана двухкомпонентная метрика, агрегирующая структурную корректность выходной JSON-схемы (наличие в полученных данных обязательных полей, типов параметров программы) и семантическую точность значений параметров (соответствие описания в документации). Экспериментальная оценка метода ориентирована на корпус документации программных пакетов (man-страницы, README). Результаты проектирования подтверждают возможность аппроксимации процесса анализа документации компактной моделью, что способствует автоматизации жизненного цикла развертывания программного обеспечения и снижению ошибок управления потоками задач в распределенных вычислительных комплексах.

Ключевые слова: низкоранговая адаптация, извлечение данных, анализ программного кода, автоматизация запуска, обработка естественного языка, научная рабочая среда, высокопроизводительные вычисления.

Архитектура лингвистической платформы “TurkLang”

Айрат Рафизович Гатиатуллин
2330-2356
Аннотация:

Описана архитектура многофункциональной лингвистической платформы “TurkLang”, создаваемой в Институте прикладной семиотики Академии наук Республики Татарстан. В основе системы лежит трехуровневая база знаний: общеязыковые универсалии, описания единиц конкретных языков и эмпирические речевые данные. База знаний реализована в виде графа, где основной единицей хранения выступает морфема. Это решение обусловлено элементно-комбинаторной природой тюркских языков: словоформа представляет собой линейную цепочку, состоящую из корня и последовательно присоединенных аффиксов – модификаторов, каждый из которых выражает одну грамматическую категорию (падеж, число, время и т. д.) в строго фиксированном порядке. Рассмотрены уровни абстракции, типы связей между сущностями, механизмы интеграции с внешними источниками (электронная энциклопедия, лексикографические ресурсы, геоинформационные системы). Особое внимание уделено применению международных стандартов синтаксической, семантической и прагматической (DiAML) аннотаций. Выполнено сравнение с существующими платформами (Sketch Engine, LingvoDoc, Apertium). На сегодняшний день база знаний платформы охватывает более 30 языков и диалектов, содержит более 237 тыс. корневых морфем и около 40 тыс. правил сочетаемости, а корпусная часть насчитывает свыше 180 млн словоупотреблений.

Ключевые слова: лингвистическая платформа, граф знаний, тюркские языки, морфемоцентричность, трехуровневая архитектура, Универсальные зависимости (Universal Dependencies), Универсальное смысловое представление (Universal Meaning Representation), агглютинативный язык, семиотическая вертикаль.

Коммуникативная предвзятость ASR при распознавании атипичной речи на русском языке

Анастасия Владимировна Колмогорова, Екатерина Валерьевна Явшиц, Милана Святославна Майорова, Софья Владимировна Дмитриева
2134-2157
Аннотация:

Статья посвящена проблеме коммуникативной предвзятости систем автоматического распознавания речи при работе с атипичной речью на русском языке. Актуальность исследования обусловлена активным внедрением технологий искусственного интеллекта в социальную сферу и государственное управление в России, что предполагает обеспечение их доступности для различных категорий граждан, включая людей с речевыми нарушениями. Введено понятие коммуникативной предвзятости ASR-моделей как свойства системы в условиях неопределенности (атипичная речь, шум, паузы) принимать решения о заполнении смысловых и акустических лакун на основе собственной обучающей выборки. В эмпирической базы исследования выбран корпус RuAphasiaBank, включающий записи речи пациентов с различными типами афазии (моторной, сенсорной, семантической, сенсомоторной) разной степени тяжести, а также нейротипичных информантов. Для сравнительного анализа были отобраны шесть ASR-моделей, работающих с русским языком: две открытые (GigaAM, T-One) и четыре коммерческие (Yandex SpeechKit, Any2Text, Charla, Speech2Text). Качество распознавания оценено с использованием метрик WER и CER, а также с помощью  анализа соотношения вставок, удалений и замен на уровне слов и символов. Результаты показали, что модели реализуют различные стратегии при столкновении с атипичной речью: «паническое укорачивание» (GigaAM, Yandex SpeechKit), «лексическое сохранение» в ущерб точности (T-One) и «стабильная» стратегия сбалансированных ошибок (Any2Text, Speech2Text, Charla). Лингвистический анализ выявил, что каждая модель порождает специфический искаженный коммуникативный стиль: от разговорной диалогической речи до стиля, ассоциируемого с когнитивными нарушениями или употреблением молодежного сленга. На основе полученных данных моделируются потенциальные риски для социального самочувствия и правовой защищенности пациентов с афазией при использовании голосовых помощников в государственных учреждениях.

Ключевые слова: речевые технологии, речевая база данных, автоматическое распознавание речи, атипичная речь, афазия, коммуникативная предвзятость, голосовые ассистенты, ассистивные технологии, инклюзивность.

PromptAlign: автоматическое итеративное выравнивание большой языковой модели под экспертную разметку без дообучения

Александр Алексеевич Агафонов, Ахат Рустемович Хусаинов, Николай Аркадиевич Прокопьев
2265-2292
Аннотация:

Большие языковые модели все активнее применяются в социальных и психологических науках, однако их предсказания систематически смещены относительно экспертной разметки (эффект смещения выравнивания, alignment shift), а попытки улучшить инструкции вручную или с помощью примеров приводят к так называемому эффекту «перетягивания одеяла» – деградации миноритарных классов.


В работе предложен PromptAlign – автоматический конвейер оптимизации инструкций, не требующий ни доступа к весам модели, ни участия человека в итеративной коррекции, так как таксономия и пространство признаков задаются экспертом априори. Конвейер извлекает гибридные лингвистические и семантические признаки с помощью большой языковой модели, строит на их основе интерпретируемые L1-логистические регрессии для локализации расхождений с экспертом, выполняет метаанализ ошибок и компилирует новые инструкции, управляя балансом через метрику индекса дисбаланса классов (Blanket Pulling Index, BPI). Эксперимент на корпусе, включающем 541 текст на русском языке, с тремя психологическими классами показал рост macro-F1 на отложенной тестовой выборке с 0.655 до 0.749 и минимальной классовой F1 с 0.449 до 0.656 (p > 0.99 по парному бутстрэп-тесту). Метод значимо превосходит базовые уровни — без примеров (zero-shot) и с подачей примеров (few-shot). Анализ вклада компонентов подтвердил критическую роль семантической интерпретации признаков и периодической перекомпоновки инструкций. Итоговая инструкция содержит пять правил, отражающих латентные критерии экспертов; в отличие от неинтерпретируемых моделей автоматических оптимизаторов, эти правила доступны для проверки и корректировки специалистом.

Ключевые слова: большая языковая модель, оптимизация инструкций, выравнивание, интерпретируемость, L1-регуляризация, бутстрэп-тест, классификация текстов, психологическая разметка, суррогатная модель, индекс дисбаланса классов, русскоязычный корпус.

Анализ моделей векторных представлений слов в задаче разметки семантических ролей в русскоязычных текстах

Лейсан Маратовна Кадермятова, Елена Викторовна Тутубалина
1026-1043
Аннотация: Изучено влияние использования векторных представлений слов на качество установления семантических ролей в русскоязычных текстах. Задача установления семантических ролей в русскоязычных текстах получила широкое распространение после выхода на свет корпуса FrameBank. Были исследованы модели векторных представлений слов word2vec, fastText и ELMo (Embeddings from Language Models). Анализировались метрики качества микро- и макро-F1 как оценочные показатели результатов автоматической разметки актантов. Был проведен ряд экспериментов, демонстрирующих, что модели ELMo, основанные на токенах предикатно-аргументных конструкций, показывают больший прирост качества по сравнению со всеми остальными моделями, в том числе, в сопоставлении с моделями ELMo, обученными на леммах, как по величине микро-F1, так и по величине макро-F1.
Ключевые слова: машинное обучение, обработка естественного языка, векторные представления слов, семантические роли.

Типы эмбеддингов и их применение в интеллектуальной академической генеалогии

Андреас Хачатурович Мариносян
240-261
Аннотация:

Рассмотрена проблема построения интерпретируемых векторных представлений научных текстов для задач интеллектуальной академической генеалогии. Предложена типология эмбеддингов, включающая три класса: статистические, выученные нейросетевые и структурированные символьные. Обоснована необходимость объединения достоинств нейросетевых (высокая семантическая точность) и символьных (интерпретируемость измерений) подходов. Для реализации такого гибридного подхода предложен алгоритм построения выученных символьных эмбеддингов путем регрессионного преобразования вектора внутреннего представления нейросетевой модели в интерпретируемый набор оценок.


Экспериментальная оценка алгоритма проведена на корпусе фрагментов авторефератов диссертаций по педагогическим наукам. Компактный трансформерный энкодер с регрессионной головой обучался воспроизводить тематические оценки, сгенерированные передовой генеративной языковой моделью. Сравнение шести режимов обучения (три типа регрессионной головы и два состояния энкодера) показало, что дообучение верхних слоев энкодера является ключевым фактором повышения качества. По результатам тестирования была выбрана наилучшая конфигурация, которая достигла коэффициента детерминации R² = 0.57 и точности определения трех наиболее релевантных концептов, равной 74%. Результаты подтверждают, что для определенного рода задач, в которых требуется формальное представление выходных данных, возможна аппроксимация поведения генеративной модели компактным энкодером с регрессионной головой при существенно меньших вычислительных затратах. В более широкой перспективе разработка алгоритмов построения выученных символьных эмбеддингов будет способствовать созданию такой модели формальной репрезентации научного знания, в которой конвергенция нейросетевых и символьных методов обеспечит как масштабируемость обработки научных текстов, так и интерпретируемость векторных представлений, кодирующих содержание.

Ключевые слова: эмбеддинги, академическая генеалогия, трансформерный энкодер, регрессионная голова, символьные эмбеддинги, тематический профиль, обработка естественного языка, интерпретируемость, большие языковые модели, наукометрия.
1 - 25 из 36 результатов 1 2 > >> 
Информация
  • Для читателей
  • Для авторов
  • Для библиотек
Отправить материал
Текущий выпуск
  • Логотип Atom
  • Логотип RSS2
  • Логотип RSS1

Электронные библиотеки

ISSN 1562-5419

Информация

  • О журнале
  • Цели и задачи
  • Тематика
  • Руководство для авторов
  • Отправка материалов
  • Заявление о конфиденциальности
  • Контакты
  • eLIBRARY.RU
  • dblp computer science bibliography

Отправить статью

Авторам нужно зарегистрироваться в журнале перед отправкой материалов, или, если вы уже зарегистрированы, можно просто войти со своей учетной записью и начать процесс отправки, состоящий из пяти шагов.

Отправить материал
Больше информации об этой издательской системе, платформе и рабочем процессе от OJS/PKP.

© 2015-2026 Казанский (Приволжский) федеральный университет; Институт развития информационного общества