• Main Navigation
  • Main Content
  • Sidebar

Электронные библиотеки

  • Главная
  • О нас
    • О журнале
    • Цели и задачи
    • Тематика
    • Главный редактор
    • Редакция
    • Отправка материалов
    • Заявление об открытом доступе
    • Заявление о конфиденциальности
    • Контакты
  • Текущий выпуск
  • Архивы
  • Регистрация
  • Вход
  • Поиск
Издается с 1998 года
ISSN 1562-5419
16+
Language
  • Русский
  • English

Найти

Расширенные фильтры

Результаты поиска

Формирование и разметка корпуса русскоязычных новостных текстов для автоматизированного выявления политических манипуляций

Нина Леонидовна Кулюлина
782-797
Аннотация:

Исследована проблема создания специализированных корпусных ресурсов для задач автоматизированного анализа политических манипуляций в русскоязычных текстах. Несмотря на активное развитие методов семантического и вычислительного анализа текстов, существующие корпусные ресурсы и схемы разметки в основном ориентированы на англоязычные данные и плохо учитывают языковую и контекстуальную специфику русскоязычных новостных средств массовой информации (СМИ).


Целями исследования были создание специализированного корпуса русскоязычных новостных текстов и разработка схемы разметки, ориентированной на автоматизированный анализ политических манипуляций с учетом особенностей русскоязычного медиапространства. 


В рамках проведенного исследования сформирован корпус фраз, извлеченных из русскоязычных новостных текстов и опубликованных в период 2010–2019 гг., и разработана схема разметки манипулятивных техник. В основе разметки лежит адаптация международных классификаций манипулятивных стратегий, сведенных к ограниченному числу интерпретируемых техник, релевантных для анализа русскоязычных новостных текстов. Предлагаемая схема охватывает эмоциональные, аргументативные и контекстуальные формы манипулятивного воздействия.


Полученные корпус и схема разметки могут использоваться в качестве эмпирической основы для разработки и тестирования методов автоматизированного анализа политических манипуляций в русскоязычных новостных СМИ, а также дальнейших исследований политических и медиа-текстов.

Ключевые слова: медиа-манипуляции, русскоязычные СМИ, корпус текстов, разметка данных, манипулятивные техники, политическая коммуникация, семантический анализ, вычислительный дискурс-анализ.

HaRuCo: новый русскоязычный корпус научно-популярных текстов с разметкой кореференции

Роман Денисович Шувалов, Елена Анатольевна Сидорова
1293-1303
Аннотация:

Представлен новый русскоязычный корпус с разметкой кореференции HaRuCo (Habr Russian Coreference Corpus). В качестве основы для корпуса взяты научно-популярные статьи, относящиеся к предметной области «Компьютерная лингвистика». Предложена методика разметки кореференции для текстов узких предметных областей, которая включает четыре основных этапа: синтаксический анализ текста; сборку именных групп и выделение местоимений для построения упоминаний (спанов); классификацию упоминаний классами предметной области; кластеризацию упоминаний в соответствии с цепочками кореферентно-связанных спанов. Аннотирование кореферентных связей осуществлено с применением синтаксического парсера и большой языковой модели, оно прошло ручную проверку и корректировку. Созданный корпус включает 3727 сущностей, 9905 упоминаний и 2683 кореферентных цепочек. Он может быть использован для обучения и оценки моделей разрешения кореференции для русского языка.

Ключевые слова: разрешение кореференции, разметка кореференции, корпус текстов, научно-популярный текст, методика разметки, разметка упоминаний, кластеризация упоминаний, кореферентная связь.

PromptAlign: автоматическое итеративное выравнивание большой языковой модели под экспертную разметку без дообучения

Александр Алексеевич Агафонов, Ахат Рустемович Хусаинов, Николай Аркадиевич Прокопьев
2265-2292
Аннотация:

Большие языковые модели все активнее применяются в социальных и психологических науках, однако их предсказания систематически смещены относительно экспертной разметки (эффект смещения выравнивания, alignment shift), а попытки улучшить инструкции вручную или с помощью примеров приводят к так называемому эффекту «перетягивания одеяла» – деградации миноритарных классов.


В работе предложен PromptAlign – автоматический конвейер оптимизации инструкций, не требующий ни доступа к весам модели, ни участия человека в итеративной коррекции, так как таксономия и пространство признаков задаются экспертом априори. Конвейер извлекает гибридные лингвистические и семантические признаки с помощью большой языковой модели, строит на их основе интерпретируемые L1-логистические регрессии для локализации расхождений с экспертом, выполняет метаанализ ошибок и компилирует новые инструкции, управляя балансом через метрику индекса дисбаланса классов (Blanket Pulling Index, BPI). Эксперимент на корпусе, включающем 541 текст на русском языке, с тремя психологическими классами показал рост macro-F1 на отложенной тестовой выборке с 0.655 до 0.749 и минимальной классовой F1 с 0.449 до 0.656 (p > 0.99 по парному бутстрэп-тесту). Метод значимо превосходит базовые уровни — без примеров (zero-shot) и с подачей примеров (few-shot). Анализ вклада компонентов подтвердил критическую роль семантической интерпретации признаков и периодической перекомпоновки инструкций. Итоговая инструкция содержит пять правил, отражающих латентные критерии экспертов; в отличие от неинтерпретируемых моделей автоматических оптимизаторов, эти правила доступны для проверки и корректировки специалистом.

Ключевые слова: большая языковая модель, оптимизация инструкций, выравнивание, интерпретируемость, L1-регуляризация, бутстрэп-тест, классификация текстов, психологическая разметка, суррогатная модель, индекс дисбаланса классов, русскоязычный корпус.

Прагматические границы приветствий и прощаний: оценка LLM на материале мультимедийного корпуса речевого этикета

Ксения Сергеевна Клокова, Максим Aнисимович Кронгауз, Валерий Александрович Шульгинов, Татьяна Александровна Юдина
2080-2104
Аннотация:

 


Исследована способность больших языковых моделей выявлять в русскоязычных диалогах последовательности приветствий и прощаний и определять их точные прагматические границы. Рассмотрены YandexGPT 5.1 Pro, GigaChat 2 Max и GPT-5 с целью: классификации диалогов по наличию указанных последовательностей и извлечении отдельных высказываний с учетом их интенциональных границ. На материале 216-ти диалогов из «Мультимедийного корпуса речевого этикета русского языка» проведен эксперимент, позволивший учесть широкий коммуникативный и социальный контекст взаимодействия. GPT-5 продемонстрировал наиболее высокое качество классификации на уровне диалога, тогда как YandexGPT и GigaChat достигли почти идеальной точности за счет консервативных стратегий. При извлечении точных границ качество всех моделей заметно снижается. Анализ ошибок показал, что модели систематически включают лишние контекстуальные невербальные действия и пропускают нестандартные маркеры: жесты, формы обращения, дискурсивные маркеры и импликатуры, указывающие на будущий контакт. Представлены актуализированное описание корпуса, его веб-интерфейс, а также возможности формирования диагностических подкорпусов и бенчмарков. Полученные результаты подчеркивают необходимость более точного учета структуры дискурса и контекстуальной вариативности повседневного общения.

Ключевые слова: большие языковые модели, мультимедийный корпус речевого этикета, приветствие, прощание, речевой этикет, прагматические границы, формулы вежливости, анализ диалога.

Морфологические формы глагола в задаче распознавания эмоций: характеристики данных и результаты классификации

Полина Владимировна Ярошенко, Анастасия Алексеевна Петрова, Наталья Валентиновна Лукашевич
2240-2264
Аннотация:

Распознавание эмоций в тексте является одной из актуальных задач обработки естественного языка. В работе исследовано влияние морфологической формы глагола на качество эмоциональной классификации моделями-энкодерами и выявлены факторы, определяющие морфологическую чувствительность языковых моделей. Для эксперимента использованы три модели (ruBERT-tiny2, ruBERT-base, ruRoBERTa-large), дообученные на объединенном корпусе из четырех русскоязычных датасетов (22852 примера). Каждая модель классифицировала 5676 морфологических форм 473 глаголов из Russian Emotion Lexicon. В результате зафиксировано систематическое влияние морфологии: различия в качестве классификации между формами по метрике F1 достигают 20–25% для всех моделей. Для объяснения установленных закономерностей был проведен анализ характеристик обучающих данных. Показано, что частотность морфологических форм в корпусе частично коррелирует с качеством классификации, однако не является единственным определяющим фактором. При анализе распределения эмоций по морфологическим формам выявлено, что в обучающем корпусе императив преимущественно встречается в контекстах с эмоцией «Радость». Однако глаголы класса «Грусть» в форме повелительного наклонения систематически классифицируются энкодерами как «Злость». Это расхождение между характеристиками обучающих данных и результатами классификации указывает на то, что императив в сочетании с семантикой грусти интерпретируется моделями как выражение агрессии, что свидетельствует о взаимодействии грамматической формы с семантикой глагола при определении эмоционального класса.

Ключевые слова: классификация эмоций, BERT, обработка естественного языка, русский язык, морфология.

Методы автоматического присвоения кодов УДК математическим статьям: оценка классических и нейросетевых подходов

Булат Тимурович Гизатуллин, Ольга Авенировна Невзорова
699-718
Аннотация:

Универсальная десятичная классификация (УДК) – это иерархическая система индексирования, в рамках которой одной публикации могут соответствовать один или несколько кодов. Ручное присвоение кодов УДК трудоемко и нередко оказывается неоднородным. В работе рассмотрена задача автоматического присвоения кодов УДК русскоязычным математическим статьям. Цель исследования – сравнить различные сочетания текстовых представлений и моделей классификации на едином корпусе и определить наиболее эффективные конфигурации. Для этого был сформирован корпус из 4194 статей с ресурса Math-Net.Ru, включающий полные тексты, аннотации, метаданные и коды УДК; были выполнены извлечение текста из PDF-файлов, очистка артефактов верстки и нормализация кодов. В эксперименте сопоставлялись текстовые представления TF-IDF, Word2Vec, SciRus-tiny и SciRus-tiny3.5 в сочетании с моделями логистической регрессии, Complement Naive Bayes (CNB) и CatBoost. Наилучшие результаты в обеих постановках – однозначной (single-label) и многозначной (multi-label) – показала модель TF-IDF + LogReg; близкие результаты продемонстрировала конфигурация TF-IDF + CNB. Полученные результаты могут быть использованы при разработке систем автоматической рубрикации научных публикаций, рекомендательных сервисов для авторов и редакторов, а также средств контроля качества тематической разметки.

Ключевые слова: автоматическая классификация, универсальная десятичная классификация, УДК, обработка научных текстов, машинное обучение, иерархическая классификация, многозначная классификация, математические тексты, цифровые библиотеки, векторизация текста.
1 - 6 из 6 результатов
Информация
  • Для читателей
  • Для авторов
  • Для библиотек
Отправить материал
Текущий выпуск
  • Логотип Atom
  • Логотип RSS2
  • Логотип RSS1

Электронные библиотеки

ISSN 1562-5419

Информация

  • О журнале
  • Цели и задачи
  • Тематика
  • Руководство для авторов
  • Отправка материалов
  • Заявление о конфиденциальности
  • Контакты
  • eLIBRARY.RU
  • dblp computer science bibliography

Отправить статью

Авторам нужно зарегистрироваться в журнале перед отправкой материалов, или, если вы уже зарегистрированы, можно просто войти со своей учетной записью и начать процесс отправки, состоящий из пяти шагов.

Отправить материал
Больше информации об этой издательской системе, платформе и рабочем процессе от OJS/PKP.

© 2015-2026 Казанский (Приволжский) федеральный университет; Институт развития информационного общества