• Main Navigation
  • Main Content
  • Sidebar

Электронные библиотеки

  • Главная
  • О нас
    • О журнале
    • Цели и задачи
    • Тематика
    • Главный редактор
    • Редакция
    • Отправка материалов
    • Заявление об открытом доступе
    • Заявление о конфиденциальности
    • Контакты
  • Текущий выпуск
  • Архивы
  • Регистрация
  • Вход
  • Поиск
Издается с 1998 года
ISSN 1562-5419
16+
Language
  • Русский
  • English

Найти

Расширенные фильтры

Результаты поиска

Коммуникативная предвзятость ASR при распознавании атипичной речи на русском языке

Анастасия Владимировна Колмогорова, Екатерина Валерьевна Явшиц, Милана Святославна Майорова, Софья Владимировна Дмитриева
2134-2157
Аннотация:

Статья посвящена проблеме коммуникативной предвзятости систем автоматического распознавания речи при работе с атипичной речью на русском языке. Актуальность исследования обусловлена активным внедрением технологий искусственного интеллекта в социальную сферу и государственное управление в России, что предполагает обеспечение их доступности для различных категорий граждан, включая людей с речевыми нарушениями. Введено понятие коммуникативной предвзятости ASR-моделей как свойства системы в условиях неопределенности (атипичная речь, шум, паузы) принимать решения о заполнении смысловых и акустических лакун на основе собственной обучающей выборки. В эмпирической базы исследования выбран корпус RuAphasiaBank, включающий записи речи пациентов с различными типами афазии (моторной, сенсорной, семантической, сенсомоторной) разной степени тяжести, а также нейротипичных информантов. Для сравнительного анализа были отобраны шесть ASR-моделей, работающих с русским языком: две открытые (GigaAM, T-One) и четыре коммерческие (Yandex SpeechKit, Any2Text, Charla, Speech2Text). Качество распознавания оценено с использованием метрик WER и CER, а также с помощью  анализа соотношения вставок, удалений и замен на уровне слов и символов. Результаты показали, что модели реализуют различные стратегии при столкновении с атипичной речью: «паническое укорачивание» (GigaAM, Yandex SpeechKit), «лексическое сохранение» в ущерб точности (T-One) и «стабильная» стратегия сбалансированных ошибок (Any2Text, Speech2Text, Charla). Лингвистический анализ выявил, что каждая модель порождает специфический искаженный коммуникативный стиль: от разговорной диалогической речи до стиля, ассоциируемого с когнитивными нарушениями или употреблением молодежного сленга. На основе полученных данных моделируются потенциальные риски для социального самочувствия и правовой защищенности пациентов с афазией при использовании голосовых помощников в государственных учреждениях.

Ключевые слова: речевые технологии, речевая база данных, автоматическое распознавание речи, атипичная речь, афазия, коммуникативная предвзятость, голосовые ассистенты, ассистивные технологии, инклюзивность.

Автоматическое распознавание речи: факторы снижения точности при работе с региональным вариантом русского языка (на материале Дагестана)

Артем Игоревич Кацнельсон, Ольга Николаевна Ляшевская
2058-2079
Аннотация:

Работа посвящена сравнительному анализу качества автоматического распознавания стандартного русского языка и его дагестанского региолекта (дагестанского русского) – контактного идиома, формирующегося в условиях многоязычия Дагестана. Десять конфигураций ASR-систем (без дообучения), представляющих три архитектурных подхода (Conformer+RNNT, Conformer+CTC, Encoder-Decoder Transformer), протестированы на корпусах стандартного русского (GOLOS, RuDevices, примерно 20 и 90 тыс. высказываний) и дагестанского русского (DaGRuS, примерно 40 тыс. высказываний). Все модели демонстрируют падение метрики WER на 33–50% при переходе к дагестанскому русскому, что указывает на проблему сильного доменного сдвига. Анализ структуры ошибок выявил три основных механизма, вызывающих снижение WER: это русификация – систематическая замена дагестанских форм фонетически близкими стандартными русскими словами; удаление дискурсивных маркеров и OOV-лексики (этнонимов, топонимов); галлюцинации генеративных моделей на непонятных фрагментах. Установлено, что сквозные архитектуры-архитектуры деградируют слабее каскадных (33–35% против 40–42%), однако ни одна из моделей не достигает приемлемого качества (минимум WER около 43%). Сформулированы рекомендации для проектирования ASR-систем, устойчивых к региональной вариативности русского языка.


 

Ключевые слова: автоматическое распознавание речи, ASR, дагестанский региолект русского языка, региолект, региональные варианты речи, WER, языковая вариативность, доменный сдвиг, Conformer, Whisper, GigaAM, галлюцинации.

Предсказание качества автоматического распознавания речи на основе больших языковых моделей

Антон Вячеславович Полевой
1189-1211
Аннотация:

Предложен подход к прогнозированию показателя качества распознавания речи Word Error Rate (WER) на основе акустических характеристик сигнала и вычисления перплексии языковых моделей. Предлагаемый метод включает в себя создание разнообразных наборов аудиоданных путем применения различных типов акустических искажений к чистым речевым образцам на различных уровнях качества и разборчивости. В отличие от предыдущих работ, извлекается и анализируется полный набор речевых признаков: прогнозирование значения отношения сигнал/шум (signal-to-noise ratio, SNR), нейросетевые метрики качества звука (NISQA и др.), метрики уверенности модели распознавания речи, а также перплексия текста гипотезы ASR по языковой модели в качестве дополнительного признака для обучения единой модели прогнозирования WER.


Проведены эксперименты с использованием современных архитектур распознавания речи для демонстрации эффективности предлагаемого метода в прогнозировании WER в различных акустических условиях. Показано, что включение перплексии существенно повышает качество прогноза WER, в частности для данных, где акустические признаки слабо коррелируют с ошибками распознавания. Результаты применимы для автоматической оценки ожидаемого качества распознавания речи и фильтрации аудиовходов.

Ключевые слова: прогнозирование WER, акустическая деградация при распознавании речи, перплексия, уверенность систем автоматического распознавания речи.

Разработка cистемы поиска и индексирования контента аудиозаписей

Роман Алексеевич Климов, Азат Шавкатович Якупов
483-497
Аннотация:

Статья посвящена разработке системы поиска и индексации аудиофайлов с использованием автоматического распознавания речи (ASR) и Elasticsearch. Проанализированы актуальные системы транскрибирования аудиофайлов на русском языке и выбрана система whisper как лучшая. Создан алгоритм оптимизации скорости транскрибирования с помощью параллелизации процессов обработки файла, продемонстрирована его эффективность. Построена система на микросервисной архитектуре, способная индексировать контент аудиофайлов и их мета-данные для поиска. Результаты исследования показали, что предложенный подход может быть применен для создания эффективных и гибких систем поиска и аналитики аудиоинформации.

Ключевые слова: транскрибирование, индексирование, параллелизация, микросервисы, масштабируемость.

Моделирование и метод расчета усиливаемых нагруженных стержневых конструкций

Мурат Нуриевич Серазутдинов, Маджид Насриевич Убайдуллоев
611-626
Аннотация:

Представлены разработанные математические модели и вариационный метод расчета пространственных стержневых конструкций, усиленных в нагруженном состоянии. Эти модели и метод расчета имеют более широкие возможности по сравнению с существующими. Их использование позволяет выполнять расчеты стержневых систем, усиливаемых способами наращивания поперечных сечений стержней, изменения расчетной схемы и деформированного состояния. Рассмотрены сложные стержневые конструкции с различными формами поперечного сечения. В основе расчетов лежат гипотезы теории стержней Тимошенко. Для тонкостенных стержней дополнительно использованы положения теории тонкостенных стержней с учетом сдвиговых деформаций. Предполагается, что материал стержневого элемента следует диаграмме линейно упрочняющегося материала. Расчет напряжено-деформированного состояния (НДС) усиленной конструкции выполняется поэтапно. На начальной стадии вычисляются перемещения и напряжения в элементах конструкции под действием исходных нагрузок. На втором этапе определяются величины монтажных сил и напряжений, возникающих при присоединении усиливающих элементов к основным элементам конструкции. На последнем этапе выполняется расчет усиленной конструкции от воздействий дополнительных нагрузок, прикладываемых к конструкции после усиления. Рассмотрены примеры расчета эксплуатируемых конструкций, усиленных различными способами, с использованием предложенных моделей и метода расчета.

Ключевые слова: стержневая система, математическая модель, вариационный метод, напряженно-деформированное состояние, ремонт и усиление.

Инфраструктура пространственных данных для научных исследований

О.М. Атаева, А.В. Кошкарев, А.А. Медведев, В.А. Серебряков, К.Б. Теймуразов
Аннотация: Обсуждаются планы создания Академической инфраструктуры пространственных данных как элемента единого научного пространства РАН. Приводятся результаты ее реализации, в том числе геопорталы будущей распределенной сети узлов «ГеоМета» ВЦ РАН (http://www.geometa.ru) и ИГ РАН (http://asdi.igras.ru), и проект по особо охраняемым природным территориям России на основе интегрированной прикладной схемы в соответствии со спецификацией Директивы INSPIRE Европейского союза.
Ключевые слова: пространственные данные, инфраструктура пространственных данных, геопортал, особо охраняемые природные территории, метаданные.
1 - 6 из 6 результатов
Информация
  • Для читателей
  • Для авторов
  • Для библиотек
Отправить материал
Текущий выпуск
  • Логотип Atom
  • Логотип RSS2
  • Логотип RSS1

Электронные библиотеки

ISSN 1562-5419

Информация

  • О журнале
  • Цели и задачи
  • Тематика
  • Руководство для авторов
  • Отправка материалов
  • Заявление о конфиденциальности
  • Контакты
  • eLIBRARY.RU
  • dblp computer science bibliography

Отправить статью

Авторам нужно зарегистрироваться в журнале перед отправкой материалов, или, если вы уже зарегистрированы, можно просто войти со своей учетной записью и начать процесс отправки, состоящий из пяти шагов.

Отправить материал
Больше информации об этой издательской системе, платформе и рабочем процессе от OJS/PKP.

© 2015-2026 Казанский (Приволжский) федеральный университет; Институт развития информационного общества