• Main Navigation
  • Main Content
  • Sidebar

Электронные библиотеки

  • Главная
  • О нас
    • О журнале
    • Цели и задачи
    • Тематика
    • Главный редактор
    • Редакция
    • Отправка материалов
    • Заявление об открытом доступе
    • Заявление о конфиденциальности
    • Контакты
  • Текущий выпуск
  • Архивы
  • Регистрация
  • Вход
  • Поиск
Издается с 1998 года
ISSN 1562-5419
16+
Language
  • Русский
  • English

Найти

Расширенные фильтры

Результаты поиска

Предсказание качества автоматического распознавания речи на основе больших языковых моделей

Антон Вячеславович Полевой
1189-1211
Аннотация:

Предложен подход к прогнозированию показателя качества распознавания речи Word Error Rate (WER) на основе акустических характеристик сигнала и вычисления перплексии языковых моделей. Предлагаемый метод включает в себя создание разнообразных наборов аудиоданных путем применения различных типов акустических искажений к чистым речевым образцам на различных уровнях качества и разборчивости. В отличие от предыдущих работ, извлекается и анализируется полный набор речевых признаков: прогнозирование значения отношения сигнал/шум (signal-to-noise ratio, SNR), нейросетевые метрики качества звука (NISQA и др.), метрики уверенности модели распознавания речи, а также перплексия текста гипотезы ASR по языковой модели в качестве дополнительного признака для обучения единой модели прогнозирования WER.


Проведены эксперименты с использованием современных архитектур распознавания речи для демонстрации эффективности предлагаемого метода в прогнозировании WER в различных акустических условиях. Показано, что включение перплексии существенно повышает качество прогноза WER, в частности для данных, где акустические признаки слабо коррелируют с ошибками распознавания. Результаты применимы для автоматической оценки ожидаемого качества распознавания речи и фильтрации аудиовходов.

Ключевые слова: прогнозирование WER, акустическая деградация при распознавании речи, перплексия, уверенность систем автоматического распознавания речи.

Разработка cистемы поиска и индексирования контента аудиозаписей

Роман Алексеевич Климов, Азат Шавкатович Якупов
483-497
Аннотация:

Статья посвящена разработке системы поиска и индексации аудиофайлов с использованием автоматического распознавания речи (ASR) и Elasticsearch. Проанализированы актуальные системы транскрибирования аудиофайлов на русском языке и выбрана система whisper как лучшая. Создан алгоритм оптимизации скорости транскрибирования с помощью параллелизации процессов обработки файла, продемонстрирована его эффективность. Построена система на микросервисной архитектуре, способная индексировать контент аудиофайлов и их мета-данные для поиска. Результаты исследования показали, что предложенный подход может быть применен для создания эффективных и гибких систем поиска и аналитики аудиоинформации.

Ключевые слова: транскрибирование, индексирование, параллелизация, микросервисы, масштабируемость.

Коммуникативная предвзятость ASR при распознавании атипичной речи на русском языке

Анастасия Владимировна Колмогорова, Екатерина Валерьевна Явшиц, Милана Святославна Майорова, Софья Владимировна Дмитриева
2134-2157
Аннотация:

Статья посвящена проблеме коммуникативной предвзятости систем автоматического распознавания речи при работе с атипичной речью на русском языке. Актуальность исследования обусловлена активным внедрением технологий искусственного интеллекта в социальную сферу и государственное управление в России, что предполагает обеспечение их доступности для различных категорий граждан, включая людей с речевыми нарушениями. Введено понятие коммуникативной предвзятости ASR-моделей как свойства системы в условиях неопределенности (атипичная речь, шум, паузы) принимать решения о заполнении смысловых и акустических лакун на основе собственной обучающей выборки. В эмпирической базы исследования выбран корпус RuAphasiaBank, включающий записи речи пациентов с различными типами афазии (моторной, сенсорной, семантической, сенсомоторной) разной степени тяжести, а также нейротипичных информантов. Для сравнительного анализа были отобраны шесть ASR-моделей, работающих с русским языком: две открытые (GigaAM, T-One) и четыре коммерческие (Yandex SpeechKit, Any2Text, Charla, Speech2Text). Качество распознавания оценено с использованием метрик WER и CER, а также с помощью  анализа соотношения вставок, удалений и замен на уровне слов и символов. Результаты показали, что модели реализуют различные стратегии при столкновении с атипичной речью: «паническое укорачивание» (GigaAM, Yandex SpeechKit), «лексическое сохранение» в ущерб точности (T-One) и «стабильная» стратегия сбалансированных ошибок (Any2Text, Speech2Text, Charla). Лингвистический анализ выявил, что каждая модель порождает специфический искаженный коммуникативный стиль: от разговорной диалогической речи до стиля, ассоциируемого с когнитивными нарушениями или употреблением молодежного сленга. На основе полученных данных моделируются потенциальные риски для социального самочувствия и правовой защищенности пациентов с афазией при использовании голосовых помощников в государственных учреждениях.

Ключевые слова: речевые технологии, речевая база данных, автоматическое распознавание речи, атипичная речь, афазия, коммуникативная предвзятость, голосовые ассистенты, ассистивные технологии, инклюзивность.

Автоматическое распознавание речи: факторы снижения точности при работе с региональным вариантом русского языка (на материале Дагестана)

Артем Игоревич Кацнельсон, Ольга Николаевна Ляшевская
2058-2079
Аннотация:

Работа посвящена сравнительному анализу качества автоматического распознавания стандартного русского языка и его дагестанского региолекта (дагестанского русского) – контактного идиома, формирующегося в условиях многоязычия Дагестана. Десять конфигураций ASR-систем (без дообучения), представляющих три архитектурных подхода (Conformer+RNNT, Conformer+CTC, Encoder-Decoder Transformer), протестированы на корпусах стандартного русского (GOLOS, RuDevices, примерно 20 и 90 тыс. высказываний) и дагестанского русского (DaGRuS, примерно 40 тыс. высказываний). Все модели демонстрируют падение метрики WER на 33–50% при переходе к дагестанскому русскому, что указывает на проблему сильного доменного сдвига. Анализ структуры ошибок выявил три основных механизма, вызывающих снижение WER: это русификация – систематическая замена дагестанских форм фонетически близкими стандартными русскими словами; удаление дискурсивных маркеров и OOV-лексики (этнонимов, топонимов); галлюцинации генеративных моделей на непонятных фрагментах. Установлено, что сквозные архитектуры-архитектуры деградируют слабее каскадных (33–35% против 40–42%), однако ни одна из моделей не достигает приемлемого качества (минимум WER около 43%). Сформулированы рекомендации для проектирования ASR-систем, устойчивых к региональной вариативности русского языка.


 

Ключевые слова: автоматическое распознавание речи, ASR, дагестанский региолект русского языка, региолект, региональные варианты речи, WER, языковая вариативность, доменный сдвиг, Conformer, Whisper, GigaAM, галлюцинации.
1 - 4 из 4 результатов
Информация
  • Для читателей
  • Для авторов
  • Для библиотек
Отправить материал
Текущий выпуск
  • Логотип Atom
  • Логотип RSS2
  • Логотип RSS1

Электронные библиотеки

ISSN 1562-5419

Информация

  • О журнале
  • Цели и задачи
  • Тематика
  • Руководство для авторов
  • Отправка материалов
  • Заявление о конфиденциальности
  • Контакты
  • eLIBRARY.RU
  • dblp computer science bibliography

Отправить статью

Авторам нужно зарегистрироваться в журнале перед отправкой материалов, или, если вы уже зарегистрированы, можно просто войти со своей учетной записью и начать процесс отправки, состоящий из пяти шагов.

Отправить материал
Больше информации об этой издательской системе, платформе и рабочем процессе от OJS/PKP.

© 2015-2026 Казанский (Приволжский) федеральный университет; Институт развития информационного общества