Автоматическое распознавание речи: факторы снижения точности при работе с региональным вариантом русского языка (на материале Дагестана)

Main Article Content

Артем Игоревич Кацнельсон
Ольга Николаевна Ляшевская

Аннотация

Работа посвящена сравнительному анализу качества автоматического распознавания стандартного русского языка и его дагестанского региолекта (дагестанского русского) – контактного идиома, формирующегося в условиях многоязычия Дагестана. Десять конфигураций ASR-систем (без дообучения), представляющих три архитектурных подхода (Conformer+RNNT, Conformer+CTC, Encoder-Decoder Transformer), протестированы на корпусах стандартного русского (GOLOS, RuDevices, примерно 20 и 90 тыс. высказываний) и дагестанского русского (DaGRuS, примерно 40 тыс. высказываний). Все модели демонстрируют падение метрики WER на 33–50% при переходе к дагестанскому русскому, что указывает на проблему сильного доменного сдвига. Анализ структуры ошибок выявил три основных механизма, вызывающих снижение WER: это русификация – систематическая замена дагестанских форм фонетически близкими стандартными русскими словами; удаление дискурсивных маркеров и OOV-лексики (этнонимов, топонимов); галлюцинации генеративных моделей на непонятных фрагментах. Установлено, что сквозные архитектуры-архитектуры деградируют слабее каскадных (33–35% против 40–42%), однако ни одна из моделей не достигает приемлемого качества (минимум WER около 43%). Сформулированы рекомендации для проектирования ASR-систем, устойчивых к региональной вариативности русского языка.


 

Article Details

Как цитировать
Кацнельсон, А. И., и О. Н. Ляшевская. «Автоматическое распознавание речи: факторы снижения точности при работе с региональным вариантом русского языка (на материале Дагестана)». Электронные библиотеки, т. 29, вып. 6, октябрь 2026 г., сс. 2058-79, doi:10.26907/1562-5419-2026-29-6-2058-2079.

Библиографические ссылки

1. Dobrushina N.R. Mnogoyazychie v Dagestane, ili zachem cheloveku tri yazyka // Sotsiologicheskii zhurnal. 2007. No. 1. P. 103–127.
2. Markl N. Language variation and algorithmic bias: Understanding algorithmic biases in British English automatic speech recognition // Proceedings of the 2022 ACM Conference on Fairness, Accountability, and Transparency. 2022. P. 521–534.
3. Feng S., Kudina O., Halpern B.M., Scharenborg O. Quantifying bias in automatic speech recognition // arXiv:2103.15122. https://doi.org/10.48550/arXiv.2103
4. Conneau A., Baevski A., Collobert R., Mohamed A., Auli M. Unsupervised cross-lingual representation learning for speech recognition // Proceedings of Interspeech 2021. 2021. P. 2426–2430.
5. Karpov N., Denisenko A., Minkin F. Golos: Russian dataset for speech research // Proceedings of Interspeech 2021. 2021. P. 1419–1423.
6. Dobrushina N., Daniel M., von Waldenfels R., Maisak T., Panova A. Corpus of Russian spoken in Daghestan. 2018. URL: http://www.parasolcorpus.org/dagrus/ (accessed: 24.02.2026).
7. Hinsvark A. et al. Accented speech recognition: A survey // arXiv:2104.10747. 2021. https://doi.org/10.48550/arXiv.2104.10747
8. Ramesh G.V. et al. Federated representation learning for automatic speech recognition // Proc. 3rd Symposium on Security and Privacy in Speech Communication. 2023. P. 29–33. https://doi.org/10.21437/SPSC.2023-5
9. Mann H.B., Whitney D.R. On a test of whether one of two random variables is stochastically larger than the other // The Annals of Mathematical Statistics. 1947. Vol. 18, No. 1. P. 50–60.
10. Efron B. Bootstrap methods: Another look at the jackknife // The Annals of Statistics. 1979. Vol. 7, No. 1. P. 1–26.
11. Korobov M. Morphological analyzer and generator for Russian and Ukrainian languages // Analysis of Images, Social Networks and Texts. Communications in Computer and Information Science. Vol. 542. Cham: Springer, 2015. P. 320–332.
12. Naccarato C., Panova A., Stoynova N. Word-order variation in a contact setting: A corpus-based investigation of Russian spoken in Daghestan // Language Variation and Change. 2021. Vol. 33, No. 3. P. 387–411.
13. Guerreiro N.M., Voita E., Martins A.F.T. Looking for a needle in a haystack: A comprehensive study of hallucinations in neural machine translation // Proceedings of the 17th Conference of the European Chapter of the Association for Computational Linguistics. 2023.