Автоматический морфологический анализ для осетинского языка на материале устного корпуса

Main Article Content

Анна Сергеевна Шатских
Алексей Андреевич Сорокин

Аннотация

Работа посвящена созданию первого корпуса для осетинского языка с морфологической разметкой в формате Universal Dependencies. Корпус состоит из размеченных вручную текстов Устного корпуса осетинского языка, содержит 5454 предложения и имеет суммарный объём 73 042 токена. Также в работе представлен морфологический анализатор на основе архитектуры BERT, достигающий пословной корректности 95,60%. Кроме того, в работе приведены результаты экспериментов по улучшению качества классификации. Показано, что фильтрация выдачи модели с помощью бесконтекстного анализатора и многозадачный подход не приводят к значительному улучшению. Наконец, в работе представлены результаты тестирования анализатора на внедоменных данных и показано, что на них модель достигает пословной корректности 91,45%. Статья является расширением статьи конференции «Диалог».

Article Details

Как цитировать
Шатских, А. С., и А. А. Сорокин. «Автоматический морфологический анализ для осетинского языка на материале устного корпуса». Электронные библиотеки, т. 29, вып. 6, октябрь 2026 г., сс. 2215-39, doi:10.26907/1562-5419-2026-29-6-2215-2239.

Библиографические ссылки

1. Ethnologue. URL: http://www.ethnologue.com/show_language.asp?code=oss
2. Осетинский национальный корпус. URL: http://corpus.ossetic-studies.org
3. Устный корпус осетинского. URL: https://www.ossetic-studies.org/ru/texts/iron
4. Arkhangelskiy T., Belyaev O., Vydrin A. The Creation of Large-Scale Annotated Corpora of Minority Languages using UniParser and the EANC platform. // Proceedings of COLING 2012: Posters, Mumbai, India. The COLING 2012 Organizing Committee: 2012 (P. 83–92).
5. Nivre J., de Marneffe M., Ginter F., Hajic J., Manning C., Pyysalo S., Schuster S., Tyers F., Zeman D. Universal Dependencies v2: An Evergrowing Multilingual Treebank Collection. // Proceedings of the Twelfth Language Resources and Evaluation Conference, Marseille, France. European Language Resources Association: 2020 (P. 4034–4043).
6. Abaev V. A grammatical sketch of Ossetic. The Hague: Mouton, 1964.
7. Беляев О.И. Коррелятивная конструкция в осетинском языке (диссертация на соискание степени кандидата филологических наук). 2014.
8. Belyaev O. Evolution of Case in Ossetic. // Iran and the Caucasus. 2010. 14(2). С. 287–322.
9. Serdobolskaya N., Tuzhik O. Differential Object Marking in Modern Ossetic: Referential Properties and Animacy // Tomsk Journal of Linguistics and Anthropology. 2025. 48(2). P. 91–107.
10. Kondratyuk D., Straka M. 75 Languages, 1 Model: Parsing Universal Dependencies Universally. // Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP), Hong Kong, China. Association for Computational Linguistics: 2019 (P. 2779–2795).
11. Straka M., Straková J., Hajic, J. UDPipe at SIGMORPHON 2019: Contextualized Embeddings, Regularization with Morphological Categories, Corpora Merging. // Proceedings of the 16th Workshop on Computational Research in Phonetics, Phonology, and Morphology, Florence, Italy. Association for Computational Linguistics: 2019 (P. 95–103).
12. Devlin J., Chang M., Lee K., Toutanova K. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. // Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers), Minneapolis, Minnesota. Association for Computational Linguistics: 2020 (P. 4171–4186).
13. google-bert/bert-base-multilingual-cased. URL: https://huggingface.co/google-bert/bert-base-multilingual-cased
14. Kuratov, Y., Arkhipov, M. Adaptation of Deep Bidirectional Multilingual Transformers for Russian Language. 2019.
15. Hulden M. Foma: a Finite-State Compiler and Library // Proceedings of the Demonstrations Session at EACL 2009, Athens, Greece. Association for Computational Linguistics: 2009 (P. 29—32)
16. Inoue G., Shindo H., Matsumoto Y. Joint Prediction of Morphosyntactic Categories for Fine-Grained Arabic Part-of-Speech Tagging Exploiting Tag Dictionary Information. // Proceedings of the 21st Conference on Computational Natural Language Learning (CoNLL 2017), Vancouver, Canada. Association for Computational Linguistics: 2017 (P. 421–431).
17. Ossetic-COT. URL: https://github.com/ania3000/Ossetic-COT
18. ossetic-encoders/ossbert-morph. URL: https://huggingface.co/ossetic-encoders/ossbert-morph