Аннотация:
Работа посвящена созданию первого корпуса для осетинского языка с морфологической разметкой в формате Universal Dependencies. Корпус состоит из размеченных вручную текстов Устного корпуса осетинского языка, содержит 5454 предложения и имеет суммарный объём 73 042 токена. Также в работе представлен морфологический анализатор на основе архитектуры BERT, достигающий пословной корректности 95,60%. Кроме того, в работе приведены результаты экспериментов по улучшению качества классификации. Показано, что фильтрация выдачи модели с помощью бесконтекстного анализатора и многозадачный подход не приводят к значительному улучшению. Наконец, в работе представлены результаты тестирования анализатора на внедоменных данных и показано, что на них модель достигает пословной корректности 91,45%. Статья является расширением статьи конференции «Диалог».