Архитектура лингвистической платформы “TurkLang”

Main Article Content

Айрат Рафизович Гатиатуллин

Аннотация

Описана архитектура многофункциональной лингвистической платформы “TurkLang”, создаваемой в Институте прикладной семиотики Академии наук Республики Татарстан. В основе системы лежит трехуровневая база знаний: общеязыковые универсалии, описания единиц конкретных языков и эмпирические речевые данные. База знаний реализована в виде графа, где основной единицей хранения выступает морфема. Это решение обусловлено элементно-комбинаторной природой тюркских языков: словоформа представляет собой линейную цепочку, состоящую из корня и последовательно присоединенных аффиксов – модификаторов, каждый из которых выражает одну грамматическую категорию (падеж, число, время и т. д.) в строго фиксированном порядке. Рассмотрены уровни абстракции, типы связей между сущностями, механизмы интеграции с внешними источниками (электронная энциклопедия, лексикографические ресурсы, геоинформационные системы). Особое внимание уделено применению международных стандартов синтаксической, семантической и прагматической (DiAML) аннотаций. Выполнено сравнение с существующими платформами (Sketch Engine, LingvoDoc, Apertium). На сегодняшний день база знаний платформы охватывает более 30 языков и диалектов, содержит более 237 тыс. корневых морфем и около 40 тыс. правил сочетаемости, а корпусная часть насчитывает свыше 180 млн словоупотреблений.

Article Details

Как цитировать
Гатиатуллин, А. Р. «Архитектура лингвистической платформы “TurkLang”». Электронные библиотеки, т. 29, вып. 6, октябрь 2026 г., сс. 2330-56, doi:10.26907/1562-5419-2026-29-6-2330-2356.

Библиографические ссылки

1. Guzev V.G. O nekotorykh ekzoticheskikh osobennostyakh tyurkskikh yazykov («tyurkskie chudesa») // Aktual'nye problemy mirovoy politiki. 2020. Vol. 10. P. 231–245. https://doi.org/10.21638/11701/26868318.16
2. Koskenniemi K. Two-Level Morphology: A General Computational Model for Word-Form Recognition and Production. Helsinki: University of Helsinki, 1983. 160 p.
3. Apresyan Y.D. Izbrannye trudy. Tom II. Integral'noe opisanie yazyka i sistemnaya leksikografiya. Moscow: Shkola “Yazyki russkoi kul’tury”, 1995. 769 p.
4. Krauwer S. The basic language resource kit (BLARK) as the first milestone for the language resources roadmap // Proc. International workshop on speech and computer SPECOM-2003, Moscow, Russia, Oct. 2003. P. 8–15.
5. Kilgarriff A., Rychlý P., Smrž P., Tugwell D. The Sketch Engine // Proceedings of the Eleventh EURALEX International Congress, Lorient, France, Jul. 2004. P. 105–116.
6. Normanskaya Y.V., Borisenko O.D., Beloborodov I.B., Avetisyan A.I. The Software System LingvoDoc and the Possibilities It Offers for Documentation and Analysis of Ob-Ugric Languages // Doklady Mathematics. 2022. Vol. 105, No. 3. P. 187–206. https://doi.org/10.31857/S2686954322030055
7. Khanna, T., Washington, J.N., Tyers, F.M et al. Recent advances in Apertium, a free/open-source rule-based machine translation platform for low-resource languages // Machine Translation. 2021. Vol. 35. P. 475–502. https://doi.org/10.1007/s10590-021-09260-6
8. Bakay Ö., Ergelen Ö., Sarmış E., Yıldırım S., et al. Turkish WordNet KeNet // Proceedings of the 11th Global Wordnet Conference, Virtual, Jan. 2021. P. 166–174. https://doi.org/10.18653/v1/2021.gwc-1.19
9. Agostini A., Usmanov T., Khamdamov U., Abdurakhmonova N., et al. UZWORDNET: A Lexical- Semantic Database for the Uzbek Language // Proceedings of the 11th Global Wordnet Conference, Virtual, Jan. 2021. P. 8–19. https://doi.org/10.18653/v1/2021.gwc-1.2
10. Marsan B., Kara N., Ozcelik M., Arican B. N., et al. Building the Turkish FrameNet // Proceedings of the 11th Global Wordnet Conference, Virtual, Jan. 2021. P. 118–125. https://doi.org/10.18653/v1/2021.gwc-1.14
11. Rezhake M., Kuerban A. Design of the Uyghur FrameNet Desktop // Lecture Notes on Software Engineering. 2015. Vol. 3. No. 1. P. 53–56. https://doi.org/10.7763/LNSE.2015.V3.165
12. Navigli R., Ponzetto S.P. BabelNet: The Automatic Construction, Evaluation and Application of a Wide-Coverage Multilingual Semantic Network // Artificial Intelligence. 2012. Vol. 193. P. 217–250. https://doi.org/10.1016/j.artint.2012.07.001
13. Gangemi A., Alam M., Asprino L., Presutti V., et al. Framester: A Wide Coverage Linguistic Linked Data Hub. // Knowledge Engineering and Knowledge Management. EKAW 2016. Lecture Notes in Computer Science. 2016. Vol. 10024. P. 239–254. https://doi.org/10.1007/978-3-319-49004-5 16
14. Nivre J., de Marneffe M-C., Ginter F., Hajič J., et al. Universal Dependencies v2: An Evergrowing Multilingual Treebank Collection // Proceedings of the Twelfth Language Resources and Evaluation Conference (LREC 2020), Marseille, France, May. 2020. P. 4034–4043.