Аннотация:
Описана архитектура многофункциональной лингвистической платформы “TurkLang”, создаваемой в Институте прикладной семиотики Академии наук Республики Татарстан. В основе системы лежит трехуровневая база знаний: общеязыковые универсалии, описания единиц конкретных языков и эмпирические речевые данные. База знаний реализована в виде графа, где основной единицей хранения выступает морфема. Это решение обусловлено элементно-комбинаторной природой тюркских языков: словоформа представляет собой линейную цепочку, состоящую из корня и последовательно присоединенных аффиксов – модификаторов, каждый из которых выражает одну грамматическую категорию (падеж, число, время и т. д.) в строго фиксированном порядке. Рассмотрены уровни абстракции, типы связей между сущностями, механизмы интеграции с внешними источниками (электронная энциклопедия, лексикографические ресурсы, геоинформационные системы). Особое внимание уделено применению международных стандартов синтаксической, семантической и прагматической (DiAML) аннотаций. Выполнено сравнение с существующими платформами (Sketch Engine, LingvoDoc, Apertium). На сегодняшний день база знаний платформы охватывает более 30 языков и диалектов, содержит более 237 тыс. корневых морфем и около 40 тыс. правил сочетаемости, а корпусная часть насчитывает свыше 180 млн словоупотреблений.