Preview

Арктика XXI век

Расширенный поиск

Модель универсального лингвистического графа знаний тюркских языков

https://doi.org/10.25587/3034-7378-2026-14-3-5-21

Аннотация

В статье описывается новая модель универсального лингвистического графа знаний для тюркских языков как основа для создания онтолингвистических ресурсов. В предлагаемой модели знания о мире формализованы в виде онтологического ядра, объединяющего таксономическую и ситуационную онтологии (по аналогии с WordNet и FrameNet) и тесно взаимосвязанного с лингвистическими данными тюркских языков. Актуальность работы обусловлена малоресурсностью большинства тюркских языков и потерей эффективности нейро-сетевых подходов при обработке агглютинативных языков с богатой морфологией, что ограничивает применение больших языковых моделей к тюркским языкам. Цель проекта – разработка новой модели универсального лингвистического графа знаний для тюркских языков. Для реализации этой цели нами решались следующие задачи, такие как объединение знаний о мире и глубоких лингвистических сведений на всех уровнях языковой системы; построение графа по принципу семиотической вертикали; обеспечение морфемоцентричности модели; интеграция с международными языковыми стандартами. В ка-честве основополагающего метода предлагается прагматически-ориентированный подход, фокусирующий предметную область на структурно-функциональных особенностях тюркских языков. Граф знаний строится по принципу семиотической вертикали, объединяющей пять уровней – фонологический, морфологический, синтаксический, семантический и прагматический, а также три межуровневых моста (морфонологический, морфосинтаксический и морфосемантический). Ключевая особенность модели – морфемоцентричность, где морфема выступает базовой лингвистической единицей, связанной с единицами всех языковых уровней модели, что принципиально отличает подход от словоцентричных моделей для флективных языков. Модель интегрирована с международными яыковыми стандартами: IPA, Universal Dependencies, UDS, UMR, FrameNet, WordNet и DiAML, каждый из которых используется для описания языковых элементов и отношений на своем языковом уровне. Модель уже нашла практическое применение в нескольких программных продуктах, таких как лингвистический портал «Тюркская морфема» и новой версии татарского корпуса «Туган тел». Перспективы включают повышение интерпретируемости LLM, улучшение качества машинного перевода и унификацию аннотаций электронных корпусов.

Об авторах

А. Р. Гатиатуллин
Институт прикладной семиотики Академии наук Республики Татарстан
Россия

ГАТИАТУЛЛИН Айрат Рафизович - кандидат технических наук, ведущий научный сотрудник

Казань

WoS ResearcherID: ABF-8777-2020, Scopus Author ID: 56500678000, Elibrary AuthorID: 161758



Н. А. Прокопьев
Институт прикладной семиотики Академии наук Республики Татарстан
Россия

ПРОКОПЬЕВ Николай Аркадиевич - кандидат технических наук, научный сотрудник

Казань

WoS ResearcherID: S-3829-2016, Scopus Author ID: 57206891311, Elibrary AuthorID: 999214



Н. З. Абдурахмонова
Национальный университет Узбекистана им. Мирзо Улугбека
Узбекистан

АБДУРАХМОНОВА Нилуфар Зайнобитдиновна - доктор филологических наук, профессор, заведующая кафедрой компьютерной лингвистики и прикладного языкознания, Факультет журналистики и узбекской филологии

Ташкент

WoS ResearcherID: ABC-52752021, Scopus Author ID: 57221106516



А. А. Касиева
Кыргызско-турецкий университет «Манас»
Кыргызстан

КАСИЕВА Аида Аскарбековна - кандидат филологических наук, доцент, профессор, заведующая отделением перевода и переводоведения, Филологический факультет

Бишкек

WoS ResearcherID: HGC-3155-2022, Scopus Author ID: 57189928164



Список литературы

1. Lewis P., Perez E., Piktus A. et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. NIPS’20: Proceedings of the 34th International Conference on Neural Information Processing Systems. 2020:9459–9474. DOI: https://doi.org/10.5555/3495724.3496517 (на англ.).

2. Edge D., Trinh H., Cheng N. et al. From local to global: a graph RAG approach to query-focused summarization. arXiv cs.CL 2404.16130. 2025. DOI: https://doi.org/10.48550/arXiv.2404.16130 (на англ.).

3. Ломов П.А. Использование онтологий для контекстуализации запросов к большим языковым моделям. Онтология проектирования. 2025;15(2):239–248. DOI: https://doi.org/10.18287/2223-9537-2025-15-2-239-248

4. Arnett C., Bergen B. Why do language models perform worse for morphologically complex languages? Proceedings of the 31st International Conference on Computational Linguistics. UAE. 2025:6607–6623 (на англ.).

5. Yu S., Kulkarni N., Lee H., and Kim J. Syllable-level Neural Language Model for agglutinative language. Proceedings of the First Workshop on Subword and Character Level Models in NLP. Copenhagen. 2017:92–96 (на англ.).

6. Гузев В.Г. О некоторых экзотических особенностях тюркских языков («тюркские чудеса»). Актуальные проблемы мировой политики. 2020;(10):231–245.

7. McCrae J., Spohr D., Cimiano P. Linking lexical resources and ontologies on the Semantic Web with Lemon. The Semantic Web: Research and Applications. ESWC 2011. Lecture Notes in Computer Science. Berlin, Heidelberg: Springer. 2011;(6643):245–259. DOI: https://doi.org/10.1007/978-3-642-21034-1_17 (на англ.).

8. Francopoulo G., George M., Calzolari N., Monachini M., Bel N., Pet M., and Soria C. Lexical Markup Framework (LMF). Proceedings of the Fifth International Conference on Language Resources and Evaluation (LREC’06). Italy. 2006 (на англ.).

9. Гатиатуллин А.Р., Прокопьев Н.А., Сулейманов Д.Ш. Модель лингвистических графов знаний тюркских языков. Онтология проектирования. 2024;14(3):366–378.

10. Linden K., Axelson E., Drobac S. et al. HFST – A system for creating NLP tools. Systems and Frameworks for Computational Morphology. SFCM 2013. Communications in Computer and Information Science. 2013;(380):53–71. DOI: https://doi.org/10.1007/978-3-642-40486-3_4 (на англ.).

11. Marneffe M., Manning C., Nivre J. et al. Universal Dependencies. Computational Linguistics. 2021;47(2):255–308. DOI: https://doi.org/10.1162/coli_a_00402 (на англ.).

12. Fellbaum C. WordNet: An electronic lexical database. Cambridge. MA: MIT Press. 1998. DOI: https://doi.org/10.7551/mitpress/7287.001.0001 (на англ.).

13. Baker C.F., Fillmore C.J., Lowe J.B. The Berkeley FrameNet project. 36th Annual Meeting of the Association for Computational Linguistics and 17th International Conference on Computational Linguistics. 1998;(1):86–90. DOI: https://doi.org/10.3115/980845.980860 (на англ.).

14. Van Gysel J.E.L., Vigus M., Chun J. et al. Designing a Uniform Meaning Representation for Natural Language Processing. Künstliche Intelligenz. 2021;(35):343–360. DOI: https://doi.org/10.1007/s13218-021-00722-w (на англ.).

15. Banarescu L., Bonial C., Cai S. et al. Abstract Meaning Representation for Sembanking. Proceedings of the 7th Linguistic Annotation Workshop & Interoperability with Discourse. 2013:178–186 (на англ.).

16. Bunt H., Alexandersson J., Choe J.W. et al. ISO 24617-2: A semantically-based standard for dialogue annotation. Proceedings of the Eighth International Conference on Language Resources and Evaluation (LREC’12). 2012:430–437 (на англ.).

17. Gatiatullin A., Suleymanov D., Prokopyev N., Khakimov B. About “Turkic Morpheme” portal. CEUR Workshop Proceedings. 2020;(2780):226–243 (на англ.).

18. Mukhamedshin D., Gatiatullin A., Gilmullin R. The new version of the corpus data management system “Tugan Tel” using graph knowledge base. IEEE 3rd International Conference on Problems of Informatics, Electronics and Radio Engineering (PIERE). 2024:1800–1804. DOI: https://doi.org/10.1109/PIERE62470.2024.10804932 (на англ.).

19. White A.S., Reisinger D., Sakagucih K. et al. Universal Decompositional Semantics on Universal Dependencies. Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing. 2016:1713–1723. DOI: https://doi.org/10.18653/v1/D16-1177 (на англ.).


Рецензия

Для цитирования:


Гатиатуллин А.Р., Прокопьев Н.А., Абдурахмонова Н.З., Касиева А.А. Модель универсального лингвистического графа знаний тюркских языков. Арктика XXI век. 2026;(3):5-21. https://doi.org/10.25587/3034-7378-2026-14-3-5-21

For citation:


Gatiatullin A.R., Prokopyev N.A., Abdurakhmonova N.Z., Kasieva A.А. A model of a universal linguistic knowledge graph for Turkic languages. Arctic XXI century. 2026;(3):5-21. (In Russ.) https://doi.org/10.25587/3034-7378-2026-14-3-5-21

Просмотров: 15

JATS XML


Creative Commons License
Контент доступен под лицензией Creative Commons Attribution-NonCommercial 4.0 International.


ISSN 3034-7378 (Print)
ISSN 3034-7386 (Online)