
В Евразийском национальном университете имени Л.Н. Гумилева состоится защита диссертации на соискание степени доктора философии (PhD) Абдығалым Баянғали Хайерберліұлы на тему «Разработка тезауруса военной терминологии с использованием NLP для улучшения поиска и анализа военной информации» по образовательной программе «8D06103 – Информационные системы».
Диссертация выполнена на кафедре «Информационных систем» Евразийского национального университета имени Л.Н. Гумилева.
Язык защиты - казахский
Официальные рецензенты:
Кәрібаева Айдана Сейілғазықызы - доктор философии (PhD), и.о. доцента, Казахский национальный университет имени Әл-Фараби (г. Алматы, Республика Казахстан);
Оралбекова Дина Орымбаевна – доктор философии (PhD), ассоциированный профессор, старший научный сотрудник Института информационных и вычислительных технологий (г. Алматы, Республика Казахстан).
Временные члены Диссертационного совета:
Козбакова Айнур Холдасовна – доктор философии (PhD), ассоциированный профессор, ведущий научный сотрудник лаборатории «Искусственного интеллекта и робототехники» РГП «Институт информационных и вычислительных технологий» КН МНВО РК (г. Алматы, Республика Казахстан);
Кайбасова Динара Женисбековна – доктор философии (PhD), ассоциированный профессор департамента «Компьютерная инженерия» Astana IT University (г. Астана, Республика Казахстан).
Хужаяров Илёс Ширалиевич - доктор философии (PhD), доцент кафедры инженерии вычислительных систем Самаркандского государственного университета имени Шарафа Рашидов (г. Самарканд, Узбекистан).
Научные консультанты:
Самбетбаева Мадина Аралбаевна – доктор философии (PhD), ассоциированный профессор кафедры “Информационные системы” Евразийского национального университета имени Л.Н. Гумилева, (г. Астана, Республика Казахстан);
Esref Adali – доктор философии (PhD), профессор Стамбульского технического университета (г. Стамбул, Турция).
Защита состоится: 15 сентября 2026 года 11:00 часов в Диссертационном совете по направлению подготовки кадров «8D061 – Информационно-коммуникационные технологии» по образовательной программе «8D06103 – Информационные системы» Евразийского национального университета имени Л.Н. Гумилева. Проведение заседания диссертационного совета в онлайн формате.
Ссылка: https://teams.microsoft.com/meet/444525122444693?p=vxHHLvN8Ggdh2ivOGG
Адрес: г. Астана, ул. Пушкина, 11, Учебный корпус № 2, аудитория № 222. г.
Аннотация (рус.): АННОТАЦИЯ диссертационной работы Абдығалыма Баянғали Хайерберліұлы на тему «Разработка тезауруса военной терминологии с использованием NLP для улучшения поиска и анализа военной информации», представленной на соискание степени доктора философии (PhD) по образовательной программе «8D06103 - Информационные системы» Актуальность темы. Актуальность темы исследования определяется ростом объёма военной информации, усложнением военной терминологии и возрастающей необходимостью применения технологий обработки естественного языка в военной аналитике. В условиях многоязычной информационной среды Республики Казахстан, в которой одновременно функционируют казахский, русский и английский языки, а также с учётом активной интеграции Вооружённых Сил в международные форматы военно-технического сотрудничества потребность в формализованной, машиночитаемой и внутренне согласованной системе военной терминологии приобретает особую актуальность. В настоящее время система военной терминологии характеризуется фрагментарностью и отсутствием единообразия. В документах различных ведомств и государств одни и те же объекты описываются разными терминами. Одновременно используются официальные формулировки, профессиональный жаргон, аббревиатуры, заимствования и неологизмы, обозначающие появление новых классов вооружения и видов военных действий. Данная проблема особенно остро проявляется в казахско-русско-английской трёхъязычной среде, поскольку межъязыковые соответствия в ней не всегда являются однозначными, а казахская военная терминология представлена в открытых источниках лишь фрагментарно и не существует в полноценной формализованной машиночитаемой форме. Существующие словари и справочники военной лексики, как правило, созданы в рамках традиционной лингвистической парадигмы и не ориентированы на машинную обработку текста. Они не обеспечивают формализованного представления семантических связей между понятиями – родо-видовых, ассоциативных и межъязыковых, - не соответствуют современным международным стандартам, таким как ISO 25964, и не предназначены для интеграции с военно-информационными поисковыми и аналитическими системами. Отсутствие согласованной трёхъязычной терминологической базы приводит к существенному снижению полноты и точности автоматического поиска, индексирования и тематического профилирования военных документов. Одновременно в области обработки естественного языка широкое распространение получили трансформерные модели, многоязычные эмбеддинги, графовые нейронные сети и методы автоматического извлечения терминов. Эти методы расширяют возможности автоматического построения и пополнения тезаурусов. Появление моделей для казахского языка, таких как KazBERT и Kaz-RoBERTa, а также многоязычных эмбеддингов BGE-M3, LaBSE и multilingual E5 формирует техническую основу для разработки трёхъязычного военно-терминологического ресурса. Однако их непосредственное применение в военной предметной области ограничивается низкоресурсностью казахского языка, его агглютинативной морфологией, несбалансированностью обучающих корпусов и предметной спецификой военной лексики. Таким образом, сформировалось противоречие между необходимостью представления военной терминологии в казахско-русско-английской трёхъязычной среде в формализованном и машиночитаемом виде и недостаточностью методических и программных средств, объединяющих в единой системе требования ISO 25964, принципы военной терминографии и методы NLP. С учётом того, что современные методологические подходы к диссертационным исследованиям непосредственно требуют опоры на системное описание предметной области и её понятийного аппарата, создание научно обоснованного многоязычного военного тезауруса и технологии его автоматизированного пополнения представляет собой научно и практически значимую задачу для развития военной информатики, прикладной и компьютерной лингвистики в Республике Казахстан. Степень разработанности темы. Теоретические основы построения тезаурусов и онтологий специализированных предметных областей разработаны в трудах G. Miller (WordNet), C. Fellbaum, Н. В. Лукашевич и Б. В. Доброва (RuThes / RuWordNet), R. Navigli и S. P. Ponzetto (BabelNet), R. Speer (ConceptNet), а также в стандартах международных организаций по стандартизации — ISO 25964-1:2011, ISO 25964-2:2013, ISO 704:2022 и ISO 1087:2019 технического комитета ISO/TC 37 — и в рекомендациях консорциума W3C по SKOS, RDF и OWL. Принципы построения военных глоссариев формализованы в международных и национальных нормативных документах, прежде всего в NATO Glossary AAP-06 и DoD Dictionary of Military and Associated Terms. Методы автоматического построения тезаурусов прошли значительную эволюцию: от шаблонных подходов M. Hearst (1992) и R. Snow с соавторами (2005), через дистрибутивные модели T. Mikolov (Word2Vec), J. Pennington (GloVe) и P. Bojanowski (FastText), к трансформерным архитектурам J. Devlin (BERT), A. Conneau (XLM-RoBERTa), N. Reimers (Sentence-BERT) и графовым нейросетевым моделям J. Shen (TaxoExpan) и последующих исследователей. Методы информационного поиска получили развитие в работах G. Salton (TF-IDF), S. Robertson и H. Zaragoza (BM25), V. Karpukhin (DPR), J. Chen (BGE-M3), G. Cormack (RRF). Значимые результаты для казахского языка представлены в трудах J. Washington (FST для кипчакских языков), Z. Yessenbayev и A. Makazhanov (KazNLP), A. Toleu (character-aware morphological disambiguation), G. Tolegen (voted-perceptron approach), O. Makhambetov (Kazakh Language Corpus). Существенный вклад в изучение специализированной военной терминологии и многоязычных задач в казахско-русско-английской среде внесли исследования по созданию двуязычных терминологических ресурсов, включая русско-татарский тезаурус А. Галиевой и А. Кирилловича и Tatar WordNet. Однако казахский военно-терминологический ресурс сопоставимого масштаба до настоящего времени не создан. Исследования применения BM25 и плотных нейросетевых ретриверов в специализированных предметных областях, включая BEIR и работы N. Thakur с соавторами, показывают отсутствие безусловного превосходства одной парадигмы над другой и обосновывают необходимость гибридных архитектур. Несмотря на значительный научный интерес к созданию многоязычных терминологических ресурсов с применением технологий обработки естественного языка, сохраняются аспекты, требующие дальнейшей разработки. Большинство работ ориентировано на общеязыковые корпуса либо отдельные предметные области – агрокультуру, медицину и экологию – и не учитывает специфику военной терминологии и казахстанской трёхъязычной среды. Не разработаны комплексные методики, объединяющие требования ISO 25964 с современными NLP-технологиями применительно к низкоресурсным агглютинативным языкам. Не сформированы специализированные подходы к индексированию военной терминологии, учитывающие морфологическую вариативность казахского и русского языков. Указанные пробелы обусловили выбор темы и направленности настоящего исследования. Объект исследования. Процесс семантического представления и использования военной терминологии в текстовых ресурсах военной тематики и информационных системах поиска и анализа военной информации в казахско-русско-английской трёхъязычной среде. Предмет исследования. Методы, модели и алгоритмы построения и автоматизированного пополнения казахско-русско-английского тезауруса военной терминологии, а также формализованного моделирования семантических связей между военными терминами на основе технологий обработки естественного языка. Цель исследования. Разработка научно обоснованных методов, моделей, алгоритмов и программного прототипа построения и автоматизированного пополнения казахско-русско-английского тезауруса военной терминологии на основе технологий обработки естественного языка и международного стандарта ISO 25964. Предлагаемое решение направлено на повышение полноты и точности поиска военной информации и улучшение качества тематико-ситуационного анализа военных текстов. Задачи исследования. 1. Провести анализ специализированных тезаурусов, онтологий и методов автоматической обработки военной терминологии. 2. Выявить структурные, семантические и морфологические особенности военных терминов на казахском, русском и английском языках. 3. Сформировать корпус трёхъязычных текстов военной тематики и разработать методику автоматического извлечения терминов-кандидатов. 4. Разработать концептуальную и формализованную модель трёхъязычного военного тезауруса, включающего отношения BT, NT, RT, SYN, LE и UF в соответствии со стандартом ISO 25964. 5. Разработать гибридный NLP-конвейер, объединяющий BM25, морфологическую префиксную токенизацию, графовое расширение и классификатор отношений на основе KazBERT. 6. Разработать механизм на основе LE-замыкания и алгоритма union–find для согласования межъязыковых эквивалентов и дополнения синонимических связей. 7. Реализовать программный прототип и интерактивный лексикографический интерфейс с поддержкой Neo4j и экспорта в форматах SKOS/RDF/OWL и XML. 8. Экспериментально оценить влияние предложенного тезауруса и гибридного конвейера на качество поиска военной информации по метрикам Hit@k, MRR и Recall@K, а также на качество семантической навигации и тематического профилирования на основе графа тезауруса. Методология исследования. Методологическую основу исследования составляют системный и комплексный подходы к анализу информационных процессов в военной сфере, положения теории терминологии и тезаурусного моделирования, концептуальные основы корпусной и компьютерной лингвистики, методы информационного поиска и интеллектуального анализа текстов. Исследование опирается на международные стандарты ISO 25964-1:2011 и ISO 25964-2:2013, рекомендации W3C по SKOS, RDF и OWL, а также на нормативные источники Министерства обороны Республики Казахстан и международные глоссарии военной терминологии, включая NATO AAP-06 и DoD Dictionary. Методы исследования. В работе применялись следующие методы: теоретический анализ и критический обзор научной литературы по военной терминологии, тезаурусам, онтологиям и обработке естественного языка; методы корпусной лингвистики и контент-анализа текстов военной тематики; лингвистические методы, включая семантико-лексический и терминологический анализ, классификацию и систематизацию терминов; методы обработки естественного языка, включая токенизацию, лемматизацию, морфологический анализ, извлечение терминологических единиц, построение распределённых представлений, кластеризацию и классификацию семантических отношений с использованием трансформерных языковых моделей; методы информационного поиска, включая BM25, плотный нейронный поиск и гибридные архитектуры с объединением RRF; графовые методы хранения и обхода знаний; методы моделирования и проектирования структуры тезауруса; методы экспериментальной оценки качества информационного поиска и анализа, включая Hit@k, MRR, Recall@K, Precision, Recall, F1, macro-F1 и матрицу ошибок. Научная новизна: Впервые разработан казахско-русско-английский тезаурус военной терминологии, адаптированный к трёхъязычной военно-информационной среде Казахстана и структурированный в соответствии со стандартом ISO 25964. Тезаурус включает 5 262 канонических термина, 64 374 типизированных семантических отношения шести типов — BT, NT, RT, SYN, LE и UF – и\ терминологические записи на трёх языках. Подмножество из 1 719 казахоязычных записей представляет собой одно из крупнейших специализированных собраний, предназначенных для машинной обработки казахской военной терминологии. Предложена и экспериментально апробирована гибридная NLP-архитектура для автоматизированного извлечения семантических отношений между терминами в трёхъязычной военной предметной области. Она объединяет лексический поиск BM25, графовое расширение, кросс-энкодер на основе KazBERT и механизм LE-замыкания, а также эмпирически подтверждает гипотезу морфологической различимости, основанную на использовании морфологических префиксов длиной 4 и 6 символов. По сравнению с базовой моделью BGE-M3 предложенный подход обеспечил прирост BT Hit@5 на +224 %, достиг Hit@5 = 1,000 для отношений SYN и macro-F1 = 0,713 для классификатора отношений. Обоснованность и достоверность научных результатов. Обоснованность результатов обеспечивается всесторонним анализом широкого круга источников по теории тезаурусов, информационному поиску и обработке естественного языка, применением методов терминологического анализа, корпусной лингвистики, машинного обучения и графовых баз данных, а также строгим соблюдением требований международных стандартов ISO 25964-1:2011 и ISO 25964-2:2013. Достоверность результатов подтверждается воспроизводимостью экспериментального протокола – разделением данных на уровне концептов с 15-процентной отложенной выборкой, фиксированным random seed и опубликованными параметрами обучения, — сопоставлением полученных значений показателей с известными результатами в литературе, а также апробацией основных научных положений в публикациях, индексируемых международными научными базами данных, и в докладах на международных научных конференциях. Теоретическая значимость. Теоретическая значимость работы определяется развитием положений теории терминологии и компьютерной лексикографии применительно к казахоязычному военному дискурсу, подходов к тезаурусному и онтологическому представлению специализированных предметных областей в условиях трёхъязычной низкоресурсной среды, а также методов интеграции NLP-технологий в процессы построения и актуализации тезаурусов. Кроме того, в работе сформулирована гипотеза морфологической различимости для агглютинативных языков. Данная гипотеза объясняет причины, по которым при корректной нормализации и префиксной токенизации методы лексического поиска в отдельных задачах могут превосходить плотные нейросетевые ретриверы. Полученные результаты уточняют и дополняют теоретические представления о моделировании военной терминологии в задачах информационного поиска и интеллектуального анализа текстов. Практическая значимость. Практическая значимость исследования заключается в возможности использования разработанного трёхъязычного казахско-русско-английского тезауруса военной терминологии и методики его автоматизированного пополнения при создании и модернизации информационно-поисковых и аналитических систем военного назначения. Предлагаемые решения могут быть интегрированы в системы документооборота Министерства обороны Республики Казахстан, системы поддержки принятия решений, системы анализа открытых источников военного назначения (OSINT), системы мониторинга и ситуационного анализа, а также учебные и тренажёрные комплексы военной тематики. Результаты экспериментальной оценки показали, что применение модуля автоматизированного пополнения позволяет существенно ускорить процесс отбора терминологических единиц и проверки семантических связей по сравнению с ручным режимом. Время инференса системы составляло 120–280 мс в зависимости от используемой вычислительной среды, что позволяет применять прототип на вычислительной инфраструктуре среднего класса. Построенная структура тезауруса на основе Neo4j с экспортом в форматы SKOS/RDF/OWL и XML может служить основой для создания высокоэкспрессивных военных онтологий и дальнейшей разработки экспертных систем и интеллектуальных помощников. Личный вклад автора. Личный вклад автора заключается в постановке научной проблемы, выборе и обосновании методов исследования, разработке концептуальной и формализованной модели трёхъязычного тезауруса военной терминологии в соответствии с международным стандартом ISO 25964, формировании корпуса текстов военной тематики, разработке методики автоматического извлечения терминов с морфологической префиксной токенизацией, проектировании гибридного конвейера извлечения семантических отношений на основе BM25, графового расширения и классификатора KazBERT, формулировании гипотезы морфологической различимости, разработке механизма согласования межъязыковых эквивалентов посредством концептуальных групп, реализации программного прототипа системы и интерактивного лексикографического интерфейса, проведении экспериментальных исследований и анализе полученных результатов, а также формулировании выводов и практических рекомендаций. Все основные научные результаты, выносимые на защиту, получены автором лично. Основные научные положения, выносимые на защиту: 1. Концепция и формальная модель трёхъязычного казахско-русско-английского тезауруса военной терминологии, соответствующего международному стандарту ISO 25964, ориентированного на машинную обработку и интеграцию с системами поиска и анализа военной информации. 2. Модель системы семантических отношений, включающая шесть типов отношений военной терминологии – BT, NT, RT, SYN, LE и UF – с инверсными парами и фиксированной семантикой каждого типа. 3. Методика автоматизированного пополнения тезауруса военной терминологии посредством гибридной NLP-технологии, объединяющей лексический поиск BM25 с морфологической префиксной токенизацией, одношаговое графовое расширение и обогащённый описаниями классификатор отношений с асимметричным порогом уверенности на основе языковой модели KazBERT. 4. Механизм согласования межъязыковых эквивалентов на основе формирования концептуальных групп методом union–find по взаимным LE-связям и транзитивного замыкания синонимов. 5. Гипотеза морфологической различимости иерархических отношений в казахско-русской языковой паре и её эмпирическое подтверждение в виде увеличения показателя BT Hit@5 на 12 процентных пунктов при переходе от цельнословной токенизации к префиксной токенизации с параметрами p = 4 и p = 6. 6. Архитектура программного прототипа автоматизированного пополнения тезауруса военной терминологии, включающая модули поиска терминов-кандидатов, графового расширения, классификации отношений и экспертной валидации. 7. Результаты экспериментальных исследований, подтверждающие, что использование разработанного тезауруса в составе гибридной архитектуры обеспечивает существенное повышение полноты и точности поиска военной информации по сравнению с существующими решениями: BT Hit@5 = 0,796 против базового значения 0,246, что соответствует приросту +224 % относительно многоязычной модели BGE-M3. Апробация результатов диссертации. Результаты работы прошли апробацию на международных научных конференциях. В частности, в материалах конференции, индексируемых в базе данных Scopus, опубликован следующий доклад: An Ontological Model for Classification and Detection of Information Attacks in Social Media // In 2025 10th International Conference on Computer Science and Engineering (UBMK). – P. 1554–1557. Внедрение результатов. Результаты исследования получены в рамках научного проекта AP26195165 для молодых учёных на 2024–2026 годы «Разработка трёхэтапного фреймворка на основе языковых моделей для интеграции новых концептов в онтологии». Публикации. В международных рецензируемых научных журналах с квартильными показателями Q1–Q2, индексируемых в базах данных Web of Science Core Collection и Scopus, опубликованы три статьи: 1. A Comprehensive Review of NLP Techniques for Military Terminologies and Information Operations on Social Media // IEEE Access. – 2025. 2. NLP Models for Military Terminology Analysis and Detection of Information Operations on Social Media // Computers. – 2025. – Vol. 14, No. 11. – P. 485. 3. Integrating Thesaurus-Based Knowledge into Transformer Models for Semantic Understanding of Domain-Specific Texts // Computers. – 2026. – Vol. 15, No. 5. – P. 297. В изданиях, включённых в перечень публикаций, рекомендованных Комитетом по обеспечению качества в сфере науки и высшего образования Министерства науки и высшего образования Республики Казахстан, опубликованы две статьи: 1. Концептуальная модель для онтологий выявления информационных операций в цифровых медиа // Вестник Университета Шакарима. Серия технические науки. – 2026. – Т. 1, № 4(20). – С. 36–44. 2. An AI-Driven Three-Stage Framework for Dynamic Integration of Emerging Concepts into Ontologies // Вестник Университета Шакарима. Серия технические науки. – 2025. – № 4. – С. 101–110. Структура и объём работы. Диссертационная работа состоит из введения, трёх основных разделов, заключения, списка использованных источников и приложений. Во введении представлены обоснование актуальности темы, формулировка цели и задач исследования, изложение научной новизны, теоретической и практической значимости, а также положения, выносимые на защиту. Первый раздел «Теоретические основы построения многоязычных тезаурусов и извлечения семантических отношений» посвящён системному анализу международного стандарта ISO 25964 и типологии семантических отношений тезауруса, обзору эволюции методов автоматического построения тезаурусов от шаблонных и дистрибутивных подходов до современных трансформерных архитектур, сравнительному анализу лексического и плотного нейросетевого поиска, исследованию особенностей обработки агглютинативных и флективных языков в условиях ограниченных лингвистических ресурсов, а также сравнительному анализу существующих лексикографических ресурсов и обоснованию необходимости разработки нового трёхъязычного казахско-русско-английского военного тезауруса. Второй раздел «Разработка казахско-русско-английского тезауруса военной терминологии и гибридного конвейера извлечения отношений» включает концептуальную декомпозицию и формальную постановку задачи, разработку модели тезауруса в соответствии со стандартом ISO 25964, описание лексического индекса с морфологической префиксной токенизацией как реализации гипотезы морфологической различимости, а также описание графового расширения кандидатов и обогащённого описаниями классификатора отношений на основе языковой модели KazBERT. Третий раздел «Экспериментальное исследование и анализ результатов» посвящён описанию протокола оценки и системы метрик, представлению результатов ранжирования и классификации по каждому типу семантических отношений, оценке качества поиска военной информации на основе разработанного тезауруса с сопоставлением лексического и плотного нейросетевого подходов, абляционному исследованию вклада отдельных компонентов гибридного конвейера, обсуждению результатов, формулированию ограничений исследования и разработке практических рекомендаций. В заключении представлены основные результаты диссертационного исследования, оценка полноты решения поставленных задач, подтверждение положений, выносимых на защиту, обоснование научной новизны и теоретической значимости, практические рекомендации по использованию результатов и перспективы дальнейшего развития темы. Благодарности. Автор выражает искреннюю благодарность научному консультанту, ассоциированному профессору, PhD М. А. Самбетбаевой за ценные научные рекомендации и постоянную поддержку на всех этапах исследования; зарубежному научному консультанту, профессору E. Adalı, за методическую помощь и обмен опытом в области обработки естественного языка для тюркских языков; участникам проекта № AP26195165; а также участникам научных семинаров, на которых обсуждалась настоящая работа.
Отзыв зарубежного консультанта
