Методи перевірки та безпечної актуалізації зовнішньої пам'яті RAG за умов модифікації знань та спотворення зворотного зв'язку : дисертація на здобуття наукового ступеня доктора філософії
Loading...
Date
2026
Authors
Андрощук, Максим
Journal Title
Journal ISSN
Volume Title
Publisher
Abstract
Дисертація на здобуття наукового ступеня доктора філософії за
спеціальністю 122 "Комп’ютерні науки" (12 — Інформаційні технології). — Національний університет "Києво-Могилянська академія", Київ, 2026. Системи RAG дають змогу великим мовним моделям використовувати зовнішні джерела знань без перенавчання їхніх параметрів. У динамічних середовищах — корпоративних, медичних і юридичних — зовнішні джерела знань постійно змінюються, що породжує проблему безпечного оновлення: як приймати легітимні зміни й водночас відхиляти спотворені або помилкові дані. Більшість наявних RAG-систем не забезпечує формально обґрунтованих меж ризику проникнення отруєних даних, не має механізмів розрізнення природного дрейфу знань і координованого спотворення, а також потребує значних
обчислювальних витрат для верифікації суперечностей, які за повного попарного порівняння зростають квадратично. Наявні підходи до захисту RAG-систем, зокрема PoisonedRAG, RobustRAG і TrustRAG, розглядають окремі аспекти захисту — фільтрацію отриманих документів, агрегування відповідей із кількох підмножин та оцінювання довіри до джерел, однак не формують єдиної архітектури, яка поєднує верифікацію суперечностей, безпечне переведення нових знань із карантинного стану до основної пам’яті та розрізнення легітимного дрейфу знань і координованого отруєння. Окремою проблемою є обчислювальна вартість верифікації: повне попарне порівняння отриманих документів засобами NLI має квадратичну складність відносно кількості документів у контексті, що обмежує застосування такої верифікації в онлайн-сценаріях. Водночас параметричні підходи до редагування знань моделей, зокрема ROME і MEMIT, передбачають доступ до ваг або внутрішніх представлень базової моделі — це ускладнює їх застосування для закритих моделей, доступних лише через API і поширених у промислових RAG-розгортаннях. Об’єктом дослідження є процеси оброблення, верифікації та оновлення даних у зовнішній пам’яті RAG-систем за умов динамічної зміни знань і спотворення джерел інформації. Предметом дослідження є методи й алгоритми верифікації узгодженості, виявлення суперечностей та безпечної актуалізації зовнішньої пам’яті RAG-систем без модифікації параметрів генеративної моделі. Метою дослідження є розроблення методів верифікованої та захищеної від
отруєння актуалізації зовнішньої пам’яті RAG-систем за умов обмеженої
обчислювальної вартості верифікації. Для досягнення мети вирішено такі завдання: розроблено якірну схему виявлення суперечностей зі зниженою вартістю NLI-верифікації; запропоновано двофазну схему карантину та затвердження нових знань із модельною верхньою межею ризику проникнення отруєних даних; побудовано шар прийняття рішень для розрізнення легітимного дрейфу знань і координованого отруєння; удосконалено механізми запитно-орієнтованого відбору підграфа, злиття ранжувань і керування повторною генерацією. Методологічну основу дослідження становлять методи математичного моделювання, теорії ймовірностей, статистичного аналізу, оброблення природної мови, зокрема NLI-верифікації, байєсівські методи виявлення зміни режиму, а також порівняльна експериментальна перевірка на контрольованих стендах і зовнішніх еталонних наборах даних. Наукова новизна одержаних результатів полягає у розробленні архітектури непараметричної адаптації зовнішньої пам’яті RAG-систем, яка поєднує
верифікацію суперечностей, карантинне оновлення знань і виявлення режиму змін у єдиному замкненому циклі без модифікації параметрів генеративної моделі. Взаємодія функціональних контурів організована таким чином: результати NLI-верифікації суперечностей (A3) одночасно використовуються як вхідні сигнали для байєсівського карантину (A5) і детектора зміни режиму (A6); детектор A6, у свою чергу, змінює пороги прийняття рішень в A5 у разі виявлення координованої схеми змін, а оновлений стан довіри до джерел повертається на етап пошуку через зважування каналів злиття ранжувань. Така замкнена архітектура дає змогу системі поступово накопичувати інформацію про достовірність джерел під час тривалої експлуатації та зменшує потребу в ручному переналаштуванні параметрів у межах досліджених сценаріїв. Запропоновано інтегровану схему безпечної актуалізації зовнішньої пам’яті RAG, у якій контур верифікації суперечностей (A3), контур карантину та затвердження нових знань (A5), а також контур розрізнення легітимного дрейфу знань і координованого отруєння (A6) функціонують як взаємопов’язані підсистеми зі спільним інформаційним обміном через стан довіри до джерел. Інтеграція забезпечує системний ефект, недосяжний для окремих компонентів: рішення про карантин враховують сигнали детектора режиму, а оновлення довіри до джерел синхронізується з результатами верифікації. У контрольованих експериментальних сценаріях це дало змогу скоротити обчислювальні витрати NLI-верифікації на 57 %, заблокувати всі отруєні документи з тестового набору, зберегти 93 % легітимних оновлень і досягти повної класифікації режимів "дрейф знань / координоване отруєння" для досліджених конфігурацій. Удосконалено окремі механізми запропонованої архітектури: якірну схему виявлення суперечностей, яка знижує вартість NLI-верифікації з O(K²) до O(K·a); двофазну схему карантину та затвердження нових знань з аналітичною верхньою межею ризику проникнення отруєних даних; шар прийняття рішень на основі байєсівського детектора зміни режиму з виявленням коаліцій джерел; методи запитно-орієнтованого відбору підграфа, злиття ранжувань із урахуванням довіри й часу та керування повторною генерацією. Дістав подальшого розвитку підхід до непараметричної адаптації RAG-систем за участю людини у контурі керування завдяки введенню механізму довірчого оновлення за вимірами "джерело — тема — користувач — час". Запропоновані алгоритми перевірено на десяти зовнішніх еталонних наборах даних (N = 1250 запитів), а також у змагальних сценаріях із цільовою ін’єкцією отруєних документів. У базовому одномодельному налаштуванні повний конвеєр зберігає статистичний паритет із RAG-конвеєром на основі BM25-ретривера на 9 із 10 еталонних наборів даних; зафіксовано один статистично значущий негативний результат, який інтерпретується як очікувана плата за підвищення безпеки. У контрольованому наборі адверсаріальних експериментів механізм карантину заблокував усі отруєні документи з тестового набору; за цільової атаки з підміною відповідей відновлення якості відповідей становило 99,4 % відносно неатакованого сценарію. Експериментальну перевірку побудовано за принципом множинного підтвердження: контрольовані абляційні експерименти оцінюють внесок кожного компонента архітектури окремо; інтеграційні тести перевіряють властивості системи загалом; змагальні експерименти з цільовою ін’єкцією отруєних документів і симуляцією координованих атак оцінюють стійкість захисних механізмів; зовнішні еталонні набори даних використовуються для перевірки відсутності деградації якості на стандартних задачах. Статистичну значущість ключових результатів перевірено з поправкою на множинні порівняння за методом Беньяміні — Хохберга; для відповідних експериментальних тверджень наведено розміри ефектів і довірчі інтервали. Окремим компонентом експериментальної перевірки є дослідження стійкості: BOCPD-детектор зберіг якість класифікації в усіх 60 досліджених конфігураціях гіперпараметрів, що свідчить про придатність підходу до розгортання без додаткового ручного налаштування у межах перевірених промислово орієнтованих сценаріїв. Обмеження дослідження полягають у наступному. Ефективність запропонованих алгоритмів верифікації залежить від точності зовнішнього NLI-верифікатора, тому помилки такого верифікатора можуть впливати на якість виявлення суперечностей і подальші рішення щодо карантину. Контур перевірки зворотного зв’язку досліджено у межах контрольованого симуляційного сценарію; його перенесення на реальний користувацький зворотний зв’язок потребує окремої експериментальної перевірки. Захист від координованого отруєння обґрунтовано для випадку, коли атакувальна коаліція становить меншість активних джерел; стійкість до масових атак типу Сивілли потребує додаткових механізмів, зокрема доказу виконаної роботи або довірчого шлюзування джерел. Практичне значення одержаних результатів полягає у можливості застосування запропонованих алгоритмів для побудови корпоративних довідкових сервісів, систем підтримки клієнтів, а також медичних і юридичних інформаційних систем, у яких критичними є швидкість оновлення знань і фактологічна достовірність відповідей. Запропонована архітектура не потребує модифікації параметрів базової мовної моделі та є сумісною із закритими моделями, доступними лише через API; це розширює сферу її промислового застосування порівняно з параметричними підходами до редагування знань моделі. Зниження обчислювальної вартості NLI-верифікації на 57 % у досліджених сценаріях підвищує економічну доцільність онлайн-розгортання верифікованих RAG-систем за високого потоку запитів. В умовах широкого промислового розгортання RAG-систем і зростання кількості змагальних атак на пошукові індекси запропоновані методи дають змогу знизити ризик поширення недостовірної інформації без перенавчання великих мовних моделей. Результати дослідження можуть бути використані у навчальних курсах із інформаційного пошуку, оброблення природної мови та безпеки систем штучного інтелекту.
Description
PhD thesis to obtain the degree of Doctor of Philosophy in the Programme
Subject Area 122 "Computer Science" (12 — Information technology). —
National University of Kyiv-Mohyla Academy, Kyiv, 2026. Retrieval-Augmented Generation (RAG) systems in question-answering tasks allow large language models to use external knowledge sources without retraining their parameters. In dynamic environments—corporate, medical, and legal—external knowledge sources are constantly changing, which raises the problem of safe updating: how to accept legitimate changes while rejecting distorted or erroneous data. Most existing RAG systems do not provide formally justified bounds on the risk of poisoned data infiltration, lack mechanisms for distinguishing between natural knowledge drift and coordinated distortion, and require significant computational costs fo
contradiction verification, which grow quadratically under full pairwise comparison. Existing approaches to defending RAG systems, in particular PoisonedRAG, RobustRAG, and TrustRAG, address individual aspects of defense—filtering retrieved documents, aggregating answers from multiple subsets, and evaluating source trust— but do not form a unified architecture that combines contradiction verification, the safe transfer of new knowledge from a quarantine state to main memory, and the distinction between legitimate knowledge drift and coordinated poisoning. A separate problem is the computational cost of verification: full pairwise comparison of retrieved documents using NLI (Natural Language Inference) has quadratic complexity relative to the number of documents in the context, which limits the application of such verification in online scenarios. At the same time, parametric approaches to model knowledge editing, such as ROME and MEMIT, require access to the weights or internal representations of the base model; this complicates their application to closed models accessible only via API, which are common in industrial RAG deployments. The object of the research is the processes of processing, verifying, and updating data in the external memory of RAG systems under conditions of dynamic knowledge changes and information source distortion. The subject of the research is the methods and algorithms for consistency verification, contradiction detection, and safe updating of the external memory of RAG systems without modifying the parameters of the generative model. The purpose of the research is to develop methods for the verified and poisonprotected updating of the external memory of RAG systems under conditions of limited computational verification costs. To achieve this purpose, the following tasks were accomplished: an anchor scheme for contradiction detection with reduced NLI verification costs was developed; a two-phase scheme for quarantining and approving new knowledge with a modeled upper bound for the risk of poisoned data infiltration was proposed; a decision-making layer for distinguishing between legitimate knowledge drift and coordinated poisoning was built; and mechanisms for query-oriented subgraph selection, rank fusion, and regeneration control were improved. The methodological basis of the research comprises methods of mathematical modeling, probability theory, statistical analysis, natural language processing (specifically NLI verification), Bayesian methods for regime change detection, as well as comparative experimental validation on controlled testbeds and external benchmark
datasets. The scientific novelty of the obtained results lies in the development of an architecture for the non-parametric adaptation of RAG system external memory, which combines contradiction verification, quarantined knowledge updating, and change regime detection in a single closed loop without modifying the generative model's parameters. The interaction of functional loops is organized as follows: the results of NLI contradiction verification (A3) are simultaneously used as input signals for the Bayesian quarantine (A5) and the regime change detector (A6); the A6 detector, in turn, alters the decision thresholds in A5 if a coordinated pattern of changes is detected, and the updated state of source trust is returned to the retrieval stage through the
weighting of rank fusion channels. Such a closed-loop architecture allows the system to gradually accumulate information about source reliability during long-term operation and reduces the need for manual parameter tuning within the investigated scenarios. An integrated scheme for the safe updating of RAG external memory is proposed, in which the contradiction verification loop (A3), the quarantine and new knowledge approval loop (A5), and the loop for distinguishing between legitimate knowledge drift and coordinated poisoning (A6) function as interconnected subsystems with shared information exchange via the state of source trust. This integration provides a systemic effect unattainable by individual components: quarantine decisions take into account
signals from the regime detector, and source trust updates are synchronized with the verification results. In controlled experimental scenarios, this made it possible to reduce the computational costs of NLI verification by 57%, block all poisoned documents from the test set, preserve 93% of legitimate updates, and achieve complete classification of the "knowledge drift / coordinated poisoning" regimes for the investigated configurations. Specific mechanisms of the proposed architecture were improved: the anchor scheme for contradiction detection, which reduces the cost of NLI verification from O(K²) to O(K·a); the two-phase quarantine and new knowledge approval scheme with an analytical upper bound for poisoned data infiltration risk; the decision-making layer based on a Bayesian regime change detector with source coalition detection; and methods for query-oriented subgraph selection, rank fusion incorporating trust and time, and regeneration control. The approach to the non-parametric adaptation of human-in-the-loop RAG systems received further development through the introduction of a trust-based update mechanism across the dimensions of "source —topic — user — time". The proposed algorithms were tested on ten external benchmark datasets (N =1250 queries), as well as in adversarial scenarios with the targeted injection of poisoned documents. In a baseline single-model setup, the full pipeline maintains statistical parity with a BM25-retriever-based RAG pipeline on 9 out of 10 benchmark datasets; one statistically significant negative result was recorded, which is interpreted as the expected trade-off for increased security.
In a controlled set of adversarial experiments, the quarantine mechanism blocked all poisoned documents from the test set; during a targeted attack with answer substitution, the restoration of answer quality was 99.4% relative to the unattacked scenario. The experimental validation was designed according to the principle of multiple confirmation: controlled ablation experiments evaluate the contribution of each architectural component separately; integration tests verify the properties of the system as a whole; adversarial experiments with the targeted injection of poisoned documents
and simulation of coordinated attacks assess the robustness of the defense mechanisms; external benchmark datasets are used to verify the absence of quality degradation on standard tasks. The statistical significance of the key results was verified with a correction for multiple comparisons using the Benjamini-Hochberg method; effect sizes and confidence intervals are provided for the respective experimental claims. A separate component of the experimental validation is the robustness study: the BOCPD detector
maintained classification quality in all 60 investigated hyperparameter configurations, demonstrating the approach's suitability for deployment without additional manual tuning within the tested industry-oriented scenarios. The limitations of the study are as follows. The effectiveness of the proposed verification algorithms depends on the accuracy of the external NLI verifier; therefore, errors by such a verifier can affect the quality of contradiction detection and subsequent quarantine decisions. The feedback verification loop was investigated within a controlled simulation scenario; its transfer to real user feedback requires separate experimental validation. Protection against coordinated poisoning is justified for the case where the attacking coalition constitutes a minority of active sources; resistance to massive Sybil-type attacks requires additional mechanisms, such as proof-of-work or trust-based source gating. The practical significance of the obtained results lies in the possibility of applying the proposed algorithms to build corporate reference services, customer support systems, as well as medical and legal information systems, where the speed of knowledge updating and the factual reliability of answers are critical. The proposed architecture does not require modification of the base language model's parameters and is compatible with closed models accessible only via API; this expands its scope of industrial application compared to parametric approaches to model knowledge editing. The 57% reduction in the computational cost of NLI verification in the investigated scenarios increases the economic feasibility of the online deployment of verified RAG systems under high query traffic. Given the widespread industrial deployment of RAG systems and the growing number of adversarial attacks on search indices, the proposed methods make it possible to reduce the risk of spreading unreliable information without
retraining large language models. The research results can be used in educational courses on information retrieval, natural language processing, and the security of artificial intelligence systems.
Keywords
питально-відповідальні системи, RAG, графи знань, база знань, мультимодальність, комп'ютерна математика, комп'ютерна алгебра, ранжування альтернатив, прийняття рішень, LLM, обробка природних мов, велика мовна модель, машинне навчання, розподілені обчислення, машини станів, дисертація, question answering systems, RAG, knowledge graphs, knowledge base, multimodality, computer mathematics, computer algebra, ranking of alternatives, decision making, LLM, natural language processing, large language model, machine learning, distributed computing, state machines
Citation
Андрощук М. В. Методи перевірки та безпечної актуалізації зовнішньої пам'яті RAG за умов модифікації знань та спотворення зворотного зв'язку : дисертація на здобуття наукового ступеня доктора філософії / Андрощук Максим Віталійович ; наук. кер. Глибовець Андрій Миколайович ; Національний університет "Києво-Могилянська академія", Міністерство освіти і науки України. - Київ : [б. в.], 2026. - 217 с. : схеми, табл. - Містить додатки.