Створення NLP-системи для визначення контекстуальних синонімів українською мовою

Loading...
Thumbnail Image
Date
2026
Authors
Швець, Дмитро
Journal Title
Journal ISSN
Volume Title
Publisher
Abstract
У роботі описано розроблення NLP-системи для визначення контекстуальних синонімів у текстах, написаних українською мовою. Сформовано збірку контекстуальних векторних представлень лексем на основі корпусів ГРАК, CNC-UA та UD-treebanks із застосуванням моделі paraphrasemultilingual- mpnet-base-v2. Вектори обчислено методом усередненого пулінгу прихованих станів субтокенів цільової леми в контексті речення. На основі тлумачень СУМ побудовано збірник гіперонімів: для кожного запису засобами синтаксичного аналізу залежностей виявлено гіпероніми та виділено їх у тексті тлумачення. Реалізовано модуль морфологічного узгодження синонімів із граматичним контекстом речення. Розроблено два вдосконалення системи: формування синтаксично орієнтованого контексту для обчислення вектора цільового слова та переранжування кандидатів через порівняння ембедингів речень. Після обох удосконалень точність системи становить 68,28 %, а повнота — 49,18 %, що відповідно у 2,33 і 2,06 раза перевищує початкові значення. Створено вебзастосунок для наочної взаємодії з функціями системи. Отримані результати візуалізовано.
Description
Keywords
обробка природної мови, контекстуальні синоніми, текстовий корпус, векторне представлення слова, ембединг, семантична подібність, морфологічне узгодження, гіпероніми, українська мова, трансформерні моделі, вебзастосунок, бакалаврська робота
Citation