Створення NLP-системи для визначення контекстуальних синонімів українською мовою
Loading...
Date
2026
Authors
Швець, Дмитро
Journal Title
Journal ISSN
Volume Title
Publisher
Abstract
У роботі описано розроблення NLP-системи для визначення контекстуальних синонімів у текстах, написаних українською мовою. Сформовано збірку контекстуальних векторних представлень лексем на основі корпусів ГРАК, CNC-UA та UD-treebanks із застосуванням моделі paraphrasemultilingual- mpnet-base-v2. Вектори обчислено методом усередненого пулінгу прихованих станів субтокенів цільової леми в контексті речення. На основі тлумачень СУМ побудовано збірник гіперонімів: для кожного запису засобами синтаксичного аналізу залежностей виявлено гіпероніми та виділено їх у тексті тлумачення. Реалізовано модуль морфологічного узгодження синонімів із граматичним контекстом речення. Розроблено два вдосконалення системи: формування синтаксично орієнтованого контексту для обчислення вектора цільового слова та переранжування кандидатів через порівняння ембедингів речень. Після обох удосконалень точність системи становить 68,28 %, а повнота — 49,18 %, що відповідно у 2,33 і 2,06 раза перевищує початкові значення. Створено вебзастосунок для наочної взаємодії з функціями системи. Отримані результати візуалізовано.
Description
Keywords
обробка природної мови, контекстуальні синоніми, текстовий корпус, векторне представлення слова, ембединг, семантична подібність, морфологічне узгодження, гіпероніми, українська мова, трансформерні моделі, вебзастосунок, бакалаврська робота