Ігнатенко, ОлексійНікітін, Руслан2026-08-272026-08-272026https://ekmair.ukma.edu.ua/handle/123456789/40997Магістерська робота присвячена оцінюванню та порівнянню сучасних архітектур автоматичного розпізнавання мовлення на задачі транскрибування змішаного українсько-англійського мовлення. Досліджено особливості роботи локальних Encoder-Decoder моделей, комерційних API-сервісів та мультимодальних великих мовних моделей, а також методи ізольованого оцінювання помилок (метрика CS-WER) і зворотної текстової нормалізації. Розроблено спеціалізований еталонний корпус uk-en-code-mixed-asr-2h з параметрами: 448 аудіозаписів загальною тривалістю понад 2 години, ІТ-домен, 99,6 % внутрішньореченнєвого перемикання кодів. Реалізовано настільний застосунок для транскрибування повного циклу, який об'єднує підсистеми детектування активності мовлення із двопороговим гістерезисом, розпізнавання тексту та діаризації з міжсесійною ідентифікацією мовців на основі векторів ECAPA-TDNN. Експериментальне порівняння 49 конфігурацій моделей показало такі результати (загальний WER після ITN-нормалізації): найкраща мультимодальна Audio-LLM Gemini 3.1 Pro – 0,105, найкращий комерційний API ElevenLabs Scribe v2 – 0,134, найкраща локальна модель Whisper large-v3-turbo – 0,167. Встановлено, що показник помилок на англійських термінах системно перевищує помилки на українських словах у 3-10 разів. Застосування алгоритму ITN знизило кількість помилок на англіцизмах у середньому на 13 %, що доводить орфографічну, а не акустичну природу збоїв (кирилична транслітерація термінів). Дослідження моделей наскрізного перекладу виявило неспроможність традиційних архітектур коректно обробляти ІТ-сленг через дослівне калькування. Натомість мультимодальні Audio-LLM продемонстрували високу ефективність у семантичній адаптації українського професійного жаргону в технічну англійську мову, що робить переклад життєздатною альтернативою транскрибуванню з ITN.ukавтоматичне розпізнавання мовленняASRcode-switchingзмішане українсько-англійське мовленняCS-WERзворотна текстова нормалізація (ITN)діаризаціяідентифікація мовцямагістерська роботаАвтоматичне транскрибування та ідентифікація у змішаному українсько-англійському мовленніOther