Використання глибинного навчання у задачах класифікації звуків навколишнього середовища

Autor: Л. П. Добуляк, Д. О. Фербей, С. Б. Костенко
Jazyk: English<br />Ukrainian
Rok vydání: 2022
Předmět:
Zdroj: Науковий вісник Ужгородського університету. Серія: Математика і інформатика, Vol 41, Iss 2, Pp 118-127 (2022)
Druh dokumentu: article
ISSN: 2616-7700
93501471
DOI: 10.24144/2616-7700.2022.41(2).118-127
Popis: У даній статті розглянуто різні аспекти, пов'язані з розпізнаванням звуків навколишнього середовища, що є прикладною задачею в багатьох сферах діяльності людини. На відміну від музики та мови, звук навколишнього середовища насичений шумом і не має ритму та мелодії музики або семантичної послідовності мови. Це ускладнює пошук спільних рис серед звукових сигналів навколишнього середовища. У даному дослідженні розв'язання задачі розпізнавання звуків базуються на використанні методів класифікації зображень. Для цього виконується перетворення кожного аудіо-запису вибірки у спеціальні зображення — спектрограму Мела, що є його компактним інформативним візуальним представленням. Щоб підвищити точність розпізнавання звуків, досліджуються різні методи збільшення навчального набору даних. В основі цих методів лежить створення нових екземплярів аудіозаписів шляхом деформації існуючих. За допомогою такого підходу ми можемо збільшити в рази кількість елементів набору даних, таким чином вирішити проблему його обмеженості. Для класифікації звуків навколишнього середовища з набору аудіоданих UrbanSound8K було використано глибинну згорткову нейронну мережу. Щоб оцінити якість (точність та втрати) представленої моделі було застосовано 10-кратну перехресну перевірку.
Databáze: Directory of Open Access Journals