Algoritme decision tree untuk mendeteksi ujaran kebencian dan bahasa kasar multilabel pada Twitter berbahasa Indonesia

Autor: Fauzi Ihsan, Iwan Iskandar, Nazruddin Safaat Harahap, Surya Agustian
Jazyk: English<br />Indonesian
Rok vydání: 2021
Předmět:
Zdroj: Jurnal Teknologi dan Sistem Komputer, Vol 9, Iss 4, Pp 199-204 (2021)
Druh dokumentu: article
ISSN: 2338-0403
DOI: 10.14710/jtsiskom.2021.13907
Popis: Ujaran kebencian dan bahasa kasar mudah ditemukan di dalam komunikasi tertulis di media sosial seperti Twitter, yang dapat memicu terjadinya persengketaan di antara korban dan pengujarnya. Bagaimanapun, akan sulit memeriksa apakah suatu twit mengandung ujaran kebencian dan/atau bahasa kasar bila seseorang berpihak. Penelitian ini bertujuan untuk membangun sistem untuk mengklasifikasi twit apakah mengandung ujaran kebencian dan kata-kata kasar. Apabila terdeteksi mengandung ujaran kebencian, maka level ujaran kebenciannya diukur. Dataset yang digunakan terdiri dari 13.126 twit asli dari Twitter. Word embedding digunakan untuk fitur dari teks. Algoritme Decision Tree digunakan untuk klasifikasi. Rekayasa fitur dan pengaturan parameter menunjukkan peningkatan performa deteksi. Fitur leksikon di klasifikasi Decision Tree menghasilkan akurasi tertinggi untuk deteksi ketiga kelas, yaitu kelas ujaran kebencian, kata-kata kasar dan level ujaran kebencian, daripada rekayasa fitur khusus dan fitur tekstual. Rata-rata akurasi dari ketiga kelas meningkat dari 69,77 % menjadi 70,48 % untuk komposisi data latih-uji 90:10, dan dari 69,35 % menjadi 69,54 % untuk komposisi 80:20.
Databáze: Directory of Open Access Journals