ANALISIS KOMPARATIF EFEKTIVITAS VARIAN ARSITEKTUR TRANSFORMER PADA ANALISIS SENTIMEN BAHASA INFORMAL
Abstract
Bahasa informal yang kaya akan slang, sarkasme, dan fenomena code-switching di media sosial menjadi tantangan serius bagi sistem Natural Language Processing (NLP), khususnya dalam tugas analisis sentimen. Penelitian ini bertujuan menganalisis secara komparatif efektivitas berbagai varian arsitektur Transformer—meliputi BERT, RoBERTa, IndoBERT, XLM-R, FNet, dan FastFormer—dalam menangani teks bahasa informal berbahasa Indonesia. Evaluasi dilakukan pada tiga kategori dataset media sosial yang merepresentasikan teks slang, code-mixed, dan sarkasme, dengan menerapkan strategi fine-tuning berbasis domain serta augmentasi data melalui back-translation. Hasil menunjukkan bahwa IndoBERT-base mencapai performa tertinggi dengan akurasi 89,1% dan F1-score 88,7% pada teks slang, sementara XLM-R-base unggul pada teks code-mixed dengan F1-score 89,3%. Pendekatan ensemble keduanya menghasilkan F1-score terbaik sebesar 90,7%. Deteksi sarkasme menjadi tantangan tersulit dengan capaian terbaik hanya 74,8%. Kesimpulannya, tidak ada satu varian Transformer yang secara universal unggul, pemilihan model optimal sangat bergantung pada karakteristik linguistik data target.