- 30/01/2026
- Category: Commentaries ID
Penulis: Fathin Difa Robbani
Penyunting: Ayom Mratita Purbandani
Pendahuluan
Penggunaan kecerdasan artifisial generatif (generative artificial intelligence/genAI) dalam penulisan akademik dan profesional meningkat pesat. Model bahasa besar tersebut kini tidak hanya dimanfaatkan untuk koreksi bahasa atau parafrase, tetapi juga untuk penyusunan argumen, ringkasan literatur, dan penulisan draf awal karya ilmiah. Sejumlah studi bahkan menunjukkan bahwa penggunaan genAI berkontribusi pada peningkatan produktivitas dan, dalam kondisi tertentu, kualitas tulisan di pendidikan tinggi dan pekerjaan-pekerjaan yang berbasis pengetahuan.[1][2] Akibatnya, banyak institusi akademik yang mengkhawatirkan isu orisinalitas dan integritas. Merespons kekhawatiran tersebut, banyak institusi mengadopsi AI text detection tools untuk membedakan teks yang diproduksi oleh manusia dan AI. Bahkan, menjadikannya sebagai dasar pengambilan keputusan yang berdampak langsung pada penilaian dan sanksi akademik.
Kendati demikian, tujuan menjaga integritas akademik tersebut menjadi problematis ketika AI detection tools tersebut diperlakukan seolah-olah objektif dan andal. Padahal, sejumlah bukti empiris menunjukkan bahwa tingkat akurasi detektor tersebut masih terbatas, sering kali hanya berada pada kisaran 50–70%, terdapat penurunan pada model generatif terbaru, dan bias terhadap penulis bukan penutur asli (non-native) atau teks yang telah diedit manusia.[3] Ketergantungan berlebihan pada detektor dalam penilaian penulisan menimbulkan risiko etis dan sosial yang signifikan, Oleh karena itu, tulisan ini bermaksud untuk menegaskan bahwa AI text detection tools tidak layak dijadikan dasar keputusan tunggal, tetapi diperlakukan sebagai indikator awal yang bersifat probabilistik. Sebab, tanpa kerangka etika dan regulasi yang jelas, penggunaan detektor justru berpotensi menciptakan ketidakadilan baru, alih-alih menjaga integritas akademik dan profesional.
Mengapa Deteksi Teks AI Sulit secara Prinsipil
AI text detection tools bekerja dengan pendekatan probabilistik, bukan deterministik. Alat deteksi tidak dapat memastikan asal sebuah teks, tetapi hanya memperkirakan kemungkinan apakah teks tersebut dihasilkan oleh manusia atau model bahasa. Estimasi ini umumnya didasarkan pada metrik seperti perplexity, pola variasi bahasa (stylometry), serta klasifikasi menggunakan model pembelajaran mesin yang dilatih dengan contoh teks manusia dan AI.[4][5] Pendekatan semacam ini secara inheren tidak pasti dan sangat bergantung pada asumsi bahwa terdapat perbedaan karakteristik yang stabil antara teks manusia dan teks AI.
Asumsi tersebut semakin rapuh seiring perkembangan model bahasa generatif. Model terbaru menghasilkan teks yang semakin beragam, kontekstual, dan menyerupai gaya manusia. Sementara itu, penulis manusia juga semakin sering menyunting atau memodifikasi teks dengan bantuan AI. Akibatnya, batas antara teks manusia dan AI menjadi kabur, dan pola statistik yang digunakan detektor cenderung cepat usang serta sulit digeneralisasikan ke kondisi dunia nyata. Dalam evaluasi komprehensifnya, Weber-Wulff et al.[6] menunjukkan bahwa sebagian besar AI text detection tools bergantung pada ciri statistik permukaan seperti tingkat perplexity, regularitas sintaksis, distribusi frekuensi kata, dan konsistensi struktur kalimat, yang hanya merepresentasikan gaya linguistik, bukan asal teks diproduksi. Ketergantungan pada pola-pola ini menyebabkan akurasi deteksi berada pada kisaran 50–70% dan menurun secara signifikan ketika dihadapkan pada teks dari model generatif yang lebih baru, seperti GPT-4.
Di sisi lain, laporan yang menunjukkan akurasi tinggi dalam konteks tertentu perlu ditafsirkan secara hati-hati. Penelitian Pitriani et al.[7], misalnya, menunjukkan performa deteksi yang sangat baik menggunakan IndoBERT untuk teks berbahasa Indonesia. Namun, hasil tersebut diperoleh dari dataset yang terkontrol dengan batasan domain dan skenario penggunaan yang sempit. Kondisi ini tidak sepenuhnya mencerminkan kompleksitas dunia nyata, mengingat sebuah tulisan sering kali bersifat campuran, telah diedit, dan dipengaruhi oleh konteks sosial penulis. Dengan demikian, angka akurasi yang tinggi dalam pengujian laboratorium tidak otomatis menjamin validitas sosial maupun keandalan detektor dalam praktik nyata.
Risiko Nyata: Error, Bias, dan Teks Campuran
Keterbatasan teknis AI text detection tools berdampak langsung dalam praktik akademik dan profesional, terutama melalui dua jenis kesalahan: false positive dan false negative. False positive, yakni ketika teks yang diproduksi manusia diklasifikasikan sebagai hasil AI dapat berujung pada sanksi akademik, kerusakan reputasi, dan tekanan psikologis. Sementara, false negative, yakni ketika teks yang diproduksi AI lolos sebagai tulisan manusia, tetapi situasi ini sering kali tidak menimbulkan konsekuensi langsung. Dalam konteks ini, cost of error bersifat tidak simetris karena risiko dan beban moral dari kesalahan lebih banyak ditanggung oleh individu daripada institusi. Oleh karenanya, penggunaan detektor sebagai dasar keputusan penilaian tulisan menjadi problematis.
Risiko terjadinya false positive semakin besar akibat bias terhadap penulis bukan penutur asli (non-native). Gaya bahasa yang sederhana, struktur kalimat langsung, atau variasi kosakata yang terbatas kerap disalahartikan sebagai ciri teks yang diproduksi AI, meskipun mencerminkan latar belakang linguistik penulis. Kecenderungan detektor secara keliru mengklasifikasikan teks penulis English as Second Language (ESL) sebagai AI-generated disampaikan oleh Weber-Wulff et al.[8] secara eksplisit. Kekeliruan tersebut berpotensi menimbulkan diskriminasi bahasa, alih-alih menunjukkan perilaku akademik yang tidak jujur dari penulis. Dalam konteks global yang multibahasa, termasuk dalam penggunaan Bahasa Indonesia, bias semacam ini memiliki implikasi etis yang semakin signifikan.
Seiring dengan perkembangan model generatif yang semakin mutakhir asumsi bahwa teks dapat diklasifikasikan secara biner (produksi manusia atau AI) semakin sulit dipertahankan. Praktik penulisan modern sering melibatkan kolaborasi manusia dan AI, baik melalui penyusunan draf awal maupun penyuntingan lanjutan. Penelitian seperti DAMASHA[9] menunjukkan bahwa teks campuran dan manipulasi adversarial secara signifikan meningkatkan kompleksitas deteksi, menegaskan bahwa realitas penulisan saat ini jauh melampaui asumsi klasifikasi sederhana. Secara keseluruhan, keberadaan eror, bias, dan teks campuran menunjukkan bahwa pendekatan deteksi biner produksi manusia versus AI sudah tidak memadai dan berisiko memperbesar ketidakadilan ketika digunakan sebagai dasar keputusan.
Implikasi Etika dan Regulasi
Penggunaan AI text detection tools membawa implikasi etika dan regulasi yang melampaui persoalan teknis. Salah satu masalah utamanya adalah kurangnya transparansi. Banyak institusi tidak menjelaskan secara rinci bagaimana sebuah detektor bekerja, tingkat akurasinya, maupun batasan-batasannya. Akibatnya, hasil deteksi sering diperlakukan sebagai fakta objektif, bukan sebagai estimasi probabilistik. Kondisi ini memperlemah prinsip akuntabilitas dan membuka ruang bagi pengambilan keputusan yang tidak proporsional.
Masalah etika lain yang krusial adalah pergeseran beban pembuktian (shifting burden of proof). Dalam banyak kasus, ketika sebuah detektor menandai teks sebagai AI-generated, penulis diminta untuk membuktikan bahwa tulisannya asli. Pendekatan ini problematis karena mengasumsikan kesalahan telak berada pada penulis, bukan pada alat yang memiliki tingkat kesalahan yang terdokumentasi. Selain itu, AI text detection tools sering diperlakukan seolah-olah seperti alat forensik, padahal secara ilmiah alat ini tidak dirancang untuk memberikan kepastian, tetapi indikasi.
Oleh karena itu, diperlukan serangkaian prinsip dasar dalam penggunaan AI text detection tools. Pertama, hasil deteksi tidak boleh digunakan sebagai bukti tunggal dalam pengambilan keputusan yang berdampak signifikan. Kedua, evaluasi manusia (human review) harus menjadi bagian integral dari proses, terutama untuk mempertimbangkan konteks penulisan dan latar belakang penulis. Ketiga, penulis harus memiliki hak untuk klarifikasi dan keberatan terhadap hasil deteksi, termasuk akses terhadap penjelasan umum mengenai dasar penilaian yang digunakan.
Pendekatan ini bukan bertujuan untuk melarang penggunaan AI text detection tools, melainkan untuk membatasi dan membingkainya secara bertanggung jawab. Tanpa kerangka etika dan regulasi yang jelas, detektor berisiko menjadi alat kontrol yang tidak adil. Namun, sebaliknya, jika digunakan secara hati-hati dan transparan, detektor dapat berfungsi sebagai alat pendukung yang membantu menjaga integritas tanpa mengorbankan keadilan.
Kesimpulan
AI text detection tools masih memiliki keterbatasan mendasar yang membuatnya tidak cukup andal untuk dijadikan dasar keputusan yang berdampak signifikan. Pendekatan deteksi yang bersifat probabilistik, performa yang tidak stabil terhadap model generatif terbaru, serta risiko false positive dan false negative, serta bias terhadap penulis bukan penutur asli menunjukkan bahwa hasil deteksi sebaiknya dipahami sebagai indikasi awal, bukan alat keputusan final. Ketika detektor diperlakukan sebagai bukti tunggal, risiko ketidakadilan meningkat, baik dalam bentuk sanksi akademik yang keliru maupun erosi kepercayaan antara institusi dan penulis. Oleh karena itu, penggunaan AI text detection tools perlu dibingkai secara etis melalui evaluasi manusia, transparansi atas keterbatasan alat, dan mekanisme klarifikasi yang adil.
Melihat bagaimana perkembangan genAI ke depan, integritas akademik tidak dapat semata-mata bergantung pada teknologi deteksi, tetapi memerlukan peningkatan literasi AI, pedoman penggunaan yang jelas, dan etika penulisan yang adaptif terhadap kolaborasi manusia–AI. Dorongan ini penting karena integritas akademik bukan hanya tentang menertibkan teknologi, melainkan membangun praktik yang adil dan reflektif.
- Usdan, J. et al. (2024) ‘Generative AI’s Impact on Graduate Student Professional Writing Productivity and Quality’, International Journal of Artificial Intelligence in Education. Available at: https://link.springer.com/article/10.1007/s40593-025-00528-z ↑
- Forster, Rebecca Tukachinsky, et al.(2025) ‘From digital divide to equity-enhancing diffusion: Generative AI and writing quality’, AI & Society. Available at: https://link.springer.com/article/10.1007/s00146-025-02739-3 ↑
- Weber‑Wulff, D., Anohina‑Naumeca, A., Bjelobaba, S., Foltýnek, T., Guerrero‑Dib, J., Popoola, O., & Šigut, P. (2023). Testing of detection tools for AI‑generated text. International Journal for Educational Integrity, 19, 26. doi:10.1007/s40979-023-00146-z. Available at: https://link.springer.com/article/10.1007/s40979-023-00146-z ↑
- Hayawi, K., Shahriar, S. and Mathew, S.S., 2023. The Imitation Game: Detecting Human and AI-Generated Texts in the Era of ChatGPT and BARD. arXiv. Available at: https://arxiv.org/abs/2307.12166 ↑
- Opara, C., 2025. Distinguishing AI-Generated and Human-Written Text Through Psycholinguistic Analysis. arXiv. Available at: https://arxiv.org/abs/2505.01800 ↑
- Weber‑Wulff, D., Anohina‑Naumeca, A., Bjelobaba, S., Foltýnek, T., Guerrero‑Dib, J., Popoola, O., & Šigut, P. (2023). Testing of detection tools for AI‑generated text. International Journal for Educational Integrity, 19, 26. doi:10.1007/s40979-023-00146-z. Available at: https://link.springer.com/article/10.1007/s40979-023-00146-z ↑
- Pitriani, P., Maylawati, D.S. & Gerhana, Y.A. (2023) ‘Deteksi Generatif Teks pada Penilaian Otomatis Tes Esai Berbahasa Indonesia Menggunakan IndoBERT’, Jurnal Edukasi dan Penelitian Informatika (JEPIN), vol. 11, no. 2, pp. 170–190. Available at: https://jurnal.untan.ac.id/index.php/jepin/article/view/93221 ↑
- Weber‑Wulff, D., Anohina‑Naumeca, A., Bjelobaba, S., Foltýnek, T., Guerrero‑Dib, J., Popoola, O., & Šigut, P. (2023). Testing of detection tools for AI‑generated text. International Journal for Educational Integrity, 19, 26. doi:10.1007/s40979-023-00146-z. Available at: https://link.springer.com/article/10.1007/s40979-023-00146-z ↑
- Sai Teja, L.D.M.S., Gopala Krishna, N.S., Khan, U., Khan, M.H., Pakray, P. & Mishra, A. (2025) DAMASHA: Detecting AI in Mixed Adversarial Texts via Segmentation with Human-interpretable Attribution. arXiv preprint. Available at: https://arxiv.org/abs/2512.04838 ↑