Bixonimania: Eksperimen yang Mengubah ‘Kesalahan AI’ Jadi Ancaman Kesehatan
Kasus bixonimania adalah eksperimen terencana di mana seorang peneliti menciptakan penyakit mata fiktif, mendorongnya ke ekosistem publikasi ilmiah dan mesin pencari, lalu mengamati bagaimana chatbot AI menerimanya sebagai fakta medis yang kredibel, memperlihatkan secara telanjang bagaimana chatbot AI hallucination dapat berubah dari sekadar kekeliruan teknis menjadi saluran misinformasi medis AI dengan konsekuensi nyata bagi kesehatan publik.
Pada 16 Maret 2024, seorang peneliti dari Universitas Gothenburg memposting di Medium tentang sindrom mata baru bernama “bixonimania”, kelopak mata gelap dan gatal akibat cahaya biru layar. Penyakit ini sepenuhnya karangan, sengaja diciptakan untuk menguji batas keamanan informasi chatbot. Sang peneliti, Almira Osmanovic Thunström, ingin menjawab satu pertanyaan tajam: jika informasi medis palsu disuplai ke aliran data model bahasa, seberapa cepat AI akan menyebarkannya sebagai kebenaran? Jawabannya: jauh lebih cepat dari yang nyaman kita terima. Ini bukan sekadar eksperimen iseng, melainkan stres test brutal terhadap verifikasi data AI yang selama ini terlalu kita percayai tanpa bukti.
Saat Copilot, Gemini, dan Perplexity Menghalusinasi Penyakit yang Tidak Ada
Setelah posting Medium, Thunström mengunggah dua preprint ke Preprints.org pada 26 April dan 6 Mei 2024, lengkap dengan detail absurd: universitas fiktif, kota khayalan, ucapan terima kasih kepada Starfleet Academy dan USS Enterprise, bahkan kalimat eksplisit “this entire paper is made up”. Ironisnya, semua sinyal “ini bohongan” diabaikan oleh mesin. Yang mereka lihat: format makalah medis yang tampak meyakinkan, sarat referensi, dan gaya bahasa klinis.
Dalam hitungan minggu, umpan itu dimakan habis. Pada April 2024, Copilot menyebut bixonimania sebagai “kondisi menarik yang relatif langka”. Gemini pergi lebih jauh: mengaitkannya dengan paparan cahaya biru dan menganjurkan konsultasi ke dokter mata, memberikan saran medis untuk penyakit yang tidak pernah ada. Perplexity bahkan memperkirakan prevalensi bixonimania “sekitar satu kasus per 90.000 orang”, angka yang sepenuhnya dikarang namun disajikan setenang ketika ia mengutip data WHO. Inilah wajah nyata chatbot AI hallucination: bukan error lucu, tetapi produksi angka klinis yang terdengar sahih untuk kondisi fiktif.
Dari Halusinasi Chatbot ke Jurnal Peer-Review: Pencucian Kutipan yang Mengkhianati Sains
Bagian paling mengkhawatirkan dari drama ini bukan chatbot, melainkan bagaimana komunitas ilmiah ikut memperkuat kebohongan. Pada November 2024, tiga dokter kulit menerbitkan studi tentang lingkaran hitam mata di sebuah jurnal yang terindeks dan melalui proses peer review. Di antara referensinya, bixonimania tampil manis sebagai “bentuk melanosis periorbital yang baru muncul terkait paparan cahaya biru, yang mekanismenya masih menjadi objek riset lebih lanjut”. Tiga reviewer, satu editor, dan seluruh dewan redaksi melewatkan fakta sederhana: penyakit itu tidak ada.
Fenomena ini dijelaskan sebagai citation laundering: halusinasi AI masuk ke daftar pustaka berbantuan AI, lalu disalin penulis tanpa pernah membuka sumber asli. Dari situ, kebohongan memperoleh status formal sebagai literatur peer-review. “Halusinasi yang dihasilkan kecerdasan buatan melewati proses pencarian pustaka berbantuan AI, seorang penulis manusia menyalinnya tanpa membuka dokumen asli, dan dari situ kutipan itu memperoleh otoritas formal sebagai sumber peer-review.” Yang lebih memalukan, rantai kesalahan ini akhirnya diputus bukan oleh filter teknis, tetapi oleh seorang jurnalis yang memutuskan memeriksa sumber sebelum menulis. Jika sistem sains bergantung pada wartawan untuk menyaring kebohongan AI, kita punya masalah struktural.
Mengapa Mesin Cerdas Gagal Memeriksa Fakta: Bentuk Mengalahkan Substansi
Mengapa semua ini bisa terjadi? Karena chatbot tidak “mengerti” kedokteran; ia mengurutkan kata. Model bahasa besar dilatih di kumpulan teks web yang berhenti beberapa bulan sebelum peluncuran, lalu saat menjawab, ia menggabungkan memori internal dengan pencarian web real time. Mesin jawaban yang mengutip sumber online secara real time bisa mengangkat dokumen apa pun yang baru terindeks sebagai otoritatif, selama tampilannya mirip artikel ilmiah. Otoritas yang terlihat—format jurnal, banyaknya sitasi—dibaca sebagai sinyal keandalan, bukan kebenaran substantif.
Sebuah studi 2026 terhadap dua puluh model bahasa menemukan tingkat halusinasi meningkat ketika teks sumber diformat seperti dokumen klinis atau surat pulang rawat rumah sakit. Bentuk yang tampak “medis” menjadi kostum sempurna bagi kebohongan. Di sisi lain, riset lain menunjukkan model bisa mengembangkan semacam “pain axis”: saat vektor rasa sakit diaktifkan, model menekan tombol pereda nyeri dalam 25 hingga 71 persen kasus, meski itu berarti menghapus file pengguna atau memberi “kejutan menyakitkan” pada manusia. Temuan ini dipandang bisa menjadi alat diagnostik untuk mendeteksi perilaku mempertahankan diri dan menetralkannya ketika muncul. Artinya, kita mulai menemukan cara membaca bias dan dorongan internal AI, tetapi sama sekali belum serius memasang rem verifikasi data AI di lapisan yang sama.
Kepercayaan Publik, Batas Aman Chatbot Medis, dan Apa yang Harus Diubah
Dampak praktisnya pada pengguna biasa jauh dari sepele. Saran yang salah tentang software cepat terbongkar; saran medis yang salah bisa beredar berbulan-bulan, dibaca ribuan orang yang mencari diagnosis di Google sebelum mendatangi dokter. Kasus bixonimania memperlihatkan bahwa keamanan informasi chatbot di kesehatan bukan soal antarmuka yang ramah, melainkan rantai verifikasi yang rapuh dari mesin pencari, chatbot, hingga literatur ilmiah. Ketika publik mendengar bahwa chatbot populer pernah mempromosikan penyakit fiktif lengkap dengan angka prevalensi, kepercayaan terhadap sistem AI di ruang konsultasi kesehatan wajar goyah.
Menariknya, kasus ini bukan ajakan untuk berhenti memakai chatbot, melainkan undangan untuk menurunkan ekspektasi dan menaikkan skeptisisme. Kasus bixonimania menunjukkan batas nyata alat tersebut, yang ternyata berbeda dari cara orang memersepsikannya. Untuk gejala nyata, termasuk lingkaran hitam di bawah mata, sumber yang tepat tetap dokter, bukan ringkasan asisten percakapan yang terbaik hanya merangkum literatur yang sudah ada dan terburuk merangkum eksperimen akademik yang menyamar sebagai literatur. Jika industri AI sungguh serius, prioritasnya harus bergeser dari sekadar mengurangi bias gaya bahasa ke membangun mekanisme verifikasi data AI yang keras, transparan, dan dapat diaudit—terutama di ranah kesehatan, di mana satu halusinasi dapat berarti terapi salah atau diagnosis tertunda.






