Ada satu kebiasaan kecil yang diam-diam berubah dalam beberapa bulan terakhir. Dulu, setiap kali harus mengolah data—entah indikator mutu rumah sakit, entah rekap kunjungan pasien—ritualnya selalu sama: buka SPSS atau Jamovi, impor berkas Excel yang kolomnya berantakan, klik menu Analyze, pilih uji, lalu menatap tabel keluaran yang lebih mirip teka-teki silang daripada jawaban. Sekarang, godaannya lain. Unggah saja berkas itu ke chatbot, ketik “tolong analisis, apakah ada perbedaan bermakna?”, dan dalam hitungan detik muncul grafik rapi, nilai p, dan paragraf interpretasi yang terdengar sangat meyakinkan.
Terlalu meyakinkan, malah. Dan di situlah pertanyaan artikel ini bermula: seberapa jauh sebenarnya kemampuan model AI unggulan saat ini dalam mengolah data statistik? Apakah aplikasi statistik yang selama ini jadi “kitab suci” mahasiswa, peneliti, dan pengelola mutu sudah bisa dipensiunkan? Atau justru ada hal-hal yang belum—dan mungkin tidak akan—bisa digantikan?
AI Tidak Menghitung, AI Menyuruh Menghitung
Hal pertama yang perlu diluruskan adalah cara kerja AI saat “menganalisis data”. Model bahasa besar (LLM) seperti yang ada di balik ChatGPT, Claude, atau Gemini pada dasarnya adalah mesin bahasa, bukan kalkulator. Kalau Anda memintanya menghitung simpangan baku dari 300 angka “di kepalanya”, hasilnya bisa meleset—dan ia akan tetap menyampaikannya dengan nada percaya diri.
Yang membuat AI generasi sekarang terasa jauh lebih andal adalah satu trik sederhana: ia tidak lagi menghitung sendiri. Ia menulis kode—biasanya Python atau R—lalu menjalankannya di sebuah lingkungan terisolasi (sandbox), membaca hasilnya, dan baru kemudian menjelaskannya kepada kita. Jadi ketika chatbot menyajikan hasil uji-t, yang sebenarnya bekerja di belakang layar adalah pustaka statistik yang sama yang dipakai para statistikawan sejak lama.
Analogi yang paling pas barangkali begini: AI adalah seorang asisten peneliti yang sangat cepat dan fasih berbicara, yang kebetulan pandai mengoperasikan kalkulator ilmiah. Angka yang ia sajikan umumnya benar kalau ia memilih tombol yang tepat. Masalahnya, memilih tombol yang tepat itulah inti dari statistik.
Benar Arah, Meleset Angka
Pertanyaan “seberapa baik” akhirnya harus dijawab dengan data, bukan kesan. Dan di sini, sebuah studi yang terbit Agustus 2026 memberi gambaran yang cukup jujur.
Tim dari Stanford dan University of Wisconsin–Madison menyusun P-Bench, kumpulan 425 tugas uji hipotesis yang diambil dari data ilmiah sungguhan—makalah ekonomi, biologi, dan materi ajar biostatistik. Setiap tugas hanya memberi pertanyaan penelitian dan dataset, tanpa memberi tahu metode apa yang harus dipakai. Model AI harus memilih uji sendiri, menjalankan analisis, melaporkan nilai p, lalu menyimpulkan: tolak atau terima hipotesis nol.
Hasilnya menarik. Pada tugas-tugas yang tergolong mudah, GPT-5.4 dari OpenAI mampu mencapai kesimpulan yang benar sekitar 93% dari waktu. Tetapi ketika syaratnya diperketat—nilai p yang dilaporkan harus mendekati hasil analisis rujukan—angkanya turun ke kisaran 65%. Pada tugas sulit, jurangnya lebih lebar lagi: kesimpulan yang benar sekitar 58%, namun yang benar sekaligus nilai p-nya akurat hanya sekitar 30%.
Artinya, AI sering “benar karena kebetulan”: arah kesimpulannya tepat, tetapi jalan yang ditempuh untuk sampai ke sana tidak sesuai dengan analisis yang semestinya. Dalam penelitian sungguhan, ini berbahaya, karena kita jarang tahu jawaban benarnya sejak awal.
Para peneliti menampilkan satu contoh yang membuat saya tersenyum kecut. Dalam sebuah data genomik kanker, model AI sebenarnya sudah melihat adanya beberapa pencilan (outlier) yang ekstrem. Namun ia tetap memakai regresi linear, menghasilkan hubungan yang “sangat bermakna”—padahal uji berbasis peringkat seperti Spearman, yang lebih tepat untuk data semacam itu, justru tidak menemukan hubungan apa pun. Kodenya berjalan mulus, bahasanya fasih, kesimpulannya salah. Sebuah temuan palsu yang dibungkus rapi.
Yang tak kalah menarik: model kecil berukuran 14 miliar parameter bernama Fisher-R1, yang dilatih khusus untuk uji hipotesis, justru mengungguli GPT-5.4 pada sebagian besar ukuran ketat. Pesannya jelas—penalaran statistik yang andal tidak otomatis muncul dari model yang lebih besar, melainkan dari pelatihan yang memang menuntut ketelitian metodologis. (Perlu dicatat, studi ini tidak menguji semua model unggulan; Claude dan Gemini, misalnya, tidak masuk daftar pembanding.)
Temuan senada muncul di tempat lain. Sebuah studi eksplorasi yang mencoba memakai agen AI untuk mereproduksi penelitian Alzheimer mendapati agen tersebut kadang lupa memasukkan kovariat penting seperti usia, jenis kelamin, dan pendidikan ke dalam regresi, atau melewatkan uji ketahanan (bootstrapping) yang dilakukan penelitian aslinya. Studi lain tentang reprodusibilitas analisis data oleh LLM menyimpulkan bahwa model saat ini belum sepenuhnya andal, dan menyarankan agar setiap solusi buatan AI ditinjau cermat sebelum dipakai.
Kesimpulan sementara: untuk pekerjaan statistik rutin dengan data yang bersih, AI sudah sangat membantu. Untuk data yang “nakal”—penuh pencilan, klaster, variabel pengganggu—AI masih seperti mahasiswa cerdas yang terlalu cepat menjawab.
Menariknya: Aplikasi Statistik Tidak Diam Saja
Kalau kita membayangkan pertandingan “AI melawan SPSS”, sebenarnya gambaran itu sudah usang. Yang terjadi justru perkawinan.
IBM kini membenamkan fitur AI Output Assistant berbasis watsonx ke dalam SPSS Statistics. Fungsinya menerjemahkan tabel keluaran yang rumit menjadi penjelasan dalam bahasa sehari-hari—persis bagian yang dulu paling membuat pusing mahasiswa. Versi 32 juga menambahkan analisis mediasi dan alur kerja untuk data genomik.
JASP, aplikasi gratis kesayangan para peneliti psikologi, melangkah lebih jauh. Sejak versi 0.98 yang dirilis awal Juli 2026, JASP punya AI yang terintegrasi penuh: ia bisa mengendalikan antarmuka, memilih analisis baru, lalu menafsirkan dan memberi anotasi pada hasilnya. Untuk komunitas, fitur ini gratis asal pengguna membawa kunci API dan model AI sendiri.
Di dunia R, Posit—perusahaan di balik RStudio—meluncurkan Posit Assistant, agen AI yang hidup langsung di dalam RStudio dan Positron. Keunggulannya dibanding chatbot di peramban: ia bisa melihat sesi R yang sedang berjalan, membaca keluaran konsol, menangkap grafik, dan memeriksa variabel di lingkungan kerja. Ada pengakuan menarik dari tim Posit: mereka semula sangat berhati-hati terhadap AI dalam ilmu data, tetapi menjelang akhir 2025 kemampuan model meningkat begitu pesat sehingga, dalam kata-kata mereka sendiri, yang mengejutkan bukan lagi ketika AI berhasil, melainkan ketika ia gagal.
Bahkan Jamovi punya modul komunitas bernama askLLM yang memungkinkan pengguna “bertanya” tentang datanya. Yang menarik dari modul ini adalah filosofi privasinya: ia hanya mengirim ringkasan statistik, bukan baris data mentah, dan menyediakan opsi model lokal lewat Ollama sehingga tak satu pun data meninggalkan komputer.
Jadi pertanyaannya bergeser. Bukan lagi “AI atau SPSS?”, melainkan “AI di dalam apa, dan siapa yang memegang kendali?”
Apa yang Sudah Bisa Digantikan
Mari jujur. Ada banyak pekerjaan yang dulu membuat kita bergantung pada aplikasi statistik—dan pada teman yang “jago SPSS”—yang kini bisa ditangani AI dengan baik.
Yang pertama adalah peran sebagai penerjemah menu. Banyak orang memakai SPSS bukan karena mengerti statistik, melainkan karena hafal urutan klik. Kini cukup mengatakan apa yang ingin diketahui, dan AI akan memilihkan prosedur, menulis kode, serta menjalankannya. Hambatan teknis untuk memulai analisis nyaris lenyap.
Yang kedua adalah pembersihan dan penataan data: mengganti format tanggal, menyatukan kategori yang ditulis berbeda-beda (“Laki-laki”, “L”, “laki2”), menangani sel kosong. Pekerjaan membosankan yang dulu memakan separuh waktu analisis ini kini bisa diselesaikan dengan satu kalimat perintah—asal hasilnya tetap diperiksa.
Yang ketiga adalah statistik deskriptif, visualisasi, dan uji-uji dasar: rerata, proporsi, tabel silang, grafik tren indikator bulanan, uji-t, chi-kuadrat, korelasi sederhana. Untuk kebutuhan laporan rutin, AI sudah cukup cakap.
Yang keempat, dan mungkin paling berharga, adalah AI sebagai guru privat. Ia bisa menjelaskan mengapa uji Mann-Whitney dipilih alih-alih uji-t, apa arti interval kepercayaan, atau mengapa nilai p 0,049 bukan alasan untuk berpesta. Ia sabar, tidak menghakimi, dan bisa ditanya berulang kali pukul dua pagi.
Apa yang Belum Bisa Digantikan
Namun ada beberapa hal yang, setidaknya hingga hari ini, masih menjadi wilayah aplikasi statistik—dan manusia yang memakainya.
Mesin hitung yang deterministik. Ini ironi yang sering terlupa: AI yang “menganalisis data” itu sendiri meminjam mesin R atau Python. Aplikasi statistik bukan pesaing AI; ia adalah mesin yang dikemudikan AI. Masukkan data yang sama ke prosedur yang sama di SPSS seratus kali, hasilnya akan identik seratus kali. LLM tidak memberi jaminan itu—jalankan permintaan yang sama dua kali, dan ia bisa memilih jalur analisis yang berbeda.
Jejak audit dan reprodusibilitas. Dalam penelitian yang serius, terlebih uji klinis, hasil harus bisa diulang dan diperiksa oleh orang lain bertahun-tahun kemudian. Berkas sintaksis SPSS atau skrip R adalah “rekam medis” dari sebuah analisis. Percakapan dengan chatbot, sebaliknya, bergantung pada versi model yang bisa pensiun sewaktu-waktu. Karena itu, praktik terbaik adalah selalu meminta AI menyerahkan kodenya—dan menyimpannya.
Penilaian metodologis. Inilah jurang terbesar, seperti ditunjukkan P-Bench. Memilih uji yang tepat menuntut pemahaman tentang desain penelitian, cara data dikumpulkan, asumsi yang mungkin dilanggar, dan pertanyaan klinis di baliknya. AI bisa menyebutkan asumsi-asumsi itu dengan fasih, tetapi seperti dalam contoh data kanker tadi, ia belum konsisten bertindak berdasarkan asumsi yang ia sendiri kenali. Apalagi untuk inferensi kausal—apakah intervensi X benar-benar menyebabkan perbaikan Y—yang membutuhkan pengetahuan tentang dunia di luar spreadsheet.
Privasi data. Bagi kami yang bekerja di layanan kesehatan, ini bukan perkara kecil. Tim JASP sendiri mengingatkan bahwa banyak layanan AI gratis—termasuk versi gratis model komersial—bisa memakai masukan pengguna untuk melatih model, sebuah risiko nyata bagi data pasien. Di Indonesia, UU Pelindungan Data Pribadi menjadikan ini soal hukum, bukan sekadar etika. Aplikasi statistik yang berjalan luring di komputer sendiri punya satu keunggulan yang tak bisa ditandingi layanan awan: datanya tidak ke mana-mana.
Tanggung jawab. Pada akhirnya, laporan mutu, skripsi, atau artikel ilmiah akan ditandatangani oleh manusia. Ketika kesimpulan salah memicu kebijakan yang keliru, “kata AI begitu” bukan pembelaan yang bisa diterima—tidak di hadapan penguji, tidak di hadapan surveior akreditasi, dan tidak di hadapan nurani sendiri.
Dari Operator Menjadi Penyunting
Jadi, apakah SPSS, R, JASP, dan Jamovi sudah boleh pensiun? Jawaban saya: yang pensiun bukan aplikasinya, melainkan cara kita memakainya.
Antarmuka berbasis menu kemungkinan besar akan pelan-pelan tergeser oleh percakapan. Anak muda yang belajar statistik lima tahun lagi mungkin tak pernah merasakan frustrasi mencari di mana letak menu Compare Means. Tetapi mesin perhitungannya—yang deterministik, tervalidasi, dan dapat diaudit—akan tetap ada, justru semakin penting karena kini ia menjadi fondasi tempat AI berpijak.
Yang berubah paling drastis adalah peran kita. Dulu kita adalah operator yang menekan tombol. Kini kita dituntut menjadi penyunting yang cermat: memeriksa apakah uji yang dipilih masuk akal, apakah asumsinya dipenuhi, apakah kesimpulannya sejalan dengan angka, dan apakah data yang diunggah memang boleh diunggah. Ironisnya, era AI tidak membuat pemahaman statistik menjadi kurang penting. Ia justru membuatnya lebih penting—karena kesalahan kini datang dalam kemasan yang jauh lebih meyakinkan.
Mungkin analogi terbaiknya adalah autopilot di kokpit pesawat. Ia menerbangkan pesawat dengan mulus sebagian besar waktu, dan tak ada pilot waras yang menolak memakainya. Tetapi kita tetap menaruh pilot terlatih di kursi depan, karena saat cuaca memburuk dan instrumen mulai memberi sinyal aneh, yang dibutuhkan adalah seseorang yang benar-benar paham cara terbang.
Maka pertanyaan yang tersisa barangkali bukan untuk AI, melainkan untuk kita sendiri: ketika mesin sudah bisa menjawab hampir semua pertanyaan statistik, apakah kita masih cukup paham untuk tahu kapan jawabannya keliru? Dan jika tidak—siapa sebenarnya yang sedang menganalisis siapa?
Bacaan Lanjutan
- Miao, J., Mu, J., Chen, G., & Zou, J. (2026). Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing. arXiv:2608.07437. https://arxiv.org/abs/2608.07437
- Large Language Model-Based Agents for Automated Research Reproducibility: An Exploratory Study in Alzheimer’s Disease. arXiv:2505.23852. https://arxiv.org/abs/2505.23852
- AIRepr: An Analyst-Inspector Framework for Evaluating Reproducibility of LLMs in Data Science. arXiv:2502.16395. https://arxiv.org/abs/2502.16395
- IBM SPSS Statistics — Features. https://www.ibm.com/products/spss-statistics/features
- JASP Team (2026). Breakthrough Development: JASP with Fully Integrated AI. https://jasp-stats.org/2026/06/30/breakthrough-development-jasp-with-fully-integrated-ai/
- Posit (2026). Introducing AI in RStudio. https://posit.co/blog/introducing-ai-in-rstudio
- askLLM — modul jamovi. https://github.com/SCgeeker/askLLM




Tinggalkan Balasan