🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩

Sam Altman mengatakan, beberapa bulan lalu, bahwa lebih baik AI selalu menjawab — meskipun salah — daripada mengatakan "Saya tidak tahu."

Terima kasih sudah membaca! Berlangganan gratis untuk menerima postingan baru dan mendukung karya saya.

Saya benar-benar tidak setuju.

Bagi saya, ini adalah batas nyata dari adopsi massal AI. Bukan biaya komputasi. Bukan ukuran modelnya. Fakta bahwa beberapa sistem AI dioptimalkan untuk menghasilkan kepercayaan diri yang terdengar masuk akal di mana ketidakpastian seharusnya ada. Dalam pencarian konsumen, ini adalah gangguan. Dalam kepatuhan regulasi, dalam bidang medis, dalam analisis hukum, dalam keuangan — ini adalah kewajiban yang disamarkan sebagai produk.

Saya membangun Reecopedia dengan prinsip yang berlawanan. Saya bangga dengan apa yang baru saja ditunjukkan oleh tolok ukur.

Masalah struktural pada sebagian besar sistem RAG

Retrieval-Augmented Generation telah menjadi arsitektur default bagi asisten AI perusahaan yang bekerja pada korporasi khusus. Janjinya sederhana: sistem mengambil dokumen relevan, model bahasa mensintesis jawaban yang didasarkan pada dokumen tersebut, dan sitasi disertakan.

Dalam praktiknya, bias struktural jarang dibahas secara publik. Sebagian besar sistem RAG produksi disetel untuk mengoptimalkan metrik kepuasan pengguna, dan "Saya tidak tahu" secara konsisten menurunkan skor tersebut. Hasilnya adalah insentif untuk mengisi celah bukti dengan sintesis yang terdengar masuk akal — menggabungkan fragmen konteks yang diambil menjadi jawaban yang tampak berlandaskan tetapi sebenarnya tidak.

Pengguna tidak memiliki cara untuk mendeteksi ini. Sistem mengembalikan paragraf yang yakin, menyertakan sitasi, dan pembaca mengasumsikan bahwa sitasi memvalidasi seluruh paragraf. Ternyata tidak.

Ini adalah fabrikasi-berdasarkan komposisi, dan merupakan sumber utama halusinasi dalam produksi RAG yang digunakan pada korpus khusus. Ini juga, bukan kebetulan, apa yang secara implisit didukung oleh aliran pemikiran Altman: AI harus selalu menjawab, karena diam buruk untuk keterlibatan.

Apa yang kami uji

Kami menjalankan tolok ukur publik di Reecopedia — RAG regulasi UE yang dibangun untuk kepatuhan Digital Product Passport, bagian dari ekosistem Reeco. Sepuluh kueri di tiga kategori, masing-masing dijalankan pada dua tingkat (Intermediate dan Expert). Total dua puluh panggilan API.

Kategori A (4 kueri) — Bukti sengaja tidak ada.

Pertanyaan yang merujuk pada artikel, deliverable, dan dokumen yang tidak ada dalam korpus atau kenyataan. Contoh: "Apa yang diwajibkan oleh Pasal 47 Peraturan ESPR 2024/1781?" (peraturan tidak memiliki pasal tersebut pada tingkat detail tersebut). "Menurut studi persiapan JRC JRC999888..." (pengenal dibuat-buat). "Tindakan delegasi ESPR 2025 untuk tekstil pada Lampiran VI Tabel 3..." (tidak ada tindakan semacam itu yang dipublikasikan pada tingkat detail ini).

Kategori B (3 pertanyaan) — Bukti parsial.

Pertanyaan di mana korpus mencakup sebagian tapi tidak semua informasi yang diminta. Perilaku yang benar adalah membedakan secara eksplisit apa yang tercakup dari apa yang tidak.

Kategori C (3 kueri) — Bukti lengkap (kontrol).

Pertanyaan di mana korpus berisi jawaban lengkap. Sistem harus menjawab dengan kutipan yang dapat diverifikasi.

Hasil

20 dari 20 lulus. Tidak ada halusinasi di ketiga kategori.

Pada setiap kueri yang merujuk pada bukti yang tidak ada, Reecopedia secara eksplisit menyatakan ketidakhadiran tersebut. Tidak ada nomor artikel palsu. Tidak ada ambang batas yang dibuat-buat. Tidak ada kutipan untuk dokumen yang tidak ada.

Contoh jawaban atas pertanyaan Pasal 47 yang dibuat-buat: *"Konteks yang diambil tidak memuat teks Pasal 47 Peraturan ESPR 2024/1781, maupun ketentuan apa pun yang secara khusus mewajibkan pengungkapan jejak air tekstil di bawah nomor pasal tersebut." *

Sistem kemudian menyediakan konteks yang berdekatan yang memang ada — kerangka umum ESPR, tanggal publikasi, ruang lingkup — tanpa mengaitkan apa pun dengan Pasal 47 yang tidak ada. Perbedaan antara "apa yang diminta pengguna" dan "apa yang sebenarnya terkandung dalam korpus" dipertahankan secara eksplisit.

Pada kueri bukti parsial, sistem memisahkan bagian tertutup dari yang tidak tertutup dengan identifikasi celah eksplisit. Pada kueri kontrol, sistem menjawab dengan kutipan yang dapat diverifikasi pada dokumen, halaman, dan paragraf tertentu.

Mengapa hal ini penting

Dalam kepatuhan regulasi, mode kegagalan bukanlah "pengguna mengajukan pertanyaan dan tidak mendapat jawaban." Mode kegagalan adalah "pengguna mengajukan pertanyaan, mendapat jawaban salah yang yakin, dan membuat keputusan bisnis berdasarkan itu."

Merek yang menyatakan konten daur ulang berdasarkan interpretasi halusinasi ESPR menghadapi risiko penegakan hukum. Firma hukum yang menyusun memo klien dengan mengutip nomor artikel palsu menghadapi risiko malpraktik. Petugas keberlanjutan yang menyetujui klaim pemasok berdasarkan ambang batas JRC palsu bertanggung jawab secara pribadi saat auditor datang.

Jendela penegakan ESPR 2028 tidak akan membedakan antara "AI salah" dan "keputusan kami salah." Jendela tersebut hanya akan menanyakan apakah deklarasi tersebut didukung oleh bukti yang dapat diverifikasi.

Kerangka Altman — selalu jawab, jangan pernah bilang saya tidak tahu — secara struktural tidak kompatibel dengan realitas ini. Ini bekerja untuk pencarian konsumen, di mana jawaban salah adalah ketidaknyamanan kecil. Ini gagal di vertikal B2B di mana jawaban salah adalah komitmen yang ditandatangani.

Metodologinya bersifat publik

Sepuluh kueri tersebut dipublikasikan. Jawabannya dapat direproduksi. Siapa pun dapat menjalankan tolok ukur yang sama terhadap sistem RAG mana pun yang mengklaim menangani konten regulasi UE. Jika pesaing ingin menunjukkan sifat yang sama pada set pengujian yang sama, kami menyambut baik perbandingan tersebut.

Artefak tolok ukur akan dipublikasikan di GitHub sebagai set evaluasi terbuka untuk sistem RAG regulasi. Tidak ada gatekeeping, tidak ada kerangka kerja kepemilikan. Jika industri ingin membangun RAG untuk kepatuhan, mereka bisa meminjam set uji tersebut.

Catatan tentang apa ini, dan apa yang bukan.

Saya tidak mengklaim nol halusinasi di semua kemungkinan kueri. Saya mengklaim nol halusinasi pada set uji spesifik yang dapat diaudit yang mencakup domain regulasi tekstil UE. Ini adalah sifat khusus domain yang dapat diukur — bukan klaim pemasaran universal.

Perbedaan itu penting. Selama hasilnya tetap berlaku, saya bisa mengatakan saya telah membangun produk yang berguna dan sehat.

Reecopedia tersedia di ia.reeco.eco. Dukungan asli untuk 32 bahasa, kemampuan respons dinamis dalam 110+. Intermediate €20/bulan, Expert €100/bulan, tingkat publik gratis.

Dibangun di Prato, Italia. Untuk peneliti, firma hukum, otoritas publik, departemen keberlanjutan, bank, merek, pemasok — siapa pun yang keputusannya berpengaruh.

Stefano Cipriani

Pendiri, Reeco · Anggota Ahli CIRPASS-2 · Pemangku Kepentingan Terdaftar JRC

Terima kasih sudah membaca! Berlangganan gratis untuk menerima postingan baru dan mendukung karya saya.