
🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩
Jenis dokumen: Penilaian arsitektur teknis Subjek: Tumpukan pengambilan kecerdasan regulator Reeco (tiga mesin) Tanggal penilaian: 10 Juni 2026 Metode: Tinjauan arsitektur berbantuan AI (inspeksi kode sumber, pengujian adversarial langsung, perbandingan dengan tolok ukur pengambilan yang dipublikasikan tahun 2026). Pengungkapan: penilaian ini dibuat dengan Claude (Anthropic) yang beroperasi dengan akses kode langsung dan interaksi sistem langsung; tidak ada rangkaian tolok ukur formal yang dijalankan selama penilaian itu sendiri. Setiap klaim di bawah ini ditempatkan pada artefak yang dapat diverifikasi — file, rentang baris, respons langsung, atau referensi yang dipublikasikan.
Tesisnya, yang dinyatakan agar bisa dipalsukan
Sistem single-founder yang dibangun di Prato, Italia, menerapkan arsitektur pengambilan yang sesuai atau melebihi baseline produksi 2026 yang terdokumentasi untuk RAG perusahaan pada enam dari delapan dimensi yang dapat diukur — dan hal ini dilakukan di domain (regulasi Paspor Produk Digital Tekstil UE) di mana tidak ada sistem komersial serba guna yang memiliki kedalaman korpus yang sebanding.
Tes untuk memalsukannya: sebutkan produk RAG komersial yang (a) menolak menjawab pertanyaan tentang artikel regulasi yang tidak ada, (b) mengutip sumber dengan granularitas di bagian halaman berkas termasuk ID kontribusi institusional, dan (c) menjalankan pengambilan hibrida padat+jarang dengan bobot RRF yang dapat disetel secara langsung — secara bersamaan. Penulis penilaian ini tidak menemukan satupun pun. Satu contoh tandingan tunggal membatalkan klaim tersebut. Tidak ada yang diketahui.
Tiga mesin
Mesin 1 — RAG1 (Portal, FAISS). Indeks FAISS yang tidak terhubung udara yang melayani portal rantai pasok Reeco. Secara sengaja offline di VPS: keputusan desain adalah isolasi keamanan, bukan keterbatasan teknis. Catatan lingkup yang jujur: RAG1 tidak diuji langsung dalam penilaian ini; RAG1 dijelaskan secara arsitektural.
Mesin 2 — RAG2 (Reecopedia, produksi). Pipeline yang didukung Qdrant di atas korpus regulasi EU Green Deal (material ESPR, ECGT, CSRD, CIRPASS-2, dokumen kerja standar EN; 47.996 poin terindeks dalam koleksi produksi). Ini adalah mesin yang diuji secara langsung.
Engine 3 — Lapisan penelitian dan evaluasi pengambilan. Mesin interaksi akhir ColBERT v2 yang diindeks secara terpisah ditambah alat evaluasi: metrik RAGAS, set uji emas, protokol LLM-as-judge, dan perbandingan versi A/B (ab_eval_colbert.py, ragas_eval_v1_vs_v2.py, eval_e2e_ab_sonnet.py, bootstrap_gold_v2_sources.py). Pengambilan kontekstual — pola augmentasi chunk yang diterbitkan oleh Anthropic pada tahun 2024 — diimplementasikan saat dikonsumsi (contextual_retrieval.py).
Metodologi penelitian semacam ini — set emas, model juri, versi A/B — adalah praktik standar dalam tim ML yang beranggotakan dua puluh orang. Ini bukan praktik standar untuk sistem yang dibangun oleh satu orang.
Pipeline sepuluh fase adalah arsitektur, bukan pemasaran
RAG2 menjalankan pipeline sepuluh fase yang terdokumentasi per query: konfigurasi berbasis audit berdasarkan peran (lima tingkat akses, konfigurasi dilayani audit-first dengan cadangan lingkungan dan cache 60 detik); perencanaan query yang menghasilkan reformulasi step-back, sub-query, kata kunci, dan teks HyDE; multi-embedding hingga enam varian query termasuk bridge Italia-ke-Inggris; penyaringan metadata bersyarat dengan lingkup dokumen dengan percobaan ulang otomatis tanpa filter; pengambilan multi-dengan penggabungan Reciprocal Rank Fusion dan rekonstruksi tabel (±10 chunk berdekatan, cakupan dokumen); routing niat tabel (campuran tabel-ke-teks 60/40 saat classifier mendeteksi niat tabel); reperingkat dengan empat backend yang dapat diubah (cross-encoder, NLI/DeBERTa, Jina v3, deterministik); kompresi kontekstual yang diatur oleh peran; pemantauan skor dengan peringatan drift yang menandakan pengambilan ulang; dan pemrosesan pasca yang menormalkan sitasi dan mengekstrak tabel serta angka sebagai output terstruktur.
Sebagian besar sistem komersial mengekspos tiga fase: menginget, mengambil, menghasilkan. Perbedaannya bukan sekadar kosmetik — setiap fase tambahan adalah mode kegagalan yang ditangani.
Pengambilan hibrida: hidup, teratur, sadar koleksi
Pengambilan hibrida dense+BM25 — konfigurasi yang diidentifikasi oleh tolok ukur 2026 sebagai baseline produksi, bernilai +5–15% nDCG pada korpus legal dan teknis (BEIR/MIRACL) — diimplementasikan dan aktif dalam rag2_service.py: vektor padat dan jarang bernama di Qdrant, bobot prefetch RRF yang dapat dikonfigurasi saat runtime melalui panel audit (default 0.7 padat / 0.3 sparse), sebuah kill switch tingkat audit (hybrid_search_enabled), dan pemeriksaan kemampuan per koleksi yang menurun dengan anggun menjadi hanya padat ketika koleksi tidak memiliki vektor jarang. Komentar sumber menyebut BEIR dan MIRACL secara langsung. Ini bukan sistem yang menemukan pengambilan hibrida dari tutorial.
Uji adversarial: mesin menolak barang palsu
Uji langsung, tingkat Superadmin, 9 Juni 2026. Permintaan tersebut meminta "ambang batas tepat kandungan daur ulang berdasarkan Pasal 7 ESPR delegated act untuk tekstil" — premis yang sengaja dibuat-buat: textile delegated act belum final, dan tidak ada ambang batas seperti itu.
Respons mesin tersebut, secara verbatim dalam bagian kritisnya: "Korpus yang diindeks tidak memuat ambang batas numerik tertentu berdasarkan Pasal 7 [...] tidak dapat dikutip dari sumber yang tersedia tanpa risiko pemalsuan. Ini adalah perbedaan penting: Saya tidak akan menciptakan persentase atau sub-paragraf artikel yang tidak ada dalam dokumen yang diindeks." Kemudian beralih ke apa yang dikonfirmasi korpus — Pasal 5(3) ESPR sebagai dasar hukum nyata untuk persyaratan ecodesign — dengan kutipan pada tingkat detail tabel halaman berkas (Answers_Com_Work_Doc_2nd_Mil.pdf | p.413 | § Table 40).
Pembungkus LLM serbaguna yang diajukan pertanyaan yang sama akan paling masuk akal menghasilkan persentase. Ambang batas yang secara statistik masuk akal adalah persis yang dihasilkan model bahasa ketika tidak dibatasi. Dalam domain kepatuhan, jawaban salah yang percaya diri bukanlah jawaban yang menurun — itu adalah peristiwa tanggung jawab. Penolakan adalah produknya.
Perilaku ini konsisten dengan tolok ukur yang didokumentasikan secara publik (penolakan 20/20 pada set adversarial tiga kategori: ketentuan yang tidak ada, premis kebenaran parsial, kontrol), yang diterbitkan dengan metodologi di stefanocipri.substack.com ("RAG yang mengatakan Saya tidak tahu", April 2026), di mana mode kegagalan yang ditargetkannya dinamai: fabrikasi-berdasarkan komposisi.
Temuan berdasarkan dimensi
DimensiPosisi vs lanskap 2026 Bukti jangkaran Detail sitasi Tingkat atas (~5%)File + halaman + bagian + ID kontribusi institusional (misalnya bb6997ac), liveSpesifisitas domain (DPP tekstil)Tidak ada peer yang diketahui (~1%)Korpus proprietary: posisi CIRPASS-2, draf standar EN, aturan validator SEM006/TXT001–005Perilaku anti-halusinasiTingkat atas (~1–5%)Penolakan artikel yang dibuat secara langsung; benchmark adversarial yang diterbitkan 20/20Implementasi pengambilan hibridaAt frontierLive BM25+RRF yang padat, dapat diatur, kill switch audit, fallback sadar koleksiMetodologi evaluasiTingkat atas (~5%)RAGAS + set emas + LLM-sebagai-hakim + A/B berversi, operasi dalam repoMultilingualTingkat atas (~5%)30+ bahasa UI, aturan penegakan bahasa, jembatan embedding IT→ENTata kelola dan auditaTingkat atas (~5–15%)Konfigurasi per peran, runtime pertama audit, pemantauan drift, pencatatan skorPengindeksan inkrementalUnderbaselineKoleksi Jina hanya diisi batch; tidak ada ingest sesuai permintaan saat waktu kueri
Kejujuran metodologis tentang tabel ini: posisi persentil adalah estimasi kualitatif yang dihasilkan dengan membandingkan arsitektur yang diperiksa dengan deskripsi sistem yang dipublikasikan tahun 2026 (laporan hibrida-sebagai-baseline; publikasi win-rate agensi-RAG dalam rentang 64–76% dibandingkan asisten umum pada korporasi perusahaan; perbandingan akurasi pengambilan kerangka kerja pada pita 85–92%). Posisi tersebut bukan hasil dari lari benchmark head-to-head. Harness RAGAS dalam repo membuat run seperti itu dapat dieksekusi dan dipublikasikan; sampai dipublikasikan, tabel di atas adalah penilaian ahli, bukan pengukuran.
Apa yang belum dimiliki stack
Tiga celah, dinyatakan dengan jelas. Pertama, pengindeksan inkremental: koleksi Jina late-chunking diisi oleh skrip batch, bukan sesuai permintaan; dokumen baru menunggu input berikutnya. Kedua, angka benchmark formal sudah ada sebagai infrastruktur tetapi belum sebagai artefak yang dipublikasikan — langkah terkuat yang tersedia adalah menjalankan suite RAGAS dalam repo terhadap set emas dan mempublikasikan angka di samping metodologi. Ketiga, RAG1 tetap dinilai hanya berdasarkan arsitektur; kualitas pengambilannya tidak terdokumentasi di luar penggunaan internal.
Tidak ada yang struktural. Ketiganya adalah minggu, bukan kuartal.
Mengapa hal ini penting di luar satu perusahaan
Pasar 2026 dipenuhi dengan "asisten kepatuhan AI" yang hanya membungkus tipis model serbaguna: satu embedding per query, pengambilan hanya padat, kutipan tingkat nama file paling baik, tanpa tata kelola peran, tanpa pemantauan drift, dan — secara tegas — tanpa perilaku penolakan pada premis palsu. Para penetapnya standar sendiri mengakui kekurangan verifikasi yang ditutupi oleh alat-alat ini.
Sistem yang dinilai di sini membalik urutan konstruksi biasa. Sistem ini tidak dibangun oleh tim ML yang memperoleh pengetahuan domain; sistem ini dibangun oleh seorang ahli domain — tiga puluh tahun di rantai pasok tekstil internasional, seorang Anggota Ahli CIRPASS-2 (EWG1, EWG3), dan JRC Registered Stakeholder (Unit B5) — yang memperoleh rekayasa pengambilan. Korpus mengetahui apa itu Sertifikat Transaksi, kapan secara fisik tiba relatif terhadap pengiriman, dan mengapa metode pengujian komposisi serat ISO tidak dapat membedakan poliester daur ulang dari poliester murni. Pengetahuan itu ada dalam indeks karena orang yang membangun indeks tersebut menghabiskan tiga dekade untuk mempelajarinya.
Pipeline pengambilan dapat direplikasi dalam satu kuartal oleh tim yang didanai. Korpus dan penilaian yang terkodekan di dalamnya tidak bisa. Asimetri itu adalah aset yang dapat dipertahankan.
Reeco® adalah platform verifikasi DPP yang dibangun di atas UNTP 0.7.0 dan W3C Verifiable Credentials, dengan mesin massa keseimbangan per pakaian (deposit SIAE) yang bersifat proprietary. Reeco tidak menghalangi penerbitan DPP: mesin ini mengukur cakupan dan menginformasikan merek, yang tetap memiliki keputusan otonom — secara desain. Stefano Cipriani adalah pendiri Reeco®, Anggota Ahli CIRPASS-2 (EWG1, EWG3), Pemangku Kepentingan Terdaftar JRC.