Finware
  • Beranda
  • Riwayat
  • Disimpan
  • Feed
  • Topik Pilihan
  • News
  • Market
  • Bisnis
  • Kripto
  • Tech
Notification
FinwareFinware
  • News
  • Market
  • Bisnis
  • Kripto
  • Tech
Search
  • Quick Access
    • Beranda
    • Contact Us
    • Riwayat
    • Disimpan
    • Topik Pilihan
    • Feed
  • Categories
    • News
    • Market
    • Bisnis
    • Kripto
    • Tech

Artikel Populer

Jangan lewatkan artikel menarik lainnya
Indonesia Terancam Tertinggal dalam Euforia EV, Sebagian Besar Nikel Dialihkan ke Baja Tahan Karat, Temuan Riset Mengungkap

Indonesia Terancam Tertinggal dalam Euforia EV, Sebagian Besar Nikel Dialihkan ke Baja Tahan Karat, Temuan Riset Mengungkap

Reihan
19 April 2026
Oracle Satukan Data AI untuk Berikan Agensi Perusahaan Satu Versi Kebenaran

Oracle Satukan Data AI untuk Perusahaan Agensi Single Version of Truth

Keenan
26 Maret 2026
Aksi Saham Terbesar Siang Ini: META, BBY, APP, SMG Siap Mengguncang Pasar!

Aksi Saham Terbesar Siang Ini: META, BBY, APP, SMG Siap Mengguncang Pasar!

Dirga
27 Maret 2026
© 2026 Finware Media. All Right Reserved.
Finware > Bisnis > Menekan Biaya Inference RAG hingga 6 Kali Lipat: Mulai dari Menentukan Data yang Tak Masuk ke LLM
Bisnis

Menekan Biaya Inference RAG hingga 6 Kali Lipat: Mulai dari Menentukan Data yang Tak Masuk ke LLM

Keenan
Last updated: 17 Agustus 2026 8:41 PM
By
Keenan
8 Min Read
Share
Menekan Biaya Inference RAG hingga 6 Kali Lipat: Mulai dari Menentukan Data yang Tak Masuk ke LLM
SHARE

Banyak tim yang sedang mengembangkan sistem retrieval augmented generation (RAG) untuk klasifikasi yang berisiko tinggi mengambil keputusan arsitektur yang sama: mengarahkan setiap kasus ambigu langsung ke model bahasa dan mengandalkan konteks yang diambil untuk menyelesaikan masalah. Konsep ini mungkin terlihat baik pada demo, namun semuanya bisa berantakan ketika sistem harus menghadapi audit atau ditanya oleh regulator mengenai mengapa keputusan tertentu diambil enam bulan lalu.

Table of Content
  • Biaya tersembunyi dari jalur LLM yang semuanya
  • Pendekatan cascade
  • Mendesain prompt untuk risiko asimetris
  • Menilai sistem seperti ini dengan tepat
  • Pelajaran yang Lebih Luas

Selama setahun terakhir, banyak tim membangun sistem klasifikasi berbasis RAG dalam konteks bisnis yang diatur, dimana biaya untuk jawaban yang salah bukan hanya sekadar respons chatbot yang buruk. Setiap keputusan harus dapat dipertanggungjawabkan dalam jangka waktu yang lama setelah model menghasilkan jawabannya. Lingkungan seperti ini memaksa adanya filosofi desain yang berbeda dari kebanyakan konten teknik AI yang ada saat ini.

Berikut ini yang berubah ketika Anda tidak dapat bersikap probabilistik pada segalanya, dan bagaimana arsitektur cascade dapat menyelesaikannya.

Biaya tersembunyi dari jalur LLM yang semuanya

Daya tarik dari mengarahkan segalanya melalui model bahasa besar (LLM) jelas: lebih sedikit bagian yang bergerak, iterasi lebih cepat, dan model mampu menangani kasus yang tidak terduga. Namun, masalahnya akan muncul kemudian di tiga aspek.

Pertama, auditabilitas. “Model memutuskan berdasarkan konteks yang diambil” bukanlah jawaban yang dapat diterima. Anda memerlukan jalur keputusan yang dapat direkonstruksi oleh manusia tanpa harus menjalankan lagi inferensi dan berharap mendapat output yang sama.

Kedua, biaya seiring pertumbuhan. Jika sistem Anda memproses puluhan ribu kasus sehari dan setiap kasus menyentuh panggilan LLM dengan beberapa dokumen yang diambil sebagai konteks, tagihan inferensi dan latensi Anda akan meningkat seiring volume, berbeda dengan logika berbasis aturan yang tidak demikian.

Read more  Ketika Manajer Produk Meluncurkan Kode: AI Mengubah Struktur Organisasi Perangkat Lunak!

Ketiga, dan yang jarang dibicarakan, adalah drift model pada kasus yang mudah. LLM sangat baik dalam keputusan yang bernuansa. Mereka sering tidak konsisten, dalam cara yang sulit dideteksi, pada kasus yang seharusnya memiliki jawaban deterministik. Pencocokan yang jelas terhadap kriteria yang dikenal tidak boleh bergantung pada suasana hati model bahasa.

Pendekatan cascade

Solusinya: berhenti memperlakukan LLM sebagai garis depan dan mulai memperlakukannya sebagai jalur eskalasi. Dalam praktiknya, ini berarti pipeline tiga tahap.

Tahap pertama adalah deterministik. Pencocokan yang tepat, perbandingan field terstruktur, dan apa pun yang memiliki aturan jelas diselesaikan di sini tanpa panggilan model sama sekali. Tahap ini harus menyelesaikan sebagian besar volume, sering kali lebih dari setengahnya tergantung pada kualitas data Anda, dan setiap keputusan sepenuhnya dapat dijelaskan karena merupakan pencarian, bukan inferensi.

Tahap kedua adalah di mana pengambilan bukti mendapatkan perannya. Bagi kasus yang berhasil melalui tahap satu — dan maksud saya bertahan adalah bahwa mereka tidak jelas diselesaikan — Anda membangun lapisan pengambilan yang menarik bukti spesifik yang relevan dengan ambiguitas tersebut: keputusan peninjau sebelumnya pada kasus serupa, dokumen kontekstual yang menjelaskan konflik yang apparent, atau preseden sejarah yang menjernihkan kasus pinggiran. Langkah pengambilan lebih penting daripada langkah generasi di sini. Jika Anda mengambil konteks yang salah, bahkan model bahasa terbaik di dunia sekalipun akan menghasilkan jawaban salah yang tampak meyakinkan dan terfikirkan dengan baik.

Tahap ketiga adalah panggilan LLM, dan seharusnya hanya melihat sisa yang tidak dapat diselesaikan oleh tahap satu dan dua. Ini adalah aspek yang sering dilewatkan ketika mendesain versi pertama, dan ini adalah pengungkit terbesar untuk biaya dan kualitas. Dalam satu sistem yang saya kerjakan, mengarahkan hanya 10 hingga 15% kasus yang benar-benar ambigu ke LLM mengurangi biaya inferensi sekitar 6X dibandingkan baseline LLM penuh, sekaligus meningkatkan konsistensi pada mayoritas deterministik menjadi efektif sempurna.

Read more  Tiana Sumanasekera, Mantan Atlet Olimpiade AS, Siap Wakili Sri Lanka di Panggung Internasional

Mendesain prompt untuk risiko asimetris

Setelah sebuah kasus sampai di tahap LLM, sebagian besar tim akan menggunakan prompt netral: “Tentukan apakah kasus ini harus disetujui atau ditandai.” Pemaknaan ini kurang tepat untuk klasifikasi berisiko tinggi karena biaya dari dua jenis kesalahan tersebut tidak simetris. Mengabaikan sesuatu yang benar-benar memerlukan perhatian bisa berakibat serius, sementara salah menandai sesuatu yang baik hanya menguras waktu peninjau dan menyebabkan keterlambatan. Dua hasil ini jarang sama buruknya, namun prompt netral meminta model untuk memperlakukan keduanya seolah-olah sama.

Prompt risiko asimetris menjadikan tradeoff ini eksplisit kepada model alih-alih membiarkannya menebak toleransi risiko Anda. Secara konkret, ini berarti menginstruksikan model untuk memperlakukan ketidakpastian sebagai alasan untuk eskalasi, memberikan contoh terukur dari kedua jenis kesalahan dengan konsekuensi yang dijelaskan, dan meminta skor kepercayaan bersamaan dengan klasifikasi alih-alih jawaban biner. Skor kepercayaan menjadi titik cascade kedua Anda: apa pun yang berada di bawah ambang tertentu diarahkan kepada peninjau manusia alih-alih diselesaikan secara otomatis, terlepas dari apa yang dikatakan klasifikasi model.

Ini mungkin terdengar seperti detail kecil dalam rekayasa prompt. Namun, dalam praktiknya, ini adalah perbedaan antara sistem yang mengurangi beban kerja peninjau dan satu yang diam-diam meningkatkan risiko sambil terlihat seolah-olah berfungsi dengan baik.

Menilai sistem seperti ini dengan tepat

Metrik evaluasi RAG standar tidak dibangun dengan kasus penggunaan ini dalam pikiran, dan menggunakannya tanpa penyesuaian akan memberikan rasa percaya diri yang salah. Ada beberapa penyesuaian yang perlu diperhatikan.

Kualitas pengambilan perlu diukur terpisah dari akurasi klasifikasi akhir. Sebuah sistem dapat memiliki skor peringkat pengambilan yang sangat baik dan tetap membuat keputusan akhir yang buruk jika langkah generasi memperberat bukti secara tidak tepat. Lacak mereka secara independen.

Set data evaluasi Anda perlu melakukan oversampling secara deliberatif pada kasus yang mencapai tahap ketiga, karena itu adalah di mana penilaian sistem Anda benar-benar diuji. Jika set evaluasi Anda mencerminkan distribusi produksi Anda, itu akan didominasi oleh kasus deterministik yang sudah ditangani dengan baik oleh cascade Anda, dan Anda akan buta terhadap kegagalan yang paling penting.

Read more  Pendiri Manfaatkan Putusan Pengadilan India untuk Kembali Mengkritik Bisnis Iklan Google

Evaluasi LLM sebagai hakim bekerja untuk domain ini tapi hanya jika prompt hakim menyimpan pemaknaan risiko asimetris yang sama dengan prompt produksi Anda. Seorang hakim yang memperlakukan kedua jenis kesalahan secara setara akan secara sistematis mendukung tradeoff yang salah saat Anda menyetel sistem.

Akhirnya, bangunlah umpan balik dari hasil yang dikonfirmasi kembali ke dalam corpus pengambilan Anda. Ketika seorang peninjau manusia membatalkan keputusan model, kasus tersebut dan resolusi yang benar harus menjadi konteks yang dapat diambil untuk kasus serupa di masa depan. Tanpa ini, penanganan kasus ambigu oleh sistem Anda tidak akan pernah membaik; ia hanya akan terus membuat jenis kesalahan yang sama dengan tingkat yang sama.

Pelajaran yang Lebih Luas

Insting untuk memilih model yang paling mampu untuk setiap keputusan sangat dapat dipahami, namun dalam domain di mana jawaban yang salah memiliki konsekuensi nyata, pekerjaan rekayasa yang lebih berharga adalah menentukan bagian mana yang seharusnya tidak pernah menyentuh model sama sekali. Arsitektur cascade bukanlah solusi sementara untuk keterbatasan LLM. Ini adalah apa yang tampak seperti sistem RAG yang matang setelah Anda benar-benar harus mempertahankan keputusan terhadap seseorang yang tugasnya adalah menemukan celah dalam logika Anda.

Jika Anda sedang membangun sistem AI untuk domain yang diatur atau berisiko tinggi, pertanyaan yang patut diajukan sebelum menulis satu prompt pun bukanlah “Bagaimana agar model dapat menangani ini dengan baik,” tetapi “Bagian mana dari keputusan ini yang seharusnya tidak pernah menjadi tanggung jawab model?”

Share This Article
Facebook Whatsapp Whatsapp LinkedIn Telegram Threads Copy Link
Avatar photo
ByKeenan
Artikel eksklusif dari Keenan Prawira seputar tren bisnis terbaru, pendanaan startup, dan aksi korporasi. Insight esensial untuk para pemimpin bisnis modern.
Previous Article Biaya Tersembunyi Krisis RAM: Kenapa Kenaikan Harga Memori Mungkin Bukan Satu-satunya Tantangan Upgrade PC Anda Biaya Tersembunyi Krisis RAM: Kenapa Kenaikan Harga Memori Mungkin Bukan Satu-satunya Tantangan Upgrade PC Anda
Next Article Perekonomian Thailand Tembus Perkiraan di Kuartal II, Prospek Tahun Penuh Kian Cerah! Perekonomian Thailand Tembus Perkiraan di Kuartal II, Prospek Tahun Penuh Kian Cerah!
- Advertisement -
Ad image

Don't Miss

BlackRock Turunkan Minimum Konversi IBIT In-Kind Menjadi $1 Juta
BlackRock Turunkan Minimum Konversi IBIT In-Kind Menjadi $1 Juta
Kripto
Berkshire Hathaway Pindahkan Alphabet ke Tiga Posisi Teratas, Tingkatkan Investasi Delta dan Sektor Perumahan
Berkshire Hathaway Pindahkan Alphabet ke Tiga Posisi Teratas, Tingkatkan Investasi Delta dan Sektor Perumahan
News
DeepSeek V4 Flash: Harga Melonjak, Namun Kinerja di Tugas Nyata Terhambat
DeepSeek V4 Flash: Harga Melonjak, Namun Kinerja di Tugas Nyata Terhambat
Bisnis
- Advertisement -
Ad image

Baca Juga

Jelajahi insight lain yang sejalan dengan artikel ini!
Model memori MeMo memungkinkan tim tingkatkan LLM tanpa perlu pelatihan ulang — kinerja melonjak 26%!
Bisnis

Model memori MeMo memungkinkan tim tingkatkan LLM tanpa perlu pelatihan ulang — kinerja melonjak 26%!

Keenan
31 Mei 2026
Apple Buka Peluang Persaingan Baru di App Store Brasil
Bisnis

Apple Buka Peluang Persaingan Baru di App Store Brasil

Keenan
18 Juni 2026
Strategi Membangun Ketahanan Finansial untuk Solopreneur
Bisnis

Strategi Membangun Ketahanan Finansial untuk Solopreneur

Keenan
6 April 2026
Wikipedia Batasi Penggunaan AI dalam Penulisan Artikel
Bisnis

Wikipedia Batasi Penggunaan AI dalam Penulisan Artikel

Keenan
27 Maret 2026
Airbound India Mengumpulkan $37 Juta untuk Tantang Truk dengan Drone Seperti Roket
Bisnis

Airbound India Mengumpulkan $37 Juta untuk Tantang Truk dengan Drone Seperti Roket

Keenan
25 Agustus 2026
Kerangka Optimalisasi AI Baru Mampu Unggul 2,5x atas Claude Code dan Codex dengan Anggaran Komputasi yang Sama
Bisnis

Kerangka Optimalisasi AI Baru Mampu Unggul 2,5x atas Claude Code dan Codex dengan Anggaran Komputasi yang Sama

Keenan
19 Juni 2026
Peneliti Berhasil Latih Model Dasar dari Awal dengan Biaya Hanya $1.500
Bisnis

Peneliti Berhasil Latih Model Dasar dari Awal dengan Biaya Hanya $1.500

Keenan
11 Juni 2026
Glance dan Samsung Kolaborasi Ciptakan Belanja Pintar Berbasis AI di TV
Bisnis

Glance dan Samsung Kolaborasi Ciptakan Belanja Pintar Berbasis AI di TV

Keenan
7 Juli 2026
Show More
- Advertisement -
Ad image
- Advertisement -
Ad image
Finware

Baca berita keuangan global real-time, insight market APAC, tren bisnis, dan crypto paling komprehensif. Curi start sebelum market bergerak.

  • Kanal:
  • Bisnis
  • Market
  • Tech
  • Kripto

Personal

  • Riwayat
  • Disimpan
  • Feed
  • Topik Pilihan

Tentang Kami

  • Beranda
  • Hubungi Kami

© 2026 Finware Media. All Right Reserved.

Welcome Back!

Sign in to your account

Username or Email Address
Password

Lost your password?