Finware
  • Beranda
  • Riwayat
  • Disimpan
  • Feed
  • Topik Pilihan
  • News
  • Market
  • Bisnis
  • Kripto
  • Tech
Notification
FinwareFinware
  • News
  • Market
  • Bisnis
  • Kripto
  • Tech
Search
  • Quick Access
    • Beranda
    • Contact Us
    • Riwayat
    • Disimpan
    • Topik Pilihan
    • Feed
  • Categories
    • News
    • Market
    • Bisnis
    • Kripto
    • Tech

Artikel Populer

Jangan lewatkan artikel menarik lainnya
Indonesia Terancam Tertinggal dalam Euforia EV, Sebagian Besar Nikel Dialihkan ke Baja Tahan Karat, Temuan Riset Mengungkap

Indonesia Terancam Tertinggal dalam Euforia EV, Sebagian Besar Nikel Dialihkan ke Baja Tahan Karat, Temuan Riset Mengungkap

Reihan
19 April 2026
Oracle Satukan Data AI untuk Berikan Agensi Perusahaan Satu Versi Kebenaran

Oracle Satukan Data AI untuk Perusahaan Agensi Single Version of Truth

Keenan
26 Maret 2026
Aksi Saham Terbesar Siang Ini: META, BBY, APP, SMG Siap Mengguncang Pasar!

Aksi Saham Terbesar Siang Ini: META, BBY, APP, SMG Siap Mengguncang Pasar!

Dirga
27 Maret 2026
© 2026 Finware Media. All Right Reserved.
Finware > Bisnis > Perusahaan yang Gunakan Berbagai Model AI Cenderung Meremehkan Tingkat Kegagalan Hingga 2,25 Kali Lipat
Bisnis

Perusahaan yang Gunakan Berbagai Model AI Cenderung Meremehkan Tingkat Kegagalan Hingga 2,25 Kali Lipat

Keenan
Last updated: 10 Juli 2026 5:49 PM
By
Keenan
10 Min Read
Share
Perusahaan yang Gunakan Berbagai Model AI Cenderung Meremehkan Tingkat Kegagalan Hingga 2,25 Kali Lipat
SHARE

Sebuah studi terbaru telah menemukan bahwa anggapan tentang model-model yang berbeda dapat saling mengisi kekurangan satu sama lain adalah salah besar. Penelitian ini mengevaluasi 67 model dari 21 penyedia dan menunjukkan bahwa kelemahan tersebut memiliki nama: batas kegagalan bersama (co-failure ceiling).

Table of Content
  • Biaya Tersembunyi dari Strategi Multi-Model
  • Kenapa Matematika Ini Gagal: Batas Kegagalan Bersama
  • Pemeriksaan Kelayakan Pra-Penempatan $0

Anggapan ini beroperasi dengan cara begini: selama dua model tidak sering gagal pada pertanyaan yang sama, menggabungkan keduanya seharusnya menciptakan jaringan pengaman terhadap kegagalan. Namun, batas sebenarnya dari pengaturan model bukanlah seberapa sering model-model berbeda, melainkan persentase pertanyaan di mana setiap model memberikan jawaban salah secara bersamaan. Dengan mengabaikan batas kegagalan bersama ini, perusahaan menghabiskan biaya untuk membangun infrastruktur pengalihan yang rumit dan mahal demi mengejar peningkatan kinerja yang mungkin tidak ada. Beruntung, pengembang bisa menggunakan matematika yang sama untuk membuat tes gratis yang menentukan kapan pengaturan multi-model sebenarnya akan membuahkan hasil.

Biaya Tersembunyi dari Strategi Multi-Model

Untuk mengatur beberapa model bahasa, pengembang biasanya mengandalkan tiga arsitektur. Pengalihan model berfungsi seperti petugas lalu lintas, mengarahkan pertanyaan kompleks ke model-model mahal dan pertanyaan sederhana ke model-model yang lebih murah. Arsitektur cascades mengirim setiap pertanyaan ke model murah terlebih dahulu, hanya beralih ke model premium jika sistem awal menunjukkan tingkat kepercayaan rendah. Pendekatan seperti Mixture-of-Agents (MoA) menggabungkan beberapa model dengan memberikan pertanyaan yang sama dan menghasilkan jawaban yang disintesis dari output gabungan mereka.

Namun, arsitektur ini membawa “harga bayangan” pada biaya inferensi. Setiap kali tim pengembang menerapkan pengalihan atau cascade, mereka membayar biaya tambahan dalam bentuk latensi sistem, pemeliharaan infrastruktur yang rumit, dan meningkatnya risiko pengelolaan di berbagai penyedia API.

Untuk membenarkan biaya operasional ini, para engineer biasanya mengandalkan “korelasi kesalahan pasangan” dalam memilih kumpulan model mereka. Bayangkan seorang pengembang memiliki Model A yang sangat baik dalam menulis kode Python namun gagal dalam SQL, dan Model B yang piawai dalam SQL tetapi kesulitan di Python. Karena keduanya gagal pada jenis pertanyaan yang berbeda, korelasi kesalahan pasangan mereka rendah. Pengembang berpikir dengan menempatkan lapisan pengalih di depan, mereka telah menciptakan sistem komposit yang jarang gagal.

Read more  Kenapa Kami Berinvestasi dalam Terapi Setiap 7 hingga 10 Hari untuk Meningkatkan Kinerja Bisnis?

Akan tetapi, menurut studi tersebut, menggabungkan model yang beragam berdasarkan korelasi rendah justru dapat merugikan kinerja jika model-model tersebut tidak memiliki kemampuan yang sama. Ketika suara diambil dari model-model yang beragam tetapi tidak setara, model yang lebih lemah sering kali akan mendominasi dan mengesampingkan yang paling pintar. Josef Chen, penulis paper tersebut, mengungkapkan bahwa dalam eksperimen mereka, “Pemungutan suara mayoritas yang naif di antara model-model yang tidak setara menghasilkan keuntungan rata-rata negatif.” Nasihat yang tepat untuk para pengembang adalah “mengombinasikan hanya model-model dalam rentang kualitas yang sebanding.” Jika tidak bisa mencocokkan kualitas, lebih baik ambil model tunggal yang terbaik dan gunakan anggaran untuk itu.

Paper tersebut memberikan satu titik terang untuk pendekatan ini terkait arsitektur MoA. Ketika membangun ansambel, tim sering menggunakan “Self-MoA,” di mana mereka mengajukan pertanyaan yang sama kepada model premium berkali-kali untuk menghasilkan jawaban sintetis. Peneliti mencatat bahwa pada kualitas yang sebanding, membangun ansambel beragam dengan korelasi pasangan yang rendah dapat mengalahkan setup Self-MoA dengan korelasi tinggi.

Namun, ketika tim menggunakan metrik korelasi pasangan yang sama untuk memprediksi akurasi absolut sistem keseluruhan mereka, matematika pembuktian ini menjadi tidak akurat.

Kenapa Matematika Ini Gagal: Batas Kegagalan Bersama

Temuan utama studi terletak pada metrik yang dinamakan “angka kegagalan bersama” — istilah formal untuk skenario di mana semua model gagal. Tidak ada pengalihan, sistem pemungutan suara, atau cascade yang bisa mencapai akurasi lebih tinggi dari batas yang mereka tetapkan sendiri.

Pooled coding, logika, dan generalist menunjukkan korelasi pasangan yang rendah pada pertanyaan rutin — mereka jarang gagal bersamaan. Namun batas kegagalan bersama ini merepresentasikan kasus kompleks yang mendorong melewati batas arsitektur AI saat ini. Jika sebuah pertanyaan begitu sulit sehingga ketiga model berhalusinasi atau gagal, maka tidak peduli seberapa cermat pengalihan mendistribusikan tugas, seluruh kumpulan akan gagal secara bersamaan.

Para peneliti menguji kumpulan 67 model mereka, termasuk GPT-5.5, Claude Opus 4.8, dan Gemini 3.1 Pro, pada benchmark matematika terbuka MATH-500. Berdasarkan korelasi pasangan yang standar, model-model statistik memprediksi bahwa seluruh kumpulan hanya akan gagal bersamaan pada 2.3% dari pertanyaan. Namun kenyataannya, tingkat kegagalan bersama mencapai 5.2%.

Read more  'Pembatasan Terbesar dalam Perkembangan AI Dorong ETF DRAM Capai Rekor Baru'

Metrik korelasi standar meremehkan tingkat kegagalan sekitar 2.25 kali. Masalahnya bukan sekedar kesulitan yang independen, tetapi titik kegagalan yang sama.

Peneliti juga menemukan bahwa format tugas langsung memicu kegagalan bersama. Ketika mereka mengambil pertanyaan sains tingkat pascasarjana dari benchmark GPQA dan mengubahnya dari format pilihan ganda menjadi format jawaban terbuka, proporsi kegagalan meningkat menjadi 12.7%.

Namun, pengembang bisa merancang solusi untuk menghindari batas ini. “Implikasi teknik agak tidak nyaman: pengaturan multi-model buy dengan biaya terendah pada area yang diinginkan, seperti generasi terbuka,” kata Chen. “Di mana saja Anda dapat mengubah generasi menjadi verifikasi atau pemilihan terbatas (output terstruktur, jawaban yang dapat diperiksa, tes eksekusi), Anda membuka kembali batas tersebut.”

Akhirnya, penelitian ini menemukan bahwa batas ini membatasi aplikasi AI dengan dua cara berbeda, tergantung pada domain:

  • Lingkungan dengan batas (misalnya, matematika terbuka): Tingkat kegagalan bersama tinggi. Tugas terlalu sulit, dan semua model gagal secara bersamaan. Tidak peduli berapa banyak pengalihan yang ada, tidak ada kemampuan mendasar untuk menghadapinya.

  • Lingkungan terikat realisasi (misalnya, sains tingkat pascasarjana): Tingkat kegagalan bersama mendekati nol, artinya setidaknya satu model dalam kumpulan biasanya tahu jawabannya. Namun, model-model tersebut sering tidak sepakat sehingga lapisan pengalihan tidak dapat dengan andal memilih jawaban yang benar tanpa orakel yang tahu segalanya.

Pemeriksaan Kelayakan Pra-Penempatan $0

Sebelum mendedikasikan waktu engineering untuk membangun pengalihan, tim bisa menghitung batas performa absolut mereka secara gratis menggunakan rumus matematika yang disebut batas Clopper-Pearson.

Batas Clopper-Pearson berfungsi sebagai kalkulator skenario terburuk. Jika Anda melempar koin sepuluh kali dan mendapatkan delapan kepala, Anda tidak bisa menjamin koin itu akan selalu menunjukkan kepala 80% dari waktu. Batas ini mengambil sampel kecil dari pertanyaan uji dan memberi output batas matematis yang dijamin.

Jika diterapkan pada model bahasa, katakanlah tim menguji kumpulan lima agen pada 50 sample pertanyaan dan menemukan mereka semua gagal bersamaan hanya pada dua pertanyaan. Seorang pengembang mungkin mengira bahwa sistem multi-agen mereka akan mencapai akurasi 96% dalam produksi. Namun, rumus Clopper-Pearson melakukan koreksi terhadap optimisme itu. Ia menganalisis ukuran sampel kecil dan memberikan jaminan matematis bahwa tingkat kegagalan sebenarnya bisa setinggi 12%.

Read more  Siapa Saja Pemeran ‘Perfect Match’ Season 4? Temui 20 Jomblo Mencari Cinta!

Untuk menerapkannya, perusahaan harus membangun dataset yang terpisah. Sebuah perusahaan fintech, misalnya, bisa mengambil 200 tiket dukungan pelanggan yang kompleks dari kuartal sebelumnya dan meminta agen manusia menulis resolusi yang sempurna sebagai tolok ukur. Meskipun ini terdengar seperti proyek manual yang berat, tim engineering yang matang bisa mengotomasi seluruh perhitungan batas tersebut.

Integrasinya cukup sederhana: itu adalah pekerjaan penghitungan terhadap log eval yang sudah diproduksi tim. Jadi bisa dilakukan di tahap CI yang sama dengan suite evaluasi dan akan dipicu ulang setiap kali kumpulan model atau beban kerja berubah.

Tim engineering kemudian menjalankan model-model kandidat mereka terhadap 200 tiket ini sekali dan mencatat hasilnya. Ketika mereka ingin mengevaluasi konfigurasi multi-model, mereka bisa menggunakan metrik tingkat kegagalan bersama untuk memprediksi akurasi maksimum yang bisa mereka capai dari sistem tanpa menjalankan kueri tambahan.

Kesimpulan penting dari studi ini adalah bahwa pada tugas di mana jawaban bisa diperiksa dengan pasti, menggabungkan model jarang mengalahkan penggunaan model terbaik tunggal di pasar, kecuali tim memiliki sinyal pengalihan pada tingkat kueri yang sangat kuat.

Dalam lingkungan bisnis, tugas yang bisa diperiksa secara definitif memiliki jawaban yang objektif dan tanpa toleransi terhadap kesalahan. Ini termasuk menghasilkan kueri SQL yang harus dieksekusi tanpa kesalahan, mengekstrak total faktur tertentu dari PDF 50 halaman, atau memformat payload JSON yang sesuai dengan skema yang ketat. Untuk tugas-tugas ini, umumnya perusahaan lebih baik membayar premium untuk model frontier yang paling pintar daripada menggabungkan tiga model lebih murah dan berharap pengalihan memilih output yang benar.

Karena pemeriksaan matematis ini gratis, tim perusahaan bisa melacak tingkat kegagalan mereka sendiri seiring dengan munculnya model-model baru.

“Pengukuran ini tidak memerlukan biaya, jadi tim mana pun bisa melacak tingkat kegagalan mereka sendiri di antara generasi model dan melihat apakah batas tersebut mendekati,” kata Chen. Akhirnya, “yang bisa mereka kendalikan adalah heterogenitas cara-cara gagal dan perputaran pasar, bukan jumlah model.”

TAGGED:breaking
Share This Article
Facebook Whatsapp Whatsapp LinkedIn Telegram Threads Copy Link
Avatar photo
ByKeenan
Artikel eksklusif dari Keenan Prawira seputar tren bisnis terbaru, pendanaan startup, dan aksi korporasi. Insight esensial untuk para pemimpin bisnis modern.
Previous Article Memahami 'AI Work Slop': Cara Bisnis Inggris Melindungi Diri dari Risiko Memahami ‘AI Work Slop’: Cara Bisnis Inggris Melindungi Diri dari Risiko
Next Article Belanja Konsumen Jadi Pilar Utama Vietnam Raih Pertumbuhan Dua Digit Belanja Konsumen Jadi Pilar Utama Vietnam Raih Pertumbuhan Dua Digit
- Advertisement -
Ad image

Don't Miss

Pengumuman dari Kementerian Keuangan Picu Lonjakan Harga Emas dan Bitcoin Pekan Ini
Pengumuman dari Kementerian Keuangan Picu Lonjakan Harga Emas dan Bitcoin Pekan Ini
Market
China Serukan Kedaulatan Digital di Tengah Tekanan AS Terhadap Negara-Negara soal AI
China Serukan Kedaulatan Digital di Tengah Tekanan AS Terhadap Negara-Negara soal AI
Kripto
Siapa Saja Pemimpin di Balik Model ‘Stealth’ Ox Alpha yang Baru?
Siapa Saja Pemimpin di Balik Model ‘Stealth’ Ox Alpha yang Baru?
Bisnis
- Advertisement -
Ad image

Baca Juga

Jelajahi insight lain yang sejalan dengan artikel ini!
Apa yang Perlu Anda Ketahui Menjelang Keputusan Suku Bunga Terbaru The Fed Rabu Ini
News

Apa yang Perlu Anda Ketahui Menjelang Keputusan Suku Bunga Terbaru The Fed Rabu Ini

Dirga
29 April 2026
Aliran ETF Obligasi Melonjak 60%, Menurut Eksekutif BlackRock
News

Aliran ETF Obligasi Melonjak 60%, Menurut Eksekutif BlackRock

Dirga
26 Juni 2026
Tech

NYT Mengungkap Petunjuk dan Jawaban untuk Minggu, 14 Juni (Game #833)

Keenan
14 Juni 2026
Tech

NYT Rilis Petunjuk Menarik untuk Game Maut Sabtu, 16 Mei (Game #804)

Keenan
16 Mei 2026
Meta Siap Bersaing di Era AI: Pembangunan Infrastruktur Baru Butuh Waktu 20 Bulan, Kata VP Infrastruktur
Bisnis

Meta Siap Bersaing di Era AI: Pembangunan Infrastruktur Baru Butuh Waktu 20 Bulan, Kata VP Infrastruktur

Keenan
15 Juli 2026
Agen AI Enterprise Ciptakan Silo Data, Microsoft Hadirkan Solusi Microsoft IQ dan Rayfin di Build
Bisnis

Agen AI Enterprise Ciptakan Silo Data, Microsoft Hadirkan Solusi Microsoft IQ dan Rayfin di Build

Keenan
4 Juni 2026
ScaleOps Raih $130 Juta untuk Tingkatkan Efisiensi Komputasi di Tengah Permintaan AI yang Melonjak
Bisnis

ScaleOps Raih $130 Juta untuk Tingkatkan Efisiensi Komputasi di Tengah Permintaan AI yang Melonjak

Keenan
30 Maret 2026
Cohere Luncurkan Agen Pengkodean Open Source yang Bekerja di Satu H100
Bisnis

Cohere Luncurkan Agen Pengkodean Open Source yang Bekerja di Satu H100

Keenan
10 Juni 2026
Show More
- Advertisement -
Ad image
- Advertisement -
Ad image
Finware

Baca berita keuangan global real-time, insight market APAC, tren bisnis, dan crypto paling komprehensif. Curi start sebelum market bergerak.

  • Kanal:
  • Bisnis
  • Market
  • Tech
  • Kripto

Personal

  • Riwayat
  • Disimpan
  • Feed
  • Topik Pilihan

Tentang Kami

  • Beranda
  • Hubungi Kami

© 2026 Finware Media. All Right Reserved.

Welcome Back!

Sign in to your account

Username or Email Address
Password

Lost your password?