Finware
  • Beranda
  • Riwayat
  • Disimpan
  • Feed
  • Topik Pilihan
  • News
  • Market
  • Bisnis
  • Kripto
  • Tech
Notification
FinwareFinware
  • News
  • Market
  • Bisnis
  • Kripto
  • Tech
Search
  • Quick Access
    • Beranda
    • Contact Us
    • Riwayat
    • Disimpan
    • Topik Pilihan
    • Feed
  • Categories
    • News
    • Market
    • Bisnis
    • Kripto
    • Tech

Artikel Populer

Jangan lewatkan artikel menarik lainnya
Indonesia Terancam Tertinggal dalam Euforia EV, Sebagian Besar Nikel Dialihkan ke Baja Tahan Karat, Temuan Riset Mengungkap

Indonesia Terancam Tertinggal dalam Euforia EV, Sebagian Besar Nikel Dialihkan ke Baja Tahan Karat, Temuan Riset Mengungkap

Reihan
19 April 2026
Aksi Saham Terbesar Siang Ini: META, BBY, APP, SMG Siap Mengguncang Pasar!

Aksi Saham Terbesar Siang Ini: META, BBY, APP, SMG Siap Mengguncang Pasar!

Dirga
27 Maret 2026
Warren Buffett Akui Terlambat Jual Saham Apple: Siap Tambah, Tapi Tunggu Pasar Lebih Baik!

Warren Buffett Akui Terlambat Jual Saham Apple: Siap Tambah, Tapi Tunggu Pasar Lebih Baik!

Dirga
31 Maret 2026
© 2026 Finware Media. All Right Reserved.
Finware > Bisnis > Perusahaan yang Gunakan Berbagai Model AI Cenderung Meremehkan Tingkat Kegagalan Hingga 2,25 Kali Lipat
Bisnis

Perusahaan yang Gunakan Berbagai Model AI Cenderung Meremehkan Tingkat Kegagalan Hingga 2,25 Kali Lipat

Keenan
Last updated: 10 Juli 2026 5:49 PM
By
Keenan
10 Min Read
Share
Perusahaan yang Gunakan Berbagai Model AI Cenderung Meremehkan Tingkat Kegagalan Hingga 2,25 Kali Lipat
SHARE

Sebuah studi terbaru telah menemukan bahwa anggapan tentang model-model yang berbeda dapat saling mengisi kekurangan satu sama lain adalah salah besar. Penelitian ini mengevaluasi 67 model dari 21 penyedia dan menunjukkan bahwa kelemahan tersebut memiliki nama: batas kegagalan bersama (co-failure ceiling).

Table of Content
  • Biaya Tersembunyi dari Strategi Multi-Model
  • Kenapa Matematika Ini Gagal: Batas Kegagalan Bersama
  • Pemeriksaan Kelayakan Pra-Penempatan $0

Anggapan ini beroperasi dengan cara begini: selama dua model tidak sering gagal pada pertanyaan yang sama, menggabungkan keduanya seharusnya menciptakan jaringan pengaman terhadap kegagalan. Namun, batas sebenarnya dari pengaturan model bukanlah seberapa sering model-model berbeda, melainkan persentase pertanyaan di mana setiap model memberikan jawaban salah secara bersamaan. Dengan mengabaikan batas kegagalan bersama ini, perusahaan menghabiskan biaya untuk membangun infrastruktur pengalihan yang rumit dan mahal demi mengejar peningkatan kinerja yang mungkin tidak ada. Beruntung, pengembang bisa menggunakan matematika yang sama untuk membuat tes gratis yang menentukan kapan pengaturan multi-model sebenarnya akan membuahkan hasil.

Biaya Tersembunyi dari Strategi Multi-Model

Untuk mengatur beberapa model bahasa, pengembang biasanya mengandalkan tiga arsitektur. Pengalihan model berfungsi seperti petugas lalu lintas, mengarahkan pertanyaan kompleks ke model-model mahal dan pertanyaan sederhana ke model-model yang lebih murah. Arsitektur cascades mengirim setiap pertanyaan ke model murah terlebih dahulu, hanya beralih ke model premium jika sistem awal menunjukkan tingkat kepercayaan rendah. Pendekatan seperti Mixture-of-Agents (MoA) menggabungkan beberapa model dengan memberikan pertanyaan yang sama dan menghasilkan jawaban yang disintesis dari output gabungan mereka.

Namun, arsitektur ini membawa “harga bayangan” pada biaya inferensi. Setiap kali tim pengembang menerapkan pengalihan atau cascade, mereka membayar biaya tambahan dalam bentuk latensi sistem, pemeliharaan infrastruktur yang rumit, dan meningkatnya risiko pengelolaan di berbagai penyedia API.

Untuk membenarkan biaya operasional ini, para engineer biasanya mengandalkan “korelasi kesalahan pasangan” dalam memilih kumpulan model mereka. Bayangkan seorang pengembang memiliki Model A yang sangat baik dalam menulis kode Python namun gagal dalam SQL, dan Model B yang piawai dalam SQL tetapi kesulitan di Python. Karena keduanya gagal pada jenis pertanyaan yang berbeda, korelasi kesalahan pasangan mereka rendah. Pengembang berpikir dengan menempatkan lapisan pengalih di depan, mereka telah menciptakan sistem komposit yang jarang gagal.

Read more  ‘The Blood Altar’ dan ENHYPEN Siap Memukau Pengunjung di San Diego Comic-Con!

Akan tetapi, menurut studi tersebut, menggabungkan model yang beragam berdasarkan korelasi rendah justru dapat merugikan kinerja jika model-model tersebut tidak memiliki kemampuan yang sama. Ketika suara diambil dari model-model yang beragam tetapi tidak setara, model yang lebih lemah sering kali akan mendominasi dan mengesampingkan yang paling pintar. Josef Chen, penulis paper tersebut, mengungkapkan bahwa dalam eksperimen mereka, “Pemungutan suara mayoritas yang naif di antara model-model yang tidak setara menghasilkan keuntungan rata-rata negatif.” Nasihat yang tepat untuk para pengembang adalah “mengombinasikan hanya model-model dalam rentang kualitas yang sebanding.” Jika tidak bisa mencocokkan kualitas, lebih baik ambil model tunggal yang terbaik dan gunakan anggaran untuk itu.

Paper tersebut memberikan satu titik terang untuk pendekatan ini terkait arsitektur MoA. Ketika membangun ansambel, tim sering menggunakan “Self-MoA,” di mana mereka mengajukan pertanyaan yang sama kepada model premium berkali-kali untuk menghasilkan jawaban sintetis. Peneliti mencatat bahwa pada kualitas yang sebanding, membangun ansambel beragam dengan korelasi pasangan yang rendah dapat mengalahkan setup Self-MoA dengan korelasi tinggi.

Namun, ketika tim menggunakan metrik korelasi pasangan yang sama untuk memprediksi akurasi absolut sistem keseluruhan mereka, matematika pembuktian ini menjadi tidak akurat.

Kenapa Matematika Ini Gagal: Batas Kegagalan Bersama

Temuan utama studi terletak pada metrik yang dinamakan “angka kegagalan bersama” — istilah formal untuk skenario di mana semua model gagal. Tidak ada pengalihan, sistem pemungutan suara, atau cascade yang bisa mencapai akurasi lebih tinggi dari batas yang mereka tetapkan sendiri.

Pooled coding, logika, dan generalist menunjukkan korelasi pasangan yang rendah pada pertanyaan rutin — mereka jarang gagal bersamaan. Namun batas kegagalan bersama ini merepresentasikan kasus kompleks yang mendorong melewati batas arsitektur AI saat ini. Jika sebuah pertanyaan begitu sulit sehingga ketiga model berhalusinasi atau gagal, maka tidak peduli seberapa cermat pengalihan mendistribusikan tugas, seluruh kumpulan akan gagal secara bersamaan.

Para peneliti menguji kumpulan 67 model mereka, termasuk GPT-5.5, Claude Opus 4.8, dan Gemini 3.1 Pro, pada benchmark matematika terbuka MATH-500. Berdasarkan korelasi pasangan yang standar, model-model statistik memprediksi bahwa seluruh kumpulan hanya akan gagal bersamaan pada 2.3% dari pertanyaan. Namun kenyataannya, tingkat kegagalan bersama mencapai 5.2%.

Read more  Weibo Hadirkan VibeThinker-3B, Memicu Perdebatan Baru di Dunia AI soal Standar Kinerja

Metrik korelasi standar meremehkan tingkat kegagalan sekitar 2.25 kali. Masalahnya bukan sekedar kesulitan yang independen, tetapi titik kegagalan yang sama.

Peneliti juga menemukan bahwa format tugas langsung memicu kegagalan bersama. Ketika mereka mengambil pertanyaan sains tingkat pascasarjana dari benchmark GPQA dan mengubahnya dari format pilihan ganda menjadi format jawaban terbuka, proporsi kegagalan meningkat menjadi 12.7%.

Namun, pengembang bisa merancang solusi untuk menghindari batas ini. “Implikasi teknik agak tidak nyaman: pengaturan multi-model buy dengan biaya terendah pada area yang diinginkan, seperti generasi terbuka,” kata Chen. “Di mana saja Anda dapat mengubah generasi menjadi verifikasi atau pemilihan terbatas (output terstruktur, jawaban yang dapat diperiksa, tes eksekusi), Anda membuka kembali batas tersebut.”

Akhirnya, penelitian ini menemukan bahwa batas ini membatasi aplikasi AI dengan dua cara berbeda, tergantung pada domain:

  • Lingkungan dengan batas (misalnya, matematika terbuka): Tingkat kegagalan bersama tinggi. Tugas terlalu sulit, dan semua model gagal secara bersamaan. Tidak peduli berapa banyak pengalihan yang ada, tidak ada kemampuan mendasar untuk menghadapinya.

  • Lingkungan terikat realisasi (misalnya, sains tingkat pascasarjana): Tingkat kegagalan bersama mendekati nol, artinya setidaknya satu model dalam kumpulan biasanya tahu jawabannya. Namun, model-model tersebut sering tidak sepakat sehingga lapisan pengalihan tidak dapat dengan andal memilih jawaban yang benar tanpa orakel yang tahu segalanya.

Pemeriksaan Kelayakan Pra-Penempatan $0

Sebelum mendedikasikan waktu engineering untuk membangun pengalihan, tim bisa menghitung batas performa absolut mereka secara gratis menggunakan rumus matematika yang disebut batas Clopper-Pearson.

Batas Clopper-Pearson berfungsi sebagai kalkulator skenario terburuk. Jika Anda melempar koin sepuluh kali dan mendapatkan delapan kepala, Anda tidak bisa menjamin koin itu akan selalu menunjukkan kepala 80% dari waktu. Batas ini mengambil sampel kecil dari pertanyaan uji dan memberi output batas matematis yang dijamin.

Jika diterapkan pada model bahasa, katakanlah tim menguji kumpulan lima agen pada 50 sample pertanyaan dan menemukan mereka semua gagal bersamaan hanya pada dua pertanyaan. Seorang pengembang mungkin mengira bahwa sistem multi-agen mereka akan mencapai akurasi 96% dalam produksi. Namun, rumus Clopper-Pearson melakukan koreksi terhadap optimisme itu. Ia menganalisis ukuran sampel kecil dan memberikan jaminan matematis bahwa tingkat kegagalan sebenarnya bisa setinggi 12%.

Read more  Hentikan Pembunuhan Ide Cemerlang: Atasi Kebuntuan dan Dorong Inovasi di Organisasi Anda!

Untuk menerapkannya, perusahaan harus membangun dataset yang terpisah. Sebuah perusahaan fintech, misalnya, bisa mengambil 200 tiket dukungan pelanggan yang kompleks dari kuartal sebelumnya dan meminta agen manusia menulis resolusi yang sempurna sebagai tolok ukur. Meskipun ini terdengar seperti proyek manual yang berat, tim engineering yang matang bisa mengotomasi seluruh perhitungan batas tersebut.

Integrasinya cukup sederhana: itu adalah pekerjaan penghitungan terhadap log eval yang sudah diproduksi tim. Jadi bisa dilakukan di tahap CI yang sama dengan suite evaluasi dan akan dipicu ulang setiap kali kumpulan model atau beban kerja berubah.

Tim engineering kemudian menjalankan model-model kandidat mereka terhadap 200 tiket ini sekali dan mencatat hasilnya. Ketika mereka ingin mengevaluasi konfigurasi multi-model, mereka bisa menggunakan metrik tingkat kegagalan bersama untuk memprediksi akurasi maksimum yang bisa mereka capai dari sistem tanpa menjalankan kueri tambahan.

Kesimpulan penting dari studi ini adalah bahwa pada tugas di mana jawaban bisa diperiksa dengan pasti, menggabungkan model jarang mengalahkan penggunaan model terbaik tunggal di pasar, kecuali tim memiliki sinyal pengalihan pada tingkat kueri yang sangat kuat.

Dalam lingkungan bisnis, tugas yang bisa diperiksa secara definitif memiliki jawaban yang objektif dan tanpa toleransi terhadap kesalahan. Ini termasuk menghasilkan kueri SQL yang harus dieksekusi tanpa kesalahan, mengekstrak total faktur tertentu dari PDF 50 halaman, atau memformat payload JSON yang sesuai dengan skema yang ketat. Untuk tugas-tugas ini, umumnya perusahaan lebih baik membayar premium untuk model frontier yang paling pintar daripada menggabungkan tiga model lebih murah dan berharap pengalihan memilih output yang benar.

Karena pemeriksaan matematis ini gratis, tim perusahaan bisa melacak tingkat kegagalan mereka sendiri seiring dengan munculnya model-model baru.

“Pengukuran ini tidak memerlukan biaya, jadi tim mana pun bisa melacak tingkat kegagalan mereka sendiri di antara generasi model dan melihat apakah batas tersebut mendekati,” kata Chen. Akhirnya, “yang bisa mereka kendalikan adalah heterogenitas cara-cara gagal dan perputaran pasar, bukan jumlah model.”

TAGGED:breaking
Share This Article
Facebook Whatsapp Whatsapp LinkedIn Telegram Threads Copy Link
Avatar photo
ByKeenan
Artikel eksklusif dari Keenan Prawira seputar tren bisnis terbaru, pendanaan startup, dan aksi korporasi. Insight esensial untuk para pemimpin bisnis modern.
Previous Article Memahami 'AI Work Slop': Cara Bisnis Inggris Melindungi Diri dari Risiko Memahami ‘AI Work Slop’: Cara Bisnis Inggris Melindungi Diri dari Risiko
Next Article Belanja Konsumen Jadi Pilar Utama Vietnam Raih Pertumbuhan Dua Digit Belanja Konsumen Jadi Pilar Utama Vietnam Raih Pertumbuhan Dua Digit
- Advertisement -
Ad image

Don't Miss

Burry Ambil Posisi Pendek Terhadap Caterpillar Setelah Melonjak Hampir Dua Kali Lipat Berkat Kecerdasan Buatan 2026
Burry Ambil Posisi Pendek Terhadap Caterpillar Setelah Melonjak Hampir Dua Kali Lipat Berkat Kecerdasan Buatan 2026
News
Meski Sudah Kaya dan Sukses, Mengapa Pemenang Teknologi Terakhir Masih Terus Berjuang?
Meski Sudah Kaya dan Sukses, Mengapa Pemenang Teknologi Terakhir Masih Terus Berjuang?
Bisnis
Distributor Bahan Bakar Singapura Investasi US$10 Juta untuk Terminal Minyak di Timor-Leste
Distributor Bahan Bakar Singapura Investasi US$10 Juta untuk Terminal Minyak di Timor-Leste
Market
- Advertisement -
Ad image

Baca Juga

Jelajahi insight lain yang sejalan dengan artikel ini!
10 Langkah Strategis SEO yang Telah Terbukti, Ini Cara Memaksimalkannya!
Bisnis

10 Langkah Strategis SEO yang Telah Terbukti, Ini Cara Memaksimalkannya!

Keenan
11 Juli 2026
Circle Dapatkan Persetujuan Terakhir dari OCC untuk Dirikan Bank Digital Nasional Pertama di AS
Kripto

Circle Dapatkan Persetujuan Terakhir dari OCC untuk Dirikan Bank Digital Nasional Pertama di AS

Rangga
12 Juli 2026
Trailer 'The Social Reckoning' Dibilang 'Sketch SNL', Pendapat Penggemar Terbelah — Tapi Ada Skandal Meta yang Lebih Krusial untuk Diperhatikan!
Tech

Trailer ‘The Social Reckoning’ Dibilang ‘Sketch SNL’, Pendapat Penggemar Terbelah — Tapi Ada Skandal Meta yang Lebih Krusial untuk Diperhatikan!

Keenan
15 Juni 2026
Gedung Putih Minta OpenAI Perlambat Peluncuran Model Terbaru demi Keamanan Publik
Bisnis

Gedung Putih Minta OpenAI Perlambat Peluncuran Model Terbaru demi Keamanan Publik

Keenan
26 Juni 2026
Ketika AI Mengubah Paradigma Pengembangan Perangkat Lunak: Peningkatan 170% dengan 80% Tenaga Kerja
Bisnis

Ketika AI Mengubah Paradigma Pengembangan Perangkat Lunak: Peningkatan 170% dengan 80% Tenaga Kerja

Keenan
29 Maret 2026
Mengapa Pengalaman Pelanggan B2B Memerlukan Strategi Baru?
Bisnis

Mengapa Pengalaman Pelanggan B2B Memerlukan Strategi Baru?

Keenan
10 Juli 2026
Apakah SEO Sudah Mati? Ini Dia Jawaban yang Saya Berikan Kepada Klien di 2026!
Bisnis

Apakah SEO Sudah Mati? Ini Dia Jawaban yang Saya Berikan Kepada Klien di 2026!

Keenan
18 Juni 2026
Jawaban dan Petunjuk Quordle untuk Minggu, 19 April (Game #1546)
Tech

Tip dan Jawaban Quordle untuk Jumat, 24 April (permainan #1551)

Keenan
24 April 2026
Show More
- Advertisement -
Ad image
- Advertisement -
Ad image
Finware

Baca berita keuangan global real-time, insight market APAC, tren bisnis, dan crypto paling komprehensif. Curi start sebelum market bergerak.

  • Kanal:
  • Bisnis
  • Market
  • Tech
  • Kripto

Personal

  • Riwayat
  • Disimpan
  • Feed
  • Topik Pilihan

Tentang Kami

  • Beranda
  • Hubungi Kami

© 2026 Finware Media. All Right Reserved.

Welcome Back!

Sign in to your account

Username or Email Address
Password

Lost your password?