Finware
  • Beranda
  • Riwayat
  • Disimpan
  • Feed
  • Topik Pilihan
  • News
  • Market
  • Bisnis
  • Kripto
  • Tech
Notification
FinwareFinware
  • News
  • Market
  • Bisnis
  • Kripto
  • Tech
Search
  • Quick Access
    • Beranda
    • Contact Us
    • Riwayat
    • Disimpan
    • Topik Pilihan
    • Feed
  • Categories
    • News
    • Market
    • Bisnis
    • Kripto
    • Tech

Artikel Populer

Jangan lewatkan artikel menarik lainnya
Indonesia Terancam Tertinggal dalam Euforia EV, Sebagian Besar Nikel Dialihkan ke Baja Tahan Karat, Temuan Riset Mengungkap

Indonesia Terancam Tertinggal dalam Euforia EV, Sebagian Besar Nikel Dialihkan ke Baja Tahan Karat, Temuan Riset Mengungkap

Reihan
19 April 2026
Oracle Satukan Data AI untuk Berikan Agensi Perusahaan Satu Versi Kebenaran

Oracle Satukan Data AI untuk Perusahaan Agensi Single Version of Truth

Keenan
26 Maret 2026
Aksi Saham Terbesar Siang Ini: META, BBY, APP, SMG Siap Mengguncang Pasar!

Aksi Saham Terbesar Siang Ini: META, BBY, APP, SMG Siap Mengguncang Pasar!

Dirga
27 Maret 2026
© 2026 Finware Media. All Right Reserved.
Finware > Bisnis > AI Perusahaan Masuk Era Evaluasi: Agen Menguasai Otonomi Lebih Cepat Daripada Verifikasi Perusahaan
Bisnis

AI Perusahaan Masuk Era Evaluasi: Agen Menguasai Otonomi Lebih Cepat Daripada Verifikasi Perusahaan

Keenan
Last updated: 11 Juli 2026 3:28 AM
By
Keenan
6 Min Read
Share
AI Perusahaan Masuk Era Evaluasi: Agen Menguasai Otonomi Lebih Cepat Daripada Verifikasi Perusahaan
SHARE

Tim AI di perusahaan-perusahaan semakin memberikan kebebasan kepada agen-agen mereka, tapi di saat yang sama, kepercayaan terhadap pengujian otomatis mulai merosot. Berdasarkan survei VB Pulse Juni 2026 yang melibatkan 157 responden dari perusahaan berukuran 100 karyawan atau lebih, setengah dari perusahaan telah menerapkan fitur agen AI atau LLM yang lulus evaluasi internal, namun tetap menyebabkan kegagalan saat berhadapan dengan pelanggan. Satu dari empat perusahaan mengalami kegagalan tersebut lebih dari sekali.

Table of Content
  • Kenapa evaluasi yang lulus tidak menjamin agen yang berfungsi
  • Kemampuan tidak sama dengan konsistensi
  • Otonomi harus berkembang berdasarkan risiko, bukan ambisi

Ini berarti perusahaan-perusahaan tidak menanggapi masalah ini dengan memperlambat proses otomatisasi. Sebanyak 66% responden sudah mengizinkan beberapa penggunaan produksi tanpa tinjauan manusia atau sedang membangun sistem yang ditujukan untuk itu dalam waktu dekat. Hanya 5% yang mengatakan bahwa mereka sepenuhnya percaya pada evaluasi otomatis yang bisa membuat keputusan rilis tersebut.

Kesenjangan ini disebut “evaluasi gap” di mana tingkat otonomi naik lebih cepat dibandingkan dengan jaminan di bawahnya. Fenomena ini juga menunjukkan bahwa perusahaan lebih suka meluncurkan agen terlebih dahulu, sementara lapisan kontrol terkait identitas, evaluasi, biaya, konteks, dan orkestrasi akan menyusul kemudian. Dalam setahun ke depan, perusahaan akan melakukan retrofit, memindahkan anggaran mereka untuk sistem yang membuat penerapan agen menjadi lebih terkelola dan dapat dipertanggungjawabkan.

Kenapa evaluasi yang lulus tidak menjamin agen yang berfungsi

Pengujian perangkat lunak tradisional biasanya menilai apakah input yang didefinisikan menghasilkan output yang diharapkan. Namun, pengujian agen lebih sulit karena sistem mungkin memilih urutan langkahnya sendiri, memanggil alat, mengambil data, mengubah status, dan memberikan respons yang berbeda dari satu percobaan ke percobaan berikutnya.

Read more  Kisah Seorang Konsultan Bisnis: Mengungkap Kesalahan yang Membuat Saran Terbaik Justru Menjerumuskan Perusahaan

Sebuah agen dapat membuat beberapa keputusan secara terpisah dan tetap mencapai hasil yang salah. Misalnya, agen bisa saja mengambil akun yang benar tetapi memperbarui kolom yang salah. Ia bisa menyusun permintaan pengembalian dana yang valid tetapi mengirimkannya tanpa persetujuan. Bisa juga ia berhasil memanggil lima alat sebelum langkah keenam mengeluarkan informasi sensitif atau mengakhiri alur kerja yang tidak lengkap.

Survei menunjukkan bahwa perusahaan sudah menyadari batasan ini. Alasan paling umum mengapa mereka tidak percaya pada evaluasi otomatis adalah karena kurangnya keselarasan dengan hasil di dunia nyata, yang diungkapkan oleh 29% responden. Bias atau ketidakkonsistenan menyusul di angka 21%, kurangnya kemampuan untuk menjelaskan di 18%, dan kekhawatiran kebocoran data atau privasi di 17%.

Hierarki ini penting. Perusahaan-perusahaan mengatakan bahwa skor yang didapat sering kali tidak dapat memprediksi apa yang terjadi ketika seorang pelanggan, karyawan, atau proses bisnis berinteraksi dengan agen di produksi—bukan karena pengukuran otomatis itu terlalu lambat atau mahal. NIST juga menggarisbawahi hal serupa dalam Panduan AI Generatifnya, yang menyebutkan bahwa pengukuran yang dilakukan di lingkungan terkendali mungkin tidak bisa diterapkan langsung ke produksi, karena perilaku bisa berubah sesuai dengan prompt, pengguna, konteks, dan kondisi operasional. Panduannya merekomendasikan pengujian lapangan, pemantauan pasca-deployment, dan proses yang jelas untuk menangani kegagalan.

Kemampuan tidak sama dengan konsistensi

Satu kali percobaan yang sukses hanya membuktikan bahwa agen dapat menyelesaikan tugas. Ini tidak membuktikan bahwa agen tersebut akan menyelesaikan tugas dengan konsisten. Panduan dari Anthropic membedakan antara mengukur apakah suatu sistem berhasil setidaknya sekali di berbagai usaha, dengan apakah ia selalu berhasil. Perbedaan ini sangat penting untuk alur kerja yang berhadapan dengan konsumen atau operasional. Model yang sesekali menghasilkan jawaban baik mungkin tetap tidak dapat diterima jika tugas yang sama gagal secara tak terduga pada percobaan berikutnya.

Read more  Dari Garasi Tua ke Puncak: Kisah Sukses Bisnis yang Raih Pendapatan $500 Ribu Setahun

Oleh karena itu, tim perusahaan sebaiknya memperlakukan kesinambungan sebagai metrik utama. Ini berarti menjalankan skenario yang sama beberapa kali, mengubah frasa dan konteks, menguji kemungkinan kegagalan alat, dan mengukur apakah hasil bisnis akhir tetap benar bahkan ketika urutan langkah berubah. Set evaluasi juga perlu berkembang. Setiap insiden yang muncul dalam produksi harus menjadi pengujian regresi permanen. Eskalasi dari pelanggan, kegagalan panggilan alat, persetujuan yang salah dan kesalahan penanganan data harus dimasukkan kembali ke dalam suite pra-deployment daripada tetap sebagai kasus dukungan yang terisolasi.

Otonomi harus berkembang berdasarkan risiko, bukan ambisi

Survei ini tidak menyiratkan bahwa setiap tindakan agen harus memerlukan intervensi manusia. Tinjauan manusia tidak dapat diterapkan untuk jutaan keputusan dengan konsekuensi rendah. Namun, operasi tanpa intervensi manusia seharusnya diperoleh melalui keandalan yang terbukti dan dibatasi oleh konsekuensi dari kegagalan.

Tindakan berisiko rendah seperti menyusun ringkasan internal atau mengategorikan dokumen bisa ditoleransi untuk otonomi yang lebih besar. Namun, transaksi finansial, komunikasi pelanggan, penerapan kode, perubahan kontrol akses, dan penghapusan data memerlukan ambang batas yang lebih ketat, pengujian konsistensi yang berulang, pemeriksaan kebijakan, mekanisme rollback, dan jalur eskalasi manusia yang jelas.

Risiko ini juga tidak terdistribusi secara merata berdasarkan ukuran perusahaan. Perusahaan besar, yaitu yang memiliki 2.500 karyawan atau lebih, bergerak menuju penerapan tanpa intervensi manusia paling cepat, yaitu 70% dibandingkan dengan 64% untuk perusahaan lebih kecil. Mereka juga mengirimkan lebih banyak agen yang kemudian gagal dalam menghadapi pelanggan, yakni 54% berbanding 48%.

Inilah peringatan bagi para pemimpin perusahaan. Menghapus manusia dari proses tidak menghapus ketidakpastian. Tanpa jaminan yang lebih kuat, hal ini hanya mengalihkan ketidakpastian menjadi keputusan produksi otomatis.

Read more  Pemetaan Agenik: Perusahaan AI Hadapi Tantangan Implementasi, Bukan Masalah Platform – Banyak yang Sebut Chatbot Sebagai Agen

Pasar akan terus dorong menuju otonomi yang lebih besar karena insentif ekonominya nyata. Organisasi yang paling siap bukanlah yang tercepat menghapus kehadiran manusia, tetapi mereka yang memperlakukan kesinambungan dan pengujian regresi sama seriusnya dengan kecepatan penerapan.

Share This Article
Facebook Whatsapp Whatsapp LinkedIn Telegram Threads Copy Link
Avatar photo
ByKeenan
Artikel eksklusif dari Keenan Prawira seputar tren bisnis terbaru, pendanaan startup, dan aksi korporasi. Insight esensial untuk para pemimpin bisnis modern.
Previous Article Serangan Ransomware di Sektor Pendidikan Melonjak 16% dalam Setahun, GenAI yang Ceroboh Diduga Jadi Penyebabnya Serangan Ransomware di Sektor Pendidikan Melonjak 16% dalam Setahun, GenAI yang Ceroboh Diduga Jadi Penyebabnya
Next Article Pertumbuhan Asia Menguat, Namun ADB Ingatkan Tantangan Masih Ada di Depan Pertumbuhan Asia Menguat, Namun ADB Ingatkan Tantangan Masih Ada di Depan
- Advertisement -
Ad image

Don't Miss

Pengguna Mac Waspada: Sebuah Malware Menyamarkan Diri Sebagai OpenAI Codex dan Mencuri Kata Sandi dalam Sekejap
Pengguna Mac Waspada: Sebuah Malware Menyamarkan Diri Sebagai OpenAI Codex dan Mencuri Kata Sandi dalam Sekejap
Tech
Perusahaan China Ungguli Micron dan Kioxia dalam Pengiriman Chip Memori NAND
Perusahaan China Ungguli Micron dan Kioxia dalam Pengiriman Chip Memori NAND
News
Putri Saya Tak Bicara Selama 4 Tahun, Tapi Bukan Karena Politika: Sebuah Tragedi yang Menggugah Hati
Putri Saya Tak Bicara Selama 4 Tahun, Tapi Bukan Karena Politika: Sebuah Tragedi yang Menggugah Hati
Market
- Advertisement -
Ad image

Baca Juga

Jelajahi insight lain yang sejalan dengan artikel ini!
Ingin Lebih Banyak Pelanggan? Simak Strategi Jitu dari Ahli Google Ini!
Bisnis

Ingin Lebih Banyak Pelanggan? Simak Strategi Jitu dari Ahli Google Ini!

Keenan
8 April 2026
Pantau 5 Metrik Gudang Ini Sebelum Pertumbuhan Bisnis Anda Terhambat!
Bisnis

Pantau 5 Metrik Gudang Ini Sebelum Pertumbuhan Bisnis Anda Terhambat!

Keenan
3 Juli 2026
Anthropic Luncurkan Claude Design: Alat AI yang Ubah Ide Menjadi Prototipe dan Tantang Figma
Bisnis

Anthropic Luncurkan Claude Design: Alat AI yang Ubah Ide Menjadi Prototipe dan Tantang Figma

Keenan
19 April 2026
Jersey Mike's Ungguli Chick-fil-A dalam Kepuasan Pelanggan 2026
Bisnis

Jersey Mike’s Ungguli Chick-fil-A dalam Kepuasan Pelanggan 2026

Keenan
22 Juni 2026
Apple Klaim Pengguna Lockdown Mode Aman dari Peretasan Spyware
Bisnis

Apple Klaim Pengguna Lockdown Mode Aman dari Peretasan Spyware

Keenan
27 Maret 2026
David Sacks Mundur dari Posisi Kepala AI, Apa Langkah Selanjutnya?
Bisnis

David Sacks Mundur dari Posisi Kepala AI, Apa Langkah Selanjutnya?

Keenan
27 Maret 2026
Risiko Enterprise yang Terabaikan: AI Justru Menggantikan Para Ahli yang Harusnya Jadi Sumber Belajar
Bisnis

Risiko Enterprise yang Terabaikan: AI Justru Menggantikan Para Ahli yang Harusnya Jadi Sumber Belajar

Keenan
17 Mei 2026
Temukan Wajah Baru Pencarian dengan Weights, Solusi AI Terkini!
Bisnis

Temukan Wajah Baru Pencarian dengan Weights, Solusi AI Terkini!

Keenan
21 Juni 2026
Show More
- Advertisement -
Ad image
- Advertisement -
Ad image
Finware

Baca berita keuangan global real-time, insight market APAC, tren bisnis, dan crypto paling komprehensif. Curi start sebelum market bergerak.

  • Kanal:
  • Bisnis
  • Market
  • Tech
  • Kripto

Personal

  • Riwayat
  • Disimpan
  • Feed
  • Topik Pilihan

Tentang Kami

  • Beranda
  • Hubungi Kami

© 2026 Finware Media. All Right Reserved.

Welcome Back!

Sign in to your account

Username or Email Address
Password

Lost your password?