Finware
  • Beranda
  • Riwayat
  • Disimpan
  • Feed
  • Topik Pilihan
  • News
  • Market
  • Bisnis
  • Kripto
  • Tech
Notification
FinwareFinware
  • News
  • Market
  • Bisnis
  • Kripto
  • Tech
Search
  • Quick Access
    • Beranda
    • Contact Us
    • Riwayat
    • Disimpan
    • Topik Pilihan
    • Feed
  • Categories
    • News
    • Market
    • Bisnis
    • Kripto
    • Tech

Artikel Populer

Jangan lewatkan artikel menarik lainnya
Indonesia Terancam Tertinggal dalam Euforia EV, Sebagian Besar Nikel Dialihkan ke Baja Tahan Karat, Temuan Riset Mengungkap

Indonesia Terancam Tertinggal dalam Euforia EV, Sebagian Besar Nikel Dialihkan ke Baja Tahan Karat, Temuan Riset Mengungkap

Reihan
19 April 2026
Aksi Saham Terbesar Siang Ini: META, BBY, APP, SMG Siap Mengguncang Pasar!

Aksi Saham Terbesar Siang Ini: META, BBY, APP, SMG Siap Mengguncang Pasar!

Dirga
27 Maret 2026
Warren Buffett Akui Terlambat Jual Saham Apple: Siap Tambah, Tapi Tunggu Pasar Lebih Baik!

Warren Buffett Akui Terlambat Jual Saham Apple: Siap Tambah, Tapi Tunggu Pasar Lebih Baik!

Dirga
31 Maret 2026
© 2026 Finware Media. All Right Reserved.
Finware > Bisnis > AI Perusahaan Masuk Era Evaluasi: Agen Menguasai Otonomi Lebih Cepat Daripada Verifikasi Perusahaan
Bisnis

AI Perusahaan Masuk Era Evaluasi: Agen Menguasai Otonomi Lebih Cepat Daripada Verifikasi Perusahaan

Keenan
Last updated: 11 Juli 2026 3:28 AM
By
Keenan
6 Min Read
Share
AI Perusahaan Masuk Era Evaluasi: Agen Menguasai Otonomi Lebih Cepat Daripada Verifikasi Perusahaan
SHARE

Tim AI di perusahaan-perusahaan semakin memberikan kebebasan kepada agen-agen mereka, tapi di saat yang sama, kepercayaan terhadap pengujian otomatis mulai merosot. Berdasarkan survei VB Pulse Juni 2026 yang melibatkan 157 responden dari perusahaan berukuran 100 karyawan atau lebih, setengah dari perusahaan telah menerapkan fitur agen AI atau LLM yang lulus evaluasi internal, namun tetap menyebabkan kegagalan saat berhadapan dengan pelanggan. Satu dari empat perusahaan mengalami kegagalan tersebut lebih dari sekali.

Table of Content
  • Kenapa evaluasi yang lulus tidak menjamin agen yang berfungsi
  • Kemampuan tidak sama dengan konsistensi
  • Otonomi harus berkembang berdasarkan risiko, bukan ambisi

Ini berarti perusahaan-perusahaan tidak menanggapi masalah ini dengan memperlambat proses otomatisasi. Sebanyak 66% responden sudah mengizinkan beberapa penggunaan produksi tanpa tinjauan manusia atau sedang membangun sistem yang ditujukan untuk itu dalam waktu dekat. Hanya 5% yang mengatakan bahwa mereka sepenuhnya percaya pada evaluasi otomatis yang bisa membuat keputusan rilis tersebut.

Kesenjangan ini disebut “evaluasi gap” di mana tingkat otonomi naik lebih cepat dibandingkan dengan jaminan di bawahnya. Fenomena ini juga menunjukkan bahwa perusahaan lebih suka meluncurkan agen terlebih dahulu, sementara lapisan kontrol terkait identitas, evaluasi, biaya, konteks, dan orkestrasi akan menyusul kemudian. Dalam setahun ke depan, perusahaan akan melakukan retrofit, memindahkan anggaran mereka untuk sistem yang membuat penerapan agen menjadi lebih terkelola dan dapat dipertanggungjawabkan.

Kenapa evaluasi yang lulus tidak menjamin agen yang berfungsi

Pengujian perangkat lunak tradisional biasanya menilai apakah input yang didefinisikan menghasilkan output yang diharapkan. Namun, pengujian agen lebih sulit karena sistem mungkin memilih urutan langkahnya sendiri, memanggil alat, mengambil data, mengubah status, dan memberikan respons yang berbeda dari satu percobaan ke percobaan berikutnya.

Read more  Salesforce Perkenalkan Headless 360: Transformasikan Platformnya Menjadi Infrastruktur untuk Agente AI

Sebuah agen dapat membuat beberapa keputusan secara terpisah dan tetap mencapai hasil yang salah. Misalnya, agen bisa saja mengambil akun yang benar tetapi memperbarui kolom yang salah. Ia bisa menyusun permintaan pengembalian dana yang valid tetapi mengirimkannya tanpa persetujuan. Bisa juga ia berhasil memanggil lima alat sebelum langkah keenam mengeluarkan informasi sensitif atau mengakhiri alur kerja yang tidak lengkap.

Survei menunjukkan bahwa perusahaan sudah menyadari batasan ini. Alasan paling umum mengapa mereka tidak percaya pada evaluasi otomatis adalah karena kurangnya keselarasan dengan hasil di dunia nyata, yang diungkapkan oleh 29% responden. Bias atau ketidakkonsistenan menyusul di angka 21%, kurangnya kemampuan untuk menjelaskan di 18%, dan kekhawatiran kebocoran data atau privasi di 17%.

Hierarki ini penting. Perusahaan-perusahaan mengatakan bahwa skor yang didapat sering kali tidak dapat memprediksi apa yang terjadi ketika seorang pelanggan, karyawan, atau proses bisnis berinteraksi dengan agen di produksi—bukan karena pengukuran otomatis itu terlalu lambat atau mahal. NIST juga menggarisbawahi hal serupa dalam Panduan AI Generatifnya, yang menyebutkan bahwa pengukuran yang dilakukan di lingkungan terkendali mungkin tidak bisa diterapkan langsung ke produksi, karena perilaku bisa berubah sesuai dengan prompt, pengguna, konteks, dan kondisi operasional. Panduannya merekomendasikan pengujian lapangan, pemantauan pasca-deployment, dan proses yang jelas untuk menangani kegagalan.

Kemampuan tidak sama dengan konsistensi

Satu kali percobaan yang sukses hanya membuktikan bahwa agen dapat menyelesaikan tugas. Ini tidak membuktikan bahwa agen tersebut akan menyelesaikan tugas dengan konsisten. Panduan dari Anthropic membedakan antara mengukur apakah suatu sistem berhasil setidaknya sekali di berbagai usaha, dengan apakah ia selalu berhasil. Perbedaan ini sangat penting untuk alur kerja yang berhadapan dengan konsumen atau operasional. Model yang sesekali menghasilkan jawaban baik mungkin tetap tidak dapat diterima jika tugas yang sama gagal secara tak terduga pada percobaan berikutnya.

Read more  Founders Fund Luncurkan Acara Game Show Bersama Sam Altman, Palmer Luckey, dan Para Elit Teknologi Lainnya

Oleh karena itu, tim perusahaan sebaiknya memperlakukan kesinambungan sebagai metrik utama. Ini berarti menjalankan skenario yang sama beberapa kali, mengubah frasa dan konteks, menguji kemungkinan kegagalan alat, dan mengukur apakah hasil bisnis akhir tetap benar bahkan ketika urutan langkah berubah. Set evaluasi juga perlu berkembang. Setiap insiden yang muncul dalam produksi harus menjadi pengujian regresi permanen. Eskalasi dari pelanggan, kegagalan panggilan alat, persetujuan yang salah dan kesalahan penanganan data harus dimasukkan kembali ke dalam suite pra-deployment daripada tetap sebagai kasus dukungan yang terisolasi.

Otonomi harus berkembang berdasarkan risiko, bukan ambisi

Survei ini tidak menyiratkan bahwa setiap tindakan agen harus memerlukan intervensi manusia. Tinjauan manusia tidak dapat diterapkan untuk jutaan keputusan dengan konsekuensi rendah. Namun, operasi tanpa intervensi manusia seharusnya diperoleh melalui keandalan yang terbukti dan dibatasi oleh konsekuensi dari kegagalan.

Tindakan berisiko rendah seperti menyusun ringkasan internal atau mengategorikan dokumen bisa ditoleransi untuk otonomi yang lebih besar. Namun, transaksi finansial, komunikasi pelanggan, penerapan kode, perubahan kontrol akses, dan penghapusan data memerlukan ambang batas yang lebih ketat, pengujian konsistensi yang berulang, pemeriksaan kebijakan, mekanisme rollback, dan jalur eskalasi manusia yang jelas.

Risiko ini juga tidak terdistribusi secara merata berdasarkan ukuran perusahaan. Perusahaan besar, yaitu yang memiliki 2.500 karyawan atau lebih, bergerak menuju penerapan tanpa intervensi manusia paling cepat, yaitu 70% dibandingkan dengan 64% untuk perusahaan lebih kecil. Mereka juga mengirimkan lebih banyak agen yang kemudian gagal dalam menghadapi pelanggan, yakni 54% berbanding 48%.

Inilah peringatan bagi para pemimpin perusahaan. Menghapus manusia dari proses tidak menghapus ketidakpastian. Tanpa jaminan yang lebih kuat, hal ini hanya mengalihkan ketidakpastian menjadi keputusan produksi otomatis.

Read more  Petunjuk dan Jawaban Wordle #1771 untuk Sabtu, 25 April

Pasar akan terus dorong menuju otonomi yang lebih besar karena insentif ekonominya nyata. Organisasi yang paling siap bukanlah yang tercepat menghapus kehadiran manusia, tetapi mereka yang memperlakukan kesinambungan dan pengujian regresi sama seriusnya dengan kecepatan penerapan.

Share This Article
Facebook Whatsapp Whatsapp LinkedIn Telegram Threads Copy Link
Avatar photo
ByKeenan
Artikel eksklusif dari Keenan Prawira seputar tren bisnis terbaru, pendanaan startup, dan aksi korporasi. Insight esensial untuk para pemimpin bisnis modern.
Previous Article Serangan Ransomware di Sektor Pendidikan Melonjak 16% dalam Setahun, GenAI yang Ceroboh Diduga Jadi Penyebabnya Serangan Ransomware di Sektor Pendidikan Melonjak 16% dalam Setahun, GenAI yang Ceroboh Diduga Jadi Penyebabnya
Next Article Pertumbuhan Asia Menguat, Namun ADB Ingatkan Tantangan Masih Ada di Depan Pertumbuhan Asia Menguat, Namun ADB Ingatkan Tantangan Masih Ada di Depan
- Advertisement -
Ad image

Don't Miss

Buku Terbaru Mengungkap Proses Kreatif di Balik 'The Odyssey' Karya Christopher Nolan Segera Hadir!
Buku Terbaru Mengungkap Proses Kreatif di Balik ‘The Odyssey’ Karya Christopher Nolan Segera Hadir!
Bisnis
CEO Vercel Guillermo Rauch: Memisahkan Model dari Agen, Strategi Baru untuk Masa Depan
CEO Vercel Guillermo Rauch: Memisahkan Model dari Agen, Strategi Baru untuk Masa Depan
Bisnis
WhatsApp Buka Kesempatan Reservasi Nama Pengguna untuk Tiga Miliar Pengguna – Begini Cara Klaim Nama Anda demi Privasi yang Lebih Baik
WhatsApp Buka Kesempatan Reservasi Nama Pengguna untuk Tiga Miliar Pengguna – Begini Cara Klaim Nama Anda demi Privasi yang Lebih Baik
Tech
- Advertisement -
Ad image

Baca Juga

Jelajahi insight lain yang sejalan dengan artikel ini!
Polymarket Menutup Taruhan Terkait Penyelamatan Perwira Angkatan Udara yang Jatuh
Bisnis

Polymarket Menutup Taruhan Terkait Penyelamatan Perwira Angkatan Udara yang Jatuh

Keenan
6 April 2026
Databricks Klaim Telah Menyelesaikan Masalah Pipeline Data yang Telah Menghambat Perkembangan AI Selama Bertahun-Tahun
Bisnis

Databricks Klaim Telah Menyelesaikan Masalah Pipeline Data yang Telah Menghambat Perkembangan AI Selama Bertahun-Tahun

Keenan
18 Juni 2026
Mengapa Munculnya AI Open Source Belum Mengancam Anthropic?
Bisnis

Mengapa Munculnya AI Open Source Belum Mengancam Anthropic?

Keenan
8 Juli 2026
Aturan Tak Tertulis yang Mematikan: Kenapa Bisnis Anda Bisa Terancam?
Bisnis

Aturan Tak Tertulis yang Mematikan: Kenapa Bisnis Anda Bisa Terancam?

Keenan
9 Juli 2026
Nicolas Sauvage Fokus pada Aspek 'Boring' AI untuk Peluang Investasi Cemerlang
Bisnis

Nicolas Sauvage Fokus pada Aspek ‘Boring’ AI untuk Peluang Investasi Cemerlang

Keenan
4 Mei 2026
Kluster Komputasi Orbital Terbesar Kini Siap Layani Pelanggan!
Bisnis

Kluster Komputasi Orbital Terbesar Kini Siap Layani Pelanggan!

Keenan
13 April 2026
Temukan Alat Produktivitas yang Tepat untuk Diri Anda!
Bisnis

Temukan Alat Produktivitas yang Tepat untuk Diri Anda!

Keenan
5 April 2026
Portico Utara Gedung Putih Ditutupi Terpal—Apa Alasan di Baliknya?
Bisnis

Portico Utara Gedung Putih Ditutupi Terpal—Apa Alasan di Baliknya?

Keenan
10 Juli 2026
Show More
- Advertisement -
Ad image
- Advertisement -
Ad image
Finware

Baca berita keuangan global real-time, insight market APAC, tren bisnis, dan crypto paling komprehensif. Curi start sebelum market bergerak.

  • Kanal:
  • Bisnis
  • Market
  • Tech
  • Kripto

Personal

  • Riwayat
  • Disimpan
  • Feed
  • Topik Pilihan

Tentang Kami

  • Beranda
  • Hubungi Kami

© 2026 Finware Media. All Right Reserved.

Welcome Back!

Sign in to your account

Username or Email Address
Password

Lost your password?