Benchmarking kini menjadi norma di industri untuk bagaimana perusahaan AI memvalidasi kemampuan model mereka. Ketika metriknya memihak pada mereka, perusahaan bisa tampil menonjol dari pesaing dan mengiklankan keunggulan mereka. Singkatnya, benchmark yang baik hampir selalu berarti PR yang baik.
Tapi sayangnya, perusahaan juga mulai mengakali sistem benchmarking yang sudah usang—banyak yang tidak dirancang untuk mengukur kemampuan model-model modern.
Vals, sebuah startup yang didirikan pada tahun 2024, mengklaim sedang dalam misi untuk memperbaiki sistem yang tidak sempurna ini. Dalam waktu kurang dari dua tahun, perusahaan ini sudah dikenal di industri teknologi, serta berhasil mendapatkan putaran seed yang dipimpin oleh 8VC dan Bloomberg Beta tahun lalu. Bulan lalu, setelah periode pertumbuhan pesat, Vals mengumpulkan dana sebesar $40 juta dalam putaran Seri A yang dipimpin oleh Andreessen Horowitz.
Rayan Krishnan, salah satu pendiri perusahaan yang berusia 25 tahun ini, sebelumnya pernah magang di Palantir. Selama masa kuliah di Stanford, dia juga bekerja di Microsoft serta di lab kecerdasan buatan yang terkenal di universitas tersebut. Krishnan mengatakan Vals lahir dari pengamatannya bahwa benchmarking ketinggalan jauh dari kemajuan industri yang seharusnya diukur.
“Kami melihat banyak model baru yang sangat mumpuni muncul ke pasar dengan cepat, tetapi benchmark akademik tidak dapat mengikuti kemajuan tersebut,” ungkap Krishnan. Dengan AI yang semakin terintegrasi ke dalam berbagai aspek masyarakat, benchmark seharusnya ada untuk memverifikasi bahwa model-model ini bisa melakukan apa yang diiklankan perusahaan.
Baru-baru ini, pendiri muda itu menunjukkan kantornya yang terdiri dari dua lantai di San Francisco, tepatnya di Folsom Street—sebuah bangunan bata tua yang, seabad lalu, berfungsi sebagai tempat pembuatan bir besar. Kini, struktur bersejarah ini menjadi rumah bagi berbagai startup yang tengah berusaha membangun masa depan industri teknologi.
“Secara historis, proses evaluasi dilakukan untuk mengukur kecerdasan dengan cara yang sangat abstrak,” jelas Krishnan. “Seperti, apakah model memiliki cukup informasi untuk dapat mengikuti ujian bar?”
Di sinilah Vals ingin membedakan diri. Sementara banyak sistem benchmarking menawarkan tes yang tersedia untuk publik, yang memungkinkan perusahaan melatih model mereka berdasarkan tes tersebut, Vals tidak secara publik mengungkapkan materi tes spesifik mereka. Alih-alih mengukur pengetahuan umum AI, Vals juga mengevaluasi model berdasarkan kemampuan mereka untuk menyelesaikan tugas kompleks yang terkait dengan industri tertentu seperti hukum, keuangan, dan pemrograman.
“Apa yang kami lakukan adalah melihat dampak nyata dari model-model ini,” kata Krishnan. “Apakah mereka bisa melakukan pekerjaan yang menghasilkan produk berkualitas sama seperti manusia di setiap domain?”
Tujuannya adalah untuk memeriksa tidak hanya hasil positif, tetapi juga negatif. Harapannya adalah untuk menganalisis bagaimana “jika model-model ini bebas berkeliaran di dunia, apa implikasi negatif yang mungkin timbul,” tambahnya.
Kemampuan yang diukur oleh Vals semakin berkembang. Selain industri tradisional, startup ini juga menjajaki area yang lebih unik. “Kami memiliki benchmark untuk perbaikan diri yang berulang. Kami sedang mengerjakan beberapa penelitian di bidang kesehatan mental, keamanan siber, biow keamanan, dan bahkan hukum konflik bersenjata untuk memahami bagaimana menerapkan Konvensi Jenewa,” ujar Krishnan.
Perusahaan membayar Vals untuk menguji model mereka, yang mungkin terdengar aneh. Kenapa sebuah perusahaan mau membayar untuk mengetahui bahwa modelnya tidak berkinerja baik? Namun, pengukuran yang efektif membantu perusahaan untuk memperbaiki dan meningkatkan hasil seiring waktu. Krishnan membandingkan model pendapatan mereka dengan bagaimana seorang siswa mungkin membayar College Board untuk mengikuti SAT.
Evaluasi ini juga menjadi faktor kunci dalam pengambilan keputusan bagi perusahaan yang ingin mengakuisisi model AI baru.
Startup ini baru-baru ini mengungkapkan bahwa pendapatan mereka saat ini delapan kali lipat dari tahun lalu. Jumlah staf juga terus bertambah. Vals, yang memulai tahun dengan hanya delapan orang, kini telah berkembang menjadi tim yang terdiri dari 25 orang. Krishnan mengatakan bahwa seiring pertumbuhan startup, rencana mereka adalah pindah ke kantor yang jauh lebih besar, serta merekrut tambahan 10 hingga 15 orang. Perusahaan juga baru saja meluncurkan program untuk memberikan evaluasi model kepada lembaga pemerintah.
Krishnan melihat sistem benchmarking perusahaannya sebagai masa depan bagaimana perusahaan AI memikirkan pertumbuhan bisnis dan membangun kepercayaan publik.
“Perusahaan AI mulai melantai di bursa. SpaceX sudah melantai. Anthropic dijadwalkan untuk tahun ini. Saya menduga OpenAI juga akan cepat melantai. Saya pikir saat model AI menjadi bagian inti dari ekonomi dan lebih menyebar luas, jenis benchmark dan evaluasi yang kami lakukan akan menjadi pendorong penggunaan dan bagian sentral dari bagaimana perusahaan-perusahaan ini menyampaikan laporan publik atau membahas investasi yang mereka rencanakan dalam AI,” ujarnya.

