Tim teknik yang sedang membangun jalur coding agentic kini punya alternatif open-source yang konkret untuk model-model terkelola seperti Claude Fable 5, yang bisa dijalankan di satu H100. Perangkat ini, yang dinamakan North Mini Code dari Cohere, baru saja diluncurkan pada hari Selasa. Kelemahannya: North Mini Code menghasilkan output token tiga kali lebih banyak dibandingkan model sejenis dalam pengujian independen, sebuah biaya verbosity yang bertambah dalam beban kerja produksi bervolume tinggi.
Model open-source baru ini adalah model campuran dengan 30 miliar parameter yang mengaktifkan 3 miliar parameter per token. Dirancang khusus untuk rekayasa perangkat lunak agentic termasuk orkestra sub-agent, pemetaan arsitektur, tinjauan kode, dan pekerjaan terminal. Model ini mendukung konteks window sebesar 256.000 token dengan panjang generasi maksimum 64.000 token, dan sudah tersedia di Hugging Face di bawah lisensi Apache 2.0.
Apa yang Bisa Dilakukan North Mini Code
North Mini Code menargetkan seluruh rangkaian coding agentic. Berikut ini adalah beberapa fungsi dan kemampuan dari model ini.
Rekayasa perangkat lunak. Cohere membangun North Mini Code secara khusus untuk rekayasa perangkat lunak agentic, bukan diadaptasi dari basis umum. Ia memiliki kemampuan alat yang terintegrasi dan mendukung pemikiran yang saling terkait, yang menurut Cohere meningkatkan kinerja bekerja dalam multi-langkah agentic.
Pemetaan arsitektur dan tinjauan kode. North Mini Code mampu menganalisis dan memetakan arsitektur sistem, mengungkapkan ketergantungan dan melakukan tinjauan kode pada basis kode yang besar. Dengan konteks window 256.000 token, ia dapat menangani proyek multi-file yang substansial dalam satu waktu konteks.
Tugas agentic berbasis terminal. Model ini dilatih untuk lingkungan terminal, mampu menangani interaksi shell, skrip paket, dan alat command-line. Cohere sudah mengujinya pada Terminal-Bench v2, yang menguji agen dalam lingkungan terminal nyata daripada tugas penghasil kode sintetik.
Bagaimana Model Ini Dibangun
North Mini Code adalah model campuran sparse dengan 128 expert, di mana 8 di antaranya diaktifkan per token. Kebutuhan komputasi pada saat inferensi lebih mendekati model 3 miliar parameter meskipun totalnya 30 miliar parameter. Nick Frosst, salah satu pendiri Cohere, mendemonstrasikan model ini berjalan di Mac Studio melalui MLX dengan sekitar 20 gigabyte RAM, sama dengan mesin yang digunakannya untuk pekerjaan coding lokal.
Cohere melatih model ini melalui dua tahap fine-tuning berbasis supervisi diikuti oleh pembelajaran penguatan dengan penghargaan yang dapat diverifikasi di lebih dari 70.000 tugas diverifikasi dari sekitar 5.000 repositori, yang sudah disaring terhadap SWE-Bench.
Bukan hanya dioptimalkan untuk satu skaf agen, Cohere melatihnya melalui tiga skaf. SWE-Agent menggunakan CLI yang kaya dengan perintah khusus. Mini-SWE-Agent menggunakan satu alat bash dengan output shell mentah. OpenCode menggunakan alat yang ditulis secara individu yang mengembalikan JSON terstruktur. Cohere melaporkan peningkatan 10 persen pada evaluasi OpenCode dari pendekatan multi-harness sambil mempertahankan kinerja SWE-Agent.
Di Mana Letak North Mini Code
North Mini Code masuk ke pasar yang kini diperkuat dengan Mistral Devstral Small 2, GitHub Copilot, Cursor, dan Claude Fable 5, masing-masing dengan trade-off biaya dan penerapan yang berbeda.
Perbandingan utama Cohere adalah terhadap Mistral Devstral Small 2, sebuah model padat dengan 24 miliar parameter. Dalam tes internal yang dilaporkan vendor, Cohere mengklaim throughput output 2,8 kali lebih tinggi dan keuntungan latensi inter-token sebesar 30 persen dibandingkan Devstral Small 2 di konfigurasi perangkat keras yang identik. Cohere juga mengklaim dalam posting teknisnya di Hugging Face bahwa North Mini Code melampaui model-model open-source hingga empat kali lipat jumlah parameternya pada benchmark yang dilaporkan, termasuk model dengan 120 miliar parameter.
Artificial Analysis secara independen menempatkannya di urutan kedelapan dari 127 model terbuka sebanding dalam hal kecepatan output, menghasilkan 210 token per detik, dengan waktu untuk token pertama mencapai 0,25 detik dibandingkan median klas 1,95 detik. Model ini menempati urutan ke-18 dari 127 dalam Indeks Kecerdasan Artificial Analysis. Satu tanda dari data yang sama: model ini menghasilkan 75 juta token output untuk menyelesaikan Indeks Kecerdasan dibandingkan median kelas yang sebesar 25 juta. Dalam jalur agentic bervolume tinggi, verbosity ini memengaruhi biaya inferensi dan latensi.
“Tiba-tiba orang-orang berpikir, hei, apakah saya mendapatkan nilai ekonomi yang cukup dari token yang dihasilkan model ini?” kata Frosst dalam video peluncuran. “Penerapan lokal adalah satu cara untuk memberdayakan orang dan membuat AI benar-benar bekerja untuk mereka.”
GitHub Copilot, Cursor, dan Claude Code beroperasi dengan harga berdasarkan penggunaan atau berlangganan tanpa opsi penerapan di tempat. Model yang sekarang paling mampu secara publik, Claude Fable 5, dibanderol $50 per satu juta token output. Menurut Frosst, model ini adalah kebalikan dari Fable.
“Model ini kecil, hemat biaya, open-source Apache 2.0, dan dapat diterapkan secara lokal. Inilah arah yang seharusnya diambil oleh LLM, kecil, open source, transparan dan berdaulat, versus besar, mahal, proprietari, dan hegemonik,” tulis Frosst dalam sebuah posting di X.
Makna bagi Perusahaan
Bagi tim yang membangun jalur coding agentic untuk produksi, peluncuran North Mini Code menjelaskan serangkaian keputusan yang sudah dibentuk dalam beberapa bulan ini.
Pendidikan agentic yang dibangun khusus kini menjadi acuan untuk evaluasi. Perbedaan antara model yang dilatih khusus untuk kode dan model yang dilatih untuk alur kerja agentic dengan panggilan alat yang terverifikasi serta ketahanan multi-harness kini jadi faktor materi dalam keputusan jalur. Setiap vendor model yang mengklaim kemampuan coding agentic seharusnya bisa menjawab apakah pelatihannya menggunakan tugas agentik yang dapat diverifikasi atau hanya diadaptasi dari basis umum.
Verbosity adalah biaya jalur yang tersembunyi yang tidak terungkap dalam benchmark. Artificial Analysis mencatat North Mini Code mampu menghasilkan tiga kali lipat token output dibandingkan model-model sebanding. Verbosity ini bertambah di seluruh biaya inferensi dan latensi dalam jalur bervolume tinggi. Pengujian throughput melawan volume workload yang sebenarnya adalah langkah evaluasi yang dilewati dalam peringkat benchmark.
Pemisahan harga frontier kini menjadi keputusan arsitektur yang nyata. Fable 5 yang dihargai $50 per satu juta token output dan North Mini Code pada satu H100 mewakili trade-off yang nyata antara pengendalian biaya dan residensi data di satu sisi, serta overhead infrastruktur terkelola di sisi lainnya. Tim yang menjalankan jalur coding agentic bervolume tinggi harus memodelkan kedua jalur biaya ini terhadap muatan aktual mereka sebelum berkomitmen pada salah satu dari keduanya.

