Dalam dua hari, tiga perusahaan besar merilis model AI baru dan ketiganya menyebut-nyebut soal coding. Anthropic pada 1 September, lalu Google dan Meta pada 2 September. Yang terakhir datang dengan klaim paling berani.
Meta merilis Muse Spark 1.3 dan menyatakan model itu mengungguli Claude Opus 5 maupun GPT-5.6 Sol pada tolok ukur rekayasa perangkat lunak. Selisihnya, kalau diperhatikan, tipis sekali.

Ringkasan cepat
- Apa: peluncuran Muse Spark 1.3 dari Meta.
- Kapan: 2 September 2026, langsung tersedia hari itu juga di Muse Code dan Meta Model API.
- Klaim utamanya: skor 75,4 pada DeepSWE 1.1, di atas Claude Opus 5 (74,0) dan GPT-5.6 Sol (73,0).
- Skor lain: 88,8 persen pada Terminal-Bench 2.1, 59,4 persen pada SWEAtlas CodeBase QnA, dan 98,5 persen pada pengambilan konteks panjang.
- Efisiensi: sekitar 25 persen lebih sedikit token dan 20 persen lebih sedikit panggilan alat untuk tugas yang sama.
- Belum tersedia: mode penalaran maksimal, menunggu pengujian keamanan tambahan.
Selisihnya tipis, dan itu perlu disebut
Mari lihat angkanya berdampingan: 75,4 berbanding 74,0 berbanding 73,0.
Jarak antara juara pertama dan ketiga cuma 2,4 poin. Antara pertama dan kedua bahkan hanya 1,4 poin.
Dalam pemakaian nyata, selisih sekecil itu hampir mustahil kamu rasakan. Yang jauh lebih menentukan adalah kecocokan model dengan cara kerjamu, kualitas instruksi yang kamu berikan, dan seberapa rapi kode yang sedang kamu garap.
Dan seperti biasa, angka ini dilaporkan Meta sendiri. Belum ada pengujian pihak ketiga yang independen.
Ketika tiga model teratas hanya berselisih dua poin, yang sebenarnya sedang diumumkan bukan keunggulan, melainkan kesetaraan.
Angka yang justru lebih berguna
Ada dua angka lain di pengumuman ini yang menurut kami lebih berarti daripada skor tolok ukurnya.
Muse Spark 1.3 disebut menyelesaikan tugas yang sama dengan sekitar 25 persen lebih sedikit token dan 20 persen lebih sedikit panggilan alat dibanding versi sebelumnya.
Kenapa ini penting? Karena token adalah satuan tagihan, dan panggilan alat adalah satuan waktu tunggu. Model yang menyelesaikan pekerjaan sama dengan langkah lebih sedikit berarti lebih murah dan lebih cepat, dua hal yang benar-benar terasa sehari-hari.
Bandingkan dengan langkah Anthropic sehari sebelumnya yang memangkas biaya baca cache 75 persen. Dua pendekatan berbeda, tujuan sama: menurunkan ongkos kerja agen AI yang berputar berulang kali.
Mode paling kuatnya sengaja ditahan
Satu detail yang gampang terlewat: mode penalaran maksimal tidak ikut dirilis, dan baru menyusul setelah Meta merampungkan pengujian keamanan tambahan.
Pola menahan kemampuan paling kuat ini muncul berulang minggu ini. OpenAI menahan kemampuan siber Astra untuk penguji terpilih. Google tidak menjual bebas Gemini 3.8 Flash Cyber. Sekarang Meta menunda mode penalaran tertingginya.
Tiga perusahaan, tiga alasan berbeda, satu kebiasaan baru: merilis dulu yang aman, tahan dulu yang paling kuat.
Kenapa Meta kembali agresif
Konteksnya membantu. Meta sempat tertinggal dalam perlombaan model, lalu kembali ke jalur sumber terbuka dengan model yang bisa dijalankan di laptop.
Rilis kali ini menyasar wilayah yang berbeda: kerja coding kelas atas, langsung menantang dua pemain terdepan.
Perlu dicatat, pengumumannya menyebut ketersediaan di Muse Code dan Meta Model API, dan tidak menyatakan model ini dibuka bobotnya. Jadi jangan berasumsi ini rilis terbuka seperti sebelumnya.
Apa yang bisa kamu lakukan sekarang
- Jangan berpindah model karena selisih dua poin. Ongkos berpindah hampir selalu lebih besar daripada keuntungan sekecil itu.
- Kalau kamu memang bekerja dengan kode setiap hari, uji sendiri dengan tugas nyatamu selama sepekan. Itu jauh lebih berguna daripada tabel tolok ukur mana pun.
- Perhatikan efisiensinya, bukan skornya. Angka 25 persen lebih sedikit token berdampak langsung ke tagihanmu. Skor 75,4 tidak.
- Tunggu uji pihak ketiga sebelum menerima klaim unggul. Semua angka di pengumuman ini berasal dari Meta.
Pertanyaan yang sering muncul
Apa itu Muse Spark 1.3?
Model AI terbaru dari Meta yang dirilis pada 2 September 2026, ditujukan untuk tugas coding dan kerja agentik, dan langsung tersedia di Muse Code serta Meta Model API.
Apakah benar lebih baik dari Claude Opus 5 dan GPT-5.6?
Menurut angka yang dilaporkan Meta, ya, dengan skor 75,4 pada DeepSWE 1.1 berbanding 74,0 dan 73,0. Namun selisihnya sangat tipis dan angkanya belum diverifikasi pihak ketiga yang independen.
Apa keunggulan yang paling terasa dalam pemakaian nyata?
Efisiensinya. Meta menyebut model ini menyelesaikan tugas yang sama dengan sekitar 25 persen lebih sedikit token dan 20 persen lebih sedikit panggilan alat, yang berarti biaya lebih murah dan waktu tunggu lebih pendek.
Apakah semua fiturnya sudah tersedia?
Belum. Mode penalaran maksimal belum dirilis dan baru akan menyusul setelah Meta menyelesaikan pengujian keamanan tambahan.
Apakah Muse Spark 1.3 model terbuka?
Pengumumannya hanya menyebut ketersediaan di Muse Code dan Meta Model API, tanpa menyatakan bobot modelnya dibuka. Jadi tidak bisa diasumsikan sebagai rilis bobot terbuka seperti sebagian model Meta sebelumnya.




Tinggalkan Komentar