- Claude Mythos 5 kembali beroperasi setelah penangguhan singkat selama dua minggu untuk audit keamanan.
- Arsitektur model ini menunjukkan lompatan signifikan dalam kemampuan pengkodean, mencapai 80.3% pada SWE-bench Pro.
- Fitur memori persisten baru memungkinkan AI untuk bertindak sebagai kolaborator teknis jangka panjang, bukan sekadar chatbot standar.
- Protokol keamanan kini mencakup mekanisme cadangan yang canggih ke Claude Opus 4.8 untuk kueri sensitif.

Lanskap kecerdasan buatan tingkat tinggi telah mengalami beberapa gelombang besar baru-baru ini dengan kembalinya sistem tercanggih Anthropic secara tiba-tiba. Setelah periode penangguhan total selama dua minggu karena pertimbangan keamanan nasional, Model Claude Mythos 5 telah diaktifkan kembali. untuk kelompok organisasi tertentu yang dikenal sebagai "mitra tepercaya." Langkah ini menunjukkan bahwa meskipun kekuatan model-model ini sangat besar, batasan-batasan yang mengelilingi penerapannya tetap lebih ketat dari sebelumnya bagi masyarakat umum.
Rilis ini jauh lebih dari sekadar pembaruan versi sederhana; ini mewakili pergeseran menuju apa yang oleh para ahli disebut sebagai kolaborator teknis yang berkelanjutan. Tidak seperti iterasi sebelumnya yang sering kehilangan arah dalam percakapan panjang, Arsitektur Mythos dirancang untuk mempertahankan fokus. Dalam jangka waktu yang lama dan mengoordinasikan tugas multi-langkah tanpa kesulitan. Ini merupakan terobosan besar bagi mereka yang membutuhkan AI untuk tetap fokus selama proyek kompleks yang berlangsung berminggu-minggu.
Perbandingan Kinerja dan Keahlian Pemrograman
Jika dilihat dari angka-angka konkret, kemajuannya cukup mencolok, terutama di bidang rekayasa perangkat lunak. Dalam pengujian SWE-bench Pro terbaru, yang mensimulasikan masalah pengkodean di dunia nyata, Claude Mythos 5 meraih skor 80.3%., meninggalkan pendahulunya, Claude Opus 4.8, jauh di belakang dengan angka 69.2%. Keunggulan dua digit ini paling terlihat ketika AI harus menangani banyak file dan menavigasi basis kode yang padat dan saling terhubung.
Demonstrasi awal telah menunjukkan sistem ini membangun seluruh aplikasi web dalam satu file, menampilkan grafik dinamis dan bahkan game platform fungsional dengan fisika dan logika kamera seluler. Sistem ini tidak hanya menulis kode; Ia sangat unggul dalam tugas membosankan yaitu melakukan debugging. dengan mengidentifikasi akar penyebab kesalahan dan menyarankan perbaikan yang paling hemat biaya. Bagi pengembang, ini berarti AI akhirnya mampu melakukan sebagian besar pekerjaan berat daripada hanya menawarkan saran dasar.
Munculnya Agen AI yang Persisten
Salah satu hal paling keren dari versi terbaru ini adalah kemampuannya untuk berfungsi sebagai agen otonom. Alih-alih menunggu perintah di setiap langkah, Mythos dapat memiliki tujuan yang luas.Uraikan menjadi langkah-langkah logis, dan sajikan rencana terstruktur sebelum dieksekusi. Ini tentang beralih dari kueri terisolasi ke alur kerja terintegrasi di mana sistem benar-benar meninjau dan mempertahankan arah proyek itu sendiri.
Tingkat persistensi ini berarti bahwa model tersebut dapat mengingat keputusan teknis yang dibuat beberapa hari yang lalu dan menandai permintaan baru yang mungkin bertentangan dengan keputusan tersebut. Dengan menjaga konteks selama sesi yang panjangDengan begitu, fitur ini menghindari jebakan umum berupa keharusan membangun kembali seluruh logika dari awal setiap kali Anda memulai obrolan baru. Rasanya jauh lebih seperti bekerja dengan rekan kerja manusia yang benar-benar memperhatikan riwayat pekerjaan.
Lapisan Keamanan dan Sistem Cadangan
Tentu saja, dengan kekuatan besar datang banyak birokrasi. Anthropic telah mengintegrasikan serangkaian pengklasifikasi yang memindai setiap permintaan sebelum mencapai inti Mythos, khususnya mencari tanda bahaya dalam bidang biologi, kimia, dan pengembangan AI tingkat lanjut. Jika sebuah permintaan dianggap terlalu sensitif atau memerlukan pendekatan yang berbeda, Sistem ini menggunakan mekanisme cadangan. untuk mengalihkan tugas tersebut ke model yang sedikit lebih terbatas seperti Claude Opus 4.8.
Terdapat beberapa perbincangan di kalangan peneliti mengenai filter internal ini yang terkadang menghasilkan positif palsu, yang bisa sedikit membuat frustrasi ketika Anda mencoba menyelesaikan pekerjaan. Untuk mengatasi hal ini, ada dorongan untuk... lebih banyak transparansi mengenai bagaimana filter-filter ini bekerja. dalam proses kreatif. Menampilkan pemeriksaan keamanan ini membantu membangun kepercayaan, memastikan bahwa pengguna tahu persis mengapa respons tertentu dimodifikasi atau dialihkan.
Evolusi sistem-sistem ini menyoroti masa depan di mana kemampuan teknis dan langkah-langkah keselamatan pada dasarnya adalah dua sisi dari koin yang sama. Seiring industri bergerak menuju model yang dapat merencanakan, mengeksekusi, dan mengingat logikanya sendiri, fokus pada komunikasi yang jelas dan hasil yang dapat diandalkan menjadi metrik utama untuk keberhasilan. Meskipun aksesnya masih agak eksklusif untuk saat ini, tolok ukur yang ditetapkan oleh arsitektur terbaru ini menunjukkan jalan yang jelas menuju AI yang berfungsi sebagai mitra sejati dalam skenario pemecahan masalah yang kompleks.