Model bobot terbuka Tiongkok telah membukukan skor sempurna pada tolok ukur peretasan AI profesional — dan biaya keseluruhannya lebih murah daripada sandwich. Menurut Enclave, sebuah perusahaan keamanan AI yang menjalankan benchmark, Flash V4.1 DeepSeek memperoleh eksekusi kode pada 11 target yang rentan sekaligus menjaga keempat target kontrol yang dipatch tetap aman. Biaya proses yang diterima adalah $4,65 secara total.
Hasilnya, yang diterbitkan oleh salah satu pendiri dan kepala produk Enclave Yanir Tsarimi pada hari Selasa, mendorong perusahaan untuk mengaudit setiap perintah dan meminta model yang dibuat. Tinjauan tersebut mengkonfirmasi enam eksploitasi yang mengikuti jalur serangan yang dimaksudkan — dan mengungkap lima rute keberhasilan tambahan yang tidak dibedakan oleh skor awal benchmark dari solusi yang direncanakan. For more context on this story, see our ongoing latest AI developments.
Banyak Pekerjaan untuk Lima Dolar
Skala aktivitas di balik skor tersebut sangat mencolok. Bekerja di dalam salinan Grafana, Jenkins, dan Nextcloud yang terisolasi, model membaca kode sumber, membandingkan versi yang rentan dan versi yang diperbaiki, memulai layanan, dan menjalankan permintaan pengujian, mengubah taktik setiap kali upaya gagal.
Di seluruh benchmark, DeepSeek V4.1 Flash mengeksekusi 2.349 perintah Bash dan mencatat waktu model aktif sekitar dua jam 38 menit, Enclave melaporkan. Median keberhasilan larinya memakan waktu empat menit 38 detik. Penyedia model melaporkan 268,3 juta token masukan dan sekitar dua juta token keluaran — tetapi karena 266,2 juta token masukan tersebut dilayani dari cache dengan harga diskon, jumlah proses yang diterima hanya $4,65. Upaya yang gagal mendorong biaya keseluruhan menjadi $5,14.
Profil biaya tersebut adalah cerita di dalam cerita. Peretasan agen pada tingkat kemampuan ini, hingga saat ini, merupakan model harga terdepan. Pergerakan harga kopi yang hampir sempurna menunjukkan bahwa biaya marjinal dari pengujian keamanan ofensif otomatis – atau serangan otomatis – sedang menurun.
Grafana Jatuh dalam Waktu Kurang dari 90 Detik
Tantangan Grafana menargetkan kelemahan dalam proses instalasi plugin, di mana serangan yang dimaksud menggunakan masalah penanganan jalur file untuk menempatkan kode di lokasi yang dilindungi. Model tersebut menemukan sesuatu dengan lebih cepat. Itu menjatuhkan file yang dapat dieksekusi ke folder plugin sementara dan menginstruksikan Grafana untuk memuat folder itu sebagai plugin normal, yang menjalankan kode dan mengembalikan bukti eksploitasi.
DeepSeek mengulangi metode tersebut di ketiga putaran Grafana, berakhir dalam 52, 64, dan 90 detik. Sistem penilaian asli, yang hanya memeriksa apakah target menjalankan perintah pembuktian, menerima setiap proses. Audit Enclave selanjutnya — yang juga memeriksa bagaimana model mencapai eksekusi kode — menunjukkan ketiganya menggunakan rute alternatif yang sama, bukan rute yang dirancang untuk diukur oleh tantangan tersebut. Target kontrol yang ditambal tetap aman sepanjang waktu.
Jenkins Menggambar Karya Model Terkuat
Tantangan Jenkins menghasilkan apa yang disebut Enclave sebagai solusi model terbaik. Yang pertama, DeepSeek menemukan bahwa pengguna dengan hak istimewa rendah dapat membuat file konfigurasi yang mengarahkan Jenkins ke file kedua. File pertama lolos pemeriksaan keamanan server; yang kedua dibaca di luar batas tersebut, sehingga model dapat mengekstrak kredensial pengontrol pribadi. Kemudian masuk dengan kredensial, membuka konsol skrip bawaan Jenkins, dan menjalankan perintah di server — rantai serangan penuh, diselesaikan dalam ketiga proses.
Tantangan Jenkins kedua menguji kondisi balapan selama pengunggahan file, mengharuskan model untuk memulai pengunggahan, menjedanya setelah satu byte, mengalihkan tujuannya dengan permintaan kedua, dan melanjutkan pada saat yang tepat. DeepSeek mendapatkan urutan yang tepat itu dalam sekali proses, membuat Jenkins menulis skrip ke lokasi yang dilindungi di mana build normal kemudian mengeksekusinya. Dua proses lainnya menggunakan rute tautan file yang lebih pendek yang sepenuhnya menghindari trik pengaturan waktu.
Mengapa Audit Sama Pentingnya dengan Skor
Bagi Enclave, rute yang tidak terduga adalah intinya. Tolok ukur yang hanya menilai hasil - apakah target menjalankan perintah pembuktian - tidak dapat membedakan eksploitasi buku teks dari pintasan yang tidak diinginkan, dan keduanya dihitung sama di papan peringkat. Perusahaan tersebut mengatakan bahwa episode tersebut menunjukkan mengapa tolok ukur agen tingkat lanjut perlu memverifikasi jalur serangan serta hasilnya, dan kini membedakan solusi terencana dari solusi improvisasi.
Perbedaan itu mempunyai bobot praktis. Bagi para pembela HAM, model yang menemukan rute yang tidak dikatalogkan oleh siapa pun merupakan model ancaman yang lebih realistis dibandingkan model yang mengulangi teknik-teknik yang sudah diketahui. Bagi operator benchmark, jalur alternatif yang tidak diaudit akan menambah kesulitan tantangan yang ada.
Konteks: Model Murah dan Cepat yang Bergigi
DeepSeek V4.1 Flash adalah rilis yang dioptimalkan kecepatannya, diposisikan secara agresif dalam hal harga, dan hasil Enclave adalah titik data dalam pola yang lebih luas: model bobot terbuka dari laboratorium Tiongkok terus menyamai atau mengalahkan model perbatasan tertutup dalam tugas-tugas agen dengan biaya yang jauh lebih murah. Rilisan DeepSeek sebelumnya telah mengungguli evaluasi pengkodean dan penggunaan alat, dan kemampuan keamanan cenderung melacak keterampilan agen secara umum.
Implikasi penggunaan ganda tidak nyaman. Ciri-ciri yang sama yang menjadikan model murah berguna bagi penguji penetrasi — ketekunan, kelancaran alat, dan kemauan untuk mencoba banyak rute serangan — berlaku ketika niat operator adalah jahat. Benchmark Enclave berjalan dalam salinan terisolasi dari perangkat lunak nyata, namun teknik yang ditunjukkan model, mulai dari rantai ekstraksi kredensial hingga kondisi balapan unggahan, menargetkan kerentanan yang ada dalam penerapan produksi Grafana dan Jenkins saat ini.
Enclave telah mempublikasikan rincian lengkap dari sebelas serangan yang berhasil dalam laporannya, termasuk lima rute yang gagal dalam penilaian aslinya.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →