Model AI Frontier sangat berbeza dari segi betapa sukarnya untuk dipecahkan, menurut penanda aras baharu daripada FAR.AI bukan untung keselamatan — dan jurangnya jauh lebih besar daripada yang diandaikan.
Pada 29 Julai, FAR.AI melancarkan Papan Pendahulu Keselamatan AInya, menguji perlindungan empat model terkemuka dalam keadaan yang sama. Anthropic's Claude Fable 5 dan OpenAI's GPT-5.6 Sol berpegang teguh terhadap serangan, manakala xAI's Grok 4.5 dan Google Gemini 3.1 Pro masing-masing mencecah di bawah $300, kata organisasi itu. FAR.AI menyifatkan perbezaan antara model paling teguh dan paling kurang kukuh sebagai "jurang seratus kali ganda" dalam perlindungan. For more context on this story, see our ongoing breaking AI news.
Di samping papan pendahulu, FAR.AI memperkenalkan apa yang dipanggil Piawaian Minimal untuk Pelindungan, garis dasar keselamatan bersama yang dipasang sepenuhnya daripada pertahanan yang telah dijalankan oleh pembangun sebaya dalam pengeluaran. Matlamatnya adalah untuk memberikan makmal lantai konkrit untuk bertemu — dan untuk membuat perlindungan yang lemah kelihatan.
Penemuan itu menggemakan ujian tekanan FAR.AI yang terdahulu. Laporan Mei mendapati bahawa perlindungan DeepSeek-V4-Pro telah "runtuh hampir sepenuhnya," dengan penyerang berkemahiran rendah memintas mekanisme keselamatan 98–100% sepanjang masa merentasi setiap domain yang diuji. Pecah jail tersedia secara terbuka yang dibina untuk model terdahulu berfungsi tanpa satu pengubahsuaian, menunjukkan kelemahan yang diketahui tidak dapat ditambal.
WIRED, melaporkan pada papan pendahulu, menyimpulkan bahawa ia masih "sangat mudah untuk mematahkan beberapa model AI sempadan." Apabila ejen menjalankan tugas yang lebih sensitif, perbezaan itu menimbulkan persoalan mendesak tentang sistem yang selamat untuk digunakan.
Untuk liputan berterusan penyelidikan keselamatan dan keselamatan AI, pembaca boleh mengikuti AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →