Model Frontier AI beda-beda banget amarga angel dipecah, miturut pathokan anyar saka FAR.AI nirlaba safety - lan jurang kasebut luwih gedhe tinimbang sing dikira.
Ing tanggal 29 Juli, FAR.AI ngluncurake Papan Pimpinan Keamanan AI, nguji pangayoman saka papat model utama ing kahanan sing padha. Anthropic's Claude Fable 5 lan OpenAI's GPT-5.6 Sol nahan serangan kasebut, dene xAI's Grok 4.5 lan Google Gemini 3.1 Pro saben pecah kurang saka $ 300, ujare organisasi kasebut. FAR.AI nggambarake prabédan antarane model sing paling kuat lan paling ora kuwat minangka "jurang satus" ing pangayoman. For more context on this story, see our ongoing AI news.
Saliyane papan pimpinan, FAR.AI ngenalake apa sing diarani Minimal Standard for Safeguards, garis dasar keamanan sing dienggo bareng kabeh saka pertahanan sing wis ditindakake para pangembang peer ing produksi. Tujuane yaiku kanggo menehi laboratorium lantai konkrit kanggo ketemu - lan nggawe proteksi sing ringkih katon.
Temuan kasebut nuduhake tes stres FAR.AI sadurunge. Laporan Mei nemokake yen pangayoman DeepSeek-V4-Pro wis "ambruk meh kabeh," kanthi panyerang sing kurang skill ngliwati mekanisme safety 98-100% ing saben domain sing diuji. Jailbreak sing kasedhiya kanggo umum sing dibangun kanggo model sadurunge bisa digunakake tanpa modifikasi siji, sing nuduhake kerentanan sing ora dingerteni.
WIRED, nglaporake ing leaderboard, nyimpulake yen tetep "gampang banget kanggo jailbreak sawetara model AI perbatasan." Nalika agen nindakake tugas sing luwih sensitif, kesenjangan kasebut nyebabake pitakonan sing penting babagan sistem sing aman kanggo disebarake.
Kanggo liputan terus-terusan babagan riset keamanan lan keamanan AI, para pamaca bisa ngetutake AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →