Amerika Birleşik Devletleri ve Birleşik Krallık hükümetinin yapay zeka güvenlik enstitüleri tarafından yapılan ortak bir ön değerlendirme, Moonshot AI'nin açık ağırlıklı Kimi K3 modelinin, saldırgan siber görevlerde önde gelen ABD sınır modellerinin büyük bir farkla gerisinde kaldığı sonucuna varmıştır. 25 Temmuz 2026'da yayınlanan bulgu, Çin tarafından geliştirilen yapay zeka sistemlerinin ABD'de benimsenirken nasıl ele alınması gerektiği konusunda yoğunlaşan tartışmaya somut bir veri noktası ekliyor.
Değerlendirme, CAISI olarak bilinen NIST'te bulunan ABD AI güvenlik enstitüsü tarafından İngiltere'nin AISI ile birlikte yayınlandı. Kimi K3'ün özellikle siber alana odaklanan ilk resmi Batılı değerlendirmelerinden birini temsil ediyor. Hızla gelişen son dakika yapay zeka haberleri ortamını takip eden okuyucular için sonuç, tek bir kıyaslama puanı için olduğundan daha az, hükümet laboratuvarlarının artık yabancı modelleri geniş çapta dağıtılmadan önce incelemede oynadığı genişleyen rol hakkında sinyaller açısından kayda değerdir.
Değerlendirme neyi ölçtü?
Pekin merkezli Moonshot AI tarafından piyasaya sürülen Kimi K3, lansmanından sonra güçlü genel amaçlı performansıyla kısa sürede küresel dikkatleri üzerine çeken büyük, açık ağırlıklı bir modeldir. Açık dağıtımı, araştırmacıların ve geliştiricilerin ağırlıkları doğrudan indirip inceleyebilmeleri anlamına geliyordu; bu da onu harici güvenlik testleri için doğal bir aday haline getirdi.
Yeni ön rapor daha dar ve daha hassas bir soruya odaklanıyor: Model, ulusal güvenlik teşkilatları için en önemli olan görev türleri olan saldırgan siber operasyonlarda ne kadar yetenekli? Enstitüler, Kimi K3'ü geniş bilgi birikimi veya muhakeme açısından değerlendirmek yerine, onun siber saldırıların gerçekleştirilmesine, yazılım açıklarından yararlanılmasına veya kötü niyetli bilgisayar işlemlerine başka şekilde yardımcı olup olamayacağını araştırdı.
Rakamlar: kabaca %32'ye karşı %76
Ana sonuç keskin bir boşluktur. Değerlendirmeye ilişkin rapora göre, siber yetenek değerlendirmesinde Kimi K3 yaklaşık %32 puan alırken, önde gelen ABD sınır modelleri yaklaşık %76 puan aldı. Basit bir ifadeyle ABD enstitüleri, Çin modelinin, en iyi Batılı modellerin üstlendiği saldırgan siber görevlerin yalnızca üçte birini tamamlayabildiğini buldu.
Serbest bırakmayı kapsayan birden fazla çıkış, boşluğu tutarlı bir şekilde çerçeveledi. South China Morning Post Kimi K3'ün "siber saldırı yeteneğinde ABD'li rakiplerinin çok gerisinde" olduğunu bildirirken İlginç Mühendislik siber kıyaslamalarda %76'ya karşı %32'lik farkın altını çizdi. Değerlendirme ön değerlendirme olarak tanımlanıyor; bu da enstitülerin herhangi bir nihai sonuca varılmadan önce muhtemelen daha fazla test yapılabileceğinin sinyalini verdiği anlamına geliyor.
Boşluk neden mevcut olabilir?
Genel kıyaslamalarda güçlü ancak siber saldırıda zayıf performans gösteren bir model, ilginç bir bilmece sunuyor ve analistler şimdiden bu konuya ağırlık vermeye başladılar. The Decoder'da yazan yorumcular, damıtmanın tutarsızlığın bir kısmını açıklayabileceğini belirtti.
Damıtma, bir modelin, her yeteneği sıfırdan oluşturmak yerine, daha yetenekli bir "öğretmen" modelinin çıktılarını taklit ederek öğrendiği bir eğitim tekniğidir. Analistler, Kimi K3'ün kısmen damıtma yoluyla geliştirilmesi durumunda, öğretmeni olarak görev yapan model ne olursa olsun, yeteneklerinde bir tavan miras alabileceğini ve bu durumun, karmaşık siber saldırı operasyonları gibi en zor görevlerdeki performansı potansiyel olarak sınırlayabileceğini öne sürüyor.
Bu hipotez sadece bir hipotez olarak kalıyor. Ön rapor, boşluğun neden var olduğunu açıklamıyor, yalnızca var olduğunu ortaya koyuyor. Diğer olası faktörler arasında kasıtlı yetenek kısıtlamaları, eğitim verilerindeki farklılıklar veya modeli yaygın olarak bulunan donanımlarda çalışacak kadar verimli tutmak için yapılan ödünleşimler yer alır.
Heyecanlı bir siyasi ortam
Değerlendirme, ABD'nin Çin yapay zeka sistemlerini incelemeye yönelik daha geniş bir çabasının ortasında yer alıyor. Temmuz ayının başlarında Trump yönetimi, siber güvenlik kaygılarını öne sürerek Çin tarafından geliştirilen yapay zeka modellerinin ABD'de kullanımını kısıtlama çabalarını yeniden canlandırdı ve bu tartışmada Kimi K3'ün adı defalarca verildi. ABD yasa koyucuları, yabancı modellerin ürünlerine entegre edilmesinin veri güvenliği üzerindeki etkileri konusunda Amerikan şirketlerine ayrı ayrı baskı yaptı.
Bu çerçevede, hükümet Çin'in en önde gelen açık siklet modelinin hücum kesintilerinde iki yönde düşük performans gösterdiğini tespit etti. Kısıtlamaları savunanlar için bu, modelin test edilecek kadar ciddiye alındığına dair resmi kanıt sağlıyor. Aşırıya kaçma konusunda temkinli olanlar için, nispeten düşük bir siber puan, her Çin modelinin acil bir siber tehdidi temsil ettiği yönündeki anlatımı da karmaşık hale getiriyor.
Açık ağırlığın benimsenmesi ne anlama geliyor?
Sonuç aynı zamanda daha geniş anlamda açık ağırlıklı yapay zekaya ilişkin ayrı bir tartışmayı da besliyor. Açık ağırlık modellerinin savunucuları, serbestçe indirilebilen ağırlıkların, tıpkı CAISI ve Birleşik Krallık AISI'nin yürüttüğü gibi bağımsız güvenlik testlerine olanak sağladığını ve açık dağıtımı güvenlik açısından net bir olumlu hale getirdiğini ileri sürüyor. Eleştirmenler, aynı açıklığın, kötü niyetli aktörlerin yetenekli sistemleri değiştirme veya kötüye kullanma engelini azalttığını söylüyor.
Kimi K3'ün durumunda, açık ağırlık kullanılabilirliği tam da bu bağımsız hükümet değerlendirmesini mümkün kılan şeydi. Nispeten mütevazı siber skorun politika yapıcılara güvence mi yoksa alarm mı vereceği, muhtemelen sayının kendisine daha az, ABD ve İngiltere kurumlarının önümüzdeki haftalarda bunu nasıl çerçeveleyeceğine daha fazla bağlı olacak.
Şimdilik ön değerlendirme bir referans noktası olarak duruyor: Kimi K3'ün saldırgan siber yeteneklerine ilişkin ilk resmi Batılı ölçüm ve onu sıklıkla karşılaştırılan sınır ABD modellerinin oldukça gerisine yerleştiren bir ölçüm.
Yapay Zekanın Önünde Olun
Siber yetenek puanları, yapay zeka güvenliği, düzenlemeleri ve küresel rekabete ilişkin çok daha büyük bir yarışmanın yalnızca bir cephesini oluşturuyor. Politika ortamı her hafta değişiyor ve tek bir değerlendirmeyi kaçırmak, bir sonraki başlığın ardındaki bağlamı kaçırmak anlamına gelebilir. Önemli olan her model yayınını, hükümet kararını ve güvenlik değerlendirmesini takip etmek için AI Buzz Wire'da daha fazla AI haberini okuyun.
Yapay zeka yarışında bir adım önde olun — AI Buzz Wire'ı ziyaret edin


