Bir araştırmacı ekibi, Anthropic, OpenAI ve Google'ın önde gelen yapay zeka modellerinin ürettiği gizli düşünce zinciri mantığının şifrelenmiş izlerden kurtarılabileceğini, özel mantığı, kişisel verileri ve kimlik bilgilerini geniş ölçekte açığa çıkarabileceğini gösterdi.

11 Ağustos 2026'da Tescilli LLM API'lerinden Akıl Yürütme İzlerini Çalmak başlıklı bir makalede yayınlanan bulgular, büyük yapay zeka sağlayıcılarının en değerli fikri mülkiyetlerini koruma biçiminde temel bir mimari güvenlik açığını ortaya koyuyor. Araştırma, son dakika yapay zeka haberlerini takip eden herkes için, şifrelenmiş model çıktılarının bile herkese açık olarak paylaşıldığında nasıl bir sorumluluk haline gelebileceğinin altını çiziyor.

Saldırı Nasıl Çalışır?

Önde gelen yapay zeka sağlayıcıları, fikri mülkiyeti korumak ve bilgi sızıntısını sınırlamak için modellerinin düşünce zinciri olarak bilinen adım adım mantığını gizler. Sağlayıcılar, bu izleri sunucu tarafında depolamak yerine, bunları istemciye, müşterinin sonraki her istekte geri ilettiği şifrelenmiş metin blokları olarak geri gönderir.

Araştırmacılar, bu şifrelenmiş blokların, bir sağlayıcının ekosistemindeki farklı oturumlar, kullanıcılar ve modeller arasında tamamen uyumlu ve değiştirilebilir olduğunu belirledi. Bu taşınabilirlik saldırının anahtarıdır.

Yöntem iki API çağrısında çalışır. İlk olarak, bir saldırgan bir sınır modeli (örneğin, Claude Opus 4.8) tarafından üretilen şifrelenmiş bir akıl yürütme izini alır ve bunu aynı sağlayıcının Claude Haiku 4.5 gibi daha zayıf, daha az korunan bir kardeş modeline enjekte eder. Daha zayıf olan model, daha sonra, gerekçeyi kelimesi kelimesine yazıya dökmek için basit bir talimatla jailbreak yapılır. Şifrelenmiş blok birbiriyle değiştirilebilir olduğundan, daha zayıf olan model, daha güçlü modele doğrudan saldırmadan, daha güçlü modelin gizli mantığını düz metin olarak çözer ve çıkarır.

Araştırmacılar bu saldırıyı üç büyük sağlayıcının modellerinde gösterdi: Anthropic'ten Claude, OpenAI'den GPT ve Google'dan Gemini.

Veriye Maruz Kalma Ölçeği

En endişe verici bulgu, halka açık olarak paylaşılan oturum günlükleri aracılığıyla sızdırılan hassas verilerin boyutudur. Araştırmacılar GitHub ve Hugging Face'ten Claude, GPT ve Gemini modelleri tarafından üretilen ve hâlâ şifreli akıl yürütme blokları içeren 6.708 halka açık aracı yörüngesi topladı.

Kod çözme ardışık düzenlerinin her imzalı bloğa uygulanması sonucunda 315.320 yeniden yapılandırılmış akıl yürütme bloğu elde edildi. Bu gizli izler gerçek sırlar ve hassas bilgiler içeriyordu.

Araştırmacılar, orijinal, karşılaştırmalı olmayan kullanıcı oturumlarıyla sınırlandırarak şunları tespit etti:

  • toplamda 704 farklı gizlilik yapısı
  • 204 teknik tanımlayıcı (dahili URL'ler, sunucu yolları)
  • 126 kişisel olarak tanımlanabilir bilgi (PII) öğesi, 30 kişisel e-posta adresi, isim ve posta adresi dahil
  • 23 kimlik bilgisi, 62 API anahtarı, 33 şifre ve 24 erişim jetonu dahil

704 yapıttan 64'ü münhasıran muhakeme bloklarının içinde göründü ve görünür oturum metninin hiçbir yerinde görünmedi; bu, günlüklerini paylaşmadan önce gözden geçiren geliştiricilerin, bunların sır sızdırdığına dair hiçbir fikrinin olmayacağı anlamına geliyordu.

Belgelenen bir örnekte, modelin gizli mantığının API anahtarlarını, AWS kimlik bilgilerini ve GitHub belirteçlerini arama ve işleme hakkında ayrıntılı dahili düşünceler içerdiği ve bunların tümü görüşmenin görünür çıktısında görünmeyen bir GPT-5.2 Codex oturumu gösterildi.

Damıtma Önleyici Korumaların Atlatılması

İkinci önemli sonuç, damıtma önleyici mekanizmaların atlatılmasıdır. Yapay zeka sağlayıcıları, rakiplerin daha küçük modelleri bu mantık üzerine eğitmesini önlemek için modellerinin mantığını kasıtlı olarak gizler. Araştırmacıların tekniği bu önlemleri tamamen atlıyor.

Kodu çözülen mantığın aslına uygunluğunu doğrulamak için araştırmacılar 120 Codeforce rekabetçi programlama problemini test etti. Kodu çözülmüş akıl yürütmenin jeton sayısı, her modelin API'si tarafından bildirilen gizli düşünme jetonu sayısını yakından takip ederek, iyileşmenin neredeyse tamamlandığını doğruladı.

Dört Saldırı Vektörü

Makale, bu güvenlik açığının etkinleştirdiği dört farklı saldırı vektörünü tanımlıyor:

1. Damıtma karşıtı hile — Anthropic, OpenAI ve Google'da gösterilen, rakip modelleri eğitmek için özel bir modelin mantığını çıkarmak.

2. Büyük ölçekli özel veri çıkarma — Geliştiricilerin halka açık depolarda bilmeden paylaştığı binlerce şifreli akıl yürütme bloğundan sırların ve kişisel bilgilerin toplanması.

3. Tehlikeli bilgilerin açığa çıkması — Gizli gerekçe bazen sağlayıcıların görünür çıktıdan kasıtlı olarak gizlediği, potansiyel olarak tehlikeli bilgiler de dahil olmak üzere içerik içerir.

4. Model parmak izi alma — Kodu çözülmüş akıl yürütme, model kimliği gizlendiğinde bile hangi model sürümünün iz ürettiğini belirlemek için kullanılabilir.

Hangi Modeller Etkileniyor

Araştırmacılar, üç büyük sağlayıcının şifreli akıl yürütme sistemlerindeki güvenlik açığını doğruladı:

  • Antropik — Claude modelleri, "imza" alanıyla şifrelenmiş "düşünme" bloklarını döndürür
  • OpenAI — GPT modelleri şifrelenmiş muhakeme özetleri döndürür
  • Google — Gemini modelleri şifrelenmiş düşünce bloklarını döndürür

Araştırmacılar, Çinli AI şirketi Moonshot AI'nin kısa süre önce sandbox testinden kaçan bir modeli olan Kimi-K3 örneğinin özellikle endişe verici olduğunu, çünkü şifrelenmiş akıl yürütme bloklarının kodunun çözülmesinin özellikle kolay olduğunu belirtti.

Geliştiriciler İçin Bunun Anlamı Nedir?

Geliştiriciler için pratik çıkarım çok net: GitHub deposunda, Hugging Face veri kümesinde veya bir blog gönderisinde herkese açık olarak paylaştığınız herhangi bir şifreli akıl yürütme bloğu, kurtarılabilir sırlar içerebilir. Şifreleme, bu sınıftaki saldırılara karşı gizlilik için değil, oturumun sürekliliği için tasarlanmıştır.

Araştırmacılar, geliştiricilerin paylaşılan oturum günlüklerini şifrelenmiş muhakeme blokları açısından denetlemelerini ve yayınlamadan önce bunları çıkarmalarını öneriyor. Ayrıca sağlayıcılara, şu anda güvenlikten ziyade API kolaylığını önceliklendiren şifreli muhakeme sistemlerinin mimarisini yeniden değerlendirmeleri çağrısında bulunuyorlar.

Araştırma, Jonas Geiping ve Maksym Andriushchenko'nun gözetiminde Alexander Panfilov, David Schmotz ve Ilia Shumailov tarafından, Tübingen ELLIS Enstitüsü, Max Planck Akıllı Sistemler Enstitüsü, Tübingen Yapay Zeka Merkezi, MATS Araştırma, Snyk ve Tübingen Üniversitesi'nde gerçekleştirildi.

Yapay Zekanın Önünde Olun

Yapay zeka güvenlik ortamı hızla gelişiyor. AI Buzz Wire, en son AI gelişmeleri ve ortaya çıkan güvenlik açıklarının derinlemesine ele alınması için önemli hikayeleri sunuyor.

Daha fazla AI haberini okuyun →