Yapay zeka ve büyük dil modeli güvenliği. Prompt injection, jailbreak, AI agent, RAG, AI red teaming.
Büyük Dil Modelleri artık dosya okuyabilen, araç kullanabilen sistemlere dönüştü; ancak doğal dili yorumlama biçimleri saldırganların modeli manipüle etmesine olanak tanıyor. Bu yazıda Prompt Injection'ın ne olduğunu, türlerini (direct, indirect, multi-turn, jailbreak), AI Agent ve RAG sistemlerindeki artan riskini ve katmanlı savunma yaklaşımlarını inceliyoruz.
Bu çalışma, insan kaynakları departmanlarına entegre edilen büyük dil modellerinin (LLM), kurumsal hiyerarşi ve teknik yetki manipülasyonu içeren siber saldırılar karşısında şirket bordro gizliliğini koruma performansını ampirik verilerle incelemektedir. AltayDuel test süreçlerinde yer alan tr-hr-bordro senaryosu kapsamında model dirençleri analiz edilmiştir.
Geleneksel uygulama güvenliği, veri ile kod arasına keskin güven sınırları çizer; LLM mimarilerinde ise bu sınırlar yapısal olarak çöker. Bu çalışmada, yapay zeka tabanlı sistemlerde semantik sınır keşfi süreçleri, Policy Fingerprinting kavramı ve bu keşif faaliyetlerine karşı geliştirilebilecek mimari yalıtım yaklaşımları inceleniyor.
Geleneksel uygulama güvenliği, veri ile kod arasına keskin güven sınırları çizer; LLM mimarilerinde bu sınırlar yapısal olarak çöker. Bu çalışmada, yapay zekanın ham veriyi komut gibi işlediği Anlamsal Yürütme Alanı kavramı, kesin kurallı doğrulamanın yetersiz kaldığı Epistemik Güvenlik krizi ve bu çöküşe karşı geliştirilebilecek mimari yalıtım yaklaşımları inceleniyor. Katmanlı Tehdit Evrimi serisinin ilk bölümü.
LLMjacking, saldırganların başkalarına ait yapay zeka sunucularını ele geçirerek hesaplama gücünü ücretsiz kullandığı bir saldırı türü. Ollama, LM Studio gibi yerel LLM araçları yanlış yapılandırıldığında internete açık kalıyor; Shodan bu sunucuları birkaç saatte buluyor. Korunmak için localhost bağlaması, kimlik doğrulama ve kaynak izleme zorunlu.
Bu çalışma; kurumsal ve kamusal personelin günlük iş süreçlerinde harici Büyük Dil Modeli (LLM) servislerini kullanırken gerçekleştirdiği anlamsal veri aktarımlarını, bu sızıntıların geleneksel DLP mimarileri tarafından neden engellenemediğini ve siber savaş senaryolarındaki risk yüzeylerini teknik boyutlarıyla ele almaktadır.
Bu çalışma, bankacılık sektöründe müşteri destek operasyonlarına entegre edilen büyük dil modellerinin (LLM), kritik iç verileri [Tek Kullanımlık Şifreler (OTP)] koruma performansını ampirik verilerle incelemektedir. AltayDuel test süreçlerinde yer alan tr-finbot-otp senaryosu kapsamında model dirençleri analiz edilmiştir.
Bu çalışma, kamu/devlet sektöründe vatandaşlık portallarına entegre edilen büyük dil modellerinin (LLM), kritik vatandaş verilerini [e-Devlet PIN kodları] siber manipülasyonlara karşı koruma performansını ampirik verilerle incelemektedir. AltayDuel platformunda gerçekleştirilen tr-edevlet-pin simülasyonlarında, Kırmızı Takım (Red Team) %89.5 gibi kritik bir başarı oranına ulaşmıştır.
Büyük Dil Modellerinin (LLM) statik bilgi sınırlarını aşmak için kullanılan RAG altyapıları, dolaylı komut enjeksiyonu (Indirect Prompt Injection) zafiyetini doğurur. Bu çalışmada, RAG hatlarındaki vektör tabanlı erişim manipülasyonları, yerel test ortamlarında gözlemlenen görünmez karakter tehditleri ve siber savunma perspektifinde kurulabilecek katmanlı bariyer tasarımları incelenmiştir.
Uç cihazlarda (Edge-AI) çalışan derin öğrenme modelleri, fiziksel model hırsızlığı ve IP korsanlığı tehdidi altındadır. Bu yazıda, donanımsal kök güvenlik (Root of Trust) sağlayan Fiziksel Klonlanamaz Fonksiyonlar (PUF) ile model ağırlıklarının nasıl korunabileceğini ve CyberPUF projesi üzerinden pratik bir uygulamayı inceliyoruz.
Prompt injection'a karşı tek bir savunma katmanı asla yeterli değildir. Bu rehberde girdi filtreleme, sistem promptu sertleştirme, çıktı denetimi ve mimari izolasyon olmak üzere dört katmanlı bir savunma stratejisini örneklerle inceliyoruz.