Softonic bu hafta OpenAI ve Anthropic’in birlikte bir dizi AI ajan açığını açıkladığını rapor etmiştir ve bunu takip eden sorumluluk sorusu asıl hikayedir. Eğer bir kodlama ajanı bir klasörü silerse çünkü bir web sayfası ona söyledi, birinin bundan sorumlu olması gerekir. Masaüstü kullanıcısının doğru yanıtı ajanları çalıştırmayı durdurmak değildir. Bunun yerine onları guardrail’ler arkasında çalıştırın. Ajan girdilerini ve çıktılarını filtreleyen, yürütmelerini izole eden ve ne yaptıklarını kaydeden 7 uygulamayı test ettik, böylece bir şey ters gittiğinde bunu tetikleyen tam istemi gösterebiliriz.
AI ajan güvenliği uygulamasında nelere bakılacak
Ajan güvenliği üç soruna ayrılır: ajan ne okur, ajan ne yapar ve ajan ne bırakır. Gerçek herhangi bir kurulum üçünü de içermesi gerekir.
- Prompt injection ve PII için prompt giriş filtreleme
- Yapısal kurallar karşısında çıktı doğrulaması
- Shell yürütme için bir sandbox, böylece ajan yanlış dosyaya dokunmaz
- Her istem, araç çağrısı ve yanıtının denetim günlükleri
- Kullanımda olan kodlama ajanlarıyla entegrasyon (Claude Code, Cursor, Cline)
- Mümkün olduğunda yerel olarak çalıştırın, üçüncü taraf hizmeti her istemi görmez
Hızlı karşılaştırma
| App | Best for | Platforms | Free | Cost | Rating |
|---|---|---|---|---|---|
| Guardrails AI | Yapısal ve içerik guardrail’leri | Windows, macOS, Linux, Python | Yes | Free tier + paid Hub | 4.7 (GitHub) |
| NeMo Guardrails | Kural tabanlı konuşma güvenliği | Windows, macOS, Linux | Yes | Free | 4.6 |
| Rebuff | Prompt-injection algılama | Windows, macOS, Linux, cloud | Yes | Free tier | 4.5 |
| Docker Desktop | Ajanlar için kapsayıcı sandbox | Windows, macOS, Linux | Yes | 9/user/mo Pro | 4.5 |
| gVisor | Kapsayıcılar için çekirdek düzeyinde sandbox | Linux, macOS Docker | Yes | Free | 4.4 |
| Firecracker | Hafif yalıtım için Micro-VM’ler | Linux | Yes | Free | 4.6 |
| LangKit | LLM istekleri için çalışma zamanı ölçümleri | Windows, macOS, Linux | Yes | Free | 4.5 |
1. Guardrails AI, yapısal ve içerik guardrail’leri için en iyi
Guardrails AI model çağrılarını bildirim kurallarına sarmalayan bir Python kütüphanesi ve Hub’dır. “Çıktı bu alanlarla geçerli JSON olmalı”, “çıktı PII içermemelidir”, “çıktı shell komutu içermemelidir” deyin ve kütüphane yeniden yazar, yeniden dener veya çağrıyı reddeder. Hub, önceden oluşturulmuş doğrulayıcıların bir pazarını ekler.
Nerede eksik: Python-merkezli, bu nedenle “Cursor’ün sadece iyi davranmasını istiyorum” durumlarından daha iyi ajan çerçeveleri için uyar.
Fiyatlandırma:
- Free: core library, Apache 2.0
- Paid: paylaşılan doğrulayıcılar ve barındırılan uygulama için Hub Pro katmanı
Platformlar: Windows, macOS, Linux, Python
Download: Guardrails AI | GitHub
Bottom line: kendi ajanımızı yazarken ve kötü çıktıda yüksek sesle başarısız olmasını istediğimizde seçilecek araç.
2. NeMo Guardrails, kural tabanlı konuşma güvenliği için en iyi
NeMo Guardrails NVIDIA tarafından, Colang adlı küçük bir alan özel dilde politika tanımlamak, sonra herhangi bir LLM çağrısını sarmak için bize izin verir. Bir politika “kullanıcı sistem istemi hakkında soru soruyorsa reddet” veya “alan sorularını cevaplamadan önce daima alma aracını çağır” diyebilir. Colang model çağrısından önce, sırasında ve sonra çalışır.
Nerede eksik: Colang öğrenilecek bir dildir ve çalışma zamanı gecikme süresi ekler.
Fiyatlandırma:
- Free: open source, Apache 2.0
- Paid: yok, ancak eğitim yığını için NeMo Enterprise hizmetleri mevcut
Platformlar: Windows, macOS, Linux
Download: NeMo Guardrails
Bottom line: ajan kullanıcıya dönükse ve politika kuralları istemi dışında yaşamalıysa öğrenme eğrisine değer.
3. Rebuff, prompt-injection algılama için en iyi
Rebuff tek bir soruna adanmış küçük bir kütüphanedir: prompt injection’ı modele ulaşmadan önce yakalayın. Buluşsal yöntemler, bilinen saldırı dizelerinin vektör DB’si ve muasır token yaklaşımı kullanır. Bir enjeksiyona benzeyen herhangi bir şey işaretlenir ve çağıran kod ne yapacağına karar verir.
Nerede eksik: buluşsal yöntemler hatalı pozitiflere sahip ve vektör yaklaşımı çalışan bir vektör DB’sine ihtiyaç duyar.
Fiyatlandırma:
- Free: open source, MIT
- Paid: barındırılan vektör DB ve paylaşılan saldırı corpus ile bulut katmanı
Platformlar: Python, JavaScript, cloud
Download: Rebuff
Bottom line: uzmanlaşmış araç. Genel amaçlı guardrail kütüphanesinden önce bağlayın.
4. Docker Desktop, tanıdık kapsayıcı sandbox için en iyi
Docker Desktop listede en az göz alıcı girişi ve muhtemelen en kullanışlı olanıdır. Kodlama ajanlarını repo okuma-yazma olacak şekilde monte edilen bir kapsayıcı içinde çalıştırın ve diğer her şey salt okunur olsun, ve hatta düşmanca bir istem makineyi rm yapamaz. Birimler ana bilgisayara handoff’ları açık yapar.
Nerede eksik: masaüstü uygulaması RAM’de ağır ve lisanslama üç yılda iki kez değişti.
Fiyatlandırma:
- Free: Kişisel ve küçük takımlar (250’den az çalışan)
- Paid: 9/user/mo Pro, Team için daha fazla
Platformlar: Windows, macOS, Linux
Download: Docker Desktop
Bottom line: “Claude’a dosya sistemime erişim vermeden npm install çalıştırmasına nasıl izin veririm” sorusunun pratik cevabı.
5. gVisor, çekirdek düzeyinde sandbox için en iyi
gVisor Google tarafından yazılmış bir userspace çekirdeğidir. gVisor altında çalışan kapsayıcılar yalnızca sistem çağrılarının bir alt kümesini yapabilir, bu nedenle bir kapsayıcı kaçışı bile ana bilgisayar çekirdeğine ulaşamaz. Normal bir kapsayıcıdan daha ağır, ancak tam bir VM’den çok daha hafif.
Nerede eksik: performans ek yükü gerçek ve her iş yükü ayarlamalar olmadan altında çalışmaz.
Fiyatlandırma:
- Free: open source, Apache 2.0
- Paid: yok
Platformlar: Linux ve macOS’te Linux-inside-Docker
Bottom line: yabancılardan kod dokunuş ajanları için daha derin izolasyon katmanı.
6. Firecracker, Micro-VM’ler için en iyi
Firecracker mikro-VM’ler için KVM tabanlı bir hipervizördür. Önyükleme süreleri bir saniyenin altında, bellek ayak izi megabaytlar cinsinden ölçülür ve yalıtım kapsayıcıdan tam VM’ye daha yakındır. AWS Lambda bunu çalıştırır. Yerel olarak, ajan çalıştırması başına bir Firecracker VM, her işin patlama yarıçapını sınırda tutar.
Nerede eksik: yalnızca Linux ve kurulum beş dakikalık bir egzersiz değil.
Fiyatlandırma:
- Free: open source, Apache 2.0
- Paid: yok
Platformlar: Linux
Download: Firecracker | GitHub
Bottom line: tam VM kısa en güçlü yerel yalıtım seçeneği.
7. LangKit, çalışma zamanı ölçümleri ve gözlemlenebilirlik için en iyi
LangKit WhyLabs tarafından her istemi ve yanıtı metin kalitesi, toksisiyet, duygu, bilinen injeksiyonlara benzerlik ve PII için ölçer. Herhangi bir LLM çağrısının önüne oturur ve panolar zaman içinde anomaliler gösterir. Nokta bloke etmek değil, fark etmektir.
Nerede eksik: gözlemlenebilirlik tek başına bir saldırıyı durdurmaz, gerçekten sonra ne olduğunu açıklar.
Fiyatlandırma:
- Free: open source, Apache 2.0
- Paid: barındırılan panolar için WhyLabs platformu, yaklaşık 200/mo’dan
Platformlar: Windows, macOS, Linux
Download: LangKit
Bottom line: “az önce ne oldu” katmanı. Bunu yukarıdaki zorlayıcılardan herhangi biriyle eşleştirin.
Doğruyu nasıl seçersiniz
- Kötü model çıktısını yeniden yazmak veya reddetmek için: Guardrails AI.
- İstemi dışında politika kuralları için: NeMo Guardrails.
- Prompt-injection algılama özel olarak için: Rebuff.
- Shell yürütmesini pragmatik bir şekilde sandbox yapmak için: Docker Desktop.
- Linux’ta daha derin yalıtım için: gVisor.
- Micro-VM yalıtımı için: Firecracker.
- Ajanların ne yaptığını ölçmek için: LangKit.
- İstem düzeyi denetim günlüğü için: PromptLayer bir bakış değer, meta verilerle her istek ve yanıtı yakalar.
Savunulabilir bir masaüstü kurulumu genellikle bunlardan üçünü istiflemelidir: bir sandbox (Docker Desktop), bir guardrail katmanı (Guardrails AI veya NeMo) ve gözlemlenebilirlik (LangKit veya PromptLayer).
FAQ
Kodlama ajanlarını gerçekten sandbox yapmam gerekiyor mu?
Ajan shell komutlarını çalıştırır veya dosyalar yazarsa, evet. Yalnızca sohbet ediyorsa, hayır. Hat prompt injection’ı bir eyleme dönüştürüp dönüştüremeyeceğidir.
En kolay ilk adım hangisi?
Kodlama ajanı için kilitlenmiş bir kapsayıcı ile Docker Desktop. Model çağrısına Guardrails AI ekleyin. Bu zaten kazara hasar çoğunluğu engeller.
Bu araçlar modeli Astra tarzı saldırılardan koruyabilir mi?
Doğrudan model saldırılarına karşı, hayır. Bu listede hiçbir şey model ağırlıklarını değiştirmez. Prompt injection, PII sızıntısı ve güvensiz araç çağrılarına karşı, evet.
Ücretsiz katmanlar yeterli mi?
Tek bir geliştirici için, evet. Guardrails AI, NeMo Guardrails, Rebuff, gVisor, Firecracker, LangKit ve PromptLayer’ın tümü gerçek ücretsiz katmanlar vardır. Yalnızca Docker Desktop çok küçük takımların ötesinde ücret almaya başlar.
Bu ajanı yavaşlatır mı?
Guardrail’ler gecikme süresi ekler, bazen yüzlerce milisaniye. Sandbox’lar kapsayıcılar için ihmal edilebilir gecikme süresi ve mikro-VM’ler için biraz daha ekler. Gecikme süresini güvenlik için ticarete edin, her zaman.