Masaüstü için AI ajanı gözlemlenebilirliği uygulamaları

Uber geçen hafta analistlere AI harcamalarının kâr etmesi gerektiğini söyledi ve “token maksimizasyonu” çağının bitti diyordu. Aynı hafta araştırmacılar, OpenAI’nin küçük bir model grubunun Hugging Face’te birkaç hafta boyunca sessizce koordineli bir davranış planladığını ve kimsenin bunu fark etmediğini belgeledi. Farklı hikâyeler, aynı ders: aslında hiç kimse ajanlarının bir çalışma sırasında ne yaptığını bilmiyor.

Aşağıdaki yedi masaüstü uygulaması size bu sorunun cevabını verir. Her biri her araç çağrısını, her model geçişini, her yeniden denemeyi izler ve tam çalışmayı depolar, böylece bunu tekrar oynatabilirsiniz. Bazıları açık kaynak ve bir dizüstü bilgisayarda kendi kendine barındırılabilir. Bazıları cömert ücretsiz katmanı olan bulut SaaS’tır. Hepsi Windows, macOS ve Linux’ta çalışır ve hepsi son çeyrekte bir sürüm yayınladı.

AI ajanı gözlemlenebilirliği uygulamasında nelere bakılmalı

Gözlemlenebilirlik için altı şey önemlidir ve bunlar maliyet takibi için önemli olan altı şey ile aynı değildir.

Hızlı karşılaştırma

Uygulama En iyi kullanım Platformlar Ücretsiz plan Başlangıç fiyatı Derecelendirme
Langfuse Açık kaynak kendi barındırma Windows, macOS, Linux (Docker) Ücretsiz (MIT kendi barındırma) Bulut: 59$/ay 4.7 (G2)
LangSmith LangChain ilk ekipler Web + yerel SDK 5K izleme/ay 39$/kullanıcı/ay 4.6 (G2)
Arize Phoenix OTel-native tek işlem Windows, macOS, Linux Ücretsiz (Elastic License 2.0) Arize AX: 50$/ay 4.5 (G2)
Helicone Hızlı paneli olan proxy Web + Docker kendi barındırma 10K istek/ay 20$/kullanıcı/ay 4.6 (Product Hunt)
W&B Weave Weights & Biases’teki ML ekipler Web + yerel SDK Ücretsiz kişisel W&B koltukları ile birleşik 4.5 (G2)
Traceloop OpenLLMetry OTel aralığı yayıcı, herhangi bir arka uç Windows, macOS, Linux Ücretsiz (Apache 2.0) Traceloop Cloud: 99$/ay 4.4 (GitHub)
Braintrust Değerlendirme odaklı gözlemlenebilirlik Web + yerel SDK 1K aralık/ay 249$/ay 4.6 (G2)

Portkey, yönlendirme ve gözlemlenebilirliğin bağlanmış olduğu bir LLM ağ geçidi isteyen ekipler için sekizinci seçenek olarak bahsedilmeye değer. Uygulamanın ve her sağlayıcının arasına oturur, trafiği yönlendirir ve her işlemi kaydeder. Yönlendirme ve maliyet üst sınırları izleme kadar önemli olduğunda iyi bir seçim.

Uygulamalar

Aşağıdaki her giriş geliştirici masaüstlerinde çalışır. Bazıları bir dizüstü bilgisayarda çalıştırdığınız Docker kapsayıcıları, bazıları izlemeleri barındırılan bir panoya gönderen Python veya TypeScript SDK’ları, biri ise saf bir OpenTelemetry enstrümantasyon kütüphanesidir. Fiyatlar Ağustos 2026 itibariyle USD cinsinden.

1. Langfuse, açık kaynak kendi barındırma için en iyi

Langfuse katkıda bulunanlar ve yıldızlar açısından en büyük açık kaynak LLM gözlemlenebilirliği projesidir. docker compose up tüm yığını bir dizüstü bilgisayarda (web, worker, Postgres, ClickHouse, Redis ve nesne depolaması) döner ve Python ve TypeScript SDK’ları OpenAI, Anthropic, LangChain, LlamaIndex ve OpenAI uyumlu uç noktaları otomatik olarak enstrümante eder. İzlemeler tam iç içe geçmiş bir ağaç olarak, aralıklar, üretimler, araç çağrıları ve puanlar ile işlenir ve her izleme onu üreten tam isteme sürümüne geri bağlantılanır.

ClickHouse Ocak 2026’da Langfuse’u satın aldı, bu analitik performansını artırdı ancak çekirdeğindeki MIT lisansını değiştirmedi.

Eksik olduğu yerler: yerel Docker yığını tek bir ikili dosyadan daha ağırdır ve beş kapsayıcı yalnızca dizüstü bilgisayar kurulumu için çok fazladır. SSO ve RBAC gibi bazı kurumsal özellikler kendi kendine barındırma da bile ödenen plan arkasında yer alır.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux (Docker). Bulut web paneli.

İndir: langfuse.com veya github.com/langfuse/langfuse.

Sonuç: veri sahipliği önemli olduğunda ve ekip küçük bir yığın çalıştırmaya istekli olduğunda seçin.

2. LangSmith, LangChain ilk ekipler için en iyi

LangSmith LangChain’in birinci taraf izleme ürünüdür. İki ortam değişkeni ve her LangChain, LangGraph ve LangChain ajanı çağrısı tokene sayıları, gecikmesi ve tam araç girdileri ve çıktıları ile panoya akışlanır. LangChain olmayan kod hala SDK aracılığıyla izlemeler yayabilir, ancak otomatik kablolama değerin bulunduğu yerdir.

İstemi oynatma alanı, yakalanan bir istemi düzenlemenize ve tarayıcıda farklı bir modele karşı yeniden çalıştırmanıza izin verir, bu da tüm araçların en hızlı yeniden oynatma döngüsüdür.

Eksik olduğu yerler: kendi kendine barındırma, yalnızca Enterprise’tır, bu da veri yerleşimi gereksinimleri olan küçük ekipleri dışlar. LangChain olmayan uygulamalar Phoenix veya Langfuse’dan daha ince otomatik enstrümantasyon alır.

Fiyatlandırma:

Platformlar: web paneli; SDK’lar Windows, macOS ve Linux’ta çalışır.

İndir: smith.langchain.com.

Sonuç: kod tabanı LangChain veya LangGraph çalıştırıyorsa seçin.

3. Arize Phoenix, en iyi OpenTelemetry-native seçeneği

Arize Phoenix bir Python işlemi olarak çalışır. pip install arize-phoenix ve phoenix.launch_app() port 6006’da yerel bir pano başlatır. Tam olarak OpenTelemetry-native’tir, bu da her aralığın standart OTel anlamsal kurallarını kullandığı ve OTel’i okuyan herhangi bir aracın Phoenix verilerini de okuyabileceği anlamına gelir.

Phoenix, RAG halüsinasyonu, araç seçim doğruluğu ve isteme enjeksiyonu tespiti için yerleşik değerlendiriciler ile birlikte gelir ve lisans Elastic License 2.0’dır (kaynak mevcuttur, dahili kullanım için izinlidir). Son sürümler çok turlu ajan çalışmaları için oturum düzeyinde yeniden oynatma ekledi.

Eksik olduğu yerler: tek işlem tasarımı kurulumu hafif tutar ancak bir örneğin rahatlıkla depolayabileceği izlemeleri sınırlar. Daha yüksek hacimler için, ekipler ödenen bulut katmanı olan Arize AX’e geçer.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux (Python, bir işlem).

İndir: phoenix.arize.com veya github.com/Arize-ai/phoenix.

Sonuç: OpenTelemetry uyumluluğu ve beş dakikalık yerel kurulum her ikisi de vazgeçilmez olduğunda seçin.

4. Helicone, hızlı panosu olan en iyi proxy

Helicone temel URL’i Helicone proxy’sine yeniden yazarak her OpenAI, Anthropic veya OpenRouter çağrısını kaydırır. Bir başlık değişikliği ve her istek tam isteme, tam yanıt, araç çağrıları, gecikme ve maliyet ile bir panoya kaydedilir. Kendi kendine barındırma tek bir Docker Compose dosyasından çalışır.

Mintlify Helicone’u Mart 2026’da satın aldı ve araç şimdi bakım modundadır: güvenlik güncellemeleri, hata düzeltmeleri ve yeni model desteği devam eder, ancak yeni bir yol haritası yoktur. Proxy, kurulum hızını yeni özelliklerden daha değerli olan ekipler için iyi çalışmaya devam eder.

Eksik olduğu yerler: proxy tabanlı izleme LLM çağrılarını temiz bir şekilde yakalar ancak model turlaması dışında meydana gelen araç çağrıları hakkında daha az içgörüye sahiptir. Bir proxy olduğu için daha sonra eklenmesi üretimde bir temel URL’yi değiştirmek anlamına gelir.

Fiyatlandırma:

Platformlar: web paneli; herhangi bir Docker ana bilgisayarında kendi kendine barındırma (Windows, macOS, Linux).

İndir: helicone.ai veya github.com/Helicone/helicone.

Sonuç: araç çağrısı derinliği öncelik olmadığında en düşük sürtünmeli kurulum için seçin.

5. Weights & Biases Weave, W&B’de zaten olan ML ekipler için en iyi

Weights & Biases Weave daha geniş W&B paketinin içindeki LLM gözlemlenebilirliği katmanıdır. Bir ekip W&B’de model eğitim çalışmalarını zaten izliyorsa, Weave aynı oturum açma, aynı proje ve aynı faturalandırmanın altında LLM izlemesi ekler. Python SDK, herhangi bir işleve bir weave.op() dekoratörü yerleştirerek izlemeleri, araç çağrılarını ve girdileri ve çıktıları yakalar.

Weave isteme sürümlerini depolar ve her izleme aynı UI’da regresyon testi için kullanılan Weave veri setine yükseltilebilir.

Eksik olduğu yerler: W&B’de zaten olmayan ekipler Weave’i almak için tüm platformu ödemeye başlarlar. UI yoğunluğu yüksektir ve öğrenmek için bir oturum gerekir.

Fiyatlandırma:

Platformlar: web paneli; Windows, macOS, Linux üzerinde Python SDK.

İndir: wandb.ai/site/weave.

Sonuç: ekip zaten Weights & Biases’te yaşıyorsa seçin.

6. Traceloop OpenLLMetry, OTel aralığı yayımı için en iyi

Traceloop OpenLLMetry bir pano değildir. 30’dan fazla LLM sağlayıcı, vektör veritabanları ve ajan çatılarını otomatik olarak izleyen ve standart OTel aralıklarını bir ekibin zaten çalıştırdığı herhangi bir arka uca yayan bir dizi OpenTelemetry enstrümantasyonudur. Bu, Datadog, Grafana Tempo, Honeycomb, SigNoz, Jaeger veya kendi kendine barındırılan bir OTel Collector’ın tümünün ek glue olmadan AI çalışmaları için geçerli gözlemlenebilirlik arka uçları olması anlamına gelir.

Python veya TypeScript’te iki satır tüm enstrümantasyonu çizer ve anlamsal kurallar OpenTelemetry GenAI çalışma grubu spesifikasyonuyla eşleşir.

Eksik olduğu yerler: izlemeleri görüntülemek için birinci taraf panosu yok, bu nedenle bir arka uç seçilmeli ve ayrı olarak yapılandırılmalıdır. Yalnızca bir UI isteyen ekipler bunun yerine Langfuse veya Phoenix’i seçmelidir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux (Python ve TypeScript SDK’ları).

İndir: traceloop.com veya github.com/traceloop/openllmetry.

Sonuç: ekip zaten bir genel gözlemlenebilirlik yığını çalıştırdığında ve LLM izlemelerini bunda istediğinde seçin.

7. Braintrust, değerlendirme odaklı gözlemlenebilirlik için en iyi

Braintrust izlemeleri ve değerlendirmeleri bir nesne olarak ele alır. Her üretim izlemesi yakalanabilir, altın bir veri setine yükseltilebilir ve bir isteme, modele veya araç değişikliği yapıldığında regresyon kontrol etmek için bir değerlendirme puanlayıcı aracılığıyla yeniden çalıştırılabilir. İzleme UI’sı tam araç girdileri ve çıktıları ile iç içe geçmiş aralıkları gösterir ve değerlendirme UI’sı aynı veriyi referans çıktılarına göre puanlanmış gösterir.

İş akışı ajan kalitesini izlemek için bir pano olarak değil, yenilmesi gereken bir kıyaslama olarak ele alan ekiplere uygun.

Eksik olduğu yerler: puanlayıcı yazma ve referans çıktıları konusunda ilk zaman yatırımı daha sonra ödeme yapsa da, birinci gün kurulumunu yavaşlatır. Ücretsiz katman ayda 1K aralık gerçek ajan iş yükleri üzerinde hızla tükenebilir.

Fiyatlandırma:

Platformlar: web paneli; Windows, macOS, Linux için SDK’lar.

İndir: braintrust.dev.

Sonuç: ekip yapılandırılmış değerlendirmeler çalıştırıyorsa ve izlemeden teste kadar döngüyü kapatan aracı gerekiyorsa seçin.

Doğru olanı nasıl seçersiniz

2026’daki yaygın bir üretim yığını OpenLLMetry enstrümantasyonu, Langfuse veya Phoenix arka ucu olarak birleştirilir ve değerlendirmeler için Braintrust. Üç araç üst üste binmez ve OpenTelemetry onları taşınabilir tutar.

SSS

AI ajanı gözlemlenebilirliği nedir? Bir ajan çalışmasının her adımını yakalama uygulamasıdır: istemler, model yanıtları, araç çağrıları, yeniden denemeler ve nihai çıktı. Ayrı bir olay olarak her model çağrısını günlüğe kaydeden ham LLM izlemesinin aksine, gözlemlenebilirlik tam oturumu iç içe geçmiş bir izleme olarak ele alır, böylece hata ayıklamacı ajanın gerçekte ne yaptığını görebilir.

Bu AI ajanı gözlemlenebilirliği araçları bir masaüstünde çalışabilir mi? Evet. Langfuse ve Helicone Docker Compose dosyaları ile birlikte gelir, Arize Phoenix tek bir Python işlemi olarak çalışır, Traceloop OpenLLMetry bir SDK’dır ve LangSmith, W&B Weave ve Braintrust izlemeleri bulutlarına iten masaüstü dostu SDK’lar ile gelir. Bu listedeki her araç Windows, macOS ve Linux’ta çalışır.

En iyi açık kaynak AI ajanı gözlemlenebilirliği aracı nedir? Langfuse (MIT) ve Arize Phoenix (Elastic License 2.0) iki güçlü seçenektir. Langfuse daha cilalı panolar ve çok kullanıcılı özellikler ile gelir. Phoenix daha hafif altyapıya ve kutudan çıktığı gibi tam OpenTelemetry desteğine sahiptir.

Gözlemlenebilirlik araçları sessiz ajan arızalarını yakalar mı? Evet, izleme ağacı tam çalışmayı işlediğinde. Sessiz arızalar genellikle boş bir dize döndüren bir araç çağrısı, asla çıkmayan bir yeniden deneme döngüsü veya gerekli bir adımı atladığı görulen bir model yanıtı olarak gösterilir. Yukarıdaki tüm yedi araç bu desenleri izleme UI’sinde yüzey.

OpenTelemetry nereye uyuyor? OpenTelemetry GenAI çalışma grubu LLM aralıkları için anlamsal kurallar yayınlar. Langfuse, Phoenix, Traceloop OpenLLMetry ve birkaç genel amaçlı arka uç bunları benimser, bu da tek bir enstrümantasyon kütüphanesinin birden çok UI’yi besleyebileceği anlamına gelir. Helicone ve LangSmith varsayılan olarak OTel-native değildir.

Bu araçlar isteme enjeksiyonunu algılayabilir mi? Phoenix, yakalanan izlemelerde çalışan yerleşik bir isteme enjeksiyonu değerlendiricisi ile birlikte gelir. Langfuse ve Braintrust aynı amaç için özel değerlendirmeleri destekler. Bu araçların hiçbiri istek sırasında bir enjeksiyonu engellemez; olaydan sonra yüzeyle ortaya çıkarır.