XDA’nın Nvidia Personal AI Router hakkındaki yazısı hassas bir noktaya değindi: bir uç nokta arkasında iki bilgisayar, model istekleri ağırlık ve sağlık tarafından yönlendirildi, beş uygulamada yapılandırma dosyalarını düzenlemeden. Önemli olan, Nvidia’nın sürümünün açık kaynak yığınının zaten kapladığı ve daha geniş model desteğiyle kapsadığı bir kategorinin bir çeşidi olması. 4090’lı bir iş istasyonunuz ve dolaptaki Ollama çalıştıran bir mini bilgisayarınız varsa, onları birleştiren bir proxy eksik parçadır.
2026’da yerel LLM çıkarımı için yedi yük dengeleyici ve ağ geçidini test ettik. Her seçim Ollama, vLLM, LM Studio, llama.cpp veya bir kombinasyonun önünde durur, OpenAI uyumlu bir uç nokta ortaya çıkarır ve bir arka uç meşgul, çevrimdışı veya iş için yanlış araç olduğunda yönlendirmeyi işler.
Yerel AI yük dengeleyicisinde nelere bakmalı
- OpenAI uyumlu yüzey. Her ciddi istemci (Open WebUI, Cline, Continue, Aider, Zed)
/v1/chat/completionsbekler. Yönlendiricinin özel bir API konuşması durumunda, gelecek hafta sonu istemcileri yamalamakla geçeceksiniz. - Arka uç kapsamı. Ollama, vLLM, LM Studio, llama.cpp ve SGLang yaygın yerel motorlardır. Tümünü kapla veya yönlendiriciyi üç ay içinde kaldıracaksın.
- Sağlık kontrolleri ve yük devretme. Yerel sistemler çevrimdışı olur. Çökmüş bir GPU’ya istek göndermeye devam eden bir yönlendirici round-robin’den daha kötüdür.
- Maliyet ve yetenek tabanlı yönlendirme. Her isteme 70B model gerek değildir. Hafif istekleri küçük yerel modele yönlendir ve büyük olanı zor durumlar için ayır.
- Gözlemlenebilirlik. Günlükler, model başına gecikme ve istek izlemeleri “yavaş” ile “8B her zaman ilk cevapladığı için tüm trafiği yiyor” arasındaki farktır.
Hızlı karşılaştırma
| Uygulama | En iyi | Arka Uçlar | Lisans | Açık kaynak |
|---|---|---|---|---|
| LiteLLM | 100+ sağlayıcısı olan evrensel proxy | OpenAI uyumlu herhangi biri | MIT | Evet |
| Olla | Saf yerel, küçük ayak izi | Ollama, vLLM, LM Studio, SGLang, llama.cpp | Apache 2.0 | Evet |
| Nvidia Personal AI Router | Windows’ta Nvidia donanım kurulumları | Nvidia tarafından optimize edilmiş arka uçlar | Ücretsiz (kayıt) | Hayır |
| vLLM | Yüksek verimli tek model sunumu | vLLM motoru | Apache 2.0 | Evet |
| Ollama | En basit çok modelli sunucu | Yerel | MIT | Evet |
| LocalAI | Daha fazla medya modeli ile açık kalıp OpenAI kopyası | GGUF, ONNX, diffusers | MIT | Evet |
| Portkey | İlke denetimleri ile kurumsal ağ geçidi | 200+ sağlayıcı | AGPL / ücretli katman | Kaynak-kullanılabilir |
Yerel AI çıkarımı yük dengelemesi için 7 en iyi uygulama
1. LiteLLM — genel olarak en iyi
LiteLLM modellerinizin önünde Python veya Rust proxy olarak çalışır ve OpenAI ile konuşan bir /v1 uç noktası çıkarır. Ollama, vLLM, barındırılan Anthropic ve OpenAI’nin herhangi bir kombinasyonuna yönlendir ve aralarında yük dengeleyecek, 429’da geri çekilecek, tekrarlanan istekleri önbelleğe alacak ve anahtar başına bütçeler uygulayacak. 2026 Rust yeniden yazması tek bir düğümde saniyede 1500 isteğin üzerine çıkış sağlar; bu bir ev labu’nun hiç ihtiyacı olmayacağından çok daha fazla ama paylaşılan bir takım ağ geçidinde hoş.
Nerede yetersiz kalır: Yedek ağaçları ve maliyet katmanlarını ekledikten sonra yapılandırma dosyası hızlı büyür. Panel işlevsel ama gösterebileceğin bir şey değil.
Fiyat: Ücretsiz ve açık kaynak (MIT). Ücretli kurumsal katman SSO ve denetim günlükleri ekler.
Platformlar: Windows, macOS, Linux, Docker.
İndir: litellm.ai · GitHub
Sonuç: Ev labu’ndan barındırılan API’lere büyüyen bir yönlendirici istiyorsanız, buradan başla.
2. Olla — en iyi saf-yerel seçim
Olla kendi kendine barındırılan çıkarım için özel olarak tasarlanmış bir LLM proxy’sidir. Ollama, LM Studio, vLLM, llama.cpp, SGLang ve LiteLLM’in kendisi ile konuşur, her arka uçta modelleri otomatik olarak keşfeder ve 50 MB hafızanın altında kalır. İki Ollama kutusu arasında yük devretme beş satırlık bir YAML dosyasıdır ve açığa çıkan metrikler bir eklenti olmadan Prometheus’u besler.
Nerede yetersiz kalır: Yerleşik maliyet izleme veya bütçe uygulaması yok, çünkü barındırılan API’lere dokunmaz. LiteLLM’den daha küçük topluluk.
Fiyat: Ücretsiz ve açık kaynak (Apache 2.0).
Platformlar: Windows, macOS, Linux, Docker. Tek statik ikili.
İndir: thushan.github.io/olla · GitHub
Sonuç: Tüm yığının sahip olduğun donanımda olması ve bir saniyede önyükleyen bir yönlendirici istiyorsanız bunu seç.
3. Nvidia Personal AI Router — Nvidia donanımında en iyi anahtar teslim seçeneği
Nvidia Personal AI Router XDA makalesi’nin konusudur. LAN’ınızı tarar, Nvidia tabanlı çıkarım düğümlerini bulur ve bunları yerel bir uç noktanın arkasında bir havuza sokan bir Windows uygulaması olarak gelir. Model yönlendirmesi, akışı ve kuantizasyon el değiştirmesi yönlendirici içinde işlenir ve aynı paket (Nvidia ChatRTX ve Nvidia AI Workbench) istemci uygulamaları doğrudan takılı.
Nerede yetersiz kalır: Nvidia-ilk: Radeon ve Intel Arc sistemleri ikinci sınıf vatandaşlar. Yönlendirici doğal olarak OpenAI uyumlu bir uç nokta ortaya çıkarmaz, bu nedenle üçüncü taraf istemcilerin bir şim gerekir.
Fiyat: Nvidia geliştirici hesabı ile ücretsiz.
Platformlar: Windows.
İndir: nvidia.com/ai-router
Sonuç: Nvidia ekosistemini asla terk etmezsen iki Nvidia sistemini tek bir AI uç noktasına havuzlamanın en kolay yolu.
4. vLLM — tek güçlü GPU’yu maksimize etmek için en iyi
vLLM kendi başına bir yönlendirici değildir, ancak sürekli toplu işleme ve PagedAttention’ı olan OpenAI uyumlu sunucusu tek bir GPU’da Ollama’nın ulaşabileceği şeyleri geniş bir marjla ileri iter. İki düğümlü kurulumda, vLLM’i LiteLLM veya Olla’nın arkasında çalıştırmak bir takıma bir büyük modeli sunmak için standart patern iken daha ucuz arka uçlar uzun kuyruğu işler.
Nerede yetersiz kalır: Model yükleme Ollama’dan daha yavaş; yalnızca CPU geri çekilmesi yok. Kuantizasyon desteği llama.cpp’nin gerisinde kalır.
Fiyat: Ücretsiz ve açık kaynak (Apache 2.0).
Platformlar: CUDA, ROCm veya Intel XPU ile Linux. WSL2 üzerinden Windows. macOS Metal desteği topluluk tarafından yönlendirilir.
Sonuç: Bunu yönlendiricinin çalışma yönlendireceği arka uçlardan biri olarak kullan, yönlendirici olarak değil.
5. Ollama — basit çok modelli barındırma için en iyi
Ollama çoğu ev kurulumu zaten çalıştırdığı ve yerleşik kuyruğu makul şekilde birden çok eşzamanlı isteği işlediği için listede kalır. Yüksek kullanılabilirlik için ön taraftaki bir yönlendiriciye eşleştir veya sıcak yedek yük devretme için Olla ile iki Ollama kutusu çalıştır.
Nerede yetersiz kalır: GPU başına üretim toplu iş yükleri üzerinde vLLM’den 4-8x geri kalır. Maliyet izleme yok, yönlendirme zekası yok.
Fiyat: Ücretsiz ve açık kaynak (MIT).
Platformlar: Windows, macOS, Linux, Docker.
İndir: ollama.com · GitHub
Sonuç: Güvenilir arka uç, yönlendirici değil. Tut ve ön tarafta daha akıllı bir şey koy.
6. LocalAI — yönlendirici de çıkarım sunucusu olarak görev yapıyorsa en iyi
LocalAI OpenAI API ile konuşan ve LLM’ler, gömme modelleri, TTS, görüntü oluşturma ve konuşmadan metne barındıran tek bir ikilidir. Sahne arkasında diğer Ollama veya vLLM arka uçları çağırabilir; bu, üç yerine bir işlem çalıştırmayı tercih edeceğin tek düğümlü ev labu için tüm-bir-olarak oldukça iyi yapar.
Nerede yetersiz kalır: Hibrit yerel artı barındırılan kurulumlar için LiteLLM’den daha az esnek. Medya model desteği ikili ağır olur.
Fiyat: Ücretsiz ve açık kaynak (MIT).
Platformlar: Windows, macOS, Linux, Docker.
İndir: localai.io · GitHub
Sonuç: Aynı kutudan bir yönlendirici ve tam medya model sunucusu istersen iyi seçim.
7. Portkey — ilke denetimleri gerekiyorsa en iyi
Portkey kurumsal lezzeti seçeneğidir. LiteLLM’in yaptığı gibi yerel ve barındırılan modellerin ön tarafında durur ama koruma rayları, PII redaksiyonu ve takım başına yönlendirme politikaları kutudan çıkar. Kendi kendine barındırılan OSS sürümü yönlendirme temellerini kapsar; SSO, denetim ve yönetilen panel ücretli katmanın arkasında oturur.
Nerede yetersiz kalır: AGPL bazı homelabber’ları korkutur. Tam politika motoru sadece bir takım buna güvenirse faydalı.
Fiyat: Kendi kendine barındırılan ücretsiz (AGPL); ücretli yönetilen katmanlar mütevazı aylık kişi başı ücret ile başlar.
Platformlar: Herhangi bir ana bilgisayar OS’de Docker.
İndir: portkey.ai · GitHub
Sonuç: Tek ev labu için aşırı, küçük takım ağ geçidi için doğru boyut.
Doğru olanı seçme
- Ev labu’ndan barındırılan API’lere büyüyen bir yönlendirici istiyorsanız: LiteLLM.
- Tüm yığını yerel istersin ve en küçük ayak izini istersen: Olla.
- Her iki bilgisayar da Nvidia ise ve asla Windows’tan ayrılmıyorsan: Nvidia Personal AI Router.
- Küçük bir takımın güvenlik rayları ve politika gerekiyorsa: Portkey.
- Diffusers ve TTS’yi de barındıran bir yönlendirici istersen: LocalAI.
- Ollama’yı güvenilir arka ucun ve tek güçlü GPU için vLLM olarak tut.
SSS
Yük dengeleyici ile çıkarım motoru arasında fark nedir?
Çıkarım motoru (vLLM, Ollama, llama.cpp) gerçek modeli çalıştırır. Bir yük dengeleyici veya ağ geçidi (LiteLLM, Olla) ön tarafta oturur ve her isteğin hangi motora gittiğine karar verir. İkisine de ihtiyacın var: biri sunmak için, biri yönlendirmek için.
Barındırılan API’yi geri çekilme olarak kullanarak yerel modelleri yük dengeleleyebilir miyim?
Evet. LiteLLM ve Portkey tam olarak bunun için yapılır. Yerel modeli ilk olarak daha düşük maliyet ağırlığı ile yapılandır, ardından barındırılan sağlayıcı geri çekilme olarak; yönlendirici GPU’nun kapalı veya aşırı yüklü olması durumunda barındırılan API’yi kullanır.
Sadece bir GPU’ya sahipsem yönlendiriciye ihtiyacım var mı?
Kesinlikle değil, ama yine de yardımcı olur. Bir yönlendirici size kararlı bir uç nokta, yeniden deneme mantığı ve gözlemlenebilirlik verir, böylece daha sonra Ollama’yı vLLM’ye değiştirirsen hiçbir istemci uygulamasına dokunmana gerek yoktur.
Nvidia Personal AI Router AMD veya Intel GPU’larla çalışır mı?
Resmi olarak hayır. Nvidia donanımını ve CUDA’yı hedefler. Karışık kurulumlar için, LiteLLM veya Olla OpenAI uyumlu arka uçlara satıcı ne olursa olsun aynı şekilde davranır.
Hangisinin en düşük gecikme süresi var?
Olla testlerde yerel ağ üzerinde 5 ms’nin altını ekler, Go çekirdeği sayesinde. LiteLLM sıcak bir önbellek üzerinde Rust motoru ile 10-15 ms civarında oturur. Çoğu sohbet ve kodlama iş yükü için her ikisi de modelin kendi kod çözme süresi yanında görünmez.