
Dizüstü bilgisayarda Gemma 4 hızlıdır. GPU işini yapar, cevaplar saniyeler içinde gelir ve model gerçek bir asistan gibi hissettiri. Bunu NAS’a taşıyın ve bir soru küçük bir taahhüt haline gelene kadar yavaşlayacak. İşte bu fark önemlidir. Model paylaşılan depolamada bulunduğunda, tüm aile veya takım bunu çağırabilir ve ekstra bir saniyelik gecikme, bunu bir duyuştan ziyade yeniden bir araç haline getirir.
Bugün NAS’ta yerel LLM’ler barındırmak için çalıştırdığımız sekiz uygulamayı seçtik. Bazıları sunucudur, bazıları ön uçtur, bazıları dağıtım katmanıdır. Birlikte, bir modeli indirmekten bir istemci ailesinin paylaşılan bir uç noktayı çağırmasına kadar olan iş akışını kapsarlar.
NAS’ta Barındırılan LLM Uygulamasında Nelere Bakılmalı
- Başsız çalışır. NAS’ın monitörü yoktur ve genellikle GPU’su yoktur.
- Sabit bir HTTP API’sini açığa çıkarır, böylece herhangi bir istemci bununla konuşabilir.
- Docker görüntüsünü yeniden paketlemeden modelleri yönetir.
- Tokenleri akışa alır, çünkü NAS’ta barındırılan model daha yavaştır ve akış onu kullanılabilir kılar.
- Bir erişim kontrol katmanı, hatta basit bir token, çünkü uç nokta LAN’da bulunur.
Aşağıdaki sekiz, beşten en az dördünü karşılar. Sıralama, Synology, QNAP veya kendi kendine inşa edilen NAS üzerinde çalıştırılmasının ne kadar kolay olduğuna göre sıralanır.
Hızlı Karşılaştırma
| Uygulama | Şu amaçlar için en iyisi | Şu üzerinde çalışır | GPU Desteği | Lisans |
|---|---|---|---|---|
| Ollama | En kolay NAS’ta barındırılan sunucu | Linux, macOS, Windows | CUDA, Metal, ROCm | MIT |
| LM Studio | Tıklama modeli barındırıcı | Linux, macOS, Windows | CUDA, Metal, ROCm | Proprietary (free) |
| Open WebUI | Paylaşılan web ön ucu | Docker | Arka uç yoluyla | MIT |
| LocalAI | OpenAI uyumlu eklenti | Docker | CUDA, ROCm, CPU | MIT |
| Text Generation WebUI | Güç kullanıcı ayarlama | Linux, macOS, Windows | CUDA, ROCm, CPU | AGPL |
| Jan | Yerel-ilk masaüstü istemcisi | Windows, macOS, Linux | CUDA, Metal, CPU | AGPL |
| vLLM | Yüksek verimli çıkarım | Linux | CUDA (sunucu GPU’ları) | Apache 2 |
| llama.cpp | Çıplak metal CPU çıkarımı | Herhangi biri | Herhangi biri | MIT |
1. Ollama, En Kolay NAS’ta Barındırılan Sunucu İçin En İyi
Ollama NAS için tek komutluk bir kuruluma en yakın şeydir. Docker görüntüsü, port 11434 ve Ollama veya OpenAI API’si ile konuşan her istemci bununla konuşabilir. Model kütüphanesi Llama, Gemma, Mistral, Qwen ve artan sayıda talimat varyantını kapsar.
Nerede Yeterli Değil: İnce taneli örnekleme kontrolleri bayrakların arkasında gizlidir. Prompt şablonlarını elle değiştirmek isteyen herkes modelfile sözdiziminde bitir.
Fiyatlandırma:
- Ücretsiz, MIT.
Platformlar: Linux, macOS, Windows (tümü Docker veya yerel olarak).
İndir: ollama.com
Alt Satır: İlk kez NAS LLM kuran herkes için varsayılan öneri.
2. LM Studio, Tıklama Modeli Barındırıcı İçin En İyi
LM Studio, OpenAI uyumlu bir sunucuyu da çalıştıran masaüstü uygulamasıdır. Bunu NAS’a monte edilmiş bir model klasörüne işaret edin, sunucuyu etkinleştirin ve LAN üzerindeki istemciler bunu çağırabilir. GUI, llama.cpp’nin insanları korkutan parçalarını gizler.
Nerede Yeterli Değil: Öncelikle bir masaüstü uygulamasıdır, bu nedenle NAS’ta başsız kurulum, bunu hafif bir X sunucusunun içinde çalıştırmak veya kurulum için ekranı olan bir NAS seçmek anlamına gelir.
Fiyatlandırma:
- Kişisel kullanım için ücretsiz.
Platformlar: Windows, macOS, Linux.
İndir: lmstudio.ai
Alt Satır: Bir aile üyesi modelleri değiştirmek istediğinde ve terminali dokunmak istemediğinde doğru seçim.
3. Open WebUI, Paylaşılan Web Ön Ucu İçin En İyi
Open WebUI, NAS’ta barındırılan bir arka uç için ChatGPT stili web arayüzüdür. Bunu Ollama, LM Studio veya LocalAI’ye işaret edin, kullanıcılar ekleyin ve her hane halkı üyesi kendi sohbetleri ve paylaşılan komut istemlendiğini alır. Yerel dosyalarda RAG kutuda gelir.
Nerede Yeterli Değil: Bir ön uçtur, çalışma zamanı değildir. Ollama veya LocalAI hala model çalışmalarını yapar.
Fiyatlandırma:
- Ücretsiz, MIT.
Platformlar: Linux’ta Docker, artı Portainer üzerinden yerel NAS kurulumu.
İndir: openwebui.com
Alt Satır: Ollama ile doğru eşleştirme, hedef paylaşılan, tarayıcı-odaklı bir aile sohbeti olduğunda.
4. LocalAI, OpenAI Uyumlu Eklenti İçin En İyi
LocalAI, yerel modellere karşı OpenAI uyumlu bir uç noktayı (sohbet, gömmeleri, resimler, TTS) açığa çıkarır. OpenAI API’si ile konuşan herhangi bir uygulama değişiklik olmadan bununla konuşabilir. Arka uçlar llama.cpp, whisper.cpp ve stable-diffusion.cpp’yi kapsar.
Nerede Yeterli Değil: Yapılandırma dosyası yoğundur ve her model kendi girdisine ihtiyaç duyar. Ollama eşleştirmeyi sizin için işler.
Fiyatlandırma:
- Ücretsiz, MIT.
Platformlar: Linux’ta Docker, artı Windows ve macOS için yerel derlemeler.
İndir: localai.io
Alt Satır: İstemci OpenAI SDK olduğunda ve temel URL’yi değiştirmek tüm geçiş olduğunda doğru sunucu.
5. Text Generation WebUI, Güç Kullanıcı Ayarlaması İçin En İyi
Text Generation WebUI (oobabooga), bir sunucu da çalıştıran daha eski, daha zengin ön uçtur. Örnekleme parametreleri, LoRA yükleme ve karakter kartı stili komut şablonları tümü açığa çıkarılır. Varsayılan ötesinde bir model ayarlamak isteyen herkes burada oturur.
Nerede Yeterli Değil: Arayüz iki kez yeniden inşa edildi ve hala güç kullanıcı köklerini gösteriyor. Bu, bir aile üyesine verdiğiniz araç değildir.
Fiyatlandırma:
- Ücretsiz, AGPL.
Platformlar: Windows, macOS, Linux.
İndir: github.com/oobabooga/text-generation-webui
Alt Satır: Ollama ve LM Studio’nun gizlediği örnekleme düğmelerini isteyen herkes için seçim.
6. Jan, Yerel-İlk Masaüstü İstemcisi İçin En İyi
Jan, yerel-ilk ChatGPT istemcisidir. Sadece CPU NAS’ları için kendi çalışma zamanı ile gelir, ancak ayrıca uzak Ollama veya LocalAI sunucusuyla konuşur. Sohbetler ve komut istemleri diskte kalır, bu nedenle tüm geçmiş yerel bir dosyadır.
Nerede Yeterli Değil: NAS sunucusu olarak, en güçlü uyum değildir. Bunu istemci olarak kullanın ve Ollama veya LocalAI’ye hizmet etmesine izin verin.
Fiyatlandırma:
- Ücretsiz, AGPL.
Platformlar: Windows, macOS, Linux.
İndir: jan.ai
Alt Satır: Web sekmesi istemeyen herkes için NAS sunucusuna doğru masaüstü arkadaşı.
7. vLLM, Yüksek Verimli Çıkarım İçin En İyi
vLLM, üretim sınıfı sunucudur. Sayfalanmış dikkat, tensor paralelizmi ve sürekli toplu işleme, bunu birçok istemciye büyük bir modele hizmet etmenin en hızlı yoludur. Hile, gerçek bir GPU (Ampere veya daha yeni) gerektiğidir.
Nerede Yeterli Değil: NAS’a uygun bir kurulum değildir. Veri merkezi GPU’su olmayan bir NAS şasisi, docsların varsaydığı şekilde çalıştırılamaz.
Fiyatlandırma:
- Ücretsiz, Apache 2.
Platformlar: Linux (genellikle NVIDIA kapsayıcı araç kiti ile Docker).
İndir: github.com/vllm-project/vllm
Alt Satır: “NAS” bir evde laboratuvarın istemcilerine hizmet veren gerçek GPU’lu bir Linux kutusu olduğunda seçim.
8. llama.cpp, Çıplak Metal CPU Çıkarımı İçin En İyi
llama.cpp, bu listedeki her şeyin sardığı düşük seviye çalışma zamanıdır. Gerçek GPU’nun eksik olduğu yalnızca CPU NAS derlemelerinde çalışır, 8B parametre modelini birkaç gigabayta indiren nicelleştirilmiş modelleri içerir.
Nerede Yeterli Değil: Hiçbir UI yok. Bu bir sunucu ikili ve CLI’dir. Bunu Open WebUI veya Ollama ile eşleştirin.
Fiyatlandırma:
- Ücretsiz, MIT.
Platformlar: Herhangi (Linux, macOS, Windows, Raspberry Pi ve Apple Silicon dahil ARM).
İndir: github.com/ggerganov/llama.cpp
Alt Satır: NAS’ın yalnızca CPU olduğu ve RAM’in her gigabaytının önemli olduğu zaman doğru seçim.
Doğru Olanı Seçme Yöntemi
- NAS’ta tek komutla kurulum: Ollama.
- Hane için paylaşılan web sohbeti: Ollama artı Open WebUI.
- Herhangi bir SDK’nın çağırabileceği OpenAI uyumlu uç noktası: LocalAI.
- Tıklama modeli değişimi: LM Studio.
- Örnekleme ve LoRA kontrolü: Text Generation WebUI.
- Bir NAS’a işaret eden yerel masaüstü istemcisi: Jan.
- Birçok istemci için ciddi GPU verimi: vLLM.
- Yalnızca CPU NAS: llama.cpp.
Sık Sorulan Sorular
Hangi Model GPU Olmayan NAS Üzerinde Çalışır?
3B-8B aralığındaki Gemma, Llama veya Mistral’ın nicelikleştirilmiş versiyonları modern bir NAS CPU’da saniyede birkaç token çalışır. Bu etkileşimli sohbet için yavaştır, tek seferlik bir özet veya gece çalışması için iyidir.
NAS’ımda GPU’ya İhtiyacım Var mı?
Sadece etkileşimli hız için. Yalnızca CPU NAS yine de küçük bir model çalıştırır; yanıt süreleri saniyede token yerine cümle başına birkaç saniyedir.
NAS’ta barındırılan modeli LAN’ımda özel tutabilir miyim?
Evet. Ollama, LM Studio ve LocalAI varsayılan olarak LAN arayüzüne bağlanır. Bir ev LAN’ından daha fazlası için temel kimlik doğrulaması veya ters proxy ekleyin.
Yerel Modeller Ne Kadar Disk Alanı Gerekir?
Bir nicelikleştirilmiş 8B model yaklaşık 5 GB’da oturur. Bir nicelikleştirilmiş 70B model 40 GB’a daha yakın oturur. 500 GB yedek hacmine sahip bir NAS tam bir kütüphane tutar.
Birden Fazla Kişi Aynı Anda Modeli Kullanabilir mi?
Ollama, LocalAI ve Text Generation WebUI’nin tümü varsayılan olarak serileştirir. vLLM eşzamanlı istekleri doğal olarak işler. Küçük bir aile için serileştirme iyidir.
Gizlilik Ne Olacak?
Bu listedeki her uygulama modeli yerel olarak çalıştırır. Uygulama yapılandırılmadığı sürece hiçbir istem veya yanıt üçüncü tarafa gönderilmez.