Ollama, NAS üzerinde yerel LLM çalıştırmak için kullanılan uygulamalardan biri

Dizüstü bilgisayarda Gemma 4 hızlıdır. GPU işini yapar, cevaplar saniyeler içinde gelir ve model gerçek bir asistan gibi hissettiri. Bunu NAS’a taşıyın ve bir soru küçük bir taahhüt haline gelene kadar yavaşlayacak. İşte bu fark önemlidir. Model paylaşılan depolamada bulunduğunda, tüm aile veya takım bunu çağırabilir ve ekstra bir saniyelik gecikme, bunu bir duyuştan ziyade yeniden bir araç haline getirir.

Bugün NAS’ta yerel LLM’ler barındırmak için çalıştırdığımız sekiz uygulamayı seçtik. Bazıları sunucudur, bazıları ön uçtur, bazıları dağıtım katmanıdır. Birlikte, bir modeli indirmekten bir istemci ailesinin paylaşılan bir uç noktayı çağırmasına kadar olan iş akışını kapsarlar.

NAS’ta Barındırılan LLM Uygulamasında Nelere Bakılmalı

Aşağıdaki sekiz, beşten en az dördünü karşılar. Sıralama, Synology, QNAP veya kendi kendine inşa edilen NAS üzerinde çalıştırılmasının ne kadar kolay olduğuna göre sıralanır.

Hızlı Karşılaştırma

Uygulama Şu amaçlar için en iyisi Şu üzerinde çalışır GPU Desteği Lisans
Ollama En kolay NAS’ta barındırılan sunucu Linux, macOS, Windows CUDA, Metal, ROCm MIT
LM Studio Tıklama modeli barındırıcı Linux, macOS, Windows CUDA, Metal, ROCm Proprietary (free)
Open WebUI Paylaşılan web ön ucu Docker Arka uç yoluyla MIT
LocalAI OpenAI uyumlu eklenti Docker CUDA, ROCm, CPU MIT
Text Generation WebUI Güç kullanıcı ayarlama Linux, macOS, Windows CUDA, ROCm, CPU AGPL
Jan Yerel-ilk masaüstü istemcisi Windows, macOS, Linux CUDA, Metal, CPU AGPL
vLLM Yüksek verimli çıkarım Linux CUDA (sunucu GPU’ları) Apache 2
llama.cpp Çıplak metal CPU çıkarımı Herhangi biri Herhangi biri MIT

1. Ollama, En Kolay NAS’ta Barındırılan Sunucu İçin En İyi

Ollama NAS için tek komutluk bir kuruluma en yakın şeydir. Docker görüntüsü, port 11434 ve Ollama veya OpenAI API’si ile konuşan her istemci bununla konuşabilir. Model kütüphanesi Llama, Gemma, Mistral, Qwen ve artan sayıda talimat varyantını kapsar.

Nerede Yeterli Değil: İnce taneli örnekleme kontrolleri bayrakların arkasında gizlidir. Prompt şablonlarını elle değiştirmek isteyen herkes modelfile sözdiziminde bitir.

Fiyatlandırma:

Platformlar: Linux, macOS, Windows (tümü Docker veya yerel olarak).

İndir: ollama.com

Alt Satır: İlk kez NAS LLM kuran herkes için varsayılan öneri.

2. LM Studio, Tıklama Modeli Barındırıcı İçin En İyi

LM Studio, OpenAI uyumlu bir sunucuyu da çalıştıran masaüstü uygulamasıdır. Bunu NAS’a monte edilmiş bir model klasörüne işaret edin, sunucuyu etkinleştirin ve LAN üzerindeki istemciler bunu çağırabilir. GUI, llama.cpp’nin insanları korkutan parçalarını gizler.

Nerede Yeterli Değil: Öncelikle bir masaüstü uygulamasıdır, bu nedenle NAS’ta başsız kurulum, bunu hafif bir X sunucusunun içinde çalıştırmak veya kurulum için ekranı olan bir NAS seçmek anlamına gelir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: lmstudio.ai

Alt Satır: Bir aile üyesi modelleri değiştirmek istediğinde ve terminali dokunmak istemediğinde doğru seçim.

3. Open WebUI, Paylaşılan Web Ön Ucu İçin En İyi

Open WebUI, NAS’ta barındırılan bir arka uç için ChatGPT stili web arayüzüdür. Bunu Ollama, LM Studio veya LocalAI’ye işaret edin, kullanıcılar ekleyin ve her hane halkı üyesi kendi sohbetleri ve paylaşılan komut istemlendiğini alır. Yerel dosyalarda RAG kutuda gelir.

Nerede Yeterli Değil: Bir ön uçtur, çalışma zamanı değildir. Ollama veya LocalAI hala model çalışmalarını yapar.

Fiyatlandırma:

Platformlar: Linux’ta Docker, artı Portainer üzerinden yerel NAS kurulumu.

İndir: openwebui.com

Alt Satır: Ollama ile doğru eşleştirme, hedef paylaşılan, tarayıcı-odaklı bir aile sohbeti olduğunda.

4. LocalAI, OpenAI Uyumlu Eklenti İçin En İyi

LocalAI, yerel modellere karşı OpenAI uyumlu bir uç noktayı (sohbet, gömmeleri, resimler, TTS) açığa çıkarır. OpenAI API’si ile konuşan herhangi bir uygulama değişiklik olmadan bununla konuşabilir. Arka uçlar llama.cpp, whisper.cpp ve stable-diffusion.cpp’yi kapsar.

Nerede Yeterli Değil: Yapılandırma dosyası yoğundur ve her model kendi girdisine ihtiyaç duyar. Ollama eşleştirmeyi sizin için işler.

Fiyatlandırma:

Platformlar: Linux’ta Docker, artı Windows ve macOS için yerel derlemeler.

İndir: localai.io

Alt Satır: İstemci OpenAI SDK olduğunda ve temel URL’yi değiştirmek tüm geçiş olduğunda doğru sunucu.

5. Text Generation WebUI, Güç Kullanıcı Ayarlaması İçin En İyi

Text Generation WebUI (oobabooga), bir sunucu da çalıştıran daha eski, daha zengin ön uçtur. Örnekleme parametreleri, LoRA yükleme ve karakter kartı stili komut şablonları tümü açığa çıkarılır. Varsayılan ötesinde bir model ayarlamak isteyen herkes burada oturur.

Nerede Yeterli Değil: Arayüz iki kez yeniden inşa edildi ve hala güç kullanıcı köklerini gösteriyor. Bu, bir aile üyesine verdiğiniz araç değildir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: github.com/oobabooga/text-generation-webui

Alt Satır: Ollama ve LM Studio’nun gizlediği örnekleme düğmelerini isteyen herkes için seçim.

6. Jan, Yerel-İlk Masaüstü İstemcisi İçin En İyi

Jan, yerel-ilk ChatGPT istemcisidir. Sadece CPU NAS’ları için kendi çalışma zamanı ile gelir, ancak ayrıca uzak Ollama veya LocalAI sunucusuyla konuşur. Sohbetler ve komut istemleri diskte kalır, bu nedenle tüm geçmiş yerel bir dosyadır.

Nerede Yeterli Değil: NAS sunucusu olarak, en güçlü uyum değildir. Bunu istemci olarak kullanın ve Ollama veya LocalAI’ye hizmet etmesine izin verin.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: jan.ai

Alt Satır: Web sekmesi istemeyen herkes için NAS sunucusuna doğru masaüstü arkadaşı.

7. vLLM, Yüksek Verimli Çıkarım İçin En İyi

vLLM, üretim sınıfı sunucudur. Sayfalanmış dikkat, tensor paralelizmi ve sürekli toplu işleme, bunu birçok istemciye büyük bir modele hizmet etmenin en hızlı yoludur. Hile, gerçek bir GPU (Ampere veya daha yeni) gerektiğidir.

Nerede Yeterli Değil: NAS’a uygun bir kurulum değildir. Veri merkezi GPU’su olmayan bir NAS şasisi, docsların varsaydığı şekilde çalıştırılamaz.

Fiyatlandırma:

Platformlar: Linux (genellikle NVIDIA kapsayıcı araç kiti ile Docker).

İndir: github.com/vllm-project/vllm

Alt Satır: “NAS” bir evde laboratuvarın istemcilerine hizmet veren gerçek GPU’lu bir Linux kutusu olduğunda seçim.

8. llama.cpp, Çıplak Metal CPU Çıkarımı İçin En İyi

llama.cpp, bu listedeki her şeyin sardığı düşük seviye çalışma zamanıdır. Gerçek GPU’nun eksik olduğu yalnızca CPU NAS derlemelerinde çalışır, 8B parametre modelini birkaç gigabayta indiren nicelleştirilmiş modelleri içerir.

Nerede Yeterli Değil: Hiçbir UI yok. Bu bir sunucu ikili ve CLI’dir. Bunu Open WebUI veya Ollama ile eşleştirin.

Fiyatlandırma:

Platformlar: Herhangi (Linux, macOS, Windows, Raspberry Pi ve Apple Silicon dahil ARM).

İndir: github.com/ggerganov/llama.cpp

Alt Satır: NAS’ın yalnızca CPU olduğu ve RAM’in her gigabaytının önemli olduğu zaman doğru seçim.

Doğru Olanı Seçme Yöntemi

Sık Sorulan Sorular

Hangi Model GPU Olmayan NAS Üzerinde Çalışır?

3B-8B aralığındaki Gemma, Llama veya Mistral’ın nicelikleştirilmiş versiyonları modern bir NAS CPU’da saniyede birkaç token çalışır. Bu etkileşimli sohbet için yavaştır, tek seferlik bir özet veya gece çalışması için iyidir.

NAS’ımda GPU’ya İhtiyacım Var mı?

Sadece etkileşimli hız için. Yalnızca CPU NAS yine de küçük bir model çalıştırır; yanıt süreleri saniyede token yerine cümle başına birkaç saniyedir.

NAS’ta barındırılan modeli LAN’ımda özel tutabilir miyim?

Evet. Ollama, LM Studio ve LocalAI varsayılan olarak LAN arayüzüne bağlanır. Bir ev LAN’ından daha fazlası için temel kimlik doğrulaması veya ters proxy ekleyin.

Yerel Modeller Ne Kadar Disk Alanı Gerekir?

Bir nicelikleştirilmiş 8B model yaklaşık 5 GB’da oturur. Bir nicelikleştirilmiş 70B model 40 GB’a daha yakın oturur. 500 GB yedek hacmine sahip bir NAS tam bir kütüphane tutar.

Birden Fazla Kişi Aynı Anda Modeli Kullanabilir mi?

Ollama, LocalAI ve Text Generation WebUI’nin tümü varsayılan olarak serileştirir. vLLM eşzamanlı istekleri doğal olarak işler. Küçük bir aile için serileştirme iyidir.

Gizlilik Ne Olacak?

Bu listedeki her uygulama modeli yerel olarak çalıştırır. Uygulama yapılandırılmadığı sürece hiçbir istem veya yanıt üçüncü tarafa gönderilmez.