Ollama — Proxmox ev laboratuvarları için en popüler yerel LLM sunucusu

ChatGPT veya Claude’a gönderilen her ileti binayı terk eder. Çoğu insan için bu takas iyidir. Ev laboratuvarı sahiplerinin artan bir sayısı için durum böyle değildir ve zaten Plex, Home Assistant ve Pi-hole çalıştıran bir Proxmox sunucusu, yerel bir dil modelinin ihtiyaç duyduğu tam olarak yedek CPU, RAM ve (sık sık) GPU’ya sahiptir. Bulut AI’dan Proxmox’ta yerel LLM’ye geçen bir kendini barındıran kişinin yakın zamanda yayınlanan bir raporu çekiciliği iyi özetledi: donanım zaten ödeniydi, bu yüzden model sonunda tüm ev laboratuvarını buna değer hale getiren şey oldu. Bunu başarmak için bir VM veya LXC kapsayıcısında çalıştırmaya değer yedi uygulama topladık, kurulum çabası, donanım verimliliği ve günlük deneyimin ChatGPT’ye ne kadar yakın olduğuna göre sıralanan. Bunlar bu yıl Proxmox’ta yerel LLM barındırmak için en iyi uygulamadır.

Proxmox LLM ana makinesi için ne aranmalı

Her yerel LLM projesi, bir hipervisor üzerinde başsız olarak çalıştırılmak üzere yapılmamıştır. Birkaç şey, yüklemeye değer olanları, sizinle mücadele edecek olanlardan ayırır.

Hızlı karşılaştırma

Uygulama En iyi Dağıtım Ücretsiz katman GPU desteği
Ollama Genel Proxmox ana makine Linux VM, LXC, Docker Ücretsiz, açık kaynak NVIDIA, AMD (ROCm), CPU
Open WebUI Ollama üzerinde en iyi UI Aynı VM/LXC’de Docker Ücretsiz, açık kaynak Arka uç GPU’yu miras alır
LM Studio Masaüstü üzerinde model keşfi Masaüstü uygulaması (başsız değil) Ücretsiz NVIDIA, Apple Silicon
text-generation-webui Gelişmiş ve eski model biçimleri Linux VM, Docker Ücretsiz, açık kaynak NVIDIA, AMD, CPU
vLLM Yüksek iş hacmi, üretim sunumu Linux VM, Docker Ücretsiz, açık kaynak NVIDIA (en iyi), AMD (kısmi)
llama.cpp server En hafif, GGUF yerel Linux VM, LXC, Docker Ücretsiz, açık kaynak NVIDIA, AMD, Apple Silicon, CPU
LocalAI OpenAI-API bırak-in değiştiricisi Linux VM, LXC, Docker Ücretsiz, açık kaynak NVIDIA, CPU

7 uygulama sıralandı

1. Ollama — Genel olarak en iyi

Ollama, çoğu Proxmox ev laboratuvarı sahibinin ilk kez konuşlandığı uygulamadır ve genellikle kaldıkları orandır. Kurulum, bir Debian veya Ubuntu VM’nin içinde tek bir shell komutudur (veya doğru çekirdek modüllerine sahip ayrıcalıklı LXC kapsayıcısı), ve bir model çekmek ollama run llama3 kadar basittir. Varsayılan olarak 11434 numaralı bağlantı noktasında OpenAI uyumlu bir API’yi ortaya koymakta, bu da Home Assistant, Continue.dev ve düzine diğer araçların ek yapılandırma olmadan ona bağlanması anlamına gelir.

Geri kalmakta olduğu yer: Birleştirilmiş arayüz bir komut satırı sohbeti değil, bir web UI’dir, bu nedenle çoğu kişi bunu Open WebUI veya benzer bir ön uç ile eşleştirir. LXC kapsayıcısına GPU geçişi, NVIDIA sürücüsünün ana makine ile kapsayıcı arasında tam olarak eşleşmesini gerektirmekte, VM rotasında daha çok başlangıçları rahatsız etmektedir.

Fiyatlandırma: Ücretsiz, açık kaynak.

Platformlar: Linux VM, LXC, Docker, ayrıca laboratuvar dışında yerel sınama için Windows ve macOS’ta yereldir.

İndir: ollama.com

Sonuç: Proxmox LLM ana makinesi için varsayılan seçim ve bu listedeki diğer uygulamaların çoğunun üzerine inşa edildiği arka uç.

2. Open WebUI — Ollama üzerinde en iyi UI

Open WebUI, Ollama’yı gerçekten ChatGPT gibi görünen ve hissettiren bir şeye dönüştürür: sohbet geçmişi, birden çok konuşma, açılır listeden model değiştirme, alma özelliğinde belge yüklemesi ve kullanıcı başına izinlerle çok kullanıcılı oturum açma. Ollama’nın hemen yanında kendi Docker kapsayıcısında çalışır, bu yüzden her ikisi birden bir LXC kapsayıcısına veya küçük bir VM’ye rahat bir şekilde sığar.

Aile veya ev içi dağıtımlar burada en çok yararlanır. Her kişi kendi girişini, kendi sohbet geçmişini alır ve yönetici hangi modellerin kime sunulduğunu ayarlayabilir.

Geri kalmakta olduğu yer: Bu bir ön uçtur, bir model sunucusu değildir, bu nedenle tamamen Ollama’ya (veya başka bir OpenAI uyumlu arka uca) bağımlıdır. İzin ve kullanıcı yönetimi ekranlarının ilk kez alışması birkaç dakika sürer.

Fiyatlandırma: Ücretsiz, açık kaynak.

Platformlar: Ollama ile birlikte Linux VM veya LXC kapsayıcısında Docker.

İndir: github.com/open-webui/open-webui

Sonuç: Ailenin yerel LLM’yi onu kuran kişinin yerine gerçekten kullanmasını isteyen herkes için seçim.

3. LM Studio — Model keşfi için en iyi

LM Studio, Windows, macOS ve Linux için cilalı bir masaüstü uygulamasıdır ve Hugging Face modellerini gezinmeyi, indirmeyi ve test etmeyi sorunsuz hale getirmektedir; yerleşik bir katalog, indirmeden önce RAM ve VRAM tahminleri ve OpenAI uyumlu aynı API’yi ortaya koyan yerel bir sunucu modu bu listedeki diğer uygulamalar kullanılır. Bu, Ollama’dan daha az Proxmox doğal, çünkü bir çalışma istasyonunda GUI ile çalıştırılmak üzere tasarlanmıştır, kapsayıcıda başsız yerine, ancak bu yüzden bir yer kazanır, çünkü donanımınızla gerçekten uyuşan modeli Proxmox dağıtımını yapmadan önce bulmanın en hızlı yoludur.

Bazı ev laboratuvarı sahipleri, model araştırması için tamamen bir masaüstü makinesinde LM Studio çalıştırır, sonra kazanan modeli Proxmox kutusundaki Ollama’ya çeker, daima açık sunucu için.

Geri kalmakta olduğu yer: Başsız olarak bir VM’nin içinde çalıştırmak işe yarar, ancak uygulamanın noktasını kaybeder, çünkü GUI ana çekicidir. Bir ev laboratuvarı sunucusunun istediği tür katılımsız, önyükleme ve unut işlemi için yapılmamıştır.

Fiyatlandırma: Ücretsiz.

Platformlar: Windows, macOS, Linux masaüstü (kapsayıcı yerel değil).

İndir: lmstudio.ai

Sonuç: Dağıtımdan önce keşif aracı olarak faydalıdır, Proxmox ana makinesi değildir.

4. text-generation-webui — Gelişmiş ve eski model biçimleri için en iyi

text-generation-webui, genellikle yaratıcısından sonra “oobabooga” olarak adlandırılır, bu listenin gazisidir ve hala en geniş biçim desteğine sahip uygulama: GGUF, GPTQ, AWQ ve EXL2 tümü aynı arayüz üzerinden yüklenir, LoRA ince tuning desteği ve notebook tarzı ham tamamlama modu. Eski veya daha belirsiz bir model çalıştıran birisi için, yeni araçlar desteği bırakmıştır, bu normalde hala işe yaradığı yerdir.

Web arayüzü karakter kartları, sohbet ön ayarları ve uzun vadeli hafıza ve ses gibi şeyler için uzantıları içerir, özellikleri temiz bir günlük sürücü sohbet deneyiminden ziyade hobi tinkerlerine hedef alınmıştır.

Geri kalmakta olduğu yer: Arayüz Open WebUI’nin yanında yaşını gösterir ve ayarlar ve uzantıların büyük sayısı yalnızca çalışan bir sohbet kutusu isteyen birini bunaltabilir. Güncellemeler bazen belirli nicelikleştirme biçimleriyle uyumluluğu kırabilir.

Fiyatlandırma: Ücretsiz, açık kaynak.

Platformlar: Linux VM, Docker, ayrıca Windows ve macOS’ta çalışır.

İndir: github.com/oobabooga/text-generation-webui

Sonuç: Olağandışı model biçimleri veya diğer sunucuların desteklemediği ince ayarlar çalıştıran kişi için doğru seçim.

5. vLLM — Yüksek iş hacmi ve üretim sunumu için en iyi

vLLM, bu listenin çoğundan farklı bir sorun için yapılmıştır: birçok eşzamanlı isteği hızlı bir şekilde sunmak, yük altında GPU belleğini verimli tutmak için PagedAttention kullanılarak. Uygun şekilde geçen GPU’ya sahip bir Proxmox kutusunda, vLLM, birden fazla kişi veya birden fazla uygulama aynı anda modeli vurduğunda Ollama’yı geniş bir marjla baskılayacaktır, bu, birden fazla hizmet (kodlama asistanı, sohbet UI ve otomasyon boru hattı, hepsi aynı anda) arkasında bir LLM çalıştıran ev laboratuvarı için önemlidir.

OpenAI API’yle yerel olarak konuşur, bu yüzden Ollama ile konuşan aynı araçlara sığar.

Geri kalmakta olduğu yer: Kurulum daha ağırdır, GPU gereksinimleri daha katıdır ve tek kullanıcılı sohbet performansı buradaki daha basit seçeneklerden çok daha iyi değildir. Yalnızca CPU veya düşük VRAM ev laboratuvarları bundan çok az yararlanır.

Fiyatlandırma: Ücretsiz, açık kaynak.

Platformlar: GPU geçişi, Docker ile Linux VM.

İndir: github.com/vllm-project/vllm

Sonuç: Tek kullanıcı ChatGPT değiştiricisi için overkill, ancak bir ev laboratuvarı aynı anda birden fazla uygulamaya veya kişiye yerel bir model sunmaya başladığında doğru araç.

6. llama.cpp server — En hafif, GGUF yerel

llama.cpp, bu listedeki uygulamaların çoğunun altında çalıştığı C++ çıkarım motorudur ve kendi birleştirilmiş sunucusu (llama-server) bir GGUF modelini ek katman olmadan OpenAI uyumlu bir API üzerinde ortaya koyan en hafif yoldur. Kaynak kullanımı bu listeye en düşüktür, bu onu küçük bir LXC kapsayıcısı veya aynı donanımda diğer hizmetleri çalıştırması gereken Proxmox ana makinesi için güçlü bir seçim yapar.

Minimal yerleşik web sohbet arayüzü, işlevsel ama sade, temel kullanım için Open WebUI eklemeden yeterlidir.

Geri kalmakta olduğu yer: Model yöneticisi yok, çok kullanıcılı hesaplar yok ve yapılandırma ayarlar ekranı yerine komut satırı bayraklarıyla yapılır. Terminal’de rahat olan birini, noktala tıkla kurulumunu isteyen birinden daha ödüllendirmektedir.

Fiyatlandırma: Ücretsiz, açık kaynak.

Platformlar: Linux VM, LXC, Docker, ayrıca Windows, macOS ve Apple Silicon’da inşa edilir.

İndir: github.com/ggerganov/llama.cpp

Sonuç: Minimal donanıma model sıkıştırmak veya sınırlı kaynak LXC kapsayıcısı için seçim.

7. LocalAI — Beste OpenAI-API bırak-in değiştiricisi

LocalAI, OpenAI API için neredeyse tam bir bırak-in değiştiricisi olmayı amaçlamakta, yalnızca sohbet tamamlamasını değil, aynı arayüz arkasında görüntü üretimini, metin okumayı ve yerleştirmeleri kapsamakta. OpenAI API’sine çağrı yapmak üzere zaten bağlı uygulamaları veya otomasyonları olan bir ev laboratuvarı için, LocalAI bu entegrasyon noktasının değişmeden kalmasını sağlarken gerçek çıkarım Proxmox kutusunda yerel olarak gerçekleşir.

llama.cpp de dahil olmak üzere çok çeşitli arka uçları desteklemektedir, bu yüzden aynı sunucu, belirli bir isteğin gereksinimleri ne olursa olsun, birkaç farklı model biçimini çalıştırabilir.

Geri kalmakta olduğu yer: Desteklenen model türlerinin genişliği, Ollama gibi tek amaçlı bir sunucuya kıyasla yapılandırma karmaşıklığı ekler ve proje yeterince hızlı hareket ederken belgeler bazen en son sürümün gerisinde kalır.

Fiyatlandırma: Ücretsiz, açık kaynak.

Platformlar: Linux VM, LXC, Docker.

İndir: localai.io

Sonuç: Mevcut araçlar zaten OpenAI API’ye karşı inşa edilirse ve uç noktayı takas etmek, entegrasyonu yeniden yazmak değil, hedefse, doğru seçim.

Doğru olanı seçme

Günlük kullanım için ChatGPT’yi değiştiren bir kişi için, Ollama Open WebUI ile eşleştirilmiş neredeyse her şeyi kapsar: bir sohbet arayüzü, model değiştiricisi ve ağdaki başka herhangi bir şey için bir API uç noktası. Bir Proxmox kutusunu paylaşan bir ev, aynı eşleştirmeden yararlanır, çünkü Open WebUI’nin kullanıcı başına girişleri birden fazla VM gereksinimine sahip olmaksızın sohbet geçmişlerini ayrı tutar.

Ince ayarlar, karakter ön ayarları veya eski nicelikleştirme biçimleriyle oynanmak isteyen bir hobici, text-generation-webui’den daha fazla mesafe alır, daha dik bir öğrenme eğrisinde bile. Hala donanımıyla uyuşan modeli belirleyen birisi, Proxmox VM’yi belirli bir kuruluma zamanlamadan önce masaüstünde LM Studio ile başlamalıdır.

Aynı anda birkaç uygulamaya veya kişiye hizmet veren GPU zengin rig, vLLM ekstra kurulum maliyetini kazandığı tek durumdur, çünkü iş hacmi avantajı yalnızca eşzamanlı yükü altında gösterilmektedir. CPU-yalnızca kutu veya kaydedilecek sınırlı RAM’ı olan Proxmox ana makinesi, bu listeya en az ek yükü taşıyan llama.cpp sunucusuyla doğrudan daha iyi sunulur. Ve zaten OpenAI API’sine çağrı yapan mevcut otomasyona sahip bir laboratuvar, LocalAI için açık bir durumdur, çünkü bu entegrasyon noktasının tam olarak öyle kalmasını sağlar.

Sıkça sorulan sorular

Proxmox, GPU olmadan LLM’leri çalıştırabilir mi? Evet. Ollama, llama.cpp sunucusu ve LocalAI tümü yalnızca CPU’da çalışır ve nicelleştirilmiş bir 7B veya 8B modeli, CPU’dan daha yavaş yanıtlar gelse de modern çok çekirdekli CPU’da sohbet için kullanılabilir. Daha küçük nicelleştirilmiş modeller (3B ve altı) bile mütevazı donanımda duyarlı kalır.

Hangi yerel LLM ChatGPT kalitesine en yakın? Model kalitesi, hangi ağırlıkların yüklendiğine bağlıdır, hangi sunucu onları çalıştırmadığına, bu yüzden bu uygulamalardan biri aynı modelleri çalıştırabilir. 70B-plus aralığında daha büyük açık modeller, iyi bir nicelikleştirmede çalıştırılır, ChatGPT-seviye yanıtlara en yakın, yine de iyi çalışması için önemli VRAM veya yavaş CPU geri dönüş gerekli.

Ollama ücretsiz mi? Evet. Ollama ücretsiz ve açık kaynaktır, ödeme katmanı, abonelik veya kullanım sınırı olmadan, çünkü çıkarım tam olarak çalıştığı donanımda gerçekleşir.

Ollama için VM veya LXC kapsayıcısı kullanmalı mıyım? LXC kapsayıcısı daha hafiftir ve daha hızlı başlar, CPU-yalnızca kurulum veya RAM’de dar ev laboratuvarı için uygun. VM, GPU geçişi için daha güvenli seçimdir, çünkü Proxmox ana makinesinden NVIDIA sürücü yığınını izole eder ve kapsayıcı ana makinenin çekirdeğini ve sürücülerini paylaştığında ortaya çıkan sürüm uyuşması sorunlarından kaçınır.

16 GB VRAM’da hangi model çalışır? 13B modeli, 4 bitlik veya 5 bitlik GGUF nicelikleştirmesi, makul bir bağlam penceresi için yer ile 16 GB VRAM’a rahat bir şekilde sığar. Bazı iyi optimize edilmiş 34B nicelikleştirmeleri de azaltılmış bağlam uzunluğunda sığar, rağmen 13B ve altında daha uzun konuşmalar için en fazla başlık boşluğu verir.