XDA bu ay, paralel olarak çalışan iki 2 GB yerel modelinin hemen hemen her gerçek görevde bir 8 GB modeli yendiğini savunan bir makale yayınladı ve yazar haklıydı. Kod için ayarlanmış küçük bir model artı sohbet için ayarlanmış küçük bir model, yan yana çalışırken, daha az VRAM kullanır, daha hızlı yanıt verir ve doğru soruyu doğru araca yönlendirmenize izin verir. Sorun araçlandırmada: çoğu yerel LLM uygulaması aynı anda bir modeli ve bir sohbet penceresini varsayar. Aşağıdaki sekiz uygulamanın masaüstünde birden fazla yerel LLM’yi aynı anda çalıştırması eşzamanlı modelleri işler, ister yerel olarak ister ikinci uygulamanın işaret edebileceği OpenAI uyumlu bir uç nokta açığa çıkararak.
Çok modelli bir LLM çalıştırıcısında neye bakılmalı
Birden fazla model çalıştırmanın gerçek kriterleri:
- Yerel çok modelli yükleme. Bazı araçlar talep üzerine modelleri değiştirirler; diğerleri gerçekten RAM’de iki tane yüklü tutar.
- OpenAI uyumlu uç nokta. Port 11434 veya 1234’te çalışan sunucu diğer araçların çağırabileceği.
- Model yönlendirmesi. Kod istemlerini Qwen2.5-Coder’a, sohbeti Llama 3.2’ye yönlendirin, isteğe göre.
- Katman bölümleme ile GPU boşaltma. Aynı GPU’ya iki küçük modeli yükleyin biri çökmeden.
- İkinci model için CPU geri dönüşü. GPU dolu ise, ikinci model CPU’da başarısız olmadan çalışır.
- Oturum yalıtımı. İki sohbet birbirinin bağlam penceresini çiğnemez.
Hızlı karşılaştırma
| Uygulama | En iyi | Çok modelli | Ücretsiz plan | Başlangıç fiyatı | GUI |
|---|---|---|---|---|---|
| Ollama | CLI-first, OpenAI endpoint | Evet (paralel yükleme) | Ücretsiz | Ücretsiz | Hayır (CLI) |
| LM Studio | Tıkla ve göster model yöneticisi | Evet | Ücretsiz | Ücretsiz | Evet |
| Jan | Tamamen çevrimdışı sohbet + backend | Evet | Ücretsiz | Ücretsiz | Evet |
| llama.cpp server | En ham kontrol, en küçük ayak izi | Evet (işlem başına) | Ücretsiz | Ücretsiz | Hayır |
| LiteLLM | 100+ backend’e yönlendir | Yönlendirici | Ücretsiz | Ücretsiz (bulut opt-in) | Web UI |
| Open WebUI | Çok modelli sohbet frontend | Evet | Ücretsiz | Ücretsiz | Evet (web) |
| vLLM | Üretim sınıfı verim | Evet (tensör paraleli) | Ücretsiz | Ücretsiz | Hayır |
| Msty | Tek masaüstü uygulamasında yerel + bulut | Evet (Sohbeti Böl) | Ücretsiz | 8.99 USD/ay | Evet |
Uygulamalar
1. Ollama, varsayılan runtime
Ollama talep üzerine modelleri yükler ve boşaltır ve port 11434’te OpenAI uyumlu bir API ortaya çıkarır. Ortamınızda OLLAMA_NUM_PARALLEL=2 ve OLLAMA_MAX_LOADED_MODELS=3 ayarlayın, hizmeti yeniden başlatın ve herhangi bir istemciden iki modele paralel olarak ulaşabilirsiniz. 32 GB birleştirilmiş belleğe sahip bir M2 Pro üzerinde, Qwen2.5-Coder 3B ve Llama 3.2 3B’yi küçük bir görüntü modeli için başlık alanı ile yan yana çalıştırdık.
Nerede yetersiz kaldığı: Yerel GUI yok. Varsayılan bağlam uzunluğu (2048) gerçek iş için küçük, bu yüzden ayarlayın. ollama serve süreci multi-GPU kurulumlarda modelleri belirli GPU’lara otomatik olarak sabitlemiyor.
Fiyatlandırma:
- Ücretsiz: Her şey.
Platformlar: macOS, Windows, Linux.
Sonuç: Temel katman. Bu listedeki hemen hemen her diğer araç Ollama’yı sarar veya onun mimarisini paylaşır. Önce kurulumu yapın.
2. LM Studio, cilalı GUI
LM Studio çoğu insanın ilk kurduğu uygulamadır. Tam bir model tarayıcı, bir sohbet ara yüzü ve 0.3 sürümünden beri çok modeli eşzamanlı olarak çalıştıran yerleşik bir yerel sunucu ile gelir. Model kataloğu doğrudan Hugging Face’den çekilir ve makinenize ne sığacağına göre filtrelenir. Sohbeti Böl modu aynı istemi iki modelle gerçek zamanlı olarak karşılaştırmanıza izin verir.
Nerede yetersiz kaldığı: Açık kaynak değildir (kişisel kullanım için ücretsiz, iş kullanımı için onlarla iletişime geçin). Dahil edilen llama.cpp sürümü upstream’den geride kalabilir.
Fiyatlandırma:
- Ücretsiz: Kişisel kullanım için tüm özellikler.
- Ücretli: Takım/ticari lisanslama için satışla iletişime geçin.
Platformlar: Windows, macOS, Linux.
İndir: LM Studio
Sonuç: GUI istiyorsanız en iyi giriş noktası. Komut dosyası oluşturma için Ollama ile eşleştirin.
3. Jan, açık kaynak LM Studio
Jan, LM Studio’nun açık kaynaklı alternatifidir: aynı fikir, MIT lisanslı ve tamamen çevrimdışı çalıştırma hedefi. Çok modelli sohbet iş parçacıkları, her bir iş parçacığını farklı bir modele sabitlemeye izin verir. Kendi llama.cpp arka ucunu çalıştırır ve daha büyük bir model istediğinizde uzak bir Ollama veya OpenAI uyumlu API’ye vekil olabilir.
Nerede yetersiz kaldığı: LM Studio’dan daha genç proje. Daha az paketlenmiş uzantı.
Fiyatlandırma:
- Ücretsiz: Her şey (açık kaynak).
Platformlar: Windows, macOS, Linux.
Sonuç: Açık kaynak önemliyse bunu seçin. İşlevsel olarak LM Studio’ya çok benzer.
4. llama.cpp server, temel ilkel
llama.cpp model başına başlattığınız durum sabit bir HTTP sunucusu ile gelir. İki kabuk komutu, iki bağlantı noktası, iki model. Bu, iki GGUF nicelemesini RAM’de tutmanın en sıkı yoludur: sarmalayıcı yok, planlayıcı yok, telemetri yok ve burada en küçük bellek yükü.
Nerede yetersiz kaldığı: Kendi yönlendirmenizi bağlarsınız. GUI yok. Model yöneticisi yok. Kurulum için yalnızca komut satırı.
Fiyatlandırma:
- Ücretsiz: Açık kaynak (MIT).
Platformlar: Windows, macOS, Linux (Docker da).
İndir: GitHub
Sonuç: Soyutlama katmanlarının ne gizlediklerini anlamak isteyenler için. Komut dosyası kuruluşları için mükemmel.
5. LiteLLM, yönlendirici
LiteLLM modelleri barındırmaz; bunları yönlendirir. Ollama örneğinize, LM Studio sunucunuza, Anthropic API anahtarınıza ve Azure bitiş noktanıza işaret edin, ardından her isteği bir OpenAI uyumlu URL üzerinden gönderin ve yönlendiricinin karar vermesine izin verin. Model başına geri dönüşler ve hız sınırları içeren YAML yapılandırma dosyası, büyük olanı meşgul olduğunda bir kodlama asistanının daha küçük bir yerel modele geri dönmesine izin verir.
Nerede yetersiz kaldığı: Yönetilecek ek bir işlem ekler. Yönlendirme kararlarının hata ayıklanması biraz log okumayı gerektirir.
Fiyatlandırma:
- Ücretsiz: Açık kaynak (proxy ve SDK).
- Ücretli: LiteLLM Cloud (isteğe bağlı) gözlemlenebilirlik için abonelik tabanlı.
Platformlar: Windows, macOS, Linux (Python, Docker).
İndir: GitHub
Sonuç: Birden fazla çalıştırıcı arasında yapıştırıcı. Yalnızca bir arka uç çalıştırıyorsanız atlayın, üç çalıştırıyorsanız zorunlu.
6. Open WebUI, ChatGPT benzeri frontend
Open WebUI yerel modeller için cilalı sohbet ara yüzüdür. Ollama’ya (veya herhangi bir OpenAI uyumlu uç noktaya) bağlayın ve size çok kullanıcılı kimlik doğrulama, sohbet geçmişi, konuşma ortasında model değiştirme ve tek bir tarayıcı sekmesinde yan yana model karşılaştırması verir. Dört kişinin bir makineyi paylaştığı bir hane için kullanışlı.
Nerede yetersiz kaldığı: Sorunsuz deneyim için Docker’da çalışır; yerel kurulum mümkün ancak daha karmaşıktır. Herhangi bir model yüklenmeden önce yaklaşık 500 MB RAM kullanır.
Fiyatlandırma:
- Ücretsiz: Açık kaynak (BSD-3).
Platformlar: Windows, macOS, Linux (Docker).
İndir: GitHub
Sonuç: Zaten Ollama çalışıyor ise en iyi frontend. Sohbeti Böl modu öldürücü özelliktir.
7. vLLM, verim motoru
vLLM masaüstü araçları ölçeklemeyi bıraktığında kurduğunuz şeydir. PagedAttention bellek yönetimi, herhangi bir tek modelli çalıştırıcıdan daha iyi VRAM kullanımı ile birden fazla modeli tutar. Tensör paraleli ağırlığı bir modeli GPU’lar arasında bölür; aynı sunucudaki birden fazla dağıtım farklı modelleri eşzamanlı olarak barındırır. Dizüstü bilgisayar için aşırı, iki GPU’lu iş istasyonu için gerekli.
Nerede yetersiz kaldığı: Linux-birinci (WSL2 üzerinden Windows). Python ve CUDA kurulumunu gerektirir. Gündelik kullanıcılar için hedeflenmiş değildir.
Fiyatlandırma:
- Ücretsiz: Açık kaynak (Apache 2.0).
Platformlar: Linux, Windows (WSL2), macOS (Apple Silicon kısmi).
İndir: GitHub
Sonuç: Yalnızca ciddi bir GPU’nuz varsa buna ulaşın. Tek bir 4090’da, Ollama daha kolaydır ve neredeyse o kadar hızlıdır.
8. Msty, yerel+bulut masaüstü uygulaması
Msty tek bir masaüstü ikilisi olarak gelir ve yerleşik bir çalışma zamanı aracılığıyla yerel modelleri ve kendi API anahtarlarınız aracılığıyla bulut modellerini, aynı pencerede yan yana çalıştırır. Sohbeti Böl, istem başına dört modele kadar karşılaştırır. Bilgi Yığınları özelliği yerel belgeleri dizine ekler ve dizini modeller arasında paylaşır.
Nerede yetersiz kaldığı: Ücretsiz katman cömert ancak sohbeti iki modelle bölmeyi sınırlar. Dört yönlü bölme için ücretli katman pahalı tarafta.
Fiyatlandırma:
- Ücretsiz: İki yönlü sohbeti böl, tüm yerel model özellikleri.
- Ücretli: Dört yönlü bölme ve premium senkronizasyon için ayda 8,99 USD veya yılda 79 USD.
Platformlar: Windows, macOS, Linux.
İndir: Msty
Sonuç: Yerel ve bulut modellerini yan yana karşılaştırmanın en kolay yolu. Yalnızca dört yönlü bölmeye ihtiyacınız varsa ödeme yapın.
Doğru olanı seçme
- Sıfırdan başlıyorsanız, Ollama ve Open WebUI’yi kurun. Bu referans yığınıdır.
- Docker’a dokunmadan GUI istiyorsanız, LM Studio veya Jan.
- Açık kaynak önemliyse ve GUI istiyorsanız, Jan.
- Yerel ve bulut API’leri arasında yönlendirirseniz, LiteLLM’yi ekleyin.
- Model çıkışlarını sürekli karşılaştırırsanız, Msty veya LM Studio Sohbeti Böl.
- Her şeyi komut dosyası oluşturursa, özel bağlantı noktalarında llama.cpp sunucusu.
- Sizin kuruluşunuzda iki GPU varsa ve küçük bir ekibe hizmet verirseniz, vLLM.
SSS
Tek bir GPU’da iki LLM çalıştırabilir miyim?
Evet, her iki nicelenmiş sürüm de VRAM’a sığarsa. Q4_K_M’de bir 3B modeli yaklaşık 2 GB kullanır; bunlardan ikisi bir 8 GB kartına rahatça sığar. OLLAMA_MAX_LOADED_MODELS‘ı 1’in üzerine ayarlayın onları sıcak tutmak için.
Küçük yerel LLM’ler gerçekten iyi mi?
Qwen 2.5 ve Llama 3.2’den bu yana 3B-7B aralığında, küçük modeller özet, kod tamamlama, çıkarma ve kısa biçim sohbeti GPT-3.5’e yakın kalitede işler. Uzun bağlam akıl yürütme ve karmaşık çok adımlı görevlerde başarısız olurlar. Zor istekler için daha büyük bir modelle bunu yönlendirin.
Ollama ve LM Studio arasında fark nedir?
Ollama, HTTP API’ye sahip CLI-birinci çalışma zamanıdır. LM Studio, paketlenmiş llama.cpp sunucusu çalıştıran GUI-birinci masaüstü uygulamasıdır. Aynı makinede paralel olarak çalışabilirler.
Yerel LLM’leri çalıştırmak için GPU’ya ihtiyacım var mı?
Hayır ama yardımcı olur. Bir 3B modeli modern Apple Silicon CPU’sunda veya 16 GB RAM’li Intel/AMD çip üzerinde okunabilir hızda (saniyede 10 ila 20 belirteç) çalışır. GPU’lar bunu saniyede 60 ila 200 belirtece çıkarır.
Hangi uygulama en hızlı çalışır?
Belirteç başına, modern NVIDIA GPU’da vLLM. Kurulum başına, iyi bir quant ile llama.cpp. Kolaylık için, Ollama.