Masaüstünde birden fazla küçük yerel LLM çalıştırma

XDA bu ay, paralel olarak çalışan iki 2 GB yerel modelinin hemen hemen her gerçek görevde bir 8 GB modeli yendiğini savunan bir makale yayınladı ve yazar haklıydı. Kod için ayarlanmış küçük bir model artı sohbet için ayarlanmış küçük bir model, yan yana çalışırken, daha az VRAM kullanır, daha hızlı yanıt verir ve doğru soruyu doğru araca yönlendirmenize izin verir. Sorun araçlandırmada: çoğu yerel LLM uygulaması aynı anda bir modeli ve bir sohbet penceresini varsayar. Aşağıdaki sekiz uygulamanın masaüstünde birden fazla yerel LLM’yi aynı anda çalıştırması eşzamanlı modelleri işler, ister yerel olarak ister ikinci uygulamanın işaret edebileceği OpenAI uyumlu bir uç nokta açığa çıkararak.

Çok modelli bir LLM çalıştırıcısında neye bakılmalı

Birden fazla model çalıştırmanın gerçek kriterleri:

Hızlı karşılaştırma

Uygulama En iyi Çok modelli Ücretsiz plan Başlangıç fiyatı GUI
Ollama CLI-first, OpenAI endpoint Evet (paralel yükleme) Ücretsiz Ücretsiz Hayır (CLI)
LM Studio Tıkla ve göster model yöneticisi Evet Ücretsiz Ücretsiz Evet
Jan Tamamen çevrimdışı sohbet + backend Evet Ücretsiz Ücretsiz Evet
llama.cpp server En ham kontrol, en küçük ayak izi Evet (işlem başına) Ücretsiz Ücretsiz Hayır
LiteLLM 100+ backend’e yönlendir Yönlendirici Ücretsiz Ücretsiz (bulut opt-in) Web UI
Open WebUI Çok modelli sohbet frontend Evet Ücretsiz Ücretsiz Evet (web)
vLLM Üretim sınıfı verim Evet (tensör paraleli) Ücretsiz Ücretsiz Hayır
Msty Tek masaüstü uygulamasında yerel + bulut Evet (Sohbeti Böl) Ücretsiz 8.99 USD/ay Evet

Uygulamalar

1. Ollama, varsayılan runtime

Ollama talep üzerine modelleri yükler ve boşaltır ve port 11434’te OpenAI uyumlu bir API ortaya çıkarır. Ortamınızda OLLAMA_NUM_PARALLEL=2 ve OLLAMA_MAX_LOADED_MODELS=3 ayarlayın, hizmeti yeniden başlatın ve herhangi bir istemciden iki modele paralel olarak ulaşabilirsiniz. 32 GB birleştirilmiş belleğe sahip bir M2 Pro üzerinde, Qwen2.5-Coder 3B ve Llama 3.2 3B’yi küçük bir görüntü modeli için başlık alanı ile yan yana çalıştırdık.

Nerede yetersiz kaldığı: Yerel GUI yok. Varsayılan bağlam uzunluğu (2048) gerçek iş için küçük, bu yüzden ayarlayın. ollama serve süreci multi-GPU kurulumlarda modelleri belirli GPU’lara otomatik olarak sabitlemiyor.

Fiyatlandırma:

Platformlar: macOS, Windows, Linux.

İndir: Ollama | GitHub

Sonuç: Temel katman. Bu listedeki hemen hemen her diğer araç Ollama’yı sarar veya onun mimarisini paylaşır. Önce kurulumu yapın.

2. LM Studio, cilalı GUI

LM Studio çoğu insanın ilk kurduğu uygulamadır. Tam bir model tarayıcı, bir sohbet ara yüzü ve 0.3 sürümünden beri çok modeli eşzamanlı olarak çalıştıran yerleşik bir yerel sunucu ile gelir. Model kataloğu doğrudan Hugging Face’den çekilir ve makinenize ne sığacağına göre filtrelenir. Sohbeti Böl modu aynı istemi iki modelle gerçek zamanlı olarak karşılaştırmanıza izin verir.

Nerede yetersiz kaldığı: Açık kaynak değildir (kişisel kullanım için ücretsiz, iş kullanımı için onlarla iletişime geçin). Dahil edilen llama.cpp sürümü upstream’den geride kalabilir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: LM Studio

Sonuç: GUI istiyorsanız en iyi giriş noktası. Komut dosyası oluşturma için Ollama ile eşleştirin.

3. Jan, açık kaynak LM Studio

Jan, LM Studio’nun açık kaynaklı alternatifidir: aynı fikir, MIT lisanslı ve tamamen çevrimdışı çalıştırma hedefi. Çok modelli sohbet iş parçacıkları, her bir iş parçacığını farklı bir modele sabitlemeye izin verir. Kendi llama.cpp arka ucunu çalıştırır ve daha büyük bir model istediğinizde uzak bir Ollama veya OpenAI uyumlu API’ye vekil olabilir.

Nerede yetersiz kaldığı: LM Studio’dan daha genç proje. Daha az paketlenmiş uzantı.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: Jan | GitHub

Sonuç: Açık kaynak önemliyse bunu seçin. İşlevsel olarak LM Studio’ya çok benzer.

4. llama.cpp server, temel ilkel

llama.cpp model başına başlattığınız durum sabit bir HTTP sunucusu ile gelir. İki kabuk komutu, iki bağlantı noktası, iki model. Bu, iki GGUF nicelemesini RAM’de tutmanın en sıkı yoludur: sarmalayıcı yok, planlayıcı yok, telemetri yok ve burada en küçük bellek yükü.

Nerede yetersiz kaldığı: Kendi yönlendirmenizi bağlarsınız. GUI yok. Model yöneticisi yok. Kurulum için yalnızca komut satırı.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux (Docker da).

İndir: GitHub

Sonuç: Soyutlama katmanlarının ne gizlediklerini anlamak isteyenler için. Komut dosyası kuruluşları için mükemmel.

5. LiteLLM, yönlendirici

LiteLLM modelleri barındırmaz; bunları yönlendirir. Ollama örneğinize, LM Studio sunucunuza, Anthropic API anahtarınıza ve Azure bitiş noktanıza işaret edin, ardından her isteği bir OpenAI uyumlu URL üzerinden gönderin ve yönlendiricinin karar vermesine izin verin. Model başına geri dönüşler ve hız sınırları içeren YAML yapılandırma dosyası, büyük olanı meşgul olduğunda bir kodlama asistanının daha küçük bir yerel modele geri dönmesine izin verir.

Nerede yetersiz kaldığı: Yönetilecek ek bir işlem ekler. Yönlendirme kararlarının hata ayıklanması biraz log okumayı gerektirir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux (Python, Docker).

İndir: GitHub

Sonuç: Birden fazla çalıştırıcı arasında yapıştırıcı. Yalnızca bir arka uç çalıştırıyorsanız atlayın, üç çalıştırıyorsanız zorunlu.

6. Open WebUI, ChatGPT benzeri frontend

Open WebUI yerel modeller için cilalı sohbet ara yüzüdür. Ollama’ya (veya herhangi bir OpenAI uyumlu uç noktaya) bağlayın ve size çok kullanıcılı kimlik doğrulama, sohbet geçmişi, konuşma ortasında model değiştirme ve tek bir tarayıcı sekmesinde yan yana model karşılaştırması verir. Dört kişinin bir makineyi paylaştığı bir hane için kullanışlı.

Nerede yetersiz kaldığı: Sorunsuz deneyim için Docker’da çalışır; yerel kurulum mümkün ancak daha karmaşıktır. Herhangi bir model yüklenmeden önce yaklaşık 500 MB RAM kullanır.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux (Docker).

İndir: GitHub

Sonuç: Zaten Ollama çalışıyor ise en iyi frontend. Sohbeti Böl modu öldürücü özelliktir.

7. vLLM, verim motoru

vLLM masaüstü araçları ölçeklemeyi bıraktığında kurduğunuz şeydir. PagedAttention bellek yönetimi, herhangi bir tek modelli çalıştırıcıdan daha iyi VRAM kullanımı ile birden fazla modeli tutar. Tensör paraleli ağırlığı bir modeli GPU’lar arasında bölür; aynı sunucudaki birden fazla dağıtım farklı modelleri eşzamanlı olarak barındırır. Dizüstü bilgisayar için aşırı, iki GPU’lu iş istasyonu için gerekli.

Nerede yetersiz kaldığı: Linux-birinci (WSL2 üzerinden Windows). Python ve CUDA kurulumunu gerektirir. Gündelik kullanıcılar için hedeflenmiş değildir.

Fiyatlandırma:

Platformlar: Linux, Windows (WSL2), macOS (Apple Silicon kısmi).

İndir: GitHub

Sonuç: Yalnızca ciddi bir GPU’nuz varsa buna ulaşın. Tek bir 4090’da, Ollama daha kolaydır ve neredeyse o kadar hızlıdır.

8. Msty, yerel+bulut masaüstü uygulaması

Msty tek bir masaüstü ikilisi olarak gelir ve yerleşik bir çalışma zamanı aracılığıyla yerel modelleri ve kendi API anahtarlarınız aracılığıyla bulut modellerini, aynı pencerede yan yana çalıştırır. Sohbeti Böl, istem başına dört modele kadar karşılaştırır. Bilgi Yığınları özelliği yerel belgeleri dizine ekler ve dizini modeller arasında paylaşır.

Nerede yetersiz kaldığı: Ücretsiz katman cömert ancak sohbeti iki modelle bölmeyi sınırlar. Dört yönlü bölme için ücretli katman pahalı tarafta.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: Msty

Sonuç: Yerel ve bulut modellerini yan yana karşılaştırmanın en kolay yolu. Yalnızca dört yönlü bölmeye ihtiyacınız varsa ödeme yapın.

Doğru olanı seçme

SSS

Tek bir GPU’da iki LLM çalıştırabilir miyim?

Evet, her iki nicelenmiş sürüm de VRAM’a sığarsa. Q4_K_M’de bir 3B modeli yaklaşık 2 GB kullanır; bunlardan ikisi bir 8 GB kartına rahatça sığar. OLLAMA_MAX_LOADED_MODELS‘ı 1’in üzerine ayarlayın onları sıcak tutmak için.

Küçük yerel LLM’ler gerçekten iyi mi?

Qwen 2.5 ve Llama 3.2’den bu yana 3B-7B aralığında, küçük modeller özet, kod tamamlama, çıkarma ve kısa biçim sohbeti GPT-3.5’e yakın kalitede işler. Uzun bağlam akıl yürütme ve karmaşık çok adımlı görevlerde başarısız olurlar. Zor istekler için daha büyük bir modelle bunu yönlendirin.

Ollama ve LM Studio arasında fark nedir?

Ollama, HTTP API’ye sahip CLI-birinci çalışma zamanıdır. LM Studio, paketlenmiş llama.cpp sunucusu çalıştıran GUI-birinci masaüstü uygulamasıdır. Aynı makinede paralel olarak çalışabilirler.

Yerel LLM’leri çalıştırmak için GPU’ya ihtiyacım var mı?

Hayır ama yardımcı olur. Bir 3B modeli modern Apple Silicon CPU’sunda veya 16 GB RAM’li Intel/AMD çip üzerinde okunabilir hızda (saniyede 10 ila 20 belirteç) çalışır. GPU’lar bunu saniyede 60 ila 200 belirtece çıkarır.

Hangi uygulama en hızlı çalışır?

Belirteç başına, modern NVIDIA GPU’da vLLM. Kurulum başına, iyi bir quant ile llama.cpp. Kolaylık için, Ollama.