Ollama ile masaüstünde birden fazla yerel AI modeli çalıştırma

Masaüstünde birden fazla yerel AI modeli çalıştırmak için en iyi uygulamalar, GPU’nuzun tek yuvalı kartuş konsolu olarak davranmayı bırakanlarıdır. Daha büyük yerel modelleri takip etmeyi bırakan bir yazar tarafından yazılan yakın tarihli bir XDA makalesi bunu açıkça ortaya koymaktadır: yan yana çalışan iki 2GB modeli bir 8GB modeli geçmiştir, çünkü her küçük model belirli bir görev için seçilmiştir. Bir 3B kod modeli otomatik tamamlamayı yönetiyordu. Bir 3B sohbet modeli konuşmayı yönetiyordu. İkisinin de evrensel olması gerekmiyordu.

İşte burada önemsediğimiz desen budur. Karşılaştırma yaşını sormak değil. Yönlendirme. Geçen birkaç hafta içinde yedi masaüstü çalıştırıcı ve orkestrasyoncu test ettik, modelleri ne kadar hızlı değiştirdiklerini ölçtük, iki tanesini aynı anda yüklü tutabilip tutamadıklarını kontrol ettik ve yönlendirmenin pratikte ne kadar kullanışlı olduğunu değerlendirdik. Bu liste, 12GB ila 24GB kartı olan ve gerçek bir asistan artı bir kod modeli artı belki bir görüş modeli, hepsi bir makinede istemiş olan herkes için.

Yerel çok modelli çalıştırıcıda ne aranmalı

Altı şey, çok modelli iş akışlarını keyifli hale getiren araçları tek modelli çıkmazlara zorlayan araçlardan ayırır.

Hızlı karşılaştırma

Uygulama En iyisi Platformlar Ücretsiz plan Ücretli katman Çok modelli hikayesi
Ollama Temel çalıştırıcı ve API katmanı Windows, macOS, Linux Tamamen ücretsiz, açık kaynak Hiçbiri İsteğe bağlı hızlı değişim, son modelleri ılık tutar
LM Studio GUI çok modelli sekmeler Windows, macOS, Linux Kişisel kullanım için ücretsiz İş için ekip lisansı Aynı anda birden fazla modeli yükleyin, sekmeleri değiştirin
Msty Modeller arasında paralel sohbet Windows, macOS, Linux Ücretsiz katman Aurum ömür boyu lisansı Sekiz model arasında yan yana yanıtlar
Jan Açık kaynak çok modelli sohbet istemcisi Windows, macOS, Linux Tamamen ücretsiz, açık kaynak Hiçbiri Konuşma başına değişim, OpenAI uyumlu sunucu
Open WebUI Ollama üzerinde boru hattı yönlendirme katmanı Web UI, kendi kendine barındırılan Tamamen ücretsiz, açık kaynak Hiçbiri İstek başına model seçimi, ardışık betikler
LocalAI Kutunun dışından çık API yönlendiricisi Windows, macOS, Linux, Docker Tamamen ücretsiz, açık kaynak Hiçbiri Bir uç nokta çok sayıda arka uç ve biçime yönlendirir
LiteLLM Arka uçlar arası vekil Windows, macOS, Linux Tamamen ücretsiz, açık kaynak Yönetilen bulut katmanı Model adına göre herhangi bir yerel veya uzak sağlayıcıya yönlendirir

Uygulamalar

1. Ollama, yerel model hızlı değişimi için en iyi

Ollama, bu listenin çoğu öğesinin bağlı olduğu uygulamadır ve haklı nedenlerle. CLI’si ve llama.cpp etrafındaki API’si model yönetimini docker pull gibi hissettirir ve birden fazla modelle davranışı, iki küçük modelli iş akışlarının ilk başta çalışmasının nedenidir. ollama run llama3.2:3b sohbeti için çalıştırın ve otomatik tamamlama için ollama run qwen2.5-coder:3b çalıştırın ve daemon, diğerini yüklerken yakın zamanda kullanılanı sıcak tutun. Varsayılan canlı kalma süresi beş dakikadır, bu nedenle hızlı bir geri değişim yükleme maliyetini telafi etmez. OLLAMA_KEEP_ALIVE daha yüksek ayarlayın ve VRAM basıncı bunu tahliye etmeye zorlayıncaya kadar model ikamet kalır.

http://localhost:11434/v1 adresindeki OpenAI uyumlu uç nokta, test ettiğimiz her IDE eklentisi, sohbet ön ucu ve aracı çerçevesinin uyarıcı olmadan bağlanması anlamına gelir. 24GB kartında bir 7B sohbet modeli ve bir 3B kod modelini satış yeri ile birlikte sakin tuttuk.

Nerede eksik: GUI yok. Model keşfi Modelfile adlı bir metin dosyasıdır. Windows GPU desteği yerel yayınlamadan bu yana istikrarlı olmuştur, ancak yine de macOS için cilalama konusunda geride kalır.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux।

İndir: Yayıncı sitesi - GitHub

Sonuç: Bunu ilk olarak yükleyin. Günlük sürücünüz bir GUI uygulaması olsa da, muhtemelen arka uç olarak Ollama istiyorsunuz.

2. LM Studio, birden fazla modeli aynı anda tutmak için en iyi GUI

LM Studio, küçük model hilesini istemeyen CLI olmayan bir kullanıcıya verilecek uygulamadır. 0.3 serisi aynı pencerede çok modelli destek ekledi, bu nedenle bir sekmede bir sohbet modeli, başka bir sekmede bir kod modeli yükleyebilir ve her yükleme için bekleme yapmadan aralarında geçiş yapabilirsiniz. Yerleşik sunucu, yüklenen modeli başına OpenAI uyumlu bir uç nokta ortaya koymaktadır, bu da düzenleyici uzantısının kod modeline çarpabilmesi anlamına gelir, sohbet pencereniz sohbet modeli ile konuşmaya devam eder.

Model keşfi, Hugging Face’e karşı yerleşik niceleme seçici ve VRAM tahmincisi ile bir arama kutusudur. Kullanıcı Arayüzü, model başına GPU boşaltma kaydırıcısını gösterir, bu da iki orta boyutlu modeli bir karta sığdırmaya çalışırken önemlidir.

Nerede eksik: Açık kaynak değil. Ücretsiz lisans kişisel kullanımı kapsar ve indirme akışının tanıması istediği iş kullanımı için ayrı bir lisans vardır. Bazı niceleme biçimleri ham llama.cpp’de olduğundan daha yavaş yüklenir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: Yayıncı sitesi - GitHub

Sonuç: Gerçek bir GUI, birden fazla yüklü model ve terminaline dokunmadan çalışan bir API sunucusu istiyorsanız en iyi seçim.

3. Msty, paralel sohbet ve karşılaştırma için en iyi

Msty, kopyala-yapıştır modelleri A/B test etmeyi bırakmamızı sağlayan uygulamadır. Bölünmüş görünümü, bir istemi iki, dört veya en fazla sekiz modele gönderip yanıtları yan yana okumanıza olanak tanır. Hangi küçük modelin yüklü tutmaya değer olduğunu anlamaya çalışırken istediğiniz tam iş akışı budur. Bunu Ollama’ya yönlendirin ve otomatik olarak yerel modellerinizi miras alır. Bunu OpenAI veya Anthropic anahtarlarına yönlendirin ve aynı görünümde yerel vs. barındırılan karşılaştırıldığında.

Knowledge Stack özelliği, belge ve PDF klasörleri eklemenizi ve bunları modellerde sorgulamanıza izin verir; bu, küçük bir sohbet modeli ile küçük bir yerleştirme modelini birlikte sakin tutmakla iyi çiftleşir.

Nerede eksik: Açık kaynak değil. Ücretsiz katman kişisel kullanımı kapsar ve Aurum yükseltmesi iki model üzerinde sohbet bölüne, çalışma alanı senkronizasyonu ve diğer ekstraları açar. Kullanıcı Arayüzü özelliklerle yüklü ve öğrenmek için bir oturum sürer.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: Yayıncı sitesi

Sonuç: Aynı anda iki modelin aynı soruya cevap vermesini görmek istediğinizde bunu seçin.

4. Jan, en iyi açık kaynak çok modelli sohbet istemcisi

Jan, GUI lisansı sorusu olmadan LM Studio tarzı bir GUI istiyorsanız açık kaynak alternatifidir. Kendi çıkarım motoruyla gelir, Ollama veya llama.cpp sunucularına karşı çalıştırılabilir ve konuşma başına modeli değiştirmenize izin verir. Her iş parçası, hangi modeli, hangi sistem istemini ve hangi parametreleri kullandığını hatırlar, böylece kod iş parçası ve yazma iş parçası birbirini kirletmeden farklı uzmanları gösterebilir.

Yerleşik yerel sunucu, OpenAI uyumlu bir uç nokta ortaya koymakta ve uygulamanın kendisi küçük bir eklenti API’si aracılığıyla genişletilebilir. Testlerimizde, hedef zaten yüklendiğinde iki iş parçası arasında model değişimi neredeyse anlıktı ve bir NVMe’deki diskten yüklenmesi gerektiğinde yaklaşık üç ila sekiz saniye.

Nerede eksik: Henüz kendi motorunda birden fazla modeli sakin tutamıyor. Aynı anda ikisinin yüklenmesini istiyorsanız bunu Ollama’ya yönlendirin ve Ollama’nın sakin yönetimini yapmasını sağlayın. Windows’ta GPU hızlandırması hala bazı niceleme biçimleri için macOS derlemesinde geride kalmıştır.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: Yayıncı sitesi - GitHub

Sonuç: Açık kaynak önemli olması ve CLI çalışması olmadan iş parçası başına model yönlendirmesi istiyorsanız doğru seçim.

5. Open WebUI, Ollama’nın üzerinde en iyi yönlendirme katmanı

Open WebUI Ollama WebUI olarak markalandırılmıştır ve kendi kendine barındırılan yerel yığının en eksiksiz web ön ucu olmaya devam etmektedir. Buraya kazandırılan şey, boru hattı sistemidir: istem içeriğine, ileti geçmişine veya ekli dosyalara göre istek başına modeli seçen komut dosyaları tanımlayabilirsiniz. Klasik örnek, kod bloğuyla başlayan herhangi bir şeyi coder modelinize gönderen ve diğer her şeyi sohbet modelinize gönderen bir yönlendirme boru hattıdır, hepsi bir konuşma içinde.

Ayrıca tek bir mesajda paralel model yanıtlarını, artı kendi belge deponuzla RAG’ı, artı işlev çağrılarını destekler. LAN’ınıza her şeyi ortaya koymaktan dolayı, bodrumda bir Ollama kutusu, evin her makinesine yönlendirilmiş çok modelli sohbeti sunabilir.

Nerede eksik: Web ilk. Yerel masaüstü istemcisi yok, bu nedenle bunu tarayıcıda yerel olarak çalıştırırsınız veya bir sunucuda kendi kendine barındırırsınız. Kurulum Docker veya Python istediği için çift tıklamalı yükleyici değil.

Fiyatlandırma:

Platformlar: Docker veya Python’un çalıştığı her yerde çalışır. Windows, macOS, Linux’ta tarayıcı aracılığıyla erişim.

İndir: Yayıncı sitesi - GitHub

Sonuç: Programlanabilir yönlendirme istiyorsanız ve beş dakikalık Docker yüklemesiyle rahat olduğunuzda bunu kullanın.

6. LocalAI, model aileleri arasında en iyi kutunun dışında çık API yönlendiricisi

LocalAI belirli bir sorunun cevabıdır. GGUF’ta bir sohbet modeliniz var, transkripsiyon için bir whisper modeliniz var, difüzyon için bir görüntü modeliniz ve küçük bir yerleştirme modeliniz var ve hepsi için OpenAI uyumlu konuşan bir uç nokta istiyorsunuz. Her arka ucu kendi işçisinde çalıştırır, istekleri model adına göre yönlendirir ve yanıtları barındırılan API’nin yapacağı aynı şekilde döndürür. Continue eklentiniz, not alma aracınız ve özel komut dosyanız tümü aynı URL’yi işaret eder ve adlarına göre model seçerler.

İki küçük modelli desen için bu, Continue’nun qwen-coder-3b istediği ve not alma uygulamanızın llama-3.2-3b istediği bir iş akışı anlamına gelir, her ikisi de aynı proxy’den sunulur, her ikisi de sık yüklenebilir, her ikisi de yağında ağır görevin sohbeti durdurmayacak şekilde izole edilmiş.

Nerede eksik: Kurulum Ollama’dan daha ağırdır. Model yapılandırması arka uç başına YAML’dir. GPU hızlandırması çalışır ancak neyi kurduğunuzu bilmek ister. Dokümantasyon kapsamlıdır ancak OpenAI uyumlu yükün neye benzediğini zaten bildiğinizi varsayar.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux, Docker.

İndir: Yayıncı sitesi - GitHub

Sonuç: Yerel bir API istediğinizde doğru seçim, ayrı sunucuları yapıştırmadan metin, görüş, ses ve yerleştirmelere konuşur.

7. LiteLLM, görev yönlendirmesi için en iyi arka uçlar arası vekil

LiteLLM, bir arabirimle yüz model sağlayıcısını çağırmak için Python SDK olarak başladı ve proxy sunucusu, burada yerel ilk listede kazanılan yerdir. Ollama, LM Studio, LocalAI veya herhangi bir karışım önüne alın ve istemciler OpenAI uyumlu bir yükle konuşurlar. İstenen model adının arkasındaki arka uç için isteği yeniden yazar. Bir uç nokta chat yerel Llama’nıza ve code yerel Qwen Coder’ınıza yönlendirilir, aynı araç her ikisini de elde eder, ikisinin nerede yaşadığını bilmeden.

Ayrıca fallback’leri, yeniden denemeleri, oran limitlerini ve anahtar başına bütçeleri işler; bu, birden fazla uygulamanızın GPU’yu paylaşmaya başladığı anda önemlidir.

Nerede eksik: Vekil, çalıştırıcı değil. Modelleri sunmak için arka tarafında hala Ollama veya LocalAI gerekir. Yapılandırma YAML dosyasıdır. Cilalı pano yönetilen bulut katmanında oturur, bu nedenle kendi kendine barındıranlar ücretsiz UI artı yapılandırma dosyalarına bağımlıdır.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux, Docker.

İndir: Yayıncı sitesi - GitHub

Sonuç: Birden fazla uygulamanın birden fazla yerel modele basması ve adlar, yönlendirme ve limitler için tek bir doğru kaynağı istediğinde bunu ekleyin.

Doğru olanı seçme

Küçük modelli hilenin minimum kurulumunu istiyorsanız Ollama çalıştırın ve bitti. 3B sohbet modeli ve 3B kod modeli çekin, daemon’u bir tanesi sıcak tutarken diğerini kullanmasını sağlayın ve düzenleyicinizi yerel uç noktaya yönlendirin.

GUI ve terminal olmadan istiyorsanız LM Studio yükleyin. İki sekmede iki modeli yükleyin ve API’ye ihtiyaç duyan herhangi bir şey için yerleşik sunucusunu kullanın.

Bunlara VRAM taahhüt etmeden önce modelleri karşılaştırmak istiyorsanız Msty kullanın ve bir tane kazanıncaya kadar aynı istemi adaylar arasında böl.

GUI ve açık kaynak istiyorsanız Ollama’nın üzerinde Jan çalıştırın.

İstem içeriğine göre yönlendirmek istiyorsanız Ollama’nın önüne Open WebUI kendi kendine barındırın ve bir boru hattı yazın.

İş yükünüz sohbete ek olarak görüş, transkripsiyon veya yerleştirmeleri içeriyorsa LocalAI’yi ortaya koyun ve bir API’nin tümünü sunmasını sağlayın.

Zaten üç araç iki modele basıyorsanız ve karışık hale geliyorsa LiteLLM’yi önüne bırakın ve rol’e göre her şeyi yeniden adlandırın.

Sıkça Sorulan Sorular

Gerçekten aynı anda iki yerel AI modeli çalıştırabilirim?

Evet, her ikisini de tutmak için yeterli VRAM ile herhangi bir GPU’da. İki 3B veya 4B nicemlenmiş model 12GB kartına rahat şekilde oturur. Ollama ve LM Studio her ikisini de sakin tutabilir ve boşta olan istekler soğuk yükleme olmadan anında döner. Bu ilham veren XDA makalesi teorik değil, çalışan bir örnektir.

Bir büyük yerel AI modeli her zaman iki küçükten daha iyi midir?

Gerçek iş akışları için hayır. Tek bir 8B modeli genelci olması gerekir, bu da orta dereceli bir kodlayıcı ve orta dereceli bir yazar olduğu anlamına gelir. Uzmanlaşmaları için seçilen iki 3B modeli (diyelim coder modeli artı sohbet modeli) genellikle her uzman görevde daha büyük tek modeli yener, özellikle doğru yönlendirme ile. Büyük tek modelin hala kazandığı tek yer, uzun bağlam gerektiren zor bir soru hakkında derin akıl yürütmedir.

Masaüstünde birden fazla yerel model çalıştırmak için en iyi ücretsiz uygulama nedir?

Daemon ve API için Ollama. GUI veya programlanabilir yönlendirme istediğinizde Jan veya Open WebUI’yi üstüne ekleyin. Üçü de açık kaynaktır ve koltuk sınırı olmaksızın ücretsizdir.

LM Studio aynı anda iki modeli çalıştırmanıza izin veriyor mu?

Evet, 0.3 serisi beri sekmeli aynı oturumda birden fazla modeli yüklemeyi destekler ve yerleşik OpenAI uyumlu sunucu yüklü her modeli ayrı bir uç nokta olarak ortaya koymaktadır. Ana sınır VRAM’dir.

İki yerel AI modeli çalıştırmak için ne kadar VRAM’e ihtiyacım var?

İki 3B veya 4B nicemlenmiş model için rahat minimum 12GB’dir. 8GB kartlarda Q4’te iki çok küçük modeli zar zor çalıştırabilirsiniz, ancak biraz eş zamanlılık alanı kaybedersiniz. 7B artı sakin tutacak 3B için, 16GB ve üstünü planlayın.

Ollama ile LocalAI arasındaki fark nedir?

Ollama, temiz CLI, metin modeli kataloğu ve OpenAI uyumlu uç nokta ile llama.cpp etrafında odaklanmış bir çalıştırıcıdır. LocalAI, metin, görüntü, ses ve yerleştirmeler dahil olmak üzere aynı anda çok sayıda arka ucu açabilen daha geniş bir API katmanıdır, arka uç başına YAML yapılandırması. Ollama başlamak daha kolay. LocalAI, iş akışınız sohbetten fazla olduğunda ulaştığınız şeydir.