llama.cpp

XDA bu ay daha küçük bir yerel AI yığınının daha üretken bir yerel AI yığını olduğunu savunan bir makale yayınladı. Yazar olağan kargaşayı birikmiş: iki model çalıştırıcı, üç kullanıcı arayüzü, kimsenin kullanmadığı bir vektör veritabanı ve unuttuğu bir adaptör klasörü. Minimal bir set’e indirmek, kurulumu koruması daha kolay ve ulaşması daha kolay hale getirdi. Masaüstünde minimalist yerel bir AI yığını için sekiz en iyi uygulamayı test ettik, bir MacBook Pro M3’te, RTX 4070’li bir Windows iş istasyonunda ve AMD 7800 XT’li bir Debian kutusunda, her birinin yığındaki tek araç olarak nasıl davrandığına odaklandık. birçoğunun aksine.

Minimalist yerel AI uygulamasında nelere bakılmalı

Hızlı karşılaştırma

Uygulama En iyisi Platformlar Ücretsiz plan Başlangıç fiyatı Öne çıkan özellik
llama.cpp Referans çalışma zamanı Windows, macOS, Linux Ücretsiz, açık kaynak Ücretsiz Taşınabilir tek ikili çıkarım
llamafile Bir dosya, yükleme yok Windows, macOS, Linux Ücretsiz, açık kaynak Ücretsiz Model artı çalışma zamanı tek bir yürütülebilir dosyada
Ollama En basit CLI artı API Windows, macOS, Linux Ücretsiz, açık kaynak Ücretsiz ollama run ve OpenAI uç noktanız var
Jan API ile yerel masaüstü arayüzü Windows, macOS, Linux Ücretsiz, açık kaynak Ücretsiz Platformlar arası masaüstü sohbeti
KoboldCpp Tek ikili arayüz artı API Windows, macOS, Linux Ücretsiz, açık kaynak Ücretsiz Yerleşik web arayüzü ile GGUF koşucusu
Msty Yerel modellerde cilalanmış ücretli arayüz Windows, macOS, Linux Ücretsiz katman Gelişmiş özellikler için Msty aboneliği Çok modelli sohbet arayüzü
GPT4All En basit masaüstü sohbeti Windows, macOS, Linux Ücretsiz, açık kaynak Ücretsiz Başlangıç dostu, CLI yok
LM Studio Tam özellikli yerel koşucu Windows, macOS, Linux Kişisel kullanım için ücretsiz Ticari lisanslama Model keşif arayüzü, geniş arka uç desteği

Uygulamalar

1. llama.cpp — Herkese konu olan referans çalışma zamanı için en iyisi

llama.cpp bu listenin çoğunun bir şekilde sardığı çalışma zamanıdır. CPU, Metal, CUDA ve ROCm’de GGUF modellerini çalıştıran taşınabilir, bağımlılığı olmayan C++ bir çıkarım sunucusudur. Kendisi tarafından minimal bir yığın olarak, llama-server size OpenAI uyumlu bir uç noktası verirken llama-cli size bir REPL’i verir. Bu, çoğu yerel AI işi için yeterlidir.

Nerede başarısız olur: Cilalanmış bir arayüz yok. Bir sürüm ikilisini derleyip indiriyorsunuz. Model yönetimi el ile yapılır.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: github.com/ggerganov/llama.cpp

Sonuç: llama.cpp, en az hareketli parça istediğinizde ve bir terminalde rahat olduğunuzda seçtiğiniz şeydir.

2. llamafile — Çalışma zamanı ve model tek bir yürütülebilir dosyada en iyisi

llamafile Mozilla’nın Ocho projesi tarafından bir model ve llama.cpp çalışma zamanını, Windows, macOS ve Linux’ta yükleme olmadan çalışan tek bir Cosmopolitan-libc ikilisine paketler. Dosyayı indirin, chmod edin, çalıştırın. Bir tarayıcı arayüzü açar ve localhost’ta OpenAI uyumlu bir API’yi ortaya çıkarır. Bu, listede “minimal yerel AI"nin en kesin yorumudur.

Nerede başarısız olur: Taşınabilir tek ikili dosyalar ana bilgisayar güvenlik araçlarını tetikleyebilir. Yeni bir model indirmek yeni bir llamafile indirmek anlamına gelir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: github.com/Mozilla-Ocho/llamafile

Sonuç: llamafile, kurulum bir dosya ve sadece bir dosya olması gerektiğinde seçtiğiniz şeydir.

3. Ollama — En basit CLI artı API iş akışı için en iyisi

Ollama llama.cpp’i bu listedeki herhangi bir şeyin en temiz kurulum ve komut deneyimi ile sarar. ollama pull llama3.2:8b bir model indirir. ollama run llama3.2:8b bir sohbet açar. ollama serve varsayılan olarak 11434 bağlantı noktasında OpenAI uyumlu bir uç noktayı ortaya çıkarır. Modelfile biçimi sistem istemlerini ve parametrelerini tek bir metin dosyasıyla sabitlemenize izin verir.

Nerede başarısız olur: Varsayılan kurulum sunucuyu istemeyebileceğiniz bir arka plan hizmeti olarak çalıştırır. Manuel model nicemlemesi ham llama.cpp’ye kıyasla sınırlıdır.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: ollama.com

Sonuç: Ollama, tek komutlu kurulum ve tek komutlu çalıştırma en az barsa ne zaman seçilir.

4. Jan — API ile sahip olduğunuz yerel masaüstü arayüzü için en iyisi

Jan yerel modeller için sıfırdan oluşturulmuş masaüstü uygulaması, açık kaynaktır ve OpenAI uyumlu API sunucusu yerleşiktir. LM Studio yüzeyinden haber olmayan gerçek bir masaüstü sohbet arayüzü istediğinizde yüklediğiniz şeydir. Takım üç işletim sistemi için derler sevk ediyor ve model keşfi akışını basit tutuyor.

Nerede başarısız olur: LM Studio veya Ollama’dan daha genç bir proje. Bazı gelişmiş özellikler (özelleştirilmiş arka uçlar, derin model özelleştirmesi) geride kalır.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: jan.ai

Sonuç: Jan, uygun bir masaüstü arayüzü karar verici faktör olduğunda seçtiğiniz şeydir.

5. KoboldCpp — Taşınabilir hedefte tek ikili arayüz artı API için en iyisi

KoboldCpp KoboldAI topluluğu için hedeflenen llama.cpp’nin bir çatalı olarak başladı ve tarayıcı arayüzü, API uç noktası, resim ve ses girişi desteği ve kurulum adımı olmayan tek ikili GGUF koşucusuna dönüştü. İkiliye ve GGUF’a yanına koyun, bir komutu çalıştırın ve her şey hazır.

Nerede başarısız olur: Bazı özelleştirilmiş özellikler (Horde entegrasyonu, KoboldAI’e özgü istemler) genel sohbet kullanım durumu için önemli değildir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: github.com/LostRuins/koboldcpp

Sonuç: KoboldCpp, size daha ağır bir uygulama olmadan arayüz ve API veren tek bir ikili istediğinizde seçtiğiniz şeydir.

6. Msty — Yerel modellerde cilalanmış ücretli arayüz için en iyisi

Msty LM Studio yaklaşımını alır ve daha temiz bir arayüz üretir. Birden çok modelle yan yana sohbet edin, yerel Ollama veya Jan uç noktalarına bağlanın ve konuşmaları klasörlerde düzenleyin. Ücretsiz katman cömert; ücretli katman çok kullanıcılı ve çalışma alanı özellikleriyle kilidi açan şeydir.

Nerede başarısız olur: Kapalı kaynak. “Tek bir açık kaynak ikilisini kurun” minimalist ucundan değil. Polisiye ilkelere tercih eden tek bir kullanıcı için, bu iyidir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: msty.app

Sonuç: Msty, arayüz cilaması açık kaynak kısıtlamasıyla takas etmeye değer olduğunda seçtiğiniz şeydir.

7. GPT4All — Başlangıç dostu masaüstü sohbeti için en iyisi

GPT4All Nomic tarafından terminale dokunmak istemeyen biri için yerel bir LLM çalıştırmanın en dostça yoludur. Uygulamayı kurun, seçilmiş bir model listesine gözat, birini seçin, sohbet edin. Ayrıca yerel bir API’yi ortaya çıkarır ve sohbetten ötesine gitmeye karar verirseniz Nomic Atlas ile belge tabanlı RAG ile bütünleşir.

Nerede başarısız olur: Seçilmiş model listesi Hugging Face’te mevcut olanın küçük bir alt kümesidir. İleri düzey kullanıcılar bundan büyüyor.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: gpt4all.io

Sonuç: GPT4All, sadece çalışan bir masaüstü uygulaması isteyen ilk kez yerel AI kullanıcısı için seçtiğiniz şeydir.

8. LM Studio — Tam özellikli yerel koşucu için en iyisi

LM Studio “hala tek masaüstü uygulaması” nın maksimalist ucudur. Hugging Face’ten model keşfi, çok arka uç desteği (llama.cpp, Apple Silicon’da MLX), tam sohbet arayüzü, API sunucusu ve her şeyi ortaya çıkaran model yapılandırma yüzeyi. Ollama’nın basitliği çok sınırlı olduğunda insanların varsayılan olarak gittiği şeydir.

Nerede başarısız olur: Açık kaynak değil. Yukarıdaki seçeneklerden daha büyük kurulum ayakiç. Maksimalist özellik yüzeyi, XDA parçasının savunduğu minimal yığının tersidir, ancak kesmemeyi reddederseniz ne olacağının referans noktası olarak buraya dahildir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: lmstudio.ai

Sonuç: LM Studio, tam özellikli yerel koşucu yukarıdakilerden herhangi birinden daha büyük kuruluma değer olduğunda seçtiğiniz şeydir.

Doğru olanı nasıl seçersiniz

SSS

16 GB RAM’de hangi modeli çalıştırmalıyım? 7B veya 8B modelinin Q4 nicemlemesi bu zarfta iyi çalışır ve çoğu sohbet ve kodlama kullanım durumunu kapsar. 13B’den Q4 nicemlemesi mümkün ama sıkı.

Bu uygulamalar Apple Silicon’da çalışır mı? Evet. llama.cpp, Ollama, Jan, KoboldCpp, LM Studio ve Msty Apple Silicon’da Metal’i kullanıyor ve neredeyse-yerel hızı alıyor. llamafile Apple Silicon ikilisi ile birlikte gelir.

ChatGPT tarzı araçları yerel bir modele işaretleyebilir miyim? Evet. Ollama, llama.cpp, Jan, KoboldCpp, LM Studio ve llamafile localhost’ta OpenAI uyumlu bir uç noktayı ortaya çıkarıyor. Özel bir temel URL’yi kabul eden herhangi bir aracı http://localhost:<port>/v1 işaretleyin.

Minimal yığın maksimalist yığından nasıl farklıdır? Daha az hareketli parça. Bir çalışma zamanı, bir model yöneticisi, bir arayüz. Maksimalist yığınlar vektör veritabanları, orkestrasyonu katmanlar ve agen çerçeveleri ekler. Çoğu solo kullanıcı belirli bir sorun bunu talep edene kadar hiçbirine ihtiyaç duymaz.

Bunların hiçbirinin kutudan çıktığında ajan yeteneği var mı? Hayır. Bunlar çıkarım çalışma zamanları ve sohbet arayüzleridir. Bir agen döngüsü için bu uç noktalardan birine karşı OpenAI Sohbeti Tamamlanması protokolü hakkında konuşan ayrı bir araç eklersiniz.

Disk’te en küçük yığın hangisidir? llamafile artı tek bir nicemlenmiş model, mümkün olan en hafif kurulumdur. Ollama artı modeli mağazası yakın bir saniye ve büyümesi daha kolay.