
Herkes parametre sayısına takılı kalır. Daha büyük model, daha iyi cevaplar — ta ki tokenler saniyede üç hızında kayıncaya ve GPU’nuzun fanı bir yaprak üfleyiciye benzeninceye kadar. İnsanların 7B’den 70B modele geçerken aradığı hız kazançlarının yarısı, zaten sahip oldukları runtime’ı düzgün bir şekilde ayarlamaktan gelirdi.
2026’da yerel LLM çıkarımı kararların bir yığınıdır: kuantizasyon şeması, KV önbellek dtype, batch boyutu, prompt önbelleği, spekülatif dekodlama, offload stratejisi. Yerel LLM çıkarımı optimizasyonu için sekiz masaüstü uygulaması test ettik; her kontrol düğmesini ortaya çıkaran düşük seviye runtime’larından sizin için makul varsayılanları seçen sarılmış araçlara kadar. Ne kadar derinlemesine gitmek istediğinize eşleşen olanı seçin.
Yerel LLM çıkarımı optimizasyonu uygulamasında ne arayın
Her runtime aynı şeyi optimize etmez. Seçmeden önce, bunlardan hangisine gerçekten ihtiyaç duyduğunuzu bilin:
- Kuantizasyon desteği. Runtime, GGUF, EXL2, AWQ veya MLC biçimlerini okuyabilmeli ve model başına bit genişliğini seçmenize izin vermeli. 4-bit modern standarttır; bazı iş yükleri 3-bit’te iyi çalışır.
- KV önbellek kontrolleri. Önbellek dtype (fp16 vs q8_0 vs q4_0) ve önbellek boyutu VRAM kullanımını önemli ölçüde değiştirir. Runtime’ın bunları ayarlamanıza izin vermesi gerekir.
- Prompt önbelleği yeniden kullanımı. Chat ve RAG için, önceki iletiden KV önbelleğini yeniden kullanmak, anlık yanıtlar ile tam prefill arasındaki farktır.
- Spekülatif dekodlama. Küçük bir taslak modelini büyük bir hedef modelle eşleştirmek, sohbet iş yükleri için aynı donanımda verimliyi iki katına çıkarabilir.
- Çoklu GPU ve offload. Katman katman CPU RAM’e offload, GPU’lar arasında tensor bölme ve NUMA duyarlı ayırma, modeller büyüdüğünde önemli hale gelir.
- Batch ve eşzamanlı istek yönetimi. Birden fazla istemciyi sunuyorsanız, batch boyutu 8 veya 16’da verim, batch 1’de gecikme süresi olandan daha önemlidir.
Hızlı karşılaştırma
| Uygulama | En iyi | Platformlar | Ücretsiz plan | Öne çıkan özellik |
|---|---|---|---|---|
| llama.cpp | Derin kuantizasyon + KV önbellek kontrolü | Windows, macOS, Linux | Tamamen ücretsiz, açık kaynak | GGUF ekosistemi, katman başına offload |
| Ollama | Makul varsayılanlar ile sıfır yapılandırma runtime’ı | Windows, macOS, Linux | Ücretsiz | Tek satırlı model değişimi |
| LM Studio | Terminal olmadan ayarlama için GUI | Windows, macOS, Linux | Ücretsiz | GGUF için görsel runtime ayarları |
| vLLM | PagedAttention ile toplu sunucu | Linux, WSL üzerinden Windows | Ücretsiz, açık kaynak | Birçok istemci için sürekli batching |
| MLC LLM | GPU’lar üzerinde derlenmiş çıkarım | Windows, macOS, Linux | Ücretsiz, açık kaynak | TVM tarafından derlenmiş kerneller, Metal + Vulkan |
| KoboldCpp | Roleplay ve yaratıcı yazı ayarlaması | Windows, macOS, Linux | Ücretsiz, açık kaynak | İstem başına KV önbellek ayarlama arayüzü |
| ExLlamaV2 | Nvidia’da hızlı EXL2 çıkarımı | Windows, Linux | Ücretsiz, açık kaynak | EXL2 quant + spekülatif dekodlama |
| TabbyAPI | OpenAI uyumlu ExLlamaV2 sunucusu | Windows, Linux | Ücretsiz, açık kaynak | Herhangi bir OpenAI istemcisinin arkasında düşer |
Uygulamalar
1. llama.cpp — Derin kuantizasyon ve KV önbellek kontrolü için en iyi
llama.cpp, ekosisteminin çoğunun inşa edildiği runtime’dır. 8-bit’ten 2-bit’e GGUF kuantizasyonlarını okur, model VRAM’e sığmadığında CPU’ya katman katman offload yapar ve cache dtype ayarlarını ortaya çıkarır, böylece kaliteyi yer için takas edebilirsiniz.
Ayarlama yüzeyi, hızın yaşadığı yerdir. GPU’nuz için --n-gpu-layers‘ı doğru şekilde ayarlamak, cache dtype’ı kuant ile eşleştirmek, --flash-attn‘ı etkinleştirmek ve prompt önbellek dosyalarını kullanmak aynı donanımda verimliyi iki katına çıkarabilir.
Eksik olduğu yer: CLI yoğun ve flag listesi hızla değişir. İlk kez ayarlama, belgeleri okumak için bir öğleden sonra alır.
Fiyatlandırma:
- Ücretsiz, açık kaynak.
Platformlar: Windows, macOS, Linux — CPU, CUDA, Metal, Vulkan, ROCm.
İndir: llama.cpp GitHub’da
Özet: Hız rahatlıktan daha önemli olduğunda ulaşılacak runtime.
2. Ollama — Makul varsayılanlar ile sıfır yapılandırma runtime’ı için en iyi
Ollama, llama.cpp’yi sarar ve çoğu insanı bayrak dokunmadan kabul edilebilir bir verimliliğe getiren varsayılanları seçer. Bir model çekin, çalıştırın, bitti. Modelfile biçimi, model başına sistem istemlerini, örnekleme parametrelerini ve bağlam uzunluğunu ayarlamanıza izin verir.
Rotasyonda birkaç modeli çalıştıran bir iş istasyonu için, bu “kurulu” olmaktan “kullanılabilir” olmaya kadar en hızlı yoldur. Gelişmiş ayarlama, komut satırı bayraklarından ziyade Modelfile parametreleri aracılığıyla gerçekleşir.
Eksik olduğu yer: Soyutlama, verimlilik payından son %30’unu sıkıştıran bazı kaldıraçları gizler. Power kullanıcılar sık sık rahat kullanım için Ollama ve ağır iş için llama.cpp ile biter.
Fiyatlandırma:
- Ücretsiz.
Platformlar: Windows, macOS, Linux.
İndir: Ollama masaüstü için
Özet: Yerel LLM’lerde yeni olan ve kılavuzsuz hız isteyen biri için varsayılan seçim.
3. LM Studio — Terminal olmadan ayarlama için en iyi
LM Studio, llama.cpp’nin optimizasyon düğmelerini gerçek bir GUI aracılığıyla ortaya çıkarır. Quant seçimi, n_gpu_layers, bağlam uzunluğu, cache dtype ve batch boyutu bayraklar yerine kaydırıcılar ve açılır menü alır.
Bu, düğmelerin ne yaptığını anlayan ancak CLI sözdizimini ezberlemek istemeyen kişiler için en iyi seçim yapar. Yerleşik sohbet ve API sunucusu, ayarlamaya çalışırken test platformu olarak çalışır.
Eksik olduğu yer: Yalnızca GUI, komut dosyası oluşturmanın sınırlı olduğu anlamına gelir. Başsız sunucular için llama.cpp veya Ollama’ya geri dönün.
Fiyatlandırma:
- Kişisel ve hobi kullanımı için ücretsiz.
- Ücretli: Ticari dağıtımlar için Takım planları.
Platformlar: Windows, macOS, Linux.
İndir: LM Studio masaüstü için
Özet: Sonunda llama.cpp’yi erişilebilir yapan ayarlama GUI’si.
4. vLLM — PagedAttention ile toplu sunucu için en iyi
vLLM, birden fazla eşzamanlı istek sunduğunuzda parlak olur. PagedAttention, KV önbelleğini bir bellek ayırıcısı gibi yönetir ve parçalanma olmaksızın aynı VRAM’e birçok aktif sırayı paketler. Sürekli batching, yeni isteklerin geçerli olanının bitmesini beklemek yerine token oluşturmaları arasında yuvalanması anlamına gelir.
Aynı anda birden fazla uygulama için OpenAI uyumlu bir uç nokta çalıştıran bir ev laboratuvarı için, batch 8’de vLLM’nin verim eğrisi tek istek runtime’larını yok eder.
Eksik olduğu yer: Nvidia ilk, AMD ve Metal’da daha az olgun. Takas, açıkçası bunun için gerçek bir GPU istemenizdir.
Fiyatlandırma:
- Ücretsiz, açık kaynak.
Platformlar: Yerli Linux, WSL üzerinden Windows.
İndir: vLLM GitHub’da
Özet: Aynı kutudan birden fazla istemciyi sunan herkes için runtime.
5. MLC LLM — GPU’lar üzerinde derlenmiş çıkarım için en iyi
MLC LLM farklı bir bahis yapar: TVM ile model kernel’larını tam hedef donanım için derleyin. Bu, Mac Studio ise veya CUDA ilk runtime’ların mücadele ettiği AMD kutusuysanız önemli olan Metal, Vulkan ve WebGPU desteği sağlar.
Sonuç, llama.cpp’nin iyisi ama hızlı olmadığı donanımda hızlı prefill ve decode’dur. Derleme, model başına hedef başına bir kerelik adım ekler.
Eksik olduğu yer: Model zoosu GGUF’dan daha küçüktür ve iş akışı ilk kez kullanıcılar için daha ağırdır.
Fiyatlandırma:
- Ücretsiz, açık kaynak.
Platformlar: Windows, macOS, Linux, tarayıcılarda WebGPU.
İndir: MLC LLM GitHub’da
Özet: Birincil GPU’nuz Nvidia kartı değilse en güçlü seçim.
6. KoboldCpp — Roleplay ve yaratıcı yazı ayarlaması için en iyi
KoboldCpp, uzun biçim yazı ve roleplay’e hedeflenen UI ile alt tarafta llama.cpp’dir. Bu iş yükü KV önbelleğine ağır yüklenilir — uzun bağlam, şimdiye kadar aynı hikayenin tekrarlanan yeniden okumaları — bu nedenle KoboldCpp, önbellek yeniden kullanımı ve bağlam-kaydırma kontrollerini belirgin bir şekilde ortaya çıkarır.
Senaryo araçları, dünya bilgisi ve bellek özellikleri, onu hedef kitlesinin dışında da güçlü bir seçim yapar. Uzun bağlam istemlerini çalıştıran herkes, önbellek ayarlamasından yararlanır.
Eksik olduğu yer: UI işlevsel yerine cilalı. Sunucu modu iyidir ancak birincil deneyim yerleşik sohbettir.
Fiyatlandırma:
- Ücretsiz, açık kaynak.
Platformlar: Windows, macOS, Linux.
İndir: KoboldCpp GitHub’da yayınlanır
Özet: Uzun bağlam çalışması için en iyi ayarlanmış ön uç.
7. ExLlamaV2 — Nvidia’da hızlı EXL2 çıkarımı için en iyi
ExLlamaV2, EXL2 kuantizasyon biçimini okuyan CUDA ilk çıkarım motorudur. Aynı Nvidia GPU’da, tipik olarak aynı etkili kalite bit bütçesi için token başına saniyelerde llama.cpp’yi yener. Küçük bir taslak modeliyle spekülatif dekodlama ona bir başka sıçrama verir.
Tek hızlandırıcı olarak 3090, 4090 veya 5090 olan bir iş istasyonu için, hız burada yaşar. OpenAI uyumlu bir uç nokta almak için TabbyAPI ile eşleştirin.
Eksik olduğu yer: Yalnızca Nvidia. Metal yok, ROCm hikayesi yok.
Fiyatlandırma:
- Ücretsiz, açık kaynak.
Platformlar: Nvidia GPU’lu Windows, Linux.
İndir: ExLlamaV2 GitHub’da
Özet: Nvidia GPU’dan saniyede en çok tokeni çıkartmak için runtime.
8. TabbyAPI — OpenAI uyumlu ExLlamaV2 sunucusu için en iyi
TabbyAPI, ExLlamaV2’yi OpenAI uyumlu bir REST API’ye sarar; böylece OpenAI ile zaten konuşan herhangi bir şey — Cursor, Continue, Aider, LibreChat — bunu temel URL değişikliğiyle bırakabilir. Streaming, işlev çağırma ve spekülatif dekodlama tümü aynı API yüzeyi aracılığıyla çalışır.
Stack’ı OpenAI uç noktasını varsayacak şekilde ayarlanmış biri için, TabbyAPI “disk üzerindeki yerel model” ila “her şey onunla konuşur” e giden en kısa yoldur.
Eksik olduğu yer: Yapılandırma TOML dosyalarıdır, GUI değil. İlk kurulumu hata ayıklama sabır gerektirir.
Fiyatlandırma:
- Ücretsiz, açık kaynak.
Platformlar: Nvidia GPU’lu Windows, Linux.
İndir: TabbyAPI GitHub’da
Özet: Varolan araçlarınızın başka bir şey değiştirmeden ExLlamaV2’yi kullanmasına izin veren köprü.
Doğru olanı nasıl seçin
Maksimum kontrol istediğinizde ve bayrakları öğrenmeye istekli olduğunuzda llama.cpp seçin. Bu listedeki her şey bunu kullanır veya buna karşı ölçülür.
Yapılandırma dosyası olmadan hız istediğinizde Ollama’yı seçin. Sizi bir komutta %80 yoluna getirir.
llama.cpp’nin bayrakları Çinceye benzediğinde ve aynı ayarlama yüzeyini kaydırıcılarla istediğinizde LM Studio seçin.
Iş yükü birçok eşzamanlı istek olduğunda vLLM’yi seçin. Batching, ölçekte kazanır.
Birincil GPU Apple Silicon veya AMD olduğunda MLC LLM’yi seçin. CUDA ilk runtime’ları bu donanımda düşük performans gösterir.
İstemler uzun olduğunda ve hikaye önemli olduğunda KoboldCpp’yi seçin. Bağlam işleme onun bütün oyunudur.
Kutu Nvidia olduğunda ve her milisaniye sayıldığında ExLlamaV2 (TabbyAPI ile) seçin.
Yalnızca ihtiyacınız olan modellerin yerel ağırlıkları olmadığı veya istek hacmi, yerel bir taneyi çalıştırmak için elektriğe kıyasla kiralanmış bir A100’ün daha ucuz olacağı kadar büyükse bulutta kalın.
Sss
Kuantizasyon gerçekten yerel LLM’leri hızlandırır mı?
Evet, ve çoğu insanın beklediğinden daha fazla. Aynı modelde fp16’dan Q5_K_M’ye geçmek tipik olarak VRAM kullanımını yarıya indirir ve GPU’ya bağlı yüklerde token başına saniyeleri iyileştirir; kalite kaybı, çoğu kullanıcının kör testlerde tespit edemeyeceği kadar küçüktür.
Spekülatif dekodlama nedir?
Spekülatif dekodlama, birkaç tokeni önceden tahmin etmek için küçük bir “taslak” modelini çalıştırır, ardından bunları tek bir büyük model geçişinde doğrular. Taslak doğru olduğunda, büyük model çağrısı başına birden fazla token alırsınız. Sohbet iş yükleri üzerinde, verimliyi neredeyse iki katına çıkarabilir.
PagedAttention nedir ve neden yerel LLM’ler için önemlidir?
PagedAttention, vLLM’nin KV önbellek yönetimi tekniğidir. İstek başına sabit boyutlu önbellek yuvalarını ayırmak yerine, dinamik olarak atanabilen sayfalar olarak önbellek belleğini ele alır. Meşgul bir sunucuda, bu, aynı VRAM’e çok daha fazla eşzamanlı isteğin sığması anlamına gelir.
Hangi yerel LLM runtime Apple Silicon’da en hızlıdır?
MLC LLM’nin derlenmiş Metal kernel’ları tipik olarak Mac’lerde en hızlı tek kullanıcı seçeneğidir. llama.cpp’nin Metal arka ucu yakın ve çalıştırması daha kolay — ekstra %10 ila 20% önemliyse MLC seçin, aksi takdirde llama.cpp.
Ayrık GPU olmadan yerel LLM çalıştırabilir miyim?
Evet. llama.cpp ve Ollama her ikisi de herhangi bir GGUF modeliyle CPU üzerinde çalışır. Modern dizüstü bilgisayarlardaki hızlar, 7B modellerinde saniyede birkaç tokenden 70B’de yavaş bir ilerleyişe kadar değişir — sohbet için kullanılabilir, uzun oluşturmalar için sıkıntılıdır.