2026'da masaüstünde yerel LLM çıkarımı optimizasyonu için en iyi uygulamalar (8'ini test ettik)

Herkes parametre sayısına takılı kalır. Daha büyük model, daha iyi cevaplar — ta ki tokenler saniyede üç hızında kayıncaya ve GPU’nuzun fanı bir yaprak üfleyiciye benzeninceye kadar. İnsanların 7B’den 70B modele geçerken aradığı hız kazançlarının yarısı, zaten sahip oldukları runtime’ı düzgün bir şekilde ayarlamaktan gelirdi.

2026’da yerel LLM çıkarımı kararların bir yığınıdır: kuantizasyon şeması, KV önbellek dtype, batch boyutu, prompt önbelleği, spekülatif dekodlama, offload stratejisi. Yerel LLM çıkarımı optimizasyonu için sekiz masaüstü uygulaması test ettik; her kontrol düğmesini ortaya çıkaran düşük seviye runtime’larından sizin için makul varsayılanları seçen sarılmış araçlara kadar. Ne kadar derinlemesine gitmek istediğinize eşleşen olanı seçin.

Yerel LLM çıkarımı optimizasyonu uygulamasında ne arayın

Her runtime aynı şeyi optimize etmez. Seçmeden önce, bunlardan hangisine gerçekten ihtiyaç duyduğunuzu bilin:

Hızlı karşılaştırma

Uygulama En iyi Platformlar Ücretsiz plan Öne çıkan özellik
llama.cpp Derin kuantizasyon + KV önbellek kontrolü Windows, macOS, Linux Tamamen ücretsiz, açık kaynak GGUF ekosistemi, katman başına offload
Ollama Makul varsayılanlar ile sıfır yapılandırma runtime’ı Windows, macOS, Linux Ücretsiz Tek satırlı model değişimi
LM Studio Terminal olmadan ayarlama için GUI Windows, macOS, Linux Ücretsiz GGUF için görsel runtime ayarları
vLLM PagedAttention ile toplu sunucu Linux, WSL üzerinden Windows Ücretsiz, açık kaynak Birçok istemci için sürekli batching
MLC LLM GPU’lar üzerinde derlenmiş çıkarım Windows, macOS, Linux Ücretsiz, açık kaynak TVM tarafından derlenmiş kerneller, Metal + Vulkan
KoboldCpp Roleplay ve yaratıcı yazı ayarlaması Windows, macOS, Linux Ücretsiz, açık kaynak İstem başına KV önbellek ayarlama arayüzü
ExLlamaV2 Nvidia’da hızlı EXL2 çıkarımı Windows, Linux Ücretsiz, açık kaynak EXL2 quant + spekülatif dekodlama
TabbyAPI OpenAI uyumlu ExLlamaV2 sunucusu Windows, Linux Ücretsiz, açık kaynak Herhangi bir OpenAI istemcisinin arkasında düşer

Uygulamalar

1. llama.cpp — Derin kuantizasyon ve KV önbellek kontrolü için en iyi

llama.cpp, ekosisteminin çoğunun inşa edildiği runtime’dır. 8-bit’ten 2-bit’e GGUF kuantizasyonlarını okur, model VRAM’e sığmadığında CPU’ya katman katman offload yapar ve cache dtype ayarlarını ortaya çıkarır, böylece kaliteyi yer için takas edebilirsiniz.

Ayarlama yüzeyi, hızın yaşadığı yerdir. GPU’nuz için --n-gpu-layers‘ı doğru şekilde ayarlamak, cache dtype’ı kuant ile eşleştirmek, --flash-attn‘ı etkinleştirmek ve prompt önbellek dosyalarını kullanmak aynı donanımda verimliyi iki katına çıkarabilir.

Eksik olduğu yer: CLI yoğun ve flag listesi hızla değişir. İlk kez ayarlama, belgeleri okumak için bir öğleden sonra alır.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux — CPU, CUDA, Metal, Vulkan, ROCm.

İndir: llama.cpp GitHub’da

Özet: Hız rahatlıktan daha önemli olduğunda ulaşılacak runtime.

2. Ollama — Makul varsayılanlar ile sıfır yapılandırma runtime’ı için en iyi

Ollama, llama.cpp’yi sarar ve çoğu insanı bayrak dokunmadan kabul edilebilir bir verimliliğe getiren varsayılanları seçer. Bir model çekin, çalıştırın, bitti. Modelfile biçimi, model başına sistem istemlerini, örnekleme parametrelerini ve bağlam uzunluğunu ayarlamanıza izin verir.

Rotasyonda birkaç modeli çalıştıran bir iş istasyonu için, bu “kurulu” olmaktan “kullanılabilir” olmaya kadar en hızlı yoldur. Gelişmiş ayarlama, komut satırı bayraklarından ziyade Modelfile parametreleri aracılığıyla gerçekleşir.

Eksik olduğu yer: Soyutlama, verimlilik payından son %30’unu sıkıştıran bazı kaldıraçları gizler. Power kullanıcılar sık sık rahat kullanım için Ollama ve ağır iş için llama.cpp ile biter.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: Ollama masaüstü için

Özet: Yerel LLM’lerde yeni olan ve kılavuzsuz hız isteyen biri için varsayılan seçim.

3. LM Studio — Terminal olmadan ayarlama için en iyi

LM Studio, llama.cpp’nin optimizasyon düğmelerini gerçek bir GUI aracılığıyla ortaya çıkarır. Quant seçimi, n_gpu_layers, bağlam uzunluğu, cache dtype ve batch boyutu bayraklar yerine kaydırıcılar ve açılır menü alır.

Bu, düğmelerin ne yaptığını anlayan ancak CLI sözdizimini ezberlemek istemeyen kişiler için en iyi seçim yapar. Yerleşik sohbet ve API sunucusu, ayarlamaya çalışırken test platformu olarak çalışır.

Eksik olduğu yer: Yalnızca GUI, komut dosyası oluşturmanın sınırlı olduğu anlamına gelir. Başsız sunucular için llama.cpp veya Ollama’ya geri dönün.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: LM Studio masaüstü için

Özet: Sonunda llama.cpp’yi erişilebilir yapan ayarlama GUI’si.

4. vLLM — PagedAttention ile toplu sunucu için en iyi

vLLM, birden fazla eşzamanlı istek sunduğunuzda parlak olur. PagedAttention, KV önbelleğini bir bellek ayırıcısı gibi yönetir ve parçalanma olmaksızın aynı VRAM’e birçok aktif sırayı paketler. Sürekli batching, yeni isteklerin geçerli olanının bitmesini beklemek yerine token oluşturmaları arasında yuvalanması anlamına gelir.

Aynı anda birden fazla uygulama için OpenAI uyumlu bir uç nokta çalıştıran bir ev laboratuvarı için, batch 8’de vLLM’nin verim eğrisi tek istek runtime’larını yok eder.

Eksik olduğu yer: Nvidia ilk, AMD ve Metal’da daha az olgun. Takas, açıkçası bunun için gerçek bir GPU istemenizdir.

Fiyatlandırma:

Platformlar: Yerli Linux, WSL üzerinden Windows.

İndir: vLLM GitHub’da

Özet: Aynı kutudan birden fazla istemciyi sunan herkes için runtime.

5. MLC LLM — GPU’lar üzerinde derlenmiş çıkarım için en iyi

MLC LLM farklı bir bahis yapar: TVM ile model kernel’larını tam hedef donanım için derleyin. Bu, Mac Studio ise veya CUDA ilk runtime’ların mücadele ettiği AMD kutusuysanız önemli olan Metal, Vulkan ve WebGPU desteği sağlar.

Sonuç, llama.cpp’nin iyisi ama hızlı olmadığı donanımda hızlı prefill ve decode’dur. Derleme, model başına hedef başına bir kerelik adım ekler.

Eksik olduğu yer: Model zoosu GGUF’dan daha küçüktür ve iş akışı ilk kez kullanıcılar için daha ağırdır.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux, tarayıcılarda WebGPU.

İndir: MLC LLM GitHub’da

Özet: Birincil GPU’nuz Nvidia kartı değilse en güçlü seçim.

6. KoboldCpp — Roleplay ve yaratıcı yazı ayarlaması için en iyi

KoboldCpp, uzun biçim yazı ve roleplay’e hedeflenen UI ile alt tarafta llama.cpp’dir. Bu iş yükü KV önbelleğine ağır yüklenilir — uzun bağlam, şimdiye kadar aynı hikayenin tekrarlanan yeniden okumaları — bu nedenle KoboldCpp, önbellek yeniden kullanımı ve bağlam-kaydırma kontrollerini belirgin bir şekilde ortaya çıkarır.

Senaryo araçları, dünya bilgisi ve bellek özellikleri, onu hedef kitlesinin dışında da güçlü bir seçim yapar. Uzun bağlam istemlerini çalıştıran herkes, önbellek ayarlamasından yararlanır.

Eksik olduğu yer: UI işlevsel yerine cilalı. Sunucu modu iyidir ancak birincil deneyim yerleşik sohbettir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: KoboldCpp GitHub’da yayınlanır

Özet: Uzun bağlam çalışması için en iyi ayarlanmış ön uç.

7. ExLlamaV2 — Nvidia’da hızlı EXL2 çıkarımı için en iyi

ExLlamaV2, EXL2 kuantizasyon biçimini okuyan CUDA ilk çıkarım motorudur. Aynı Nvidia GPU’da, tipik olarak aynı etkili kalite bit bütçesi için token başına saniyelerde llama.cpp’yi yener. Küçük bir taslak modeliyle spekülatif dekodlama ona bir başka sıçrama verir.

Tek hızlandırıcı olarak 3090, 4090 veya 5090 olan bir iş istasyonu için, hız burada yaşar. OpenAI uyumlu bir uç nokta almak için TabbyAPI ile eşleştirin.

Eksik olduğu yer: Yalnızca Nvidia. Metal yok, ROCm hikayesi yok.

Fiyatlandırma:

Platformlar: Nvidia GPU’lu Windows, Linux.

İndir: ExLlamaV2 GitHub’da

Özet: Nvidia GPU’dan saniyede en çok tokeni çıkartmak için runtime.

8. TabbyAPI — OpenAI uyumlu ExLlamaV2 sunucusu için en iyi

TabbyAPI, ExLlamaV2’yi OpenAI uyumlu bir REST API’ye sarar; böylece OpenAI ile zaten konuşan herhangi bir şey — Cursor, Continue, Aider, LibreChat — bunu temel URL değişikliğiyle bırakabilir. Streaming, işlev çağırma ve spekülatif dekodlama tümü aynı API yüzeyi aracılığıyla çalışır.

Stack’ı OpenAI uç noktasını varsayacak şekilde ayarlanmış biri için, TabbyAPI “disk üzerindeki yerel model” ila “her şey onunla konuşur” e giden en kısa yoldur.

Eksik olduğu yer: Yapılandırma TOML dosyalarıdır, GUI değil. İlk kurulumu hata ayıklama sabır gerektirir.

Fiyatlandırma:

Platformlar: Nvidia GPU’lu Windows, Linux.

İndir: TabbyAPI GitHub’da

Özet: Varolan araçlarınızın başka bir şey değiştirmeden ExLlamaV2’yi kullanmasına izin veren köprü.

Doğru olanı nasıl seçin

Maksimum kontrol istediğinizde ve bayrakları öğrenmeye istekli olduğunuzda llama.cpp seçin. Bu listedeki her şey bunu kullanır veya buna karşı ölçülür.

Yapılandırma dosyası olmadan hız istediğinizde Ollama’yı seçin. Sizi bir komutta %80 yoluna getirir.

llama.cpp’nin bayrakları Çinceye benzediğinde ve aynı ayarlama yüzeyini kaydırıcılarla istediğinizde LM Studio seçin.

Iş yükü birçok eşzamanlı istek olduğunda vLLM’yi seçin. Batching, ölçekte kazanır.

Birincil GPU Apple Silicon veya AMD olduğunda MLC LLM’yi seçin. CUDA ilk runtime’ları bu donanımda düşük performans gösterir.

İstemler uzun olduğunda ve hikaye önemli olduğunda KoboldCpp’yi seçin. Bağlam işleme onun bütün oyunudur.

Kutu Nvidia olduğunda ve her milisaniye sayıldığında ExLlamaV2 (TabbyAPI ile) seçin.

Yalnızca ihtiyacınız olan modellerin yerel ağırlıkları olmadığı veya istek hacmi, yerel bir taneyi çalıştırmak için elektriğe kıyasla kiralanmış bir A100’ün daha ucuz olacağı kadar büyükse bulutta kalın.

Sss

Kuantizasyon gerçekten yerel LLM’leri hızlandırır mı?

Evet, ve çoğu insanın beklediğinden daha fazla. Aynı modelde fp16’dan Q5_K_M’ye geçmek tipik olarak VRAM kullanımını yarıya indirir ve GPU’ya bağlı yüklerde token başına saniyeleri iyileştirir; kalite kaybı, çoğu kullanıcının kör testlerde tespit edemeyeceği kadar küçüktür.

Spekülatif dekodlama nedir?

Spekülatif dekodlama, birkaç tokeni önceden tahmin etmek için küçük bir “taslak” modelini çalıştırır, ardından bunları tek bir büyük model geçişinde doğrular. Taslak doğru olduğunda, büyük model çağrısı başına birden fazla token alırsınız. Sohbet iş yükleri üzerinde, verimliyi neredeyse iki katına çıkarabilir.

PagedAttention nedir ve neden yerel LLM’ler için önemlidir?

PagedAttention, vLLM’nin KV önbellek yönetimi tekniğidir. İstek başına sabit boyutlu önbellek yuvalarını ayırmak yerine, dinamik olarak atanabilen sayfalar olarak önbellek belleğini ele alır. Meşgul bir sunucuda, bu, aynı VRAM’e çok daha fazla eşzamanlı isteğin sığması anlamına gelir.

Hangi yerel LLM runtime Apple Silicon’da en hızlıdır?

MLC LLM’nin derlenmiş Metal kernel’ları tipik olarak Mac’lerde en hızlı tek kullanıcı seçeneğidir. llama.cpp’nin Metal arka ucu yakın ve çalıştırması daha kolay — ekstra %10 ila 20% önemliyse MLC seçin, aksi takdirde llama.cpp.

Ayrık GPU olmadan yerel LLM çalıştırabilir miyim?

Evet. llama.cpp ve Ollama her ikisi de herhangi bir GGUF modeliyle CPU üzerinde çalışır. Modern dizüstü bilgisayarlardaki hızlar, 7B modellerinde saniyede birkaç tokenden 70B’de yavaş bir ilerleyişe kadar değişir — sohbet için kullanılabilir, uzun oluşturmalar için sıkıntılıdır.