2026’da yararlı bir yerel model çalıştırmak için 24 GB kartına ihtiyaç duyan kimse yok. 7 ila 14 milyar parametre nicelleştirilmiş modeller, kullanılan GTX 1080 veya RTX 2080’in rahatça ürettiği hızlarda 8 ila 12 GB VRAM’a sığar ve “yalnızca bulut” ile “çoğu zaman yerel” arasındaki fark artık bir sürücü yüklemesi ve 4 GB indirmedir. İşin püf noktası runtime’dır. Bazı uygulamalar yeni bir RTX 50-series kartı varsayar; diğerleri ev sunucusu şasisinde oturan eski donanım için özel olarak inşa edilmiştir.
Eski NVIDIA GPU’larda yerel AI çalıştırmak için 8 masaüstü uygulamasını test ettik; Pascal (GTX 10-series ve Quadro P), Turing (RTX 20-series ve Quadro T) ve erken Ampere (RTX 30-series ve workstation A-series) üzerinde yoğunlaştı. Listedeki her uygulama, Llama 3.1, Qwen 2.5, Mistral 7B veya Gemma 2’yi 8 GB VRAM’da kullanılabilir token-per-second oranı ile çalıştırır. Kurulumunuza hangisinin uygun olduğu, bir sohbet penceresi, bir hizmet veya düşük seviyeli bir runtime isteyip istemediğinize bağlıdır.
Eski GPU’lar için yerel AI uygulamasında ne arıyoruz
Donanım kısıtlamaları pazarlama metninden daha önemlidir.
- CUDA 11 desteği, yalnızca CUDA 12 değil (Pascal, Linux’ta CUDA 12.6’ya çıkıyor, Windows’ta daha sonra).
- 8 GB’ye 7B sığdıran nicelleştirme biçimleri (GGUF Q4_K_M, Q5_K_M veya AWQ 4-bit).
- Katman boşaltma, böylece 13B model aşırı katmanları CPU’ya dökerek işe yaramaz hale gelmeden.
- Kaynaktan PyTorch derlemeyi gerektirmeyen tek tıklamalı kurulum.
- Herhangi bir istemcinin özel bir dolgu parçası olmadan localhost’a işaret edebilmesi için OpenAI uyumlu API.
- Model indirme, devam ettirir ve denetim toplamlarını doğrular (arama çağrı çağı paranoası hala yardımcı olur).
Hızlı karşılaştırma
| Uygulama | En iyi | Windows / Linux | Ücretsiz plan | Öne çıkan özellik | Lisans |
|---|---|---|---|---|---|
| Ollama | Başsız daemon ve betikler | Her ikisi | Ücretsiz | Tek satırlı model çekme, CLI-first | MIT |
| LM Studio | Hepsi-bir-arada sohbet | Her ikisi | Ücretsiz | Model tarayıcı + sohbet + sunucu | Özel |
| KoboldCPP | Tek yürütülebilir runtime | Her ikisi | Ücretsiz | Kurulum yok, GGUF, TTS, görüntüler | AGPL 3.0 |
| text-generation-webui | Güç kullanıcısı alet | Her ikisi | Ücretsiz | Tüm nicelleştirme biçimleri desteklenir | AGPL 3.0 |
| GPT4All | Alçak dizüstü bilgisayarda ilk model | Her ikisi | Ücretsiz | LocalDocs kenar çubuğu, düşük VRAM ön ayarları | MIT benzeri |
| Jan | Tamamen açık kaynaklı LM Studio eşdeğeri | Her ikisi | Ücretsiz | MCP desteği, OpenAI uyumlu | Apache 2.0 |
| llama.cpp | Çıplak metal hızı | Her ikisi | Ücretsiz | En hızlı CPU + kısmi GPU boşaltma | MIT |
| vLLM | Çok kullanıcılı API sunucusu | Linux (Windows’ta WSL) | Ücretsiz | Sayfalandırılmış dikkat, en iyi verimi | Apache 2.0 |
Uygulamalar
1. Ollama – eski NVIDIA kartlarında en iyi başsız daemon
Ollama, çoğu kişinin ilk yüklediği runtime’dır çünkü tüm iş akışı ollama pull llama3.1:8b daha sonra ollama run llama3.1‘dir. GTX 1080 Ti (11 GB) üzerinde, Llama 3.1 8B Q4_K_M saniyede 25 ila 30 token çalışır; RTX 2080 Super (8 GB) üzerinde, aynı model yaklaşık 40 çalışır. Ollama localhost:11434 üzerinde OpenAI uyumlu bir uç noktası bağlar ve OpenAI ile konuşan herhangi bir ön uç (Open WebUI, Msty, LibreChat) temel URL değişikliği ile bağlanır.
Nerede kısa kalıyor: Sohbet istemcisi bir terminaldir. Ollama GUI ile gelmez; grafik kullanım, Open WebUI veya başka bir ön uç eklemeyi ifade eder.
Fiyatlandırma:
- Ücretsiz: Her şey, MIT lisanslı
- Ücretli: Hiçbiri
Platformlar: Windows, macOS, Linux
İndir: ollama.com
Sonuç: Hedef, bir modeli diğer araçlara ve betiklere sunmak olduğunda doğru seçim, bir uygulamada sohbet değil.
2. LM Studio – ilk kurulum için en iyi all-in-one
LM Studio, “bir EXE indirin ve beş dakika içinde bir model ile konuşun” seçeneğidir. Uygulama, Hugging Face tarayıcısını, sohbet panelini ve localhost:1234 üzerinde OpenAI uyumlu sunucuyu ortaya çıkarmak için bir geçiş birleştirir. VRAM algılaması eski kartlarda doğru ve model listesi hangi derlemelerin tamamen GPU’nıza uyduğunu ve hangi derlemelerin CPU boşaltması gerektiğini işaretler.
Nerede kısa kalıyor: İstemci kapalı kaynaktır. Ticari kullanım, LM Studio Team lisans formunu doldurmayi ve teklifin beklenmesini gerektirir.
Fiyatlandırma:
- Ücretsiz: Kişisel kullanım
- Ücretli: İstek üzerine Ekip lisansı
Platformlar: Windows, macOS, Linux
İndir: lmstudio.ai
Sonuç: Eski NVIDIA donanımında en uygun ilk kurulum; çalışan sohbet penceresine en hızlı yol.
3. KoboldCPP – en iyi kurulum yok runtime
KoboldCPP, Python ortamı olmadan GGUF modelleri, Stable Diffusion görüntü üretimi ve Whisper transkripsiyonunu çalıştıran tek bir yürütülebilir dosyadır (koboldcpp.exe Windows’ta, Linux’ta statik ikili). GTX 1660 Super (6 GB) üzerinde, bazı katmanlar CPU’ya boşaltılmış 7B Q4 modeli hala sığarken, aynı yürütülebilir dosya uygulamalar arasında geçiş yapılmadan hızlı görüntü üretimini işler.
Nerede kısa kalıyor: Kullanıcı arayüzü web tabanlıdır (tarayıcı sekmesinde açılır) ve cilalı yerine işlevsel hissettirir. Özellik derinliği yüksek, keşfedilebilirlik düşük.
Fiyatlandırma:
- Ücretsiz: Her şey, AGPL 3.0
- Ücretli: Hiçbiri
Platformlar: Windows, macOS, Linux
İndir: github.com/LostRuins/koboldcpp
Sonuç: Hedef makine, sistem genelinde Python yüklemek istemeyen bir dizüstü, homelab veya arkadaşın bilgisayarı olduğunda seçim.
4. text-generation-webui – güç kullanıcıları için en iyisi
text-generation-webui (oobabooga), önemli olan her nicelleştirme biçimini destekler (GGUF, GPTQ, AWQ, exllamav2), yükleyicileri koşu sırasında değiştirmenize izin verir ve diğer uygulamaların gizlediği düşük seviyeli üretim düğmelerini (rope ölçeklendirmesi, mirostat, dinamik sıcaklık) ortaya çıkarır. RTX 3060 (12 GB) üzerinde, 20 ila 30 token/saniye ile Q4’te 14B modeli memnuniyetle çalıştırır.
Nerede kısa kalıyor: Yükleyici birkaç gigabyte Python bağımlılıklarını çeker. İlk başlatma 5 ila 10 dakika sürer. Birini tıklayıp sohbet etmek isteyen biri için araç değil.
Fiyatlandırma:
- Ücretsiz: Her şey, AGPL 3.0
- Ücretli: Hiçbiri
Platformlar: Windows, macOS, Linux
İndir: github.com/oobabooga/text-generation-webui
Sonuç: Model nicelleştirmelerini ve üretim stratejilerini aynı donanımda karşılaştırmak isteyen kullanıcı için ideal.
5. GPT4All – en iyi düşük VRAM başlangıcı
GPT4All, en düşük tabana sahiptir: yerleşik model kataloğu 4 GB kartlarda çalışan 3B ve 4B modelleri işaretler ve LocalDocs kenar çubuğu ayrı bir vektör veritabanı olmadan küçük RAG işlerini işler. GTX 1060 (6 GB) üzerinde, Mistral 7B Instruct saniyede kullanılabilir 15 ila 20 token çalışır.
Nerede kısa kalıyor: Arayüz, bireysel kullanım için tasarlanmıştır; yerleşik çok kullanıcılı API yok. Model kataloğu LM Studio veya Ollama’dan küçüktür.
Fiyatlandırma:
- Ücretsiz: Her şey
- Ücretli: Yok; kurumsal destek ücretli bir eklentidir
Platformlar: Windows, macOS, Linux
İndir: gpt4all.io
Sonuç: 4 ila 6 GB VRAM’ı olan dizüstü bilgisayarda doğru ilk kurulum.
6. Jan – en iyi tamamen açık kaynaklı LM Studio eşdeğeri
Jan, müşteriyi Apache 2.0 olsaydı LM Studio’nun nasıl görüneceğidir. Birinci taraf model kataloğu, localhost:1337 üzerinde OpenAI uyumlu sunucu, Claude Desktop ve Continue’un Jan tarafından barındırılan bir modele vurabilmesi için Model Context Protocol desteği ve telemetri yok.
Nerede kısa kalıyor: LM Studio’dan daha genç proje; katalog daha küçük ve bazı Hugging Face nicelleştirmeleri daha geç gelir. Non-CUDA donanımında Windows GPU hızlandırması hala güncelleniyordur.
Fiyatlandırma:
- Ücretsiz: Her şey, Apache 2.0
- Ücretli: Hiçbiri
Platformlar: Windows, macOS, Linux
İndir: jan.ai
Sonuç: Lisansını bir öğleden sonra okuyabileceğiniz LM Studio tarzı bir uygulama istediğinizde açık kaynaklı seçim.
7. llama.cpp – en iyi çıplak metal runtime
llama.cpp, rest of the ekosisteminin inşa edildiği C++ projesidir. Her yerde çalışır, Linux’ta beş dakikada derler ve eski GPU’larda sürücü ile model arasında Python soyutlaması olmadığı için en hızlı tek kullanıcılı verimi üretir. GTX 1080 Ti’de -ngl 33 ile, daha yüksek seviye uygulamalarının birkaç yüzde puan kadar geri kaldığı ham token oranlarına ulaşır.
Nerede kısa kalıyor: Yükleyici yok, arayüz yok. Komut satırı araçlarını derleyip çalıştırıyoruz. Windows kullanıcısı için ilk kurulum, bu listede başka herhangi bir uygulamadan daha fazla çalışmadır.
Fiyatlandırma:
- Ücretsiz: Her şey, MIT
- Ücretli: Hiçbiri
Platformlar: Windows, macOS, Linux
İndir: github.com/ggml-org/llama.cpp
Sonuç: Model dosyası ve ilk token arasında tam olarak ne olduğunu bilmek isteyen geliştiriciler için.
8. vLLM – Linux’ta en iyi çok kullanıcılı API sunucusu
vLLM, eski bir iş istasyonunu küçük bir takım çıkarım sunucusuna dönüştürmek için runtime’dır. Sayfalandırılmış dikkat, eş zamanlı isteklerle neredeyse doğrusal olarak verimini ölçekler ve 4-bit AWQ nicelleştirilmiş modeller, 24 GB bir kartın iki veya üç kişiye aynı anda yazı yaparken bloklanmadan hizmet vermesini sağlar. Linux’ta yerel olarak çalışır; Windows kullanıcıları CUDA passthrough ile WSL 2 gerektirir.
Nerede kısa kalıyor: Sohbet uygulaması değil. vLLM, OpenAI uyumlu bir sunucudur ve istemcilerin ona vuracağını bekler. Küçük model desteği iyidir ancak projenin optimizasyon odağı daha büyük dağıtımlar üzerindedir.
Fiyatlandırma:
- Ücretsiz: Her şey, Apache 2.0
- Ücretli: Hiçbiri
Platformlar: Linux (Windows’ta WSL)
İndir: github.com/vllm-project/vllm
Sonuç: Hedef, birkaç kişinin paylaştığı özel OpenAI klon olduğunda seçim.
Doğru olanı nasıl seçersiniz
- Sonraki 10 dakika içinde sohbet penceresi istiyorsanız: LM Studio veya GPT4All.
- Modelleri diğer araçlara sunuyorsanız: Ollama.
- Aynı deneyimi açık kaynaklı istiyorsanız: Jan.
- Makine sistem genelinde hiçbir şey yükleyemiyorsa: KoboldCPP.
- Performansın son birkaç yüzdesini sıkıştırmak istiyorsanız: llama.cpp.
- Model derlemelerini ve nicelleştirmelerini A/B test etmek istiyorsanız: text-generation-webui.
- Küçük bir takım makineyi paylaşacaksa: Linux’ta vLLM.
SSS
GPU’nun yerel AI çalıştırması için ne kadar eski çok eskilir?
4 GB VRAM’a ve Compute Capability 6.0 veya daha yüksek (Pascal ve sonrası) sahip kartlar rahatça 3B ve 4B modelleri çalıştırabilir. 4 GB altında, pratik cevap küçük model ile yalnızca CPU çıkarımıdır.
GTX 1080 Ti 2026’da hala mantıklı mı?
Yerel AI için evet. 11 GB VRAM, geniş CUDA 12 desteği ve saniyede 25 ila 30 token ile 7B ve 8B modeller için yeterli bilgi işlemdir. Yüksek çözünürlüklü görüntü üretimi için yeterli değil.
Eski kartlar için en iyi nicelleştirme biçimi hangisidir?
Sohbet kalitesi için GGUF Q4_K_M veya Q5_K_M, vLLM kullanırken maksimum verimi için AWQ 4-bit. GPTQ hala çalışır ancak biçim sessizce emekli ediliyor.
Bu uygulamaları AMD veya Intel GPU’larda çalıştırabilir miyim?
Ollama, LM Studio, KoboldCPP ve llama.cpp, birçok AMD kartında Vulkan veya ROCm’yi destekler. Intel Arc, llama.cpp’de SYCL ve bazı forklarda OpenVINO aracılığıyla desteklenir. Bu makale NVIDIA’ya odaklanır çünkü eski kart konuşması burada yaşar.
Telemetriden endişelenmem gerekir mi?
Ollama, KoboldCPP, Jan, llama.cpp, GPT4All ve vLLM telemetri olmadan gelirler. LM Studio’nun ayarlar’da telemetri geçişleri vardır; ilk çalıştırmada devre dışı bırakın.