2026'da eski NVIDIA GPU'larda yerel AI çalıştırmak için en iyi uygulamalar

2026’da yararlı bir yerel model çalıştırmak için 24 GB kartına ihtiyaç duyan kimse yok. 7 ila 14 milyar parametre nicelleştirilmiş modeller, kullanılan GTX 1080 veya RTX 2080’in rahatça ürettiği hızlarda 8 ila 12 GB VRAM’a sığar ve “yalnızca bulut” ile “çoğu zaman yerel” arasındaki fark artık bir sürücü yüklemesi ve 4 GB indirmedir. İşin püf noktası runtime’dır. Bazı uygulamalar yeni bir RTX 50-series kartı varsayar; diğerleri ev sunucusu şasisinde oturan eski donanım için özel olarak inşa edilmiştir.

Eski NVIDIA GPU’larda yerel AI çalıştırmak için 8 masaüstü uygulamasını test ettik; Pascal (GTX 10-series ve Quadro P), Turing (RTX 20-series ve Quadro T) ve erken Ampere (RTX 30-series ve workstation A-series) üzerinde yoğunlaştı. Listedeki her uygulama, Llama 3.1, Qwen 2.5, Mistral 7B veya Gemma 2’yi 8 GB VRAM’da kullanılabilir token-per-second oranı ile çalıştırır. Kurulumunuza hangisinin uygun olduğu, bir sohbet penceresi, bir hizmet veya düşük seviyeli bir runtime isteyip istemediğinize bağlıdır.

Eski GPU’lar için yerel AI uygulamasında ne arıyoruz

Donanım kısıtlamaları pazarlama metninden daha önemlidir.

Hızlı karşılaştırma

Uygulama En iyi Windows / Linux Ücretsiz plan Öne çıkan özellik Lisans
Ollama Başsız daemon ve betikler Her ikisi Ücretsiz Tek satırlı model çekme, CLI-first MIT
LM Studio Hepsi-bir-arada sohbet Her ikisi Ücretsiz Model tarayıcı + sohbet + sunucu Özel
KoboldCPP Tek yürütülebilir runtime Her ikisi Ücretsiz Kurulum yok, GGUF, TTS, görüntüler AGPL 3.0
text-generation-webui Güç kullanıcısı alet Her ikisi Ücretsiz Tüm nicelleştirme biçimleri desteklenir AGPL 3.0
GPT4All Alçak dizüstü bilgisayarda ilk model Her ikisi Ücretsiz LocalDocs kenar çubuğu, düşük VRAM ön ayarları MIT benzeri
Jan Tamamen açık kaynaklı LM Studio eşdeğeri Her ikisi Ücretsiz MCP desteği, OpenAI uyumlu Apache 2.0
llama.cpp Çıplak metal hızı Her ikisi Ücretsiz En hızlı CPU + kısmi GPU boşaltma MIT
vLLM Çok kullanıcılı API sunucusu Linux (Windows’ta WSL) Ücretsiz Sayfalandırılmış dikkat, en iyi verimi Apache 2.0

Uygulamalar

1. Ollama – eski NVIDIA kartlarında en iyi başsız daemon

Ollama, çoğu kişinin ilk yüklediği runtime’dır çünkü tüm iş akışı ollama pull llama3.1:8b daha sonra ollama run llama3.1‘dir. GTX 1080 Ti (11 GB) üzerinde, Llama 3.1 8B Q4_K_M saniyede 25 ila 30 token çalışır; RTX 2080 Super (8 GB) üzerinde, aynı model yaklaşık 40 çalışır. Ollama localhost:11434 üzerinde OpenAI uyumlu bir uç noktası bağlar ve OpenAI ile konuşan herhangi bir ön uç (Open WebUI, Msty, LibreChat) temel URL değişikliği ile bağlanır.

Nerede kısa kalıyor: Sohbet istemcisi bir terminaldir. Ollama GUI ile gelmez; grafik kullanım, Open WebUI veya başka bir ön uç eklemeyi ifade eder.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: ollama.com

Sonuç: Hedef, bir modeli diğer araçlara ve betiklere sunmak olduğunda doğru seçim, bir uygulamada sohbet değil.

2. LM Studio – ilk kurulum için en iyi all-in-one

LM Studio, “bir EXE indirin ve beş dakika içinde bir model ile konuşun” seçeneğidir. Uygulama, Hugging Face tarayıcısını, sohbet panelini ve localhost:1234 üzerinde OpenAI uyumlu sunucuyu ortaya çıkarmak için bir geçiş birleştirir. VRAM algılaması eski kartlarda doğru ve model listesi hangi derlemelerin tamamen GPU’nıza uyduğunu ve hangi derlemelerin CPU boşaltması gerektiğini işaretler.

Nerede kısa kalıyor: İstemci kapalı kaynaktır. Ticari kullanım, LM Studio Team lisans formunu doldurmayi ve teklifin beklenmesini gerektirir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: lmstudio.ai

Sonuç: Eski NVIDIA donanımında en uygun ilk kurulum; çalışan sohbet penceresine en hızlı yol.

3. KoboldCPP – en iyi kurulum yok runtime

KoboldCPP, Python ortamı olmadan GGUF modelleri, Stable Diffusion görüntü üretimi ve Whisper transkripsiyonunu çalıştıran tek bir yürütülebilir dosyadır (koboldcpp.exe Windows’ta, Linux’ta statik ikili). GTX 1660 Super (6 GB) üzerinde, bazı katmanlar CPU’ya boşaltılmış 7B Q4 modeli hala sığarken, aynı yürütülebilir dosya uygulamalar arasında geçiş yapılmadan hızlı görüntü üretimini işler.

Nerede kısa kalıyor: Kullanıcı arayüzü web tabanlıdır (tarayıcı sekmesinde açılır) ve cilalı yerine işlevsel hissettirir. Özellik derinliği yüksek, keşfedilebilirlik düşük.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: github.com/LostRuins/koboldcpp

Sonuç: Hedef makine, sistem genelinde Python yüklemek istemeyen bir dizüstü, homelab veya arkadaşın bilgisayarı olduğunda seçim.

4. text-generation-webui – güç kullanıcıları için en iyisi

text-generation-webui (oobabooga), önemli olan her nicelleştirme biçimini destekler (GGUF, GPTQ, AWQ, exllamav2), yükleyicileri koşu sırasında değiştirmenize izin verir ve diğer uygulamaların gizlediği düşük seviyeli üretim düğmelerini (rope ölçeklendirmesi, mirostat, dinamik sıcaklık) ortaya çıkarır. RTX 3060 (12 GB) üzerinde, 20 ila 30 token/saniye ile Q4’te 14B modeli memnuniyetle çalıştırır.

Nerede kısa kalıyor: Yükleyici birkaç gigabyte Python bağımlılıklarını çeker. İlk başlatma 5 ila 10 dakika sürer. Birini tıklayıp sohbet etmek isteyen biri için araç değil.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: github.com/oobabooga/text-generation-webui

Sonuç: Model nicelleştirmelerini ve üretim stratejilerini aynı donanımda karşılaştırmak isteyen kullanıcı için ideal.

5. GPT4All – en iyi düşük VRAM başlangıcı

GPT4All, en düşük tabana sahiptir: yerleşik model kataloğu 4 GB kartlarda çalışan 3B ve 4B modelleri işaretler ve LocalDocs kenar çubuğu ayrı bir vektör veritabanı olmadan küçük RAG işlerini işler. GTX 1060 (6 GB) üzerinde, Mistral 7B Instruct saniyede kullanılabilir 15 ila 20 token çalışır.

Nerede kısa kalıyor: Arayüz, bireysel kullanım için tasarlanmıştır; yerleşik çok kullanıcılı API yok. Model kataloğu LM Studio veya Ollama’dan küçüktür.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: gpt4all.io

Sonuç: 4 ila 6 GB VRAM’ı olan dizüstü bilgisayarda doğru ilk kurulum.

6. Jan – en iyi tamamen açık kaynaklı LM Studio eşdeğeri

Jan, müşteriyi Apache 2.0 olsaydı LM Studio’nun nasıl görüneceğidir. Birinci taraf model kataloğu, localhost:1337 üzerinde OpenAI uyumlu sunucu, Claude Desktop ve Continue’un Jan tarafından barındırılan bir modele vurabilmesi için Model Context Protocol desteği ve telemetri yok.

Nerede kısa kalıyor: LM Studio’dan daha genç proje; katalog daha küçük ve bazı Hugging Face nicelleştirmeleri daha geç gelir. Non-CUDA donanımında Windows GPU hızlandırması hala güncelleniyordur.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: jan.ai

Sonuç: Lisansını bir öğleden sonra okuyabileceğiniz LM Studio tarzı bir uygulama istediğinizde açık kaynaklı seçim.

7. llama.cpp – en iyi çıplak metal runtime

llama.cpp, rest of the ekosisteminin inşa edildiği C++ projesidir. Her yerde çalışır, Linux’ta beş dakikada derler ve eski GPU’larda sürücü ile model arasında Python soyutlaması olmadığı için en hızlı tek kullanıcılı verimi üretir. GTX 1080 Ti’de -ngl 33 ile, daha yüksek seviye uygulamalarının birkaç yüzde puan kadar geri kaldığı ham token oranlarına ulaşır.

Nerede kısa kalıyor: Yükleyici yok, arayüz yok. Komut satırı araçlarını derleyip çalıştırıyoruz. Windows kullanıcısı için ilk kurulum, bu listede başka herhangi bir uygulamadan daha fazla çalışmadır.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux

İndir: github.com/ggml-org/llama.cpp

Sonuç: Model dosyası ve ilk token arasında tam olarak ne olduğunu bilmek isteyen geliştiriciler için.

8. vLLM – Linux’ta en iyi çok kullanıcılı API sunucusu

vLLM, eski bir iş istasyonunu küçük bir takım çıkarım sunucusuna dönüştürmek için runtime’dır. Sayfalandırılmış dikkat, eş zamanlı isteklerle neredeyse doğrusal olarak verimini ölçekler ve 4-bit AWQ nicelleştirilmiş modeller, 24 GB bir kartın iki veya üç kişiye aynı anda yazı yaparken bloklanmadan hizmet vermesini sağlar. Linux’ta yerel olarak çalışır; Windows kullanıcıları CUDA passthrough ile WSL 2 gerektirir.

Nerede kısa kalıyor: Sohbet uygulaması değil. vLLM, OpenAI uyumlu bir sunucudur ve istemcilerin ona vuracağını bekler. Küçük model desteği iyidir ancak projenin optimizasyon odağı daha büyük dağıtımlar üzerindedir.

Fiyatlandırma:

Platformlar: Linux (Windows’ta WSL)

İndir: github.com/vllm-project/vllm

Sonuç: Hedef, birkaç kişinin paylaştığı özel OpenAI klon olduğunda seçim.

Doğru olanı nasıl seçersiniz

SSS

GPU’nun yerel AI çalıştırması için ne kadar eski çok eskilir?
4 GB VRAM’a ve Compute Capability 6.0 veya daha yüksek (Pascal ve sonrası) sahip kartlar rahatça 3B ve 4B modelleri çalıştırabilir. 4 GB altında, pratik cevap küçük model ile yalnızca CPU çıkarımıdır.

GTX 1080 Ti 2026’da hala mantıklı mı?
Yerel AI için evet. 11 GB VRAM, geniş CUDA 12 desteği ve saniyede 25 ila 30 token ile 7B ve 8B modeller için yeterli bilgi işlemdir. Yüksek çözünürlüklü görüntü üretimi için yeterli değil.

Eski kartlar için en iyi nicelleştirme biçimi hangisidir?
Sohbet kalitesi için GGUF Q4_K_M veya Q5_K_M, vLLM kullanırken maksimum verimi için AWQ 4-bit. GPTQ hala çalışır ancak biçim sessizce emekli ediliyor.

Bu uygulamaları AMD veya Intel GPU’larda çalıştırabilir miyim?
Ollama, LM Studio, KoboldCPP ve llama.cpp, birçok AMD kartında Vulkan veya ROCm’yi destekler. Intel Arc, llama.cpp’de SYCL ve bazı forklarda OpenVINO aracılığıyla desteklenir. Bu makale NVIDIA’ya odaklanır çünkü eski kart konuşması burada yaşar.

Telemetriden endişelenmem gerekir mi?
Ollama, KoboldCPP, Jan, llama.cpp, GPT4All ve vLLM telemetri olmadan gelirler. LM Studio’nun ayarlar’da telemetri geçişleri vardır; ilk çalıştırmada devre dışı bırakın.