Ollama

XDA, aynı 8B modeli RTX 5070 dizüstü bilgisayarda ve entegre grafiklere sahip bir makinede çalıştırdı ve token-saniye boşluğunun çoğu insanın hayal ettiğinden daha küçük olduğunu bildirdi. Bu, 2026’da yerel LLM’lerin hikayesidir: kuantizasyon, Vulkan arka uçları ve Apple’ın Metal’ı birçok iş yükünü iGPU veya küçük dGPU’nun yeterli olduğu bir aralığa getirmiştir. Modelleri yerel olarak çalıştırmak için 2.000 dolarlık bir sistem almanız gerekmez.

Bu kılavuz, Intel Core Ultra 5 ile Arc iGPU, AMD Ryzen 7 ile Radeon 780M ve Apple M2’de test edilen, entegre grafiklerde yerel LLM çalıştırmak için sekiz uygulamayı kapsar. Sekizin tümü, doğru kuantizasyon ile 7B ila 14B aralığında modelleri kullanılabilir hızlarda (saniyede 10 belirteç veya daha iyi) çalıştırır. Kurulum kolaylığı, model uyumluluğu ve iGPU sınıfı donanımda dürüst performansı öncelikli olarak belirledik.

iGPU için yerel LLM çalıştırıcısında nelere bakılmalı

Hızlı karşılaştırma

Uygulama En iyi için Ücretsiz plan Başlangıç fiyatı UI stili
Ollama Yerel modeller için CLI + API Evet Ücretsiz (açık kaynak) Terminal veya üçüncü taraf istemcileri
LM Studio Cilalı masaüstü UI Evet Ücretsiz Yerel masaüstü
GPT4All Başlangıç dostu masaüstü Evet Ücretsiz Yerel masaüstü
Jan Tamamen açık kaynak ChatGPT klonu Evet Ücretsiz Yerel masaüstü (Electron)
Msty RAG içeren hepsi bir arada Evet Ücretsiz taban Yerel masaüstü
KoboldCpp Rol oynama ve yaratıcı yazı Evet Ücretsiz (açık kaynak) Web UI
Text Generation WebUI Güç kullanıcı oyunlaştırması Evet Ücretsiz (açık kaynak) Web UI
AnythingLLM Belgeler üzerinde yerel RAG Evet Ücretsiz (açık kaynak) Yerel masaüstü

Uygulamalar

1. Ollama, en iyi CLI ve API çalıştırıcı

Ollama, yerel LLM’ler için standarda en yakın şeydir. Kurun, ollama run llama3.2:3b çalıştırın ve bir dakikadan kısa sürede çalışan bir modeliniz olur. Perde arkasında, seçilmiş bir model kütüphanesi, localhost:11434‘da OpenAI uyumlu API ve model başına bellek yönetimi ile llama.cpp kullanır.

Kısa geldiği yeri: Yerleşik chat UI yok; terminal’de ollama run kullanırsınız veya bir istemci (Open WebUI, Msty veya Mac’te Enchanted) ile eşleşirsiniz. ollama.com’daki model kütüphanesi seçilmiş ancak ham Hugging Face erişimi ile karşılaştırıldığında sınırlıdır.

Fiyatlandırma:

Platformlar: Windows, macOS (Apple silicon ve Intel), Linux।

İndir: ollama.com/download veya Homebrew / apt yoluyla।

Sonuç: En iyi arka uç, dönem. Üstüne farklı bir UI kullanmayı planlasanız bile kurun।

2. LM Studio, en iyi cilalı masaüstü UI

LM Studio llama.cpp’yi yerleşik Hugging Face model tarayıcısı, tek tıklamayla indirmeler, model başına performans kıyaslamaları ve OpenAI uyumlu API sunucusu ile yerel bir masaüstü uygulamasına sarar. GPU boşaltma ayarları, Intel Arc, AMD ve Apple silicon için makul varsayılanlar ile açıklanır।

Kısa geldiği yeri: Kapalı kaynak (ücretsiz olsa da). Bazı kullanıcılar, GUI’nin düşük uçlu iGPU’larda modelin kendisinden daha fazla RAM tükettiğini bildirirler।

Fiyatlandırma:

Platformlar: Windows, macOS, Linux (beta)।

İndir: lmstudio.ai

Sonuç: GUI’ye tercih veren iGPU kullanıcıları için en iyi başlangıç noktası। Tüketici donanımı için doğru varsayılanlar ile birlikte gelir।

3. GPT4All, en iyi başlangıç dostu masaüstü

GPT4All Nomic’ten paket içinde en erişilebilir olanıdır। Kurun, kenar çubuğundan bir model seçin ve indir ve çalışır। LocalDocs bölmesi, yapılandırma olmadan dosya klasörü üzerinde basit RAG ekler।

Kısa geldiği yeri: LM Studio’dan daha küçük model kataloğu। Testlerimizde Ollama veya LM Studio’dan Windows’ta daha yavaş।

Fiyatlandırma:

Platformlar: Windows, macOS, Linux।

İndir: nomic.ai/gpt4all

Sonuç: Az teknik aileme veya arkadaşa verme seçeneği। Terminal’e dokunmadan yerel modeli çalıştırılması।

4. Jan, en iyi tamamen açık kaynak ChatGPT klonu

Jan, ChatGPT arayüzünü taklit eden tamamen açık kaynak bir masaüstü uygulamasıdır। Paket llama.cpp aracılığıyla yerel modelleri çalıştırır, uzak API’lere (OpenAI, Anthropic, Groq, Mistral) seçenek olarak bağlanır ve her konuşmayı yerel olarak depolar।

Kısa geldiği yeri: Electron tabanlı, bu nedenle RAM ayak izi yerel uygulamalardan daha ağırdır। Çok turlu konuşmalar bazen iGPU’da agresif bağlam kesilmesi nedeniyle bağlam kaybeder।

Fiyatlandırma:

Platformlar: Windows, macOS, Linux।

İndir: jan.ai

Sonuç: En açık ChatGPT benzeri। Yerel ve isteğe bağlı uzak için tek bir uygulama istiyorsanız en iyisidir।

5. Msty, en iyi RAG içeren hepsi bir arada

Msty, yerel modelleri, uzak API’leri, belgeler üzerinde RAG’ı ve bölünmüş görünüm konuşmalarını bir uygulamada birleştirir। “Knowledge Stacks” özelliği, PDF’ler, Word belgeleri ve metin dosyaları klasörlerini indeksler, böylece vektör veritabanı kurulumu olmadan bunlarla sohbet edebilirsiniz।

Kısa geldiği yeri: Kapalı kaynak। Ücretsiz plan bazı gelişmiş RAG özelliklerini sınırlar।

Fiyatlandırma:

Platformlar: Windows, macOS, Linux።

İndir: msty.app

Sonuç: Ayrı bir vektör deposu kurulumu olmadan belge sohbeti istiyorsanız seç።

6. KoboldCpp, en iyi rol oynama ve yaratıcı yazı

KoboldCpp, uzun form yazması ve rol oynamasına yönelik llama.cpp’nin bir fork’u olarak başladı। Dünya bilgisi, karakter hafızası ve diğer çalıştırıcıların ortaya koymadığı lore kitaplarıyla bir web UI’ye sahiptir። Arka uç, iGPU için Vulkan’ı destekler।

Kısa geldiği yeri: UI, yalnızca güç kullanıcıları için bir anlama gelen kaydırıcılarla yoğundur। Sohbet asistanı iş akışları için gerçekten tasarlanmamıştır।

Fiyatlandırma:

Platformlar: Windows, macOS, Linux།

İndir: KoboldCpp GitHub releases

Sonuç: Kalıcı karakterler isteyen yazarlar ve rol oyuncuları için niş seçenek።

7. Text Generation WebUI, en iyi güç kullanıcı oyunlaştırması

Text Generation WebUI (oobabooga) oyunlaştıran kişinin oyun alanıdır। llama.cpp, ExLlama, Transformers ve daha fazla arka uç destekler, her üretim parametresini ortaya koyan ve LoRA ve ince ayar ile entegre edilir।

Kısa geldiği yeri: Kurulum başlangıç seviyesi için değil; Python venv ile 30 dakikalık kurulum beklenti। Web UI işlevseldir ancak tasarlanmamıştır।

Fiyatlandırma:

Platformlar: Windows, macOS, Python aracılığıyla Linux।

İndir: oobabooga/text-generation-webui GitHub

Sonuç: Neyi ayarlamak istediğinizi bildiğiniz ve daha iyi bir uygulamada yapamadığınız zaman doğru seçim।

8. AnythingLLM, belgeler üzerinde en iyi yerel RAG

AnythingLLM, yerel (veya uzak) LLM’yi bir belge deposuyla eşleştiren özel olarak inşa edilmiş bir RAG uygulamasıdır། Bir klasöre işaret edin veya dosyaları bırakın ve yerel bir vektör veritabanına indeksler। Çok kullanıcılı çalışma alanları, farklı projeler için bağlamları ayırır።

Kısa geldiği yeri: RAG odaklı; saf sohbet mümkündür ancak bu değildir। Kurulum, chat modelinden ayrı olarak bir gömme modeli seçmeyi içerir, bu da başlangıçları kafasını karıştırır।

Fiyatlandırma:

Platformlar: Windows, macOS, Linux, artı kendi kendine barındırma için Docker dağıtımı।

İndir: anythingllm.com veya Mintplex-Labs/anything-llm GitHub

Sonuç: Yerel AI istemenizin nedeni kendi belge koleksiyonunuzu özel olarak sorgulamak istediğiniz zaman seçim।

Doğru olanı seçme

Çoğu iGPU kullanıcısı için en iyi eşlenmiş kurulum: Ollama arka uç olarak + LM Studio veya Open WebUI istemci olarak। Bu size en hızlı arka uç en dostça arayüz ile verir।

SSS

Intel Arc iGPU için en iyi yerel LLM uygulaması nedir?

LM Studio ve Ollama her ikisi de Vulkan kullanır ve Intel Arc iGPU (Xe, Xe2, Xe-LPG) üzerinde iyi çalışır។ Model seçimi uygulama seçiminden daha önemlidir; 7B-8B modellerin Q4_K_M kuantizasyonu tatlı nokta।

Ayrık GPU olmadan Ryzen APU’sunda yerel LLM çalıştırabilir miyim?

Evet। Ryzen 7000 ve 8000 serisi Radeon 780M / 890M iGPU, Vulkan yoluyla Q4 kuantizasyonda 7B modelleri saniyede 10-20 belirteç çalıştırır։ Daha büyük bağlamlar yüklemek istiyorsanız BIOS’ta grafiklere sistem RAM tahsisini artırın।

M2 veya M3 ile MacBook için en iyi yerel LLM nedir?

Apple silicon M2 üzerinde saniyede 20-40 belirteç Llama 3.1 8B, Qwen 3 8B ve Mistral 7B çalıştırır। LM Studio ve Ollama her ikisi de Metal’ı otomatik olarak kullanır। 16GB birleşik bellek üzerinde Q4_K_M veya Q5_K_M ile kalın।

Yerel modelleri çalıştırmak için Python bilmem gerekir mi?

Hayır। Ollama, LM Studio, GPT4All, Jan ve Msty, Python olmadan tek tıklamayla yükleme। Text Generation WebUI istisnadır।

Hangi yerel LLM uygulaması tamamen açık kaynak?

Ollama, GPT4All, Jan, KoboldCpp, Text Generation WebUI ve AnythingLLM, hepsi açık kaynak। LM Studio ve Msty ücretsiz ama kapalı kaynak।

Yerel LLM’ler için ne kadar RAM’e ihtiyacım var?

Q4 kuantizasyonunda 7B-8B modeller için, toplam 16GB sistem RAM uygun ve 32GB rahat► iGPU sistem RAM’i paylaşır, bu nedenle buna göre bütçe लागayın। 13B-14B modeller için en az 32GB planlayın।