
Dolabınızda yatan eski oyun PC’sinin henüz çok hayatı var. 2018 döneminde Ryzen veya Intel, 32 GB RAM ve kullanılmış bir GPU’ya sahip bir makine, 7B modeli sohbet hızında çalıştıracak ve 13B modelini rahatça barındıracaktır. Aile dizüstü bilgisayarlarını ona yönlendirin ve LAN üzerinde birkaç saniye içinde yanıt veren özel, her zaman açık bir AI’ye sahip olursunuz. Eski bir PC’yi yerel AI sunucusuna dönüştürmek için en iyi uygulamalar, modellerini iyi seçer, diğer araçlar için HTTP API sağlar ve makinenin sorgular arasında uyumasına izin verir. Eski donanımı kullanışlı bir AI hizmetine dönüştüren yedi uygulamayı seçtik.
Yerel AI Sunucusu Uygulamasında Neler Aranmalı
Eski donanımda AI için altı şey önemlidir:
- Backend ve format.
llama.cpp(GGUF) en geniş desteği sağlar; MLC ve ONNX alternatiftir. - Yalnızca CPU yolu. Uygulama GPU’su olmayan bir makinede kullanılabilir hızda çalışır mı.
- GPU desteğinin genişliği. Nvidia (CUDA), AMD (ROCm), Intel (SYCL) ve Apple Silicon (Metal).
- Eşzamanlı istek işleme. Aile aynı anda sorgu yapabilir mi biri diğerini uyuşturmadan.
- OpenAI uyumlu API. Diğer araçlar sunucuya işaret edebilir mi ve OpenAI API’si ile konuştuğunu düşünebilir mi.
- Bellek tavanı. RAM artı VRAM hangi modelin sığacağını belirler. Q4 kuantilemesi bellek ihtiyacını kabaca yarıya indirir.
Hızlı karşılaştırma
| Uygulama | Hangi Durumlarda En İyi | GPU Desteği | API | Öne Çıkan Özellik |
|---|---|---|---|---|
| Ollama | En basit sunucu | Nvidia, AMD, Apple | OpenAI uyumlu | Tek komut modeli çalıştırır |
| LM Studio | Kullanıcı dostu UI | Nvidia, AMD, Apple | OpenAI uyumlu | En iyi model keşfi |
| Jan | Tamamen yerel ChatGPT | Nvidia, AMD, Apple | OpenAI uyumlu | Sohbet ve sunucu bir uygulamada |
| GPT4All | Yalnızca CPU tabanı | Nvidia, AMD, CPU | Yerel API | Eski donanımda çalışır |
| llama.cpp | Bare-metal kontrol | Nvidia, AMD, Apple, CPU | Saf HTTP | Listenin çoğu uygulamanın motoru |
| Open WebUI | Ollama için web arayüzü | Herhangi biri (istemci) | Ollama ile iletişim kurar | LAN için ChatGPT benzeri UI |
| LocalAI | OpenAI doğrudan yerine koyma | Nvidia, AMD, CPU | OpenAI uyumlu | Resim, ses, gömmeleri de sunar |
Uygulamalar
1. Ollama, en iyi “tek komutla modeli çalıştırmak için”
Ollama seçilmiş bir kütüphaneden modelleri çeken, kuantlayan ve sunan bir arka plan hizmeti sağlar. Tek bir komut (ollama run llama3.2) ağırlıkları indirir, modeli yükler ve kullanıcıyı sohbete bırakır. Hizmet localhost:11434 üzerinde OpenAI uyumlu bir endpoint sunar, bu nedenle OpenAI ile konuşan herhangi bir araç eski PC’ye işaret edebilir ve aynı davranışı elde edebilir.
Nerede başarısız olur: Ollama’nın kendi kütüphanesi özel bildirim formatı kullanır. Hugging Face’ten rastgele bir GGUF getirmek küçük bir Modelfile ve bir içe aktarma adımı gerektirir.
Fiyat: Ücretsiz, MIT lisansı.
Platformlar: Windows, macOS, Linux.
İndir: Ollama
Özet: Buradan başlayın. Kurun, tek komut çalıştırın ve LAN’ın bir AI sunucusu vardır.
2. LM Studio, en iyi kullanıcı dostu UI için
LM Studio Hugging Face’de dolaşan, GGUF modellerini indiren ve yerel olarak çalıştıran bir masaüstü uygulamasıdır. Bir sohbet arayüzü ve OpenAI uyumlu bir endpoint sunan “yerel sunucu” geçişi vardır. Arayüz indirmeden önce tahmin edilen RAM ve VRAM kullanımını gösterir; bu kuantilemesi seçerken gerçekten yararlıdır.
Nerede başarısız olur: Kapalı kaynak. Uygulamanın bazı bölümleri yerel kullanım için bile İnternet erişilebilirliğine bağlıdır, ancak model çevrimdışı çalışır.
Fiyat: Kişisel kullanım için ücretsiz.
Platformlar: Windows, macOS, Linux.
İndir: LM Studio
Özet: Eski PC’yi çalıştıran arkadaş terminale dokunmak istemediğinde bunu seçin.
3. Jan, tamamen yerel ChatGPT klon için en iyi
Jan, ChatGPT benzeri istemci, model yöneticisi ve yerel API sunucusu olan bir masaüstü uygulamasıdır. Model indirmeleri görünürdür ve “sunucu modu” aynı modelleri LAN üzerindeki diğer uygulamalar tarafından kullanılabilir hale getirir. Tüm tasarım açık kaynak ve gizlilik odaklıdır.
Nerede başarısız olur: Ollama ve LM Studio’dan daha yeni; model desteğinde bazen pürüzlü.
Fiyat: Ücretsiz, AGPL lisansı.
Platformlar: Windows, macOS, Linux.
İndir: Jan
Özet: Amaç LAN üzerinde sohbet istemcisi ve sunucu olarak davranan tek bir uygulama ise seçin.
4. GPT4All, yalnızca CPU tabanı için en iyi
GPT4All hiç GPU’nun olmadığı durum için inşa edilmiştir. GGUF modellerini CPU’da 2018’den beri herhangi bir makinede kullanılabilir performansla çalıştırır. Masaüstü uygulama modelleri yönetir ve yerel bir API sunucusu ayarlardan açılabilir.
Nerede başarısız olur: CPU’daki hız bellek bant genişliği tarafından sınırlıdır. GPU’su olmayan modern CPU’da 7B modelde 4 ile 8 tok/sn arasında bekleyin.
Fiyat: Ücretsiz, MIT lisansı.
Platformlar: Windows, macOS, Linux.
İndir: GPT4All
Özet: GPU’su olmayan ofis PC’si için. Hala bir asistan çalıştırır.
5. llama.cpp, bare-metal kontrol için en iyi
llama.cpp yukarıdaki uygulamaların çoğunun sardığı motordur. Doğrudan çalıştırmak, eski donanımda en hızlı yoldur çünkü ek yük yoktur. llama-server ikili bir HTTP endpoint sunar; llama-cli ikili etkileşimli sohbeti çalıştırır. Her şey runtime olmadan tek bir C++ projesidir.
Nerede başarısız olur: Yalnızca komut satırı. Yapılandırma bayraklarda, kullanıcı arayüzünde değil.
Fiyat: Ücretsiz, MIT lisansı.
Platformlar: Windows, macOS, Linux (her yerde kaynak derlemeleri).
İndir: GitHub
Özet: Eski makineden her son token’ı sıkıştırma hedefi olduğunda seçin.
6. Open WebUI, web arayüzü için en iyi
Open WebUI Ollama (veya herhangi bir OpenAI uyumlu endpoint) ile konuşan kendi kendine barındırılan bir web kullanıcı arayüzüdür. Eski PC’ye kurun ve LAN üzerindeki her cihaz http://server-ip:3000 üzerinde ChatGPT benzeri bir sayfaya erişir. Kullanıcılar, izinler, RAG belgeleri ve çok modelli yönlendirme hepsi yerleşiktir.
Nerede başarısız olur: Bir model backend üzerinde çalışır, bu nedenle arkasında Ollama veya OpenAI uyumlu sunucu gerekir.
Fiyat: Ücretsiz, kendi kendine barındırılan; BSD-3-Clause.
Platformlar: Docker herhangi bir ana bilgisayarda.
İndir: GitHub
Özet: Çoğu ailenin istediği kullanıcı arayüzü. Ollama’dan hemen sonra kurun.
7. LocalAI, OpenAI doğrudan yerine koymak için en iyi
LocalAI LAN üzerinde OpenAI API’sinin yerine geçer. Sohbet tamamlamaları, gömmeleri, resim üretimi (Stable Diffusion), metin-konuşma ve konuşma-metni hepsi OpenAI’nin kullandığı aynı HTTP endpoint’lerinin arkasında bulunur. OpenAI SDK’si olan herhangi bir araç, bir env değişkenini değiştirerek LocalAI’ye karşı çalışır.
Nerede başarısız olur: Geniş kapsam daha yavaş başlatma anlamına gelir. Her modalite kendi model seçeneklerine sahiptir.
Fiyat: Ücretsiz, MIT lisansı.
Platformlar: Linux, Windows (WSL2), macOS’de Docker.
Özet: Hedef, OpenAI’yi pek çok uygulamada bir kez yerel sunucuyla değiştirmek olduğunda bunu seçin.
Doğru kombinasyon nasıl seçilir
Çalışması gereken bir home-lab kurulumu için: Ollama artı Open WebUI. Biri LAN’da modelleri sunar; diğeri ailede ziyaret edecek bir sayfa verir.
Terminale dokunmak istemeyecek bir arkadaş için: Masaüstünde LM Studio ve yerel sohbet yapmalarına izin verin.
Eski yalnızca CPU ofis kutusunun için: 3B modeli ile GPT4All. Veya terminal uygunsa llama.cpp aynı modelle.
Sohbeti ve sunucuyu iki uygulamaya bölmeden sunan all-in-one için: Jan.
Birçok AI aracı çalıştıran bir ev için (kişisel asistanlar, kodlama IDE’leri, not uygulamaları): LocalAI böylece her araç OpenAI benzeri bir endpoint görür.
SSS
Önce hangi modeli çalıştırmalıyım? Llama 3.2 3B veya Qwen 2.5 3B Q4_K_M’de. Her ikisi de 4 GB RAM’e sığar, modern bir CPU’da tek başına 15 ile 30 tok/sn çalışır ve ortak sorular için neredeyse flagship cevaplar verir.
GPU’ya ihtiyacım var mı? Hayır, ancak ne çalıştırabileceğinizi değiştirir. GPU olmadan, 7B modellerini 5 ile 10 tok/sn arasında bekleyin. GPU olmadan bile kullanılmış bir Nvidia RTX 3060 (12 GB) ile bile, 13B modeli 30 ile 50 tok/sn arasında pratik hale gelir.
Ne kadar RAM gerekli? 7B modelleri için 16 GB minimumdur. 32 GB, 13B bölgesini açar. 64 GB veya daha fazla 34B ve 70B tutmaya başlar (kuantilemesi ile).
Bunu evden dışarıdan erişebilir miyim? Evet, Tailscale gibi mesh VPN üzerinde. Ollama veya LocalAI endpoint’ini genel İnternete açığa koymayın. Varsayılan olarak yerleşik auth yoktur.
Eski bir PC boşta kalırken ne kadar güç çeker? GPU’lu eski bir masaüstü, boştayken 40 ile 80 W arasında kalır. Bu, çoğu pazarda yılda 50 ile 100 ABD doları elektrik. Makine günde sadece birkaç kez sorgulanırsa, BIOS’ta wake-on-LAN ayarlayın ve oturumlar arasında uyutun.
Bu, Mac mini’de Ollama çalıştırmayla karşılaştırıldığında nasıldır? 16 veya 24 GB birleştirilmiş belleğe sahip Apple Silicon Mac mini en enerji verimli yoldur. Eski PC başka yerde değer taşırsa, bunu tutun. Sıfırdan başlarsa, kullanılmış bir M1 mini genellikle vat başına token cinsinden 2018 kulesini yener.