PocketPal AI Android'de yerel bir dil modelini çalıştırıyor

Çağdaş bir flagship telefonda, beş yıl önce gönderilen çoğu dizüstü bilgisayardan daha fazla RAM vardır ve hiçbir zaman kullanıcının cebinden çıkmaz. Bu kombinasyon sonunda cihazda 4B ve 7B dil modellerini çalıştırmak için yeterlidir: API faturası yok, telefon dışına veri çıkmıyor, uçak Wi-Fi’si düştüğünde kısıtlama yok. Yerel LLM çıkarımını pratik hale getiren altı Android uygulamasını test ettik; tek dokunuş indirilmelerden Termux düzeyindeki esnekliğe kadar. Bunlar 2026’da Android telefonlarda yerel LLM çalıştırmak için en iyi uygulamalar.

Yerel LLM uygulamasında ne aranmalı

Tavizler her zaman aynıdır: model kalitesi bellek baskısına karşı, gecikme pil tüketimine karşı, kurulum kolaylığı kontrol karşısında.

Hızlı karşılaştırma

Uygulama En İyi Model Kataloğu Maks Bağlam Açık Kaynak
PocketPal AI Başlangıç seti Hugging Face’ten GGUF 8k varsayılan Evet
MLC Chat GPU hızlandırılı çıkarım MLC önceden oluşturulmuş 4k-8k Evet
ChatterUI Rolüne giriş ve kişilik Herhangi bir GGUF yolu 16k+ Evet
Layla Lite Anahtar teslim karakter sohbeti Seçkin GGUF 8k Freemium
Termux llama.cpp’yi doğrudan çalıştırma Herhangi bir şey Modele bağlı Evet
Google AI Edge Gallery Gemma ve Phi demo Google kataloğu 4k Evet

2026’da Android için 6 En İyi Yerel LLM Uygulaması

1. PocketPal AI, başlangıç seti

PocketPal AI ilk olarak önerilen uygulamadır. Model indirmeleri uygulamanın içindeki aranabilir Hugging Face tarayıcısı, nicemleme açılır menüden seçilir ve çıkarım başlığın altında llama.cpp kullanır. 12 GB RAM’e sahip bir telefonda Q4_K_M 3B modelini yüklemek yaklaşık on saniye sürer. Sohbet arayüzü sistem istemlerini, ileti düzenlemesini ve saniye başına jetonları bildiren bir kıyaslama modunu destekler.

2026 sürümü sohbetin yanına bir metin tamamlama modu ekledi; bu, yalnızca sıra tabanlı Q&A yerine otomatik tamamlama stili iş akışları için yararlıdır.

Nerede zayıf kalıyor: Varsayılan ayarlar orta seçenek telefonlarda kalite üzerine hız gösterir. Kalıcı sohbetler şifreden beri SQLite dosyasında yaşar.

Fiyatlandırma:

Platformlar: Android 8.0 ve sonrası, 8 GB RAM veya daha fazla çiplerde en iyisi.

İndir: AptoideGoogle Play

Özet: Bunu ilk olarak yükleyin. Bu, Android’de yerel çıkarım için başlatma rampasıdır.


2. MLC Chat, GPU hızlandırılı seçenek

MLC Chat MLC-LLM ekibi tarafından telefonun Vulkan veya OpenCL arka ucuna derlenmiş önceden oluşturulmuş modelleri içerir. Snapdragon 8 Gen 3 veya Tensor G4 üzerinde, bu, saf llama.cpp CPU derlemesinden belirgin şekilde daha iyi saniye başına jetonları anlamına gelir. Model seçimi dar ancak seçkindir: Gemma, Phi ve Llama aile derlemeleri tamamı dahildir.

Uzlaşma esnekliktir. MLC modelleri bakımcılar tarafından yeniden derlenmiş, bu nedenle yeni bir Hugging Face yüklenmesi bir veya iki hafta sürer.

Nerede zayıf kalıyor: Hiçbir özel model ithalatı yok. GPU arka ucu, bazı Samsung derlemelerinde işletim sisteminin paylaşılan bellek yöneticisiyle rekabet ederek bazen çökmeler meydana gelir.

Fiyatlandırma:

Platformlar: Android 8.0 ve sonrası, Vulkan veya OpenCL’li GPU.

İndir: Google Play

Özet: Kullanıcı MLC’nin önceden derlenmiş olan şeyleri çalıştırmaya istekli olduğunda cihazda en iyi ham hız.


3. ChatterUI, rolüne giriş ve kişilik ön ucu

ChatterUI SillyTavern tarzı karakter kartları, ileti kaydırması, grup sohbetleri ve kişi başına sistem istemlerini içeren yerel çıkarım için tam bir ön uçtur. Yerel depolama alanından herhangi bir GGUF yükler; bu, zaten Hugging Face koleksiyonunu önbelleğe alan okuyucuların seçimi yapar.

Talimat şablonu seçici burada önemlidir: Llama-3 derlemesinde Mistral sohbet şablonunun uyuşturulması kaliteyi zedeleyip ChatterUI seçeneği açıkça ortaya koyer.

Nerede zayıf kalıyor: Kurulum bu listenin en dik olanıdır. İlk çalıştırma, okuyucudan bir model dosyasına işaret etmesi, bir sohbet şablonu seçmesi ve herhangi bir işlem yapmadan önce bir bağlam uzunluğu ayarlaması istenir.

Fiyatlandırma:

Platformlar: Android 8.0 ve sonrası.

İndir: F-Droid

Özet: Telefonda SillyTavern isteyenler için güç kullanıcıları.


4. Layla Lite, anahtar teslim karakter sohbeti

Layla Lite Layla AI’nın seçkin model kataloğu ve sohbet şablonu seçmeden telefondaki bir asistanla konuşmak isteyenleri hedef alan karakter sohbeti arayüzü ile şeritli bir sürümdür. İndirmeler önceden nicelenir ve temeldeki model yerine kişiliğin adından sonra; bu alanın yeni olanları için daha dostça.

Ücretli Layla metin-konuşma, cihazda resim üretimi ve görüş girdilerini getirir.

Nerede zayıf kalıyor: Ücretsiz katman model seçimini sınırlandırır. Ücretsiz sürümdeki kişiliğin sesi küçük modellerde sıkışmış.

Fiyatlandırma:

Platformlar: Android 9.0 ve sonrası.

İndir: Google Play

Özet: Hiçbir şey yapılandırmadan cihaz sohbeti isteyenlerin seçimi.


5. Termux, DIY seçeneği

Termux bir LLM uygulaması değil; llama.cpp, Ollama ikilileri ve Python çıkarım yığınlarını yerel olarak çalıştıran tam bir Linux kabuğudur. Zaten bir dizüstü bilgisayarda yerel modeller çalıştıran herkes için Termux, telefonda aynı iş akışına giden en kısa yoldur: pkg install llama-cpp, ~/models içine GGUF düşürün, çalıştırın.

Termux:API eklentisiyle eşleştirildiğinde Tasker veya kısayoldan çıkarım komut dosyası; bu, Android’in yerel model için hotkey’e en yakın sahip olduğudur.

Nerede zayıf kalıyor: Play Store sürümü eski. F-Droid veya GitHub sürümünü kullanın. Yapılandırma bir kabuk, kullanıcı arayüzü değil.

Fiyatlandırma:

Platformlar: Android 7.0 ve sonrası.

İndir: F-Droid

Özet: Zaten bildikleri CLI’yi tercih edenler için.


Google AI Edge Gallery Google’ın resmi cihazda çıkarım vitrinesidir. MediaPipe’nin LLM Çıkarım API’si için önceden yapılandırılmış Gemma ve Phi varyantları, sohbet, özet ve görüntü anlayışı için örnek akışlarla birlikte gelir. Bir yapı veya nicemleme seçmeden bir telefonda modern Gemma modeli gibi hissetmek en hızlı yoldur.

Galeri formatı bir kıyaslama görevi görmektedir: her model kartı cihazda saniye başına jetonları listeler; okuyucu bir Pixel 9 Pro’yu bir dakikadan az sürede orta seviye Snapdragon’a karşı karşılaştırabilir.

Nerede zayıf kalıyor: Google’ın seçimlerine sınırlı. Genel amaçlı bir sohbet istemcisi değil.

Fiyatlandırma:

Platformlar: Android 12 ve sonrası.

İndir: F-Droid

Özet: Cihazda çıkarımın belirli bir telefonda hızlı yeterli olup olmadığını değerlendirmek için daha ağır bir şey yüklemeden önce temiz demo.

Doğru olanı nasıl seçersiniz

SSS

Bir Android telefonun 7B dil modelini çalıştırmak için ne kadar RAM’i olması gerekir?
Nicelenir 7B Q4_K_M modelini kullanılabilir hızda çalıştırmak için yaklaşık 4.5 GB RAM’e ihtiyaç duyar, artı işletim sistemi ve arka plan uygulamaları için yer. Pratik olarak, 8 GB telefon işe yarar eğer okuyucu arka plan sekmesini kapatırsa; 12 GB veya 16 GB telefonlar bunu fark etmeden işleyip.

Yerel LLM uygulamaları pili tüketiyor mu?
Aktif çıkarım ağırdır; bir video araması gibi. İş parçacıkları olmayan uygulamalar pili kullanmaz çünkü modeller sohbetler arasında hafızadan boşalır.

İnternet bağlantısı olmadan yerel bir model çalıştırabilir miyim?
Evet, bu noktasıdır. Model indirmelerine internet gereklidir ama çıkarım bundan sonra tamamen çevrimdışıdır.

Hangi nicemlemeyi seçmeliyim?
Q4_K_M çoğu telefonda çalışan varsayılandır. Q5_K_M, yedek RAM varsa daha iyidir. Q4 altında kalite keskin bir şekilde düşer ve bellekten çok nadir tasarruf değerdir.