
Android’de çalıştırmak için en iyi nicelleştirilmiş LLM uygulamaları 2026’da
Q4_K_M, Q5_K_S, Q8_0. Henüz anlamı açık değilse, bu etiketler 7 milyar parametreli bir modelin artık 6 GB telefonun içine sığmasının sebebidir. Nicelleştirme, model ağırlıklarını 16-bit ondalıktan 4-bit tamsayıya indirir; bu, bir sohbet modelini 14 GB’den 5 GB’nin altına küçültür ve telefonunuzun bunu bir bulut API’si faturası olmadan çalıştırmasını sağlar.
Bir Pixel 8 ve Snapdragon 8 Gen 2 tabletinde yedi uygulamayı test ettik. Önemsediğimiz şeyler: hangi uygulamalar ortada bir dizüstü bilgisayar olmadan GGUF ve MLC nicelleştirilmiş ağırlıkları yükledi, hangisi uçak modunda çevrimdışı çalıştı ve hangisi termal daraltmaya girmeden bir konuşmayı sürdürdü.
Cihaz üzerinde LLM uygulamalarında nelere bakılmalı
- Yaygın nicelleştirme formatları desteği: GGUF (llama.cpp stili) veya MLC (derlenmiş kerneller).
- Hugging Face URL’lerini yapıştırmaya gerek kalmadan göz atabileceğiniz bir model kataloğu.
- Sunucuya aktarılmayan, yerel olarak kaydedilen kalıcı sohbet geçmişi.
- Saniye başına belirteç okuma, böylece bir modelin telefon için çok ağır olup olmadığını bilirsiniz.
- CPU vs GPU vs NPU çıkarım geçişleri, çünkü Snapdragon 8 serisi NPU aktarım hızını iki katına çıkarabilir.
- Uçak modu işlemi. “Merhaba” cevaplamak için Wi-Fi gerektirirse, cihaz üzerinde değildir.
Hızlı karşılaştırma
| Uygulama | En iyi kullanım | Ücretsiz plan | Başlangıç fiyatı/ay | Puan |
|---|---|---|---|---|
| MLC Chat | Derlenmiş MLC kernelleri, en iyi aktarım hızı | Evet (açık kaynak) | Ücretsiz | 4.4 |
| PocketPal AI | Dostu bir katalog ile GGUF modelleri | Evet (açık kaynak) | Ücretsiz | 4.6 |
| Layla | Rolü oynamak ve uzun bağlamda sohbetler | Ücretsiz katman | 9,99 $ bir kerelik | 4.5 |
| Sherpa | Minimal llama.cpp kabuğu | Evet (açık kaynak) | Ücretsiz | 4.2 |
| LLMFarm Companion | Cihazlar arası model senkronizasyonu | Evet | 4,99 $ bir kerelik | 4.3 |
| ChatterUI | Çok modelli sohbet ön ucu | Evet (açık kaynak) | Ücretsiz | 4.5 |
| Enchanted | Ev Ollama sunucusu için ön uç | Evet (açık kaynak) | Ücretsiz | 4.4 |
Uygulamalar
1. MLC Chat — Derlenmiş MLC kernelleri ve en iyi aktarım hızı için
MLC Chat, telefonunuzdaki tam Adreno veya Mali GPU’su için ayarlanmış önceden derlenmiş modelleri sunmaktadır. Bu derleme adımı, bir Pixel 8’de 3 milyar parametreli Phi modelinin 15+ belirteç/saniyede çalışmasını sağlayan şeydir; bu, genel bir GGUF çalışma zamanının başarabileceğinin kabaca iki katı. Uygulama içindeki katalog kısadır ancak seçilmiştir: Llama, Phi, Gemma, Mistral, RedPajama.
Eksik yanı: Rasgele GGUF dosyaları desteği yok. Halihazırda indirilmiş bir modeliniz varsa, MLC için yeniden derlemeden onu burada yükleyemezsiniz.
Fiyatlandırma:
- Ücretsiz: Apache 2.0 açık kaynak.
- Ücretli: Yok.
Platform: Android 8.0 ve üstü.
Özet: Saniye başına belirteç sayısı önemli olduğunda ve sabit katalog ile yaşayabileceğiniz zaman MLC Chat’i seçin.
2. PocketPal AI — GGUF modelleri dostu bir katalog ile için en iyi
PocketPal AI, işaret ettiğiniz herhangi bir GGUF’u yükler. Uygulama içi arama Hugging Face’i tarayıcıya geçmeden göz atar ve indirme ekranı, diske 4 GB işlemeden önce cihazınız için nicelleştirme katmanını, boyutunu ve kaba saniye başına belirteç tahminini gösterir. Sohbet geçmişi cihazda kalır.
Eksik yanı: GPU hızlandırması aynı telefonda MLC’nin gerisinde kalır. Uzun bağlamda konuşmalar 6 GB cihazlarda RAM’i hızlı tüketir.
Fiyatlandırma:
- Ücretsiz: MIT lisanslı açık kaynak.
- Ücretli: Yok.
Platform: Android 9.0 ve üstü.
Özet: Android’de GGUF nicelleştirmesine yeni başlayanlar için en uygun seçim.
3. Layla — Rolü oynamak ve uzun bağlamda sohbetler için en iyi
Layla, rolü oynamak ve uzun hikaye yazma çıktısı isteyenleri hedefler. İstem şablonları, karakter kartı içeri aktarımları ve hikaye devamlılığını birçok tur boyunca tutmak üzere ayarlanmış daha geniş varsayılan bağlam pencereleri ile birlikte gelir. Yerel olarak GGUF çalıştırır; ücretli katman sesli giriş ve premium modelleri ekler.
Eksik yanı: Arayüz meşgul. Önceden derlenmiş bazı karakterler yetişkin temalı olma eğilimindedir; güvenlik filtresi aile kullanımı için manuel ayarlama gerektirir.
Fiyatlandırma:
- Ücretsiz: Birkaç önceden ayarlanmış modelle temel sohbet.
- Ücretli: 9,99 $ bir kerelik (Pro) sesli, daha büyük modelleri ve bulut senkronizasyonunu açar.
Platform: Android 9.0 ve üstü.
Özet: Yerel bir model isteme nedeniniz, bulut modelinin reddedebileceği kurgu yazarsa Layla’yı seçin.
4. Sherpa — Minimal llama.cpp kabuğu için en iyi
Sherpa, ne istediğini zaten bilenlerin uygulaması. Bir GGUF dosyasını SD karta gösterin, bağlam uzunluğunuzu ve iş parçacığı sayınızı ayarlayın ve başlayın. Katalog yok, senkronizasyon yok, delik yok.
Eksik yanı: El tutmaz. İlk kez deneyenleri sığmayacak bir model yükleyip uygulamayı çökertebilir.
Fiyatlandırma:
- Ücretsiz: MIT lisansı.
- Ücretli: Yok.
Platform: Android 8.0 ve üstü.
Özet: Bir sohbet uygulaması sarmalayıcısı olmayan bir llama.cpp çalışma zamanı isteyen ileri kullanıcılar için.
5. LLMFarm Companion — Cihazlar arası model senkronizasyonu için en iyi
LLMFarm iOS’ta başladı ve Android’de aynı kataloğu ve istem kitaplığını yansıtan bir yardımcı vardır. Bir iPad ve Android tablet arasında zaman ayırıyor ve her ikisinde de aynı karakterleri ve sistem istemlerini istiyorsanız kullanışlıdır.
Eksik yanı: PocketPal’den daha az format geçişi. Adreno’da GPU desteği hala yakalamakta.
Fiyatlandırma:
- Ücretsiz: Temel sohbet.
- Ücretli: 4,99 $ bir kerelik model boyutu kısıtlamalarını kaldırır.
Platform: Android 10 ve üstü.
Özet: iOS’ta LLMFarm’ı kullanıyorsanız ve istem paritesini istiyorsanız bunu seçin.
6. ChatterUI — En iyi çok modelli sohbet ön ucu
ChatterUI, her arka ucu aynı şekilde ele alır; ister telefonunuzda llama.cpp çalıştırıyorsanız, ister bir dizüstü bilgisayarda KoboldCpp, ister ev sunucusunda Ollama çalıştırıyorsanız. Sohbetin ortasında küçük yerel bir modelden daha güçlü uzak birine geçin ve konuyu kaybetmeyin.
Eksik yanı: İlk başlatmada yapılandırma ağırdır. Hangi modeli seçeceğine dair hiç fikri yoktur; bu nedenle yeni başlayanlar seçicide takılı kalır.
Fiyatlandırma:
- Ücretsiz: GPLv3 açık kaynak.
- Ücretli: Yok.
Platform: Android 8.0 ve üstü.
İndir: GitHub Sürümleri
Özet: Telefon çıkarımı çalıştırdığınız birkaç yerden sadece biri olduğu zaman doğru seçim.
7. Enchanted — Ev Ollama sunucusu için en iyi ön uç
Enchanted, kendi başına bir cihaz üzerinde motor değildir. Bir dizüstü bilgisayar veya ev sunucusunda çalıştırdığınız bir Ollama örneğine konuşan parlak bir sohbet uygulamasıdır. Yolda, yukarıdaki uygulamalardan birinde yerel bir nicelleştirilmiş modeli kullanın; evde, telefonunuzun host edemediği daha büyük bir model için Enchanted’a girin.
Eksik yanı: Ollama çalıştıran bir makine gerektirir. Uzak kullanım için tünel veya LAN erişilebilirliği gerektirir.
Fiyatlandırma:
- Ücretsiz: MIT açık kaynak.
- Ücretli: Yok.
Platform: Android 9.0 ve üstü.
İndir: GitHub Sürümleri
Özet: Telefonunuzun sığdıramadığı bir modeli istediğiniz günler için yukarıdaki uygulamalardan herhangi biriyle eşleştirin.
Doğru olanı seçme
- En hızlı belirteç/saniye istiyorsanız ve sabit katalog ile yaşayabilirsiniz: MLC Chat’i seçin.
- Uygulama içinde Hugging Face’ten GGUF modellerini göz atmak ve indirmek istiyorsanız: PocketPal AI’ı seçin.
- Amacınız kurgu yazısı ve uzun bağlamda sohbetlerse: Layla’yı seçin.
- llama.cpp’yi zaten biliyorsanız ve minimal bir kabuk istiyorsanız: Sherpa’yı seçin.
- iOS ve Android arasında zaman ayırıyorsanız: LLMFarm Companion’ı seçin.
- Yerel ve uzak arka uçlar arasında ortada sohbet değiştirmek istiyorsanız: ChatterUI’ı seçin.
- Ev Ollama sunucusu ana model host’unuzsa: çevrimdışı günler için Enchanted’ı yukarıdaki birinin ile eşleştirin.
Akronymler sizleri kullandıktan sonra daha az korkutucu olur. Llama 3.1 8B’nin Q4_K_M nicelleştirmesi herhangi bir 8 GB telefonda rahatça sığar; Phi-3 Mini’nin Q8_0 uygulaması 6 GB telefonlarda şaşırtıcı derecede iyi çalışır. Oradan başlayın, saniye başına belirteci izleyin ve adım atın veya aşağı adım atın.
SSS
Q4_K_M gerçekte ne anlama geliyor?
Q4, model ağırlıklarının 4 bitlik nicelleştirmesi anlamına gelir. K, llama.cpp tarafından tanıtılan daha akıllı bir gruplama olan k-quants’ı ifade eder. M, kalite için bazı 5 bitlik tensörleri karıştıran orta değişkenidir. Uygulamada: Q4_K_M “varsayılan yeterli” katmanıdır.
Cihaz üzerinde bir model ne kadar RAM gerektiriyor?
Başparmak kuralı: model dosya boyutu artı çalışma zamanı ve bağlam önbelleği için %30. 4 GB model yaklaşık 5,5 GB boş alanı gerektirir. 8 GB veya daha fazla RAM’e sahip telefonlar Q4’te 7B parametreli modelleri işleyebilir; 6 GB telefonlar 3B’ye bağlı kalır.
Telefonum aşırı ısınacak mı?
Orta seviye bir telefonda sürekli çıkarım birkaç dakika içinde termal daraltmaya neden olacaktır. Daha yeni Snapdragon 8 Gen 2/3 veya Tensor G4 cihazlarını tercih edin ve çalışırken telefonu yumuşak bir yüzeyin dışında tutun.
Bu uygulamalar istemlerimi bir yere gönderiyor mu?
Cihaz üzerinde çıkarım cihazda kalır. Enchanted ve ChatterUI, uzak bir arka uca konuşmak üzere yapılandırıldığında istisnalardır. İlk başlatmada her uygulamanın ağ istemlerini okuyun.
Hangi modelle başlamalıyım?
Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M veya Gemma 2 2B modern Android telefonu için güvenli başlangıç noktalarıdır. Cihaz 12 GB veya daha fazla RAM’e sahipse Llama 3.1 8B’ye adım atın.