Android'de çalışan MLC Chat nicelleştirilmiş LLM

Android’de çalıştırmak için en iyi nicelleştirilmiş LLM uygulamaları 2026’da

Q4_K_M, Q5_K_S, Q8_0. Henüz anlamı açık değilse, bu etiketler 7 milyar parametreli bir modelin artık 6 GB telefonun içine sığmasının sebebidir. Nicelleştirme, model ağırlıklarını 16-bit ondalıktan 4-bit tamsayıya indirir; bu, bir sohbet modelini 14 GB’den 5 GB’nin altına küçültür ve telefonunuzun bunu bir bulut API’si faturası olmadan çalıştırmasını sağlar.

Bir Pixel 8 ve Snapdragon 8 Gen 2 tabletinde yedi uygulamayı test ettik. Önemsediğimiz şeyler: hangi uygulamalar ortada bir dizüstü bilgisayar olmadan GGUF ve MLC nicelleştirilmiş ağırlıkları yükledi, hangisi uçak modunda çevrimdışı çalıştı ve hangisi termal daraltmaya girmeden bir konuşmayı sürdürdü.

Cihaz üzerinde LLM uygulamalarında nelere bakılmalı

Hızlı karşılaştırma

Uygulama En iyi kullanım Ücretsiz plan Başlangıç fiyatı/ay Puan
MLC Chat Derlenmiş MLC kernelleri, en iyi aktarım hızı Evet (açık kaynak) Ücretsiz 4.4
PocketPal AI Dostu bir katalog ile GGUF modelleri Evet (açık kaynak) Ücretsiz 4.6
Layla Rolü oynamak ve uzun bağlamda sohbetler Ücretsiz katman 9,99 $ bir kerelik 4.5
Sherpa Minimal llama.cpp kabuğu Evet (açık kaynak) Ücretsiz 4.2
LLMFarm Companion Cihazlar arası model senkronizasyonu Evet 4,99 $ bir kerelik 4.3
ChatterUI Çok modelli sohbet ön ucu Evet (açık kaynak) Ücretsiz 4.5
Enchanted Ev Ollama sunucusu için ön uç Evet (açık kaynak) Ücretsiz 4.4

Uygulamalar

1. MLC Chat — Derlenmiş MLC kernelleri ve en iyi aktarım hızı için

MLC Chat, telefonunuzdaki tam Adreno veya Mali GPU’su için ayarlanmış önceden derlenmiş modelleri sunmaktadır. Bu derleme adımı, bir Pixel 8’de 3 milyar parametreli Phi modelinin 15+ belirteç/saniyede çalışmasını sağlayan şeydir; bu, genel bir GGUF çalışma zamanının başarabileceğinin kabaca iki katı. Uygulama içindeki katalog kısadır ancak seçilmiştir: Llama, Phi, Gemma, Mistral, RedPajama.

Eksik yanı: Rasgele GGUF dosyaları desteği yok. Halihazırda indirilmiş bir modeliniz varsa, MLC için yeniden derlemeden onu burada yükleyemezsiniz.

Fiyatlandırma:

Platform: Android 8.0 ve üstü.

İndir: Aptoide

Özet: Saniye başına belirteç sayısı önemli olduğunda ve sabit katalog ile yaşayabileceğiniz zaman MLC Chat’i seçin.

2. PocketPal AI — GGUF modelleri dostu bir katalog ile için en iyi

PocketPal AI, işaret ettiğiniz herhangi bir GGUF’u yükler. Uygulama içi arama Hugging Face’i tarayıcıya geçmeden göz atar ve indirme ekranı, diske 4 GB işlemeden önce cihazınız için nicelleştirme katmanını, boyutunu ve kaba saniye başına belirteç tahminini gösterir. Sohbet geçmişi cihazda kalır.

Eksik yanı: GPU hızlandırması aynı telefonda MLC’nin gerisinde kalır. Uzun bağlamda konuşmalar 6 GB cihazlarda RAM’i hızlı tüketir.

Fiyatlandırma:

Platform: Android 9.0 ve üstü.

İndir: Google Play

Özet: Android’de GGUF nicelleştirmesine yeni başlayanlar için en uygun seçim.

3. Layla — Rolü oynamak ve uzun bağlamda sohbetler için en iyi

Layla, rolü oynamak ve uzun hikaye yazma çıktısı isteyenleri hedefler. İstem şablonları, karakter kartı içeri aktarımları ve hikaye devamlılığını birçok tur boyunca tutmak üzere ayarlanmış daha geniş varsayılan bağlam pencereleri ile birlikte gelir. Yerel olarak GGUF çalıştırır; ücretli katman sesli giriş ve premium modelleri ekler.

Eksik yanı: Arayüz meşgul. Önceden derlenmiş bazı karakterler yetişkin temalı olma eğilimindedir; güvenlik filtresi aile kullanımı için manuel ayarlama gerektirir.

Fiyatlandırma:

Platform: Android 9.0 ve üstü.

İndir: Google Play

Özet: Yerel bir model isteme nedeniniz, bulut modelinin reddedebileceği kurgu yazarsa Layla’yı seçin.

4. Sherpa — Minimal llama.cpp kabuğu için en iyi

Sherpa, ne istediğini zaten bilenlerin uygulaması. Bir GGUF dosyasını SD karta gösterin, bağlam uzunluğunuzu ve iş parçacığı sayınızı ayarlayın ve başlayın. Katalog yok, senkronizasyon yok, delik yok.

Eksik yanı: El tutmaz. İlk kez deneyenleri sığmayacak bir model yükleyip uygulamayı çökertebilir.

Fiyatlandırma:

Platform: Android 8.0 ve üstü.

İndir: F-Droid

Özet: Bir sohbet uygulaması sarmalayıcısı olmayan bir llama.cpp çalışma zamanı isteyen ileri kullanıcılar için.

5. LLMFarm Companion — Cihazlar arası model senkronizasyonu için en iyi

LLMFarm iOS’ta başladı ve Android’de aynı kataloğu ve istem kitaplığını yansıtan bir yardımcı vardır. Bir iPad ve Android tablet arasında zaman ayırıyor ve her ikisinde de aynı karakterleri ve sistem istemlerini istiyorsanız kullanışlıdır.

Eksik yanı: PocketPal’den daha az format geçişi. Adreno’da GPU desteği hala yakalamakta.

Fiyatlandırma:

Platform: Android 10 ve üstü.

İndir: Google Play

Özet: iOS’ta LLMFarm’ı kullanıyorsanız ve istem paritesini istiyorsanız bunu seçin.

6. ChatterUI — En iyi çok modelli sohbet ön ucu

ChatterUI, her arka ucu aynı şekilde ele alır; ister telefonunuzda llama.cpp çalıştırıyorsanız, ister bir dizüstü bilgisayarda KoboldCpp, ister ev sunucusunda Ollama çalıştırıyorsanız. Sohbetin ortasında küçük yerel bir modelden daha güçlü uzak birine geçin ve konuyu kaybetmeyin.

Eksik yanı: İlk başlatmada yapılandırma ağırdır. Hangi modeli seçeceğine dair hiç fikri yoktur; bu nedenle yeni başlayanlar seçicide takılı kalır.

Fiyatlandırma:

Platform: Android 8.0 ve üstü.

İndir: GitHub Sürümleri

Özet: Telefon çıkarımı çalıştırdığınız birkaç yerden sadece biri olduğu zaman doğru seçim.

7. Enchanted — Ev Ollama sunucusu için en iyi ön uç

Enchanted, kendi başına bir cihaz üzerinde motor değildir. Bir dizüstü bilgisayar veya ev sunucusunda çalıştırdığınız bir Ollama örneğine konuşan parlak bir sohbet uygulamasıdır. Yolda, yukarıdaki uygulamalardan birinde yerel bir nicelleştirilmiş modeli kullanın; evde, telefonunuzun host edemediği daha büyük bir model için Enchanted’a girin.

Eksik yanı: Ollama çalıştıran bir makine gerektirir. Uzak kullanım için tünel veya LAN erişilebilirliği gerektirir.

Fiyatlandırma:

Platform: Android 9.0 ve üstü.

İndir: GitHub Sürümleri

Özet: Telefonunuzun sığdıramadığı bir modeli istediğiniz günler için yukarıdaki uygulamalardan herhangi biriyle eşleştirin.

Doğru olanı seçme

Akronymler sizleri kullandıktan sonra daha az korkutucu olur. Llama 3.1 8B’nin Q4_K_M nicelleştirmesi herhangi bir 8 GB telefonda rahatça sığar; Phi-3 Mini’nin Q8_0 uygulaması 6 GB telefonlarda şaşırtıcı derecede iyi çalışır. Oradan başlayın, saniye başına belirteci izleyin ve adım atın veya aşağı adım atın.

SSS

Q4_K_M gerçekte ne anlama geliyor?

Q4, model ağırlıklarının 4 bitlik nicelleştirmesi anlamına gelir. K, llama.cpp tarafından tanıtılan daha akıllı bir gruplama olan k-quants’ı ifade eder. M, kalite için bazı 5 bitlik tensörleri karıştıran orta değişkenidir. Uygulamada: Q4_K_M “varsayılan yeterli” katmanıdır.

Cihaz üzerinde bir model ne kadar RAM gerektiriyor?

Başparmak kuralı: model dosya boyutu artı çalışma zamanı ve bağlam önbelleği için %30. 4 GB model yaklaşık 5,5 GB boş alanı gerektirir. 8 GB veya daha fazla RAM’e sahip telefonlar Q4’te 7B parametreli modelleri işleyebilir; 6 GB telefonlar 3B’ye bağlı kalır.

Telefonum aşırı ısınacak mı?

Orta seviye bir telefonda sürekli çıkarım birkaç dakika içinde termal daraltmaya neden olacaktır. Daha yeni Snapdragon 8 Gen 2/3 veya Tensor G4 cihazlarını tercih edin ve çalışırken telefonu yumuşak bir yüzeyin dışında tutun.

Bu uygulamalar istemlerimi bir yere gönderiyor mu?

Cihaz üzerinde çıkarım cihazda kalır. Enchanted ve ChatterUI, uzak bir arka uca konuşmak üzere yapılandırıldığında istisnalardır. İlk başlatmada her uygulamanın ağ istemlerini okuyun.

Hangi modelle başlamalıyım?

Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M veya Gemma 2 2B modern Android telefonu için güvenli başlangıç noktalarıdır. Cihaz 12 GB veya daha fazla RAM’e sahipse Llama 3.1 8B’ye adım atın.