Masaüstü için yerel GPU AI benchmarking uygulamaları

XDA’nın orta seviye bir GPU’nun ödeme yapılan AI aboneliklerinin bir yığınını sübvanse edebileceğine ilişkin raporu isabetlidir. Bir RTX 4070 Ti veya Radeon RX 7900 XT, 13B ve 34B parametre modellerini çalıştırırken, çoğu bulut hizmetinin tek bir abonelik seviyesi için ödedikleri hızı aşar. Ancak zaten sahip olduğunuz donanımda hangi modeli, niceliğini ve çalışma zamanını kullanacağınızı seçmek, tahminler değil gerçek sayılar gerektirir.

Aşağıdaki yedi uygulama iki tür benchmarking’i kapsıyor. İlk üçü, gerçek iş yükleri için saniye başına belirteci ve ilk belirteci verme süresini raporlayan çalışma zamanına entegre kıyaslamalarıdır. Geri kalanlar donanımı karşılaştırmak için tekrarlanabilir puanlar sağlayan üçüncü taraf benchmark paketleridir. Her seçim Windows ve Linux’ta çalışır; Apple Silicon ile macOS’ta da iki çalışır.

GPU AI Benchmark’te Nelere Bakılması Gerekir

Her AI benchmark size ihtiyacınız olan şeyi söylemez. Bu beş şeyi kontrol edin:

Yalnızca tek bir bağlamda tek bir iş hacmi numarası bildiren her şey gerçek donanım boyutlandırması için yararlı değildir.

Hızlı Karşılaştırma

Uygulama En İyi Ücretsiz Plan Başlangıç Fiyatı Dikkat Çeken Özellik
llama-bench Tekrarlanabilir LLM İş Hacmi Evet Ücretsiz llama.cpp ile birlikte gelen
LM Studio GUI Benchmarkları + Model Alışverişi Evet Ücretsiz Yerleşik model kataloğu
Ollama benchmark Tek Komutlu LLM Stres Testi Evet Ücretsiz Çekilen herhangi bir modelle çalışır
UL Procyon AI Endüstri Standardı Satıcı Benchmark’i Deneme Ödeme Lisansı ONNX + DirectML Yolları
Geekbench AI Çapraz Platform AI Puanı Evet Ücretsiz Seviye iOS, Android, Windows, macOS
MLPerf Client MLCommons Referans Benchmark’i Evet Ücretsiz Derin Donanım Profillemesi
koboldcpp benchmark Roleplay/Chat İş Yükü Simülasyonu Evet Ücretsiz Sohbet Oturumlarını Gerçekçi Bir Şekilde Simüle Eder

Uygulamalar

1. llama-bench – En İyi Tekrarlanabilir LLM İş Hacmi

llama-bench llama.cpp’nin bir parçası olarak gelir ve yerel LLM dünyasının standart bir çubuğa en yakın olması gerekir. Bunu bir GGUF dosyasına yönlendirin, bir bağlam boyutu ve toplu iş boyutu söyleyin ve istem belirteci başına saniye, oluşturma belirteci başına saniye ve ilk belirteci verme zamanını bildirecektir. Herhangi bir CUDA, ROCm, Metal veya CPU arka ucunda çalışır, bu nedenle tek bir araç Nvidia sondanız, Radeon yapınız ve MacBook’unuzda karşılaştırılabilir sayılar verir.

Başarısız Olduğu Yer: Yalnızca komut satırı. GUI yok. Bazı seçenekler (BLAS, toplu iş boyutu) belgeleri okumayı gerektirir.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: llama.cpp on GitHub

Alt Satır: Nicelikler veya modelleri karşılaştırırken varsayılan benchmark. Bayraklarını bir kez öğrenin.

2. LM Studio – Model Alışveriş ile En İyi GUI Benchmarkları

LM Studio, modelleri indirmek, çalıştırmak ve şimdi karşılaştırmak için grafik kullanıcı arabirimi ile llama.cpp’yi saran bir masaüstü uygulamasıdır. Yerleşik benchmark sekmesi, indirilen herhangi bir modeli önceden ayarlanmış bir iş yükü üzerinde test eder ve ölçümleri uzmanolmayanlar tarafından okunabilecek şekilde bildirir. Ayrıca kalan VRAM headroom’unu gösterir, bu da sonraki modeli boyutlandırmaya yardımcı olur.

Başarısız Olduğu Yer: Kapalı kaynak. Model kataloğu HuggingFace ile örtüşür ve kapsamlı değildir.

Fiyatlandırma:

Platformlar: Windows, macOS (Apple Silicon), Linux.

İndir: LM Studio

Alt Satır: Terminal’e dokunmadan yeni bir modeli karşılaştırmanın en dostça yolu.

3. Ollama benchmark – En İyi Tek Komutlu LLM Stres Testi

Ollama, token başına zamanlamaları üreten bir run --verbose bayrağı ile gelir. Topluluk tarafından yönetilen betiklerle birleştirildiğinde, benchmark aracı olarak çift rol oynar. Ollama modelleri adına göre çektiğinden, aynı kıyaslamayı ikinci bir makinede çalıştırmak iki komut alır.

Başarısız Olduğu Yer: Tam benchmark paketi değil. Tamamlama hızına odaklanmış; istem açısından ağır iş yükleri için daha az kullanışlı.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: Ollama

Alt Satır: Günlük model kullanımı için Ollama yükleyin; hızlı iş hacmi okuması istediğinizde --verbose kullanın.

4. UL Procyon AI – En İyi Endüstri Standardı Satıcı Benchmark’i

UL Procyon AI Computer Vision Benchmark, 3DMark ve PCMark’ı yayımlayan aynı UL’dir. Standart ONNX modellerini (MobileNet, ResNet, Inception) TensorRT, DirectML, OpenVINO ve CoreML arka uçları üzerinde çalıştırır ve bir puan üretir. Satıcılar incelemelerinde Procyon numaralarını alıntı yapar, bu nedenle puan endüstri genelinde doğrudan karşılaştırılabilir.

Başarısız Olduğu Yer: Görme iş yüklerine odaklanmış; LLM iş hacmi için daha az kullanışlı. Ticari kullanım için ödenen lisans.

Fiyatlandırma:

Platformlar: Windows.

İndir: UL Procyon AI

Alt Satır: Satıcı kıyaslamalarını kullanarak satın alma kararları veriyorsanız bunu satın alın. Yalnızca LLM hızıyla ilgileniyorsanız atlayın.

5. Geekbench AI – En İyi Çapraz Platform AI Puanı

Geekbench AI, çalışma başına üç sayı üretir: FP32, FP16 ve nicelleştirilmiş INT8. Windows, macOS, Linux, iOS ve Android’de çalışır, bu nedenle aynı iş yükü için bir dizüstü bilgisayar-vs-telefon karşılaştırması bir benchmark uzakta. Herkese açık sonuçlar veritabanı, koşunuzu binlercesine karşılaştırmanıza olanak tanır.

Başarısız Olduğu Yer: LLM’ye özgü değildir. Üç puan çok inceliği çöker.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux, iOS, Android.

İndir: Geekbench AI

Alt Satır: “AI’ye Özellikli Donanımım Nasıl Yığınlanıyor” için gidiş kişisel kişiselinin sayısı.

6. MLPerf Client – En İyi MLCommons Referans Benchmark’i

MLPerf Client, istemci donanımında AI için MLCommons tarafından desteklenen referans kıyaslamadır. Önceden ayarlanmış bir LLM iş yükünü (şu anda Llama 2 7B, daha yeni modellere geçiş) çalıştırır ve referans uygulamaya karşı gecikme, iş hacmi ve kalite gerileme bildirir. MLCommons sonuçları şeffaf bir şekilde yayımladığından, kurulumları karşılaştırmak basittir.

Başarısız Olduğu Yer: Kurulum alternatiflerinden daha karışıktır. Son kullanıcılar için tasarlanmamıştır.

Fiyatlandırma:

Platformlar: Windows, Linux (native), macOS (topluluk yapıları).

İndir: MLPerf Client on GitHub

Alt Satır: Yetkili Benchmark. Donanım karşılaştırması yayınlamayı planlıyorsanız kurulum maliyetine değer.

7. koboldcpp benchmark – En İyi Roleplay ve Chat İş Yükü Simülasyonu

koboldcpp, roleplay ve uzun bağlam sohbetine odaklanan bir llama.cpp çatalıdır. Benchmark modu, haddeleme bağlamı olan gerçek bir sohbet oturumunu simüle eder, bu da ev LLM sunucusunun gün geçtikçe nasıl hissedeceğinin daha dürüst bir testidir. Sayılar, bağlam takası maliyetini ve sistem RAM taşması davranışını içerir, llama-bench atlangıçtır.

Başarısız Olduğu Yer: Sohbet/RP iş yüklerine odaklanmış; kod odaklı metrikleri kaçırır. Arayüz ilk bakışta meşgul görünüyor.

Fiyatlandırma:

Platformlar: Windows, macOS, Linux.

İndir: koboldcpp on GitHub

Alt Satır: Gerçek kullanım vakası kod tamamlama yerine sohbet olan herkes için en temsili kıyaslama.

Doğru Olanı Seçme

Nicelikler arasında tekrarlanabilir sayılar için llama-bench ile başlayın. GUI tercih ederseniz LM Studio’nun yerleşik benchmark sekmesini ekleyin. Model zaten çalıştırdığınız bir makine üzerinde hızlı bir akıl kontrolü için Ollama’nın verbose bayrağını kullanın. Tek bir taşınabilir puana ihtiyacınız olduğunda Geekbench AI ekleyin. Üçüncü taraf yasal meşruiyetin önemli olduğu resmi donanım karşılaştırmaları için UL Procyon veya MLPerf Client’i saklayın. Günlük iş yükünüz kod tamamlama yerine sohbet olduğunda koboldcpp benchmark kullanın.

Satıcı “AI TOPS” teknik sayfalarını ikame olarak atlayın; sayılar tepe-teoriktir ve nadiren gerçek çıkarım iş hacmini kullanabileceğiniz nicelikler üzerinde yansıtırlar.

SSS

Bugün En İyi Yerel LLM Hızını Hangi GPU Sağlıyor? Tüketici kartları için, RTX 4090, 4080 Super ve 5080 Nvidia’da lider; RX 7900 XTX AMD’de lider. Apple M3 Max ve M4 Max, birleştirilmiş belleğe uyan modeller için açığı kapatır.

Gerçekten Kaç Token Başına Saniye İhtiyacım Var? Gerçek Zamanlı Sohbet Modelin Çıkışında 20 t/s Yukarıda İyi Hissettiriyor. 40 t/s Yukarıdaki Her Şey Hızlı SaaS API’sinden Ayırt Edilemez.

Daha Fazla VRAM Yardımcı Olur mu Yoksa Bilgisayar Kazanır mı? LLM’ler için VRAM zor kısıtlamadır. Tam modeli sistem RAM’ine taşmadan VRAM’e sığdırmak, eşik üzerinde saf hesaplamadan daha önemlidir.

Windows’daki Bir Benchmark, Linux’daki Birine Kıyaslanabilir mi? CUDA tabanlı testler için çoğunlukla evet. Sürücü farklılıkları birkaç yüzde varyans ekler. DirectML vs ROCm’de fark çok daha büyüktür ve Linux sayıları genellikle daha yüksektir.

En Ucuz Benchmark Seçeneği Nedir? llama-bench ve Ollama’nın her ikisi de hiçbir maliyeti yoktur. Her ikisi de herhangi bir tüketici GPU’sunun üzerinde çalışır.

Bu Bana LM Studio ve Ollama Arasında Seçim Yapmaya Yardımcı Olur mu? Evet. Aynı modeli ikisinde de karşılaştırın ve token başına saniye ile istem işleme hızını karşılaştırın. Ollama model takası hızında kazanma eğilimindedir; LM Studio’nun GUI deneyler için yardımcı olur.