Donanım kıyaslama araçları çoğu zaman sessizce güncellenir: sürüm numarası bir artar, birkaç test eklenir ve konu kapanır. Geekbench 7'de ise işler bu kez farklı gelişti. Primate Labs, test paketini yalnızca yeni bir sürüm etiketiyle değil; çok çekirdek puanlamasının mantığı, GPU testlerinin odağı ve desteklenen API listesiyle birlikte baştan kurguladı. Bu değişiklikler, yapay zeka iş yüklerini ölçmeye çalışan donanım ekipleri ve satın alma kararı veren teknoloji yöneticileri için ilk kez daha tutarlı bir referans noktası oluşturuyor. Aşağıda paketin öne çıkan yeniliklerini, bunların neden önemli olduğunu ve test tarafında ortaya çıkan pratik sorunları ele alıyoruz.
CUDA desteği: Nvidia GPU'lar artık üretim hattının API'siyle ölçülüyor
Geekbench 7'nin en çok konuşulan yeniliği, CUDA'nın desteklenen API'ler arasına katılması. Paket bugüne kadar GPU testlerinde OpenCL, Vulkan ve Metal API'lerini kullanıyordu; Nvidia tarafı ise bu listede yoktu. Artık bir Nvidia GPU, ağır yapay zeka iş yüklerini gerçekte çalıştıran API yığınının aynısıyla ölçülebiliyor. Primate Labs'in yıllardır kullanıcılardan talep aldığı belirtilen bu adım, kağıt üzerindeki performans iddialarıyla gerçek uygulama davranışı arasındaki farkı daraltmayı amaçlıyor. Bir kıyaslama aracının, ölçtüğü donanımın gündelik iş akışında kullandığı yolu izlemesi, sonuçların yorumlanabilirliği açısından kritik bir detay.
Bu desteğin değeri, listeye bir madde eklenmesinin çok ötesinde. Kaynak değerlendirmede CUDA desteği, çapraz platform kıyaslamada bir dönüm noktası olarak nitelendiriliyor: ilk kez tek bir araç, bir Nvidia GPU'yu üretim ortamındaki yapay zeka iş yüklerini çalıştıran API yığınıyla ölçebiliyor. Bağımsız yazılım üreticileri ve silikon ekipleri, farklı üreticilerin pazarlama rakamlarını üç ayrı kıyaslama aracıyla tahmin etmeye çalışmak yerine tek bir ortak referansa bakabiliyor. Yine de asıl sinyal CUDA'nın kendisi değil; kıyaslama araçlarının, yapay zeka iş yüklerinin gündelik cihazlara bu kadar hızlı taşınmasına yetişme çabası.
Geekbench 7, yanında bir de Geekbench AI adlı tamamlayıcı araçla birlikte geliyor. Bu araç 10 yapay zeka iş yükünü üç veri tipi üzerinden çalıştırıyor: Single Precision, Half Precision ve Quantized. Kullanıcılar CPU, GPU veya cihazın kendine ait NPU'sunu ayrı ayrı test edebiliyor; donanımın desteklediği çerçeve ne olursa olsun (Core ML'den QNN'e kadar) sonuçlar Android, iOS, Windows, macOS ve Linux arasında tek bir tarayıcı üzerinden karşılaştırılabiliyor. NPU tarafının ayrı ölçülebilmesi özellikle önemli, çünkü üreticilerin "NPU performansı" başlığı altında verdiği rakamlar bugüne kadar birbirinden bağımsız ve doğrulanması zor iddialar olarak kalıyordu.

Çok çekirdek puanı: göze çarpmayan ama en kritik düzeltme
Paketin en teknik, aynı zamanda en çok fark yaratacak değişikliği çok çekirdek testinde. Önceki sürümler, gerçek uygulamanın nasıl davrandığına bakmaksızın her iş yükünü çok iş parçacıklı moda zorluyordu. Bu yaklaşım, puanları çarpıtıyor ve kullanıcıya anlamlı bir bilgi vermiyordu; çünkü hiçbir gerçek uygulama tüm çekirdekleri sürekli ve eşit biçimde kullanmaz. Geekbench 7 bu mantığı tersine çeviriyor: bir iş yükü, yalnızca modellediği görev gerçek dünyada gerçekten çok iş parçacıklı çalışıyorsa çok iş parçacıklı modda koşuyor.
Bu kuralın en görünür sonucu, HTML5 Browser testinin çok çekirdek paketinden tamamen çıkarılması. Sebep oldukça net: tarayıcılar pratikte tek iş parçacıklı ya da hafif iş parçacıklı çalışır, dolayısıyla bu testi çok çekirdek puanının içinde tutmak yanıltıcı bir katkı yapıyordu. Ortaya çıkan tablo, bir cihazın gerçek iş yüklerinde ne yaptığını yansıtan bir puan; sentetik bir testin mevcut tüm çekirdeklerden teorik olarak çekebileceği maksimum değeri değil.
Donanım satın alma kararı veren ekipler için bu düzeltme, rakamların yeniden güvenilir hale gelmesi anlamına geliyor. İki dizüstü bilgisayarı karşılaştırırken "daha fazla çekirdek, daha yüksek puan" gibi kaba bir denklemle karar vermek yaygın bir hataydı. Yeni metodoloji, çekirdek sayısı fazla ama tek çekirdek performansı zayıf bir cihazın gündelik işlerde neden yavaş kaldığını puan üzerinden görünür kılıyor. Kısacası test, donanımın reklam broşüründeki değil, masadaki davranışını ölçmeye başlıyor.

CPU testleri gündelik kullanımın gerçek iş yüklerine kaydı
Yeni medya iş yükleri, sıradan bir kullanıcının bilgisayarını gün içinde en çok ne için kullandığına odaklanıyor. Geekbench 7, ekran paylaşımı videolarını AV1 kodeğiyle kodlayarak görüntülü konferanslardaki ekran paylaşımı senaryosunu modelliyor. Müzik ve konuşma seslerini Opus kodeğiyle sıkıştırarak sesli not ve podcast uygulamalarını taklit ediyor. Ses ve video kod çözmenin yanı sıra, OpenAI'ın Whisper konuşma tanıma modeli üzerinden canlı altyazı üretiyor; bu da otomatik altyazılı video oynatmayı temsil ediyor. Modern oyunlarda kullanılan Jolt Physics motoru üzerinde çalışan yeni bir Game Physics iş yükü de pakete eklenmiş durumda.
Fotoğraf tarafı da ihmal edilmemiş. Photo Editor iş yükü, gerçek dünyadan alınan daha zengin bir düzenleme seti kazanmış; Photo Library ise artık JPEG XL ve DNG formatlarını içe aktarıp işliyor. Bu seçimler tesadüfi değil: telefonunda ya da bilgisayarında sürekli fotoğraf düzenleyen, ses kaydı alan, toplantıya giren bir kullanıcının CPU'dan beklediği şeyler kabaca bu listeden oluşuyor.
- AV1 ile ekran paylaşımı videosu kodlama (görüntülü konferans senaryosu)
- Opus ile müzik ve konuşma sesi sıkıştırma (sesli not ve podcast uygulamaları)
- Ses/video kod çözme ve Whisper ile canlı altyazı üretme
- Jolt Physics motoru üzerinde çalışan Game Physics iş yükü
- Photo Editor'de genişletilmiş gerçek dünya düzenlemeleri
- Photo Library'de JPEG XL ve DNG içe aktarma ve işleme

GPU tarafı yapay zeka ve içerik üretimine odaklandı
GPU testlerinin odağı, giderek GPU'ların gerçek kullanımını tanımlayan iki alana kaymış durumda: makine öğrenmesi ve içerik üretimi. Yeni ML testleri yüzleri takip edip gerçek zamanlı filtreler uygulayarak sosyal medya uygulamalarını modelliyor. Makine öğrenmesiyle görüntü büyütme testi, içerik üretim araçlarındaki süper çözünürlük özelliklerini temsil ediyor. Video arka planı bulanıklaştırma testi ise görüntülü konferanslardaki sanal arka planları ölçüyor. Bu üç senaryo, son birkaç yılda GPU'ya bindirilen işlerin önemli bölümünü oluşturuyor.
Bunların yanına RAW görüntü işleme, LUT tabanlı renk düzenleme, path tracing ve akışkan simülasyonu da eklenmiş. Path tracing ve akışkan simülasyonu özellikle profesyonel görsel üretim ve oyun geliştirme tarafında kullanılan, GPU'yu ciddi biçimde zorlayan iş yükleri. LUT tabanlı renk düzenleme ise video kurgu süreçlerinin standart bir parçası. Listenin bütünü, GPU'nun artık yalnızca oyun kare hızı üreten bir birim olmadığını, üretim hattının merkezinde yer aldığını gösteriyor.
- Yüz takibi ve gerçek zamanlı filtreler (sosyal medya uygulamaları)
- Makine öğrenmesiyle görüntü büyütme (içerik üretiminde süper çözünürlük)
- Video arka planı bulanıklaştırma (sanal arka planlar)
- RAW görüntü işleme ve LUT tabanlı renk düzenleme
- Path tracing ve akışkan simülasyonu
Veri setleri büyüdü, platform desteği genişledi
Veri setleri de cihazların bugün nasıl kullanıldığına uyacak şekilde her alanda büyütülmüş. File Compression testi artık kaynak kod, nesne kodu ve metin belgesi arşivlerinden daha geniş bir karışımı kapsıyor. PDF Viewer testi park haritalarından teknik dokümanlara, akademik makalelere kadar uzanan bir yelpazeyi işliyor. Geliştirici ve görüntü işleme iş yükleri de yeni varlıklar ve ek formatlarla genişletilmiş durumda. Bu değişikliklerin ortak amacı, tek bir dar senaryoya göre puan üretmek yerine cihazın karşılaşacağı çeşitliliği yansıtmak.
Geekbench 7; Android, iOS, Windows, macOS ve Linux üzerinde çalışıyor, kişisel kullanım için ücretsiz kalıyor ve 6 Ağustos'a kadar %20 indirimli sunulan bir Pro katmanı ekliyor. Sürümün değerlendirmesi Jon Peddie Research tarafından yayımlandı; yayıncının künyesi ve "About us" (Hakkımızda) bölümündeki bilgiler, kuruluşun Kaliforniya'nın Tiburon kentinde bulunduğunu gösteriyor. Yani paketin arkasında hem geniş bir platform desteği hem de bağımsız bir değerlendirme geleneği var.
Dört farklı sistemde test: tutarlılık sorunu
Değerlendirmede kıyaslama çok farklı makinelerde çalıştırılmış: Asus System, Alienware Area 51, Lenovo 83JM ve Corsair One i200. Sonuçların bir kısmı beklenenden daha az düzenli. Dört sistemin tamamında tutarlı biçimde çalışan GPU testleri elde edilememiş, buna karşılık CPU testleri tutarlı sonuçlar vermiş. Yani paketin kendi içinde yeni olan metrikler sağlam çalışsa da, GPU tarafındaki çerçeve ve sürücü kombinasyonları işleri zorlaştırıyor.
ONNX ve DirectML tabanlı GPU testleri, Lenovo'nun tümleşik grafik biriminin kullanabildiği tüm RAM'i tüketmiş ve test hiçbir zaman tamamlanmamış. GPU OpenVino testi Lenovo'da çalışmış, ancak bir sürücü sorunu nedeniyle diğer makinelerde kullanılamamış. Değerlendirmede paylaşılan karşılaştırmalar şu başlıkları içeriyor: CPU için ONNX ve OpenVino, GPU için DirectML, ONNX ve OpenVino. Bu tablo aslında tek başına bir bulgu: yapay zeka iş yüklerini ölçmek isteyen biri, önce hangi çerçevenin hangi donanımda sorunsuz çalıştığını çözmek zorunda kalıyor.
Sürücü ve çerçeve parçalanmışlığı, gerçek dünya yapay zeka yığınlarının ne kadar heterojen olduğunu gösteriyor. Bir GPU'nun teorik performansı ile bir kullanıcı bilgisayarında elde edilebilen performans arasındaki farkın büyük bölümü buradan geliyor. Kıyaslama aracının kendisi de bu kaostan muaf değil; bu yüzden tek bir puan satırına bakıp karar vermek yerine testin nasıl koştuğunu okumak gerekiyor.
Sentetik puan ne kadar güvenilir ve bundan sonrası
Bu değişikliklerin hiçbiri Geekbench'in ne olduğunu değiştirmiyor: paket hâlâ sentetik bir kıyaslama ve belirli bir iş yükünde gerçek dünya performansının garantisi değil. Değişen şey, bu sentetik sayının gerçek kullanımı ne kadar dürüst biçimde yansıttığı. Bir dizi üretici teknik föyünü karşılaştırmak zorunda olan satın alma ekipleri için bu eşleşme, zaten bir kıyaslama çalıştırmanın tüm amacını oluşturuyor.
Değerlendirmenin vardığı sonuç, çok çekirdek düzeltmesinin CUDA desteğinden daha önemli olduğu yönünde. Sentetik kıyaslamalar yalnızca gerçek davranışı takip ettikleri sürece işe yarar ve önceki sürümün "her zaman tüm çekirdekler" yaklaşımı bu işlevi yıllar önce yitirmişti. Donanım tekliflerini karşılaştıran teknoloji yöneticileri için Geekbench 7 puanları yeniden güvenilir kabul edilebilir. Silikon ekipleri içinse GPU paketinin yapay zeka odağı, rekabet baskısının hangi yöne biriktiğine dair net bir sinyal veriyor. Buna karşılık makineler arasında tutarlılık sağlanamaması, paketin hâlâ çözmesi gereken bir sorun olarak duruyor.
Genel tabloda ortaya çıkan manzara şu: kıyaslama araçları, yapay zeka iş yüklerinin gündelik cihazlara hızlı göçünü yakalamaya çalışıyor. CUDA desteği ve Geekbench AI'nın CPU-GPU-NPU kırılımı, üretici iddialarını karşılaştırmak isteyenler için uzun süredir eksik olan ortak dili sağlıyor. Ancak tek bir sayıya bakıp karar vermek yerine, testin hangi senaryoyu modellediğini ve hangi çerçeveyle koştuğunu sorgulamak gerekiyor. Doğru okunduğunda Geekbench 7, donanım karşılaştırmalarında hem daha dürüst hem de daha kullanışlı bir zemin sunuyor.