Tecnología

Geekbench 7 ya está aquí: compatibilidad con CUDA, pruebas de IA y una medición multinúcleo renovada

Las herramientas de benchmark de hardware suelen actualizarse en silencio: el número de versión sube, se añaden un par de pruebas y el tema se cierra. Con Geekbench 7, sin embargo, las cosas han sido diferentes esta vez. Primate Labs no solo ha reconfigurado el paquete de pruebas con una nueva etiqueta de versión; lo ha reconstruido por completo junto con la lógica de la puntuación multinúcleo, el enfoque de las pruebas de GPU y la lista de API compatibles. Estos cambios crean, por primera vez, un punto de referencia más coherente para los equipos de hardware que intentan medir cargas de trabajo de inteligencia artificial y para los directivos tecnológicos que toman decisiones de compra. A continuación analizamos las novedades más destacadas del paquete, por qué son importantes y los problemas prácticos que han surgido en el lado de las pruebas.

Compatibilidad con CUDA: las GPU de Nvidia ya se miden con la API de la línea de producción

La novedad más comentada de Geekbench 7 es la incorporación de CUDA entre las API compatibles. Hasta ahora, el paquete utilizaba las API OpenCL, Vulkan y Metal en las pruebas de GPU; el lado de Nvidia no estaba en esa lista. Ahora una GPU de Nvidia puede medirse con la misma pila de API que ejecuta realmente cargas de trabajo pesadas de inteligencia artificial. Primate Labs afirma haber recibido peticiones de usuarios durante años, y este paso pretende reducir la diferencia entre las afirmaciones de rendimiento sobre el papel y el comportamiento real de las aplicaciones. Que una herramienta de benchmark siga el camino que el hardware medido utiliza en su flujo de trabajo cotidiano es un detalle crítico para la interpretabilidad de los resultados.

El valor de este soporte va mucho más allá de añadir un elemento a la lista. En la evaluación de la fuente, la compatibilidad con CUDA se califica como un hito en el benchmark multiplataforma: por primera vez, una sola herramienta puede medir una GPU de Nvidia con la pila de API que ejecuta cargas de trabajo de IA en entornos de producción. Los fabricantes independientes de software y los equipos de silicio pueden mirar una única referencia común en lugar de intentar estimar las cifras de marketing de distintos fabricantes con tres herramientas de benchmark diferentes. Aun así, la señal real no es CUDA en sí, sino el esfuerzo de las herramientas de benchmark por alcanzar la velocidad con la que las cargas de trabajo de IA se trasladan a los dispositivos cotidianos.

Geekbench 7 llega acompañado de una herramienta complementaria llamada Geekbench AI. Esta herramienta ejecuta 10 cargas de trabajo de inteligencia artificial a través de tres tipos de datos: Single Precision, Half Precision y Quantized. Los usuarios pueden probar por separado la CPU, la GPU o la NPU propia del dispositivo; sin importar el framework que admita el hardware (desde Core ML hasta QNN), los resultados pueden compararse entre Android, iOS, Windows, macOS y Linux a través de un único navegador. Que el lado de la NPU pueda medirse por separado es especialmente importante, porque las cifras que los fabricantes ofrecen bajo el título de “rendimiento de NPU” han permanecido hasta ahora como afirmaciones independientes entre sí y difíciles de verificar.

Geekbench 7 ya está aquí: compatibilidad con CUDA, pruebas de IA y medición multinúcleo renovada — imagen 2

Puntuación multinúcleo: la corrección menos llamativa pero más crítica

El cambio más técnico del paquete, y también el que más diferencia marcará, está en la prueba multinúcleo. Las versiones anteriores forzaban cada carga de trabajo al modo multihilo sin importar cómo se comportara la aplicación real. Ese enfoque distorsionaba las puntuaciones y no daba al usuario información significativa, porque ninguna aplicación real utiliza todos los núcleos de forma constante y uniforme. Geekbench 7 invierte esta lógica: una carga de trabajo se ejecuta en modo multihilo solo si la tarea que modela realmente se ejecuta así en el mundo real.

El resultado más visible de esta regla es la eliminación completa de la prueba HTML5 Browser del paquete multinúcleo. La razón es bastante clara: en la práctica, los navegadores funcionan con un solo hilo o con hilos ligeros, por lo que mantener esta prueba dentro de la puntuación multinúcleo aportaba una contribución engañosa. El panorama resultante es una puntuación que refleja lo que un dispositivo hace en cargas de trabajo reales; no el valor máximo que una prueba sintética podría extraer teóricamente de todos los núcleos disponibles.

Para los equipos que toman decisiones de compra de hardware, esta corrección significa que las cifras vuelven a ser fiables. Al comparar dos portátiles, era un error común decidir con una ecuación burda como “más núcleos, mayor puntuación”. La nueva metodología hace visible en la puntuación por qué un dispositivo con muchos núcleos pero bajo rendimiento mononúcleo se queda lento en tareas cotidianas. En resumen, la prueba empieza a medir el comportamiento del hardware sobre la mesa, no el de su folleto publicitario.

Geekbench 7 ya está aquí: compatibilidad con CUDA, pruebas de IA y medición multinúcleo renovada — imagen 3

Las pruebas de CPU se desplazan a las cargas de trabajo reales del uso cotidiano

Las nuevas cargas de trabajo multimedia se centran en aquello para lo que un usuario común más utiliza su computadora a lo largo del día. Geekbench 7 modela el escenario de compartir pantalla en videoconferencias codificando vídeos de pantalla compartida con el códec AV1. Imita aplicaciones de notas de voz y podcast comprimiendo audio musical y de voz con el códec Opus. Además de decodificar audio y vídeo, genera subtítulos en vivo mediante el modelo de reconocimiento de voz Whisper de OpenAI, lo que representa la reproducción de vídeo con subtítulos automáticos. También se ha añadido al paquete una nueva carga de trabajo Game Physics que se ejecuta sobre el motor Jolt Physics utilizado en juegos modernos.

El apartado fotográfico tampoco se ha descuidado. La carga de trabajo Photo Editor ha ganado un conjunto de ediciones del mundo real más rico; Photo Library ahora importa y procesa formatos JPEG XL y DNG. Estas elecciones no son casuales: lo que un usuario que edita fotos, graba audio y entra en reuniones constantemente desde su teléfono u ordenador espera de la CPU se compone, a grandes rasgos, de esta lista.

  • Codificación de vídeo de pantalla compartida con AV1 (escenario de videoconferencia)
  • Compresión de audio musical y de voz con Opus (aplicaciones de notas de voz y podcast)
  • Decodificación de audio/vídeo y generación de subtítulos en vivo con Whisper
  • Carga de trabajo Game Physics ejecutada sobre el motor Jolt Physics
  • Ediciones ampliadas del mundo real en Photo Editor
  • Importación y procesamiento de JPEG XL y DNG en Photo Library
Geekbench 7 ya está aquí: compatibilidad con CUDA, pruebas de IA y medición multinúcleo renovada — imagen 4

El lado de la GPU se centró en la inteligencia artificial y la creación de contenido

El enfoque de las pruebas de GPU ha ido desplazándose hacia dos áreas que definen cada vez más el uso real de las GPU: el aprendizaje automático y la creación de contenido. Las nuevas pruebas de ML modelan aplicaciones de redes sociales siguiendo rostros y aplicando filtros en tiempo real. La prueba de aumento de imagen mediante aprendizaje automático representa las funciones de superresolución de las herramientas de creación de contenido. La prueba de desenfoque de fondo de vídeo mide los fondos virtuales de las videoconferencias. Estos tres escenarios constituyen una parte importante del trabajo que se ha cargado sobre la GPU en los últimos años.

Junto a ellas se han añadido el procesamiento de imágenes RAW, la gradación de color basada en LUT, el path tracing y la simulación de fluidos. El path tracing y la simulación de fluidos son cargas de trabajo que se utilizan especialmente en la producción visual profesional y el desarrollo de videojuegos, y que exigen seriamente a la GPU. La gradación de color basada en LUT es, además, una parte estándar de los procesos de edición de vídeo. El conjunto de la lista muestra que la GPU ya no es solo una unidad que produce fotogramas por segundo en juegos, sino que ocupa el centro de la cadena de producción.

  • Seguimiento facial y filtros en tiempo real (aplicaciones de redes sociales)
  • Aumento de imagen mediante aprendizaje automático (superresolución en creación de contenido)
  • Desenfoque de fondo de vídeo (fondos virtuales)
  • Procesamiento de imágenes RAW y gradación de color basada en LUT
  • Path tracing y simulación de fluidos

Los conjuntos de datos crecieron y la compatibilidad de plataformas se amplió

Los conjuntos de datos también se han ampliado en todos los ámbitos para adaptarse a cómo se utilizan los dispositivos hoy en día. La prueba File Compression ahora abarca una mezcla más amplia de archivos de código fuente, código objeto y documentos de texto. La prueba PDF Viewer procesa un abanico que va desde mapas de aparcamiento hasta documentación técnica y artículos académicos. Las cargas de trabajo de desarrollo y procesamiento de imágenes también se han ampliado con nuevos recursos y formatos adicionales. El objetivo común de estos cambios es reflejar la diversidad que encontrará el dispositivo en lugar de generar una puntuación basada en un único escenario estrecho.

Geekbench 7 funciona en Android, iOS, Windows, macOS y Linux, sigue siendo gratuito para uso personal y añade un nivel Pro con un 20 % de descuento hasta el 6 de agosto. La evaluación de la versión fue publicada por Jon Peddie Research; los datos de la editorial y la información de su sección “About us” (Sobre nosotros) indican que la organización se encuentra en Tiburon, California. Es decir, detrás del paquete hay tanto una amplia compatibilidad de plataformas como una tradición de evaluación independiente.

Pruebas en cuatro sistemas distintos: el problema de la consistencia

En la evaluación, el benchmark se ejecutó en máquinas muy diferentes: Asus System, Alienware Area 51, Lenovo 83JM y Corsair One i200. Algunos de los resultados son menos ordenados de lo esperado. No se pudieron obtener pruebas de GPU que funcionaran de forma consistente en los cuatro sistemas; en cambio, las pruebas de CPU dieron resultados consistentes. Es decir, aunque las métricas nuevas del propio paquete funcionan de forma sólida, las combinaciones de framework y controladores en el lado de la GPU complican las cosas.

Las pruebas de GPU basadas en ONNX y DirectML consumieron toda la RAM que podía utilizar la unidad gráfica integrada del Lenovo, y la prueba nunca llegó a completarse. La prueba GPU OpenVino funcionó en el Lenovo, pero no pudo utilizarse en las otras máquinas debido a un problema de controladores. Las comparaciones compartidas en la evaluación incluyen los siguientes apartados: ONNX y OpenVino para CPU; DirectML, ONNX y OpenVino para GPU. Este cuadro constituye en sí mismo un hallazgo: quien quiera medir cargas de trabajo de inteligencia artificial tiene que resolver primero qué framework funciona sin problemas en qué hardware.

La fragmentación de controladores y frameworks muestra hasta qué punto son heterogéneas las pilas de inteligencia artificial del mundo real. De ahí procede gran parte de la diferencia entre el rendimiento teórico de una GPU y el rendimiento que puede obtenerse en el ordenador de un usuario. La propia herramienta de benchmark no está exenta de este caos; por eso, en lugar de decidir mirando una sola línea de puntuación, hay que leer cómo se ejecutó la prueba.

¿Cuán fiable es la puntuación sintética y qué viene después?

Ninguno de estos cambios altera lo que es Geekbench: el paquete sigue siendo un benchmark sintético y no una garantía de rendimiento en el mundo real para una carga de trabajo concreta. Lo que cambia es hasta qué punto esta cifra sintética refleja con honestidad el uso real. Para los equipos de compras que tienen que comparar una serie de fichas técnicas de fabricantes, esta correspondencia constituye, de hecho, todo el propósito de ejecutar un benchmark.

La conclusión a la que llega la evaluación es que la corrección multinúcleo es más importante que la compatibilidad con CUDA. Los benchmarks sintéticos solo sirven mientras siguen el comportamiento real, y el enfoque de “siempre todos los núcleos” de la versión anterior había perdido esa función hace años. Para los directivos tecnológicos que comparan ofertas de hardware, las puntuaciones de Geekbench 7 pueden volver a considerarse fiables. Para los equipos de silicio, el enfoque en IA del paquete de GPU da una señal clara de hacia dónde se acumula la presión competitiva. En cambio, la falta de consistencia entre máquinas sigue siendo un problema que el paquete aún debe resolver.

El panorama general que surge es el siguiente: las herramientas de benchmark intentan alcanzar la rápida migración de las cargas de trabajo de inteligencia artificial a los dispositivos cotidianos. La compatibilidad con CUDA y el desglose CPU-GPU-NPU de Geekbench AI proporcionan el lenguaje común que faltaba desde hacía tiempo a quienes quieren comparar las afirmaciones de los fabricantes. Sin embargo, en lugar de decidir mirando un solo número, hay que cuestionar qué escenario modela la prueba y con qué framework se ejecuta. Bien interpretado, Geekbench 7 ofrece una base tanto más honesta como más útil para comparar hardware.

NE
Editör
The Nedese editorial team covers competitive gaming guides, patch notes, and strategy breakdowns across all major titles. With over 15 years of coverage, our writers combine deep game knowledge with practical in-match experience.
Comentarios de Lectores
Discusión
0 comentarios
Aún no hay comentarios. Sé el primero en compartir tu opinión.
Escribir un Comentario
¿Te resultó útil este artículo? Comparte tu opinión con otros lectores.
Sigue Leyendo
Comunidad
¿Quieres mostrar tu propio servidor?
Añade tu servidor gestionado por la comunidad a nuestro directorio y llega a más jugadores. Únete a nuestro Discord para conectar con la comunidad, o envía tu servidor ahora.
Enviar tu Servidor