El informe de XDA de que una GPU de gama media puede subsidiar una pila de suscripciones de IA pagadas es acertado. Una RTX 4070 Ti o una Radeon RX 7900 XT ejecuta modelos de 13B y 34B parámetros a una velocidad que supera lo que la mayoría de los servicios en la nube cobran por un nivel de suscripción único. Pero elegir qué modelo, cuantización y tiempo de ejecución usar en el hardware que ya posees requiere números reales, no conjeturas.
Las siete aplicaciones a continuación cubren dos tipos de benchmarking. Las primeras tres son benchmarks integrados en tiempo de ejecución que informan tokens por segundo y tiempo hasta el primer token para cargas de trabajo reales. El resto son suites de benchmark de terceros que proporcionan puntuaciones reproducibles para comparar hardware. Cada opción se ejecuta en Windows y Linux; dos también funcionan en macOS con Apple Silicon.
Qué buscar en un benchmark de GPU AI
No todos los benchmarks de IA te dicen lo que necesitas saber. Verifica estas cinco cosas:
- Informes de tokens por segundo en varias longitudes de contexto (128, 2048, 8192)
- Mide el procesamiento de prompts (prefill) y generación por separado
- Admite la cuantización que realmente planeas usar (Q4_K_M, Q8, FP16)
- Lee la utilización de VRAM y RAM del sistema durante la ejecución
- Publica resultados en un formato compartible para que los números sean comparables entre configuraciones
Cualquier cosa que solo informe un número de rendimiento único en un contexto no es útil para el dimensionamiento real de hardware.
Comparación rápida
| Aplicación | Mejor para | Plan gratis | Precio inicial | Característica destacada |
|---|---|---|---|---|
| llama-bench | Rendimiento LLM reproducible | Sí | Gratis | Se incluye con llama.cpp |
| LM Studio | Benchmarks GUI + compra de modelos | Sí | Gratis | Catálogo de modelos integrado |
| Ollama benchmark | Prueba de estrés LLM de un comando | Sí | Gratis | Se ejecuta con cualquier modelo descargado |
| UL Procyon AI | Benchmark de proveedor estándar de la industria | Prueba | Licencia de pago | Rutas ONNX + DirectML |
| Geekbench AI | Puntuación de IA multiplataforma | Sí | Nivel gratis | iOS, Android, Windows, macOS |
| MLPerf Client | Benchmark de referencia de MLCommons | Sí | Gratis | Análisis profundo del hardware |
| koboldcpp benchmark | Simulación de carga de trabajo de roleplay/chat | Sí | Gratis | Simula sesiones de chat de manera realista |
Las aplicaciones
1. llama-bench – Mejor rendimiento LLM reproducible
llama-bench se incluye como parte de llama.cpp y es lo más cercano que tiene el mundo de los LLM locales a una vara estándar. Apúntalo a un archivo GGUF, dile un tamaño de contexto y tamaño de lote, e informará tokens de prompt por segundo, tokens de generación por segundo y tiempo hasta el primer token. Se ejecuta en cualquier backend CUDA, ROCm, Metal o CPU, por lo que una herramienta proporciona números comparables en tu rig Nvidia, compilación Radeon y MacBook.
Dónde falla: Solo línea de comandos. Sin GUI. Algunas opciones (BLAS, tamaño de lote) requieren leer la documentación.
Precios:
- Gratis: Código abierto bajo MIT.
- Pago: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: llama.cpp en GitHub
Conclusión: El benchmark predeterminado al comparar cuantizaciones o modelos. Aprende sus banderas una vez.
2. LM Studio – Mejor benchmark GUI con compra de modelos
LM Studio es una aplicación de escritorio que envuelve llama.cpp con una interfaz gráfica para descargar, ejecutar y ahora hacer benchmarks de modelos. La pestaña de benchmark integrada prueba cualquier modelo descargado en una carga de trabajo preestablecida e informa métricas de una manera que los no expertos puedan leer. También muestra el espacio de VRAM restante, lo que ayuda a cambiar el tamaño del siguiente modelo.
Dónde falla: Código fuente cerrado. El catálogo de modelos se superpone con HuggingFace y no es exhaustivo.
Precios:
- Gratis: Aplicación completa.
- Pago: Ninguno.
Plataformas: Windows, macOS (Apple Silicon), Linux.
Descargar: LM Studio
Conclusión: La forma más amigable de hacer benchmark de un modelo nuevo sin tocar una terminal.
3. Ollama benchmark – Mejor prueba de estrés LLM de un comando
Ollama se incluye con un flag run --verbose que produce tiempos por token. Combinado con scripts mantenidos por la comunidad, funciona como herramienta de benchmark. Debido a que Ollama extrae modelos por nombre, ejecutar el mismo benchmark en una segunda máquina lleva dos comandos.
Dónde falla: No es una suite de benchmark completa. Enfocado en velocidad de finalización; menos útil para cargas de trabajo con muchos prompts.
Precios:
- Gratis: Código abierto bajo MIT.
- Pago: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: Ollama
Conclusión: Instala Ollama para uso diario de modelos; usa --verbose cuando quieras una lectura de rendimiento rápida.
4. UL Procyon AI – Mejor benchmark de proveedor estándar de la industria
UL Procyon AI Computer Vision Benchmark es la misma UL que publica 3DMark y PCMark. Ejecuta modelos ONNX estándar (MobileNet, ResNet, Inception) en backends TensorRT, DirectML, OpenVINO y CoreML y produce una puntuación. Los proveedores citan números de Procyon en reseñas, por lo que la puntuación es directamente comparable en toda la industria.
Dónde falla: Enfocado en cargas de trabajo de visión; menos útil para rendimiento de LLM. Licencia de pago para uso comercial.
Precios:
- Gratis: La puntuación de prueba revela números base.
- Pago: La licencia desbloquea la ejecución completa.
Plataformas: Windows.
Descargar: UL Procyon AI
Conclusión: Compra esto si tomas decisiones de compra usando benchmarks de proveedores. Omitir si solo te importa la velocidad de LLM.
5. Geekbench AI – Mejor puntuación de IA multiplataforma
Geekbench AI produce tres números por ejecución: FP32, FP16 e INT8 cuantizado. Se ejecuta en Windows, macOS, Linux, iOS y Android, por lo que una comparación de portátil versus teléfono para la misma carga de trabajo está a un benchmark de distancia. La base de datos de resultados públicos te permite comparar tu ejecución con miles de otras.
Dónde falla: No específico de LLM. Los tres puntajes colapsan mucho matiz.
Precios:
- Gratis: Ejecución de vista previa.
- Pago: La licencia completa desbloquea ejecuciones por lotes y exportación de historial.
Plataformas: Windows, macOS, Linux, iOS, Android.
Descargar: Geekbench AI
Conclusión: El número de referencia para “qué tan bien se compara mi hardware con capacidad de IA”.
6. MLPerf Client – Mejor benchmark de referencia de MLCommons
MLPerf Client es el benchmark de referencia respaldado por MLCommons para IA en hardware de cliente. Ejecuta una carga de trabajo LLM preestablecida (actualmente Llama 2 7B, pasando a modelos más nuevos) e informa latencia, rendimiento y regresión de calidad contra una implementación de referencia. Debido a que MLCommons publica resultados de manera transparente, comparar configuraciones es sencillo.
Dónde falla: La configuración es más complicada que las alternativas. No está dirigido a usuarios finales.
Precios:
- Gratis: Código abierto.
- Pago: Ninguno.
Plataformas: Windows, Linux (nativo), macOS (compilaciones comunitarias).
Descargar: MLPerf Client en GitHub
Conclusión: El benchmark autoritario. Vale la pena el costo de configuración si planeas publicar una comparación de hardware.
7. koboldcpp benchmark – Mejor simulación de carga de trabajo de roleplay y chat
koboldcpp es un fork de llama.cpp enfocado en roleplay y chat de contexto largo. Su modo benchmark simula una sesión de chat real con contexto continuo, que es una prueba más honesta de cómo se sentirá un servidor LLM doméstico día a día. Los números incluyen el costo de intercambio de contexto y el comportamiento de desbordamiento de RAM del sistema, que llama-bench omite.
Dónde falla: Enfocado en cargas de trabajo de chat/RP; pierde métricas enfocadas en código. La interfaz se ve ocupada a primera vista.
Precios:
- Gratis: Código abierto.
- Pago: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: koboldcpp en GitHub
Conclusión: El benchmark más representativo para cualquiera cuyo caso de uso real sea chat, no completación de código.
Cómo elegir el correcto
Comienza con llama-bench para números reproducibles en cuantizaciones. Agrega la pestaña de benchmark integrada de LM Studio si prefieres GUI. Usa el flag verbose de Ollama para una verificación de cordura rápida en una máquina donde ya ejecutas modelos. Agrega Geekbench AI cuando necesites una puntuación portátil única. Guarda UL Procyon o MLPerf Client para comparaciones de hardware formales donde la legitimidad de terceros importa. Usa el benchmark de koboldcpp cuando tu carga de trabajo diaria sea chat en lugar de completación de código.
Omite hojas de especificaciones “AI TOPS” de proveedores como sustituto; los números son pico-teóricos y rara vez reflejan el rendimiento de inferencia real en las cuantizaciones que usas.
Preguntas frecuentes
¿Qué GPU ofrece la mejor velocidad de LLM local hoy? Para tarjetas de consumidor, RTX 4090, 4080 Super y 5080 lideran en Nvidia; RX 7900 XTX lidera en AMD. Apple M3 Max y M4 Max cierran la brecha para modelos que caben en memoria unificada.
¿Cuántos tokens por segundo realmente necesito? El chat en tiempo real se ve bien por encima de 20 t/s en la salida del modelo. Cualquier cosa por encima de 40 t/s es indistinguible de una API SaaS rápida.
¿Ayuda más VRAM o gana la computación? Para LLM, VRAM es la restricción más difícil. Ajustar el modelo completo en VRAM sin desbordarse en RAM del sistema es más importante que la computación pura por encima de un umbral.
¿Es un benchmark en Windows comparable con uno en Linux? Para pruebas basadas en CUDA, en su mayoría sí. Las diferencias de controlador agregan algunos puntos porcentuales de varianza. Para DirectML vs ROCm la diferencia es mucho mayor y los números de Linux suelen ser más altos.
¿Cuál es la opción de benchmark más económica? llama-bench y Ollama cuestan nada. Ambos se ejecutan en cualquier GPU de consumidor.
¿Me ayuda esto a elegir entre LM Studio y Ollama? Sí. Haz un benchmark del mismo modelo en ambos y compara tokens por segundo y velocidad de procesamiento de prompts. Ollama tiende a ganar en velocidad de intercambio de modelos; la GUI de LM Studio ayuda con experimentos.