Hugging Face

Hugging Face es la respuesta por defecto a “¿dónde obtengo un modelo abierto?” y el objetivo predeterminado cuando alguien quiere quejarse sobre la economía de los centros de modelos. El reciente rumor de Nvidia (12,9 mil millones de USD para una adquisición o asociación profunda) devolvió la atención a la misma pregunta: ¿qué sucede con el ecosistema de modelos abiertos si el centro más grande cambia de manos? ¿Y qué deberías usar realmente para servir, ajustar o ejecutar modelos en tu propio hardware hoy?

Reunimos siete alternativas a Hugging Face que cubren las partes de la plataforma en las que la gente confía: inferencia local, inferencia alojada, alojamiento de modelos con versionado tipo Git e implementación completa.

Comparación rápida

Herramienta Mejor para Licencia Desplegar Característica destacada
Ollama Inferencia local, un comando MIT Binario nativo 400+ modelos curados
LM Studio Inferencia local basada en GUI Freemium Aplicación nativa Navegador de modelos + UI de chat
vLLM Servir a escala Apache 2.0 Docker, pip Batching continuo, API OpenAI
Replicate Alojado, pago por segundo Proprietary API 50.000+ modelos de ML
Together AI Compatible con OpenAI para modelos abiertos Proprietary API Ajuste + servicio en la misma plataforma
Open WebUI Interfaz de chat para modelos locales MIT Docker Forma ChatGPT sobre Ollama u OpenAI-compatible
KohakuHub Hugging Face auto-alojado AGPL Docker Git-LFS + compatibilidad con cliente huggingface_hub

Por qué la gente busca alternativas a Hugging Face

La plataforma sigue siendo la líder, pero las críticas son más fuertes que antes.

Las alternativas

Ollama

Ollama es la herramienta de inferencia local a la que la mayoría de la gente recurre por defecto. Un binario, un comando (ollama run llama3.2), y tienes una API REST y CLI en el puerto 11434 sirviendo modelos cuantizados en Metal, CUDA o CPU. La biblioteca de modelos se selecciona (aproximadamente 400 modelos a partir de 2026) en lugar de ser exhaustiva, pero la selección es la característica: todo en Ollama se ejecuta en hardware de consumo sin configuración.

Donde se queda corta: El multi-usuario es débil. Sin UI de chat integrada (empareja con Open WebUI). Los parámetros de muestreo avanzados requieren configuración, no CLI.

Precios: Gratis, MIT. Ollama Cloud (inferencia administrada) está en vista previa con precios escalonados.

Migración desde Hugging Face: La mayoría de los modelos GGUF en Hugging Face se pueden extraer a Ollama con un Modelfile. La biblioteca propia de Ollama ya cubre las familias populares (Llama, Mistral, Gemma, Qwen, DeepSeek).

Descargar: ollama.com | GitHub

Conclusión: La respuesta por defecto a “¿cómo ejecuto un modelo en mi portátil ahora mismo?”.

LM Studio

LM Studio es la contraparte basada en GUI de Ollama. Aplicación nativa para Windows, macOS y Linux. Examina el catálogo de modelos de Hugging Face dentro de la aplicación, descarga versiones cuantizadas y chatea en una UI integrada. La actualización de 2025 agregó un servidor local compatible con OpenAI y un SDK.

Donde se queda corta: Gratis para uso personal, no es de código abierto. El uso comercial requiere una licencia.

Precios: Gratis para uso personal. La licencia comercial está disponible, con precios por licencia.

Migración desde Hugging Face: LM Studio extrae directamente de Hugging Face dentro de la aplicación. Cualquier GGUF que ya hayas descargado funciona.

Descargar: lmstudio.ai

Conclusión: La opción para personas que quieren una ventana de chat antes que una CLI.

vLLM

vLLM es el servidor de inferencia de producción en el que convergen la mayoría de los stack LLM auto-alojados. Batching continuo, PagedAttention, GPU paralelos de tensor, y una API compatible con OpenAI. Carga modelos directamente desde Hugging Face Hub o un directorio local, por lo que se integra en un flujo de trabajo HF existente sin romperlo.

Donde se queda corta: Solo GPU para rendimiento práctico. Sin UI integrada ni gestión de modelos, traes el tuyo.

Precios: Gratis, Apache 2.0.

Migración desde Hugging Face: vLLM es el reemplazo recomendado para HF Dedicated Endpoints. Apunta a tu directorio de modelos, presiona /v1/chat/completions, y tienes un servidor compatible con OpenAI listo para usar.

Descargar: docs.vllm.ai | GitHub

Conclusión: El que ejecutas cuando creces fuera de Ollama y no puedes pagar el precio de los endpoints de HF.

Replicate

Replicate es la plataforma alojada “una API para 50.000 modelos de código abierto”. Facturación de GPU por segundo, sin costo de inactividad, y un SDK de Python que oculta Docker y CUDA. Los autores de modelos publican imágenes “Cog” que Replicate ejecuta bajo demanda. Es una verdadera alternativa a HF Inference Endpoints para equipos que quieren un único proveedor.

Donde se queda corta: Inicios en frío en modelos poco utilizados. Bloqueo de proveedor en el runtime de Cog.

Precios: Paga por segundo de tiempo GPU. A100 40GB es aproximadamente 0,001 USD/segundo. Créditos gratis para cuentas nuevas.

Migración desde Hugging Face: La mayoría de los modelos populares ya están en Replicate. Los modelos personalizados se publican a través de un cog.yaml similar a Dockerfile. Replicate aloja los pesos, por lo que no mantienes el almacenamiento de HF por separado.

Descargar: replicate.com

Conclusión: La opción si quieres una API alojada para muchos modelos sin ejecutar tus propias GPU.

Together AI

Together AI ofrece endpoints compatibles con OpenAI para modelos de peso abierto (Llama 3.3, Mixtral 8x7B, Qwen 2.5, DeepSeek V3), además de endpoints dedicados, ajuste fino e inferencia por lotes en la misma plataforma. La latencia es típicamente mejor que Replicate para cargas de trabajo de chat porque el stack de inferencia se ajusta específicamente para LLMs.

Donde se queda corta: El catálogo de modelos se enfoca en LLM, no en el rango “cualquier modelo de ML” que cubre Replicate. Los modelos de Vision y audio son más delgados.

Precios: Por token para inferencia compartida (aproximadamente 0,20 USD/M tokens de entrada para Llama 3.3 70B). Endpoints dedicados con precios por hora.

Migración desde Hugging Face: La API de Together es compatible con OpenAI. Si ya apuntas un cliente a HF Inference Endpoints, el cambio de URL base es una sola línea.

Descargar: together.ai

Conclusión: La mejor opción compatible con OpenAI para LLMs de peso abierto específicamente.

Open WebUI

Open WebUI es el frontend en forma de ChatGPT para modelos locales o compatibles con OpenAI. Se ejecuta en Docker, apunta a Ollama o vLLM (o la API real de OpenAI), y te proporciona autenticación multiusuario, acceso al modelo por usuario, RAG sobre documentos cargados y llamadas de función. No es un reemplazo de Hugging Face en sí, pero la pieza que falta para un stack auto-alojado que reemplaza toda la UX de HF.

Donde se queda corta: La gestión de modelos se delega a Ollama o tu servidor de inferencia. La configuración de autenticación es manual para el primer administrador.

Precios: Gratis, MIT.

Migración desde Hugging Face: Open WebUI se empareja con Ollama para reemplazar completamente HuggingChat para uso interno.

Descargar: openwebui.com | GitHub

Conclusión: La capa UI auto-alojada que une Ollama o vLLM en algo que las personas de tu organización realmente usarán.

KohakuHub

KohakuHub es el “Hugging Face auto-alojado” que llena exactamente el hueco que el propio Hugging Face no llena. Backend Git-LFS, compatibilidad con cliente Python huggingface_hub, versionado de modelos y datasets, e interfaz web. Si necesitas alojar tu propio registro de modelos privado con la misma biblioteca de cliente que tu equipo de ML ya usa, este es el adecuado.

Donde se queda corta: Proyecto más reciente (2024). La comunidad en torno a herramientas de inferencia es más pequeña que la de HF.

Precios: Gratis, AGPL.

Migración desde Hugging Face: Apunta HF_ENDPOINT a tu instancia de KohakuHub y el cliente huggingface_hub estándar sube, descarga y crea versiones de modelos contra él. Los scripts existentes no cambian.

Descargar: GitHub

Conclusión: La respuesta auto-alojada si quieres mantener la biblioteca de cliente de HF y cambiar el backend.

Cómo elegir

FAQ

¿Para qué sirve Hugging Face? Alojamiento de modelos, alojamiento de datos, inferencia alojada (Endpoints), aplicaciones de demostración (Spaces) y la biblioteca Python transformers sobre la que se construye la mayoría de las herramientas de ML abiertas.

¿Está Hugging Face siendo adquirido por Nvidia? A partir de agosto de 2026, la cifra reportada es 12,9 mil millones de USD, sin que ninguna empresa confirme públicamente los detalles. Trátalo como un rumor hasta que uno de los lados confirme.

¿Puedo auto-alojar un centro de modelos compatible con Hugging Face? Sí. KohakuHub habla el protocolo huggingface_hub y funciona como backend listo para usar para alojamiento privado. Hugging Face también ofrece Enterprise Hub para organizaciones que desean implementación local.

¿Cuál es la alternativa más cercana a Hugging Face Inference Endpoints? vLLM si lo auto-alojas, Together AI o Replicate si quieres una API administrada. Los tres superan a Endpoints en costo por token para la mayoría de cargas de trabajo.

¿Necesito Hugging Face para usar Llama, Mistral o Qwen? No. Ollama, LM Studio y la mayoría de servidores de inferencia pueden extraer modelos de espejos o directamente del sitio del autor del modelo. Hugging Face es el índice más grande, no la única fuente.

¿Qué se ejecuta más rápido en un portátil, Ollama o LM Studio? Aproximadamente lo mismo con modelos idénticos. Ambos usan llama.cpp o MLX bajo el capó. La UI de LM Studio agrega una pequeña sobrecarga; el CLI de Ollama se siente más rápido.