Familia de modelos de pesos abiertos Google Gemma

La familia Gemma de Google es un buen punto medio para portátiles. Un checkpoint 4B cabe cómodamente en 8GB de VRAM, la licencia es lo suficientemente permisiva para herramientas internas, y Ollama descarga los pesos en un comando. Tampoco es el único modelo pequeño y de código abierto que funciona bien en un desktop modesto. Desde que llegó Gemma 3, hemos probado otras seis familias en el mismo portátil de 16GB y un desktop de 24GB, y varias de ellas superan a Gemma en tareas que nos importan. A continuación se presentan las alternativas a Gemma que dejamos instaladas.

Comparación rápida

Familia de modelos Mejor para Plan gratuito Licencia Característica destacada
Llama 3 (Meta) Chat general, uso de herramientas Sí, pesos en Hugging Face Licencia comunitaria Meta Soporte de herramientas y cuantificación más amplio
Qwen 3 (Alibaba) Razonamiento multilingüe Apache 2.0 Modo de pensamiento integrado que puedes activar
Phi-4 (Microsoft) Portátiles de 8GB MIT Mejor razonamiento de modelo pequeño por gigabyte
Mistral 7B / Nemo Código y chat rápido Apache 2.0 Llamadas de función incluidas de serie
DeepSeek V3 / R1 distills Matemáticas, código, cadenas de pensamiento MIT (distills) Etiquetas <think> explícitas
IBM Granite 3.3 Borradores seguros para empresas Apache 2.0 Fuerte en extracción estructurada
SmolLM 3 Raspberry Pi y portátiles antiguos Apache 2.0 Modelo 3B que funciona por debajo de 4GB de RAM

Por qué la gente busca alternativas a Gemma

Gemma 3 es capaz, pero algunas brechas reales nos empujan hacia otras familias de modelos:

Las alternativas

Llama 3 (Meta) - Mejor para el ecosistema más amplio

Llama 3 es el modelo local predeterminado para la mayoría de las personas que alojan su propio IA, y la razón es aburrida: cada runner lo soporta, cada formato de cuantificación lo dirige primero, y cada comunidad fine-tune escribe para él. El modelo 8B funciona en el mismo portátil de 16GB en el que cabe Gemma 4B, con un poco más de espacio de RAM, y el modelo 70B se escala hasta GPUs de estación de trabajo.

Donde se queda corto: la licencia comunitaria Meta tiene restricciones de uso que Apache 2.0 no tiene. La calidad multilingüe está por detrás de Qwen 3.

Precios:

Migración desde Gemma: ollama pull llama3.1:8b e intercambia el nombre del modelo en tu configuración de Open WebUI o LM Studio. Los prompts se portan limpiamente. Las plantillas de chat difieren, así que vuelve a ejecutar cualquier prompt del sistema una vez.

Descarga: ollama.com/library/llama3.1

Resumen: elige Llama 3 cuando la amplitud de herramientas es más importante que los benchmarks puros. Sáltalo si necesitas Apache 2.0.

Qwen 3 (Alibaba) - Mejor como estándar versátil

Qwen 3 se ha convertido en la recomendación de uso general más segura para uso local. La familia cubre checkpoints densos de 0.6B a 32B, más una variante MoE de 30B y 235B, así que puedes elegir por VRAM e intercambiar entre checkpoints sin cambiar tu estilo de prompt. La calidad del razonamiento en matemáticas y código supera a Gemma con el mismo número de parámetros, y hay un modo de pensamiento adecuado que puedes habilitar en tiempo de inferencia.

Donde se queda corto: las cláusulas de licencia de Alibaba sobre umbrales de recuento de usuarios descontentan a algunas empresas. Las variantes MoE requieren un runner que soporte mixture-of-experts, que no todas las aplicaciones de escritorio manejan bien.

Precios:

Migración desde Gemma: flujo idéntico de Ollama. Si usas las heurísticas de prompt del sistema incorporadas de Gemma, Qwen acepta las mismas instrucciones. Activa el modo de pensamiento con /set think en la CLI.

Descarga: ollama.com/library/qwen3

Resumen: el modelo que sugerimos a cualquiera que pregunte “qué debo ejecutar localmente” sin más contexto.

Phi-4 (Microsoft) - Mejor para hardware débil

Phi-4 y su hermano Phi-4-mini apuntan a máquinas pequeñas. El modelo 14B punca por encima de su peso en benchmarks de razonamiento, y Phi-4-mini con 3.8B funciona en 8GB de RAM sin GPU. Microsoft lo licencia todo bajo MIT, así que encaja en proyectos comerciales sin papeleo.

Donde se queda corto: el chat general se siente más seco que Llama o Qwen, y la escritura creativa es débil. No es el modelo para usar en copias de marketing o narración de historias.

Precios:

Migración desde Gemma: intercambio directo. La ventana de contexto de Phi-4-mini es más pequeña (128k en el modelo completo, 32k en mini), así que audita primero los prompts de documentos largos.

Descarga: ollama.com/library/phi4

Resumen: elige Phi-4-mini para portátiles antiguos y Phi-4 cuando la calidad del razonamiento es más importante que la personalidad.

Mistral 7B y Mistral Nemo - Mejor para código y llamadas de función

Mistral 7B se mantiene agudo, y el modelo Nemo 12B más reciente que Mistral construyó con NVIDIA es la familia a la que recurrimos cuando queremos finalización de código rápida y llamadas de función confiables. El uso de herramientas de Nemo funcionó al primer intento en cada runner de desktop que probamos. Apache 2.0, sin condiciones.

Donde se queda corto: los modelos base son menos conversadores que Llama 3, y los resultados pueden parecer concisos. Los modelos Mistral más grandes y nuevos están protegidos detrás de su API comercial.

Precios:

Migración desde Gemma: descarga de Ollama, ajusta la plantilla de chat al formato [INST] de Mistral. Si usas Gemma para agentes de llamada de herramientas, Nemo se sentirá como una actualización la primera vez que lo ejecutes.

Descarga: mistral.ai

Resumen: la alternativa cuando el soporte de herramientas de Gemma te ha defraudado.

DeepSeek V3 y R1 distills - Mejor para razonamiento

DeepSeek ofrece dos familias que vale la pena conocer: V3, un modelo MoE fuerte de propósito general, y los distills R1 que fine-tune bases Llama y Qwen en máquinas de pensamiento. Los distills R1 exponen su cadena de pensamiento dentro de etiquetas <think>, que es lo que el escritor de XDA quería decir con “un LLM local que realmente piensa antes de responder”. En problemas matemáticos de palabras y cambios de código de múltiples pasos, los distills R1 a menudo superan a Gemma 3 27B mientras se ejecutan en menos VRAM.

Donde se queda corto: el modo de pensamiento consume tokens, lo que ralentiza la latencia del primer token y consume contexto. El modelo MoE V3 es pesado para la mayoría de los desktops.

Precios:

Migración desde Gemma: extrae deepseek-r1:14b y solicita exactamente como lo harías con Gemma. Filtra las etiquetas <think> de tu interfaz si los usuarios finales no deberían verlas.

Descarga: ollama.com/library/deepseek-r1

Resumen: la opción orientada al razonamiento.

IBM Granite 3.3 - Mejor para extracción estructurada

IBM Granite es silencioso, poco impresionante, y muy bueno en el trabajo corporativo que la mayoría de los LLM locales realmente se usan para: extraer campos de documentos, redactar correos electrónicos, clasificar tickets. Licencia Apache 2.0, herramientas Watsonx en el lado empresarial, y el modelo 8B funciona junto a Gemma en el mismo hardware.

Donde se queda corto: el tono conversacional es rígido. Las tareas creativas se sienten como un memorando legal.

Precios:

Migración desde Gemma: intercambio directo. Si usas Gemma con un envoltorio de prompt en modo JSON, Granite lo respeta más confiablemente.

Descarga: ollama.com/library/granite3.3

Resumen: la respuesta aburrida correcta para tuberías de extracción y clasificación.

SmolLM 3 - Mejor para portátiles antiguos y computadoras de placa única

SmolLM 3 de Hugging Face es un modelo 3B diseñado para ejecutarse en hardware minúsculo. Cabe por debajo de 4GB de RAM, arranca en una Raspberry Pi 5 y mantiene una conversación coherente. No superará a Gemma 4B en razonamiento, pero seguirá funcionando en una máquina donde Gemma pasaría al disco.

Donde se queda corto: la fecha de corte del conocimiento es más antigua, y el recuerdo de contexto largo es más débil.

Precios:

Migración desde Gemma: extrae a través de Ollama o ejecuta a través de llama.cpp directamente. Espera rehacer cualquier prompt que asuma el corte de conocimiento específico de Gemma.

Descarga: huggingface.co/HuggingFaceTB/SmolLM3-3B

Resumen: la alternativa cuando la máquina no puede manejar nada más grande.

Cómo elegir

Elige primero por memoria, segundo por tarea.

FAQ

¿Cuál es una buena alternativa a Gemma para un portátil de 16GB? Qwen 3 8B o Phi-4-mini ambos caben y ambos superan a Gemma 3 4B en razonamiento general. Qwen 3 gana en trabajo multilingüe, Phi gana en matemáticas.

¿Es DeepSeek R1 mejor que Gemma para codificación? Para tareas de depuración de múltiples pasos y refactorización, el distill R1 en 14B generalmente supera a Gemma 3 27B, principalmente porque la cadena de pensamiento ayuda a capturar casos extremos perdidos.

¿Puedo ejecutar Llama 3 junto a Gemma en Ollama? Sí. Ollama cambia modelos bajo demanda. Extrae ambos, cambia por nombre en la CLI o en Open WebUI.

¿Cuál es el LLM local ligero con la licencia más permisiva? Qwen 3, Mistral 7B, IBM Granite y SmolLM 3 todos se distribuyen bajo Apache 2.0. Phi-4 y distills DeepSeek R1 son MIT.

¿Hay una alternativa a Gemma con un modo de pensamiento incorporado? Qwen 3 tiene un interruptor de pensamiento explícito, y los distills DeepSeek R1 envuelven el razonamiento en etiquetas <think>. Gemma 3 no expone ninguno de los dos.