LM Studio y Ollama hicieron que ejecutar LLM locales sea cuestión de un clic. El fine-tuning se mantuvo como un trabajo de centro de datos durante años, fuera de alcance en el mismo hardware. Eso finalmente está cambiando. La nueva aplicación de escritorio de Unsloth es la señal visible, pero un pequeño conjunto de marcos abiertos ahora entrena un adaptador LoRA real en una sola GPU de consumidor de 12 GB o 24 GB en el transcurso de una tarde.
Probamos siete herramientas en una RTX 4070, una RTX 4090 y una Mac M2 Pro base. Las opciones a continuación son las que completaron una ejecución de LoRA de Llama 3.1 8B o Mistral 7B sin quedarse sin memoria, sin necesitar un clúster y sin pedirte que escribas un bucle de entrenamiento en PyTorch primero. La lista combina herramientas con prioridad de GUI con marcos con prioridad de CLI para que puedas elegir el nivel ergonómico que desees.
Qué buscar en un fine-tuner de GPU de consumidor
- Soporte para LoRA y QLoRA, para que un modelo 7B se entrene en 12 GB y uno 13B en 24 GB.
- Carga cuantizada de 4-bit y 8-bit, que es la razón por la que todo esto cabe.
- Flash Attention o un kernel equivalente para que la velocidad de entrenamiento no se desplome.
- Soporte para las familias de modelos que realmente te importan: Llama, Mistral, Qwen, Gemma, Phi.
- Formatos de conjunto de datos fáciles de preparar, idealmente JSONL con campos instruction/output.
- Checkpointing para que un bloqueo en la hora cuatro no te cueste toda la ejecución.
Comparación rápida
| Aplicación | Mejor para | Plataformas | Plan gratuito | Precio inicial/mes | Licencia |
|---|---|---|---|---|---|
| Unsloth | LoRA más rápido en 12–24 GB | Windows, Linux | Aplicación completa | Gratuito (Pro tier) | Apache 2.0 |
| Axolotl | Usuario avanzado de archivos de configuración | Linux | Aplicación completa | Gratuito | Apache 2.0 |
| LLaMA-Factory | Basado en GUI, soporte amplio de modelos | Windows, Linux | Aplicación completa | Gratuito | Apache 2.0 |
| Text Generation WebUI | Adjunta LoRA y prueba in situ | Windows, macOS, Linux | Aplicación completa | Gratuito | AGPLv3 |
| PEFT | Biblioteca para tu propio bucle de entrenamiento | Windows, macOS, Linux | Aplicación completa | Gratuito | Apache 2.0 |
| H2O LLM Studio | UI corporativa con seguimiento de experimentos | Windows, Linux | Gratuito (código abierto) | Soporte Enterprise | Apache 2.0 |
| MLX-LM | Fine-tuning nativo en Apple Silicon | macOS | Aplicación completa | Gratuito | MIT |
Las aplicaciones
1. Unsloth, mejor LoRA más rápido en 12–24 GB
Unsloth reescribe los caminos críticos del fine-tuning de Llama, Mistral, Qwen, Gemma y Phi para ser aproximadamente dos a cinco veces más rápido y aproximadamente la mitad de la memoria de Transformers estándar. Un LoRA 7B cabe en una sola GPU de 12 GB y se completa en un conjunto de datos modesto en una tarde. La nueva aplicación de escritorio elimina el último paso de CLI para las recetas comunes.
Dónde se queda corto: la cobertura se inclina hacia las familias de modelos más populares; las arquitecturas oscuras necesitan la ruta Transformers ascendente.
Precios:
- Gratuito: Marco completo y aplicación de escritorio.
- De pago: Pro tier para soporte empresarial y kernels multi-GPU más rápidos.
Plataformas: Windows (vía WSL2), Linux.
Descargar: unsloth.ai · GitHub
Conclusión: La opción predeterminada en 2026 para el entrenamiento de LoRA en una sola tarjeta de consumidor.
2. Axolotl, mejor usuario avanzado de archivos de configuración
Axolotl es un marco de entrenamiento basado en configuración construido alrededor de Hugging Face. Un único archivo YAML describe el modelo, conjunto de datos, rango LoRA y argumentos de entrenamiento, y Axolotl se encarga del resto. Admite menos optimizaciones de velocidad que Unsloth pero gana en flexibilidad en modelos y formatos de conjunto de datos menos comunes.
Dónde se queda corto: sin GUI; la configuración tiene una curva de aprendizaje; la documentación supone que ya has entrenado algo.
Precios:
- Gratuito: Aplicación completa.
- De pago: No aplica.
Plataformas: Linux (Docker en macOS/Windows).
Descargar: GitHub (axolotl-ai-cloud/axolotl)
Conclusión: La opción correcta cuando Unsloth no tiene tu modelo y aún deseas un pipeline sensato.
3. LLaMA-Factory, mejor entrenador basado en GUI
LLaMA-Factory incluye una GUI basada en Gradio sobre un conjunto de herramientas de entrenamiento amplio. Elige un modelo, carga un conjunto de datos, establece el rango LoRA y la tasa de aprendizaje, e inicia. Cubre 100+ familias de modelos desde el principio y sus gráficos hacen que el ajuste de hiperparámetros sea accesible.
Dónde se queda corto: la GUI oculta algunas de las opciones más difíciles; en casos extremos de VRAM requiere la CLI de todas formas.
Precios:
- Gratuito: Aplicación completa.
- De pago: No aplica.
Plataformas: Windows, Linux.
Descargar: GitHub (hiyouga/LLaMA-Factory)
Conclusión: El mejor punto de entrada basado en GUI para cualquiera que sea nuevo en el entrenamiento de LoRA.
4. Text Generation WebUI, mejor para adjuntar y probar LoRA
Text Generation WebUI (“oobabooga”) es la interfaz de usuario de chat LLM local que la mayoría de los entusiastas ya ejecutan. Su pestaña Training realiza el entrenamiento de LoRA in situ, y una vez que se completa una ejecución, puedes habilitar el adaptador y charlar con el modelo para verificar inmediatamente el resultado.
Dónde se queda corto: no es el entrenador más rápido en esta lista; la pestaña de entrenamiento es una buena herramienta “conecta los puntos”, no un pipeline de producción.
Precios:
- Gratuito: Aplicación completa.
- De pago: No aplica.
Plataformas: Windows, macOS, Linux.
Descargar: GitHub (oobabooga/text-generation-webui)
Conclusión: La herramienta con menor fricción para ver si el fine-tuning de tus datos cambia algo que te importe.
5. PEFT, mejor biblioteca para tu propio bucle de entrenamiento
PEFT es la biblioteca Parameter-Efficient Fine-Tuning de Hugging Face. Es un conjunto de bloques de construcción de Python, LoRA, IA3, ajuste de prefijo, que arrojaste en un Trainer. Si deseas controlar el bucle, este es el nivel en el que trabajas.
Dónde se queda corto: sin UI; cada experimento es un script; eres responsable de la ergonomía.
Precios:
- Gratuito: Aplicación completa.
- De pago: No aplica.
Plataformas: Windows, macOS, Linux.
Descargar: GitHub (huggingface/peft)
Conclusión: El nivel correcto de abstracción para un investigador o aficionado serio que desea control total.
6. H2O LLM Studio, mejor entrenador con sabor corporativo
H2O LLM Studio envuelve los mismos marcos abiertos en una interfaz de usuario React limpia, añade seguimiento de experimentos e integración limpia con las herramientas de nube de H2O cuando una ejecución supera una sola GPU. En una estación de trabajo con un 4090 es cómodo.
Dónde se queda corto: la UI es una instalación más pesada que cualquier otra opción aquí; los valores predeterminados opinados pueden ocultar los controles subyacentes.
Precios:
- Gratuito: Aplicación completamente de código abierto.
- De pago: Soporte Enterprise.
Plataformas: Windows, Linux.
Descargar: GitHub (h2oai/h2o-llmstudio)
Conclusión: La opción cuando los experimentos van a un equipo, no a una sola laptop.
7. MLX-LM, mejor fine-tuning nativo en Apple Silicon
MLX-LM es el marco LM nativo de Apple construido sobre MLX. En una Mac Studio o una Mac M2 Pro base con 32 GB de memoria unificada, el fine-tuning de LoRA en modelos 7B y 13B es ahora un camino soportado, y el modelo de memoria del marco usa la asignación compartida GPU/CPU para ajustar modelos que CUDA nunca podría.
Dónde se queda corto: solo macOS; el catálogo de modelos es más pequeño que el de CUDA; menos maduro que las herramientas basadas en PyTorch.
Precios:
- Gratuito: Aplicación completa.
- De pago: No aplica.
Plataformas: macOS (Apple Silicon).
Descargar: GitHub (ml-explore/mlx-lm)
Conclusión: La opción correcta en una Mac moderna, la opción incorrecta en cualquier otro lugar.
Cómo elegir la correcta
Si tienes una sola GPU de consumidor de 12 GB o 24 GB y deseas velocidad, instala Unsloth y ejecuta uno de sus notebooks. Nada más en esta lista llega a un adaptador funcional más rápido.
Si tu modelo o formato de conjunto de datos está fuera del camino rápido de Unsloth, elige Axolotl por su flexibilidad basada en configuración.
Si nunca has entrenado nada antes, LLaMA-Factory pone una GUI en las mismas herramientas y acorta el debate de “qué tasa de aprendizaje”.
Si ya ejecutas Text Generation WebUI, usa su pestaña Training. No añadas otra herramienta para una ejecución única.
Para controlar el bucle de entrenamiento, PEFT es la biblioteca correcta. Espera escribir Python.
Si los experimentos necesitan ser revisados por otras personas, H2O LLM Studio incluye esa UI en el nivel de código abierto.
MLX-LM es la opción correcta en Apple Silicon y solo allí.
FAQ
¿Necesito una GPU de 24 GB para fine-tuning de un modelo 7B?
No. Unsloth y QLoRA ajustan un LoRA 7B en 8–12 GB. 24 GB te consigue 13B cómodamente.
¿Puedo hacer fine-tuning en CPU?
Técnicamente sí, de la manera que técnicamente puedes cruzar un océano en bote de remos. Usa una GPU o Apple Silicon.
¿Mejorará el fine-tuning mi modelo local para mi trabajo?
Para seguimiento de instrucciones y vocabulario de dominio, sí. Para ganancias de razonamiento duro, mayormente no; el techo del modelo base es el techo.
¿Qué tan grande debe ser mi conjunto de datos?
Para una LoRA enfocada en tareas, 500 a 5.000 ejemplos de alta calidad vencen a 100.000 ejemplos mediocres. Cura sin piedad.
¿Puedo compartir el adaptador LoRA que entrené?
Sí; los adaptadores son pequeños. Verifica primero la licencia del modelo base, la mayoría de variantes de Llama y Mistral son permisivas pero no idénticas.