Un artículo de XDA esta semana describía el entrenamiento de un LLM local basado en sus propios errores. El autor recopiló los resultados incorrectos del modelo, etiquetó manualmente algunos cientos, los empacó en un pequeño conjunto de datos y ejecutó un fine-tuning ligero. El resultado fue un modelo notablemente mejor en los problemas exactos que la versión base no estaba resolviendo. Lo que antes requería un cluster alquilado ahora se ejecuta en una laptop con una GPU de 12 GB. Estas son las siete mejores aplicaciones para fine-tuning de LLMs locales en desktop en 2026, todas gratuitas y de código abierto, clasificadas por la velocidad con que se ejecuta el primer fine-tuning.
Qué buscar en una aplicación de fine-tuning local
- Soporte para LoRA y QLoRA. El fine-tuning completo depende del hardware. Los adaptadores de bajo rango (LoRA) y LoRA cuantizado de 4 bits (QLoRA) son la única forma realista de ajustar un modelo de 7B o 13B en GPUs de consumidor.
- Se ejecuta en el hardware que tienes. NVIDIA CUDA es el estándar; ROCm en AMD es de segunda clase. Apple Silicon (M-series) tiene su propio camino a través de MLX. Una aplicación de “fine-tune” solo es útil si se ejecuta en tu GPU o NPU.
- Un formato de conjunto de datos que no asuste. JSON Lines con campos
instructionyoutputes el estándar moderno. Si la aplicación requiere un formato binario personalizado, será difícil de usar. - Evaluación y checkpointing. El fine-tuning puede salir mal. Una herramienta que crea snapshots cada N pasos y muestra curvas de pérdida te permite retroceder en una ejecución incorrecta antes de que sea tarde.
- Exportación a GGUF o MLX. Después del fine-tuning, el modelo necesita cargarse en un stack de inferencia. GGUF para llama.cpp; MLX para Apple. Si la herramienta bloquea los pesos a su propio formato, el resultado no se puede usar.
Comparación rápida
| Aplicación | Mejor para | Backend | LoRA/QLoRA | Apple Silicon | Facilidad |
|---|---|---|---|---|---|
| Unsloth | LoRA de GPU única más rápido | CUDA | Sí | Beta | Más fácil |
| Axolotl | Ejecuciones de producción configurables | CUDA (+ROCm) | Sí | No | Medio |
| LLaMA-Factory | Fine-tuning con interfaz web | CUDA (+ROCm) | Sí | Beta | Fácil |
| MLX-LM | Fine-tuning en Apple Silicon | MLX | Sí | Sí | Fácil |
| Torchtune | Referencia oficial de PyTorch | CUDA | Sí | Limitado | Medio |
| Hugging Face TRL | RLHF/DPO/PPO en top de Transformers | CUDA (+ROCm) | Sí | No | Medio |
| LM Studio | GUI todo-en-uno para inferencia + workflows ligeros de fine-tuning | CUDA/Metal | Carga de adaptador | Sí | Muy fácil |
1. Unsloth, Mejor para LoRA de GPU única más rápido
Unsloth es la herramienta que convirtió “fine-tune un modelo de 7B en tu laptop” de un artículo de investigación en un notebook de Colab y un pip install. En una RTX 4070 única con 12 GB de VRAM, una ejecución 7B QLoRA con contexto 2048 se completa en aproximadamente 30 minutos para algunos cientos de ejemplos. El truco matemático es un pase hacia adelante-hacia atrás eficiente en memoria; el beneficio práctico es un fine-tuning que se ejecuta mientras preparas café.
Dónde falla: El fine-tuning multi-GPU es de segunda clase en comparación con Axolotl o Torchtune. Algunas arquitecturas especializadas llegan más tarde que en los stacks de referencia.
Precio: Gratis.
Plataformas: Linux (mejor), Windows (vía WSL2), Apple Silicon (beta).
Descargar: unsloth.ai / github.com/unslothai/unsloth
En conclusión: La opción predeterminada para el primer fine-tuning de cualquiera con una GPU de consumidor única.
2. Axolotl, Mejor para ejecuciones de producción configurables
Axolotl es lo que usan los equipos cuando el camino feliz de Unsloth no es suficiente. El enfoque basado en archivos de configuración hace que las ejecuciones sean reproducibles: un único archivo YAML describe el modelo base, el conjunto de datos, el rango de LoRA, la tasa de aprendizaje, la cadencia de evaluación y el destino de exportación. Multi-GPU con DeepSpeed y FSDP funciona. La comunidad ha publicado docenas de configuraciones predefinidas para tareas comunes.
Dónde falla: La curva de aprendizaje es más pronunciada que la de Unsloth. La primera ejecución significa leer un archivo de configuración YAML y entender qué hace cada campo.
Precio: Gratis.
Plataformas: Linux, Windows vía WSL2.
Descargar: github.com/axolotl-ai-cloud/axolotl
En conclusión: La herramienta para usar después de que el primer fine-tuning de Unsloth funcionó y quieres más control.
3. LLaMA-Factory, Mejor para workflow de fine-tuning con interfaz web
LLaMA-Factory envuelve la misma matemática que Axolotl y Unsloth detrás de una interfaz web. Carga un modelo base, selecciona un conjunto de datos de una carpeta local, ajusta un slider para el rango de LoRA e inicia la ejecución. Las curvas de pérdida se renderizan en el navegador. Para alguien que no quiere tocar una terminal, es lo más cercano a una aplicación amigable de fine-tuning de escritorio.
Dónde falla: La interfaz web no es un IDE completo. Los pipelines complejos de múltiples etapas aún requieren una configuración real. No todos los optimizadores se exponen en la interfaz.
Precio: Gratis.
Plataformas: Linux, Windows vía WSL2, macOS vía Docker.
Descargar: github.com/hiyouga/LLaMA-Factory
En conclusión: La mejor opción si un workflow basado en terminal te desanima.
4. MLX-LM, Mejor para fine-tuning en Apple Silicon
MLX-LM es el stack oficial de modelos de lenguaje de Apple, construido sobre el framework de arrays MLX. En una M2 Max o M3 Max con 64 GB de memoria unificada, un fine-tuning 7B LoRA se ejecuta a velocidades competitivas con una GPU NVIDIA de rango medio. En una M2 Pro con 16 GB funciona para modelos más pequeños. MLX-LM exporta directamente a formato MLX para Ollama y los runtimes de inferencia propios de Apple.
Dónde falla: No todos los modelos base están disponibles en formato MLX; el paso de conversión desde pesos de Hugging Face añade fricción. El ecosistema es más pequeño que el stack CUDA.
Precio: Gratis.
Plataformas: Solo Apple Silicon macOS.
Descargar: github.com/ml-explore/mlx-lm
En conclusión: La herramienta adecuada en una Mac. Nada más usa Apple Silicon tan bien.
5. Torchtune, Mejor para la referencia oficial de PyTorch
Torchtune es la propia biblioteca de fine-tuning de PyTorch, ejecutada por el equipo de Meta. Las recetas son Python legible, no un DSL de configuración, lo que es adecuado para ingenieros que quieren ver y modificar el loop de entrenamiento. Soporte para fine-tuning completo, LoRA y DPO. Multi-GPU funciona fuera de la caja. La documentación es de calidad de ingeniería.
Dónde falla: Menos “baterías incluidas” que Unsloth o Axolotl. La postura de implementación de referencia significa menos atajos.
Precio: Gratis.
Plataformas: Linux, Windows vía WSL2, macOS con características limitadas.
Descargar: github.com/pytorch/torchtune
En conclusión: Elige Torchtune si ya escribes PyTorch y quieres ver el loop de entrenamiento.
6. Hugging Face TRL, Mejor para RLHF, DPO y modelado de recompensa
TRL (Transformer Reinforcement Learning) es el toolkit para los pasos de fine-tuning más allá del fine-tuning supervisado simple: DPO (optimización de preferencia directa), PPO (optimización de política proximal), entrenamiento de modelos de recompensa. En el workflow “train on failures” de XDA, DPO es la técnica actual que convirtió los fallos anotados en un modelo mejor. TRL es lo que lo ejecuta.
Dónde falla: Más matemáticas para entender. RLHF/DPO puede fallar de formas que SFT no puede; espera algunos intentos fallidos antes de que tenga sentido.
Precio: Gratis.
Plataformas: Linux, Windows vía WSL2.
Descargar: github.com/huggingface/trl
En conclusión: La herramienta para la segunda etapa de un pipeline de fine-tuning real “aprende de tus errores”.
7. LM Studio, Mejor para GUI todo-en-uno de escritorio
LM Studio no es principalmente una aplicación de fine-tuning. Es una GUI de escritorio para descargar, ejecutar y chatear con modelos locales en Windows, macOS y Linux. Su papel en esta lista es el pulido que proporciona alrededor del workflow de fine-tuning: carga un modelo base, carga un adaptador LoRA producido por Unsloth o Axolotl, chatea con el modelo fine-tuned, itera. Las versiones 2026 añadieron wrappers de conveniencia de fine-tuning ligero que llaman a Unsloth bajo el capó.
Dónde falla: El lado de entrenamiento es delgado. LM Studio es un chat y frontend de inferencia; úsalo para la mitad de inferencia del loop, no la mitad de entrenamiento.
Precio: Gratis.
Plataformas: Windows, macOS, Linux.
Descargar: lmstudio.ai
En conclusión: Elige LM Studio como el lado de inferencia del loop de fine-tuning, no el lado de entrenamiento.
Cómo elegir el correcto
- Nunca has hecho fine-tuning de un modelo, tienes una sola GPU NVIDIA: Unsloth. Sigue primero el notebook de QLoRA.
- En una Mac con Apple Silicon: MLX-LM. Nada más usa el hardware tan bien.
- Quieres una interfaz web y sin terminal: LLaMA-Factory.
- Construyendo un pipeline reproducible para un equipo: Axolotl con configs YAML en Git.
- Haciendo el workflow de XDA “train on failures”: Unsloth para el SFT inicial, luego TRL para DPO en los fallos anotados.
- Quieres ver el loop de entrenamiento en PyTorch simple: Torchtune.
Empareja cualquier herramienta de entrenamiento que elijas con LM Studio para probar el adaptador resultante localmente antes de enviarlo a un stack de inferencia.
FAQ
¿Cuál es la GPU mínima para fine-tune un modelo 7B?
QLoRA en contexto 2048 cabe en 8 GB de VRAM para las variantes 7B más pequeñas y 12 GB cómodamente. 8 GB funciona para contextos más cortos y rangos más bajos; 24 GB abre 13B QLoRA.
¿Podemos hacer fine-tuning sin ninguna GPU?
Técnicamente sí, en CPU, pero es demasiado lento para ser práctico. El alquiler de la nube durante algunas horas a menudo es más barato que la electricidad para ejecutar un fine-tuning de CPU hasta completarse.
¿Qué formato de datos aceptan estas herramientas?
JSON Lines con campos instruction y output (estilo Alpaca) es el estándar universal. La mayoría de herramientas también aceptan formato ShareGPT y formato de mensajes de chat de OpenAI.
¿Los modelos fine-tuned se ejecutan en Ollama, LM Studio o llama.cpp?
Sí, después de exportar a GGUF (para llama.cpp y Ollama) o MLX (para el stack de Apple). Cada herramienta anterior exporta a al menos uno de esos formatos.
¿Es legal el fine-tuning para pesos de modelos cerrados?
Solo para modelos cuya licencia lo permite. Llama 3 y 4, modelos Mistral, Qwen, Gemma y todos los modelos de peso abierto en esta lista permiten fine-tuning bajo sus licencias. Los modelos cerrados (clase GPT-4) no tienen pesos descargables, por lo que el fine-tuning local no es posible.