Unsloth realizando fine-tuning de un modelo Llama local en una GPU de escritorio

Un artículo de XDA esta semana describía el entrenamiento de un LLM local basado en sus propios errores. El autor recopiló los resultados incorrectos del modelo, etiquetó manualmente algunos cientos, los empacó en un pequeño conjunto de datos y ejecutó un fine-tuning ligero. El resultado fue un modelo notablemente mejor en los problemas exactos que la versión base no estaba resolviendo. Lo que antes requería un cluster alquilado ahora se ejecuta en una laptop con una GPU de 12 GB. Estas son las siete mejores aplicaciones para fine-tuning de LLMs locales en desktop en 2026, todas gratuitas y de código abierto, clasificadas por la velocidad con que se ejecuta el primer fine-tuning.

Qué buscar en una aplicación de fine-tuning local

Comparación rápida

Aplicación Mejor para Backend LoRA/QLoRA Apple Silicon Facilidad
Unsloth LoRA de GPU única más rápido CUDA Sí Beta Más fácil
Axolotl Ejecuciones de producción configurables CUDA (+ROCm) Sí No Medio
LLaMA-Factory Fine-tuning con interfaz web CUDA (+ROCm) Sí Beta Fácil
MLX-LM Fine-tuning en Apple Silicon MLX Sí Sí Fácil
Torchtune Referencia oficial de PyTorch CUDA Sí Limitado Medio
Hugging Face TRL RLHF/DPO/PPO en top de Transformers CUDA (+ROCm) Sí No Medio
LM Studio GUI todo-en-uno para inferencia + workflows ligeros de fine-tuning CUDA/Metal Carga de adaptador Sí Muy fácil

1. Unsloth, Mejor para LoRA de GPU única más rápido

Unsloth es la herramienta que convirtió “fine-tune un modelo de 7B en tu laptop” de un artículo de investigación en un notebook de Colab y un pip install. En una RTX 4070 única con 12 GB de VRAM, una ejecución 7B QLoRA con contexto 2048 se completa en aproximadamente 30 minutos para algunos cientos de ejemplos. El truco matemático es un pase hacia adelante-hacia atrás eficiente en memoria; el beneficio práctico es un fine-tuning que se ejecuta mientras preparas café.

Dónde falla: El fine-tuning multi-GPU es de segunda clase en comparación con Axolotl o Torchtune. Algunas arquitecturas especializadas llegan más tarde que en los stacks de referencia.

Precio: Gratis.

Plataformas: Linux (mejor), Windows (vía WSL2), Apple Silicon (beta).

Descargar: unsloth.ai / github.com/unslothai/unsloth

En conclusión: La opción predeterminada para el primer fine-tuning de cualquiera con una GPU de consumidor única.

2. Axolotl, Mejor para ejecuciones de producción configurables

Axolotl es lo que usan los equipos cuando el camino feliz de Unsloth no es suficiente. El enfoque basado en archivos de configuración hace que las ejecuciones sean reproducibles: un único archivo YAML describe el modelo base, el conjunto de datos, el rango de LoRA, la tasa de aprendizaje, la cadencia de evaluación y el destino de exportación. Multi-GPU con DeepSpeed y FSDP funciona. La comunidad ha publicado docenas de configuraciones predefinidas para tareas comunes.

Dónde falla: La curva de aprendizaje es más pronunciada que la de Unsloth. La primera ejecución significa leer un archivo de configuración YAML y entender qué hace cada campo.

Precio: Gratis.

Plataformas: Linux, Windows vía WSL2.

Descargar: github.com/axolotl-ai-cloud/axolotl

En conclusión: La herramienta para usar después de que el primer fine-tuning de Unsloth funcionó y quieres más control.

3. LLaMA-Factory, Mejor para workflow de fine-tuning con interfaz web

LLaMA-Factory envuelve la misma matemática que Axolotl y Unsloth detrás de una interfaz web. Carga un modelo base, selecciona un conjunto de datos de una carpeta local, ajusta un slider para el rango de LoRA e inicia la ejecución. Las curvas de pérdida se renderizan en el navegador. Para alguien que no quiere tocar una terminal, es lo más cercano a una aplicación amigable de fine-tuning de escritorio.

Dónde falla: La interfaz web no es un IDE completo. Los pipelines complejos de múltiples etapas aún requieren una configuración real. No todos los optimizadores se exponen en la interfaz.

Precio: Gratis.

Plataformas: Linux, Windows vía WSL2, macOS vía Docker.

Descargar: github.com/hiyouga/LLaMA-Factory

En conclusión: La mejor opción si un workflow basado en terminal te desanima.

4. MLX-LM, Mejor para fine-tuning en Apple Silicon

MLX-LM es el stack oficial de modelos de lenguaje de Apple, construido sobre el framework de arrays MLX. En una M2 Max o M3 Max con 64 GB de memoria unificada, un fine-tuning 7B LoRA se ejecuta a velocidades competitivas con una GPU NVIDIA de rango medio. En una M2 Pro con 16 GB funciona para modelos más pequeños. MLX-LM exporta directamente a formato MLX para Ollama y los runtimes de inferencia propios de Apple.

Dónde falla: No todos los modelos base están disponibles en formato MLX; el paso de conversión desde pesos de Hugging Face añade fricción. El ecosistema es más pequeño que el stack CUDA.

Precio: Gratis.

Plataformas: Solo Apple Silicon macOS.

Descargar: github.com/ml-explore/mlx-lm

En conclusión: La herramienta adecuada en una Mac. Nada más usa Apple Silicon tan bien.

5. Torchtune, Mejor para la referencia oficial de PyTorch

Torchtune es la propia biblioteca de fine-tuning de PyTorch, ejecutada por el equipo de Meta. Las recetas son Python legible, no un DSL de configuración, lo que es adecuado para ingenieros que quieren ver y modificar el loop de entrenamiento. Soporte para fine-tuning completo, LoRA y DPO. Multi-GPU funciona fuera de la caja. La documentación es de calidad de ingeniería.

Dónde falla: Menos “baterías incluidas” que Unsloth o Axolotl. La postura de implementación de referencia significa menos atajos.

Precio: Gratis.

Plataformas: Linux, Windows vía WSL2, macOS con características limitadas.

Descargar: github.com/pytorch/torchtune

En conclusión: Elige Torchtune si ya escribes PyTorch y quieres ver el loop de entrenamiento.

6. Hugging Face TRL, Mejor para RLHF, DPO y modelado de recompensa

TRL (Transformer Reinforcement Learning) es el toolkit para los pasos de fine-tuning más allá del fine-tuning supervisado simple: DPO (optimización de preferencia directa), PPO (optimización de política proximal), entrenamiento de modelos de recompensa. En el workflow “train on failures” de XDA, DPO es la técnica actual que convirtió los fallos anotados en un modelo mejor. TRL es lo que lo ejecuta.

Dónde falla: Más matemáticas para entender. RLHF/DPO puede fallar de formas que SFT no puede; espera algunos intentos fallidos antes de que tenga sentido.

Precio: Gratis.

Plataformas: Linux, Windows vía WSL2.

Descargar: github.com/huggingface/trl

En conclusión: La herramienta para la segunda etapa de un pipeline de fine-tuning real “aprende de tus errores”.

7. LM Studio, Mejor para GUI todo-en-uno de escritorio

LM Studio no es principalmente una aplicación de fine-tuning. Es una GUI de escritorio para descargar, ejecutar y chatear con modelos locales en Windows, macOS y Linux. Su papel en esta lista es el pulido que proporciona alrededor del workflow de fine-tuning: carga un modelo base, carga un adaptador LoRA producido por Unsloth o Axolotl, chatea con el modelo fine-tuned, itera. Las versiones 2026 añadieron wrappers de conveniencia de fine-tuning ligero que llaman a Unsloth bajo el capó.

Dónde falla: El lado de entrenamiento es delgado. LM Studio es un chat y frontend de inferencia; úsalo para la mitad de inferencia del loop, no la mitad de entrenamiento.

Precio: Gratis.

Plataformas: Windows, macOS, Linux.

Descargar: lmstudio.ai

En conclusión: Elige LM Studio como el lado de inferencia del loop de fine-tuning, no el lado de entrenamiento.

Cómo elegir el correcto

Empareja cualquier herramienta de entrenamiento que elijas con LM Studio para probar el adaptador resultante localmente antes de enviarlo a un stack de inferencia.

FAQ

¿Cuál es la GPU mínima para fine-tune un modelo 7B?

QLoRA en contexto 2048 cabe en 8 GB de VRAM para las variantes 7B más pequeñas y 12 GB cómodamente. 8 GB funciona para contextos más cortos y rangos más bajos; 24 GB abre 13B QLoRA.

¿Podemos hacer fine-tuning sin ninguna GPU?

Técnicamente sí, en CPU, pero es demasiado lento para ser práctico. El alquiler de la nube durante algunas horas a menudo es más barato que la electricidad para ejecutar un fine-tuning de CPU hasta completarse.

¿Qué formato de datos aceptan estas herramientas?

JSON Lines con campos instruction y output (estilo Alpaca) es el estándar universal. La mayoría de herramientas también aceptan formato ShareGPT y formato de mensajes de chat de OpenAI.

¿Los modelos fine-tuned se ejecutan en Ollama, LM Studio o llama.cpp?

Sí, después de exportar a GGUF (para llama.cpp y Ollama) o MLX (para el stack de Apple). Cada herramienta anterior exporta a al menos uno de esos formatos.

Solo para modelos cuya licencia lo permite. Llama 3 y 4, modelos Mistral, Qwen, Gemma y todos los modelos de peso abierto en esta lista permiten fine-tuning bajo sus licencias. Los modelos cerrados (clase GPT-4) no tienen pesos descargables, por lo que el fine-tuning local no es posible.