Aplicaciones de ajuste para LLM abiertos en escritorio

La destilación es la razón por la que el autohospedaje de un LLM abierto finalmente es práctico. Un modelo de 7B destilado de un profesor de 400B ahora puede manejar seguimiento de instrucciones, codificación y razonamiento a un nivel que habría requerido equipo de centro de datos hace dos años. El análisis reciente de XDA sobre lo que realmente significa “destilar” está en lo correcto sobre la recompensa: existen buenos modelos pequeños, y ahora puedes ajustarlos en casa. La pregunta es qué herramienta de escritorio elegir. Instalamos siete de las aplicaciones de ajuste más utilizadas en una estación de trabajo con una sola RTX 4090 e ejecutamos el mismo LoRA en una línea base de Llama 3.3 8B destilada para ver cómo se comparaban. Estas son las mejores aplicaciones de escritorio para ajustar LLM abiertos en 2026.

Qué buscar en una herramienta de ajuste

El ajuste es diferente del servicio. Una buena aplicación de escritorio tiene que resolver cuatro cosas que python train.py plano no hace:

Tabla de comparación rápida

Aplicación Mejor para Hardware Plan gratuito Precio inicial/mes Formatos de exportación
Unsloth Ajuste más rápido de GPU única NVIDIA, algunos AMD Totalmente gratis Gratis GGUF, HF, ONNX
Axolotl Entrenamiento serio impulsado por configuración NVIDIA, AMD Totalmente gratis Gratis HF, GGUF (vía ayudante)
LLaMA-Factory Interfaz web para no programadores NVIDIA, AMD, Ascend Totalmente gratis Gratis HF, GGUF, AWQ
Torchtune PyTorch nativo, deps mínimas NVIDIA, AMD, Apple Totalmente gratis Gratis HF, GGUF
HuggingFace TRL Ajuste de preferencias + refuerzo NVIDIA Totalmente gratis Gratis HF
MLX-LM Ajuste de Apple Silicon Apple M-series Totalmente gratis Gratis MLX, GGUF
Ludwig Entrenamiento declarativo estilo AutoML NVIDIA, CPU Totalmente gratis Gratis HF, ONNX

1. Unsloth, mejor para el ajuste más rápido de GPU única

Unsloth reescribió los kernels de atención en Triton y obtuvo 2x velocidades más 40% de reducción de memoria de ejecuciones LoRA y QLoRA. En nuestro 4090, un ajuste de Llama 3.3 8B que tardó 12 horas en Transformers vanilla se completó en aproximadamente 5 horas en Unsloth. La biblioteca se integra con Hugging Face TRL y Axolotl, por lo que puedes adoptarla sin reescribir tu bucle de entrenamiento.

Dónde falla: el objetivo principal son las GPU NVIDIA. La compatibilidad con AMD ha llegado pero se queda atrás en cobertura de kernels; Apple Silicon no está en la hoja de ruta.

Precios:

Plataformas: Linux (preferido), Windows vía WSL2

Descargar: Unsloth

Conclusión: la opción predeterminada para cualquiera con una GPU NVIDIA moderna.

2. Axolotl, mejor para entrenamiento serio impulsado por configuración

Axolotl es lo que utilizan las tiendas de modelos reales para entrenar versiones de peso abierto serias. El flujo de trabajo impulsado por archivo de configuración te obliga a pensar en tu ejecución antes de que comience, por eso produce artefactos reproducibles. El soporte de conjunto de datos es el mejor de su clase: ShareGPT, Alpaca y JSONL personalizado funcionan sin scripts de preprocesamiento.

Dónde falla: la curva de aprendizaje es real. Espera leer la referencia de configuración cuidadosamente antes de tu primera ejecución exitosa.

Precios:

Plataformas: Linux (Docker recomendado)

Descargar: Axolotl

Conclusión: la opción cuando la salida va a producción, no solo un experimento.

3. LLaMA-Factory, mejor para una interfaz web que puedas entregar a un colega

LLaMA-Factory incluye un panel web completo, sin código requerido. Seleccionas un modelo base, cargas un conjunto de datos desde el disco o Hugging Face Hub, eliges un método (SFT, DPO, PPO, KTO) e inicias el entrenamiento. Para equipos donde una persona se siente cómoda con scripts y otra no, esta es la herramienta que los une.

Dónde falla: la abstracción oculta algunos controles. Los usuarios avanzados eventualmente descenderán a un archivo de configuración.

Precios:

Plataformas: Linux (nativo), Windows vía WSL2, macOS con backend MLX

Descargar: LLaMA-Factory

Conclusión: la opción cuando el operador de entrenamiento no es un desarrollador de Python.

4. Torchtune, mejor para configuración mínima PyTorch nativa

Torchtune es la biblioteca de ajuste oficial de Meta. PyTorch puro, pocas dependencias externas y archivos de receta claros que se leen como tutoriales. La versión 2026 añadió soporte nativo para FSDP2 y la familia Llama 4, por lo que avanza al ritmo de los nuevos modelos base.

Dónde falla: los formatos de conjunto de datos son estrictos. Si tus datos no están en la forma esperada de las recetas, escribes un pase de preprocesamiento.

Precios:

Plataformas: Linux (NVIDIA y AMD), macOS (Apple Silicon)

Descargar: Torchtune

Conclusión: la opción cuando quieres PyTorch de primera parte, magia mínima.

5. Hugging Face TRL, mejor para ajuste de preferencias y RL

Hugging Face TRL es la implementación de referencia para DPO, PPO, GRPO, ORPO y todos los demás métodos de optimización de preferencias que han llegado desde ChatGPT. Cuando tu objetivo no es “enseñar al modelo este dominio” sino “enseñar al modelo a preferir estas respuestas,” TRL es el conjunto de herramientas.

Dónde falla: el soporte de SFT existe pero no es la estrella. Para ajuste supervisado simple, Unsloth o Axolotl es más rápido.

Precios:

Plataformas: Linux (NVIDIA principal), Windows vía WSL2

Descargar: TRL

Conclusión: la opción cuando el objetivo de entrenamiento es alineación, no inyección de conocimiento.

6. MLX-LM, mejor para ajuste de Apple Silicon

MLX-LM es el marco oficial de Apple para entrenamiento e inferencia de LLM en chips de la serie M. En una Mac Studio M3 Ultra de 128 GB, ajustamos exitosamente un modelo Qwen 2.5 32B durante la noche sin hardware NVIDIA. La memoria unificada es una ventaja real: puedes mantener modelos que causarían OOM en una tarjeta NVIDIA de consumidor de 24 GB.

Dónde falla: el soporte del ecosistema fuera de Apple es mínimo. Todo lo que ajustas debe reexportarse para ejecutarse en hardware que no sea Apple.

Precios:

Plataformas: macOS en Apple Silicon (M1 y posterior)

Descargar: MLX-LM

Conclusión: la opción para el propietario de Mac Studio que quiere ajustar sin comprar un equipo separado.

7. Ludwig, mejor para ejecuciones declarativas estilo AutoML

Ludwig toma una declaración YAML de tus entradas, salidas y métrica objetivo y calcula el bucle de entrenamiento. No es la opción más rápida, pero para un primer ajuste donde aún no sabes qué hiperparámetros importan, el enfoque declarativo de Ludwig acorta el bucle.

Dónde falla: oculta el bucle de entrenamiento. Cuando finalmente quieras ajustar el bucle en sí, creces fuera de Ludwig rápidamente.

Precios:

Plataformas: Linux (NVIDIA y CPU), macOS

Descargar: Ludwig

Conclusión: la opción para un primer ajuste, o para un científico de datos que prefiere declarativo a imperativo.

Cómo elegir el correcto

Si tienes una GPU NVIDIA moderna y quieres velocidad, comienza con Unsloth. Si tu modelo va a producción, cambia a Axolotl. Si el operador no es un programador, instala LLaMA-Factory. Elige Torchtune cuando quieras PyTorch de primera parte sin magia. Recurre a HuggingFace TRL cuando el objetivo es DPO o PPO, no SFT. Usa MLX-LM en cualquier Mac Apple Silicon. Prueba Ludwig para un primer ajuste donde aún estás aprendiendo los controles.

FAQ

¿Necesito varias GPU para ajustar un LLM abierto moderno? No. QLoRA en un modelo de 7B u 8B cabe en una GPU de consumidor de 12 GB. Un modelo de 13B necesita 24 GB. Los modelos de 70B aún necesitan multi-GPU o una tarjeta de clase centro de datos.

¿Cuál es la diferencia entre ajuste y destilación? La destilación entrena un modelo pequeño para imitar las salidas de un modelo grande. El ajuste enseña a un modelo existente (de cualquier tamaño) a especializarse en tus datos. Ajustar un modelo base destilado es el punto dulce actual para autohospedaje con hardware bajo.

¿Cuál es la aplicación con la rampa más corta? LLaMA-Factory para la ruta UI-first, Unsloth para la ruta script-first. Ludwig está más cerca del “solo configuración” declarativo de los siete.

¿Puedo ajustar en CPU? Técnicamente sí con Ludwig o Torchtune, pero solo para modelos diminutos (menos de 1B parámetros). Para cualquier cosa útil, se requiere una GPU o Apple Silicon.

¿Dónde debe ejecutarse el modelo ajustado después? Exporta a GGUF y carga en Ollama, LM Studio o Jan para inferencia local. Exporta a Hugging Face para servicio en la nube. Las exportaciones de MLX-LM se ejecutan de forma nativa en cualquier Mac Apple Silicon.