Entrenar un modelo local en sus propios errores no es exactamente preentrenamiento, pero si se hace correctamente, enseña a un modelo pequeño a dejar de repetir el error que te molestó ayer. Esa es la promesa detrás del ciclo de “automejora” que la comunidad de LLM local ha estado iterando durante todo el año: registra las respuestas erróneas del modelo, cúralas en un pequeño conjunto de datos de retroalimentación, ejecuta un ajuste fino de LoRA ligero y observa cómo baja la tasa de error. Estas son las mejores aplicaciones para la automejora de LLM local a partir de fallos en el escritorio, ya sea que estés ejecutando un modelo 7B en un portátil o un 70B en una estación de trabajo.
Qué buscar en una pila de automejora
- Captura de retroalimentación incorporada. Una herramienta que registra la indicación, respuesta y señal de pulgar hacia arriba/hacia abajo (o mejor, una respuesta corregida) es donde comienza el ciclo.
- Curación de conjuntos de datos. El registro de fallos debe convertirse en un conjunto de datos de afinación de instrucciones limpio antes de ser útil.
- Ajuste fino eficiente. LoRA y QLoRA reducen un ajuste fino de 24 GB a algo que una GPU de consumidor única puede ejecutar durante la noche.
- Inferencia local para evaluación. La misma herramienta que sirve el modelo a tu agente debe servir la versión afinada para que puedas comparar las dos.
- Optimización de indicaciones programática. Para muchos modos de fallo, la solución no es ajuste fino sino una mejor indicación. Los marcos de optimización lo hacen mecánico.
Comparación rápida
| Aplicación | Mejor para | Plataformas | Plan gratuito | Precio inicial/mes | Calificación |
|---|---|---|---|---|---|
| LangChain | Encadenar captura de retroalimentación en flujo de trabajo de ajuste fino | Windows, macOS, Linux | Completo | Gratuito (código abierto) | 4.5 |
| LM Studio | Inferencia diaria más exportación de conjunto de datos | Windows, macOS, Linux | Completo | Gratuito | 4.6 |
| Ollama | Servir modelos afinados a cualquier cliente | Windows, macOS, Linux | Completo | Gratuito (código abierto) | 4.7 |
| Axolotl | Ejecuciones de LoRA reproducibles impulsadas por YAML | Linux (Windows vía WSL, macOS vía contenedor) | Completo | Gratuito (código abierto) | 4.6 |
| Unsloth | LoRA 2-5x más rápido en una GPU única | Windows, Linux | Completo | Nivel gratuito, Pro disponible | 4.8 |
| Text Generation WebUI | Interfaz local para inferencia, evaluación y etiquetado manual | Windows, macOS, Linux | Completo | Gratuito (código abierto) | 4.4 |
| DSPy | Optimizar indicaciones y canalizaciones a partir de fallos etiquetados | Windows, macOS, Linux | Completo | Gratuito (código abierto) | 4.7 |
Las aplicaciones
1. LangChain – mejor para encadenar el ciclo de retroalimentación
LangChain no es un afinador fino. Lo que hace bien es darte los bloques de construcción para capturar cada par indicación-respuesta de un agente, etiquetar los fallos y encaminarlos a un conjunto de datos de entrenamiento. Las capas Callbacks y Tracing son exactamente lo que necesita un ciclo de automejora: un registro duradero de lo que dijo el modelo, qué hizo el usuario con la respuesta y cómo se corrigió.
Dónde falla: La superficie de la API es grande y cambia frecuentemente. Los ejemplos de código más antiguos en Internet a menudo son incorrectos.
Precios:
- Gratuito: El marco.
- Pagado: LangSmith es un rastreador administrado de pago si quieres un panel alojado.
Plataformas: Windows, macOS, Linux.
Descargar: langchain.com — Fuente (GitHub)
Línea de fondo: Comienza aquí para las tuberías entre el modelo, la aplicación y los datos de entrenamiento.
2. LM Studio – mejor para inferencia diaria y exportación de conjunto de datos
LM Studio es la interfaz de inferencia local más fácil en el escritorio. Apunta a un modelo de Hugging Face, obtén una ventana de chat y un servidor local compatible con OpenAI, y comienza a recopilar sesiones. Las versiones recientes agregaron una función de exportación de sesión que vuelca conversaciones como JSONL, que es la materia prima para un conjunto de datos de retroalimentación.
Dónde falla: Sin ajuste fino incorporado. LM Studio es primera inferencia; el entrenamiento ocurre en otro lugar.
Precios:
- Gratuito: Todo.
- Pagado: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: lmstudio.ai
Línea de fondo: El valor predeterminado para capturar e inspeccionar la salida del modelo en el camino a una carrera de ajuste fino.
3. Ollama – mejor para servir el modelo afinado después
Ollama es el aburrido y confiable servidor de modelos. Una vez que has afinado un LoRA, envuélvelo como archivo de modelo Ollama y cada cliente que hable con un punto final local OpenAI obtiene tu versión mejorada al instante. Las versiones recientes agregaron carga de LoRA de primera clase, así que puedes cambiar adaptadores sin descargar pesos base.
Dónde falla: Sin interfaz. Es un demonio que espera que otras herramientas se ubiquen encima.
Precios:
- Gratuito: Todo.
- Pagado: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: ollama.com — Fuente (GitHub)
Línea de fondo: La opción correcta para alojar el modelo afinado en tu máquina.
4. Axolotl – mejor para ejecuciones de LoRA reproducibles
Axolotl es un contenedor impulsado por YAML alrededor del stack de entrenamiento de Hugging Face. Apunta a un conjunto de datos, elige un modelo base, establece tu rango de LoRA y tasa de aprendizaje, y adelante. Cada ejecución es reproducible desde el archivo de configuración, lo que importa cuando el propósito completo de la automejora es medir la mejora entre iteraciones.
Dónde falla: Nativo de Linux. Se ejecuta en Windows vía WSL y en macOS vía contenedor pero con bordes ásperos.
Precios:
- Gratuito: Todo.
- Pagado: Ninguno.
Plataformas: Principalmente Linux; WSL para Windows.
Descargar: github.com/axolotl-ai-cloud/axolotl
Línea de fondo: La opción correcta si quieres que los experimentos sean reproducibles un mes después.
5. Unsloth – mejor para LoRA rápido en GPU única
Unsloth es una biblioteca de ajuste fino que exprime 2-5x velocidad en una GPU de consumidor única en comparación con el Trainer de Hugging Face estándar. El uso de VRAM se reduce aproximadamente a la mitad. En un 4090 eso significa una carrera 7B LoRA en una hora en lugar de cuatro; en un 3060 significa que la carrera termina en absoluto.
Dónde falla: Algunas arquitecturas están detrás del lanzamiento del transformador base. El soporte para los modelos más nuevos viene en una o dos versiones más tarde.
Precios:
- Gratuito: Todo en una GPU única.
- Pagado: Unsloth Pro para multi-GPU y soporte empresarial.
Plataformas: Windows, Linux.
Descargar: unsloth.ai — Fuente (GitHub)
Línea de fondo: La opción correcta cuando una GPU de escritorio única es todo lo que tienes.
6. Text Generation WebUI – mejor para etiquetado manual y evaluación
Text Generation WebUI (Oobabooga) es la interfaz de caballo de batalla para inferencia local, y también funciona como entorno de etiquetado y evaluación. Carga los modelos base y afinado lado a lado, ejecuta el mismo indicador contra ambos y marca cuál es mejor respuesta. Cada calificación va al mismo registro de conversación para la siguiente ronda.
Dónde falla: La interfaz predeterminada es anticuada. La configuración puede ser complicada en Windows sin WSL.
Precios:
- Gratuito: Todo.
- Pagado: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: github.com/oobabooga/text-generation-webui
Línea de fondo: El arnés de evaluación para personas que aman una interfaz.
7. DSPy – mejor cuando el fallo es la indicación, no los pesos
DSPy trata las indicaciones como parámetros. Dale un pequeño conjunto de datos etiquetado de fallos, define una métrica y optimiza la indicación (y pocos ejemplos) para ajustarse. Para muchos modos de fallo esto es más rápido y más barato que ajuste fino. La indicación optimizada puede retroalimentar entonces a tu agente de producción.
Dónde falla: Curva de aprendizaje. Las abstracciones (Signatures, Modules, Optimizers) son poderosas pero no obvias en la primera lectura.
Precios:
- Gratuito: Todo.
- Pagado: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: dspy.ai — Fuente (GitHub)
Línea de fondo: Prueba DSPy antes de ajuste fino. Las indicaciones baratas corrigen fallos baratos.
Cómo elegir el correcto
Si estás empezando y quieres una pila única, LM Studio para inferencia más LangChain para captura más Unsloth para la carrera de ajuste fino LoRA es el camino más barato a un ciclo funcional.
Si tus fallos son principalmente brechas de razonamiento (el modelo divagó, perdió un paso), comienza con DSPy. La optimización de indicaciones a menudo cierra la brecha por centavos en lugar de horas de GPU.
Si tus fallos son específicos del dominio (el modelo no conoce tu base de código o producto), eso es ajuste fino. Usa Axolotl o Unsloth encima del dúo LM Studio y Ollama.
Si estás en una estación de trabajo con dos o más GPU, Axolotl escala más allá del nivel gratuito de Unsloth.
Usa Text Generation WebUI como tu interfaz de evaluación independientemente de lo que entrenes. Las pruebas A/B manuales son la forma más rápida de saber que una afinación realmente mejoró las cosas.
Preguntas frecuentes
¿Puedo automejora un LLM local sin entrenar en mis propios datos? Solo hasta cierto punto. La optimización de indicaciones con DSPy te lleva más lejos de lo que la mayoría esperaría, pero los fallos específicos del dominio necesitan datos específicos del dominio.
¿Cuántos datos necesito para un ajuste fino LoRA útil? Para una corrección dirigida, unos pocos cientos de ejemplos de fallo etiquetados son suficientes. El ajuste fino de instrucciones de un modelo general necesita decenas de miles.
¿Cuál es más rápido en un 3060 o 4060: Unsloth o Axolotl? Unsloth, por un amplio margen en una GPU única. Axolotl es mejor una vez que tienes varias GPU o quieres configs YAML reproducibles.
¿Pierdo las habilidades del modelo base cuando afino LoRA? Normalmente no. LoRA congela los pesos base y agrega un pequeño adaptador. Puedes descargar el adaptador y recuperar el modelo base.
¿Puedo ejecutar todo esto en un Mac Apple Silicon? Inferencia (LM Studio, Ollama, Text Generation WebUI) sí. El entrenamiento se ejecuta más lentamente en Metal que en CUDA; algunas arquitecturas aún necesitan un cuadro GPU Linux para tiempos de entrenamiento prácticos.