LangChain

Entrenar un modelo local en sus propios errores no es exactamente preentrenamiento, pero si se hace correctamente, enseña a un modelo pequeño a dejar de repetir el error que te molestó ayer. Esa es la promesa detrás del ciclo de “automejora” que la comunidad de LLM local ha estado iterando durante todo el año: registra las respuestas erróneas del modelo, cúralas en un pequeño conjunto de datos de retroalimentación, ejecuta un ajuste fino de LoRA ligero y observa cómo baja la tasa de error. Estas son las mejores aplicaciones para la automejora de LLM local a partir de fallos en el escritorio, ya sea que estés ejecutando un modelo 7B en un portátil o un 70B en una estación de trabajo.

Qué buscar en una pila de automejora

Comparación rápida

Aplicación Mejor para Plataformas Plan gratuito Precio inicial/mes Calificación
LangChain Encadenar captura de retroalimentación en flujo de trabajo de ajuste fino Windows, macOS, Linux Completo Gratuito (código abierto) 4.5
LM Studio Inferencia diaria más exportación de conjunto de datos Windows, macOS, Linux Completo Gratuito 4.6
Ollama Servir modelos afinados a cualquier cliente Windows, macOS, Linux Completo Gratuito (código abierto) 4.7
Axolotl Ejecuciones de LoRA reproducibles impulsadas por YAML Linux (Windows vía WSL, macOS vía contenedor) Completo Gratuito (código abierto) 4.6
Unsloth LoRA 2-5x más rápido en una GPU única Windows, Linux Completo Nivel gratuito, Pro disponible 4.8
Text Generation WebUI Interfaz local para inferencia, evaluación y etiquetado manual Windows, macOS, Linux Completo Gratuito (código abierto) 4.4
DSPy Optimizar indicaciones y canalizaciones a partir de fallos etiquetados Windows, macOS, Linux Completo Gratuito (código abierto) 4.7

Las aplicaciones

1. LangChain – mejor para encadenar el ciclo de retroalimentación

LangChain no es un afinador fino. Lo que hace bien es darte los bloques de construcción para capturar cada par indicación-respuesta de un agente, etiquetar los fallos y encaminarlos a un conjunto de datos de entrenamiento. Las capas Callbacks y Tracing son exactamente lo que necesita un ciclo de automejora: un registro duradero de lo que dijo el modelo, qué hizo el usuario con la respuesta y cómo se corrigió.

Dónde falla: La superficie de la API es grande y cambia frecuentemente. Los ejemplos de código más antiguos en Internet a menudo son incorrectos.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: langchain.com — Fuente (GitHub)

Línea de fondo: Comienza aquí para las tuberías entre el modelo, la aplicación y los datos de entrenamiento.

2. LM Studio – mejor para inferencia diaria y exportación de conjunto de datos

LM Studio es la interfaz de inferencia local más fácil en el escritorio. Apunta a un modelo de Hugging Face, obtén una ventana de chat y un servidor local compatible con OpenAI, y comienza a recopilar sesiones. Las versiones recientes agregaron una función de exportación de sesión que vuelca conversaciones como JSONL, que es la materia prima para un conjunto de datos de retroalimentación.

Dónde falla: Sin ajuste fino incorporado. LM Studio es primera inferencia; el entrenamiento ocurre en otro lugar.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: lmstudio.ai

Línea de fondo: El valor predeterminado para capturar e inspeccionar la salida del modelo en el camino a una carrera de ajuste fino.

3. Ollama – mejor para servir el modelo afinado después

Ollama es el aburrido y confiable servidor de modelos. Una vez que has afinado un LoRA, envuélvelo como archivo de modelo Ollama y cada cliente que hable con un punto final local OpenAI obtiene tu versión mejorada al instante. Las versiones recientes agregaron carga de LoRA de primera clase, así que puedes cambiar adaptadores sin descargar pesos base.

Dónde falla: Sin interfaz. Es un demonio que espera que otras herramientas se ubiquen encima.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: ollama.com — Fuente (GitHub)

Línea de fondo: La opción correcta para alojar el modelo afinado en tu máquina.

4. Axolotl – mejor para ejecuciones de LoRA reproducibles

Axolotl es un contenedor impulsado por YAML alrededor del stack de entrenamiento de Hugging Face. Apunta a un conjunto de datos, elige un modelo base, establece tu rango de LoRA y tasa de aprendizaje, y adelante. Cada ejecución es reproducible desde el archivo de configuración, lo que importa cuando el propósito completo de la automejora es medir la mejora entre iteraciones.

Dónde falla: Nativo de Linux. Se ejecuta en Windows vía WSL y en macOS vía contenedor pero con bordes ásperos.

Precios:

Plataformas: Principalmente Linux; WSL para Windows.

Descargar: github.com/axolotl-ai-cloud/axolotl

Línea de fondo: La opción correcta si quieres que los experimentos sean reproducibles un mes después.

5. Unsloth – mejor para LoRA rápido en GPU única

Unsloth es una biblioteca de ajuste fino que exprime 2-5x velocidad en una GPU de consumidor única en comparación con el Trainer de Hugging Face estándar. El uso de VRAM se reduce aproximadamente a la mitad. En un 4090 eso significa una carrera 7B LoRA en una hora en lugar de cuatro; en un 3060 significa que la carrera termina en absoluto.

Dónde falla: Algunas arquitecturas están detrás del lanzamiento del transformador base. El soporte para los modelos más nuevos viene en una o dos versiones más tarde.

Precios:

Plataformas: Windows, Linux.

Descargar: unsloth.ai — Fuente (GitHub)

Línea de fondo: La opción correcta cuando una GPU de escritorio única es todo lo que tienes.

6. Text Generation WebUI – mejor para etiquetado manual y evaluación

Text Generation WebUI (Oobabooga) es la interfaz de caballo de batalla para inferencia local, y también funciona como entorno de etiquetado y evaluación. Carga los modelos base y afinado lado a lado, ejecuta el mismo indicador contra ambos y marca cuál es mejor respuesta. Cada calificación va al mismo registro de conversación para la siguiente ronda.

Dónde falla: La interfaz predeterminada es anticuada. La configuración puede ser complicada en Windows sin WSL.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: github.com/oobabooga/text-generation-webui

Línea de fondo: El arnés de evaluación para personas que aman una interfaz.

7. DSPy – mejor cuando el fallo es la indicación, no los pesos

DSPy trata las indicaciones como parámetros. Dale un pequeño conjunto de datos etiquetado de fallos, define una métrica y optimiza la indicación (y pocos ejemplos) para ajustarse. Para muchos modos de fallo esto es más rápido y más barato que ajuste fino. La indicación optimizada puede retroalimentar entonces a tu agente de producción.

Dónde falla: Curva de aprendizaje. Las abstracciones (Signatures, Modules, Optimizers) son poderosas pero no obvias en la primera lectura.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: dspy.ai — Fuente (GitHub)

Línea de fondo: Prueba DSPy antes de ajuste fino. Las indicaciones baratas corrigen fallos baratos.

Cómo elegir el correcto

Si estás empezando y quieres una pila única, LM Studio para inferencia más LangChain para captura más Unsloth para la carrera de ajuste fino LoRA es el camino más barato a un ciclo funcional.

Si tus fallos son principalmente brechas de razonamiento (el modelo divagó, perdió un paso), comienza con DSPy. La optimización de indicaciones a menudo cierra la brecha por centavos en lugar de horas de GPU.

Si tus fallos son específicos del dominio (el modelo no conoce tu base de código o producto), eso es ajuste fino. Usa Axolotl o Unsloth encima del dúo LM Studio y Ollama.

Si estás en una estación de trabajo con dos o más GPU, Axolotl escala más allá del nivel gratuito de Unsloth.

Usa Text Generation WebUI como tu interfaz de evaluación independientemente de lo que entrenes. Las pruebas A/B manuales son la forma más rápida de saber que una afinación realmente mejoró las cosas.

Preguntas frecuentes

¿Puedo automejora un LLM local sin entrenar en mis propios datos? Solo hasta cierto punto. La optimización de indicaciones con DSPy te lleva más lejos de lo que la mayoría esperaría, pero los fallos específicos del dominio necesitan datos específicos del dominio.

¿Cuántos datos necesito para un ajuste fino LoRA útil? Para una corrección dirigida, unos pocos cientos de ejemplos de fallo etiquetados son suficientes. El ajuste fino de instrucciones de un modelo general necesita decenas de miles.

¿Cuál es más rápido en un 3060 o 4060: Unsloth o Axolotl? Unsloth, por un amplio margen en una GPU única. Axolotl es mejor una vez que tienes varias GPU o quieres configs YAML reproducibles.

¿Pierdo las habilidades del modelo base cuando afino LoRA? Normalmente no. LoRA congela los pesos base y agrega un pequeño adaptador. Puedes descargar el adaptador y recuperar el modelo base.

¿Puedo ejecutar todo esto en un Mac Apple Silicon? Inferencia (LM Studio, Ollama, Text Generation WebUI) sí. El entrenamiento se ejecuta más lentamente en Metal que en CUDA; algunas arquitecturas aún necesitan un cuadro GPU Linux para tiempos de entrenamiento prácticos.