La brecha entre modelos alojados y locales en una GPU decente se ha reducido lo suficiente como para que las tareas de codificación se completen ahora sin abrir Claude. Qwen 3, Llama 3.3 y DeepSeek-Coder se ejecutan de forma receptiva en una tarjeta de 16 GB y manejan refactorizaciones, pruebas y características pequeñas. Lo que faltaba era tooling: los modelos locales estaban bien, las aplicaciones alrededor de ellos no. Eso cambió en los últimos doce meses. Estas son las siete aplicaciones de escritorio que probamos contra repositorios reales, clasificadas según cuál de ellas todavía teníamos instalada una semana después.
Qué buscar en una aplicación de codificación LLM local
No todas las herramientas de “IA local” son apropiadas para el trabajo de codificación. Una opción seria debe cubrir la mayoría de esto:
- Ejecuta modelos en tu máquina o LAN, nunca encamina prompts a una API alojada por defecto.
- Comprende un proyecto, no solo archivos individuales: contexto en todo el repositorio, referencias de archivos y diffs.
- Funciona dentro de un editor o viene con el propio, para que las completaciones y refactorizaciones lleguen donde escribes.
- Transmite llamadas de herramientas de la forma en que lo hacen las herramientas agentic (leer archivo, editar archivo, ejecutar comando).
- Maneja al menos modelos 7B y 14B sin fallar en una GPU de 16 GB.
- Viene con una API compatible con OpenAI para que puedas apuntar otras herramientas al mismo runtime.
Todo lo que se encuentra a continuación cumple con cuatro o más. Las mejores opciones cumplen con los seis.
Comparación rápida
| Aplicación | Mejor para | Plataformas | Local | Precio inicial/mes | Clasificación |
|---|---|---|---|---|---|
| Continue.dev | Extensión de editor para modelos locales | Win/Mac/Linux | Sí | Gratis | 4.6 |
| Ollama | Runtime de modelo local rápido | Win/Mac/Linux | Sí | Gratis | 4.7 |
| LM Studio | GUI para explorar y ejecutar modelos | Win/Mac/Linux | Sí | Gratis | 4.5 |
| Aider | Programación en pareja CLI | Win/Mac/Linux | Sí | Gratis | 4.5 |
| Cursor | IDE agentic con enrutamiento local | Win/Mac/Linux | Opcional | $20 | 4.6 |
| Cline | Agente de codificación autónomo | VS Code + Ollama | Sí | Gratis | 4.4 |
| Tabby | Copilot autohospedado | Win/Mac/Linux | Sí | Gratis | 4.3 |
Las aplicaciones
1. Continue.dev, la mejor extensión de editor para modelos locales
Continue.dev es una extensión de VS Code y JetBrains que habla con cualquier punto final compatible con OpenAI. Apúntala a Ollama o LM Studio ejecutándose localmente y obtendrás chat, edición y autocompletado dentro del editor. El config.json te permite asignar diferentes modelos a diferentes roles: un modelo pequeño rápido para autocompletado, uno más grande para refactorizaciones, un especialista para embeddings.
Donde se queda corta: La latencia de autocompletado en GPUs muy pequeñas se nota. El sistema de reglas y contexto es poderoso pero la documentación asume que sabes por qué querrías un archivo de prompt del sistema por proyecto. No hay aplicación de escritorio nativa; el valor está en tu editor.
Precios:
- Gratis: extensión, uso ilimitado con tus propios modelos
- Pagado: ninguno
Plataformas: VS Code y JetBrains en Windows, macOS, Linux
Descargar: Continue.dev extension
Conclusión: La mejor opción para quedarte en tu editor con un modelo local haciendo el trabajo pesado.
2. Ollama, el mejor runtime de modelo local
Ollama es el runtime que la mayoría de las otras aplicaciones en esta lista terminan hablando. Ejecuta Llama, Qwen, DeepSeek, Mistral y docenas más con un comando ollama run <model>, expone una API compatible con OpenAI en el puerto 11434 y maneja descargas de modelos, variantes de cuantización y actualizaciones. Las aplicaciones de escritorio para Windows, macOS y Linux instalan un daemon de bandeja del sistema.
Donde se queda corta: La interfaz es mínima por diseño. Necesitas un frontend separado (Continue, LM Studio, Open WebUI) si quieres una ventana de chat. La gestión de modelos está orientada a CLI y es mejor a través de scripts.
Precios:
- Gratis: runtime completo, todos los modelos
- Pagado: ninguno
Plataformas: Windows, macOS, Linux
Descargar: Ollama for desktop
Conclusión: La mejor opción como motor detrás de cualquier otra herramienta en esta lista.
3. LM Studio, la mejor GUI para explorar y ejecutar modelos
LM Studio trae todo lo que tiene Ollama más una GUI: un navegador de modelos estilo Hugging Face, una ventana de chat y controles para descarga de GPU, longitud de contexto y prompts del sistema. También expone una API compatible con OpenAI en 1234 para que Continue, Cursor y Aider puedan hablar con ella.
Donde se queda corta: Mayor huella que Ollama. El catálogo de modelos es curado, así que los lanzamientos de última generación a veces tardan un día en aparecer. El licenciamiento no comercial en el nivel gratuito es un factor si estás distribuyendo un producto.
Precios:
- Gratis: uso personal, todas las características
- Pagado: LM Studio para Trabajo a precio personalizado para uso comercial
Plataformas: Windows, macOS, Linux
Descargar: LM Studio for desktop
Conclusión: La mejor opción si quieres una GUI para comparar modelos antes de comprometerse.
4. Aider, la mejor programación en pareja CLI
Aider es una aplicación de terminal que trata tu repositorio como el espacio de trabajo compartido. Describes un cambio, Aider averigua qué archivos tocar, los edita, ejecuta las pruebas que le dices y hace commit con un mensaje. Funciona contra cualquier punto final compatible con OpenAI, así que Ollama o LM Studio lo impulsan localmente.
Donde se queda corta: Solo CLI, así que no hay autocompletado dentro de tu editor. Requiere un repositorio git limpio para que su bucle de editar-y-commit sea seguro. Más lento en repositorios muy grandes donde la heurística de selección de archivos tiene más que filtrar.
Precios:
- Gratis: aplicación completa, todas las características
- Pagado: ninguno
Plataformas: Windows, macOS, Linux (paquete Python)
Descargar: Aider on GitHub
Conclusión: La mejor opción cuando prefieres describir un cambio con palabras que hacer clic a través de la interfaz.
5. Cursor, la mejor IDE agentic con enrutamiento local
Cursor es un fork de VS Code enfocado en flujos de trabajo centrados en IA. El modo Agente planifica, edita y prueba en todo el repositorio. Puedes enrutar Cursor a Ollama o cualquier punto final local mediante la configuración “Override OpenAI Base URL”, manteniendo los prompts en tu máquina mientras usas la interfaz agentic de Cursor.
Donde se queda corta: El nivel pagado es donde viven la mayoría de las características de Cursor; el nivel gratuito limita las completaciones y los ejecutes del Agente. El enrutamiento de modelos locales es oficialmente “avanzado”, lo que significa que la configuración está documentada pero no es el predeterminado.
Precios:
- Gratis: 2000 completaciones/mes, Agente limitado
- Pagado: Pro a $20/mes para completaciones ilimitadas, Business a $40/usuario/mes
Plataformas: Windows, macOS, Linux
Descargar: Cursor for desktop
Conclusión: La mejor opción si quieres una IDE agentic y estás dispuesto a configurarla para hablar con un modelo local.
6. Cline, el mejor agente de codificación autónomo dentro de VS Code
Cline es una extensión de VS Code que ejecuta un agente de codificación paso a paso dentro del editor. Lee archivos, escribe ediciones, ejecuta comandos de terminal e informa, todo desde un panel de chat que muestra cada acción antes de aplicarla. Cline funciona con cualquier punto final compatible con OpenAI, así que Ollama en la misma máquina mantiene el bucle completamente local.
Donde se queda corta: Los modelos locales más lentos que 30 tokens/sec hacen que el bucle paso a paso se sienta lento. El modo aprobar-cada-acción es el predeterminado, lo que es más seguro pero añade fricción. Algunas herramientas funcionan mejor con modelos frontera alojados que con locales 14B.
Precios:
- Gratis: extensión, uso ilimitado con tus propios modelos
- Pagado: ninguno
Plataformas: VS Code en Windows, macOS, Linux
Descargar: Cline extension
Conclusión: La mejor opción cuando quieres un bucle de agente real sin ceder el control de la clave de API.
7. Tabby, el mejor Copilot autohospedado
Tabby es una alternativa autohospedada a GitHub Copilot. Ejecuta un servidor que habla el protocolo Copilot, así que cualquier editor con soporte de Copilot (VS Code, JetBrains, Neovim) puede apuntar a él. La imagen Docker es el camino más rápido hacia una configuración funcionando; la aplicación de escritorio en Windows, macOS y Linux ejecuta el mismo servidor detrás de una GUI.
Donde se queda corta: El modelo de completación está bien pero no al nivel de los modelos propietarios de Copilot. Las características de equipo (analytics, políticas) viven en el nivel pagado. RAG sobre tu codebase está disponible pero requiere ajuste.
Precios:
- Gratis: usuario único, completaciones ilimitadas
- Pagado: Plan de Equipo a $19/usuario/mes para analytics y SSO
Plataformas: Windows, macOS, Linux (servidor + plugins de editor)
Descargar: Tabby for desktop
Conclusión: La mejor opción si quieres un sustituto de Copilot listo para usar que tu equipo pueda ejecutar en su propio hardware.
Cómo elegir la correcta
- Si quieres el punto de partida más simple: Ollama más Continue.dev dentro de VS Code.
- Si quieres una ventana de chat mientras comparas modelos: LM Studio.
- Si prefieres describir cambios que hacer clic a través de ellos: Aider.
- Si quieres la experiencia de agente pulida sin bloqueo exclusivo de hosting: Cursor apuntado a un punto final local, o Cline para un bucle completamente local.
- Si necesitas Copilot para un equipo pequeño en tu propio hardware: Tabby.
- Si probaste una herramienta de coding alojada y arruinó tu presupuesto: Cualquiera de las cuatro opciones gratuitas. Un 4090 se paga por sí mismo contra un plan empresarial de $200/mes en un par de meses.
FAQ
¿Cuál es la mejor aplicación LLM local gratuita para coding?
Continue.dev dentro de tu editor, impulsado por Ollama en el fondo, es la pila gratuita más productiva. Aider es la opción más fuerte orientada a CLI. Cline es el mejor bucle de agente gratuito.
¿Estas aplicaciones realmente mantienen mi código privado?
Sí cuando se configuran contra un punto final local. Ollama, LM Studio y Tabby todos ejecutan modelos en tu máquina o LAN. Los wrappers (Continue, Aider, Cline, Cursor) envían prompts a cualquier URL que establezcas, así que apuntar a localhost mantiene todo local. Cursor envía prompts a sus propios servidores por defecto; el override del punto final local es lo que lo cambia.
¿Qué GPU necesito para ejecutar un modelo de coding localmente?
Una tarjeta de 16 GB ejecuta modelos 14B a velocidades utilizables y modelos 34B con cuantización pesada. Una tarjeta de 24 GB ejecuta cómodamente un modelo 34B completo en 4-bit. Solo en CPU, los modelos 7B funcionan pero lo suficientemente lento como para que el bucle se sienta frustrante para cualquier cosa más allá del autocompletado.
¿Puedo usar estas aplicaciones con GitHub Copilot?
Tabby habla el protocolo Copilot y funciona como sustituto. Los otros se ejecutan junto a Copilot en lugar de reemplazarlo. Continue y Cline ambos funcionan bien con Copilot habilitado en el mismo editor.
¿Cuál es el mejor modelo local para coding ahora mismo?
Para coding general, Qwen 3 Coder 30B y DeepSeek-Coder-V2 16B son las opciones más fuertes que caben en una tarjeta de 24 GB. Para una tarjeta de 16 GB, Qwen 3 Coder 14B y Codestral 22B (Q4) alcanzan el punto dulce. Los cuatro se ejecutan en Ollama y LM Studio de forma inmediata.