
Las mejores aplicaciones para ejecutar LLMs cuantizados en dispositivo en Android en 2026
Q4_K_M, Q5_K_S, Q8_0. Si esas etiquetas aún no significan nada para ti, son la razón por la que un modelo de 7 mil millones de parámetros ahora cabe en un teléfono de 6 GB. La cuantización reduce los pesos del modelo de flotantes de 16 bits a enteros de 4 bits, que reducen un modelo de chat de 14 GB a menos de 5 GB y permite que tu teléfono lo ejecute sin factura de API en la nube.
Probamos siete aplicaciones en un Pixel 8 y una tablet Snapdragon 8 Gen 2. Lo que nos importó: qué aplicaciones cargaban pesos cuantizados GGUF y MLC sin una laptop de por medio, cuáles funcionaban sin conexión en modo avión, y cuáles mantenían una conversación sin ralentizarse por regulación térmica.
Qué buscar en una aplicación de LLM en dispositivo
- Soporte para formatos de cuantización comunes: GGUF (estilo llama.cpp) o MLC (kernels compilados).
- Un catálogo de modelos que puedas navegar sin pegar URLs de Hugging Face.
- Historial de chat persistente guardado localmente, no transmitido a un servidor.
- Lectura de tokens por segundo, para que sepas cuándo un modelo es demasiado pesado para el teléfono.
- Alternadores de inferencia CPU vs GPU vs NPU, ya que un NPU Snapdragon 8-series puede duplicar el rendimiento.
- Funcionamiento en modo avión. Si necesita Wi-Fi para responder “hola”, no está en dispositivo.
Comparación rápida
| Aplicación | Mejor para | Plan gratuito | Precio inicial/mes | Valoración |
|---|---|---|---|---|
| MLC Chat | Kernels MLC compilados, mejor rendimiento | Sí (código abierto) | Gratuito | 4.4 |
| PocketPal AI | Modelos GGUF con catálogo amigable | Sí (código abierto) | Gratuito | 4.6 |
| Layla | Chats de rol y contexto largo | Nivel gratuito | $9.99 de una sola vez | 4.5 |
| Sherpa | Línea de comandos llama.cpp mínima | Sí (código abierto) | Gratuito | 4.2 |
| LLMFarm Companion | Sincronización de modelos entre dispositivos | Sí | $4.99 de una sola vez | 4.3 |
| ChatterUI | Frontend de chat multimodelo | Sí (código abierto) | Gratuito | 4.5 |
| Enchanted | Frontend para servidor Ollama casero | Sí (código abierto) | Gratuito | 4.4 |
Las aplicaciones
1. MLC Chat — Mejor para kernels MLC compilados y máximo rendimiento
MLC Chat incluye modelos precompilados optimizados para la GPU Adreno o Mali exacta de tu teléfono. Ese paso de compilación es lo que permite que un modelo Phi de 3 mil millones de parámetros se ejecute a más de 15 tokens por segundo en un Pixel 8, aproximadamente el doble de lo que logra un runtime GGUF genérico. El catálogo dentro de la aplicación es corto pero seleccionado: Llama, Phi, Gemma, Mistral, RedPajama.
Dónde se queda corta: Sin soporte para archivos GGUF arbitrarios. Si ya tienes un modelo descargado, no puedes cargarlo aquí sin recompilarlo para MLC.
Precio:
- Gratuito: Código abierto Apache 2.0.
- Pago: N/A.
Plataformas: Android 8.0 y superior.
Resumen: Elige MLC Chat cuando importe al máximo el número de tokens por segundo y puedas vivir con un catálogo fijo.
2. PocketPal AI — Mejor para modelos GGUF con catálogo amigable
PocketPal AI carga cualquier GGUF al que le indiques. La búsqueda dentro de la aplicación navega por Hugging Face sin cambiar a un navegador, y la pantalla de descarga muestra el nivel de cuantización, el tamaño y una estimación aproximada de tokens por segundo para tu dispositivo antes de que comprometas 4 GB del disco. El historial de chat permanece en el dispositivo.
Dónde se queda corta: La aceleración GPU se queda atrás de MLC en el mismo teléfono. Las conversaciones de contexto largo consumen RAM rápidamente en dispositivos de 6 GB.
Precio:
- Gratuito: Código abierto con licencia MIT.
- Pago: N/A.
Plataformas: Android 9.0 y superior.
Resumen: La forma más amigable para cualquiera que sea nuevo en la cuantización GGUF en Android.
3. Layla — Mejor para chats de rol y contexto largo
Layla se dirige a la comunidad de rol y escritura de historias largas. Incluye plantillas de indicaciones, importaciones de tarjetas de personajes y ventanas de contexto más grandes ajustadas para mantener la continuidad de la historia en muchos turnos. Ejecuta GGUF localmente; un nivel pago añade entrada de voz y modelos premium.
Dónde se queda corta: La interfaz es ocupada. Algunos personajes predefinidos tienen temática para adultos; el filtro de seguridad necesita ajuste manual para uso familiar.
Precio:
- Gratuito: Chat base con un par de modelos preestablecidos.
- Pago: $9.99 de una sola vez (Pro) desbloquea voz, modelos más grandes y sincronización en la nube.
Plataformas: Android 9.0 y superior.
Resumen: Elige Layla si la razón por la que quieres un modelo local es escritura de ficción que un modelo en la nube rechazaría.
4. Sherpa — Mejor para una línea de comandos llama.cpp mínima
Sherpa es la aplicación para personas que ya saben lo que quieren. Apunta a un archivo GGUF en la tarjeta SD, establece tu longitud de contexto y número de hilos, y listo. Sin catálogo, sin sincronización, sin código innecesario.
Dónde se queda corta: Sin orientación. Los principiantes pueden cargar un modelo que no cabra y bloquear la aplicación.
Precio:
- Gratuito: Licencia MIT.
- Pago: N/A.
Plataformas: Android 8.0 y superior.
Resumen: Para usuarios avanzados que quieren un runtime llama.cpp sin un envoltorio de aplicación de chat.
5. LLMFarm Companion — Mejor para sincronización de modelos entre dispositivos
LLMFarm comenzó en iOS y tiene un complemento Android que refleja el mismo catálogo y biblioteca de indicaciones. Útil si divides tu tiempo entre un iPad y una tablet Android y quieres los mismos personajes e indicaciones del sistema en ambos.
Dónde se queda corta: Menos alternadores de formato que PocketPal. El soporte GPU en Adreno aún se está poniendo al día.
Precio:
- Gratuito: Chat base.
- Pago: $4.99 de una sola vez elimina las restricciones de tamaño de modelo.
Plataformas: Android 10 y superior.
Resumen: Elige esto si ya usas LLMFarm en iOS y quieres paridad de indicaciones.
6. ChatterUI — Mejor frontend de chat multimodelo
ChatterUI trata cada backend igual, ya sea que estés ejecutando llama.cpp en el teléfono, KoboldCpp en una laptop, u Ollama en un servidor casero. Cambia a mitad de conversación de un modelo local pequeño a uno remoto más potente sin perder el hilo.
Dónde se queda corta: Configuración pesada en el primer lanzamiento. Sin opinión sobre qué modelo elegir, así que los principiantes se quedan atrapados en el selector.
Precio:
- Gratuito: Código abierto GPLv3.
- Pago: N/A.
Plataformas: Android 8.0 y superior.
Descargar: GitHub Releases
Resumen: La opción correcta cuando el teléfono es solo uno de varios lugares donde ejecutas inferencia.
7. Enchanted — Mejor frontend para servidor Ollama casero
Enchanted no es en sí un motor en dispositivo. Es una aplicación de chat pulida que se comunica con una instancia Ollama que ejecutas en una laptop o servidor casero. En movimiento, usa un modelo cuantizado local en una de las aplicaciones anteriores; en casa, abre Enchanted para un modelo más grande que tu teléfono no puede alojar.
Dónde se queda corta: Necesita una máquina ejecutando Ollama en algún lugar. Requiere un túnel o accesibilidad LAN para uso remoto.
Precio:
- Gratuito: Código abierto MIT.
- Pago: N/A.
Plataformas: Android 9.0 y superior.
Descargar: GitHub Releases
Resumen: Combínalo con cualquier aplicación en dispositivo para los días en que tu teléfono no puede albergar el modelo que quieres.
Cómo elegir la correcta
- Si quieres los tokens por segundo más rápidos y puedes vivir con un catálogo fijo: elige MLC Chat.
- Si quieres navegar y descargar modelos GGUF de Hugging Face dentro de la aplicación: elige PocketPal AI.
- Si tu objetivo es escribir ficción y chats de contexto largo: elige Layla.
- Si ya conoces llama.cpp y quieres una línea de comandos mínima: elige Sherpa.
- Si divides tu tiempo entre iOS y Android: elige LLMFarm Companion.
- Si quieres cambiar entre backends locales y remotos a mitad del chat: elige ChatterUI.
- Si un servidor Ollama casero es tu principal anfitrión de modelos: combina Enchanted con uno de los anteriores para días sin conexión.
Los acrónimos son menos aterradores una vez que los usas. Un cuant Q4_K_M de Llama 3.1 8B cabe cómodamente en cualquier teléfono de 8 GB; un Q8_0 de Phi-3 Mini funciona sorprendentemente bien en uno de 6 GB. Comienza ahí, observa los tokens por segundo y sube o baja según sea necesario.
Preguntas frecuentes
¿Qué significa realmente Q4_K_M?
Q4 significa cuantización de 4 bits de los pesos del modelo. K se refiere a k-quants, una agrupación más inteligente introducida por llama.cpp. M es la variante media, que mezcla algunos tensores de 5 bits para calidad. En la práctica: Q4_K_M es el nivel “predeterminado lo suficientemente bueno”.
¿Cuánta RAM necesita un modelo en dispositivo?
Regla general: tamaño del archivo del modelo más 30% para el runtime y caché de contexto. Un modelo de 4 GB necesita aproximadamente 5.5 GB libres. Los teléfonos con 8 GB o más de RAM manejan modelos de parámetros 7B en Q4; los teléfonos de 6 GB se adhieren a 3B.
¿Se sobrecalentará mi teléfono?
La inferencia sostenida en un teléfono de gama media se regulará térmicamente en cuestión de minutos. Prefiere dispositivos Snapdragon 8 Gen 2/3 o Tensor G4 más nuevos, y mantén el teléfono fuera de una superficie blanda mientras se ejecuta.
¿Estas aplicaciones envían mis indicaciones a algún lugar?
La inferencia en dispositivo permanece en el dispositivo. Enchanted y ChatterUI son excepciones cuando se configuran para hablar con un backend remoto. Lee los avisos de red de cada aplicación en el primer lanzamiento.
¿Con qué modelo debería empezar?
Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M, o Gemma 2 2B son los puntos de partida seguros para un teléfono Android moderno. Sube a Llama 3.1 8B si el dispositivo tiene 12 GB de RAM o más.