MLC Chat ejecutando un LLM cuantizado en Android

Las mejores aplicaciones para ejecutar LLMs cuantizados en dispositivo en Android en 2026

Q4_K_M, Q5_K_S, Q8_0. Si esas etiquetas aún no significan nada para ti, son la razón por la que un modelo de 7 mil millones de parámetros ahora cabe en un teléfono de 6 GB. La cuantización reduce los pesos del modelo de flotantes de 16 bits a enteros de 4 bits, que reducen un modelo de chat de 14 GB a menos de 5 GB y permite que tu teléfono lo ejecute sin factura de API en la nube.

Probamos siete aplicaciones en un Pixel 8 y una tablet Snapdragon 8 Gen 2. Lo que nos importó: qué aplicaciones cargaban pesos cuantizados GGUF y MLC sin una laptop de por medio, cuáles funcionaban sin conexión en modo avión, y cuáles mantenían una conversación sin ralentizarse por regulación térmica.

Qué buscar en una aplicación de LLM en dispositivo

Comparación rápida

Aplicación Mejor para Plan gratuito Precio inicial/mes Valoración
MLC Chat Kernels MLC compilados, mejor rendimiento Sí (código abierto) Gratuito 4.4
PocketPal AI Modelos GGUF con catálogo amigable Sí (código abierto) Gratuito 4.6
Layla Chats de rol y contexto largo Nivel gratuito $9.99 de una sola vez 4.5
Sherpa Línea de comandos llama.cpp mínima Sí (código abierto) Gratuito 4.2
LLMFarm Companion Sincronización de modelos entre dispositivos $4.99 de una sola vez 4.3
ChatterUI Frontend de chat multimodelo Sí (código abierto) Gratuito 4.5
Enchanted Frontend para servidor Ollama casero Sí (código abierto) Gratuito 4.4

Las aplicaciones

1. MLC Chat — Mejor para kernels MLC compilados y máximo rendimiento

MLC Chat incluye modelos precompilados optimizados para la GPU Adreno o Mali exacta de tu teléfono. Ese paso de compilación es lo que permite que un modelo Phi de 3 mil millones de parámetros se ejecute a más de 15 tokens por segundo en un Pixel 8, aproximadamente el doble de lo que logra un runtime GGUF genérico. El catálogo dentro de la aplicación es corto pero seleccionado: Llama, Phi, Gemma, Mistral, RedPajama.

Dónde se queda corta: Sin soporte para archivos GGUF arbitrarios. Si ya tienes un modelo descargado, no puedes cargarlo aquí sin recompilarlo para MLC.

Precio:

Plataformas: Android 8.0 y superior.

Descargar: Aptoide

Resumen: Elige MLC Chat cuando importe al máximo el número de tokens por segundo y puedas vivir con un catálogo fijo.

2. PocketPal AI — Mejor para modelos GGUF con catálogo amigable

PocketPal AI carga cualquier GGUF al que le indiques. La búsqueda dentro de la aplicación navega por Hugging Face sin cambiar a un navegador, y la pantalla de descarga muestra el nivel de cuantización, el tamaño y una estimación aproximada de tokens por segundo para tu dispositivo antes de que comprometas 4 GB del disco. El historial de chat permanece en el dispositivo.

Dónde se queda corta: La aceleración GPU se queda atrás de MLC en el mismo teléfono. Las conversaciones de contexto largo consumen RAM rápidamente en dispositivos de 6 GB.

Precio:

Plataformas: Android 9.0 y superior.

Descargar: Google Play

Resumen: La forma más amigable para cualquiera que sea nuevo en la cuantización GGUF en Android.

3. Layla — Mejor para chats de rol y contexto largo

Layla se dirige a la comunidad de rol y escritura de historias largas. Incluye plantillas de indicaciones, importaciones de tarjetas de personajes y ventanas de contexto más grandes ajustadas para mantener la continuidad de la historia en muchos turnos. Ejecuta GGUF localmente; un nivel pago añade entrada de voz y modelos premium.

Dónde se queda corta: La interfaz es ocupada. Algunos personajes predefinidos tienen temática para adultos; el filtro de seguridad necesita ajuste manual para uso familiar.

Precio:

Plataformas: Android 9.0 y superior.

Descargar: Google Play

Resumen: Elige Layla si la razón por la que quieres un modelo local es escritura de ficción que un modelo en la nube rechazaría.

4. Sherpa — Mejor para una línea de comandos llama.cpp mínima

Sherpa es la aplicación para personas que ya saben lo que quieren. Apunta a un archivo GGUF en la tarjeta SD, establece tu longitud de contexto y número de hilos, y listo. Sin catálogo, sin sincronización, sin código innecesario.

Dónde se queda corta: Sin orientación. Los principiantes pueden cargar un modelo que no cabra y bloquear la aplicación.

Precio:

Plataformas: Android 8.0 y superior.

Descargar: F-Droid

Resumen: Para usuarios avanzados que quieren un runtime llama.cpp sin un envoltorio de aplicación de chat.

5. LLMFarm Companion — Mejor para sincronización de modelos entre dispositivos

LLMFarm comenzó en iOS y tiene un complemento Android que refleja el mismo catálogo y biblioteca de indicaciones. Útil si divides tu tiempo entre un iPad y una tablet Android y quieres los mismos personajes e indicaciones del sistema en ambos.

Dónde se queda corta: Menos alternadores de formato que PocketPal. El soporte GPU en Adreno aún se está poniendo al día.

Precio:

Plataformas: Android 10 y superior.

Descargar: Google Play

Resumen: Elige esto si ya usas LLMFarm en iOS y quieres paridad de indicaciones.

6. ChatterUI — Mejor frontend de chat multimodelo

ChatterUI trata cada backend igual, ya sea que estés ejecutando llama.cpp en el teléfono, KoboldCpp en una laptop, u Ollama en un servidor casero. Cambia a mitad de conversación de un modelo local pequeño a uno remoto más potente sin perder el hilo.

Dónde se queda corta: Configuración pesada en el primer lanzamiento. Sin opinión sobre qué modelo elegir, así que los principiantes se quedan atrapados en el selector.

Precio:

Plataformas: Android 8.0 y superior.

Descargar: GitHub Releases

Resumen: La opción correcta cuando el teléfono es solo uno de varios lugares donde ejecutas inferencia.

7. Enchanted — Mejor frontend para servidor Ollama casero

Enchanted no es en sí un motor en dispositivo. Es una aplicación de chat pulida que se comunica con una instancia Ollama que ejecutas en una laptop o servidor casero. En movimiento, usa un modelo cuantizado local en una de las aplicaciones anteriores; en casa, abre Enchanted para un modelo más grande que tu teléfono no puede alojar.

Dónde se queda corta: Necesita una máquina ejecutando Ollama en algún lugar. Requiere un túnel o accesibilidad LAN para uso remoto.

Precio:

Plataformas: Android 9.0 y superior.

Descargar: GitHub Releases

Resumen: Combínalo con cualquier aplicación en dispositivo para los días en que tu teléfono no puede albergar el modelo que quieres.

Cómo elegir la correcta

Los acrónimos son menos aterradores una vez que los usas. Un cuant Q4_K_M de Llama 3.1 8B cabe cómodamente en cualquier teléfono de 8 GB; un Q8_0 de Phi-3 Mini funciona sorprendentemente bien en uno de 6 GB. Comienza ahí, observa los tokens por segundo y sube o baja según sea necesario.

Preguntas frecuentes

¿Qué significa realmente Q4_K_M?

Q4 significa cuantización de 4 bits de los pesos del modelo. K se refiere a k-quants, una agrupación más inteligente introducida por llama.cpp. M es la variante media, que mezcla algunos tensores de 5 bits para calidad. En la práctica: Q4_K_M es el nivel “predeterminado lo suficientemente bueno”.

¿Cuánta RAM necesita un modelo en dispositivo?

Regla general: tamaño del archivo del modelo más 30% para el runtime y caché de contexto. Un modelo de 4 GB necesita aproximadamente 5.5 GB libres. Los teléfonos con 8 GB o más de RAM manejan modelos de parámetros 7B en Q4; los teléfonos de 6 GB se adhieren a 3B.

¿Se sobrecalentará mi teléfono?

La inferencia sostenida en un teléfono de gama media se regulará térmicamente en cuestión de minutos. Prefiere dispositivos Snapdragon 8 Gen 2/3 o Tensor G4 más nuevos, y mantén el teléfono fuera de una superficie blanda mientras se ejecuta.

¿Estas aplicaciones envían mis indicaciones a algún lugar?

La inferencia en dispositivo permanece en el dispositivo. Enchanted y ChatterUI son excepciones cuando se configuran para hablar con un backend remoto. Lee los avisos de red de cada aplicación en el primer lanzamiento.

¿Con qué modelo debería empezar?

Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M, o Gemma 2 2B son los puntos de partida seguros para un teléfono Android moderno. Sube a Llama 3.1 8B si el dispositivo tiene 12 GB de RAM o más.