
Un teléfono insignia moderno tiene más RAM que la mayoría de las computadoras portátiles que se enviaron hace cinco años, y nunca deja el bolsillo del usuario. Esa combinación finalmente es suficiente para ejecutar modelos de lenguaje cuantificados de 4B y 7B en el dispositivo: sin facturas de API, sin datos saliendo del teléfono, sin limitación cuando el Wi-Fi del avión se cae. Probamos seis aplicaciones de Android que hacen que la inferencia LLM local sea práctica, desde descargas de un solo toque hasta flexibilidad a nivel de Termux. Estas son las mejores aplicaciones para ejecutar LLM locales en teléfonos Android en 2026.
Qué buscar en una aplicación LLM local
Los compromisos son siempre los mismos: calidad de modelo contra presión de memoria, latencia contra drenaje de batería, facilidad de configuración contra control.
- Catálogo de modelos. Los modelos GGUF y MLC deberían estar a un toque, no a una descarga manual de Hugging Face.
- Cuantificación. Q4_K_M y Q5_K_M importan más que el recuento de parámetros brutos en un teléfono.
- Ventana de contexto. 8k es practicable, 32k es cómodo, cualquier cosa más pequeña se siente estrecha en 2026.
- Techo de memoria. Un teléfono con 8 GB de RAM utilizable apenas puede contener un modelo 7B Q4 más el sistema operativo.
- Aislamiento de fondo. Un teléfono que OOM durante una videollamada porque el LLM se niega a descargar no es utilizable.
- Compatibilidad de API. Un punto final local compatible con OpenAI significa que otras aplicaciones en el teléfono pueden apuntar hacia él.
Comparación rápida
| Aplicación | Mejor para | Catálogo de modelos | Contexto máx. | Código abierto |
|---|---|---|---|---|
| PocketPal AI | Kit de inicio | GGUF de Hugging Face | 8k predeterminado | Sí |
| MLC Chat | Inferencia acelerada por GPU | MLC precompilado | 4k-8k | Sí |
| ChatterUI | Juego de rol y personalidades | Ruta GGUF cualquiera | 16k+ | Sí |
| Layla Lite | Chat de personaje llave en mano | GGUF seleccionado | 8k | Freemium |
| Termux | Ejecutando llama.cpp directamente | Cualquier cosa | Depende del modelo | Sí |
| Google AI Edge Gallery | Demostración de Gemma y Phi | Catálogo de Google | 4k | Sí |
Las 6 mejores aplicaciones LLM locales para Android en 2026
1. PocketPal AI, el kit de inicio
PocketPal AI es la aplicación a recomendar primero. La descarga del modelo es un navegador Hugging Face que se puede buscar dentro de la aplicación, la cuantificación se elige en una lista desplegable e la inferencia usa llama.cpp bajo el capó. Cargar un modelo 3B Q4_K_M en un teléfono con 12 GB de RAM toma aproximadamente diez segundos. La interfaz de chat admite indicaciones del sistema, edición de mensajes y un modo de referencia que informa de tokens por segundo.
La compilación 2026 agregó un modo de finalización de texto junto al chat, que es útil para flujos de trabajo al estilo de autocompletar en lugar de solo preguntas y respuestas basadas en turnos.
Dónde queda corto: La configuración predeterminada favorece la velocidad sobre la calidad en teléfonos de gama media. Los chats persistentes viven en un archivo SQLite sin encriptación en reposo.
Precio:
- Gratis, código abierto (MIT).
Plataformas: Android 8.0 y posterior, mejor en chips con 8 GB de RAM o más.
En conclusión: Instale esto primero. Es la plataforma de lanzamiento para la inferencia local en Android.
2. MLC Chat, la opción acelerada por GPU
MLC Chat viene con modelos precompilados compilados para el backend Vulkan u OpenCL del teléfono por el equipo de MLC-LLM. En un Snapdragon 8 Gen 3 o Tensor G4, eso significa tokens por segundo notablemente mejores que una compilación pura llama.cpp de CPU. La selección del modelo es estrecha pero seleccionada: las compilaciones de las familias Gemma, Phi y Llama están todas incluidas.
El compromiso es flexibilidad. Los modelos de MLC se recompilan por los mantenedores, por lo que una nueva carga de Hugging Face tarda una o dos semanas en llegar.
Dónde queda corto: Sin importaciones de modelos personalizados. El backend GPU compite con el administrador de memoria compartida del sistema operativo en algunas compilaciones de Samsung, causando bloqueos ocasionales.
Precio:
- Gratis, código abierto (Apache-2.0).
Plataformas: Android 8.0 y posterior, GPU con Vulkan u OpenCL.
En conclusión: Mejor velocidad pura en el dispositivo cuando el usuario está dispuesto a ejecutar solo lo que MLC ha precompilado.
3. ChatterUI, el frontend de juego de rol y personalidades
ChatterUI es un frontend completo para inferencia local con tarjetas de caracteres al estilo SillyTavern, deslizamiento de mensajes, chats grupales y indicadores del sistema por personaje. Carga cualquier GGUF del almacenamiento local, lo que lo convierte en la opción para usuarios que ya tienen una colección de Hugging Face en caché.
El selector de plantilla de instrucción es importante aquí: la falta de coincidencia de una plantilla de chat de Mistral en una compilación de Llama-3 daña la calidad, y ChatterUI expone la opción explícitamente.
Dónde queda corto: La configuración es la más pronunciada en esta lista. La primera ejecución pide al usuario que señale un archivo de modelo, elija una plantilla de chat y establezca una longitud de contexto antes de hacer cualquier cosa.
Precio:
- Gratis, código abierto (AGPL-3.0).
Plataformas: Android 8.0 y posterior.
En conclusión: Para usuarios avanzados que quieren SillyTavern en el teléfono.
4. Layla Lite, el chat de personaje llave en mano
Layla Lite es una compilación depurada de Layla AI con un catálogo de modelos seleccionados y una interfaz de chat de personaje destinada a usuarios que desean hablar con un asistente en el teléfono sin elegir plantillas de chat. Las descargas se cuantizan de antemano y se nombran según la personalidad en lugar del modelo subyacente, lo que es más amable para cualquiera que sea nuevo en el espacio.
El Layla de pago trae texto a voz, generación de imágenes en el dispositivo e entradas de visión.
Dónde queda corto: El nivel gratuito limita la selección del modelo. La voz de personaje en la compilación gratuita está atrapada en los modelos pequeños.
Precio:
- Nivel gratuito con un pequeño catálogo seleccionado.
- El nivel de pago desbloquea modelos más grandes, voz y flujos de trabajo de imágenes.
Plataformas: Android 9.0 y posterior.
En conclusión: La opción para usuarios que desean chat en el dispositivo sin configurar nada.
5. Termux, la opción DIY
Termux no es una aplicación LLM, es un shell Linux completo que ejecuta llama.cpp, binarios Ollama y pilas de inferencia Python de forma nativa. Para cualquiera que ya ejecute modelos locales en una computadora portátil, Termux es el camino más corto hacia el mismo flujo de trabajo en el teléfono: pkg install llama-cpp, coloque GGUF en ~/models, ejecute.
Emparejado con el complemento Termux:API para crear scripts de inferencia desde Tasker o un atajo, que es lo más cercano que Android tiene a una tecla de acceso rápido para el modelo local.
Dónde queda corto: La compilación de Play Store está desactualizada. Use la versión F-Droid o GitHub. La configuración es un shell, no una interfaz de usuario.
Precio:
- Gratis, código abierto (GPL-3.0).
Plataformas: Android 7.0 y posterior.
En conclusión: Para usuarios que prefieren el CLI que ya conocen.
6. Google AI Edge Gallery, la caja de demostración de Gemma
Google AI Edge Gallery es la vitrina oficial de inferencia en el dispositivo de Google. Viene con variantes Gemma y Phi preconfiguradas para la API de Inferencia LLM de MediaPipe, más flujos de ejemplo para chat, resumen y comprensión de imágenes. Es la forma más rápida de ver cómo se siente un modelo Gemma moderno en un teléfono sin elegir una compilación o cuantificación.
El formato de galería también sirve como referencia: cada tarjeta de modelo enumera tokens por segundo en el dispositivo, por lo que el usuario puede comparar un Pixel 9 Pro contra un Snapdragon de gama media en menos de un minuto.
Dónde queda corto: Limitado a las opciones de Google. No es un cliente de chat de propósito general.
Precio:
- Gratis, código abierto (Apache-2.0).
Plataformas: Android 12 y posterior.
En conclusión: La demostración limpia para juzgar si la inferencia en el dispositivo es lo suficientemente rápida en un teléfono determinado antes de instalar algo más pesado.
Cómo elegir el correcto
- Si este es su primer modelo local: PocketPal AI.
- Si la velocidad importa más que la selección del modelo: MLC Chat.
- Si desea personalidades y contexto largo: ChatterUI.
- Si desea un asistente precargado sin configuración: Layla Lite.
- Si ya ejecuta llama.cpp en una computadora portátil: Termux con el paquete llama.cpp.
- Si desea un benchmark antes de decidir: Google AI Edge Gallery.
Preguntas frecuentes
¿Cuánta RAM necesita un teléfono Android para ejecutar un modelo de lenguaje de 7B?
Un modelo 7B Q4_K_M cuantificado necesita aproximadamente 4,5 GB de RAM para ejecutarse a una velocidad utilizable, más espacio para el sistema operativo y las aplicaciones de fondo. En la práctica, un teléfono de 8 GB funciona si el usuario cierra las pestañas de fondo; los teléfonos de 12 GB o 16 GB lo manejan sin notarlo.
¿Las aplicaciones LLM locales agotan la batería?
La inferencia activa es pesada, similar a una videollamada. Las aplicaciones inactivas no utilizan batería porque los modelos se descargan de la memoria entre chats.
¿Puedo ejecutar un modelo local sin conexión a Internet?
Sí, ese es el punto. Las descargas del modelo necesitan Internet, pero la inferencia es completamente offline después.
¿Qué cuantificación debo elegir?
Q4_K_M es el valor predeterminado que funciona en la mayoría de los teléfonos. Q5_K_M es mejor si hay RAM de repuesto. Por debajo de Q4, la calidad cae abruptamente y rara vez vale la pena ahorrar memoria.