PocketPal AI ejecutando un modelo de lenguaje local en Android

Un teléfono insignia moderno tiene más RAM que la mayoría de las computadoras portátiles que se enviaron hace cinco años, y nunca deja el bolsillo del usuario. Esa combinación finalmente es suficiente para ejecutar modelos de lenguaje cuantificados de 4B y 7B en el dispositivo: sin facturas de API, sin datos saliendo del teléfono, sin limitación cuando el Wi-Fi del avión se cae. Probamos seis aplicaciones de Android que hacen que la inferencia LLM local sea práctica, desde descargas de un solo toque hasta flexibilidad a nivel de Termux. Estas son las mejores aplicaciones para ejecutar LLM locales en teléfonos Android en 2026.

Qué buscar en una aplicación LLM local

Los compromisos son siempre los mismos: calidad de modelo contra presión de memoria, latencia contra drenaje de batería, facilidad de configuración contra control.

Comparación rápida

Aplicación Mejor para Catálogo de modelos Contexto máx. Código abierto
PocketPal AI Kit de inicio GGUF de Hugging Face 8k predeterminado Sí
MLC Chat Inferencia acelerada por GPU MLC precompilado 4k-8k Sí
ChatterUI Juego de rol y personalidades Ruta GGUF cualquiera 16k+ Sí
Layla Lite Chat de personaje llave en mano GGUF seleccionado 8k Freemium
Termux Ejecutando llama.cpp directamente Cualquier cosa Depende del modelo Sí
Google AI Edge Gallery Demostración de Gemma y Phi Catálogo de Google 4k Sí

Las 6 mejores aplicaciones LLM locales para Android en 2026

1. PocketPal AI, el kit de inicio

PocketPal AI es la aplicación a recomendar primero. La descarga del modelo es un navegador Hugging Face que se puede buscar dentro de la aplicación, la cuantificación se elige en una lista desplegable e la inferencia usa llama.cpp bajo el capó. Cargar un modelo 3B Q4_K_M en un teléfono con 12 GB de RAM toma aproximadamente diez segundos. La interfaz de chat admite indicaciones del sistema, edición de mensajes y un modo de referencia que informa de tokens por segundo.

La compilación 2026 agregó un modo de finalización de texto junto al chat, que es útil para flujos de trabajo al estilo de autocompletar en lugar de solo preguntas y respuestas basadas en turnos.

Dónde queda corto: La configuración predeterminada favorece la velocidad sobre la calidad en teléfonos de gama media. Los chats persistentes viven en un archivo SQLite sin encriptación en reposo.

Precio:

Plataformas: Android 8.0 y posterior, mejor en chips con 8 GB de RAM o más.

Descargar: AptoideGoogle Play

En conclusión: Instale esto primero. Es la plataforma de lanzamiento para la inferencia local en Android.


2. MLC Chat, la opción acelerada por GPU

MLC Chat viene con modelos precompilados compilados para el backend Vulkan u OpenCL del teléfono por el equipo de MLC-LLM. En un Snapdragon 8 Gen 3 o Tensor G4, eso significa tokens por segundo notablemente mejores que una compilación pura llama.cpp de CPU. La selección del modelo es estrecha pero seleccionada: las compilaciones de las familias Gemma, Phi y Llama están todas incluidas.

El compromiso es flexibilidad. Los modelos de MLC se recompilan por los mantenedores, por lo que una nueva carga de Hugging Face tarda una o dos semanas en llegar.

Dónde queda corto: Sin importaciones de modelos personalizados. El backend GPU compite con el administrador de memoria compartida del sistema operativo en algunas compilaciones de Samsung, causando bloqueos ocasionales.

Precio:

Plataformas: Android 8.0 y posterior, GPU con Vulkan u OpenCL.

Descargar: Google Play

En conclusión: Mejor velocidad pura en el dispositivo cuando el usuario está dispuesto a ejecutar solo lo que MLC ha precompilado.


3. ChatterUI, el frontend de juego de rol y personalidades

ChatterUI es un frontend completo para inferencia local con tarjetas de caracteres al estilo SillyTavern, deslizamiento de mensajes, chats grupales y indicadores del sistema por personaje. Carga cualquier GGUF del almacenamiento local, lo que lo convierte en la opción para usuarios que ya tienen una colección de Hugging Face en caché.

El selector de plantilla de instrucción es importante aquí: la falta de coincidencia de una plantilla de chat de Mistral en una compilación de Llama-3 daña la calidad, y ChatterUI expone la opción explícitamente.

Dónde queda corto: La configuración es la más pronunciada en esta lista. La primera ejecución pide al usuario que señale un archivo de modelo, elija una plantilla de chat y establezca una longitud de contexto antes de hacer cualquier cosa.

Precio:

Plataformas: Android 8.0 y posterior.

Descargar: F-Droid

En conclusión: Para usuarios avanzados que quieren SillyTavern en el teléfono.


4. Layla Lite, el chat de personaje llave en mano

Layla Lite es una compilación depurada de Layla AI con un catálogo de modelos seleccionados y una interfaz de chat de personaje destinada a usuarios que desean hablar con un asistente en el teléfono sin elegir plantillas de chat. Las descargas se cuantizan de antemano y se nombran según la personalidad en lugar del modelo subyacente, lo que es más amable para cualquiera que sea nuevo en el espacio.

El Layla de pago trae texto a voz, generación de imágenes en el dispositivo e entradas de visión.

Dónde queda corto: El nivel gratuito limita la selección del modelo. La voz de personaje en la compilación gratuita está atrapada en los modelos pequeños.

Precio:

Plataformas: Android 9.0 y posterior.

Descargar: Google Play

En conclusión: La opción para usuarios que desean chat en el dispositivo sin configurar nada.


5. Termux, la opción DIY

Termux no es una aplicación LLM, es un shell Linux completo que ejecuta llama.cpp, binarios Ollama y pilas de inferencia Python de forma nativa. Para cualquiera que ya ejecute modelos locales en una computadora portátil, Termux es el camino más corto hacia el mismo flujo de trabajo en el teléfono: pkg install llama-cpp, coloque GGUF en ~/models, ejecute.

Emparejado con el complemento Termux:API para crear scripts de inferencia desde Tasker o un atajo, que es lo más cercano que Android tiene a una tecla de acceso rápido para el modelo local.

Dónde queda corto: La compilación de Play Store está desactualizada. Use la versión F-Droid o GitHub. La configuración es un shell, no una interfaz de usuario.

Precio:

Plataformas: Android 7.0 y posterior.

Descargar: F-Droid

En conclusión: Para usuarios que prefieren el CLI que ya conocen.


Google AI Edge Gallery es la vitrina oficial de inferencia en el dispositivo de Google. Viene con variantes Gemma y Phi preconfiguradas para la API de Inferencia LLM de MediaPipe, más flujos de ejemplo para chat, resumen y comprensión de imágenes. Es la forma más rápida de ver cómo se siente un modelo Gemma moderno en un teléfono sin elegir una compilación o cuantificación.

El formato de galería también sirve como referencia: cada tarjeta de modelo enumera tokens por segundo en el dispositivo, por lo que el usuario puede comparar un Pixel 9 Pro contra un Snapdragon de gama media en menos de un minuto.

Dónde queda corto: Limitado a las opciones de Google. No es un cliente de chat de propósito general.

Precio:

Plataformas: Android 12 y posterior.

Descargar: F-Droid

En conclusión: La demostración limpia para juzgar si la inferencia en el dispositivo es lo suficientemente rápida en un teléfono determinado antes de instalar algo más pesado.

Cómo elegir el correcto

Preguntas frecuentes

¿Cuánta RAM necesita un teléfono Android para ejecutar un modelo de lenguaje de 7B?
Un modelo 7B Q4_K_M cuantificado necesita aproximadamente 4,5 GB de RAM para ejecutarse a una velocidad utilizable, más espacio para el sistema operativo y las aplicaciones de fondo. En la práctica, un teléfono de 8 GB funciona si el usuario cierra las pestañas de fondo; los teléfonos de 12 GB o 16 GB lo manejan sin notarlo.

¿Las aplicaciones LLM locales agotan la batería?
La inferencia activa es pesada, similar a una videollamada. Las aplicaciones inactivas no utilizan batería porque los modelos se descargan de la memoria entre chats.

¿Puedo ejecutar un modelo local sin conexión a Internet?
Sí, ese es el punto. Las descargas del modelo necesitan Internet, pero la inferencia es completamente offline después.

¿Qué cuantificación debo elegir?
Q4_K_M es el valor predeterminado que funciona en la mayoría de los teléfonos. Q5_K_M es mejor si hay RAM de repuesto. Por debajo de Q4, la calidad cae abruptamente y rara vez vale la pena ahorrar memoria.