Un teléfono Android moderno con 8 GB de RAM puede contener un modelo 3B en memoria y responder preguntas en unos pocos segundos, sin conexión. El punto no es reemplazar GPT o Claude para problemas difíciles. El punto es un chat privado sin red que sobreviva un vuelo, un cruce fronterizo o una Wi-Fi de hotel deficiente. Las mejores aplicaciones para ejecutar LLM en dispositivo en Android difieren de tres formas: qué formatos de modelo cuantizado cargan, cuánta RAM necesitan para permanecer estables y cuán utilizable es la interfaz de chat en una pantalla pequeña. Pusimos siete a través de un mes de uso diario.
Qué buscar en una aplicación LLM en dispositivo
Seis cosas separan una aplicación de chat que permanece instalada de una que se desinstala en una semana:
- Soporte de formato de modelo. GGUF es el más común; MLC y ONNX son los siguientes. Cualquiera que sea el formato que admita la aplicación, decide qué modelos están disponibles.
- Opciones de cuantización. Q4_K_M es el punto óptimo para un modelo 3B en 8 GB; Q3 es más pequeño pero notablemente peor.
- Manejo de ventanas de contexto. Si la aplicación mantiene un historial continuo o se reinicia en cada turno.
- Tokens por segundo en hardware modesto. Un teléfono Snapdragon 8 Gen 2 ejecuta un 3B Q4 a aproximadamente 15 a 25 tok/s.
- Comportamiento de batería. Las generaciones largas calientan el teléfono. Una bandera de fondo o un temporizador que limita las sesiones ayuda.
- Costo y estado de código cerrado. Algunas opciones son freemium con respaldos en la nube que necesitan desactivarse.
Comparación rápida
| Aplicación | Mejor para | Formatos de modelo | Nivel gratuito | Destacado |
|---|---|---|---|---|
| PocketPal AI | Chat en dispositivo general | GGUF | Gratis, código abierto | Mejor UX de descarga para modelos GGUF |
| MLC Chat | Velocidad en Snapdragon 8 | MLC | Gratis, código abierto | Tok/s más rápido de todo aquí |
| Layla | Chat de personajes y juego de rol | GGUF | Nivel gratuito, suscripción | UI pulido, biblioteca de personajes |
| MyDeviceAI | Asistente con herramientas | GGUF, ONNX | Gratis, código abierto | Base de búsqueda web, se mantiene en dispositivo |
| SmolChat | Teléfonos pequeños (4 a 6 GB) | GGUF (small) | Gratis, código abierto | Ejecuta modelos 1B y 1.5B limpiamente |
| Private AI Chat | Sin cuenta, sin telemetría | GGUF | Gratis | Enviado con lista de modelos seleccionada |
| Enchanted | Ollama en el servidor del hogar | Control remoto a Ollama | Gratis, código abierto | Mejor cuando el teléfono habla con un LLM del hogar |
Las aplicaciones
1. PocketPal AI, mejor chat en dispositivo general
PocketPal AI descarga modelos GGUF de Hugging Face dentro de la aplicación y los gestiona en una biblioteca. Los ajustes preestablecidos para Phi-3.5, Gemma 3, Llama 3.2 y Qwen 2.5 proporcionan cuantizaciones iniciales sensatas. La interfaz de chat admite indicaciones del sistema, temperatura, top-p y penalización de repetición por modelo, que es más control que la mayoría de las aplicaciones aquí.
Donde se queda corto: Los usuarios por primera vez necesitan una idea aproximada de qué modelo elegir. No hay recomendación en la aplicación.
Precio: Gratis, código abierto (MIT).
Plataformas: Android, iOS.
Descargar: GitHub · Google Play
Conclusión: Empiece aquí. Es la opción gratuita más completa y no promociona un nivel de pago.
2. MLC Chat, mejor velocidad bruta en Snapdragon 8
MLC Chat compila modelos al formato MLC con anticipación y los ejecuta a través de TVM. En un teléfono Snapdragon 8 Gen 2, Gemma 2B de MLC se ejecuta a aproximadamente el doble de tok/s que el mismo modelo en GGUF en llama.cpp. Las opciones de modelo son más estrechas porque cada modelo se construye previamente.
Donde se queda corto: Agregar un nuevo modelo requiere el conjunto de herramientas MLC en una computadora portátil. No es un flujo de trabajo de “descargar e ir”.
Precio: Gratis, licencia Apache.
Plataformas: Android, iOS.
Descargar: MLC Chat · Google Play
Conclusión: La opción si el teléfono es un buque insignia reciente y el objetivo es la respuesta en dispositivo más rápida posible.
3. Layla, mejor para chat de personajes y juego de rol
Layla envuelve llama.cpp en una interfaz de chat pulida con personajes, entrada de voz y una biblioteca de personas de la comunidad. El nivel gratuito incluye descarga de modelo local; la suscripción agrega modelos alojados en la nube y generación de imágenes, ambos opcionales. Debido a que la aplicación está en dispositivo de forma predeterminada, la biblioteca de personajes funciona sin conexión.
Donde se queda corto: El enfoque RP se muestra en los indicadores predeterminados. Convertirlo en un asistente genérico significa sobrescribir la indicación del sistema en cada sesión.
Precio:
- Nivel gratuito: solo modelos locales
- Pro: desde una tarifa mensual modesta agrega modelos alojados e imágenes
Plataformas: Android, iOS.
Descargar: Layla
Conclusión: Para cualquiera que quiera un chat que se incline más hacia lo creativo que hacia la utilidad.
4. MyDeviceAI, mejor asistente con herramientas
MyDeviceAI ejecuta un modelo GGUF local, luego agrega un paso de búsqueda web que lee fragmentos y los devuelve al modelo como contexto. Se mantiene privado porque la consulta de búsqueda es lo único que sale del teléfono. Es lo más cercano a un asistente al estilo Perplexity con razonamiento local.
Donde se queda corto: La integración de búsqueda web depende de un backend de búsqueda que cambia. Las llamadas a herramientas ocasionalmente rotas son para que el operador note.
Precio: Gratis, código abierto.
Plataformas: Android.
Descargar: GitHub
Conclusión: La opción cuando el asistente necesita información actual, no solo lo que cabe en los pesos del modelo.
5. SmolChat, mejor para teléfonos pequeños
SmolChat apunta a teléfonos con 4 a 6 GB de RAM. Viene con configuración ajustada para modelos 1B y 1.5B (Phi-3-mini, Gemma 2 2B, Llama 3.2 1B) y se niega a abrir los más grandes. El resultado es una aplicación de chat que permanece receptiva en un teléfono de rango medio de dos años.
Donde se queda corto: Deliberadamente limitado. Si el teléfono puede ejecutar un modelo 3B, use PocketPal AI en su lugar.
Precio: Gratis, código abierto.
Plataformas: Android.
Descargar: GitHub · Google Play
Conclusión: Para teléfonos de rango medio que se congelarían en un modelo 7B.
6. Private AI Chat, mejor “sin cuenta, sin telemetría”
Private AI Chat envía una pequeña lista de modelos GGUF verificados, los descarga en la primera ejecución y nunca solicita una cuenta. El historial de chat permanece en una base de datos en el dispositivo. La política de privacidad cabe en una pantalla porque la aplicación no recopila datos.
Donde se queda corto: Sin respaldo en la nube si el modelo no es suficiente para una pregunta difícil. Sin modelos agregados por el usuario más allá de la lista seleccionada.
Precio: Gratis.
Plataformas: Android.
Descargar: Google Play
Conclusión: La opción cuando todo el punto es “sin datos que salgan del teléfono” y elegir un modelo no es la parte divertida.
7. Enchanted, mejor si ya ejecutas Ollama en casa
Enchanted es un cliente de teléfono para Ollama ejecutándose en el servidor del hogar. No es completamente en el dispositivo (el modelo se ejecuta en la máquina del hogar, que maneja el cálculo), pero el chat permanece en la LAN o a través de un túnel Tailscale. Para cualquiera que ya tiene un cuadro de inicio potente alojando Ollama, este es el camino más corto a un modelo 70B desde el teléfono.
Donde se queda corto: Requiere una instancia Ollama en el hogar. El uso celular necesita un túnel como Tailscale para llegar al servidor.
Precio: Gratis, código abierto.
Plataformas: Android, iOS.
Descargar: GitHub
Conclusión: La opción cuando el teléfono es un cliente delgado para un modelo local mucho más grande.
Cómo elegir el correcto
Si el teléfono tiene 8 GB de RAM o más, comience con PocketPal AI y un modelo 3B Q4. La interfaz es la más amigable y la biblioteca de modelos es la más amplia.
Si el teléfono es un buque insignia reciente y la velocidad importa más que la elección del modelo, cambie a MLC Chat.
Si el teléfono tiene 4 a 6 GB de RAM, use SmolChat con un modelo 1.5B o 2B.
Si el objetivo es un asistente privado que pueda buscar cosas, use MyDeviceAI.
Si el día implica chat creativo o juego de rol, use Layla.
Si un servidor del hogar potente ya ejecuta Ollama, use Enchanted y trate el teléfono como un cliente delgado.
FAQ
¿Qué teléfonos Android pueden ejecutar un modelo 7B? Teléfonos con al menos 12 GB de RAM (Pixel 9 Pro XL, Galaxy S25 Ultra, OnePlus 13). Un modelo 7B Q4 más el sistema operativo se ajusta bien en 12 GB y se mueve. En 8 GB el teléfono intercambia y la aplicación se bloquea en minutos.
¿Estas aplicaciones agotan la batería? Sí, durante la generación. Un modelo 3B a 20 tok/s en un SoC moderno consume 4 a 6 W. Una conversación de diez minutos es aproximadamente el uno por ciento de batería. Las generaciones largas calientan el teléfono.
¿Puedo usar estos sin conexión? Sí, ese es el punto. PocketPal AI, MLC Chat, SmolChat, Layla y Private AI Chat se ejecutan completamente en el dispositivo una vez que se descarga el modelo. El modo avión no los afecta.
¿Son privados mis datos? En las seis aplicaciones en el dispositivo, sí. Enchanted envía chat a su propio servidor Ollama. Ninguno de ellos envía indicaciones a una nube de terceros en el modo predeterminado.
¿Con qué modelo debería empezar? Phi-3.5-mini en Q4_K_M es el estándar más seguro en 8 GB. Responde bien a las preguntas comunes y cabe en aproximadamente 2,5 GB de RAM. Pase a Gemma 2 2B o Llama 3.2 3B si el teléfono puede manejarlo.
¿Pueden estos reemplazar a ChatGPT? Para preguntas rápidas, borrador de texto corto y fragmentos de código de menos de 200 líneas, sí. Para razonamiento prolongado, eventos actuales y código complejo, no. Trate en el dispositivo como la capa privada, sin conexión, no la caja de herramientas completa.