
XDA convirtió un teléfono antiguo en un servidor LLM local e hizo que Gemma 4 funcionara lo suficientemente bien para trabajos de productividad real. Es un uso bastante bueno para un Android antiguo que está en un cajón, y gracias a las optimizaciones ARM de llama.cpp, un Snapdragon 8 Gen 1 o más reciente puede alojar un modelo cuantizado de 3B a 7B que responde a otros dispositivos en nuestra Wi-Fi. Siete aplicaciones manejan el terreno, algunas son clientes de chat que también exponen una API compatible con OpenAI, algunas son terminales que nos permiten ejecutar llama.cpp u ollama directamente.
Qué buscar en una aplicación LLM local para Android
- Modo servidor API. Para “teléfono antiguo como servidor LLM”, la aplicación debe exponer un punto final HTTP que otros dispositivos puedan llamar, idealmente compatible con OpenAI.
- Compatibilidad de formatos de modelo. GGUF a través de llama.cpp es el estándar, el formato propio de MLC es otra opción.
- Descarga de GPU. El backend Vulkan u OpenCL que utiliza la GPU Adreno o Mali de nuestro teléfono cambia los tokens por segundo de 3x a 5x.
- Control de batería y térmico. La inferencia sostenida calienta un teléfono. Busca controles de servicio en primer plano y limitación térmica.
- Huella de RAM. Los teléfonos más antiguos con 4 a 6 GB de RAM no pueden caber en modelos más grandes incluso con cuantización agresiva.
- Persistencia en segundo plano. La aplicación debe sobrevivir al administrador de memoria agresivo de Android en OEM baratos.
Comparación rápida
| Aplicación | Mejor para | Gratis | Servidor API | Calificación |
|---|---|---|---|---|
| Termux | llama.cpp u ollama completo en terminal | Sí | Sí, vía llama-server | 4.7 |
| PocketPal AI | Chat GUI con interruptor de servidor | Sí | Sí, experimental | 4.5 |
| Layla | Chat pulido más juego de rol | Sí | Trial Pro API | 4.4 |
| MLC Chat | Modelos optimizados para MLC | Sí | Solo local en estable | 4.3 |
| ChatterUI | Interfaz similar a SillyTavern | Sí | Sí, vía servidor incorporado | 4.4 |
| SmolChat | Cliente de chat mínimo | Sí | No | 4.3 |
| llama.cpp Android | Compilación de referencia | Sí | Sí, vía llama-server | 4.5 |
Las siete aplicaciones
1. Termux, mejor llama.cpp u ollama completo en terminal
Termux es el kit de herramientas Linux-en-tu-bolsillo que nos permite construir y ejecutar llama.cpp u ollama directamente. pkg install cmake python git, clona llama.cpp, compila con LLAMA_VULKAN=1 e inicia llama-server vinculado a nuestra IP de LAN. El teléfono antiguo ahora sirve una API compatible con OpenAI a cualquier dispositivo en Wi-Fi.
Donde se queda corto: No es para los que temen la terminal. La configuración inicial requiere una hora de gestión de paquetes.
Precios:
- Gratis: Kit de herramientas completo
- Pagado: Ninguno
Plataformas: Android
Termux para hosting de LLM local gana en flexibilidad. Cualquier cosa que llama.cpp soporte, Termux lo soporta.
Conclusión: La opción para lectores cómodos en una terminal. El potencial es mucho mayor que cualquier GUI en esta lista.
2. PocketPal AI, mejor GUI con interruptor de servidor
PocketPal AI es un cliente de chat de Android de código abierto que carga modelos GGUF desde Hugging Face y los ejecuta en el dispositivo. Las compilaciones recientes agregan un interruptor de servidor experimental que expone el mismo modelo en nuestra LAN a través de un punto final compatible con OpenAI.
Donde se queda corto: El interruptor de servidor todavía está marcado como experimental y carece de TLS.
Precios:
- Gratis: Código abierto bajo MIT
- Pagado: Ninguno
Plataformas: Android, iOS
Descargar: Google Play · F-Droid
PocketPal AI para hosting de LLM local gana en simplicidad de GUI. Elige un modelo de Hugging Face, toca cargar, comienza a chatear.
Conclusión: La opción para lectores que desean una GUI primero y una API segundo.
3. Layla, mejor chat pulido más juego de rol
Layla es un cliente de chat de Android amigable con el pago que ejecuta modelos cuantizados en el dispositivo con una interfaz elegante. Se incluyen juego de rol de personajes, memoria persistente y modo de voz. El nivel Pro agrega un modo servidor API que expone el modelo cargado.
Donde se queda corto: El nivel gratuito limita la longitud del contexto. Las características de personajes agregan complejidad a la interfaz.
Precios:
- Gratis: Chat básico
- Pagado: Suscripción Pro para contexto extendido y modo API
Plataformas: Android
Descargar: Google Play
Layla para hosting de LLM local gana en pulido de chat y herramientas de juego de rol.
Conclusión: La opción para lectores que desean una interfaz enfocada en chat, no una herramienta de desarrollador.
4. MLC Chat, mejor modelos optimizados para MLC
MLC Chat del equipo de MLC viene con modelos precompilados optimizados para GPU Qualcomm Adreno y MediaTek. Los tokens por segundo son los mejores en esta lista para teléfonos que la aplicación soporta oficialmente, a costa de una biblioteca de modelos más pequeña que llama.cpp.
Donde se queda corto: El modo servidor API está en la hoja de ruta, aún no en la versión estable.
Precios:
- Gratis: Código abierto
- Pagado: Ninguno
Plataformas: Android, iOS
MLC Chat para hosting de LLM local gana en velocidad de inferencia pura cuando nuestro teléfono está en la lista soportada.
Conclusión: La opción para lectores cuyo dispositivo está en la lista de soporte de MLC y desean tokens máximos por segundo localmente.
5. ChatterUI, mejor interfaz similar a SillyTavern
ChatterUI es un cliente de chat de Android modelado en SillyTavern. Tarjetas de personajes, ramas de chat y un servidor incorporado que otros dispositivos en nuestra LAN pueden llamar como punto final compatible con OpenAI.
Donde se queda corto: El formato de tarjeta de personaje es el punto, pero hace que ChatterUI sea más pesado que PocketPal para preguntas y respuestas simples.
Precios:
- Gratis: Código abierto
- Pagado: Ninguno
Plataformas: Android
Descargar: GitHub
ChatterUI para hosting de LLM local gana si nuestro stack de chat existente tiene forma de SillyTavern.
Conclusión: La opción para lectores que ya usan SillyTavern.
6. SmolChat, mejor cliente de chat mínimo
SmolChat es un cliente de Android minimalista para modelos llama.cpp GGUF. No sirve una API, pero su huella es lo suficientemente pequeña como para que los teléfonos más antiguos con RAM de 4 GB aún puedan caber en un modelo cuantizado de 3B.
Donde se queda corto: Solo chat local, sin modo servidor.
Precios:
- Gratis: Código abierto
- Pagado: Ninguno
Plataformas: Android
Descargar: GitHub
SmolChat para hosting de LLM local gana como la opción más ligera para dispositivos de 4 GB.
Conclusión: La opción cuando el teléfono objetivo es realmente antiguo y tiene restricciones de RAM.
7. llama.cpp Android, mejor compilación de referencia
llama.cpp Android es la compilación de referencia oficial de ggerganov. No en ninguna tienda, descargamos el APK desde las versiones de GitHub. Ejecuta llama-server directamente con las mismas banderas que usaríamos en Linux.
Donde se queda corto: Cero pulido de interfaz, y debemos conocer las banderas de llama.cpp antes de comenzar.
Precios:
- Gratis: Código abierto bajo MIT
- Pagado: Ninguno
Plataformas: Android
Descargar: GitHub
llama.cpp Android para hosting de LLM local gana como la implementación de referencia.
Conclusión: La opción para lectores que desean la misma herramienta que ejecutan en una computadora portátil, en Android.
Cómo elegir la correcta
- Cómodo en una terminal, quiere máxima flexibilidad: Termux
- Quiere GUI más interruptor API: PocketPal AI
- Quiere pulido de chat con juego de rol: Layla
- El teléfono está en la lista soportada de MLC y quiere velocidad máxima: MLC Chat
- Ya ejecuta SillyTavern: ChatterUI
- El teléfono tiene solo 4 GB de RAM: SmolChat
- Quiere la compilación de referencia llama.cpp: llama.cpp Android
Preguntas frecuentes
¿Puede un teléfono Android antiguo realmente ejecutar un LLM?
Sí, en Snapdragon 855 y posterior, con 6 GB o más de RAM. Espera 3 a 5 tokens por segundo en un modelo cuantizado de 3B en hardware más antiguo, y 10 a 20 tokens por segundo en teléfonos más recientes.
¿Qué modelo funciona mejor en Android?
Gemma 2B, Phi-3 Mini, Llama 3.2 3B y Qwen 2.5 3B se adaptan cómodamente a la cuantización Q4_K_M. Gemma 4 se ejecuta en teléfonos más nuevos con 8 GB o más de RAM.
¿Puedo usar mi teléfono como servidor API LLM para mi computadora portátil?
Sí. Termux ejecutando llama-server vinculado a nuestra IP de LAN funciona. Apunta el cliente de chat de nuestra computadora portátil a http://<phone-ip>:8080/v1 para el punto final compatible con OpenAI.
¿Matará la ejecución de un LLM la batería de mi teléfono?
La inferencia sostenida se agota rápidamente, planifica para alimentación de pared. También espera que el teléfono funcione caliente, elévalo para el flujo de aire.
¿Es llama.cpp gratis?
Sí, bajo licencia MIT. Cada aplicación en esta lista que lo use es de código abierto o de pago sobre la base gratuita de llama.cpp.