Termux y otras herramientas para ejecutar un LLM local en Android

XDA convirtió un teléfono antiguo en un servidor LLM local e hizo que Gemma 4 funcionara lo suficientemente bien para trabajos de productividad real. Es un uso bastante bueno para un Android antiguo que está en un cajón, y gracias a las optimizaciones ARM de llama.cpp, un Snapdragon 8 Gen 1 o más reciente puede alojar un modelo cuantizado de 3B a 7B que responde a otros dispositivos en nuestra Wi-Fi. Siete aplicaciones manejan el terreno, algunas son clientes de chat que también exponen una API compatible con OpenAI, algunas son terminales que nos permiten ejecutar llama.cpp u ollama directamente.

Qué buscar en una aplicación LLM local para Android

Comparación rápida

Aplicación Mejor para Gratis Servidor API Calificación
Termux llama.cpp u ollama completo en terminal Sí, vía llama-server 4.7
PocketPal AI Chat GUI con interruptor de servidor Sí, experimental 4.5
Layla Chat pulido más juego de rol Trial Pro API 4.4
MLC Chat Modelos optimizados para MLC Solo local en estable 4.3
ChatterUI Interfaz similar a SillyTavern Sí, vía servidor incorporado 4.4
SmolChat Cliente de chat mínimo No 4.3
llama.cpp Android Compilación de referencia Sí, vía llama-server 4.5

Las siete aplicaciones

1. Termux, mejor llama.cpp u ollama completo en terminal

Termux es el kit de herramientas Linux-en-tu-bolsillo que nos permite construir y ejecutar llama.cpp u ollama directamente. pkg install cmake python git, clona llama.cpp, compila con LLAMA_VULKAN=1 e inicia llama-server vinculado a nuestra IP de LAN. El teléfono antiguo ahora sirve una API compatible con OpenAI a cualquier dispositivo en Wi-Fi.

Donde se queda corto: No es para los que temen la terminal. La configuración inicial requiere una hora de gestión de paquetes.

Precios:

Plataformas: Android

Descargar: F-Droid · Aptoide

Termux para hosting de LLM local gana en flexibilidad. Cualquier cosa que llama.cpp soporte, Termux lo soporta.

Conclusión: La opción para lectores cómodos en una terminal. El potencial es mucho mayor que cualquier GUI en esta lista.

2. PocketPal AI, mejor GUI con interruptor de servidor

PocketPal AI es un cliente de chat de Android de código abierto que carga modelos GGUF desde Hugging Face y los ejecuta en el dispositivo. Las compilaciones recientes agregan un interruptor de servidor experimental que expone el mismo modelo en nuestra LAN a través de un punto final compatible con OpenAI.

Donde se queda corto: El interruptor de servidor todavía está marcado como experimental y carece de TLS.

Precios:

Plataformas: Android, iOS

Descargar: Google Play · F-Droid

PocketPal AI para hosting de LLM local gana en simplicidad de GUI. Elige un modelo de Hugging Face, toca cargar, comienza a chatear.

Conclusión: La opción para lectores que desean una GUI primero y una API segundo.

3. Layla, mejor chat pulido más juego de rol

Layla es un cliente de chat de Android amigable con el pago que ejecuta modelos cuantizados en el dispositivo con una interfaz elegante. Se incluyen juego de rol de personajes, memoria persistente y modo de voz. El nivel Pro agrega un modo servidor API que expone el modelo cargado.

Donde se queda corto: El nivel gratuito limita la longitud del contexto. Las características de personajes agregan complejidad a la interfaz.

Precios:

Plataformas: Android

Descargar: Google Play

Layla para hosting de LLM local gana en pulido de chat y herramientas de juego de rol.

Conclusión: La opción para lectores que desean una interfaz enfocada en chat, no una herramienta de desarrollador.

4. MLC Chat, mejor modelos optimizados para MLC

MLC Chat del equipo de MLC viene con modelos precompilados optimizados para GPU Qualcomm Adreno y MediaTek. Los tokens por segundo son los mejores en esta lista para teléfonos que la aplicación soporta oficialmente, a costa de una biblioteca de modelos más pequeña que llama.cpp.

Donde se queda corto: El modo servidor API está en la hoja de ruta, aún no en la versión estable.

Precios:

Plataformas: Android, iOS

Descargar: GitHub · Aptoide

MLC Chat para hosting de LLM local gana en velocidad de inferencia pura cuando nuestro teléfono está en la lista soportada.

Conclusión: La opción para lectores cuyo dispositivo está en la lista de soporte de MLC y desean tokens máximos por segundo localmente.

5. ChatterUI, mejor interfaz similar a SillyTavern

ChatterUI es un cliente de chat de Android modelado en SillyTavern. Tarjetas de personajes, ramas de chat y un servidor incorporado que otros dispositivos en nuestra LAN pueden llamar como punto final compatible con OpenAI.

Donde se queda corto: El formato de tarjeta de personaje es el punto, pero hace que ChatterUI sea más pesado que PocketPal para preguntas y respuestas simples.

Precios:

Plataformas: Android

Descargar: GitHub

ChatterUI para hosting de LLM local gana si nuestro stack de chat existente tiene forma de SillyTavern.

Conclusión: La opción para lectores que ya usan SillyTavern.

6. SmolChat, mejor cliente de chat mínimo

SmolChat es un cliente de Android minimalista para modelos llama.cpp GGUF. No sirve una API, pero su huella es lo suficientemente pequeña como para que los teléfonos más antiguos con RAM de 4 GB aún puedan caber en un modelo cuantizado de 3B.

Donde se queda corto: Solo chat local, sin modo servidor.

Precios:

Plataformas: Android

Descargar: GitHub

SmolChat para hosting de LLM local gana como la opción más ligera para dispositivos de 4 GB.

Conclusión: La opción cuando el teléfono objetivo es realmente antiguo y tiene restricciones de RAM.

7. llama.cpp Android, mejor compilación de referencia

llama.cpp Android es la compilación de referencia oficial de ggerganov. No en ninguna tienda, descargamos el APK desde las versiones de GitHub. Ejecuta llama-server directamente con las mismas banderas que usaríamos en Linux.

Donde se queda corto: Cero pulido de interfaz, y debemos conocer las banderas de llama.cpp antes de comenzar.

Precios:

Plataformas: Android

Descargar: GitHub

llama.cpp Android para hosting de LLM local gana como la implementación de referencia.

Conclusión: La opción para lectores que desean la misma herramienta que ejecutan en una computadora portátil, en Android.

Cómo elegir la correcta

Preguntas frecuentes

¿Puede un teléfono Android antiguo realmente ejecutar un LLM?

Sí, en Snapdragon 855 y posterior, con 6 GB o más de RAM. Espera 3 a 5 tokens por segundo en un modelo cuantizado de 3B en hardware más antiguo, y 10 a 20 tokens por segundo en teléfonos más recientes.

¿Qué modelo funciona mejor en Android?

Gemma 2B, Phi-3 Mini, Llama 3.2 3B y Qwen 2.5 3B se adaptan cómodamente a la cuantización Q4_K_M. Gemma 4 se ejecuta en teléfonos más nuevos con 8 GB o más de RAM.

¿Puedo usar mi teléfono como servidor API LLM para mi computadora portátil?

Sí. Termux ejecutando llama-server vinculado a nuestra IP de LAN funciona. Apunta el cliente de chat de nuestra computadora portátil a http://<phone-ip>:8080/v1 para el punto final compatible con OpenAI.

¿Matará la ejecución de un LLM la batería de mi teléfono?

La inferencia sostenida se agota rápidamente, planifica para alimentación de pared. También espera que el teléfono funcione caliente, elévalo para el flujo de aire.

¿Es llama.cpp gratis?

Sí, bajo licencia MIT. Cada aplicación en esta lista que lo use es de código abierto o de pago sobre la base gratuita de llama.cpp.