
El artículo de XDA que llegó a muchas portadas destacó lo que muchos usuarios de Obsidian han estado probando en silencio: un teléfono Android moderno con 8 o 12 GB de RAM puede ejecutar un modelo de 3 mil millones de parámetros a una velocidad legible, completamente sin conexión, y combinado con Obsidian, convierte el almacén en algo entre un diario y un segundo cerebro buscable. Sin viajes a la nube, sin facturas por token, sin señal requerida en un avión o un viaje en metro.
Probamos 7 aplicaciones de Android que hacen que este emparejamiento funcione en la práctica. Cada una de las siguientes ejecuta el modelo en el dispositivo, se conecta a un almacén de Obsidian almacenado en el teléfono, y se mantiene útil sin conexión de red.
Qué buscar
- Inferencia en el dispositivo. Si la aplicación llama a una API, no es la herramienta que estamos probando.
- Modelos razonables. Q4-quantised 3B o 7B es el punto dulce; cualquier cosa más grande causa swapping.
- Acceso al almacén. El acceso directo al sistema de archivos del almacén Obsidian es mejor que copiar-pegar cada vez.
- Velocidad de generación. Menos de 15 tokens por segundo es inutilizable para cualquier cosa más larga que una oración.
- Comportamiento de batería. Una generación que toma dos minutos al 30% de CPU está bien; una que toma diez minutos al 100% no lo está.
- Configuraciones predeterminadas sensatas. Plantillas, búsqueda consciente de etiquetas e historial de chat que sobrevive al cierre de la aplicación.
Comparación rápida
| Aplicación | Mejor para | Plan gratuito | Característica destacada | Calificación |
|---|---|---|---|---|
| Obsidian | El almacén en sí, en el teléfono | Sí | El mismo almacén en desktop y móvil con plugins locales | 4,7 estrellas en Aptoide |
| MLC Chat | Inferencia en dispositivo más rápida para chat | Sí (código abierto) | Modelos 3B y 7B acelerados por Vulkan a velocidad razonable | Solo sideload |
| PocketPal AI | Mejor iniciación para principiantes en LLM local | Sí (código abierto) | Descarga GGUFs de Hugging Face dentro de la aplicación | 4,4 estrellas |
| Layla | Chat con RAG local sobre cualquier archivo | Nivel gratuito | Ejecuta un modelo pequeño sobre tus notas sin configuración | 4,3 estrellas |
| Ollama in Termux | Servidor Ollama completo en el teléfono, para usuarios avanzados | Sí (código abierto) | La misma API que en desktop, para que los plugins funcionen | Solo sideload |
| Smart Composer (plugin Obsidian) | Acceso a modelo local desde Obsidian móvil | Sí (código abierto) | Se comunica con un endpoint compatible con OpenAI, incluyendo Ollama local | Plugin gratuito |
| Text Generator (plugin Obsidian) | Prompts con plantilla contra modelos locales | Sí (código abierto) | Convierte cualquier nota en un prompt con variables | Plugin gratuito |
Las 7 mejores aplicaciones para Obsidian con LLM local en Android
1. Obsidian — mejor porque todo lo demás se ejecuta contra su almacén
Obsidian en Android lleva el mismo almacén Markdown que el desktop, se sincroniza a través de Obsidian Sync, Syncthing o un repositorio Git autohospedado, y ejecuta la mayoría de plugins que no requieren una API de navegador. Los plugins locales significan que la capa de IA se mantiene en el teléfono incluso cuando el almacén está en otra parte.
Donde falla: Los plugins de comunidad que asumen un entorno de desktop fallan silenciosamente. Los usuarios de iCloud tienen que depender de Obsidian Sync o Working Copy ya que Android no ve iCloud.
Precios:
- Gratuito: aplicación completa con almacenes locales
- Pagado: Obsidian Sync (opcional) para sincronización de almacén encriptada
Plataformas: Android, iOS, Windows, macOS, Linux
Descarga: obsidian.md — también disponible en Aptoide y Google Play
Conclusión: Elige Obsidian primero, porque cada plugin de IA aquí se dirige a un almacén en el teléfono.
2. MLC Chat — mejor velocidad de inferencia en dispositivo
MLC Chat proporciona modelos compilados por el proyecto MLC LLM para ejecutarse en la GPU del teléfono a través de Vulkan. Un modelo 3B como Phi-3.5-mini genera a más de 20 tokens por segundo en un Snapdragon 8 Gen 3, y un 7B Q4 cuantificado es usable en teléfonos insignia. Los chats viven localmente, sin cuenta necesaria.
Donde falla: Solo sideload, el catálogo de modelos es más pequeño que el de PocketPal, y agregar un modelo personalizado requiere un paso de compilación en desktop.
Precios:
- Gratuito: código abierto bajo Apache 2.0
- Pagado: ninguno
Plataformas: Android (sideload APK)
Descarga: llm.mlc.ai
Conclusión: Elige MLC Chat cuando quieras la generación local más rápida en el teléfono y te sientas cómodo con un APK sideloaded.
3. PocketPal AI — mejor rampa inicial para personas nuevas en LLM locales
PocketPal AI es la forma más amigable de entrar en el camino de modelos locales. Instala la aplicación, explora un conjunto seleccionado de modelos GGUF de Hugging Face, toca para descargar y comienza a chatear. Las plantillas cubren la mayoría de familias de modelos de fábrica, por lo que un usuario por primera vez no está editando chat_template JSON en la pantalla del teléfono.
Donde falla: La inferencia es solo CPU a través de llama.cpp, por lo que las velocidades son más bajas que MLC Chat en el mismo hardware. El acceso al almacén es copiar-pegar a menos que lo empareje con un plugin de Obsidian.
Precios:
- Gratuito: código abierto bajo MIT
- Pagado: ninguno
Plataformas: Android, iOS
Descarga: Google Play
Conclusión: Elige PocketPal si esta es la primera vez que ejecutas un modelo en un teléfono.
4. Layla — mejor cuando el chat necesita ver tus notas
Layla ejecuta modelos pequeños localmente y añade un paso de recuperación aumentada ligero encima, por lo que un prompt puede hacer referencia a notas o PDFs que señales. Para un usuario de Obsidian, esto significa que “resumir las notas de la última semana” funciona sin ningún trabajo de plugin, siempre que el almacén esté en una carpeta que Layla pueda leer.
Donde falla: La calidad de RAG en un modelo pequeño es desigual. El nivel gratuito limita el tamaño del modelo; el nivel pagado lo elimina. El pulido de la UI se queda atrás de PocketPal.
Precios:
- Nivel gratuito con modelos limitados
- Pagado: actualización única desbloquea modelos más grandes
Plataformas: Android, iOS
Descarga: Google Play
Conclusión: Elige Layla si el objetivo es “responder preguntas sobre mis notas” y no quieres construir el pipeline tú mismo.
5. Ollama in Termux — mejor configuración de usuario avanzado que refleja el desktop
Instalar Ollama dentro de Termux da al teléfono el mismo servidor HTTP que se ejecuta en desktop, en la interfaz loopback. Cualquier plugin de Obsidian que hable con Ollama luego habla con él directamente. La batería es más pesada porque Termux no se cierra elegantemente, pero el rendimiento supera a la mayoría de ejecutores GUI en el mismo teléfono.
Donde falla: Termux de Play Store está desactualizado; sideload desde F-Droid o la compilación oficial de GitHub. Los permisos de servicio en primer plano requieren cuidado, y la limitación térmica puede perjudicar generaciones largas.
Precios:
- Gratuito: código abierto
- Pagado: ninguno
Plataformas: Android (Termux)
Descarga: ollama.com con Termux
Conclusión: Elige esto si ya te sientes cómodo en Termux y quieres la experiencia de Ollama para desktop en el teléfono.
6. Smart Composer — mejor plugin de Obsidian para apuntar a un modelo local
Smart Composer es el plugin de comunidad que convierte un chat dentro de Obsidian en una conversación con cualquier endpoint compatible con OpenAI, incluyendo Ollama local o LM Studio ejecutándose en el mismo teléfono a través de Termux, o en un servidor doméstico a través de LAN. Los prompts pueden mencionar con @ notas, carpetas y etiquetas, por lo que un prompt “reescribe este párrafo en el tono de las notas diarias del mes pasado” tiene contexto real.
Donde falla: El plugin todavía asume que puedes llegar a un servidor, por lo que si el teléfono está sin conexión y no hay ningún servidor local ejecutándose, no hace nada.
Precios:
- Gratuito: código abierto bajo MIT
- Pagado: ninguno
Plataformas: Android, iOS, Windows, macOS, Linux (dentro de Obsidian)
Descarga: github.com/glowingjade/obsidian-smart-composer
Conclusión: Elige Smart Composer como el puente entre Obsidian y el modelo, ya sea que ese modelo se ejecute en el teléfono o en tu servidor doméstico.
7. Text Generator — mejor plugin para plantillas de prompt
Text Generator trata las notas como plantillas. Envuelve una variable, añade un prompt del sistema, y ejecutar la plantilla en cualquier nota llena los marcadores de posición y envía el resultado al modelo configurado. Funciona contra Ollama local, LM Studio o proveedores alojados, y la biblioteca de plantillas en el foro de la comunidad es grande.
Donde falla: La sintaxis requiere una tarde para aprender. Depurar una plantilla fallida en móvil es más doloroso que en desktop.
Precios:
- Gratuito: código abierto bajo GPLv3
- Pagado: ninguno
Plataformas: Android, iOS, Windows, macOS, Linux (dentro de Obsidian)
Descarga: text-gen.com
Conclusión: Elige Text Generator si quieres plantillas de prompt reutilizables que conviertan una nota en una acción de IA repetible.
Cómo elegir
Si aún no tienes un almacén en el teléfono, instala Obsidian primero y sincroniza.
Si quieres la generación local más rápida y te sientes cómodo con un APK sideloaded, ejecuta MLC Chat.
Si esta es tu primera vez probando modelos locales en un teléfono, instala PocketPal AI y elige un modelo 3B.
Si el chat debe ver tus notas sin un pipeline manual, prueba Layla con la carpeta del almacén compartida.
Si ya vives en Termux, instala Ollama allí y deja que cada plugin de Obsidian apunte a localhost.
Para traer el modelo a Obsidian en sí, añade Smart Composer como la superficie del chat.
Para prompts con plantilla repetibles en notas, añade también Text Generator.
FAQ
¿Cuál es el teléfono más pequeño que puede ejecutar un modelo útil?
Un teléfono de RAM 8 GB de las últimas dos generaciones de buques insignia ejecutará un modelo 3B a una velocidad útil. Un teléfono de RAM 12 GB abre cuants 7B Q4. Por debajo de 6 GB, el SO sigue intercambiando el modelo y las velocidades se despeñan.
¿Con qué modelo debería comenzar?
Phi-3.5-mini y Llama-3.2-3B son ambos buenos valores por defecto para un teléfono. Ambos caben por debajo de 3 GB en Q4, generan coherentemente y saben suficiente conocimiento general para ser útiles. Sube a un 7B como Qwen2.5-7B o Mistral-7B en un dispositivo insignia.
¿Ejecutar el modelo destruirá mi batería?
Las generaciones cortas de un par de cientos de tokens están bien. Las ejecuciones de agentes largos, los pipelines RAG que re-codifican un almacén grande o el uso continuo en primer plano agotarán un teléfono normal en un par de horas. Trata el modelo local como un asistente de forma corta, no como un servicio de fondo.
¿Puede Obsidian móvil llamar a un modelo ejecutándose en mi desktop?
Sí. Apunta Smart Composer a la IP local de tu desktop y al puerto Ollama sobre tu red doméstica. Añade Tailscale o WireGuard si quieres que la misma conexión funcione cuando estés lejos de casa. El teléfono permanece privado; el modelo simplemente está en otro lugar.