Physical AI agent body apps

Un robot ESP32 impreso en 3D que escribe junto con el agente de IA que vive en tu portátil es una novedad. También es una demostración de un patrón real: un microcontrolador pequeño como cuerpo, una máquina más grande como cerebro, y un par de herramientas de código abierto que las unen. El timbre que suena cuando se completa la tarea es el mismo evento de llamada de herramienta de LLM lanzado contra un pin GPIO.

Miramos siete aplicaciones que hacen ese patrón construible en un fin de semana. Dos son entornos de firmware para el microcontrolador, uno es la capa de orquestación que la mayoría de los autohospedadores ya ejecutan, uno es el marco de agente que convierte las llamadas de LLM en acciones de dispositivo, y tres son herramientas de apoyo para voz, scripts y pegamento sin código.

Qué buscar

Comparación rápida

Aplicación Mejor para Plataformas Plan Gratuito Precio Licencia
ESPHome Firmware ESP32/8266 desde YAML Windows, macOS, Linux, Docker Gratuito GPL / MIT
PlatformIO IDE completo para embedded Windows, macOS, Linux Gratuito (Pro pago) Apache 2.0
Home Assistant Bus de mensajes y panel de control Windows, macOS, Linux, Docker Gratuito Apache 2.0
LangChain Marco de agente con llamadas de herramienta Windows, macOS, Linux Gratuito (SDK) MIT
Willow Voz local en hardware ESP32 Windows, macOS, Linux Gratuito Apache 2.0
MicroPython Python en el microcontrolador Windows, macOS, Linux Gratuito MIT
n8n Pegamento sin código entre agente y hardware Windows, macOS, Linux, Docker Gratuito (autohospedado) Fair-code

1. ESPHome – Mejor para firmware ESP32/8266 desde YAML

ESPHome destella un ESP32 o ESP8266 con firmware construido a partir de una descripción YAML. Declara los pines, los sensores, los botones, los servos; ESPHome compila un binario, lo carga por USB u OTA, y conecta el dispositivo a Home Assistant sin pegamento. Ese es el camino más rápido desde una placa en blanco a “dispositivo controlable por agente”.

Donde se queda corto: YAML no es lo mismo que C. Algunos trucos de bajo nivel requieren escribir lambdas que son medio código, medio config.

Precio:

Plataformas: Windows, macOS, Linux, Docker.

Descargar: esphome.io.

Línea de fondo: La capa de firmware por defecto. Semanas de desarrollo en C++ comprimidas en cien líneas de YAML.

2. PlatformIO – Mejor IDE completo para embedded

PlatformIO es lo que escalas cuando la abstracción de ESPHome no encaja. Es un IDE (o una extensión de VS Code) que habla Arduino, ESP-IDF, STM32Cube, y docenas de otros marcos, con un administrador de paquetes para bibliotecas. Cuando el agente de IA necesita un brazo de robot impulsado por código de cinemática inversa, ese código vive en PlatformIO.

Donde se queda corto: El tier Pro bloquea algunas características de depuración avanzadas. La curva de aprendizaje es real si no has hecho embedded.

Precio:

Plataformas: Windows, macOS, Linux.

Descargar: platformio.org.

Línea de fondo: El IDE para cualquier cosa que ESPHome no pueda describir declarativamente.

3. Home Assistant – Mejor bus de mensajes y panel de control

Home Assistant es la capa que permite que una llamada de herramienta de LLM llegue al mundo físico. El agente llama a un endpoint HTTP o a un tema MQTT; Home Assistant lo traduce en “alternar un interruptor” o “girar el servo a 45 grados” y el ESP32 obedece. También proporciona una interfaz para ver qué está haciendo el robot sin abrir una terminal.

Donde se queda corto: Curva de aprendizaje pronunciada si no has configurado una antes. El ecosistema de complementos es poderoso pero ruidoso.

Precio:

Plataformas: Windows, macOS, Linux, Docker, SO dedicado.

Descargar: home-assistant.io.

Línea de fondo: La capa intermedia que mantiene el código del agente separado del hardware.

4. LangChain – Mejor marco de agente con llamadas de herramienta

LangChain es el SDK que convierte un LLM en un agente que usa herramientas. Define una herramienta (“toca el timbre”), pásala en el esquema de herramienta, y el modelo decide cuándo llamarla. Combinado con una herramienta HTTP de Home Assistant, el agente obtiene todo el conjunto de capacidades del robot sin saber nada sobre MQTT.

Donde se queda corto: API en rápida evolución. Algunos patrones de hace un año ya están obsoletos.

Precio:

Plataformas: Windows, macOS, Linux (Python y JS/TS).

Descargar: python.langchain.com o js.langchain.com.

Línea de fondo: La forma de dar a un LLM local la capacidad de llamar una herramienta “toca el timbre”.

5. Willow – Mejor voz local en hardware ESP32

Willow convierte un ESP32-S3 con una matriz de micrófono en un endpoint de voz de Home Assistant que funciona completamente en tu red. Detección de palabra de activación en el dispositivo, conversión de voz a texto alojada en tu propio servidor, y la solicitud transcrita enrutada a Home Assistant o un LLM local. Sin nube, sin cuenta, sin datos abandonando la sala.

Donde se queda corto: La selección de placas es estrecha (principalmente la línea ESP32-S3 BOX). Requiere un Willow Inference Server en una máquina más potente.

Precio:

Plataformas: Windows, macOS, Linux (para el servidor de inferencia).

Descargar: heywillow.io.

Línea de fondo: Para cualquiera que quiera que el robot escuche y hable sin dependencia de la nube.

6. MicroPython – Mejor para Python en el microcontrolador

MicroPython ejecuta un intérprete de Python en un ESP32 o RP2040, para que el firmware que escribes y el código del agente se parezcan al mismo idioma. Esa es una victoria real para el desarrollador que quiere prototipar movimiento de servo o patrones de LED sin dejar Python.

Donde se queda corto: Más lento que C en bucles ajustados. Menos eficiente energéticamente que ESPHome para un dispositivo alimentado por batería.

Precio:

Plataformas: Windows, macOS, Linux para las herramientas de flash.

Descargar: micropython.org.

Línea de fondo: Para el prototipo donde la velocidad de iteración importa más que los vatios ahorrados.

7. n8n – Mejor pegamento sin código entre agente y hardware

n8n es la herramienta de flujo de trabajo autohospedada que conecta la API de LLM, Home Assistant, ESPHome, una base de datos, y cualquier endpoint HTTP que puedas imaginar, en un gráfico. Cuando quieres “si el agente dijo que la tarea está hecha, toca el timbre y registra la marca de tiempo”, n8n es la forma rápida de construirlo sin escribir un servicio.

Donde se queda corto: No está construido para tiempo real. Bien para flujos activados por herramienta, no para bucles de sensores ajustados.

Precio:

Plataformas: Windows, macOS, Linux, Docker.

Descargar: n8n.io.

Línea de fondo: El tejido conectivo entre la salida del agente y las acciones del robot.

Cómo elegir el correcto

Preguntas frecuentes

¿Necesito una Raspberry Pi además de un ESP32? No siempre. Para cuerpos simples, el ESP32 solo es suficiente con un LLM alojado en la nube o en LAN. Para cuerpos más ricos con inferencia de voz local, una Pi 4 o 5 aloja el modelo y el ESP32 permanece como el cuerpo.

¿Cuál es la placa más barata para comenzar? Una placa de desarrollo ESP32 cuesta unos pocos dólares. Agrega servos, un altavoz pequeño, una pantalla OLED, y estás por debajo de $30 para un robot que toca el timbre.

¿Puedo hacer esto sin conexión a Internet? Sí, si autohospedas el LLM (Ollama, LM Studio o Llama.cpp) y usas Willow para voz. Todo el stack — desde micrófono a LLM a servo — puede vivir en tu LAN.

¿Es seguro? ¿Puede el agente romper cosas? Solo de las formas que permites. Dale al agente endpoints HTTP para las acciones que se permite realizar; no le des acceso root al servidor de Home Assistant. Limita el recorrido del servo y la corriente en el firmware.

¿Cuál es el robot ESP32 impreso en 3D que todos comparten? Es una carcasa pequeña alrededor de una placa de desarrollo ESP32-S3, un OLED para los ojos, y un servo que acciona el timbre. El punto no es el timbre — es el patrón de “agente de IA obtiene una presencia física en la sala”. Todo en este artículo te da los componentes para construir uno.