Softonic reportó esta semana que OpenAI y Anthropic divulgaron conjuntamente un lote de vulnerabilidades de agentes de IA, y la cuestión de responsabilidad que surge es la verdadera historia. Si un agente de codificación elimina un directorio porque una página web le dijo que lo haga, alguien tiene que responder por ello. La respuesta correcta de un usuario de escritorio no es dejar de ejecutar agentes. Es ejecutarlos tras guardrails. Probamos 7 aplicaciones que filtran entradas y salidas de agentes, aíslan su ejecución y registran lo que hicieron, de modo que cuando algo sale mal podemos señalar el prompt exacto que lo causó.
Qué buscar en una aplicación de seguridad de agentes de IA
La seguridad del agente se divide en tres problemas: qué lee el agente, qué hace el agente y qué deja atrás. Cualquier configuración real debe cubrir los tres.
- Filtrado de entrada prompt para inyección de prompt y PII
- Validación de salida contra reglas estructurales
- Una sandbox para ejecución de shell, para que el agente no pueda tocar el archivo incorrecto
- Logs de auditoría de cada prompt, llamada de herramienta y respuesta
- Integración con los agentes de codificación que ya utilizamos (Claude Code, Cursor, Cline)
- Ejecutarse localmente donde sea posible, sin que un servicio de terceros vea cada prompt
Comparación rápida
| App | Best for | Platforms | Free | Cost | Rating |
|---|---|---|---|---|---|
| Guardrails AI | Guardrails estructurales y de contenido | Windows, macOS, Linux, Python | Yes | Free tier + paid Hub | 4.7 (GitHub) |
| NeMo Guardrails | Seguridad conversacional basada en reglas | Windows, macOS, Linux | Yes | Free | 4.6 |
| Rebuff | Detección de inyección de prompt | Windows, macOS, Linux, cloud | Yes | Free tier | 4.5 |
| Docker Desktop | Sandbox de contenedor para agentes | Windows, macOS, Linux | Yes | 9/user/mo Pro | 4.5 |
| gVisor | Sandbox a nivel de kernel para contenedores | Linux, macOS Docker | Yes | Free | 4.4 |
| Firecracker | Micro-VM para aislamiento ligero | Linux | Yes | Free | 4.6 |
| LangKit | Métricas de tiempo de ejecución para prompts LLM | Windows, macOS, Linux | Yes | Free | 4.5 |
1. Guardrails AI, mejor para guardrails estructurales y de contenido
Guardrails AI es una biblioteca de Python y Hub que envuelve llamadas de modelo en reglas declarativas. Di “la salida debe ser JSON válido con estos campos”, “la salida no debe contener PII”, “la salida no debe incluir un comando shell”, y la biblioteca reescribe, reintentar o rechaza la llamada. El Hub añade un mercado de validadores preconstruidos.
Dónde se queda corto: céntrico en Python, por lo que se ajusta mejor a frameworks de agentes que a casos “simplemente quiero que Cursor se comporte”.
Precios:
- Free: core library, Apache 2.0
- Paid: Hub Pro tier para validadores compartidos y aplicación alojada
Plataformas: Windows, macOS, Linux, Python
Download: Guardrails AI | GitHub
Bottom line: la herramienta a elegir cuando escribimos nuestro propio agente y queremos que falle con estrépito en salida incorrecta.
2. NeMo Guardrails, mejor para seguridad conversacional basada en reglas
NeMo Guardrails de NVIDIA nos permite describir políticas en un pequeño lenguaje específico del dominio, Colang, luego envuelve cualquier llamada LLM. Una política podría decir “si el usuario pregunta sobre un prompt del sistema, rechaza”, o “siempre llama a la herramienta de recuperación antes de responder preguntas del dominio”. Colang se ejecuta antes, durante y después de la llamada del modelo.
Dónde se queda corto: Colang es un lenguaje a aprender, y el runtime añade latencia.
Precios:
- Free: open source, Apache 2.0
- Paid: ninguno, aunque existen servicios NeMo Enterprise para el stack de entrenamiento
Plataformas: Windows, macOS, Linux
Download: NeMo Guardrails
Bottom line: vale la pena la curva de aprendizaje si el agente está orientado al usuario y las reglas de política deben estar fuera del prompt.
3. Rebuff, mejor para detección de inyección de prompt
Rebuff es una pequeña biblioteca dedicada a un problema: capturar inyección de prompt antes de que llegue al modelo. Utiliza heurística, una DB vectorial de cadenas de ataque conocidas y un enfoque de canary token. Cualquier cosa que parezca una inyección se marca, y el código que llama decide qué hacer.
Dónde se queda corto: la heurística tiene falsos positivos, y el enfoque vectorial requiere una DB vectorial en ejecución.
Precios:
- Free: open source, MIT
- Paid: cloud tier con DB vectorial alojada y corpus de ataque compartido
Plataformas: Python, JavaScript, cloud
Download: Rebuff
Bottom line: la herramienta especializada. Conéctala antes de la biblioteca guardrail de propósito general.
4. Docker Desktop, mejor para sandbox de contenedor familiar
Docker Desktop es la entrada menos glamorosa de la lista y probablemente la más útil. Ejecuta coding agents dentro de un contenedor con el repositorio montado read-write y todo lo demás read-only, e incluso un prompt hostil no puede eliminar la máquina. Los volúmenes hacen explícitos los handoffs al host.
Dónde se queda corto: la aplicación de escritorio es pesada en RAM, y el licenciamiento ha cambiado dos veces en tres años.
Precios:
- Free: Personal y equipos pequeños (menos de 250 empleados)
- Paid: 9/user/mo Pro, más para Team
Plataformas: Windows, macOS, Linux
Download: Docker Desktop
Bottom line: la respuesta práctica para “cómo permito que Claude ejecute npm install sin darle acceso a mi sistema de archivos”.
5. gVisor, mejor para sandbox a nivel de kernel
gVisor es un kernel de espacio de usuario escrito por Google. Los contenedores que se ejecutan bajo gVisor solo pueden hacer un subset de syscalls, por lo que incluso una fuga de contenedor no puede alcanzar el kernel del host. Es más pesado que un contenedor normal pero mucho más ligero que una VM completa.
Dónde se queda corto: la sobrecarga de rendimiento es real, y no todas las cargas de trabajo se ejecutan bajo él sin ajustes.
Precios:
- Free: open source, Apache 2.0
- Paid: ninguno
Plataformas: Linux, y Linux-inside-Docker en macOS
Bottom line: la capa de aislamiento más profunda, para agentes que tocan código de extraños.
6. Firecracker, mejor para micro-VM
Firecracker es un hipervisor basado en KVM para micro-VM. Los tiempos de arranque están por debajo de un segundo, la huella de memoria se mide en megabytes, y el aislamiento está más cerca de una VM completa que de un contenedor. AWS Lambda se ejecuta en él. Localmente, una Firecracker VM por ejecución de agente mantiene el radio de explosión de cada trabajo contenido.
Dónde se queda corto: solo Linux, y la configuración no es un ejercicio de cinco minutos.
Precios:
- Free: open source, Apache 2.0
- Paid: ninguno
Plataformas: Linux
Download: Firecracker | GitHub
Bottom line: la opción de aislamiento local más fuerte sin una VM completa.
7. LangKit, mejor para métricas de tiempo de ejecución y observabilidad
LangKit de WhyLabs mide cada prompt y respuesta para text quality, toxicity, sentiment, similitud con inyecciones conocidas y PII. Se coloca antes de cualquier llamada LLM, y los dashboards muestran anomalías a lo largo del tiempo. El punto no es bloquear, es notar.
Dónde se queda corto: la observabilidad por sí sola no detiene un ataque, explica lo que sucedió después del hecho.
Precios:
- Free: open source, Apache 2.0
- Paid: plataforma WhyLabs para dashboards alojados, desde alrededor de 200/mo
Plataformas: Windows, macOS, Linux
Download: LangKit
Bottom line: la capa “qué acaba de pasar”. Emparéjala con cualquiera de los enforcers anteriores.
Cómo elegir el correcto
- Para reescribir o rechazar salida incorrecta del modelo: Guardrails AI.
- Para reglas de política fuera del prompt: NeMo Guardrails.
- Para detección de inyección de prompt específicamente: Rebuff.
- Para sandboxing de ejecución shell de forma pragmática: Docker Desktop.
- Para aislamiento más profundo en Linux: gVisor.
- Para aislamiento micro-VM: Firecracker.
- Para medir lo que hacen los agentes: LangKit.
- Para auditoría a nivel de prompt: PromptLayer vale la pena echarle un vistazo, captura cada request y response con metadatos.
Una configuración de escritorio defendible generalmente apila tres de estos: una sandbox (Docker Desktop), una capa guardrail (Guardrails AI o NeMo), y observabilidad (LangKit o PromptLayer).
FAQ
¿Realmente necesito sandboxing para coding agents?
Si el agente ejecuta comandos shell o escribe archivos, sí. Si solo chatea, no. La línea es si una inyección de prompt puede convertirse en una acción.
¿Cuál es el primer paso más fácil?
Docker Desktop con un contenedor bloqueado para el coding agent. Añade Guardrails AI a la llamada del modelo. Eso ya bloquea la mayoría del daño accidental.
¿Pueden estas herramientas proteger el modelo contra ataques de estilo Astra?
Contra ataques directos de modelo, no. Nada en esta lista cambia los pesos del modelo. Contra inyección de prompt, PII leakage, y unsafe tool calls, sí.
¿Los free tier son suficientes?
Para un único desarrollador, sí. Guardrails AI, NeMo Guardrails, Rebuff, gVisor, Firecracker, LangKit, y PromptLayer todos tienen free tier reales. Solo Docker Desktop comienza a cobrar más allá de equipos muy pequeños.
¿Esto ralentiza el agente?
Los guardrails añaden latencia, a veces cientos de milisegundos. Las sandboxes añaden latencia insignificante para contenedores y un poco más para micro-VM. Intercambia la latencia por seguridad, siempre.