Los bots web de Meta generaron nueve mil millones de solicitudes en un solo trimestre este año, y el tráfico saliente casi nunca regresó a los sitios que los crawlers extrajeron. Cloudflare ahora bloquea de forma predeterminada bots de entrenamiento y agentes en cualquier página que muestre anuncios. La línea entre “visita de búsqueda” y “corpus de entrenamiento” se ha movido, y si diriges un sitio, probablemente quieras estar del lado “bloqueador” de la misma.
Las mejores aplicaciones para bloquear scrapers web de IA en escritorio en 2026 se dividen en tres categorías: servicios edge que bloquean en el borde de la red antes de que las solicitudes lleguen a tu origin, firewalls proof-of-work autohospedados que se ejecutan junto a tu aplicación, y reglas del lado origin que filtran las solicitudes después de llegar. Elegimos siete que funcionan juntas, desde un simple toggle de Cloudflare hasta Anubis (ya implementado por el código fuente del kernel Linux, Codeberg y FFmpeg).
Qué buscar en una herramienta de bloqueo de scrapers de IA
- Detección combinada de User-Agent y comportamiento. Cualquier herramienta que solo verifique la cadena User-Agent es solo un freno, no un muro.
- Capacidad de distinguir bots de entrenamiento de crawlers de búsqueda. Quieres bloquear GPTBot, permitir Googlebot.
- Baja tasa de falsos positivos en humanos reales. Los desafíos proof-of-work deben degradarse correctamente en teléfonos antiguos y lectores de pantalla.
- Visibilidad. Un panel de control que te diga qué bots te visitaron la semana pasada vale más que un claim de “bloqueamos cosas” en caja negra.
- Costo que coincida con tu tráfico. Un blog personal no necesita un contrato WAF de cinco cifras.
Comparación rápida
| Herramienta | Mejor para | Plan gratuito | Pagado | Implementación |
|---|---|---|---|---|
| Cloudflare AI Crawl Control | Cualquier sitio detrás de Cloudflare | Incluido en todos los niveles | Incluido con Cloudflare Pro/Biz | Toggle de un clic |
| Dark Visitors (Known Agents) | Visibilidad de qué bots de IA te visitan | Nivel gratuito | Planes de equipo desde una tarifa mensual modesta | robots.txt + rastreador de agentes |
| Anubis | Muro proof-of-work autohospedado | Open source, gratuito | Solo gratuito | Proxy inverso (binario Go) |
| Nepenthes | Hacer perder tiempo activamente a los scrapers | Open source, gratuito | Solo gratuito | Contenedor tarpit |
| Fail2Ban | Herramienta de bloqueo por log del lado origin | Open source, gratuito | Solo gratuito | Daemon del servidor |
| ModSecurity + OWASP CRS | WAF basado en reglas del lado origin | Open source, gratuito | Gratuito con conjuntos de reglas comerciales | Módulo nginx/Apache |
| DataDome | Gestión de bots de nivel empresarial | Solo prueba | Contratos empresariales | Integración Edge / API |
Las herramientas
1. Cloudflare AI Crawl Control – Mejor bloqueador de un clic para cualquier sitio
Cloudflare AI Crawl Control es la forma más rápida de detener bots de entrenamiento de IA. Cualquier cliente en cualquier nivel (incluyendo gratuito) puede ir a Security → Bots en el panel de control y activar el toggle “AI Crawls and Scrapers”. Utiliza la base de datos de huellas dactilares de bots de Cloudflare más señales de comportamiento para identificar GPTBot, ClaudeBot, Applebot Extended, PerplexityBot y cientos más. A partir del 15 de septiembre de 2026, los nuevos dominios bloquean por defecto bots de entrenamiento y agentes en páginas que muestran anuncios.
Porque se ejecuta en el borde de la red, las solicitudes bloqueadas nunca tocan tu origin. Eso ahorra ancho de banda y CPU del origin, y no importa qué stack use tu sitio. También puedes permitir bots específicos (Googlebot permanece verde por defecto), cobrar por acceso a través del programa de pago por crawl de Cloudflare, o escribir reglas personalizadas para control más fino.
Dónde falla: Solo útil si tu sitio está detrás de Cloudflare. El clasificador de Cloudflare ocasionalmente etiqueta mal crawlers de investigación o archivo legítimos, así que verifica la analítica antes de dejarlo en piloto automático para algo importante.
Precios:
- Gratuito: Toggle completo, lista de bloqueo/permitidos, analítica
- Pagado: Incluido con Cloudflare Pro, Business y Enterprise
Plataformas: Cualquier sitio frente a Cloudflare (los origins de Windows, macOS, Linux funcionan)
Conclusión: Si estás en Cloudflare, activa esto antes de leer el resto de la lista.
2. Dark Visitors (Known Agents) – Mejor para saber qué bots realmente te visitan
Dark Visitors (renombrado a Known Agents en 2026) es la capa de visibilidad que falta en la mayoría de sitios. Mantiene una base de datos curada de agentes de IA (bots de entrenamiento, scrapers RAG, agentes de navegación, copilots LLM) y te proporciona tanto un archivo robots.txt actualizado en vivo como un panel de analítica que muestra cuáles están realmente tocando. Añade un fragmento y obtienes números reales sobre GPTBot, ClaudeBot, PerplexityBot y docenas de agentes más nuevos que probablemente no has oído hablar.
El nivel gratuito cubre lo esencial: lista de agentes, archivo robots.txt, seguimiento básico de visitas. Los niveles pagos desbloquean analítica completa, múltiples sitios y acceso a API. Se empareja bien con Cloudflare: Cloudflare te dice qué fue bloqueado en el borde, Known Agents te dice qué intentó (y para todo lo que Cloudflare aún no reconoce) qué aún pasó.
Dónde falla: robots.txt es una solicitud, no una regla. Los crawlers bien comportados la respetan; los malos actores la ignoran. Esta herramienta te dice la verdad sobre quién está ignorando las reglas, pero no fuerza el cumplimiento por sí sola.
Precios:
- Gratuito: Archivo robots.txt, rastreador básico, un sitio
- Pagado: Planes de equipo desde una tarifa mensual modesta para multi-sitio, analítica completa, API
Plataformas: Cualquier sitio (basado en fragmento)
Conclusión: Instala esto incluso si ya tienes Cloudflare, porque te dice qué bots se están convirtiendo en un problema creciente.
3. Anubis – Mejor muro autohospedado contra scrapers de IA
Anubis es un Web AI Firewall autohospedado escrito en Go por TecharoHQ. Se ubica como un proxy inverso frente a tu aplicación e emite un desafío de proof-of-work de JavaScript antes de servir una solicitud. Los navegadores reales resuelven el desafío de forma invisible en una fracción de segundo; los scrapers ingenuos se detienen porque no ejecutan JS o no quieren quemar ciclos de CPU en su escala.
La adopción cuenta la historia: Codeberg, FFmpeg, el código fuente del kernel Linux y la mayoría de proyectos FOSS que no son Cloudflare lo ejecutan. La configuración es un único archivo YAML; apuntas a Anubis a tu upstream, estableces la dificultad del desafío por ruta y añades listas de permitidos para bots buenos (Googlebot, IA_Archiver, etc.).
Dónde falla: Los scrapers que ejecutan JS (Chromium headless, Playwright) también pueden resolver el PoW; simplemente pagan un costo de CPU modesto. Anubis es un fuerte disuasivo, no un muro impenetrable. También añade un pequeño salto de latencia para cada solicitud.
Precios:
- Gratuito: Completamente código abierto (MIT)
- Pagado: Ninguno; soporte comercial disponible por separado
Plataformas: Linux (Docker, systemd), Windows, macOS (vía binario Go)
Conclusión: La opción correcta cuando ejecutas tu propia infraestructura y no quieres enrutar a través de Cloudflare.
4. Nepenthes – Mejor para hacer perder tiempo a los scrapers
Nepenthes toma el enfoque opuesto: en lugar de bloquear scrapers, los arrastra a un laberinto infinito de páginas generadas proceduralmente y de aspecto plausible que nunca terminan. El resultado es un tarpit que cuesta al scraper CPU y ancho de banda mientras no devuelve datos de entrenamiento útiles. Hecho específicamente en respuesta a crawlers de IA ignorando robots.txt, ha sido adoptado por administradores que quieren aumentar activamente el costo del scraping en lugar de rechazarlo pasivamente.
Implementalo como un contenedor Docker en un subdominio o ruta, añade una directiva robots.txt que apunte bots malos a ella, y mira al crawler desperdiciar sus recursos. También envenena ligeramente los datos de entrenamiento: cualquier scraper que ingiera la salida de Nepenthes trae texto ruidoso pero plausible pero falso de vuelta a cualquier pipeline al que alimente.
Dónde falla: Éticamente cuestionable para algunos operadores; estás sirviendo datos engañosos intencionalmente. Solo afecta a bots que no respetan robots.txt en primer lugar, que es el punto pero también vale la pena considerar.
Precios:
- Gratuito: Código abierto
- Pagado: Ninguno
Plataformas: Linux (Docker) principalmente; macOS y Windows vía Docker
Conclusión: Añade esto una vez que ya tengas bloqueo en lugar y quieras hacer el scraping activamente costoso.
5. Fail2Ban – Mejor herramienta de bloqueo por log del lado origin
Fail2Ban es la herramienta clásica para leer logs de servidor, detectar patrones e impulsar bloqueos de nivel IP al firewall. Cada administrador de Linux la conoce. Para scrapers de IA específicamente, un filtro Fail2Ban puede vigilar logs de nginx o Apache para User-Agent regex (GPTBot, ClaudeBot, Bytespider, etc.), o para firmas de comportamiento (ráfagas de solicitudes por segundo desde una sola IP), e introducir al infractor en iptables.
Como el bloqueo ocurre en el firewall del kernel, el origin no gasta ciclos sirviendo al scraper en absoluto. Combina con una configuración de Cloudflare en el borde y Anubis en el medio, y tienes una defensa en profundidad.
Dónde falla: Los bloqueos basados en IP son frágiles contra proxies residenciales rotativos, que usan scrapers serios. Y los filtros deben escribirse y ajustarse; no es una instalación de un clic.
Precios:
- Gratuito: Código abierto, en cada distribución de Linux convencional
- Pagado: Ninguno
Plataformas: Linux (nativo); el soporte de Windows y macOS es limitado
Conclusión: La opción correcta para administradores que ya escriben filtros regex y quieren el bloqueo a nivel de paquete.
6. ModSecurity + OWASP CRS – Mejor WAF basado en reglas del lado origin
ModSecurity con OWASP Core Rule Set es el WAF de código abierto que administradores de nginx y Apache implementan en el origin cuando no pueden o no quieren un servicio edge. El CRS viene con reglas para ataques comunes (SQLi, XSS, RCE), y conjuntos de reglas de bots de IA mantenidos por la comunidad añaden filtros User-Agent, umbrales de comportamiento y feeds de IP conocidos malos específicamente para scrapers de IA.
Porque está basado en reglas, mantienes control total. Puedes poner en lista blanca una herramienta de analítica interna, bloquear un user-agent específico globalmente, o escribir reglas por ruta. También juega bien con Fail2Ban: ModSecurity marca una solicitud como anómala, Fail2Ban lee la marca y bloquea la fuente.
Dónde falla: Las reglas requieren mantenimiento. Los falsos positivos ocurren en aplicaciones personalizadas. Y es un módulo nativo para nginx o Apache, así que los despliegues containerizados necesitan imágenes Docker con ello incorporado.
Precios:
- Gratuito: Código abierto
- Pagado: Conjuntos de reglas comerciales y soporte disponibles de terceros
Plataformas: Linux (nginx/Apache nativo), Windows (vía IIS con limitaciones)
Conclusión: El WAF predeterminado en origin cuando no estás detrás de Cloudflare y quieres transparencia total.
7. DataDome – Mejor gestión de bots de nivel empresarial
DataDome es adonde llegas cuando un blog personal escala hacia un negocio real. Aproximadamente 1.200 empresas en América y Europa ejecutan su WAF, y operan más de 85.000 modelos de aprendizaje automático específicos del cliente, lo que significa que cada sitio protegido se convierte en su propio desafío de detección para un scraper. Se integra en el borde (vía CDN o DNS), y su detección se extiende más allá de bots de entrenamiento de IA a relleno de credenciales, fraude de anuncios y granjas de scraping-como-servicio.
El panel de control es el más fuerte en esta categoría, proporcionándote clasificación por solicitud, desglose geográfico y estimaciones de impacto en ingresos. El tiempo de respuesta en la detección se mide en milisegundos. El soporte de nivel Enterprise está incluido.
Dónde falla: El precio no es para individuos; solicitas una cotización. La configuración requiere cooperación con tu DNS, CDN y origin, así que es un proyecto no un toggle.
Precios:
- Gratuito: Prueba de 30 días
- Pagado: Contratos empresariales, cotizaciones personalizadas
Plataformas: Cualquier origin (Windows, macOS, Linux); implementado en el borde
Conclusión: La opción correcta cuando el costo del contenido raspado o el fraude es mayor que la factura anual de gestión de bots.
Cómo elegir el correcto
- Si quieres la opción más simple y ya estás en Cloudflare: activa AI Crawl Control. Hecho en 15 segundos.
- Si quieres ver la verdad de quién te está raspando: instala Dark Visitors (Known Agents) junto con cualquier otra cosa. Visibilidad primero, bloqueo segundo.
- Si autohospedas y no quieres estar detrás de un CDN: ejecuta Anubis como tu proxy inverso. Añade Nepenthes para envenenar los que atraviesan.
- Si eres un administrador de Linux que ya vive en logs de nginx: conecta Fail2Ban y ModSecurity + OWASP CRS. Gratuito, transparente, bajo tu control.
- Si eres un negocio con ingresos reales en juego: obtén un contrato DataDome. Cloudflare cubre el mercado masivo; DataDome cubre los casos límite.
- El stack realista para un sitio pequeño a mediano en 2026: Cloudflare AI Crawl Control en el borde, Dark Visitors para visibilidad, Anubis para cualquier cosa que Cloudflare no capture. Esa combinación se ejecuta por $0 en la mayoría de meses.
FAQ
¿Cuál es el mejor bloqueador de scrapers de IA gratuito?
Cloudflare AI Crawl Control si tu sitio está detrás de Cloudflare (el nivel gratuito lo incluye). Si autohospedas, Anubis es la opción de código abierto gratuita más fuerte. Ambos abordan el mismo problema desde diferentes lados del stack.
¿Pueden los bots de IA eludir Cloudflare?
Sí, algunos pueden. El clasificador de Cloudflare es muy bueno en bloqueo basado en firmas pero los scrapers sofisticados utilizan rotación de proxies residenciales y navegadores headless para parecer humanos. Por eso la defensa en capas (borde + origin + visibilidad) funciona mejor que cualquier herramienta individual.
¿Necesito bloquear bots de IA en un blog personal?
Eso depende de ti. Si quieres que tu contenido se use para entrenar LLMs comerciales, no hagas nada. Si prefieres que no, activa el toggle de Cloudflare o añade Anubis. El punto medio más común es robots.txt de Known Agents más bloqueo de Cloudflare para los crawlers de entrenamiento más grandes.
¿Dañará el bloqueo de bots de IA mi clasificación de búsqueda?
No si configuras el bloqueador correctamente. Todas las herramientas en esta lista pueden permitir Googlebot, Bingbot y otros crawlers de búsqueda tradicionales mientras bloquean bots que solo entrenan como GPTBot, ClaudeBot y PerplexityBot. Verifica la lista de permitidos antes del despliegue.
¿Cuál es la diferencia entre Anubis y Cloudflare?
Cloudflare bloquea en el borde de la red antes de que las solicitudes lleguen a tu servidor. Anubis se ejecuta en tu servidor como un proxy inverso y emite un desafío proof-of-work. Cloudflare es más fácil y cubre más terreno; Anubis es autohospedado, transparente y no requiere terceros.