Firewall autohospedado de scraper de IA Anubis

Los bots web de Meta generaron nueve mil millones de solicitudes en un solo trimestre este año, y el tráfico saliente casi nunca regresó a los sitios que los crawlers extrajeron. Cloudflare ahora bloquea de forma predeterminada bots de entrenamiento y agentes en cualquier página que muestre anuncios. La línea entre “visita de búsqueda” y “corpus de entrenamiento” se ha movido, y si diriges un sitio, probablemente quieras estar del lado “bloqueador” de la misma.

Las mejores aplicaciones para bloquear scrapers web de IA en escritorio en 2026 se dividen en tres categorías: servicios edge que bloquean en el borde de la red antes de que las solicitudes lleguen a tu origin, firewalls proof-of-work autohospedados que se ejecutan junto a tu aplicación, y reglas del lado origin que filtran las solicitudes después de llegar. Elegimos siete que funcionan juntas, desde un simple toggle de Cloudflare hasta Anubis (ya implementado por el código fuente del kernel Linux, Codeberg y FFmpeg).

Qué buscar en una herramienta de bloqueo de scrapers de IA

Comparación rápida

Herramienta Mejor para Plan gratuito Pagado Implementación
Cloudflare AI Crawl Control Cualquier sitio detrás de Cloudflare Incluido en todos los niveles Incluido con Cloudflare Pro/Biz Toggle de un clic
Dark Visitors (Known Agents) Visibilidad de qué bots de IA te visitan Nivel gratuito Planes de equipo desde una tarifa mensual modesta robots.txt + rastreador de agentes
Anubis Muro proof-of-work autohospedado Open source, gratuito Solo gratuito Proxy inverso (binario Go)
Nepenthes Hacer perder tiempo activamente a los scrapers Open source, gratuito Solo gratuito Contenedor tarpit
Fail2Ban Herramienta de bloqueo por log del lado origin Open source, gratuito Solo gratuito Daemon del servidor
ModSecurity + OWASP CRS WAF basado en reglas del lado origin Open source, gratuito Gratuito con conjuntos de reglas comerciales Módulo nginx/Apache
DataDome Gestión de bots de nivel empresarial Solo prueba Contratos empresariales Integración Edge / API

Las herramientas

1. Cloudflare AI Crawl Control – Mejor bloqueador de un clic para cualquier sitio

Cloudflare AI Crawl Control es la forma más rápida de detener bots de entrenamiento de IA. Cualquier cliente en cualquier nivel (incluyendo gratuito) puede ir a Security → Bots en el panel de control y activar el toggle “AI Crawls and Scrapers”. Utiliza la base de datos de huellas dactilares de bots de Cloudflare más señales de comportamiento para identificar GPTBot, ClaudeBot, Applebot Extended, PerplexityBot y cientos más. A partir del 15 de septiembre de 2026, los nuevos dominios bloquean por defecto bots de entrenamiento y agentes en páginas que muestran anuncios.

Porque se ejecuta en el borde de la red, las solicitudes bloqueadas nunca tocan tu origin. Eso ahorra ancho de banda y CPU del origin, y no importa qué stack use tu sitio. También puedes permitir bots específicos (Googlebot permanece verde por defecto), cobrar por acceso a través del programa de pago por crawl de Cloudflare, o escribir reglas personalizadas para control más fino.

Dónde falla: Solo útil si tu sitio está detrás de Cloudflare. El clasificador de Cloudflare ocasionalmente etiqueta mal crawlers de investigación o archivo legítimos, así que verifica la analítica antes de dejarlo en piloto automático para algo importante.

Precios:

Plataformas: Cualquier sitio frente a Cloudflare (los origins de Windows, macOS, Linux funcionan)

Conclusión: Si estás en Cloudflare, activa esto antes de leer el resto de la lista.

2. Dark Visitors (Known Agents) – Mejor para saber qué bots realmente te visitan

Dark Visitors (renombrado a Known Agents en 2026) es la capa de visibilidad que falta en la mayoría de sitios. Mantiene una base de datos curada de agentes de IA (bots de entrenamiento, scrapers RAG, agentes de navegación, copilots LLM) y te proporciona tanto un archivo robots.txt actualizado en vivo como un panel de analítica que muestra cuáles están realmente tocando. Añade un fragmento y obtienes números reales sobre GPTBot, ClaudeBot, PerplexityBot y docenas de agentes más nuevos que probablemente no has oído hablar.

El nivel gratuito cubre lo esencial: lista de agentes, archivo robots.txt, seguimiento básico de visitas. Los niveles pagos desbloquean analítica completa, múltiples sitios y acceso a API. Se empareja bien con Cloudflare: Cloudflare te dice qué fue bloqueado en el borde, Known Agents te dice qué intentó (y para todo lo que Cloudflare aún no reconoce) qué aún pasó.

Dónde falla: robots.txt es una solicitud, no una regla. Los crawlers bien comportados la respetan; los malos actores la ignoran. Esta herramienta te dice la verdad sobre quién está ignorando las reglas, pero no fuerza el cumplimiento por sí sola.

Precios:

Plataformas: Cualquier sitio (basado en fragmento)

Conclusión: Instala esto incluso si ya tienes Cloudflare, porque te dice qué bots se están convirtiendo en un problema creciente.

3. Anubis – Mejor muro autohospedado contra scrapers de IA

Anubis es un Web AI Firewall autohospedado escrito en Go por TecharoHQ. Se ubica como un proxy inverso frente a tu aplicación e emite un desafío de proof-of-work de JavaScript antes de servir una solicitud. Los navegadores reales resuelven el desafío de forma invisible en una fracción de segundo; los scrapers ingenuos se detienen porque no ejecutan JS o no quieren quemar ciclos de CPU en su escala.

La adopción cuenta la historia: Codeberg, FFmpeg, el código fuente del kernel Linux y la mayoría de proyectos FOSS que no son Cloudflare lo ejecutan. La configuración es un único archivo YAML; apuntas a Anubis a tu upstream, estableces la dificultad del desafío por ruta y añades listas de permitidos para bots buenos (Googlebot, IA_Archiver, etc.).

Dónde falla: Los scrapers que ejecutan JS (Chromium headless, Playwright) también pueden resolver el PoW; simplemente pagan un costo de CPU modesto. Anubis es un fuerte disuasivo, no un muro impenetrable. También añade un pequeño salto de latencia para cada solicitud.

Precios:

Plataformas: Linux (Docker, systemd), Windows, macOS (vía binario Go)

Conclusión: La opción correcta cuando ejecutas tu propia infraestructura y no quieres enrutar a través de Cloudflare.

4. Nepenthes – Mejor para hacer perder tiempo a los scrapers

Nepenthes toma el enfoque opuesto: en lugar de bloquear scrapers, los arrastra a un laberinto infinito de páginas generadas proceduralmente y de aspecto plausible que nunca terminan. El resultado es un tarpit que cuesta al scraper CPU y ancho de banda mientras no devuelve datos de entrenamiento útiles. Hecho específicamente en respuesta a crawlers de IA ignorando robots.txt, ha sido adoptado por administradores que quieren aumentar activamente el costo del scraping en lugar de rechazarlo pasivamente.

Implementalo como un contenedor Docker en un subdominio o ruta, añade una directiva robots.txt que apunte bots malos a ella, y mira al crawler desperdiciar sus recursos. También envenena ligeramente los datos de entrenamiento: cualquier scraper que ingiera la salida de Nepenthes trae texto ruidoso pero plausible pero falso de vuelta a cualquier pipeline al que alimente.

Dónde falla: Éticamente cuestionable para algunos operadores; estás sirviendo datos engañosos intencionalmente. Solo afecta a bots que no respetan robots.txt en primer lugar, que es el punto pero también vale la pena considerar.

Precios:

Plataformas: Linux (Docker) principalmente; macOS y Windows vía Docker

Conclusión: Añade esto una vez que ya tengas bloqueo en lugar y quieras hacer el scraping activamente costoso.

5. Fail2Ban – Mejor herramienta de bloqueo por log del lado origin

Fail2Ban es la herramienta clásica para leer logs de servidor, detectar patrones e impulsar bloqueos de nivel IP al firewall. Cada administrador de Linux la conoce. Para scrapers de IA específicamente, un filtro Fail2Ban puede vigilar logs de nginx o Apache para User-Agent regex (GPTBot, ClaudeBot, Bytespider, etc.), o para firmas de comportamiento (ráfagas de solicitudes por segundo desde una sola IP), e introducir al infractor en iptables.

Como el bloqueo ocurre en el firewall del kernel, el origin no gasta ciclos sirviendo al scraper en absoluto. Combina con una configuración de Cloudflare en el borde y Anubis en el medio, y tienes una defensa en profundidad.

Dónde falla: Los bloqueos basados en IP son frágiles contra proxies residenciales rotativos, que usan scrapers serios. Y los filtros deben escribirse y ajustarse; no es una instalación de un clic.

Precios:

Plataformas: Linux (nativo); el soporte de Windows y macOS es limitado

Conclusión: La opción correcta para administradores que ya escriben filtros regex y quieren el bloqueo a nivel de paquete.

6. ModSecurity + OWASP CRS – Mejor WAF basado en reglas del lado origin

ModSecurity con OWASP Core Rule Set es el WAF de código abierto que administradores de nginx y Apache implementan en el origin cuando no pueden o no quieren un servicio edge. El CRS viene con reglas para ataques comunes (SQLi, XSS, RCE), y conjuntos de reglas de bots de IA mantenidos por la comunidad añaden filtros User-Agent, umbrales de comportamiento y feeds de IP conocidos malos específicamente para scrapers de IA.

Porque está basado en reglas, mantienes control total. Puedes poner en lista blanca una herramienta de analítica interna, bloquear un user-agent específico globalmente, o escribir reglas por ruta. También juega bien con Fail2Ban: ModSecurity marca una solicitud como anómala, Fail2Ban lee la marca y bloquea la fuente.

Dónde falla: Las reglas requieren mantenimiento. Los falsos positivos ocurren en aplicaciones personalizadas. Y es un módulo nativo para nginx o Apache, así que los despliegues containerizados necesitan imágenes Docker con ello incorporado.

Precios:

Plataformas: Linux (nginx/Apache nativo), Windows (vía IIS con limitaciones)

Conclusión: El WAF predeterminado en origin cuando no estás detrás de Cloudflare y quieres transparencia total.

7. DataDome – Mejor gestión de bots de nivel empresarial

DataDome es adonde llegas cuando un blog personal escala hacia un negocio real. Aproximadamente 1.200 empresas en América y Europa ejecutan su WAF, y operan más de 85.000 modelos de aprendizaje automático específicos del cliente, lo que significa que cada sitio protegido se convierte en su propio desafío de detección para un scraper. Se integra en el borde (vía CDN o DNS), y su detección se extiende más allá de bots de entrenamiento de IA a relleno de credenciales, fraude de anuncios y granjas de scraping-como-servicio.

El panel de control es el más fuerte en esta categoría, proporcionándote clasificación por solicitud, desglose geográfico y estimaciones de impacto en ingresos. El tiempo de respuesta en la detección se mide en milisegundos. El soporte de nivel Enterprise está incluido.

Dónde falla: El precio no es para individuos; solicitas una cotización. La configuración requiere cooperación con tu DNS, CDN y origin, así que es un proyecto no un toggle.

Precios:

Plataformas: Cualquier origin (Windows, macOS, Linux); implementado en el borde

Conclusión: La opción correcta cuando el costo del contenido raspado o el fraude es mayor que la factura anual de gestión de bots.

Cómo elegir el correcto

FAQ

¿Cuál es el mejor bloqueador de scrapers de IA gratuito?

Cloudflare AI Crawl Control si tu sitio está detrás de Cloudflare (el nivel gratuito lo incluye). Si autohospedas, Anubis es la opción de código abierto gratuita más fuerte. Ambos abordan el mismo problema desde diferentes lados del stack.

¿Pueden los bots de IA eludir Cloudflare?

Sí, algunos pueden. El clasificador de Cloudflare es muy bueno en bloqueo basado en firmas pero los scrapers sofisticados utilizan rotación de proxies residenciales y navegadores headless para parecer humanos. Por eso la defensa en capas (borde + origin + visibilidad) funciona mejor que cualquier herramienta individual.

¿Necesito bloquear bots de IA en un blog personal?

Eso depende de ti. Si quieres que tu contenido se use para entrenar LLMs comerciales, no hagas nada. Si prefieres que no, activa el toggle de Cloudflare o añade Anubis. El punto medio más común es robots.txt de Known Agents más bloqueo de Cloudflare para los crawlers de entrenamiento más grandes.

¿Dañará el bloqueo de bots de IA mi clasificación de búsqueda?

No si configuras el bloqueador correctamente. Todas las herramientas en esta lista pueden permitir Googlebot, Bingbot y otros crawlers de búsqueda tradicionales mientras bloquean bots que solo entrenan como GPTBot, ClaudeBot y PerplexityBot. Verifica la lista de permitidos antes del despliegue.

¿Cuál es la diferencia entre Anubis y Cloudflare?

Cloudflare bloquea en el borde de la red antes de que las solicitudes lleguen a tu servidor. Anubis se ejecuta en tu servidor como un proxy inverso y emite un desafío proof-of-work. Cloudflare es más fácil y cubre más terreno; Anubis es autohospedado, transparente y no requiere terceros.