AI Readable
← Todas las entradas

Los rastreadores de IA son de tres clases: no los bloquees todos

Entrenamiento, recuperación en vivo y obtenciones iniciadas por el usuario son tres cosas distintas. Solo la segunda te trae tráfico.

Antes de terminar de rellenar las líneas User-agent de robots.txt, deja claro una cosa: esos nombres representan tres comportamientos distintos, y valen cosas muy diferentes para ti.

Tres clases

1. Entrenamiento

GPTBot, ClaudeBot, Google-Extended, CCBot. Llevan el contenido a corpus de entrenamiento y no te traen tráfico. Permitirlos o no es una decisión de negocio: ¿quieres tus argumentos dentro del «sentido común» del modelo, o consideras que eso es regalarlo todo?

2. Recuperación en vivo

OAI-SearchBot, PerplexityBot, Claude-SearchBot. Cuando alguien pregunta algo, buscan y recuperan en el momento, y luego te citan con un enlace en la respuesta. Esta es la categoría que de verdad genera tráfico. Bloquearlos es darse de baja de la página de resultados de la búsqueda generativa.

3. Obtenciones iniciadas por el usuario

ChatGPT-User, Perplexity-User. Alguien pegó tu enlace en una conversación y el modelo fue a buscar esa página. Una persona pidió ver tu contenido a propósito; bloquearlo solo le entrega un «no se pudo acceder».

Un malentendido frecuente

Mucha gente supone que Disallow impide que su contenido se use para entrenamiento. En la práctica:

  • robots.txt es voluntario; no tiene poder coercitivo
  • Solo detiene la obtención directa desde tu sitio: no puede impedir que alguien recoja tu contenido después de republicarlo
  • Las instantáneas de Common Crawl (CCBot) ya existen; bloquear ahora solo afecta a lo que venga después

Una configuración que merece copiarse

Si tu objetivo es el tráfico por cita —lo normal en la mayoría de sitios de contenido—, permitirlo todo es lo más simple:

User-agent: *
Allow: /
Disallow: /admin
Disallow: /api/

Sitemap: https://your-site.com/sitemap.xml

Si quieres tráfico sin regalar datos de entrenamiento, sepáralos:

# Entrenamiento: rechazar
User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Recuperación y cita: permitir
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ChatGPT-User
Allow: /

No todos los proveedores respetan esta separación con rigor, pero al menos deja tu intención sin ambigüedad.

Cómo verificarlo

No des por hecho que ha surtido efecto. Pide la página como lo haría un rastreador:

curl -A "OAI-SearchBot" -I https://your-site.com/
curl -s https://your-site.com/robots.txt

Fíjate en dos cosas: si el estado es 200 y si tu CDN trata esos user agents como tráfico hostil. El bloqueo «AI Scrapers and Crawlers» de Cloudflare viene activado por defecto: muchos sitios tienen un robots.txt perfectamente correcto y aun así están bloqueados una capa más arriba.

Si prefieres no comprobarlos uno a uno, la herramienta de acceso de rastreadores de IA lista doce rastreadores y te dice cuáles están permitidos, cuáles bloqueados y qué línea de tu robots.txt lo decidió.