# ─── 1 · Regla por defecto — todos los rastreadores ────────────────── # Rastreo abierto de todo el sitio salvo carpetas internas/técnicas. User-agent: * Allow: / Disallow: /build/ Disallow: /uploads/ Disallow: /scraps/ # Señal de uso de contenido (Cloudflare Content Signals, 2025): # indexar para búsqueda = sí · usar para entrenar IA = no. Content-Signal: search=yes, ai-train=no # ─── 2 · Buscadores tradicionales — RASTREO COMPLETO ───────────────── # Nunca bloquear estos: son los que posicionan la web. User-agent: Googlebot Allow: / User-agent: Googlebot-Image Allow: / User-agent: Bingbot Allow: / User-agent: DuckDuckBot Allow: / User-agent: Applebot Allow: / # ─── 3 · Buscadores de IA (GEO) — PERMITIDOS ───────────────────────── # Rastrean para CITAR y enlazar la web dentro de respuestas de IA. # NO se usan para entrenar modelos. Los permitimos = visibilidad. # OpenAI · búsqueda de ChatGPT + fetch a petición del usuario User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / # Anthropic (Claude) · búsqueda + fetch a petición del usuario User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / # Perplexity · índice de respuestas y citas User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / # You.com User-agent: YouBot Allow: / # Microsoft Copilot / Bing Chat se sirven vía Bingbot (permitido arriba). # ─── 4 · Rastreadores de ENTRENAMIENTO de IA — BLOQUEADOS ──────────── # Recogen contenido para pesos de modelos, sin tráfico ni atribución. # Bloquearlos NO afecta a la búsqueda ni al posicionamiento. # OpenAI · entrenamiento de modelos (GPT) User-agent: GPTBot Disallow: / # Anthropic · entrenamiento (Claude) User-agent: ClaudeBot Disallow: / User-agent: anthropic-ai Disallow: / User-agent: Claude-Web Disallow: / # Google · opt-out de entrenamiento de Gemini/Vertex # (NO afecta a Googlebot ni al ranking de búsqueda) User-agent: Google-Extended Disallow: / User-agent: Google-CloudVertexBot Disallow: / # Apple · opt-out de entrenamiento de Apple Intelligence # (NO afecta a Applebot ni a la visibilidad en Siri/Spotlight) User-agent: Applebot-Extended Disallow: / # Common Crawl · dataset abierto que alimenta muchos LLMs User-agent: CCBot Disallow: / # Meta / Facebook · entrenamiento User-agent: Meta-ExternalAgent Disallow: / User-agent: meta-externalagent Disallow: / User-agent: Meta-ExternalFetcher Disallow: / User-agent: FacebookBot Disallow: / # ByteDance (TikTok) User-agent: Bytespider Disallow: / # Amazon (Alexa / Rufus) User-agent: Amazonbot Disallow: / # Otros rastreadores de entrenamiento / recolección masiva User-agent: cohere-ai Disallow: / User-agent: Diffbot Disallow: / User-agent: Omgili Disallow: / User-agent: Omgilibot Disallow: / User-agent: webzio-extended Disallow: / User-agent: ImagesiftBot Disallow: / User-agent: Timpibot Disallow: / User-agent: VelenPublicWebCrawler Disallow: / User-agent: Kangaroo Bot Disallow: / User-agent: PanguBot Disallow: / User-agent: Scrapy Disallow: / # ─── 5 · Mapa del sitio ────────────────────────────────────────────── Sitemap: https://cliender.com/sitemap.xml # Resumen legible para buscadores con IA (GEO) # https://cliender.com/llms.txt