
Su sitio pasa por Cloudflare, quizá porque un desarrollador, un proveedor de alojamiento o una agencia del pasado lo puso ahí, y usted acaba de leer un titular sobre Cloudflare, Googlebot y el entrenamiento de IA. Ahora se pregunta si un ajuste que nunca eligió está ocultando a su negocio de Google, o de los asistentes de IA que consultan sus clientes. Esa preocupación es justa, y usted puede aclararla en unos diez minutos sin cambiar nada. El ajuste Disallow AI Training de Cloudflare existe justo para esta situación: permite que un sitio rechace el entrenamiento de IA mientras mantiene permitido el rastreador de Google para la Búsqueda. El ajuste Block, más antiguo, funciona distinto y puede detener a Googlebot. Así que, las preguntas útiles son qué ajuste tiene su sitio, qué dice su robots.txt en vivo y qué muestra Google Search Console sobre sus páginas clave. Las respuestas le dicen si necesita tocar algo.
Puntos clave
Abra su robots.txt en vivo, revise las políticas de Search, Training y Agent en Cloudflare e inspeccione una página en Search Console. Cambie solo la regla que pueda demostrar que es responsable.
Cloudflare lo agregó el 15 de septiembre de 2026 para que un sitio pueda rechazar el entrenamiento mientras Googlebot, Bingbot y Applebot siguen permitidos para la Búsqueda. El ajuste Block, más antiguo, todavía puede detener a Googlebot.
Google dice que no afecta la inclusión de un sitio en la Búsqueda de Google y que no es una señal de posicionamiento, así que una línea Google-Extended en su robots.txt no es lo que lo oculta de Google.
¿Qué debo revisar primero si creo que Cloudflare está ocultando mi sitio de Google?
Empiece con una revisión de solo lectura. Nada de lo siguiente cambia un ajuste, y las propias herramientas de Google hacen la mayor parte del trabajo. La regla que hay que mantener: no cambie nada hasta que pueda señalar la regla responsable.
- Confirme que el sitio está detrás de Cloudflare. Mire los ajustes de DNS en su registrador de dominio o proveedor de alojamiento para ver si su nombre de host público pasa por el proxy de Cloudflare. Un encabezado de respuesta `server: cloudflare` es una pista, pero la vista de DNS o del panel es más confiable.
- Abra su robots.txt en vivo. Escriba su dirección web seguida de /robots.txt, usando la dirección exacta con `https://` que ven los clientes. La guía de Google para crear un archivo robots.txt explica el formato.
- Busque tres cosas. Un grupo `User-agent: Googlebot` con `Disallow: /`, un grupo comodín `User-agent: *` con `Disallow: /`, y las líneas de IA administradas por Cloudflare. Un `Disallow: /` general bajo Googlebot o el comodín es el que importa para la Búsqueda.
- Revise las políticas de Cloudflare. En el panel de Cloudflare, abra Security Settings de su dominio y mire las políticas de bots de IA para Search, Training y Agent. Cada una puede ser Allow, Block en todas las páginas o Block en páginas con anuncios, como describe la documentación de bots de IA de Cloudflare.
- Pregúntele a Google qué ve. En Search Console, ejecute la Inspección de URL en su página de inicio y en una página de servicio importante. Luego abra Crawl Stats para ver los códigos de respuesta y la actividad de rastreo reciente, y el informe Page Indexing para ver páginas excluidas, etiquetas noindex, errores del servidor y bloqueos de robots.txt. La guía de Search Console de Google recorre los informes.
Si el robots.txt está abierto, Googlebot no está bloqueado en Cloudflare y Search Console inspecciona sus páginas con éxito, Cloudflare no es lo que lo oculta. Un mes lento de clientes potenciales apunta entonces a otro lado, como la demanda, la competencia o el contenido de la página.

¿Qué cambió realmente Cloudflare y afecta a mi sitio?
El 1 de julio de 2026, Cloudflare anunció nuevas opciones para gestionar el tráfico de IA. Clasifica los rastreadores en tres grupos, Search, Agent y Training, y dijo que a partir del 15 de septiembre los dominios nuevos bloquearían los rastreadores de Training y Agent en páginas con anuncios mientras mantendrían permitido Search. Su entrada del registro de cambios también advirtió que los rastreadores de uso mixto como Googlebot, Applebot y Bingbot podían bloquearse cuando un cliente seleccionaba un bloqueo de Training, porque esos bots rastrean para la Búsqueda y para otros usos.
El 15 de septiembre de 2026, Cloudflare agregó un ajuste llamado Disallow AI Training. En su entrada de blog sobre rastreadores de uso mixto, Cloudflare dice que está disponible en todos los planes y que funciona publicando en robots.txt la preferencia de no entrenamiento. Googlebot, Bingbot y Applebot siguen permitidos para la Búsqueda, mientras que se rechazan los rastreadores solo de entrenamiento de empresas como Amazon, Anthropic, Meta y OpenAI. El ajuste Block, más antiguo, todavía detiene a los rastreadores por completo, y Cloudflare dice que eso incluye a Googlebot y el acceso a la Búsqueda.
Que toque o no su sitio depende del ajuste que tenga su dominio. Cloudflare dice que los valores predeterminados del 15 de septiembre se aplican a los dominios nuevos, y que los ajustes existentes se mantienen por sí solos en casi todos los casos. «Casi todos los casos» es una razón para mirar su propio panel en lugar de suponer. Ninguna fuente con nombre y fecha muestra que los ajustes de Cloudflare hicieran que algún sitio perdiera posiciones, así que trate una caída de tráfico como algo por diagnosticar, no como una prueba.
¿Qué ajuste debe elegir una pequeña empresa: Allow, Disallow AI Training o Block?
Haga coincidir el ajuste con lo que quiere de la búsqueda y de la IA. Esta tabla resume lo que hace cada uno, según la documentación de Cloudflare.
| Ajuste | Qué hace | Efecto en la Búsqueda de Google | Conviene cuando |
|---|---|---|---|
| Allow | No impone ninguna restricción a ese grupo de rastreadores | Ninguno | Usted acepta que el contenido se use para entrenar IA |
| Disallow AI Training | Publica una preferencia de no entrenamiento en robots.txt; mantiene a Googlebot, Bingbot y Applebot permitidos para la Búsqueda | La Búsqueda sigue permitida | Quiere seguir siendo encontrable y rechazar el entrenamiento |
| Block | Detiene a los rastreadores, incluidos los de uso mixto como Googlebot | Se puede perder el acceso de la Búsqueda | Tiene una razón específica para mantener fuera a los rastreadores por completo, y acepta el costo en la Búsqueda |
Para un sitio de negocio normal cuyos clientes lo encuentran por Google, el valor predeterminado seguro es mantener el acceso de la Búsqueda y tomar una decisión aparte y deliberada sobre el entrenamiento y los agentes de IA en vivo. Permitir los rastreadores de la Búsqueda lo mantiene descubrible y mantiene abierta la posibilidad de que una página se cite como fuente en una respuesta de IA. Rechazar el entrenamiento limita el permiso para que los modelos aprendan de sus páginas. Son usos distintos, y Disallow AI Training es el ajuste hecho para separarlos.
Un límite más que vale la pena conocer: ningún ajuste único gobierna todos los servicios de IA. El tráfico de los asistentes de IA puede ser distinto del de Googlebot y del de Google-Extended. Si le importa que lo nombren en las respuestas de IA, nuestro trabajo de optimización para motores generativos cubre ese lado, y empieza con la misma revisión de acceso de arriba.

¿Qué controla Google-Extended y afecta mi posicionamiento en Google?
Google-Extended es un token que puede poner en robots.txt para indicar si el contenido que Google rastrea puede usarse para entrenar futuros modelos de Gemini y para fundamentar respuestas en las aplicaciones de Gemini y en Vertex AI. La documentación de rastreadores de Google dice que «does not impact a site's inclusion in Google Search» (no afecta la inclusión de un sitio en la Búsqueda de Google) y «is not used as a ranking signal in Google Search» (no se usa como señal de posicionamiento en la Búsqueda de Google).
Tampoco es un bot aparte. Google-Extended no tiene una cadena de agente de usuario HTTP propia. Google sigue rastreando con sus agentes de usuario existentes, y el token registra su preferencia. La guía sobre funciones de IA de Google dice que Googlebot es el rastreador que importa para la Búsqueda y las descripciones generales de IA. Si quiere limitar lo que aparece en las funciones de la Búsqueda, Google recomienda `noindex`, `nosnippet`, `data-nosnippet` o `max-snippet`, según el resultado que busque.
Esto importa si activa el robots.txt administrado de Cloudflare. Cuando está activo, Cloudflare agrega líneas antes de las suyas, entre ellas `Google-Extended Disallow: /` y líneas para bots conocidos de entrenamiento de IA. Ver esa línea en su archivo no significa que esté bloqueado de la Búsqueda. El archivo administrado es una señal de preferencia, no una medida de cumplimiento. La documentación del robots.txt administrado lo dice así, y el cumplimiento viene de herramientas como AI Crawl Control o Bot Management.
¿Qué más puede ocultar un sitio de Google si Cloudflare no es la causa?
Cuando Googlebot no puede acceder a sus páginas, Cloudflare es solo uno de varios lugares donde mirar. En un orden aproximado de qué tan fácil es revisar cada uno, y no como una clasificación medida de con qué frecuencia ocurre cada uno:
- Un `Disallow: /` antiguo en robots.txt, a menudo olvidado después de un rediseño o de un lanzamiento de prueba.
- Una regla de Block o de Bot Management de Cloudflare que atrapa a los rastreadores de uso mixto.
- Una etiqueta `noindex` puesta en los ajustes de página de su sitio web.
- Un problema de alojamiento, DNS, SSL o servidor que impide que Googlebot reciba las páginas.
- Una regla amplia de seguridad o de desafío que detiene a los rastreadores verificados.
- Problemas de mapa del sitio, canónicas o redirecciones que hacen más difíciles de encontrar las páginas.
Cada uno tiene su propia solución. Un bloqueo de robots.txt significa quitar o acotar la regla equivocada y probar el archivo en vivo. Un bloqueo de uso mixto de Cloudflare suele significar cambiar la política de Training de Block a Disallow AI Training y luego verificar. Un `noindex` significa quitar el ajuste y confirmarlo en el HTML de la página. La guía de Google para solucionar problemas de rastreo cubre el resto. Tenga en cuenta también que robots.txt controla el rastreo, no la eliminación del índice. Google señala `noindex` o la protección con contraseña cuando la meta es mantener una página fuera de la Búsqueda, como explica su introducción a robots.txt.

¿Debería bloquear todos los bots de IA por seguridad?
Bloquearlo todo no es un primer paso seguro. Un bloqueo amplio puede detener a los rastreadores de la Búsqueda que le envían clientes, junto con rastreadores de referencia y tráfico de verificación que quizá quiera. Tampoco hace que su contenido sea intocable, porque robots.txt expresa una preferencia y un rastreador que la ignore todavía puede obtener una página. La documentación de Content Signals de Cloudflare describe las preferencias `search`, `ai-input` y `ai-train` y dice que son reservas de derechos bajo el Artículo 4 de la Directiva 2019/790 de la UE. No detienen técnicamente a un rastreador que decida ignorarlas.
Si quiere un cumplimiento firme contra bots en particular, eso es trabajo de AI Crawl Control o de Bot Management, configurados para los rastreadores específicos que nombre. Pay Per Crawl de Cloudflare, que puede responder a un rastreador con una respuesta HTTP 402 de pago requerido, es una beta privada, y Cloudflare señala que los bloqueos de WAF o de Bot Management prevalecen sobre el cobro.
La ruta intermedia le conviene a un sitio que vive del tráfico de Google: mantenga permitida la Búsqueda, elija Disallow AI Training si quiere rechazar el entrenamiento y revise por separado la política de Agent. Elija lo que elija, anote la fecha y el ajuste, para que la próxima persona que abra la cuenta de Cloudflare pueda ver qué se eligió y por qué.

¿Cloudflare está ocultando su sitio de Google?
Elija una respuesta para empezar.
1. ¿Qué ajuste de Cloudflare mantiene permitido a Googlebot para la Búsqueda mientras rechaza el entrenamiento de IA?
2. ¿Qué dice Google sobre Google-Extended y la Búsqueda de Google?
3. Su tráfico bajó después de la noticia. ¿Qué debe hacer primero?
Preguntas frecuentes sobre Disallow AI Training de Cloudflare
¿Qué hace el ajuste Disallow AI Training de Cloudflare?
Publica una preferencia de no entrenamiento en robots.txt y mantiene a los rastreadores de uso mixto como Googlebot, Bingbot y Applebot permitidos para la Búsqueda. Se rechaza a los rastreadores solo de entrenamiento. Cloudflare lo agregó el 15 de septiembre de 2026 y dice que está disponible en todos los planes.
¿Puede Cloudflare bloquear a Googlebot?
Sí. El ajuste Block, más amplio, de Cloudflare puede detener a los rastreadores de uso mixto, incluido Googlebot, lo que puede costarle a un sitio su acceso a la Búsqueda. Disallow AI Training es el ajuste diseñado para evitarlo.
¿Bloquear Google-Extended elimina mi sitio de la Búsqueda de Google?
No. Google dice que Google-Extended no afecta la inclusión de un sitio en la Búsqueda de Google y que no se usa como señal de posicionamiento. Controla si el contenido se usa para el entrenamiento y la fundamentación de Gemini.
¿Detiene robots.txt a todos los rastreadores de IA?
No. Expresa una preferencia, y un rastreador puede ignorarla. Detener a un rastreador por la fuerza requiere cumplimiento, como AI Crawl Control o Bot Management.
¿Cómo sé si Cloudflare está bloqueando a Googlebot?
Revise su robots.txt en vivo, las políticas de Search, Training y Agent en Security Settings de Cloudflare, y la Inspección de URL y Crawl Stats en Search Console. Una inspección exitosa de sus páginas clave es una buena señal.
¿Perdieron visibilidad en Google todos los clientes de Cloudflare?
El material publicado de Cloudflare no lo respalda. Dice que los ajustes existentes se mantienen por sí solos en casi todos los casos, así que mire su propia cuenta para ver qué ajuste se aplica.
Para cerrar
Si le preocupa que un ajuste de Cloudflare esté ocultando su sitio, la revisión va primero: su robots.txt en vivo, las políticas de Search, Training y Agent de Cloudflare, y la Inspección de URL y Crawl Stats de Search Console. Google-Extended no es un interruptor de la Búsqueda, y una línea Google-Extended en su archivo no lo oculta de Google. El ajuste que puede costarle el acceso a la Búsqueda es un Block amplio sobre rastreadores de uso mixto como Googlebot.
Para un sitio que vive del tráfico de Google, mantenga permitida la Búsqueda y tome una decisión aparte sobre el entrenamiento y los agentes de IA. Disallow AI Training rechaza el entrenamiento y deja a Googlebot en su lugar, y puede activarlo desde Security Settings de su dominio. Si la revisión no encuentra nada, puede detenerse ahí, y si encontró un problema, cambie solo la regla que pueda demostrar que es responsable, luego vuelva a probar y dé tiempo a Google para rastrear de nuevo. Una pregunta relacionada que quizá tenga es por qué una página específica falta en Google, y nuestro artículo sobre páginas no indexadas en Search Console cubre qué motivos son normales y cuáles le cuestan clientes.
Si las cuentas son heredadas, varias capas parecen entrar en conflicto o Search Console muestra un problema real de indexación, Web Leveling puede rastrear la regla exacta y corregir solo esa. Nuestro trabajo de posicionamiento en buscadores empieza con la revisión de acceso de arriba, y si muestra que sus ajustes están bien, se lo diremos. Trabajamos con pequeñas y medianas empresas en todo el país y en el extranjero. Cuéntenos qué le muestran Cloudflare y Search Console, y le ayudaremos a leerlo.
Términos
Palabras de Cloudflare y de rastreadores en este artículo
Toque un término para ver qué significa.
Googlebot. El rastreador de Google para la Búsqueda. Google dice que también controla el rastreo para las descripciones generales de IA.
Google-Extended. Un token de robots.txt que indica si el contenido rastreado puede usarse para el entrenamiento y la fundamentación de Gemini. No es un bot aparte y no afecta la Búsqueda.
Rastreador de uso mixto. Un rastreador que reúne páginas para la Búsqueda y para otros usos, como Googlebot, Bingbot y Applebot.
Disallow AI Training. Un ajuste de Cloudflare, agregado el 15 de septiembre de 2026, que rechaza el entrenamiento mientras mantiene permitidos a los rastreadores de uso mixto para la Búsqueda.
robots.txt administrado. Una opción de Cloudflare que agrega directivas relacionadas con la IA antes de su propio robots.txt. Es una señal de preferencia, no una medida de cumplimiento.
Content Signals. Etiquetas de preferencia en robots.txt para el uso en búsqueda, entrada de IA y entrenamiento de IA.
Pay Per Crawl. Una función beta privada de Cloudflare que puede responder a un rastreador con una respuesta HTTP 402 de pago requerido.




