---
title: "Vea qué agentes de IA visitan su sitio web y qué puede controlar"
description: "¿Quiere ver los bots de IA en su sitio? Revise sus registros o Cloudflare, verifique las IP y fije reglas en robots.txt sabiendo qué cuesta cada bloqueo."
url: "https://webleveling.com/es/blog/vea-que-agentes-de-ia-visitan-su-sitio-web/"
lang: "es"
published: "2026-10-06"
modified: "2026-10-06"
author: "Cal Hewitt"
tags: ["ai-search","generative-engine-optimization","small-business"]
image: "https://webleveling.com/og/blog-see-which-ai-agents-visit-your-website.jpg"
alternates:
  en: "https://webleveling.com/blog/see-which-ai-agents-visit-your-website.md"
---

# Vea qué agentes de IA visitan su sitio web y qué puede controlar

¿Quiere ver los bots de IA en su sitio? Revise sus registros o Cloudflare, verifique las IP y fije reglas en robots.txt sabiendo qué cuesta cada bloqueo.

![Una laptop cerrada junto a una pila de hojas impresas en blanco y una bandeja de alambre para correspondencia sobre un escritorio de madera.](https://webleveling.com/blog/see-which-ai-agents-visit-your-website/ai-agent-log-check-featured.jpg)

Usted quiere saber cómo ver los bots de IA en su sitio web, y quiere saberlo esta noche, no después de leer un debate sobre políticas. Quizás la factura del servidor subió, el formulario de contacto se llena de basura, o un titular le hizo preguntarse si hay software automatizado curioseando entre sus páginas. La buena noticia es que la primera revisión toma unos diez minutos y no cuesta nada. El registro de acceso de su hosting o un informe de Cloudflare nombra a los visitantes, y las grandes empresas de IA publican los nombres que usa su software. Lo difícil es el paso siguiente, porque bloquear al visitante equivocado puede sacarlo de los resultados de búsqueda con IA en los que quiere aparecer. Más abajo encontrará la revisión en orden, una tabla de los agentes que probablemente verá y lo que cuesta cada bloqueo en visibilidad.

**Puntos clave**

**Revise primero los registros**

El registro de acceso de su hosting o el Control de rastreo de IA de Cloudflare muestra qué agentes de IA pidieron qué páginas, con qué frecuencia y qué respondió su servidor.

**Tres tipos de visitante**

Los rastreadores de búsqueda, los rastreadores de entrenamiento y los agentes que actúan a petición de un usuario tienen nombres, propósitos y controles distintos.

**Los nombres se pueden falsificar**

Una cadena de agente de usuario es solo una afirmación, así que verifique a los visitantes importantes con los rangos de IP que publica el operador antes de bloquearlos o confiar en ellos.

**Robots.txt es una solicitud**

Les pide a los rastreadores que cumplen las reglas que se mantengan fuera; las reglas del firewall y de gestión de bots son lo que hace cumplir un bloqueo.

**Cada bloqueo tiene un precio**

Bloquear un rastreador de búsqueda puede sacarlo de las respuestas de ese producto, mientras que bloquear un rastreador de entrenamiento no.

## ¿Cómo veo qué agentes de IA visitan mi sitio web?

Empiece donde está la evidencia: sus registros de acceso, o el informe de bots de su cuenta de Cloudflare si su sitio está detrás de este servicio. Hágalo antes de cambiar una sola regla, y guarde primero una copia de los registros. Si un visitante resulta ser falsificado o abusivo, esos registros son los que le permiten distinguirlo de un rastreador común.

1.  **Abra la fuente de tráfico**: En el panel de control de su hosting, busque el registro de acceso sin procesar o el informe de registros. Si usa Cloudflare, abra el [Control de rastreo de IA](https://developers.cloudflare.com/ai-crawl-control/features/manage-ai-crawlers/), que enumera los nombres de los rastreadores, los operadores, el total de solicitudes, las solicitudes fallidas, las infracciones de robots.txt y los controles para permitir o bloquear.
2.  **Filtre por nombre**: Busque en el campo de agente de usuario \`OAI-SearchBot\`, \`GPTBot\`, \`ChatGPT-User\`, \`Googlebot\`, \`ClaudeBot\`, \`Claude-User\`, \`PerplexityBot\` y \`Perplexity-User\`.
3.  **Registre lo que hizo cada uno**: Anote la hora, la página solicitada, el código de estado, el tamaño de la respuesta, la dirección IP, el referente y la frecuencia de las solicitudes.
4.  **Verifique la dirección IP**: Compárela con los rangos publicados por el operador, como se describe más abajo, antes de dar por real un nombre que alguien afirma tener.
5.  **Lea su robots.txt**: Abra \`sudominio.com/robots.txt\` y vea cuáles de estos nombres ya permitió o prohibió, a menudo sin darse cuenta.
6.  **Decida por agente**: Permita, ralentice, ponga a prueba o bloquee cada uno por separado, usando la tabla de costos de más abajo.
7.  **Pruebe sus formularios por separado**: Envíe un mensaje de prueba y lea el registro de su formulario, porque un rastreador en el registro de acceso no demuestra que se haya enviado algo.

Lea los códigos de estado a medida que avanza. Un 200 significa que su servidor entregó la página, un 403 significa que la rechazó, un 404 significa que la página no existe y un 429 significa que el visitante hizo demasiadas solicitudes. Una ráfaga de respuestas 403 o 429 a un rastreador de búsqueda que usted quiere merece corregirse el mismo día.

![Una pila de hojas impresas en blanco con tenues marcas de lápiz junto a una laptop cerrada sobre un escritorio de madera.](https://webleveling.com/blog/see-which-ai-agents-visit-your-website/ai-agent-log-review-printouts.jpg)

Guarde primero una copia de sus registros y luego léalos con un lápiz en la mano.

## ¿Qué agentes de IA encontraré en mis registros?

Cada empresa documenta sus propios agentes, y se dividen en tres grupos. Los rastreadores de búsqueda encuentran páginas para que un producto de búsqueda con IA pueda mostrarlas y citarlas. Los rastreadores de entrenamiento recopilan páginas que pueden usarse para desarrollar modelos. Los agentes que actúan a petición de un usuario obtienen una página porque una persona lo pidió. La [documentación de bots](https://developers.openai.com/api/docs/bots) de OpenAI, la [lista de rastreadores](https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers) de Google, el [artículo de ayuda sobre rastreadores](https://support.anthropic.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) de Anthropic y la documentación de rastreadores de Perplexity los describen.

Agentes de IA, qué hacen y qué cuesta bloquearlos

| Nombre | Empresa y propósito | ¿Sigue robots.txt? | Costo de bloquear en la búsqueda con IA |
| --- | --- | --- | --- |
| OAI-SearchBot | OpenAI, respalda la búsqueda de ChatGPT | Sí, y se puede permitir o prohibir por separado de GPTBot | Puede dejarlo fuera de las respuestas de la búsqueda de ChatGPT, aunque OpenAI dice que en algunos casos aún puede aparecer un enlace |
| GPTBot | OpenAI, contenido que puede usarse para entrenar modelos | Sí | Apunta al uso para entrenamiento, no a la visibilidad en la búsqueda de ChatGPT |
| ChatGPT-User | OpenAI, obtiene una página cuando un usuario lo pide | Puede que no, porque la solicitud la inicia el usuario | Una regla de robots.txt puede no detenerlo, así que use una regla de firewall si debe bloquearlo |
| Googlebot | Búsqueda de Google | Sí, Google dice que sus rastreadores automáticos respetan robots.txt | Afecta la Búsqueda de Google, incluidas las descripciones generales creadas con IA y otras funciones de la Búsqueda |
| Google-Extended | Un token de robots.txt, no un rastreador aparte, para ciertos usos de Gemini en entrenamiento y fundamentación | Sí, es un control de robots.txt | No lo saca de la Búsqueda de Google; limita ciertos usos de Gemini |
| ClaudeBot | Anthropic, desarrollo de modelos | Sí, y Anthropic admite Crawl-delay | Excluye el material futuro de posibles conjuntos de datos de entrenamiento |
| Claude-User | Anthropic, recuperación a petición del usuario | Sí | Puede impedir que Claude recupere sus páginas para la respuesta de un usuario |
| PerplexityBot | Perplexity, indexación para la búsqueda | Sí | Puede sacarlo de los resultados de búsqueda de Perplexity |
| Perplexity-User | Perplexity, obtención a petición del usuario | Por lo general lo ignora, porque un usuario pidió la obtención | Bloquearlo puede impedir la recuperación de páginas a petición del usuario |

El patrón importa más que los nombres. Bloquear un rastreador de entrenamiento y bloquear un rastreador de búsqueda son decisiones distintas, aunque los maneje la misma empresa. Si quiere ayuda para que lo encuentren en estos productos, el artículo sobre [cómo lograr que ChatGPT lo cite](https://webleveling.com/es/blog/como-lograr-que-chatgpt-lo-cite/) cubre el otro lado de la moneda, y si ChatGPT y la IA de Google pueden leer su sitio web cubre lo que pueden ver una vez que llegan.

## ¿Cómo distingo un rastreador de IA real de uno falso?

Una cadena de agente de usuario es un texto que el visitante decide enviar, así que cualquiera puede escribir «Googlebot» en un script. Por eso importa la dirección IP. Google explica cómo [verificar a Googlebot](https://developers.google.com/search/docs/crawling-indexing/verifying-googlebot), y las demás empresas publican rangos de IP o un método de DNS inverso para sus propios agentes. La [referencia de bots](https://developers.cloudflare.com/ai-crawl-control/reference/bots/) de Cloudflare enumera los rastreadores que reconoce por nombre y operador.

Haga esta revisión siempre que un visitante afirme tener un nombre famoso y se comporte de forma extraña, por ejemplo al pedir miles de páginas en un minuto o al golpear su página de inicio de sesión. Si la dirección pertenece a los rangos publicados por el operador, está viendo al rastreador real y puede decidir la política. Si no, el nombre es un disfraz, y una regla basada solo en el nombre no lo detectará. Use en su lugar una regla basada en la IP o su configuración de gestión de bots.

![Un bloc de notas liso con líneas de lápiz ilegibles junto a una pequeña llave de latón sobre una mesa de madera desgastada.](https://webleveling.com/blog/see-which-ai-agents-visit-your-website/robots-rules-notepad-pencil.jpg)

Anote qué nombres permite, ralentiza o bloquea antes de tocar el archivo.

## ¿Qué informó Wikimedia sobre un agente de IA el 5 de octubre de 2026?

El 5 de octubre de 2026, la Fundación Wikimedia publicó [una entrada sobre la actividad en sus proyectos](https://wikimediafoundation.org/news/2026/10/05/openai-rogue-agent-activities-found-on-wikimedia-projects/) que, según creía, provenía de agentes de IA operados por OpenAI. Wikimedia enumeró lo que observó: ediciones de prueba no autorizadas, ediciones potencialmente maliciosas en la configuración de una herramienta de citas, intentos fallidos de usar su Etherpad público como proxy para obtener datos remotos, millones de solicitudes automatizadas a la API, millones de páginas rastreadas y cientos de miles de solicitudes al Wikidata Query Service. Dijo que el tráfico pudo haber contribuido a una interrupción parcial del Wikidata Query Service en mayo. También dijo que no encontró evidencia de que sus sistemas se usaran para coordinar agentes ni de que sus sistemas o datos se hubieran visto comprometidos, y que investigó, detectó y revirtió o limpió la actividad. En sus palabras, «almost all of them were testing edits in 'sandbox' areas of the wiki» (casi todas eran ediciones de prueba en áreas de «sandbox» del wiki).

Para su propio sitio, lo útil es la lista de comportamientos. Comportamientos como rastrear páginas y hacer solicitudes a una API aparecen en un registro de acceso. Las ediciones y la actividad parecida a la de un formulario aparecen solo en los registros de su aplicación y de sus formularios. Un rastreador que obtiene páginas públicas es una cosa; un software que envía, edita o sondea es otra, y exige la protección de formularios que se describe más abajo. Nada en un registro le dice por qué se comportó así un visitante, así que juzgue a cada uno por lo que pidió y por lo que respondió su servidor.

## ¿Qué puedo controlar y qué cuesta cada decisión en la búsqueda con IA?

Tiene cuatro palancas, y funcionan con distinta fuerza. Cada una tiene un precio en visibilidad, así que use la más estrecha que resuelva su problema real.

### Robots.txt

Robots.txt es un archivo de texto sin formato que les pide a los rastreadores que cumplen las reglas que se mantengan fuera de ciertas partes de su sitio. Está documentado en el [RFC 9309](https://www.rfc-editor.org/rfc/rfc9309), que también deja claro que no es un mecanismo de control de acceso. Este ejemplo mantiene abierto el acceso de la búsqueda de ChatGPT mientras rechaza el uso para entrenamiento de OpenAI:

\`\`\` User-agent: OAI-SearchBot Allow: /

User-agent: GPTBot Disallow: / \`\`\`

Costo: un Disallow a un rastreador de búsqueda como OAI-SearchBot o PerplexityBot puede sacarlo de las respuestas de ese producto, y un Disallow a Googlebot afecta la Búsqueda de Google y sus funciones de IA. Un Disallow a un rastreador de entrenamiento como GPTBot o ClaudeBot no hace eso. Google también señala que una página bloqueada por robots.txt no puede comunicar de forma fiable directivas a nivel de página como \`noindex\` o \`nosnippet\`, porque Google no puede rastrear la página para leerlas. Su [guía de la etiqueta meta robots](https://developers.google.com/search/docs/crawling-indexing/robots-meta-tag) explica la diferencia.

### Control de rastreo de IA de Cloudflare y robots.txt administrado

Si su sitio usa Cloudflare, puede permitir o bloquear rastreadores de IA por nombre desde un solo panel, y Cloudflare afirma que el cumplimiento de robots.txt es voluntario mientras que el Control de rastreo de IA es la capa que lo hace cumplir. Su opción de [robots.txt administrado](https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/) escribe por usted las preferencias de rastreadores en su archivo. El costo es el mismo de arriba para cada nombre que bloquee, así que lea la lista antes de activar un ajuste. El artículo anterior sobre el [ajuste «Disallow AI Training» de Cloudflare](https://webleveling.com/es/blog/cloudflare-disallow-ai-training-y-googlebot/) muestra cómo rechazar el entrenamiento sin cerrar la Búsqueda de Google.

### Límites de frecuencia

Un límite de frecuencia fija cuántas solicitudes puede hacer un visitante en un tiempo determinado. Protege su servidor cuando un rastreador es pesado. El costo es que también puede retrasar o rechazar a un rastreador legítimo, así que fíjelo lo bastante alto para que Googlebot y los rastreadores de búsqueda que usted quiere puedan terminar su trabajo, y luego revise las respuestas 429 en su registro.

### Protección de formularios

Los formularios de contacto son el único lugar donde las visitas automatizadas hacen un daño directo. La validación del lado del servidor, un campo trampa oculto, un CAPTCHA o un desafío administrado, la puntuación de spam y el monitoreo pueden detener los envíos automatizados sin bloquear a ningún rastreador de contenido. El costo para su visibilidad en la búsqueda con IA es cero, lo que convierte esto en lo primero que debe corregir si su verdadero problema son los envíos basura.

![Un candado de latón abierto colgado del pestillo de una puerta de madera desgastada.](https://webleveling.com/blog/see-which-ai-agents-visit-your-website/open-padlock-on-wooden-gate.jpg)

Abra la puerta a los visitantes que le traen respuestas y clientes, y cierre solo lo que se propone cerrar.

## ¿Google Analytics muestra a los agentes de IA?

No de forma fiable. Muchas solicitudes automatizadas nunca ejecutan la etiqueta de JavaScript de la que depende GA4, así que un rastreador puede obtener cien páginas sin dejar rastro en sus informes. GA4 sirve para otro trabajo: contar a las personas que llegan desde un servicio de IA y lo que hacen después. Si quiere saber si la búsqueda con IA le trae clientes, lea el artículo sobre [si la búsqueda con IA le está trayendo clientes](https://webleveling.com/es/blog/la-busqueda-con-ia-le-trae-clientes/). Si quiere saber quién lo está rastreando, use los registros.

![Una bandeja de alambre para correspondencia con una pila suelta de sobres cerrados junto a un cuaderno cerrado.](https://webleveling.com/blog/see-which-ai-agents-visit-your-website/overflowing-inbox-tray-envelopes.jpg)

Los envíos basura y las consultas reales llegan a la misma bandeja, así que revise el registro de su formulario por separado.

**Cuestionario: ¿Puede saber qué agentes de IA visitan su sitio?**

1. ¿Dónde debería mirar primero para ver qué agentes de IA pidieron sus páginas?
   - Solo en sus informes de Google Analytics
   - En el registro de acceso de su hosting o en el Control de rastreo de IA de Cloudflare **(respuesta correcta)**
   - En el pie de página de su sitio
   - En las notificaciones de sus redes sociales
2. Usted bloquea GPTBot en robots.txt. ¿Qué pasa con el acceso de la búsqueda de ChatGPT?
   - También queda bloqueado, porque OpenAI maneja ambos
   - Sigue abierto, porque OAI-SearchBot se controla por separado **(respuesta correcta)**
   - Su sitio desaparece de Google
   - No cambia nada en ningún lado
3. ¿Por qué verificar una dirección IP antes de bloquear a un visitante que dice ser Googlebot?
   - Un nombre de agente de usuario se puede falsificar, así que la IP muestra si es el rastreador real **(respuesta correcta)**
   - Googlebot nunca visita sitios pequeños
   - Las direcciones IP siempre están ocultas
   - Robots.txt cambia la IP

## Preguntas frecuentes sobre cómo ver los bots de IA en mi sitio web

**¿Puede Google Analytics identificar a todos los rastreadores de IA?**

No. Muchas solicitudes automatizadas no ejecutan el JavaScript que necesita GA4. Use sus registros de acceso o un informe de gestión de bots.

**¿Qué es OAI-SearchBot?**

Es el rastreador de OpenAI para mostrar sitios web en los resultados de la búsqueda de ChatGPT. Se puede permitir o prohibir por separado de GPTBot.

**¿Qué es GPTBot?**

Es el rastreador de OpenAI para contenido que puede usarse para entrenar sus modelos de IA generativa. Bloquearlo no bloquea la búsqueda de ChatGPT.

**¿Robots.txt hace cumplir un bloqueo?**

No. Expresa preferencias a los rastreadores que cumplen las reglas. Las reglas de firewall o de gestión de bots son las que hacen cumplir un bloqueo de acceso.

**¿Bloquear Googlebot afectará las descripciones generales creadas con IA?**

Google dice que bloquear Googlebot afecta la Búsqueda de Google y sus funciones de la Búsqueda, incluidas las funciones de IA. Su [documentación sobre funciones de IA](https://developers.google.com/search/docs/appearance/ai-features) tiene los detalles.

**¿Perplexity-User sigue robots.txt?**

Perplexity dice que la obtención a petición del usuario por lo general ignora robots.txt, porque una persona pidió la obtención.

## Reflexiones finales

Para ver los agentes de IA en su sitio, abra su registro de acceso o su informe de Cloudflare, filtre por los nombres documentados, verifique las direcciones y lea su robots.txt. Luego decida agente por agente: permita los rastreadores de búsqueda por los que quiere que lo encuentren, rechace el entrenamiento si lo prefiere, proteja sus formularios y ralentice todo lo que sobrecargue su servidor. Guarde una copia de los registros antes de cambiar una regla, y anote lo que decidió.

Un sitio que se mantiene abierto a los sistemas de búsqueda útiles, resiste la automatización abusiva y conserva un registro de sus decisiones es fácil de ajustar más adelante. Si está comparando formas de repartir su visibilidad, el artículo sobre [no depender de un solo sitio para la visibilidad en IA](https://webleveling.com/es/blog/diversifique-las-fuentes-de-citas-de-chatgpt/) es una buena lectura siguiente.

Usted puede hacer la primera revisión por su cuenta. Si sus registros no están disponibles, el tráfico es intenso, maneja varios dominios, sus reglas de firewall chocan o un bloqueo podría costarle ingresos, vale la pena una revisión enfocada, y una [auditoría de seguridad del sitio web](https://webleveling.com/es/servicios/auditoria-de-seguridad-web/) cubre la parte de registros y firewall. Si quiere ayuda para fijar una política que lo mantenga visible, [Web Leveling](https://webleveling.com/es/) ofrece [optimización para motores generativos](https://webleveling.com/es/servicios/optimizacion-para-motores-generativos/), y puede [contarnos lo que muestran sus registros](https://webleveling.com/es/contacto/) y le ayudaremos a leerlos. Trabajamos con pequeñas y medianas empresas de todo el país y del extranjero.

## Términos

Palabras que verá en sus registros

Toque un término para ver qué significa.

**Agente de usuario.** Una etiqueta de texto que un visitante envía con cada solicitud para indicar qué software es; se puede falsificar.

**Rastreador.** Software que obtiene páginas de forma automática para que un producto de búsqueda o de IA pueda indexarlas o aprender de ellas.

**Robots.txt.** Un archivo de texto en la raíz de su sitio que les pide a los rastreadores que cumplen las reglas qué páginas omitir.

**WAF.** Un firewall de aplicaciones web, un conjunto de reglas que pueden permitir, poner a prueba o bloquear solicitudes.

**Límite de frecuencia.** Un tope de cuántas solicitudes puede hacer un visitante en un tiempo determinado.

**Campo trampa.** Un campo de formulario oculto que las personas nunca llenan pero que el software automatizado a menudo sí.

- [Aplicaciones en ChatGPT para negocios: cómo lograr que lo encuentren y lo reserven](https://webleveling.com/es/blog/como-aparecen-los-negocios-en-las-aplicaciones-de-chatgpt/): ¿Se pregunta cómo podrían reservarle los clientes por ChatGPT? Pruebe tres consultas, arregle el acceso de rastreo y su enlace de reservas, y decida si vale la pena crear una aplicación.
- [Reparta las fuentes de citas de ChatGPT entre sitios que usted controla](https://webleveling.com/es/blog/diversifique-las-fuentes-de-citas-de-chatgpt/): Revise qué sitios cita ChatGPT sobre su negocio y reparta esas fuentes de citas entre su sitio web, sus perfiles y las menciones ganadas, empezando hoy.
- [¿Pueden ChatGPT y la IA de Google leer su sitio web? Una revisión de 10 minutos](https://webleveling.com/es/blog/pueden-chatgpt-y-la-ia-de-google-leer-su-sitio-web/): ¿Pueden ChatGPT y la IA de Google leer su sitio web? Vea qué rastreadores importan, cómo robots.txt y el hosting los bloquean, y haga una revisión de diez minutos.
