Documentación del crawler

    itsbydavidBot

    Si encontraste esto en tu log de acceso, esta página es la respuesta. Es un escáner de diagnóstico, pide una página a la vez cuando alguien se lo pide, y bloquearlo es una línea.

    Qué es

    Un diagnóstico, no un crawler

    itsbydavidBot comprueba si los sistemas de IA pueden leer un sitio web. Alguien pega una URL en una herramienta gratuita, y el bot pide esa página, más robots.txt, sitemap.xml y llms.txt, para reportar qué recibiría un crawler.

    No rastrea el sitio. No sigue tus enlaces, no encola tus páginas, y no vuelve por su cuenta. Un juego de peticiones, cuando una persona lo pide.

    Lo opera David Monzón, consultor independiente en Guatemala. No hay empresa detrás ni reventa de datos.

    La parte que asusta

    Por qué manda nombres de otros crawlers

    El escáner reporta si un sitio aplica de verdad la política de crawlers que declara. Medir eso obliga a pedir la página como la pediría GPTBot, y ver si el servidor responde distinto. No hay forma de medirlo sin mandar una petición con forma de bot.

    Por eso el user agent lleva un probing-token. Nunca suplanta. El nombre del bot va primero, esta URL va segunda, y el token que se está probando va etiquetado como lo que es:

    Mozilla/5.0 (compatible; itsbydavidBot/1.0; +https://itsbydavid.com/tools/itsbydavidbot/; probing-token=GPTBot)

    Una regla que hace match con "GPTBot" se dispara igual, que es justo el punto. Pero quien lea el log ve quién hizo la petición de verdad, y lo puede distinguir del GPTBot real, que llega desde los rangos de direcciones de OpenAI.

    Política de robots

    Respeta robots.txt, y respeta que le digan que no

    Un Disallow dirigido a itsbydavidBot se respeta siempre. Si tu robots.txt nombra a este bot y le dice que no, para: lee tu política y la reporta, pero no hace ninguna petición en vivo contra tus páginas.

    Para bloquearlo por nombre

    User-agent: itsbydavidBot
    Disallow: /

    Eso es todo. Sin formulario, sin cuenta, sin correo que mandar. Si prefieres que no vuelva a tocar tu servidor, con esto basta.

    Límites

    Qué te cuesta

    • Como mucho unas quince peticiones por escaneo, todas a la vez, ninguna repetida.
    • Un escaneo por dominio cada hora, a nivel global. Una segunda persona que pregunte por el mismo dominio dentro de esa ventana recibe el resultado en caché, no una ronda nueva de peticiones.
    • Límite por IP del lado de quien pide, para que la herramienta no se pueda apuntar repetidamente contra el servidor de otro.
    • Cinco segundos de tiempo máximo por petición y un tope de dos megabytes de lectura.

    Contacto

    Contesta una persona

    Si este bot hizo algo que no esperabas, o quieres que pare y bloquearlo no te resulta cómodo, escríbeme y lo resuelvo.

    info@itsbydavid.com