Archivo robots.txt: qué es, para qué sirve y cómo configurarlo en SEO

Si hay un archivo capaz de hundir tu página web en Google en cuestión de horas, es el robots.txt. Y no estoy exagerando. Un simple carácter mal puesto en este documento de texto puede hacer que el buscador te expulse de sus resultados de un plumazo.

Pero si aprendes a dominarlo, se convierte en el mejor filtro para que los buscadores no pierdan el tiempo en páginas basura y se centren en rastrear lo que de verdad te trae ventas.

Vamos a destripar cómo funciona este archivo, cómo configurarlo paso a paso y cómo evitar el desastre.

Qué es exactamente el archivo robots.txt

Imagina que tu página web es una discoteca y los robots de Google (y otros buscadores) son los clientes que quieren entrar a mirar.

El archivo robots.txt es el portero de la puerta.

Es un simple documento de texto público que le dice a esos robots: «A esta sala puedes pasar, pero la zona VIP y el almacén están restringidos».

Físicamente, es un archivo llamado robots.txt que siempre, sin excepción, debe colgar de la raíz de tu dominio

Ejemplo: tuweb.com/robots.txt

Si lo pones en otra carpeta, los buscadores lo ignorarán como tu gato te ignora a ti cuando le llamas.

Por tanto, como habrás podido deducir, no todo el contenido de tu web es igual de importante o relevante para ser rastreado e indexado.

Aquí es donde entra en juego el archivo robots.txt, ya que permite a los propietarios de una web dirigir a los motores de búsqueda, indicando qué partes del sitio deben ser exploradas y cuáles deben ser ignoradas.

Para qué sirve de verdad en tu estrategia SEO

Los consultores SEO no tocamos este archivo por capricho. Lo usamos para gestionar los recursos de los buscadores de forma inteligente.

Estas son las razones más importantes por las que necesitas tenerlo bajo control.

Optimizar el presupuesto de rastreo o crawl budget

Aunque nunca ha sido confirmado oficialmente, Google no tiene tiempo infinito para mirar tu web. Te asigna un tiempo máximo de rastreo conocido como crawl budget.

Si dejas la puerta abierta de par en par, el robot de Google perderá el tiempo leyendo algunas páginas que pueden parecer contenido duplicado, los filtros del carrito de compra o las carpetas de administrador de tu WordPress.

Usando el robots.txt, le cerramos el paso a la basura. Así obligamos al buscador a gastar su tiempo leyendo tus artículos nuevos o tus páginas de servicios más rentables.

Evitar la sobrecarga de tu servidor

No solo existe Google. Hay miles de bots (de Bing, de herramientas SEO, extractores de datos, IAs) que pueden entrar a tu web al mismo tiempo.

Si tu página es muy grande, estos rastreos masivos pueden tumbar tu servidor o hacer que la web vaya lentísima para los usuarios reales.

Con este archivo puedes frenarles los pies.

Control de acceso a contenido sensible

El archivo robots también nos permite restringir el acceso a áreas internas y sensibles, a las que no debería entrar, ni encontrar, como páginas de administración, paneles de usuario, etc.

El gran mito: el robots.txt no sirve para desindexar

Aquí es donde el 90% de la gente mete la pata y donde quiero que prestes máxima atención. El archivo robots.txt bloquea el rastreo, no la indexación.

Si tienes una página privada, por ejemplo, una promoción secreta, y la bloqueas en el robots.txt, le estás diciendo a Google «no entres a leerla».

Pero si desde otro blog ponen un enlace hacia esa URL, Google sabrá que existe y la mostrará en los resultados de búsqueda.

Si tu objetivo real es que una URL desaparezca por completo de Google, no uses el robots.txt.

Tienes que usar la etiqueta meta robots noindex en el código de esa página concreta y cuando estés seguro que Google ya la ha leido y desindexado, la bloqueas en robots.txt

Por tanto, primero noindex, después robots. Si lo haces al revés y bloqueas el acceso ¿cómo leerá Google que no quieres que  se indexe?

Estructura y comandos básicos que debes dominar

El lenguaje que usamos dentro de este archivo es súper básico. Se compone de bloques de reglas donde primero decimos a quién nos dirigimos, y luego qué le prohibimos o permitimos hacer.

  • User-agent: Define a qué robot le estás hablando. Puedes usar un asterisco (*) para hablarles a todos a la vez, o especificar uno concreto (ejemplo: Googlebot).
  • Disallow: Es la orden de bloqueo. Le indica la ruta o carpeta exacta que no puede rastrear.
  • Allow: Sirve para crear excepciones. Por ejemplo, puedes bloquear toda una carpeta con Disallow, pero permitir el rastreo de un único archivo dentro de ella usando Allow.
  • Sitemap: Al final del archivo, siempre debes añadir la URL absoluta de tu mapa del sitio para que los robots lo encuentren a la primera.

Ejemplo de un robots.txt perfecto para WordPress

Si usas WordPress, no necesitas complicarte la vida inventando reglas. Este es un código estándar y seguro que puedes aplicar a casi todos los proyectos para proteger la zona privada sin romper el SEO:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://tuweb.com/sitemap_index.xml

Con esto, bloqueamos el acceso al panel de control de WordPress (/wp-admin/), pero dejamos abierto un archivo técnico (admin-ajax.php) que muchos temas y plugins necesitan que Google lea para mostrar la web correctamente.

Cómo crear y subir un archivo robots.txt

Crear un archivo robots.txt es un proceso sencillo, pero debes seguir ciertos pasos para asegurarse de que funcione correctamente:

  • Crea el archivo. Para ello puedes utilizar un editor de texto sencillo, como el bloc de notas en Windows o TextEdit en macOS, para crear un archivo llamado robots.txt. No utilices formatos de texto enriquecido como .doc o .rtf.
  • Define las reglas: escribe las reglas necesarias según las necesidades de tu sitio web. Ten mucho cuidado de producir bloqueos accidentales de contenido importante.
  • Sube el archivo al servidor: el archivo robots.txt debe ubicarse en la raíz del dominio de tu web. Por ejemplo, si tu dominio es www.ejemplo.com, el archivo debe estar en www.ejemplo.com/robots.txt.
  • Prueba el archivo: después de subir el archivo, utiliza la herramienta que proporciona Google Search Console para verificar que las reglas funcionan correctamente y no bloquean contenido que debería ser accesible.

Cómo bloquear a las inteligencias artificiales en tu robots.txt

Actualízate, porque esto es crítico hoy en día. Si no quieres que empresas como OpenAI (ChatGPT) o Anthropic rastreen tu contenido gratuito para entrenar sus modelos de IA y luego dar tus respuestas sin citarte, puedes bloquearlos de raíz.

Pero ojo, que estarás perdiendo la oportunidad de que den tus respuestas citando tu web y aparecer en los resultados de IA (estarás dejando de hacer lo que ahora llaman GEO).

Si aun así decides seguir adelante, añade esto al final de tu archivo para cerrarles la puerta:

User-agent: GPTBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: Claude-Web
Disallow: /

Buenas prácticas para el uso del archivo robots.txt

Un uso adecuado puede mejorar tu estrategia de SEO, mientras que los errores pueden impactar negativamente tu posicionamiento. A continuación, te detallo algunas buenas prácticas que puedes seguir para maximizar su efectividad:

1. No bloquees contenido importante

Trata de no bloquear páginas que son esenciales para la experiencia del usuario y para tu estrategia SEO, como páginas de productos, artículos de blog, categorías clave o la página de inicio. Revisa cuidadosamente las directrices de exclusión para asegurarte de que no estás limitando el acceso a contenido relevante que debería ser indexado.

Si has indexado alguna página por error no la bloquees aquí hasta asegurarte primero que Google ha leído de nuevo la url y la directiva no index

2. Evita el uso Excesivo de disallow

El uso indiscriminado de la directiva Disallow puede dificultar que los motores de búsqueda comprendan la estructura de tu sitio y clasifiquen tu contenido de manera efectiva. Bloquea solo aquellas páginas que no deseas que sean rastreadas, como archivos temporales, secciones privadas o duplicados de contenido.

3. Mantén el archivo actualizado

Tu archivo robots.txt debe evolucionar junto con tu sitio web. Cada vez que realices cambios en la estructura, añadas nuevas secciones o elimines páginas antiguas, actualiza el archivo para garantizar que sigue cumpliendo su función correctamente. Realiza revisiones periódicas para detectar errores o configuraciones obsoletas.

4. Utiliza comentarios para aclarar reglas

Añadir comentarios en el archivo robots.txt no solo facilita la colaboración con otros compañeros, también sirve como una guía para futuras actualizaciones. Los comentarios ayudan a explicar el propósito detrás de cada directiva, lo que reduce el riesgo de errores en la edición.

# Bloquear acceso a la carpeta de administración 
Disallow: /wp-admin/

5. Permite el acceso a recursos necesarios

No bloquees archivos CSS, JavaScript o imágenes esenciales para la correcta visualización de tu web. Los motores de búsqueda necesitan acceder a estos recursos para renderizar y evaluar  el contenido correctamente, lo que puede impactar en tu SEO.

6. Configura la ubicación del sitemap

Incluye en tu archivo robots.txt una referencia al sitemap de tu web para facilitar a los motores de búsqueda la localización de todas tus URLs

Sitemap: https://www.ejemplo.com/sitemap.xml 

7. Revisa que todo esté bien con GSC

Ve a ajustes en tu propiedad de Google Search Console. En el apartado de Rastreo podrás ver si Google ha procesado el archivo robots y pinchando sobre él, podrás comprobar si tiene errores o está todo bien.

probar robotstxt en gsc

Esto te permitirá confirmar que las reglas funcionan como esperas y evitar errores críticos.

Errores comunes al usar robots.txt

Incluso con las mejores intenciones, es fácil cometer errores al configurar el archivo.

  •  Bloquear accidentalmente todo el sitio: un error común es utilizar la directiva Disallow: /, lo que bloquea todo el sitio para todos los robots. Esto puede evitar que tu sitio aparezca en los resultados de búsqueda.
  •  Sintaxis incorrecta: errores de sintaxis, como espacios adicionales o caracteres no permitidos, pueden hacer que ciertas reglas no funcionen como se espera.
  • No especificar user-agent: olvidar especificar el User-agent puede llevar a que las reglas no se apliquen correctamente a los robots deseados.
  • No incluir el sitemap: Omitir la ubicación del sitemap puede dificultar que los motores de búsqueda accedan a la estructura completa de tu sitio y no rastree algunas urls.
  • Bloquear el CSS o Javascript: Si prohíbes el rastreo de tus carpetas de diseño o scripts, Google verá tu web como un documento de texto roto de los años 90 y te penalizará por mala experiencia de usuario.
  • Conflictos de mayúsculas: Las rutas en el robots.txt distinguen entre mayúsculas y minúsculas. Disallow: /Contacto/ no bloqueará la URL /contacto/.

Preguntas frecuentes sobre el archivo robots.txt

Para terminar, resumo aquí las dudas rápidas que soléis preguntar cuando nos ponemos a tocar la configuración de rastreo de una web.

¿Dónde se pone el archivo robots.txt exactamente?

El archivo robots.txt debe colocarse siempre, sin excepción, en el directorio raíz de tu dominio. Por ejemplo, si tu web es tuweb.com, la única ruta válida donde los buscadores lo buscarán es https://tuweb.com/robots.txt. Si lo metes en una subcarpeta (tipo tuweb.com/blog/robots.txt), los bots lo ignorarán por completo.

¿El robots.txt sirve para desindexar una página de Google?

No, y es un error muy peligroso pensarlo. El robots.txt solo bloquea el rastreo de los bots (que no entren). Si tu objetivo es eliminar una página de los resultados de Google (desindexar), debes permitir que entren y usar la etiqueta meta robots con la directiva noindex dentro del código de esa página concreta.

¿Qué pasa si pongo «Disallow: /» en mi robots.txt?

Mucho cuidado con esto. Si escribes Disallow: / (seguido de una barra inclinada sola), le estás diciendo a los robots que tienen prohibido el paso a toda tu página web. Los buscadores dejarán de rastrearla por completo y tu web desaparecerá de los resultados de Google en cuestión de días.

¿Puedo bloquear a las Inteligencias Artificiales con el robots.txt?

Sí, y es una práctica cada vez más recomendada. Puedes bloquear a los rastreadores de IA añadiendo reglas específicas para sus User-agents. Por ejemplo, usando User-agent: GPTBot y debajo Disallow: / impedirás que OpenAI escanee tu contenido gratuito para entrenar sus modelos de lenguaje.

 

Si aun con nuestras explicaciones no sabes cómo implementar el archivo robots.txt de tu web en nuestra Agencia SEO Madrid estaremos encantados de ayudarte, llámanos o mándanos un email

Visítanos en las redes

Hola, ahora no estamos, pero puedes dejarnos un mensaje y te responderemos en cuanto volvamos.