> For the complete documentation index, see [llms.txt](https://4lec4st.gitbook.io/4lec4st/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://4lec4st.gitbook.io/4lec4st/ejpt-notes/metodologias-de-evaluacion/recopilacion-de-informacion/recopilacion-pasiva-de-informacion/reconocimiento-y-huella-del-sitio-web.md).

# Reconocimiento y huella del sitio web

## 1. **BuiltWith** (<https://builtwith.com>)

* **¿Qué es?**\
  Es una herramienta online que analiza qué tecnologías utiliza un sitio web: CMS (WordPress, Joomla), frameworks (React, Django), servicios de analítica, servidores web, CDN, etc.
* **¿Cómo se usa?**\
  Visitas la página, introduces el dominio objetivo, y te devuelve un desglose completo de las tecnologías usadas.
* **¿Para qué sirve en enumeración?**\
  Te permite saber posibles vectores de ataque, versiones de software, CMS o plugins que puedan tener vulnerabilidades conocidas.

***

## 2. **Wappalyzer** (<https://www.wappalyzer.com>)

* **¿Qué es?**\
  Similar a BuiltWith, Wappalyzer detecta tecnologías web como frameworks, servidores, CMS, librerías JS, etc.
* **¿Cómo se usa?**\
  Puedes:
  * Usar la extensión para Firefox/Chrome
  * Analizar directamente en la web
* **Ventaja:**\
  La extensión te da info en tiempo real mientras navegas por un sitio.
* **¿Para qué sirve?**\
  Identificar puntos débiles como versiones vulnerables, tecnologías obsoletas, servicios de terceros con fallos conocidos, etc.

***

## 3. **HTTrack**

* **¿Qué es?**\
  Es una herramienta para **clonar completamente un sitio web**.
* **¿Cómo se usa?**
  * Instalación:

    ```bash
    sudo apt install httrack
    ```
  * Comando básico:

    ```bash
    httrack http://objetivo.com -O sitio_clonado
    ```
* **¿Para qué sirve?**
  * Acceder al sitio **offline**, navegar por directorios ocultos o enlaces no indexados.
  * Ver cómo está estructurado el sitio.
  * Buscar formularios ocultos, comentarios en código HTML, rutas internas, archivos JS.
  * Buscar referencias a APIs, endpoints, usuarios, tokens, etc.

***

## 📂 Archivos útiles para enumerar

### 4. **robots.txt**

* **¿Qué es?**\
  Archivo que usan los sitios para **decirle a los bots de búsqueda qué no indexar**.
* **¿Cómo se accede?**\
  Simplemente ve a:

  ```
  http://objetivo.com/robots.txt
  ```
* **¿Qué puede revelar?**\
  Directorios interesantes como:

  ```
  Disallow: /admin/
  Disallow: /secret/
  ```

  Aunque no deberían ser accesibles, a veces sí lo son, y puedes intentar acceder directamente.

***

### 5. **sitemap.xml**

* **¿Qué es?**\
  Archivo XML que enumera **todas las URLs** que el sitio quiere que sean indexadas por motores de búsqueda.
* **¿Cómo se accede?**

  ```
  http://objetivo.com/sitemap.xml
  ```
* **¿Qué puede revelar?**
  * Rutas poco conocidas o no enlazadas desde la página principal.
  * Estructura interna del sitio.
  * URLs que puedes testear para vulnerabilidades.

***

### 💡 Uso en una auditoría web / fase de reconocimiento

1. **Empiezas pasivamente:**
   * Analizas con Wappalyzer y BuiltWith.
   * Visitas `/robots.txt` y `/sitemap.xml`.
   * Apuntas tecnologías, CMS, frameworks, plugins.
2. **Luego haces un clon del sitio:**
   * Con `httrack` te descargas todo y lo inspeccionas localmente.
   * Buscas JS, parámetros ocultos, endpoints internos, comentarios, etc.
3. **Con todo esto, preparas ataques más específicos** como:
   * Buscar exploits para versiones de plugins/temas.
   * Fuzzear directorios ocultos encontrados en `robots.txt`.
   * Comprobar vulnerabilidades en formularios o endpoints encontrados en el sitemap.
