Un dominio con años encima no es una cadena de texto: es un montón de enlaces que otras webs pusieron cuando ese sitio estaba vivo. Cuando lo recuperas, esos enlaces siguen apuntando ahí (bueno, es un poco más complejo que eso, pero eso da para una clase de SEO para ecommerce en pango.academy). Lo que no vuelve solo es el contenido.
Esto es algo que me gusta hacer por ocio: cuando tengo algo de tiempo libre busco algo que rescatar e intento que vuelva a tener tráfico. Ahora mismo estoy en mitad de dos a la vez y he montado el proceso entero por escrito, así que aprovecho para contarlo con los números delante. Uno es un sitio de egiptología de 2008. El otro, un foro de finanzas e inversión que estuvo vivo entre 2012 y 2019.
Paso 1: inventariar una web que ya no existe
El Internet Archive tiene una API que casi nadie usa y que es la pieza clave: el índice CDX. Devuelve, en JSON, todas las capturas que tiene de un dominio. A lo mejor no entiendes por qué, pero a mí esto me flipa.
https://web.archive.org/cdx/search/cdx
?url=ejemplo.com&matchType=domain&output=json
&collapse=urlkey
&filter=statuscode:200
&filter=mimetype:text/html
Tres parámetros hacen el trabajo. matchType=domain baja también los subdominios.
collapse=urlkey deja una fila por URL en vez de una por captura, que es la diferencia
entre 5.401 filas y varios cientos de miles. Y los dos filtros quitan los 404 y los
ficheros que no son páginas.
Con eso, el sitio de finanzas devolvió 5.401 rutas únicas. Ahí empieza lo interesante, porque de esas 5.401 solo una parte es contenido: el resto puede ser cualquier tipo de basura que te imagines.
El otro truco que hay que saber: para bajar el HTML original, sin la barra de
navegación que el archivo inyecta, hay que meter id_ justo después de la marca de
tiempo.
https://web.archive.org/web/20150430104110id_/http://ejemplo.com/pagina.html
Sin ese id_ te llevas el HTML completo, que normalmente viene contaminado con los
scripts del archivo —y ahí puede haber cualquier cosa—, y luego limpiarlo bien es casi
imposible.
Paso 2: el dominio tiene capas, como un yacimiento arqueológico
Yo a esto lo llamo arqueología web, y no sé si alguien habrá inventado ya ese término para otra cosa. Aquí es donde deja de ser un script y empieza a necesitar criterio.
Al clasificar las 5.401 rutas del foro salieron tres eras distintas, y ninguna tiene que ver con la anterior:
| Era | Qué había | Cuánto |
|---|---|---|
| 2012-2019 | Un foro phpBB de finanzas, macro, materias primas, Dubái, salud | 1.080 hilos |
| 2020 | Spam en chino sobre casinos, montado sobre un WordPress 4.9 | 77 páginas |
| 2022 en adelante | Artículos en español de un nicho concreto | ~30 artículos |
La era de 2020 es el clásico: el dominio se queda libre, alguien lo pilla y lo usa para
apuntar enlaces mientras dure la autoridad acumulada. Títulos tipo bgc娱乐官方注册 en un
dominio en español.
Esto no es una anécdota, es el problema central del rescate. Si te bajas «todo el contenido posible» y lo publicas, acabas de republicar el spam de otro en tu dominio nuevo. Y lo vas a hacer sin enterarte, porque nadie se lee 5.401 páginas.
Paso 3: la IA como portero, no como redactora
Aquí es donde meto los modelos, y no es para escribir: es para decidir qué entra.
El pipeline tiene tres filtros encadenados, del más barato al más caro:
Filtro por patrón. Expresiones regulares sobre la ruta. Los hilos de un phpBB acaban
en -t1094.html, los índices de foro en -f102/, los perfiles de usuario en -u851/, y
las paginaciones llevan topic34.html. Con eso solo, de 5.401 rutas se quedan 1.114
candidatas y se van 4.287 que eran listados, perfiles y paginación. Esto es gratis y
resuelve el 80%.
Filtro por estructura. Se extrae el cuerpo y se descarta lo que no llega a 200 palabras de texto real. Se cae un montón de páginas que existen pero están vacías: hilos de una línea, redirecciones, plantillas huérfanas.
Filtro por criterio, con modelo. Lo que sobrevive se clasifica: ¿esto es contenido del sitio original o es lo que dejó el okupa spammer? ¿Está en el idioma del sitio? ¿Habla del tema del dominio o de casinos? ¿Es un texto que se sostiene solo o es el «gracias, muy buen aporte» de un hilo?
Ese último filtro es el que no se puede hacer con reglas, y es el que decide si tu sitio resucita sano o resucita con la enfermedad del dueño anterior. Un modelo leyendo 1.114 páginas y contestando cuatro preguntas sobre cada una cuesta unos céntimos, y sustituye a un tiempo casi infinito de una persona leyendo un montón de contenido, gran parte de él infumable. No te aconsejo hacerlo a mano. Y hace unos años lo hacía a mano.
Con dos advertencias que me he tatuado, porque las dos me han mordido:
El modelo etiqueta, no decide. La salida es una etiqueta con una razón, no un DELETE.
Todo queda en un JSON que se puede revisar y revertir. Lo que se descarta se guarda.
Lo dudoso no entra. Si el clasificador no está seguro, va a una pila de revisión manual. Un falso positivo publicado es contenido basura en tu dominio; un falso negativo es una página menos. No son igual de graves.
Paso 4: el detalle que decide el rescate entero
Y ahora la parte que casi todo el mundo se salta, que es la única que importa de verdad.
En Pango Studio usamos mucho Ahrefs para las migraciones a Shopify, así que lo uso también para esto. En el sitio de egiptología descargué el perfil de enlaces: 469 enlaces entrantes. La primera lectura es «bien, 469». La segunda es la buena:
- 350 vienen de granjas de enlaces: dominios tipo
rank-your.site,factmags.comy varios.shopcon «seo» o «rank» en el nombre. Todos apuntan a la portada. Es el rastro que dejó la etapa en que el dominio estuvo suelto. - Quedan 115 enlaces limpios, 50 de ellos con autoridad de dominio 20 o más.
- Y de todo el perfil, solo 25 enlaces apuntan a páginas internas.
Esos 25 son el activo. Porque entre ellos están la Wikipedia catalana y la rusa —
autoridad 97 — y no enlazan a la portada: enlazan a
/pagina/culturaegipcia/ocasmeidum/ocasmeidum.htm, una página concreta sobre las ocas de
Meidum. Yo de egiptología no sé nada, pero por lo que he leído son un friso pintado de
hace unos 4.600 años, sacado de una tumba en Meidum, con seis ocas de un realismo que
llama la atención para la época; está en el Museo Egipcio de El Cairo y hay quien lo llama
la Mona Lisa del antiguo Egipto. Y ecured.cu, con autoridad 76, enlaza directamente a
un fichero .jpg: la foto del papiro Harris de Ramsés III.
Y de aquí sale lo único que hay que tener claro antes de montar nada: si pones permalinks bonitos y esas URLs devuelven 404, acabas de tirar a la basura lo único que hacía valioso al dominio. Y encima va a parecer que ha ido bien, porque la web ha quedado con un estilo que me encanta.
Así que el orden correcto es al revés de como lo hace todo el mundo:
- Primero, la lista de URLs que reciben enlaces, ordenada por autoridad.
- Esa lista es un requisito, no una tarea de la fase tres.
- Cada una: o responde con su contenido en la ruta original, o redirige con un 301 a la entrada equivalente.
- Las imágenes enlazadas se suben a su ruta exacta. Un
.jpgenlazado desde una enciclopedia es un enlace igual que cualquier otro. - Y al final se comprueba a mano, con las URLs de origen en el navegador, que ninguna cae en un 404.
En este caso son once URLs. Once. Ese es todo el trabajo que separa un rescate que funciona de un dominio bonito y muerto.
Lo que no se rescata
Dos cosas se quedan fuera, siempre.
El spam del okupa spammer, obviamente. Las 77 páginas de casinos no entran ni redirigidas. Si acaso, se comprueba si alguna sigue indexada para pedir su retirada.
Lo que no es tuyo sin decir de quién es. Un dominio puede pasar por varias manos, y los enlaces que otros le pusieron se quedan con el dominio: eso es de quien lo tiene ahora, y aprovecharlos es tan legítimo como comprar un local con la clientela hecha.
El contenido es otra cosa. Ahí el autor no cambia porque cambie el propietario del dominio, así que la regla es sencilla: lo que no escribiste tú vuelve con el nombre de quien lo escribió. En el sitio de egiptología eso significa recuperar todo lo que haya disponible y publicarlo atribuido a su autor original, con la fecha que tenía y un enlace a la captura del archivo de la que sale. No es solo una cuestión legal: una página que dice de dónde viene y quién la firmó es más creíble que una que aparece flotando.
Es la diferencia entre restaurar un cuadro y firmarlo con tu nombre.
El resumen, para quien vaya a hacerlo
- El índice CDX del Internet Archive te da el mapa completo.
collapse=urlkeyy los filtros de estado y tipo te ahorran el 95% del ruido. - El sufijo
id_te da el HTML limpio. - Clasifica por patrón primero: es gratis y quita cuatro quintas partes.
- Mete el modelo donde hace falta criterio, no donde hace falta una regla. Y que etiquete, no que borre.
- Baja el perfil de enlaces antes de montar nada. Las URLs que reciben enlaces son el esquema de tu sitio nuevo, no un detalle de migración.
- Y ten claro qué contenido es tuyo. Los enlaces vienen con el dominio; los textos no.
Lo iré contando según avancen los dos. El de egiptología tiene 65 páginas y 51 imágenes esperando en el archivo, y el de finanzas, 1.080 hilos que llevan siete años apagados.