Plantearse los problemas con grandes limitaciones agudiza el ingenio. En este caso Andrew Chan consiguió rastrear millones de páginas web en 24h simplemente porque se autoimpuso las cifras, inspirado por una idea de Michael Nielsen de 2012: 1.000 millones de páginas web en 24 horas (entonces fueron 250 millones en 40 horas).
La cosa resultó además muy barata: apenas unos 462 dólares, muy lejos de los miles o millones que podrían suponerse para un trabajo de este tipo. Usó un clúster de 12 nodos con una sola instancia de Redis, suficiente para recopilar todo el HTML (nada de imágenes) de la manera más rápida posible. Y además, respetando las directrices del robots.txt, como $god manda.
Por @Alvy — 19 de Julio de 2025
PUBLICIDAD
Suscripción sin publicidad a Microsiervos
Patrocinadores
MAXSIM - La nube agéntica
Lo más visto recientemente
- «Mira mamá, sin cookies»: una web que revela todo lo que un sitio web que se visita puede saber de ti y además te explica cómo lo hace
- Castlemap: un mapa con 6.412 castillos del mundo, clasificados por su «fama» en la Wikipedia. Numancia triunfa
- El manual original del Legend of Zelda de Nintendo muestra cómo se acompañaban los juegos antes de que todo fuera digital
- Responsables de eBay respondieron a unas críticas periodísticas con una campaña de acoso que ha acabado costándoles 56 millones de dólares y varias condenas de prisión
- La botella π de 3,14 litros, que irónicamente no es redonda
¿Interesante? No te pierdas…

