Plantearse los problemas con grandes limitaciones agudiza el ingenio. En este caso Andrew Chan consiguió rastrear millones de páginas web en 24h simplemente porque se autoimpuso las cifras, inspirado por una idea de Michael Nielsen de 2012: 1.000 millones de páginas web en 24 horas (entonces fueron 250 millones en 40 horas).
La cosa resultó además muy barata: apenas unos 462 dólares, muy lejos de los miles o millones que podrían suponerse para un trabajo de este tipo. Usó un clúster de 12 nodos con una sola instancia de Redis, suficiente para recopilar todo el HTML (nada de imágenes) de la manera más rápida posible. Y además, respetando las directrices del robots.txt, como $god manda.
Por @Alvy — 19 de Julio de 2025
PUBLICIDAD
Regala una suscripción sin publicidad a Microsiervos
Lo más visto recientemente
- La evolución de la estructura de las noticias a lo largo del tiempo debido al clickbait
- ¡Dios mío, está lleno de símbolos! Un catálogo de más de 5.200 iconos estándar y su significado
- 13 de septiembre, el día en el que la Luna fue arrancada de su órbita en Espacio: 1999
- Cosas curiosas que le suceden a la gente, algunas de las cuales son raras, raras y otras parecen superpoderes
- El X-59, el avión supersónico «silencioso» de la NASA, supera los 25 vuelos sin un solo problema serio
¿Interesante? No te pierdas…
