Muchos proyectos de scraping mueren igual: un cron llena un bucket de JSON, alguien lo abre una vez, y la operación vuelve a los chequeos manuales. El scrape “funcionó”. La operación no cambió.
Scraping que no cambia la operación
El scraping útil empieza en la decisión, no en la página. ¿Qué debería hacer alguien distinto mañana por la mañana porque ese dato existe? Cambiar un precio, marcar un anuncio, actualizar stock, llamar un lead, pausar un anuncio. Si no nombras esa acción, estás coleccionando curiosidad.
Eso significa que el pipeline es más que extracción. Necesitas schema, resolución de entidades, SLA de frescura y una superficie de entrega donde el equipo ya vive — alerta en Slack, panel admin, tabla en warehouse, webhook al ERP.
Empieza por la decisión, no por el HTML
La confiabilidad importa más que la viveza. Los sitios cambian. Los selectores se rompen. Aparecen muros anti-bot. El producto no es un script; es un feed monitoreado con reintentos, tests de parse y alguien responsable cuando dejan de llegar los números de ayer.
Los límites legales y éticos entran en el diseño, no en una nota al pie. Respetar robots cuando corresponda, evitar datos personales que no necesitas y preferir datos comerciales públicos con un propósito de negocio claro.
Confiabilidad, entrega y límites
Cuando entregamos scrapers para real estate y ecommerce, la condición de victoria es simple: el operador deja de abrir diez pestañas porque el sistema ya leyó todo de madrugada.