← Todos los artículos

Cómo automaticé el rastreo diario de 542 fuentes oficiales

Caso OpoAlerta: scraping y ETL en Python que cada mañana revisa 542 fuentes oficiales (DOGV, boletines y ayuntamientos) y publica las oposiciones listas para buscar.

Buscar una oposición pública en la Comunitat Valenciana significaba, hasta hace poco, abrir a mano decenas de webs cada día: el diario oficial (DOGV), los boletines de las tres provincias y las sedes electrónicas de cientos de ayuntamientos. Cada uno con su formato, su calendario y su forma de publicar. Un trabajo imposible de hacer manualmente sin que se escape media convocatoria.

OpoAlerta nació para resolver exactamente eso. Y el reto era, sobre todo, técnico: convertir un caos de fuentes dispersas en un único buscador limpio y actualizado. Este es el tipo de problema que resuelvo con automatización y web scraping.

El problema: 542 fuentes que no se parecen en nada

No es lo mismo rastrear una web que rastrear 542. Cada fuente tiene:

  • Un formato distinto: unas publican en HTML, otras en PDF, otras en portales de sede electrónica con su propio buscador.
  • Un ritmo distinto: el DOGV sale cada día laborable; muchos ayuntamientos publican de forma irregular.
  • Una estructura cambiante: las webs municipales se rediseñan sin avisar y rompen cualquier scraper rígido.

Hacer esto a mano es inviable. Y un scraper ingenuo —de los que asumen que todas las páginas son iguales— se rompe el primer día.

La solución: scraping + ETL, ejecutado solo cada mañana

Monté un sistema en Python que cada mañana, de forma automática:

  1. Rastrea las 542 fuentes: el DOGV, los boletines provinciales y las sedes de los municipios de la Comunitat Valenciana.
  2. Extrae las convocatorias de cada una, adaptándose al formato concreto de cada fuente.
  3. Limpia y normaliza los datos (un proceso ETL): fechas, plazos, tipo de plaza, organismo… todo con la misma estructura, vengan de donde vengan.
  4. Clasifica cada convocatoria y la deja lista para buscar en un único sitio.

La clave no es el scraping en sí, sino todo lo que viene después: sin la fase de limpieza y normalización, tendrías 542 volcados imposibles de cruzar. Con ella, tienes un buscador que funciona.

Y como cualquier sistema que depende de webs externas, está construido para aguantar los cambios: control de errores, reintentos y avisos cuando una fuente deja de responder, para enterarme en el momento y no semanas después.

El resultado

  • 542 fuentes oficiales rastreadas automáticamente cada mañana, sin intervención manual.
  • Las convocatorias llegan clasificadas y buscables en un solo lugar, en lugar de repartidas por decenas de webs.
  • El trabajo que sería imposible hacer a mano —revisar cientos de fuentes a diario— lo hace un sistema que se ejecuta solo.

Puedes ver el proyecto en marcha en opoalerta.com.

Qué puede aprender tu empresa de esto

OpoAlerta es un caso extremo (542 fuentes), pero el patrón se repite en muchísimos negocios:

  • Un e-commerce que necesita vigilar los precios de la competencia o los catálogos de sus proveedores.
  • Una empresa que recopila a mano listados, licitaciones o boletines que le afectan.
  • Un equipo que dedica horas cada semana a copiar datos de unas webs a una hoja de cálculo.

Todo eso se puede automatizar: un sistema que recoge la información, la ordena y la deja lista, para que tú tomes decisiones en vez de perder el tiempo recopilando.

Si en tu negocio hay una tarea así —de recoger, copiar o vigilar datos que cambian—, cuéntamelo y te digo en menos de 24 horas cómo automatizarla. La primera valoración es gratis y sin compromiso.

Cuéntame qué necesitas

¿Cansado de perder tiempo en tareas que deberían estar automatizadas? Describe tu situación y en menos de 24 horas te respondo con una propuesta y un precio orientativo para tu caso. Sin compromiso.

Email
Ubicación España — Remoto
Sígueme