Lo que buscamos Experiencia 5+ años en roles de datos, o 3+ años como Data Engineer construyendo y operando pipelines en producción. Python y SQL Python avanzado para procesamiento de datos (pandas), con tests automatizados (pytest). SQL avanzado en PostgreSQL: modelado, índices, planes de ejecución y cargas incrementales (upserts).
Integración Experiencia integrando fuentes heterogéneas: APIs REST (autenticación, paginación), webhooks, SFTP, archivos planos y bases de datos de terceros. Diseño de procesos ETL/ELT con un orquestador (idealmente Airflow). Calidad y contratos de datos Validación de datos con esquemas y contratos (pandera, pydantic, Great Expectations o similares).
Criterio para pensar la calidad del dato desde el diseño del pipeline. Cloud AWS: S3, RDS y al menos un servicio de procesamiento (Glue, Lambda, Batch o ECS). Lo que vas a hacer Diseñar, construir y operar pipelines de integración desde el origen de cada cliente (ERPs, APIs REST, webhooks, SFTP, VPN, archivos en S3) hasta PostgreSQL en AWS RDS. Escribir procesos ETL y ELT en Python, orquestados con Apache Airflow.
Migrar los pipelines legados (AWS Glue y flujos heredados) al nuevo stack. Definir contratos de datos declarativos por cliente y entidad: esquema, tipos, vocabularios, ventanas de entrega y umbrales de cuarentena. Implementar reglas de calidad por dimensión (completitud, validez, unicidad, integridad referencial, consistencia, oportunidad) y verificar que cada transformación preserve los invariantes del dato.
Diseñar el modelo de datos, versionarlo con migraciones y hacer el onboarding de clientes nuevos. Construir la observabilidad del pipeline: hallazgos de calidad por corrida, alertas y detección de fallas silenciosas, como el proceso que termina “con éxito” sin haber recibido un solo archivo. Cuadrar nuestras cifras con las del cliente, explicar cada diferencia y arreglar la causa en el pipeline.
Gestionar accesos y credenciales de procesos y cuentas de servicio con mínimo privilegio. Documentar flujos, contratos de datos y procedimientos operativos. Trabajar con data science, producto e ingeniería en los datos que alimentan el motor de recomendaciones y la plataforma. Nivel: Senior.
Jornada
Tiempo completo.
Fuente: Get on Board. trabajaya no cobra nada, ni a vos ni por postularte.
📲 Pasársela a alguien✈️ Telegram