Design, develop, and maintain robust ETL/ELT pipelines using PySpark and Python to process large volumes of data. Collaborate with cross-functional teams to build scalable data architectures and optimize performance for high-efficiency data processing.
Buscamos un(a) Ingeniero(a) PySpark Senior responsable de diseñar, desarrollar y optimizar procesos de ingeniería y transformación de datos utilizando Python y PySpark, asegurando la calidad, disponibilidad y eficiencia de grandes volúmenes de información.
La persona seleccionada participará en proyectos de Data Engineering, Big Data y procesamiento distribuido, colaborando con equipos de desarrollo, arquitectura, analítica y negocio para construir soluciones escalables y de alto rendimiento.
\n
Responsabilidades
Diseñar, desarrollar y mantener procesos de ETL/ELT utilizando PySpark y Python.
Procesar y transformar grandes volúmenes de datos mediante arquitecturas distribuidas.
Desarrollar pipelines de datos robustos, escalables y eficientes.
Optimizar jobs de Spark, consultas y procesos de transformación para mejorar tiempos de ejecución y consumo de recursos.
Trabajar con fuentes de datos estructuradas y no estructuradas.
Integrar información proveniente de bases de datos, APIs, archivos y diferentes fuentes de información.
Implementar procesos de validación, limpieza y transformación de datos.
Participar en el diseño de arquitecturas de datos y soluciones Big Data.
Monitorear y solucionar errores en pipelines y procesos de procesamiento de datos.
Implementar buenas prácticas de desarrollo, control de versiones y documentación.
Colaborar con Data Engineers, Data Scientists, DevOps, arquitectos y equipos de negocio.
Participar en procesos de automatización y mejora continua de las plataformas de datos.
Requisitos técnicos
+2 años de experiencia en Data Engineering o desarrollo de soluciones de procesamiento de datos.
Experiencia sólida con PySpark y Python.
Conocimiento de Apache Spark y procesamiento distribuido.
Experiencia desarrollando procesos ETL/ELT.
Manejo avanzado de SQL.
Experiencia con bases de datos relacionales y/o NoSQL.
Conocimiento de formatos como Parquet, JSON, CSV y Avro.
Experiencia con herramientas de control de versiones, principalmente Git.
Conocimiento de ambientes Linux/Unix.
Experiencia con alguna plataforma Cloud como AWS, Azure o GCP.
Deseable experiencia con servicios de datos como Databricks, AWS Glue, EMR, Azure Databricks, Synapse o similares.
Deseable conocimiento de herramientas de orquestación como Airflow.
Deseable experiencia con Docker y CI/CD.
$2,000 - $3,000 a month
En iCodde apreciamos el valor de tu red personal, por lo tanto, recompensamos con dinero en efectivo por compartirla. Si el puesto no es de su interés pero conoces a alguien que podría estar interesado, envíanos su contacto y recibe un beneficio económico por una contratación efectiva. De esta forma, recibes una compensación y tu contacto mejora sus condiciones laborales.
“I was the first applicant for a remote marketing position that got listed on the company website the same day I applied. Had an interview within 48 hours!”