Back to jobs

Data Engineer - Streaming & Batch Pipelines

Madrid

SE REQUIERE

Experiencia

  • 3+ años de experiencia como Data Engineer en entornos productivos de gran volumen, con experiencia sólida en Apache Spark, tanto en procesamiento batch como en Spark Structured Streaming, utilizando PySpark o Scala.

Estudios

  • Technical degree-level education: Bachelor’s degree in Engineering, Technology Sciences, Mathematics, Economics, Physics, Chemistry, Statistics, or similar.

Technical skills

  • Apache Spark con PySpark o Scala: batch y Spark Structured Streaming.
  • Delta Lake: MERGE, upserts, time travel, optimización de ficheros y gestión de esquemas.
  • Apache Kafka y Confluent: productores y consumidores, particionado, Schema Registry y CDC mediante Debezium.
  • Ecosistema de datos de AWS: Glue, Data Catalog, ETL, Lambda, S3, EMR y EMR Serverless.
  • AWS Lake Formation: permisos a nivel de tabla y columna y gobierno de acceso.
  • Amazon SageMaker: integración de pipelines de datos con flujos de Machine Learning.
  • SQL avanzado y modelado de datos dimensional.
  • Change Data Capture y Slowly Changing Dimensions.
  • Git, CI/CD y buenas prácticas de testing en proyectos de datos.

Otras informaciones

Se valorará:

  • Experiencia con Kafka Streams o ksqlDB.
  • Experiencia con arquitecturas de lookup tables a gran escala, incluyendo point lookup, bucketing y Bloom Filters.
  • Conocimientos de Terraform o CloudFormation para infraestructura como código.
  • Experiencia en sectores regulados, especialmente en el sector financiero o de medios de pago.
  • Certificaciones AWS, como Data Analytics Specialty o Solutions Architect.
  • Buscamos un perfil con capacidad para realizar debugging profundo en sistemas distribuidos, autonomía y mentalidad “you build it, you run it”.

 

RESPONSABILIDADES CLAVE

  • Diseñar, construir y operar pipelines de ingesta y transformación de datos en tiempo real y por lotes sobre una plataforma AWS nativa de streaming basada en Kafka/Confluent, Spark Structured Streaming y Delta Lake, con foco en fiabilidad, rendimiento y escalabilidad.

 

Actividades principales

  • Diseñar, desarrollar y mantener pipelines de streaming con Spark Structured Streaming y procesos batch sobre AWS.
  • Implementar lógica CDC, joins de enriquecimiento, gestión de checkpoints y offsets, y tratamiento de DLQ.
  • Integrar y mantener conectores y componentes de Confluent Kafka, incluyendo topics, Schema Registry, particionado y optimización del throughput.
  • Construir y optimizar tablas Delta Lake mediante particionado, Z-Ordering o Liquid Clustering, compactación, operaciones MERGE/upsert y gestión de esquemas.
  • Desarrollar y mantener jobs en AWS Glue, incluyendo crawlers, catálogo y procesos ETL, así como funciones AWS Lambda para orquestación y procesamiento event-driven.
  • Operar y optimizar cargas Spark en EMR y EMR Serverless mediante tuning de memoria, particionado, shuffle, Adaptive Query Execution y resolución de cuellos de botella.
  • Colaborar con los equipos de Data Science y Machine Learning en la preparación de datasets y pipelines de features para SageMaker.
  • Diseñar estrategias para gestionar tablas de referencia o lookup a gran escala, utilizando point lookup, caching y particionado para realizar joins de enriquecimiento eficientes.
  • Implementar monitorización, alertado y mecanismos de resiliencia para pipelines 24/7, incluyendo heartbeats, reintentos y checkpointing.
  • Evolucionar el framework interno de ETL basado en YAML y Spark, aplicando CI/CD, testing e infraestructura como código.

Apply for this job

*

indicates a required field

Phone
Resume/CV*

Accepted file types: pdf, doc, docx, txt, rtf


Select...
Select...
Select...

The PagoNxt entity advertising the job to which you are applying will process your personal information as data controller to assess your suitability for the position and manage the recruitment process. 
If you are applying for a job in the EU, the lawful basis to process your data is the necessity to take steps to assess your suitability for the offered position (art. 6.1b GDPR). If applying outside the EU, the lawful basis is your consent. To exercise your privacy rights (including access, rectification, erasure, restrict processing, portability, object and not being subject to automated decisions or any other required by law), please write to the PagoNxt’s entity Data Protection Officer listed in our privacy notice or send an email to privacy@pagonxt.com. You may also submit a complaint to the relevant supervisory authority.

Please read the details of processing in our Privacy Notice:

https://www.pagonxt.com/assets/pdf/Data_Protection_Candidades_PagoNxt_v3.pdf

Select...