Cerved

Senior Data Engineer

San Donato Milanese ItalyFull timeSeniorPosted 21 days ago
Apply on Cerved →

Sign into see who you know at Cerved.

Cerved è la tech company italiana che, grazie a segnali predittivi unici e a un patrimonio esclusivo di dati e analytics, supporta la crescita sostenibile, la gestione del rischio e la trasformazione digitale di imprese e istituzioni.Con Cerved Rating Agency, elaboriamo valutazioni sul merito di credito, rating ESG e analisi sulle emissioni di debito.Dal 2021 Cerved è parte di ION Group, uno dei più grandi operatori FinTech internazionali.Per consolidare il nostro Team Data Models Tools & Processes, siamo alla ricerca di una figura di Senior Data Engineer che avrà la responsabilità di progettare, sviluppare e ottimizzare pipeline di dati robuste e scalabili, a supporto dei processi di business e delle iniziative di Analytics, AI e Machine Learning.Principali responsabilitàSviluppare, testare e mantenere pipeline di ingestione, trasformazione e distribuzione dei dati (ETL/ELT) utilizzando Python, Java, Apache Spark e Databricks;Implementare e ottimizzare Job Spark (batch e streaming) su Databricks, garantendo performance, affidabilità e copertura dei test;Integrare sorgenti dati eterogenee (database relazionali, API REST, file system, code di messaggistica) sfruttando i servizi AWS: S3, Glue, Kinesis, SQS, Lambda, Redshift;Scrivere codice di qualità production-grade in Python e/o Java, applicando principi SOLID, design pattern, code review e test automatizzati (unit, integration);Costruire e gestire workflow di orchestrazione con Apache Airflow o Databricks Workflows, assicurando monitoraggio, alerting e gestione degli errori;Applicare tecniche di data modeling e trasformazione con Databricks (Delta Live Tables, Databricks SQL, Auto Loader), garantendo la tracciabilità e la qualità dei dati lungo tutto il flusso (data lineage, data quality checks);Collaborare con i team di Data Architect, Data Science e BI;Contribuire all’adozione di best practice DevOps/DataOps: versionamento del codice (Git), CI/CD per pipeline dati, Infrastructure as Code (Terraform) e ambienti containerizzati (Docker, Kubernetes);Preparare e ottimizzare i dati a supporto di modelli ML e soluzioni AI: feature engineering, costruzione di Feature Store, pipeline di embedding e RAG per applicazioni di Generative AI.RequisitiLaurea in Informatica, Ingegneria Informatica, Matematica o discipline affini. Certificazioni AWS (Cloud Practitioner, Developer, Data Analytics) o Databricks sono apprezzate;Esperienza di almeno 3 anni nello sviluppo di pipeline dati e soluzioni di data engineering in contesti produttivi;Solide competenze di programmazione in Python (pandas, PySpark, asyncio, FastAPI) e/o Java (Spring Boot, Maven/Gradle); capacità di scrivere codice pulito, testabile e documentato;Esperienza con Apache Spark (RDD, DataFrame API, Spark SQL, Structured Streaming) e con la piattaforma Databricks (notebooks, jobs, Delta Live Tables);Conoscenza pratica dei servizi AWS per i dati: S3, Glue, Athena, Redshift, EMR, Kinesis Data Streams/Firehose, Lambda, Step Func...