Data Product Engineer - Freelance
Freelance Paris (Paris)
Description de l'offre
Contexte
Dans le cadre de la transition vers une architecture Data Mesh, nous recherchons un(e) Data Product Engineer spécialisé(e) dans le développement de pipelines sur la plateforme Talend Real Time BigData et de data products sur la plateforme Starburst (Trino). La mission consiste à concevoir, collecter, intégrer, construire et opérer des jeux de données fiables, auto-descriptifs et interopérables, en collaboration avec les domain teams et les data owners.
Missions
Concevoir des flux de données et des Data Products
Développer des pipelines d'intégration de données optimisés via la Talend Data Fabric / Talend Real Time BigData
Développer des requêtes SQL optimisées pour Starburst/Trino (push-down predicates, partitionnement, formats de fichiers comme Iceberg/Parquet)
Automatiser les pipelines de données (ETL/ELT) avec des outils comme Airflow, dbt, ou Starburst Galaxy
Configurer des accès sécurisés (RBAC, row-level security) et des politiques de gouvernance (tagging, lineage)
Collaborer avec les domain teams pour identifier les sources de données et les cas d’usage
Documenter les data products (métadonnées, ownership, qualité) via des outils comme Amundsen, DataHub, ou Starburst Discover
Participer à la définition des standards d’interopérabilité (formats communs, APIs de données)
Monitorer la performance (latence, coût des requêtes) et la qualité des données (frais, complétude)
Mettre en place des alertes et des dashboards (Grafana, Metabase) pour le suivi des data products
Contribuer à l’amélioration continue de la plateforme Starburst (scaling, caching, federation)
Compétences techniques requises
Talend RealTime BigData : expérience avancée en développement de pipelines sur Talend Studio en mode batch ou route (runtime)
Starburst/Trino : expérience avancée en SQL sur Starburst/Trino (jointures, CTEs, fonctions analytiques)
Data Modeling
Pipelines : expérience avec Airflow/Astronomer, Spark, Talend Real Time Big Data / Talend Data intégration
Stockage : connaissance des formats Iceberg, Parquet, S3
Gouvernance : familiarité avec les outils de sécurité (Ranger, RBAC)
DevOps/DataOps : pratiques CI/CD pour les pipelines, infrastructure-as-code (Terraform, Kubernetes)
Langages : SQL avancé (mandatory), Python (Pandas, PySpark), bash
Compétences transverses (Data Mesh)
Compréhension des principes Data Mesh (domain-oriented ownership, self-serve platform, federated governance)
Capacité à travailler en mode produit (roadmap, priorisation, collaboration avec les métiers)
Sensibilité à la data quality (tests, monitoring, remédiation) et à la documentation (data contracts, métadonnées)
Soft Skills
Esprit collaboratif : travail avec les équipes métiers, data scientists, et DevOps
Pédagogie : capacité à expliquer des concepts techniques à des non-experts
Autonomie : prise d’initiative dans un cadre agile
Environnement technique
Expertise écosystème zoo Hadoop
Connaissance / maîtrise Data
Connaissance / maîtrise technique de l’environnement DevOps
Maîtrise technique de l'environnement Data
Expertise couche d'accès et d‘échange (Kafka, Nifi, …)
Expertise Java, Scala, Python, Hive, Spark
Expertise ETL, Bash
Expertise SQL / NoSQL
Profil recherché
Expérience avancée en développement de pipelines sur Talend RealTime BigData (Talend Studio en mode batch ou route)
Expérience avancée en SQL sur Starburst/Trino (jointures, CTEs, fonctions analytiques)
Expérience avec Airflow/Astronomer, Spark, Talend Data intégration
Connaissance des formats de stockage Iceberg, Parquet, S3
Familiarité avec les outils de sécurité et gouvernance (Ranger, RBAC)
Pratiques CI/CD pour les pipelines, infrastructure-as-code (Terraform, Kubernetes)
Maîtrise des langages : SQL avancé (obligatoire), Python (Pandas, PySpark), bash
Compréhension des principes Data Mesh (domain-oriented ownership, self-serve platform, federated governance)
Capacité à travailler en mode produit (roadmap, priorisation, collaboration avec les métiers)
Sensibilité à la data quality (tests, monitoring, remédiation) et à la documentation (data contracts, métadonnées)
Esprit collaboratif : travail avec les équipes métiers, data scientists, et DevOps
Pédagogie : capacité à expliquer des concepts techniques à des non-experts
Autonomie : prise d’initiative dans un cadre agile
Expertise dans l'écosystème Hadoop
Maîtrise technique de l'environnement Data et DevOps
Expertise sur les couches d'accès et d’échange (Kafka, Nifi)
Expertise en langages Java, Scala, Python, Hive, Spark
Expertise en ETL, Bash
Expertise en SQL / NO SQL
À propos de Collective.work
Collective.work est la plateforme de recrutement nouvelle génération pour trouver votre prochain emploi.
Fort d'une grande expertise dans l'IA, Collective.work permet de mieux cibler les offres et leurs candidats correspondants, créant ainsi un système beaucoup plus fluide que les acteurs traditionnels.
Plus de 10,000 recruteurs utilisent Collective, permettant à des dizaines de milliers de candidats de trouver leur futur emploi chaque jours