Data Engineer Big Data - Freelance - Freelance
Freelance Paris (Paris)
Description de l'offre
Contexte
Dans le cadre de la maintenance et du passage à l'échelle de différents outils de datavisualisation et d'analytics, la mission vise à assurer la robustesse des chaînes de traitement de données, l'optimisation des performances et l'intégration de nouveaux cas d'usage analytiques.
- Bonne compréhension des architectures Data modernes (Data Lake, Data Mesh, Event-Driven Architecture).
- Maîtrise des principes de conception et d'industrialisation des flux de données batch et temps réel.
- Connaissance des architectures événementielles et des mécanismes de publication/consommation d'événements (topics, messaging, streaming).
- Expérience des environnements Cloud AWS et des bonnes pratiques d'exploitation associées.
- Compréhension des enjeux de gouvernance, de qualité et de traçabilité des données.
- Capacité à concevoir des solutions robustes, résilientes et évolutives répondant aux besoins métiers.
| Catégorie | Compétences obligatoires | Compétences souhaitées |
|---|---|---|
| Big Data | Spark (PySpark/Spark SQL), optimisation des jobs | Hadoop |
| Streaming | Kafka (producteur/consommateur, topics, partitions) | Kafka Connect |
| Langages | Python (Pandas, PySpark), SQL | Scala (option) |
| Cloud | AWS/GCP/Azure | Terraform, Cloud Storage (S3, GCS) |
| Monitoring | Datadog (métriques custom, API) | Prometheus, Grafana |
| Outils Data | Airflow, Dataiku (intégration, recettes) | |
| DevOps | Kubernetes, Helm, Docker, CI/CD (GitLab CI, Jenkins) |
Missions
- Assurer le maintien en conditions opérationnelles de l'infrastructure Data sur AWS et des produits existants.
- Concevoir et déployer des topics événementiels permettant la diffusion et la consommation de données en temps réel.
- Renforcer la robustesse, la scalabilité et l'interopérabilité des plateformes de données afin de répondre aux nouveaux besoins métiers et analytiques.
Compétences demandées
- Python (Pandas, PySpark) : confirmé
- Spark (PySpark/Spark SQL) : confirmé
- Kafka (producteur/consommateur, topics, partitions) : confirmé
- Connaissance des architectures événementielles et des mécanismes de publication/consommation d'événements (topics, messaging, streaming) : confirmé
Profil recherché
- Bonne compréhension des architectures Data modernes (Data Lake, Data Mesh, Event-Driven Architecture)
- Maîtrise des principes de conception et d'industrialisation des flux de données batch et temps réel
- Connaissance des architectures événementielles et des mécanismes de publication/consommation d'événements (topics, messaging, streaming)
- Expérience des environnements Cloud AWS et des bonnes pratiques d'exploitation associées
- Compréhension des enjeux de gouvernance, qualité et traçabilité des données
- Capacité à concevoir des solutions robustes, résilientes et évolutives répondant aux besoins métiers
- Compétences obligatoires en Spark (PySpark/Spark SQL) et optimisation des jobs
- Compétences obligatoires en Kafka (producteur/consommateur, topics, partitions)
- Compétences obligatoires en Python (Pandas, PySpark) et SQL
- Compétences souhaitées en Hadoop, Kafka Connect, Scala (option)
- Compétences en Cloud (AWS/GCP/Azure) avec des connaissances souhaitées en Terraform, Cloud Storage (S3, GCS)
- Compétences en monitoring avec Datadog (métriques custom, API), Prometheus, Grafana
- Connaissance des outils Data comme Airflow, Dataiku (intégration, recettes)
- Compétences DevOps souhaitées en Kubernetes, Helm, Docker, CI/CD (GitLab CI, Jenkins)
À propos de Collective.work
Collective.work est la plateforme de recrutement nouvelle génération pour trouver votre prochain emploi.
Fort d'une grande expertise dans l'IA, Collective.work permet de mieux cibler les offres et leurs candidats correspondants, créant ainsi un système beaucoup plus fluide que les acteurs traditionnels.
Plus de 10,000 recruteurs utilisent Collective, permettant à des dizaines de milliers de candidats de trouver leur futur emploi chaque jours