Les offres de “Collective.work”

Nouveau Collective.work

Senior Kafka Reliability & Performance Engineer - Freelance

  • Freelance
  • Paris (Paris)

Description de l'offre

Nous recherchons un(e) expert(e) Kafka pour un mandat exclusivement centré sur le diagnostic d'une plateforme Apache Kafka en production (distribution open-source, non-Confluent) au sein d'un environnement hautement réglementé.

L'écosystème repose sur des clients Python et C++ utilisant la bibliothèque (les clients Java et Kafka Streams ne sont pas du tout utilisés sur ce projet).

Ta Mission:

La plateforme rencontre actuellement plusieurs difficultés que vous devrez analyser :

  • Des pertes d'événements intermittentes.

  • Des pics de latence de queue (tail-latency) inexpliqués.

  • De fortes faiblesses dans la détection des incidents.

Votre rôle consistera à instrumenter la plateforme, mener l'enquête technique et concevoir des solutions pérennes.

Livrables attendus:

  • Un plan de remédiation priorisé.

  • Un cadre d'observabilité complet.

Profil recherché

  • Expérience : Plus de 10 ans sur des systèmes distribués, dont plus de 5 ans d'expertise approfondie sur Kafka en production, avec de fortes contraintes de fiabilité et de latence.

  • Méthodologie : Vous êtes un(e) investigateur/trice pragmatique basé(e) sur la preuve (vous instrumentez d'abord, vous émettez des hypothèses, et vous éliminez les pistes grâce aux données).

  • Profondeur technique : Vous êtes capable d'analyser les problèmes depuis la couche haute (Broker, JVM, Garbage Collector) jusqu'aux couches très basses (TCP, carte réseau, horloge).

Compétences Techniques Indispensables:

  • Maîtrise experte du troubleshooting Kafka en production.

  • Excellente maîtrise pratique de en Python et/ou C++ (une connaissance très fine des paramètres de configuration et du débogage est requise).

  • Optimisation (tuning) des brokers Kafka : JVM, GC (G1/ZGC), gestion de la mémoire Heap vs Page-cache, comportement de l'ISR sous stress.

  • Capacité à mener des investigations de pertes de données de bout en bout (ex: réconciliation d'offsets).

  • Création depuis zéro d'outils d'observabilité avec Prometheus et Grafana (développement d'exportateurs, dashboards, alertes).

  • Expérience préalable dans des environnements à faible latence ou réglementés (finance, trading, télécoms, etc.).

  • Protocoles de synchronisation : déploiement PTP et compréhension experte de la dérive d'horloge (clock skew).

  • Diagnostic réseau bas niveau : TCP, optimisation de la carte réseau (NIC) via / et analyse du page-cache du noyau.

  • Maîtrise des protocoles de sérialisation (Avro, Protobuf ou binaire sur mesure), gestion de l'évolution des schémas et détection des pertes silencieuses lors des échecs de décodage.

  • Expérience réussie dans des missions d'audit générant des plans d'action clairs, pouvant être directement exécutés par une équipe interne.

À propos de Collective.work

Collective.work est la plateforme de recrutement nouvelle génération pour trouver votre prochain emploi.

Fort d'une grande expertise dans l'IA, Collective.work permet de mieux cibler les offres et leurs candidats correspondants, créant ainsi un système beaucoup plus fluide que les acteurs traditionnels.

Plus de 10,000 recruteurs utilisent Collective, permettant à des dizaines de milliers de candidats de trouver leur futur emploi chaque jours

Faire de chaque avenir une réussite.
  • Annuaire emplois
  • Annuaire entreprises
  • Événements