Ingénieur de Production SRE (> 3a) – Observabilité & Fiabilité @ Orléans - Freelance
Freelance Entre 7 et 12 mois Orléans (Loiret)
Description de l'offre
Taux journalier (TJM): 415 € HT
Contexte & Enjeux
Dans le cadre du renforcement d'une équipe dédiée à l'Observabilité et à la Fiabilité du Système d'Information, nous recherchons un Ingénieur de Production expérimenté spécialisé en Site Reliability Engineering (SRE).
Vous intégrerez une équipe en charge de garantir la disponibilité, la performance, la résilience et l'observabilité d'un SI critique à grande échelle, composé de plusieurs milliers de serveurs, d'environnements conteneurisés et d'applications distribuées.
La mission s'inscrit dans une démarche d'amélioration continue visant à renforcer la qualité de service, automatiser les opérations de production et optimiser la supervision des plateformes.
Missions
Au sein de l'équipe Observabilité & Fiabilité, vous serez notamment en charge de :
Assurer le maintien en conditions opérationnelles des infrastructures, plateformes et services.
Garantir le respect des objectifs de disponibilité et de qualité de service.
Surveiller les environnements de production et assurer le diagnostic ainsi que la résolution des incidents.
Participer aux dispositifs d'astreinte (1 semaine sur 5 comprenant soirées, week-ends et jours fériés).
Analyser les événements de production, coordonner les interventions avec les différentes équipes techniques et assurer le suivi des incidents.
Anticiper les incidents grâce à l'analyse des tendances, des capacités et des signaux faibles.
Réaliser les analyses post-incidents (RCA) et piloter les actions de fiabilisation.
Concevoir, maintenir et faire évoluer les tableaux de bord, indicateurs et solutions d'observabilité.
Optimiser les mécanismes d'alerting afin de réduire le bruit opérationnel.
Participer aux cellules de crise et aux processus de gestion des incidents majeurs.
Contribuer à l'automatisation, à l'industrialisation et à la simplification des activités de production.
Rédiger et maintenir la documentation technique ainsi que les procédures d'exploitation.
Être force de proposition dans l'amélioration continue des pratiques de production.
Environnement technique
Supervision / Observabilité
Prometheus
Grafana
Centreon
Splunk
Tempo
Conteneurisation
Kubernetes
Docker
Systèmes
Linux
Windows
Bases de données
PostgreSQL
MariaDB
Middleware
JBoss
Spring Boot
Développement & Scripting
Python
Shell Linux
Architecture
Architectures distribuées
Microservices
Cloud / Hybrid Cloud
VMware
Méthodologies
Site Reliability Engineering (SRE)
ITIL
DevOps
Agile
Environnement de production
Le périmètre couvre notamment :
Environ 8 000 serveurs
Deux datacenters et un site de secours
Environ 160 applications Java
Environnements virtualisés VMware
Déploiements Kubernetes
Supervision 24/7
Astreinte :
1 semaine sur 5
En semaine : 18h30 à 00h30
Week-end : 08h00 à 19h00
Informations complémentaires
Localisation : Saint-Jean-de-Braye (45)
Durée : 24 mois fermes renouvelables 12 mois
Charge estimée : environ 630 jours
Démarrage prévisionnel : Septembre 2026
Profil recherché
Profil recherché
Vous justifiez d'une expérience significative en ingénierie de production ou en Site Reliability Engineering et disposez des compétences suivantes :
Expertise technique
Maîtrise des pratiques SRE
Très bonne maîtrise des outils de supervision, monitoring, logs, métriques, traces et alerting
Solide expérience de Kubernetes et des environnements conteneurisés
Bonne connaissance des architectures distribuées et des microservices
Expérience des environnements Cloud et hybrides
Compétences en automatisation et pratiques DevOps
Bonne maîtrise du scripting Python et Shell Linux
Connaissance des environnements Linux, Windows, PostgreSQL, MariaDB, JBoss et Spring Boot
Compétences fonctionnelles
Diagnostic d'incidents complexes
Gestion des incidents majeurs
Analyse des causes racines (RCA)
Gestion des événements selon les pratiques ITIL/SRE
Forte autonomie
Excellentes qualités de communication écrites et orales
Esprit collaboratif
Capacité à documenter et formaliser les procédures
Force de proposition dans les démarches d'amélioration continue
À propos de Collective.work
Collective.work est la plateforme de recrutement nouvelle génération pour trouver votre prochain emploi.
Fort d'une grande expertise dans l'IA, Collective.work permet de mieux cibler les offres et leurs candidats correspondants, créant ainsi un système beaucoup plus fluide que les acteurs traditionnels.
Plus de 10,000 recruteurs utilisent Collective, permettant à des dizaines de milliers de candidats de trouver leur futur emploi chaque jours