Les offres de “Collective.work”

Nouveau Collective.work

Ingénieur de Production SRE (> 3a) – Observabilité & Fiabilité @ Orléans - Freelance

  • Freelance
  • Entre 7 et 12 mois
  • Orléans (Loiret)

Description de l'offre

Taux journalier (TJM): 415 € HT

Contexte & Enjeux

Dans le cadre du renforcement d'une équipe dédiée à l'Observabilité et à la Fiabilité du Système d'Information, nous recherchons un Ingénieur de Production expérimenté spécialisé en Site Reliability Engineering (SRE).

Vous intégrerez une équipe en charge de garantir la disponibilité, la performance, la résilience et l'observabilité d'un SI critique à grande échelle, composé de plusieurs milliers de serveurs, d'environnements conteneurisés et d'applications distribuées.

La mission s'inscrit dans une démarche d'amélioration continue visant à renforcer la qualité de service, automatiser les opérations de production et optimiser la supervision des plateformes.

Missions

Au sein de l'équipe Observabilité & Fiabilité, vous serez notamment en charge de :

  • Assurer le maintien en conditions opérationnelles des infrastructures, plateformes et services.

  • Garantir le respect des objectifs de disponibilité et de qualité de service.

  • Surveiller les environnements de production et assurer le diagnostic ainsi que la résolution des incidents.

  • Participer aux dispositifs d'astreinte (1 semaine sur 5 comprenant soirées, week-ends et jours fériés).

  • Analyser les événements de production, coordonner les interventions avec les différentes équipes techniques et assurer le suivi des incidents.

  • Anticiper les incidents grâce à l'analyse des tendances, des capacités et des signaux faibles.

  • Réaliser les analyses post-incidents (RCA) et piloter les actions de fiabilisation.

  • Concevoir, maintenir et faire évoluer les tableaux de bord, indicateurs et solutions d'observabilité.

  • Optimiser les mécanismes d'alerting afin de réduire le bruit opérationnel.

  • Participer aux cellules de crise et aux processus de gestion des incidents majeurs.

  • Contribuer à l'automatisation, à l'industrialisation et à la simplification des activités de production.

  • Rédiger et maintenir la documentation technique ainsi que les procédures d'exploitation.

  • Être force de proposition dans l'amélioration continue des pratiques de production.

Environnement technique

Supervision / Observabilité

  • Prometheus

  • Grafana

  • Centreon

  • Splunk

  • Tempo

Conteneurisation

  • Kubernetes

  • Docker

Systèmes

  • Linux

  • Windows

Bases de données

  • PostgreSQL

  • MariaDB

Middleware

  • JBoss

  • Spring Boot

Développement & Scripting

  • Python

  • Shell Linux

Architecture

  • Architectures distribuées

  • Microservices

  • Cloud / Hybrid Cloud

  • VMware

Méthodologies

  • Site Reliability Engineering (SRE)

  • ITIL

  • DevOps

  • Agile

Environnement de production

Le périmètre couvre notamment :

  • Environ 8 000 serveurs

  • Deux datacenters et un site de secours

  • Environ 160 applications Java

  • Environnements virtualisés VMware

  • Déploiements Kubernetes

  • Supervision 24/7

Astreinte :

  • 1 semaine sur 5

  • En semaine : 18h30 à 00h30

  • Week-end : 08h00 à 19h00

Informations complémentaires

  • Localisation : Saint-Jean-de-Braye (45)

  • Durée : 24 mois fermes renouvelables 12 mois

  • Charge estimée : environ 630 jours

  • Démarrage prévisionnel : Septembre 2026

Profil recherché

Profil recherché

Vous justifiez d'une expérience significative en ingénierie de production ou en Site Reliability Engineering et disposez des compétences suivantes :

Expertise technique

  • Maîtrise des pratiques SRE

  • Très bonne maîtrise des outils de supervision, monitoring, logs, métriques, traces et alerting

  • Solide expérience de Kubernetes et des environnements conteneurisés

  • Bonne connaissance des architectures distribuées et des microservices

  • Expérience des environnements Cloud et hybrides

  • Compétences en automatisation et pratiques DevOps

  • Bonne maîtrise du scripting Python et Shell Linux

  • Connaissance des environnements Linux, Windows, PostgreSQL, MariaDB, JBoss et Spring Boot

Compétences fonctionnelles

  • Diagnostic d'incidents complexes

  • Gestion des incidents majeurs

  • Analyse des causes racines (RCA)

  • Gestion des événements selon les pratiques ITIL/SRE

  • Forte autonomie

  • Excellentes qualités de communication écrites et orales

  • Esprit collaboratif

  • Capacité à documenter et formaliser les procédures

  • Force de proposition dans les démarches d'amélioration continue

À propos de Collective.work

Collective.work est la plateforme de recrutement nouvelle génération pour trouver votre prochain emploi.

Fort d'une grande expertise dans l'IA, Collective.work permet de mieux cibler les offres et leurs candidats correspondants, créant ainsi un système beaucoup plus fluide que les acteurs traditionnels.

Plus de 10,000 recruteurs utilisent Collective, permettant à des dizaines de milliers de candidats de trouver leur futur emploi chaque jours

Faire de chaque avenir une réussite.
  • Annuaire emplois
  • Annuaire entreprises
  • Événements