Lead Site Reliability Engineer - Cloud - Remote - F/H

 Posted 2 days ago
  
 France
  
 â‚Ź60000 - €70000 per year
  
⭐ 5-10 years experience
Apply Now

Please mention DailyRemote when applying

AI Summary

The Lead SRE will oversee the stability, performance, and scalability of the cloud platform while providing technical leadership to the SRE team. Responsibilities include managing incidents, automating infrastructure, and ensuring compliance with security standards like ISO 27001.

🌍 À propos de Scalingo

Scalingo est une startup technologique en forte croissance. Notre plateforme cloud europĂ©enne, robuste et souveraine, libĂšre les Ă©quipes techniques des contraintes d’infrastructure, pour leur permettre de se concentrer sur ce qui compte vraiment : crĂ©er, innover et dĂ©livrer.

Notre PaaS permet de dĂ©ployer et d’hĂ©berger facilement des applications web et des bases de donnĂ©es, sans avoir Ă  gĂ©rer l’administration systĂšme ou l’infrastructure sous-jacente.

Nous accompagnons une grande diversitĂ© de clients — startups, scale-ups, grands groupes et institutions publiques — parmi lesquels le MinistĂšre de l’IntĂ©rieur ou ENGIE, avec une exigence Ă©levĂ©e en matiĂšre de fiabilitĂ©, de sĂ©curitĂ© et de qualitĂ© de service.

🎯 Ton rîle chez Scalingo

En tant que Lead Site Reliability Engineer, tu occupes une position clĂ© Ă  l’interface des Ă©quipes dĂ©veloppement, infrastructure, sĂ©curitĂ© et support.

Ton rĂŽle est Ă  la fois :

  • technique, avec un fort impact sur la fiabilitĂ© et la performance de la plateforme,
  • structurant, en faisant Ă©voluer les pratiques et les outils SRE et au-delĂ .,
  • fĂ©dĂ©rateur, en accompagnant et faisant monter en compĂ©tence une Ă©quipe SRE de 2 personnes.

Tu interviens aussi bien sur le fonctionnement quotidien de l’activitĂ© SRE que sur les projets stratĂ©giques liĂ©s Ă  la croissance de la plateforme. RĂ©fĂ©rent ou rĂ©fĂ©rente technique, tu incarnes les bonnes pratiques SRE et contribues Ă  diffuser une culture de la fiabilitĂ©, de l’automatisation et de l’excellence opĂ©rationnelle au sein de Scalingo.

đŸ§© Pourquoi ce rĂŽle est essentiel

  • Garantir la stabilitĂ©, la disponibilitĂ© et la rĂ©silience des systĂšmes en production.
  • Anticiper les dĂ©faillances et structurer des rĂ©ponses efficaces aux incidents.
  • Industrialiser et automatiser l’exploitation de la plateforme.
  • Maintenir un haut niveau de qualitĂ© de service vis-Ă -vis de nos clients et de nos engagements contractuels (SLA).

Chaque amĂ©lioration que tu apportes contribue directement Ă  la robustesse de la plateforme, Ă  la rĂ©duction des incidents, Ă  la maĂźtrise des coĂ»ts opĂ©rationnels et Ă  l’accompagnement de la croissance de Scalingo.

đŸ€ Organisation & Ă©volution

Rattaché directement à un Engineering Manager, tu exerces un leadership technique et opérationnel fort, sans responsabilité hiérarchique directe.

En raison de nos dĂ©marches de certifications relatives Ă  la sĂ©curitĂ© des donnĂ©es, ce poste devra ĂȘtre basĂ© en France exclusivement.

Selon notre Career path, des évolutions professionnelles sont possibles vers une spécialisation technique ou managériale.

Vos missions

Leadership technique

  • Être moteur dans l’organisation du travail de l’équipe (processus, rituels, documentation).
  • Accompagner prioriser, revoir des choix techniques et des implĂ©mentations.
  • Contribuer Ă  la montĂ©e en compĂ©tences les membres de l’équipe, en favorisant l’autonomie et la prise d’initiative.
  • Transmettre les bonnes pratiques SRE (fiabilitĂ©, observabilitĂ©, gestion d’incidents, automatisation).
  • Porter la vision technique SRE et la dĂ©cliner dans les projets structurants.

Fiabilisation et amélioration continue des services

  • Analyser les performances, identifier les points de contention et proposer des amĂ©liorations pour optimiser l’utilisation des ressources et la montĂ©e en charge.
  • DĂ©finir, mettre en place et amĂ©liorer les outils d’observabilitĂ© (monitoring, mĂ©triques, logs, alerting), dans une approche proactive.
  • RĂ©diger des processus d’exploitation, les maintenir et les faire Ă©voluer.
  • Assurer une veille technologique continue afin de proposer des Ă©volutions pertinentes de l’infrastructure.

Gestion des incidents

  • Assurer une partie du support client de niveau 3, en lien avec les Ă©quipes support et selon les SLA.
  • Participer activement Ă  la gestion des incidents, ainsi qu'aux cycles d'astreintes (environ une demi-semaine toutes les trois semaines).
  • Intervenir rapidement lors des incidents critiques afin d’en limiter l’impact et d’assurer la continuitĂ© des services.
  • Piloter et animer les rĂ©trospectives d’incidents (post-mortems), en identifiant les causes racines et en dĂ©finissant des actions correctives durables.
  • RĂ©diger et publier les rapports post-mortem Ă  la suite des incidents majeurs.
  • Assurer la coordination et la communication de crise, en interne comme auprĂšs des clients.

SĂ©curitĂ©, conformitĂ© et continuitĂ© d’activitĂ©

  • Veiller au respect des engagements de service (SLA, RPO, RTO) sur le pĂ©rimĂštre SRE.
  • Mettre en place des indicateurs de mesure de la qualitĂ© des services (SLO).
  • Contribuer activement Ă  la conformitĂ© ISO 27001 et HDS : respect des processus, participation aux audits internes et externes.
  • Planifier, exĂ©cuter et analyser les tests rĂ©guliers des dispositifs de continuitĂ© et de reprise d’activitĂ© (PCA/PRA).

Collaboration interne et contribution transverse

  • Collaborer Ă©troitement avec les Ă©quipes de dĂ©veloppement afin d’intĂ©grer les exigences d’exploitabilitĂ© (fiabilitĂ©, performance, sĂ©curitĂ© opĂ©rationnelle) dĂšs la conception.
  • Être force de proposition auprĂšs des Ă©quipes Produit Engineering sur les sujets de fiabilitĂ©, d’expĂ©rience client et des outils d'administration.
  • Contribuer Ă  la rĂ©daction, Ă  la structuration et au maintien d’une documentation opĂ©rationnelle claire et Ă  jour.

Vos compétences

🔎 Ce que tu sais faire en arrivant :

  • Une solide expertise des environnements cloud et infrastructures distribuĂ©es, avec une culture forte de la haute disponibilitĂ© et de la fiabilitĂ© en production.
  • Une maĂźtrise des pratiques d’observabilitĂ© (logs, mĂ©triques, alerting) et une capacitĂ© de diagnostic structurĂ©e sur des incidents complexes.
  • Une bonne comprĂ©hension des environnements conteneurisĂ©s et de leurs enjeux opĂ©rationnels.
  • Des compĂ©tences confirmĂ©es en bases de donnĂ©es en production : fiabilitĂ©, sauvegardes, restauration, rĂ©plication et montĂ©e en charge.
  • Une pratique de l’Infrastructure as Code et de l’automatisation des environnements.
  • Une sensibilitĂ© aux enjeux de sĂ©curitĂ© opĂ©rationnelle.
  • Une aisance dans l’utilisation des outils d’Intelligence Artificielle pour gagner en efficacitĂ© au quotidien.
  • Une capacitĂ© Ă  Ă©voluer dans des contextes complexes, changeants ou incertains, avec rigueur et fiabilitĂ©.
  • Une aisance dans la priorisation, y compris en situation d’incident.
  • Une communication claire et structurĂ©e, un goĂ»t pour la collaboration transverse et le partage des connaissances.
  • Une posture blameless, de la curiositĂ© technique, du sang-froid et une attention portĂ©e Ă  l’impact utilisateur.
  • Une capacitĂ© Ă  exercer un leadership technique, Ă  transmettre et Ă  faire progresser les pratiques collectives.

Avantages

  • Full remote avec 1 dĂ©placement par trimestre (Strasbourg ou autre ville)
  • EvenĂ©ments d'entreprise : 1 Offsite annuel et des afterworks rĂ©guliers
  • Prime de tĂ©lĂ©travail (57,60€)
  • Ticket Restaurant (11,52 € par unitĂ©) et carte Swile avec ses avantages
  • Horaires flexibles en convention de forfait horaires (RTT)
  • Ordinateur portable sous Linux
  • Budget d'Ă©quipements complĂ©mentaires (participation)

🧭 Processus de recrutement

  • Call de prĂ©-qualification (30 min) : nous t’appelons pour te prĂ©senter l’offre et la clarifier si besoin. C’est toi qui dĂ©cides si tu souhaites poursuivre l’étape suivante.
  • Test de prĂ©-screening (30 min) : un test standardisĂ© de type QCM, Ă  passer en ligne. Il nous permet d’évaluer les candidatures de maniĂšre objective, en limitant les biais de recrutement. Une note minimale est requise pour passer cette Ă©tape.
  • Test hard-skill (quelques heures) : un test technique Ă  rĂ©aliser et Ă  nous restituer Ă  la date de ton choix dans un dĂ©lai de 7 jours, aprĂšs avoir pris connaissance des consignes. L’objectif est d’évaluer tes compĂ©tences, tes habitudes et tes bonnes pratiques en lien avec le poste. Nous t'encouragerons Ă  dĂ©montrer que tu sais utiliser le meilleur de l'I.A.
  • Premier entretien structurĂ© – skill & aptitude fit (1h30) : un Ă©change avec les membres de l’équipe impliquĂ©s dans le recrutement, pour discuter de tes compĂ©tences et de ton expĂ©rience, et Ă©valuer leur adĂ©quation avec le poste.
  • Second entretien structurĂ© – culture fit & confirmation mutuelle (1h30) : un entretien avec un co-fondateur ou un autre membre de l’équipe, afin de vĂ©rifier des deux cĂŽtĂ©s que nous avons envie de travailler ensemble.

đŸŒ± La vie chez Scalingo

Chez Scalingo, nous sommes un acteur technologique exigeant, au service aussi bien de startups que de grandes entreprises et d’institutions publiques, sans ĂȘtre une mĂ©ga-corporation. Cette position nous permet de conjuguer haut niveau d’exigence technique, impact concret et environnement de travail Ă  taille humaine.

Nous cultivons une culture du no bullshit : nous faisons ce que nous disons, nous prenons la responsabilitĂ© de nos succĂšs comme de nos Ă©checs, et nous privilĂ©gions des Ă©changes honnĂȘtes et directs. L’amĂ©lioration continue fait partie de notre ADN : nous questionnons rĂ©guliĂšrement nos produits, nos pratiques et notre organisation pour progresser durablement.

Chez Scalingo, nous avançons ensemble. La collaboration, la confiance et le soutien mutuel sont au cƓur de notre maniĂšre de travailler. Nous Ă©vitons les silos et favorisons la transparence par dĂ©faut, afin que chacun puisse comprendre les enjeux, les dĂ©cisions et le travail des autres.

Nous accordons une grande importance Ă  l’autonomie et Ă  la responsabilitĂ©. Chacun est encouragĂ© Ă  prendre des initiatives, Ă  faire des choix Ă©clairĂ©s et Ă  contribuer activement Ă  l’évolution de l’entreprise, avec un cadre managĂ©rial prĂ©sent et un suivi rĂ©gulier.

Enfin, nous croyons fermement Ă  l’égalitĂ© des opportunitĂ©s. Nous recrutons des personnes avant des CV, valorisons la diversitĂ© des parcours et veillons Ă  crĂ©er un environnement respectueux, inclusif et Ă©quitable pour toutes et tous.

Similar Jobs

See all Remote Software Development jobs →

Personalize your Remote Job Search in 3 Easy Steps!

Discover remote opportunities in Site Reliability Engineer

Answer easy questions

Answer easy questions

200,000+ jobs across 15+ categories

Get your best job matches

Get your best job matches

Only hand-screened, legit jobs

Find a remote job faster

Find a remote job faster

No ads, scams, or junk

I was the first applicant for a remote marketing position that got listed on the company website the same day I applied. Had an interview within 48 hours!

Sarah J. — Sarah J. · Marketing Manager ★★★★★ Verified