đ Ă propos de Scalingo
Scalingo est une startup technologique en forte croissance. Notre plateforme cloud europĂ©enne, robuste et souveraine, libĂšre les Ă©quipes techniques des contraintes dâinfrastructure, pour leur permettre de se concentrer sur ce qui compte vraiment : crĂ©er, innover et dĂ©livrer.
Notre PaaS permet de dĂ©ployer et dâhĂ©berger facilement des applications web et des bases de donnĂ©es, sans avoir Ă gĂ©rer lâadministration systĂšme ou lâinfrastructure sous-jacente.
Nous accompagnons une grande diversitĂ© de clients â startups, scale-ups, grands groupes et institutions publiques â parmi lesquels le MinistĂšre de lâIntĂ©rieur ou ENGIE, avec une exigence Ă©levĂ©e en matiĂšre de fiabilitĂ©, de sĂ©curitĂ© et de qualitĂ© de service.
đŻ Ton rĂŽle chez Scalingo
En tant que Lead Site Reliability Engineer, tu occupes une position clĂ© Ă lâinterface des Ă©quipes dĂ©veloppement, infrastructure, sĂ©curitĂ© et support.
Ton rĂŽle est Ă la fois :
- technique, avec un fort impact sur la fiabilité et la performance de la plateforme,
- structurant, en faisant évoluer les pratiques et les outils SRE et au-delà .,
- fédérateur, en accompagnant et faisant monter en compétence une équipe SRE de 2 personnes.
Tu interviens aussi bien sur le fonctionnement quotidien de lâactivitĂ© SRE que sur les projets stratĂ©giques liĂ©s Ă la croissance de la plateforme. RĂ©fĂ©rent ou rĂ©fĂ©rente technique, tu incarnes les bonnes pratiques SRE et contribues Ă diffuser une culture de la fiabilitĂ©, de lâautomatisation et de lâexcellence opĂ©rationnelle au sein de Scalingo.
đ§© Pourquoi ce rĂŽle est essentiel
- Garantir la stabilité, la disponibilité et la résilience des systÚmes en production.
- Anticiper les défaillances et structurer des réponses efficaces aux incidents.
- Industrialiser et automatiser lâexploitation de la plateforme.
- Maintenir un haut niveau de qualité de service vis-à -vis de nos clients et de nos engagements contractuels (SLA).
Chaque amĂ©lioration que tu apportes contribue directement Ă la robustesse de la plateforme, Ă la rĂ©duction des incidents, Ă la maĂźtrise des coĂ»ts opĂ©rationnels et Ă lâaccompagnement de la croissance de Scalingo.
đ€ Organisation & Ă©volution
Rattaché directement à un Engineering Manager, tu exerces un leadership technique et opérationnel fort, sans responsabilité hiérarchique directe.
En raison de nos dĂ©marches de certifications relatives Ă la sĂ©curitĂ© des donnĂ©es, ce poste devra ĂȘtre basĂ© en France exclusivement.
Selon notre Career path, des évolutions professionnelles sont possibles vers une spécialisation technique ou managériale.
Vos missions
Leadership technique
- Ătre moteur dans lâorganisation du travail de lâĂ©quipe (processus, rituels, documentation).
- Accompagner prioriser, revoir des choix techniques et des implémentations.
- Contribuer Ă la montĂ©e en compĂ©tences les membres de lâĂ©quipe, en favorisant lâautonomie et la prise dâinitiative.
- Transmettre les bonnes pratiques SRE (fiabilitĂ©, observabilitĂ©, gestion dâincidents, automatisation).
- Porter la vision technique SRE et la décliner dans les projets structurants.
Fiabilisation et amélioration continue des services
- Analyser les performances, identifier les points de contention et proposer des amĂ©liorations pour optimiser lâutilisation des ressources et la montĂ©e en charge.
- DĂ©finir, mettre en place et amĂ©liorer les outils dâobservabilitĂ© (monitoring, mĂ©triques, logs, alerting), dans une approche proactive.
- RĂ©diger des processus dâexploitation, les maintenir et les faire Ă©voluer.
- Assurer une veille technologique continue afin de proposer des Ă©volutions pertinentes de lâinfrastructure.
Gestion des incidents
- Assurer une partie du support client de niveau 3, en lien avec les équipes support et selon les SLA.
- Participer activement Ă la gestion des incidents, ainsi qu'aux cycles d'astreintes (environ une demi-semaine toutes les trois semaines).
- Intervenir rapidement lors des incidents critiques afin dâen limiter lâimpact et dâassurer la continuitĂ© des services.
- Piloter et animer les rĂ©trospectives dâincidents (post-mortems), en identifiant les causes racines et en dĂ©finissant des actions correctives durables.
- Rédiger et publier les rapports post-mortem à la suite des incidents majeurs.
- Assurer la coordination et la communication de crise, en interne comme auprĂšs des clients.
SĂ©curitĂ©, conformitĂ© et continuitĂ© dâactivitĂ©
- Veiller au respect des engagements de service (SLA, RPO, RTO) sur le périmÚtre SRE.
- Mettre en place des indicateurs de mesure de la qualité des services (SLO).
- Contribuer activement à la conformité ISO 27001 et HDS : respect des processus, participation aux audits internes et externes.
- Planifier, exĂ©cuter et analyser les tests rĂ©guliers des dispositifs de continuitĂ© et de reprise dâactivitĂ© (PCA/PRA).
Collaboration interne et contribution transverse
- Collaborer Ă©troitement avec les Ă©quipes de dĂ©veloppement afin dâintĂ©grer les exigences dâexploitabilitĂ© (fiabilitĂ©, performance, sĂ©curitĂ© opĂ©rationnelle) dĂšs la conception.
- Ătre force de proposition auprĂšs des Ă©quipes Produit Engineering sur les sujets de fiabilitĂ©, dâexpĂ©rience client et des outils d'administration.
- Contribuer Ă la rĂ©daction, Ă la structuration et au maintien dâune documentation opĂ©rationnelle claire et Ă jour.
Vos compétences
đ Ce que tu sais faire en arrivant :
- Une solide expertise des environnements cloud et infrastructures distribuées, avec une culture forte de la haute disponibilité et de la fiabilité en production.
- Une maĂźtrise des pratiques dâobservabilitĂ© (logs, mĂ©triques, alerting) et une capacitĂ© de diagnostic structurĂ©e sur des incidents complexes.
- Une bonne compréhension des environnements conteneurisés et de leurs enjeux opérationnels.
- Des compétences confirmées en bases de données en production : fiabilité, sauvegardes, restauration, réplication et montée en charge.
- Une pratique de lâInfrastructure as Code et de lâautomatisation des environnements.
- Une sensibilité aux enjeux de sécurité opérationnelle.
- Une aisance dans lâutilisation des outils dâIntelligence Artificielle pour gagner en efficacitĂ© au quotidien.
- Une capacité à évoluer dans des contextes complexes, changeants ou incertains, avec rigueur et fiabilité.
- Une aisance dans la priorisation, y compris en situation dâincident.
- Une communication claire et structurée, un goût pour la collaboration transverse et le partage des connaissances.
- Une posture blameless, de la curiositĂ© technique, du sang-froid et une attention portĂ©e Ă lâimpact utilisateur.
- Une capacité à exercer un leadership technique, à transmettre et à faire progresser les pratiques collectives.
Avantages
- Full remote avec 1 déplacement par trimestre (Strasbourg ou autre ville)
- Evenéments d'entreprise : 1 Offsite annuel et des afterworks réguliers
- Prime de tĂ©lĂ©travail (57,60âŹ)
- Ticket Restaurant (11,52 ⏠par unité) et carte Swile avec ses avantages
- Horaires flexibles en convention de forfait horaires (RTT)
- Ordinateur portable sous Linux
- Budget d'équipements complémentaires (participation)
đ§ Processus de recrutement
- Call de prĂ©-qualification (30 min) : nous tâappelons pour te prĂ©senter lâoffre et la clarifier si besoin. Câest toi qui dĂ©cides si tu souhaites poursuivre lâĂ©tape suivante.
- Test de prĂ©-screening (30 min) : un test standardisĂ© de type QCM, Ă passer en ligne. Il nous permet dâĂ©valuer les candidatures de maniĂšre objective, en limitant les biais de recrutement. Une note minimale est requise pour passer cette Ă©tape.
- Test hard-skill (quelques heures) : un test technique Ă rĂ©aliser et Ă nous restituer Ă la date de ton choix dans un dĂ©lai de 7 jours, aprĂšs avoir pris connaissance des consignes. Lâobjectif est dâĂ©valuer tes compĂ©tences, tes habitudes et tes bonnes pratiques en lien avec le poste. Nous t'encouragerons Ă dĂ©montrer que tu sais utiliser le meilleur de l'I.A.
- Premier entretien structurĂ© â skill & aptitude fit (1h30) : un Ă©change avec les membres de lâĂ©quipe impliquĂ©s dans le recrutement, pour discuter de tes compĂ©tences et de ton expĂ©rience, et Ă©valuer leur adĂ©quation avec le poste.
- Second entretien structurĂ© â culture fit & confirmation mutuelle (1h30) : un entretien avec un co-fondateur ou un autre membre de lâĂ©quipe, afin de vĂ©rifier des deux cĂŽtĂ©s que nous avons envie de travailler ensemble.
đ± La vie chez Scalingo
Chez Scalingo, nous sommes un acteur technologique exigeant, au service aussi bien de startups que de grandes entreprises et dâinstitutions publiques, sans ĂȘtre une mĂ©ga-corporation. Cette position nous permet de conjuguer haut niveau dâexigence technique, impact concret et environnement de travail Ă taille humaine.
Nous cultivons une culture du no bullshit : nous faisons ce que nous disons, nous prenons la responsabilitĂ© de nos succĂšs comme de nos Ă©checs, et nous privilĂ©gions des Ă©changes honnĂȘtes et directs. LâamĂ©lioration continue fait partie de notre ADN : nous questionnons rĂ©guliĂšrement nos produits, nos pratiques et notre organisation pour progresser durablement.
Chez Scalingo, nous avançons ensemble. La collaboration, la confiance et le soutien mutuel sont au cĆur de notre maniĂšre de travailler. Nous Ă©vitons les silos et favorisons la transparence par dĂ©faut, afin que chacun puisse comprendre les enjeux, les dĂ©cisions et le travail des autres.
Nous accordons une grande importance Ă lâautonomie et Ă la responsabilitĂ©. Chacun est encouragĂ© Ă prendre des initiatives, Ă faire des choix Ă©clairĂ©s et Ă contribuer activement Ă lâĂ©volution de lâentreprise, avec un cadre managĂ©rial prĂ©sent et un suivi rĂ©gulier.
Enfin, nous croyons fermement Ă lâĂ©galitĂ© des opportunitĂ©s. Nous recrutons des personnes avant des CV, valorisons la diversitĂ© des parcours et veillons Ă crĂ©er un environnement respectueux, inclusif et Ă©quitable pour toutes et tous.