Logo-of-Ovhcloud-hiring-for-jobs-in-Canada-on-GrabJobs

Site Reliability Engineer

Job Description - Site Reliability Engineer


Ingénieur SRE / VMware 


 


Au sein de votre équipe #OneTeam


 


L’équipe est responsable de l’exploitation, de la fiabilité et de  l’amélioration continue des plateformes de virtualisation VMware ainsi  que des solutions de sauvegarde associées.


Dans un environnement orienté SRE et opérations cloud, l’équipe  assure la gestion des incidents, l’évolution des plateformes et la  fiabilité des services pour les solutions existantes, récentes et  futures.


 


Vous intégrerez une équipe responsable des produits :


 




  • Managed VMware vSphere




  • Public VCFaaS




  • Private VCFaaS




 


Votre rôle consistera à assurer la stabilité des plateformes,  contribuer à l’amélioration continue des services et participer aux  activités d’exploitation et d’automatisation.


 


Vos principales responsabilités


 




  • Assurer le suivi quotidien de l’incidentologie sur les produits VMware et les solutions de backup (Veeam)




  • Participer à la gestion et la résolution des incidents de niveau 3




  • Analyser les causes racines des incidents (RCA) et mettre en place les actions correctives nécessaires




  • Contribuer à l’amélioration du produit Managed VMware vSphere, notamment via le développement de correctifs et d’automatisations




  • Participer aux tâches de migration, de mise à jour et aux projets d’évolution des plateformes VMware




  • Développer et maintenir des scripts ou correctifs simples à intermédiaires afin de réduire la récurrence des incidents




  • Participer aux rotations d’astreinte afin d’assurer la continuité du service




  • Contribuer à l’automatisation et à l’amélioration des opérations via des outils CI/CD




  • Collaborer avec les équipes techniques dans un environnement Agile




  • Participer à l’amélioration continue des processus SRE et opérationnels 




 


Votre futur impact


 


Dans les 6 mois


 




  • Autonomie opérationnelle : gérer de façon indépendante les incidents  N3 sur vSphere et Public VCFaaS, incluant l'analyse de root cause et la  production de post-mortems.




  • Début des rotations d'astreintes. 




  • Développement : prendre en charge des correctifs de code de  complexité simple à intermédiaire (Go / Perl) sans supervision  systématique.




  • Documenter les problemes via jira et prendre en charge tout le cycle du jira de sa création a sa resolution.




  • Prompt engineering : appliquer des workflows IA efficaces en contexte SRE et partager ses pratiques avec l'équipe. 




 


Dans 1 an


 




  • Autonomie : gérer la majorité des incidents N3 de façon indépendante  sur l'ensemble du périmètre (vSphere, Public et Private VCFaaS, Veeam),  tout en ayant accès à du soutien au besoin.




  • Efficacité et qualité : atteindre constamment les indicateurs clés  de performance (KPI) liés à la fiabilité et à la satisfaction client.




  • Connaissance des produits : développer une connaissance approfondie  de l'ensemble du portfolio Cloud VMware et contribuer activement aux  projets d'amélioration du produit.




 


Compétences requises


 




  • Expérience dans un environnement d’exploitation ou SRE




  • Bonne compréhension des méthodologies SRE et des pratiques d’exploitation




  • Expérience avec les environnements de virtualisation VMware




  • Connaissance des solutions de backup Veeam




  • Compréhension des langages Go et Perl




  • Maîtrise des outils et pratiques CI/CD




  • Maîtrise du prompt engineering dans un contexte opérationnel :




  • rédaction de system prompts efficaces




  • structuration de conversations multi-tours




  • utilisation de techniques avancées (few-shot, chain-of-thought, self-consistency)




  • Capacité à analyser des incidents complexes et diagnostiquer les causes racines




  • Travail en équipe et expérience dans un environnement Agile




  • Capacité à évoluer dans un environnement d’incidentologie et de production




  • Bilinguisme est nécessaire afin de répondre à des demandes de soutien à l'international




 


Atouts


 




  • Expérience avec VMware Cloud Foundation (VCF) ou d’autres solutions de virtualisation




  • Expérience avec les technologies de sauvegarde Veeam




 


Informations complémentaires


 




  • Participation à une rotation d’astreinte afin d’assurer un service 24/7/365




 


 


xxx


Original job Site Reliability Engineer posted on GrabJobs ©. To flag any issues with this job please use the Report Job button on GrabJobs.
Share Job
Share Job

Similar Site Reliability Engineer Jobs in Canada

GrabJobs is the no1 job portal in Canada, connecting you to thousands of jobs fast! Find the best jobs in Canada, apply in 1 click and get a job today!

Mobile Apps

Copyright © 2026 Grabjobs Pte.Ltd. All Rights Reserved.