€70,000 - 102,000 yearly
Für unser Geschäftsfeld Omnichannel im Tribe Omnikanal, Portal und API Enabler (OMCOPA) suchen wir dich in Vollzeit als System Engineer/Site Reliability Engineer (m/w/d) in Aschheim, Karlsruhe bzw. Münster. Hier arbeitest du mit deinen Kolleg*innen standortübergreifend und mit vielfältigen, teilweise englischsprachigen Schnittstellen zusammen.
Deine Aufgaben mit Perspektiven
Du bist für die Einführung und Weiterentwicklung von SRE-/DevOps-Praktiken verantwortlich und berätst Entwicklungsteams auf dem Weg zu stabilen, produktionsreifen Services.
Du stellst die Systemstabilität durch Observability, Monitoring, Alerting und Kapazitätsbetrachtungen sicher, z. B. mit Prometheus, Grafana oder Dynatrace.
Du unterstützt den zuverlässigen Betrieb cloudnativer Anwendungen auf Kubernetes, insbesondere im Umfeld von Google Cloud Platform und Google Kubernetes Engine.
Du analysierst Störungen im 2nd-/3rd-Level-Support, unterstützt die Incident Response und etablierst gemeinsam mit dem Team blameless Post-Mortem-Analysen, um systematisch aus Incidents zu lernen und nachhaltige Verbesserungen abzuleiten.
Du arbeitest mit dem Team an der Optimierung von Betriebsprozessen, Runbooks, Automatisierungen und Standards zur Reduktion von Toil sowie zur Steigerung von Verfügbarkeit und Kundenzufriedenheit.
Du berücksichtigst betriebliche Security- und Compliance-Anforderungen im Rahmen von Production Readiness, Zugriffen, Runbooks und Incident-Prozessen.
Deine Persönlichkeit mit Profil
Du hast ein abgeschlossenes Studium der Informatik sowie mehrjährige einschlägige Berufserfahrung oder eine vergleichbare Qualifikation.
Du besitzt praktische Erfahrung im stabilen Betrieb, in der Skalierung und in der Fehleranalyse produktionskritischer Anwendungen.
Du bringst fundierte Kenntnisse in SRE-/DevOps-Methoden, Observability, Monitoring, Incident Response, SLIs, SLOs, Error Budgets und Toil Reduction mit und hast Erfahrung in der Zusammenarbeit mit agilen Entwicklungsteams.
Du hast praktische Erfahrung mit Google Cloud Platform und Google Kubernetes Engine oder bringst fundierte Erfahrung mit Kubernetes in produktionskritischen Cloud-Umgebungen mit.
Du verfügst über Kenntnisse in Automatisierung, Infrastructure as Code und Script- oder Programmiersprachen wie Bash, Python, Go, Node.js oder vergleichbaren Technologien sowie über Erfahrung mit Git.
Du kannst Entwicklungsteams methodisch und technisch beraten, komplexe Zusammenhänge verständlich erklären und auch in kritischen Situationen strukturiert handeln.
Du verstehst SRE nicht nur als Tooling- oder Betriebsrolle, sondern als Ansatz, um Entwicklungsteams zu befähigen und Services nachhaltig zuverlässiger zu machen.
Du verfügst über verhandlungssichere Deutschkenntnisse mindestens auf C1-Niveau und gute Englischkenntnisse mindestens auf B2-Niveau.
Du zeichnest dich durch Teamfähigkeit, analytisches Denken, Kommunikationsstärke, Eigeninitiative und eine selbständige Arbeitsweise aus.
Neben einem attraktiven Tarifgehalt und 30 Tagen Urlaub bieten wir dir folgende Benefits:
Copyright © 2026 Grabjobs Pte.Ltd. All Rights Reserved.