Land
Sektor
Beruf suchen
SRE-Ingenieur
Systemzuverlässigkeit und Infrastrukturautomatisierung in komplexen verteilten Produktionsumgebungen verbessern
40 000 – 95 000 EUR (€)
Gehalt / Jahr
Bachelor
Bildungsniveau
00
Automatisierung
Mittel
Schwierigkeit
Positiv
Beschäftigung
6-12 Monate
Marktanspannung
Mittel bis Hoch
Mobilität
Möglich
Automatisierung
Mittel
Schwierigkeit
Positiv
Beschäftigung
6-12 Monate
Marktanspannung
Mittel bis Hoch
Mobilität
Möglich
About
Ein SRE-Ingenieur (Site Reliability Engineer) arbeitet an der Schnittstelle zwischen Softwareentwicklung und IT-Betrieb in cloud-nativen oder hybriden Infrastrukturen. Er nutzt Werkzeuge wie Kubernetes, Terraform, Prometheus und CI/CD-Pipelines, um die Verfügbarkeit, Skalierbarkeit und Leistung von Produktionssystemen zu verbessern. Er arbeitet eng mit Entwicklungsteams, Platform-Engineers und Produktverantwortlichen zusammen, um Betriebsprozesse zu automatisieren und Ausfallzeiten systematisch zu reduzieren.
Kompetenzen
Technische Kompetenzen
- Erfahrung mit Kubernetes und Container-Orchestrierung
- Versiert in Terraform und Infrastructure-as-Code
- Kompetenz in Prometheus, Grafana, Loki (Observability)
- Optimierung von CI/CD-Pipelines (ArgoCD, GitHub Actions)
- Programmierung in Python, Go oder Bash
- Erfahrung in Linux-Systemadministration
- Kenntnisse in Cloud-Plattformen (AWS, GCP, Azure)
- Erfahrung in Incident Management und Post-Mortem-Methodik
Soft Skills
- Analytisches Denken bei komplexen Systemausfällen
- Eigenverantwortliches Handeln unter Zeitdruck
- Strukturierte Kommunikation mit technischen und nicht-technischen Teams
- Bereitschaft zur kontinuierlichen Weiterbildung in sich wandelnden Technologiefeldern
- Sorgfalt bei der Dokumentation und Prozessdefinition
Aufgaben
- Definieren und Überwachen von SLOs, SLIs und Error Budgets zur Messung der Systemzuverlässigkeit
- Automatisieren von Betriebsaufgaben mit Python, Go oder Bash zur Reduzierung von Toil um mindestens 30 %
- Entwerfen und Betreiben von Kubernetes-Clustern in Multi-Cloud-Umgebungen (AWS, GCP, Azure)
- Implementieren von Infrastructure-as-Code mit Terraform und Ansible für reproduzierbare Deployments
- Konfigurieren von Monitoring- und Alerting-Systemen mit Prometheus, Grafana und PagerDuty
- Analysieren von Produktionsvorfällen im Rahmen strukturierter Post-Mortem-Prozesse und Ableiten von Maßnahmen
- Optimieren von CI/CD-Pipelines mit GitHub Actions, ArgoCD oder Jenkins zur Verkürzung der Deployment-Zyklen
- Koordinieren von Incident-Response-Prozessen und Führen von On-Call-Rotationen im Team
- Bewerten und Reduzieren von Kapazitäts- und Latenzrisiken durch regelmäßige Load-Tests mit k6 oder Locust
- Dokumentieren von Runbooks und Betriebsstandards zur Wissensverteilung im Engineering-Team
Arbeitsumgebungen
Die Arbeitsumgebungen können variieren:
Scale-up und Tech-Unternehmen mit cloud-nativer Infrastruktur
Großunternehmen mit verteilten Produktionssystemen
Fintech- und E-Commerce-Plattformen mit hohen Verfügbarkeitsanforderungen
SaaS-Anbieter mit mehreren Mandanten und globaler Nutzerverteilung
Beratungsunternehmen mit DevOps-Praxis
Forschungs- und Medieninstitutionen mit datenintensiven Plattformen
Karrierewege
- Platform Engineer mit Fokus auf interne Entwicklerplattformen
- Staff oder Principal Engineer im Bereich Reliability
- Engineering Manager für SRE- oder DevOps-Teams
- Cloud Architect mit Spezialisierung auf Resilienzarchitekturen
- DevSecOps-Ingenieur mit Fokus auf Sicherheitsautomatisierung
Gesuchtes Profil
Erfahrung mit verteilten Systemen und Microservices
Fundierte Kenntnisse in Containerisierung und Orchestrierung
Nachweisbare Automatisierungsprojekte im Betriebsumfeld
Souveräner Umgang mit On Call-Verantwortung
Kompetenz in der Fehleranalyse und Prozessoptimierung
Wie werde ich SRE-Ingenieur?








