Schwarz Group
Posted 7mo ago

(Senior) Site Reliability Engineer / Distributed Cloud - STACKIT (m/w/d) (Heilbronn, BW, DE, 74076)

Schwarz Group
Heilbronn, Baden-Wurttemberg, Germany
OnsiteFull Time
Responsibilities
  • Operate platforms
  • Monitor systems
  • Define SLOs
Requirements
  • 2+ years SRE/DevOps experience
  • Kubernetes and virtualization
  • Golang or similar systems language
  • Completed IT-related degree
Technical tools mentioned
KubernetesKubeVirtCiliumCephTalosGolang

Job description

Einleitungstext

Du willst mit uns STACKITEERs die Cloud-Welt im Sturm erobern und mit uns die Zukunft Europas gestalten? Prima! Dann bist du bei STACKIT genau richtig. Unsere Vision ist ambitioniert: Ein unabhängiges Europa - digital, führend. Als Cloud- und Colocation-Provider bauen wir die sichere Infrastruktur dafür. Mit unseren Serverstandorten ausschließlich in Deutschland und Österreich bieten wir sowohl der Schwarz Gruppe, zu der wir gehören, als auch externen Kunden eine europäische Alternative zu den internationalen Cloud-Anbietern und unterstützen unsere Kunden mit individuellen Lösungen ganzheitlich.

Als engagierter STACKITEER bist du Teil des Geschäftsbereichs STACKIT Products. Hier werden unsere Produkte und Services entwickelt, getestet und verbessert. 

Deine Aufgaben

  • Du betreibst und optimierst unsere hochkomplexen Plattformen (Kubernetes, KubeVirt, Cilium, Ceph, Talos) sowie die zugrundeliegende Infrastruktur mit dem Fokus auf End-to-End-Stabilität, Skalierbarkeit und Kosten.
  • Du entwickelst und pflegst unsere Monitoring- und Logging-Systeme (Metrics, Logs, Traces), um jederzeit tiefgreifende Einblicke in den Systemzustand zu gewährleisten und proaktiv Engpässe zu erkennen.
  • Du implementierst konsequentes Synthetic Monitoring und Tracetests, um die End-to-End-Funktionalität kritischer Services kontinuierlich zu validieren.
  • Du definierst und überwachst klare Service Level Objectives (SLOs) und reduzierst 'Toil' konsequent durch Code. Runbooks sind für dich nur die letzte Verteidigungslinie.
  • Du dokumentierst deine Arbeit nachvollziehbar, denn das beste System ist wertlos ohne ein gutes Markdown.

Dein Profil

  • Du hast ein abgeschlossenes Studium in Informatik oder einem verwandten Fachgebiet. 
  • Mindestens 2 Jahre aktive Erfahrung als SRE/DevOps Engineer, wo du gelernt hast, dass 'Works on my machine' keine Antwort ist. 
  • Fundierte Erfahrung im Betrieb von Cloud-Infrastrukturen mit Kubernetes und/oder Virtualisierungstechnologien. 
  • Du hast gute Kenntnisse in der Softwareentwicklung mit Golang oder einer vergleichbaren Systemsprache und nutzt diese, um Abläufe zu automatisieren und eigene Tools zu bauen.

About Schwarz Group

International retail group operating Lidl, Kaufland, and cloud services.

Similar jobs

Site Reliability Engineer roles near Heilbronn, Baden-Wurttemberg
3d
Save
Mark Applied
Hide
Senior Site Reliability Engineer (all genders)
Berlin or Munich or Pforzheim or Stockholm
HybridFull Time
FactFinder
FactFinder: AI-powered product discovery and search platform for online shops.
SRE or infrastructure experience, Kubernetes, observability, incident management, GitOps, autoscaling, networking, automation, AI tools, and fluent English; German is a plus.
Kubernetes, Harvester, Argo CD, Flux, GitOps, KubeVirt, vSphere/ESXi, OpenStack, Longhorn, Ceph, HPA, VPA, KEDA, VLAN
4d
Save
Mark Applied
Hide
Site Reliability Engineer (m/w/d) - AI Healthcare Infrastructure
Karlsruhe, Baden-Württemberg, Germany
€75k-€95k/yr HybridFull Time
Mediform
Mediform: AI-powered autonomous telephone assistants for medical practices.
3+ YOETypically 3–6 years of production experience in DevOps, SRE, backend, or infrastructure engineering; hands-on distributed-systems troubleshooting, coding, IaC, automation, and excellent English.
AWS, Kubernetes, Amazon EKS, Amazon EC2, Amazon RDS, PostgreSQL, Prometheus, Grafana, Loki, Sentry, Linux, Infrastructure as Code, SIP, RTP
2w
Save
Mark Applied
Hide
Team Lead - Site Reliability Engineering (all genders)
Berlin or Munich or Pforzheim or Stockholm
HybridFull Time
FactFinder
FactFinder: AI-powered product discovery and search for e-commerce.
5+ YOE5+ years infrastructure/platform experience; production Kubernetes expertise; hands-on with Harvester or similar HCI; experience migrating VMs to k8s; people leadership and stakeholder management; fluent English.
Kubernetes, Harvester, Longhorn, VLAN, GitOps, Argo CD, Flux, NG Search Operator, HPA, VPA, KEDA, cluster autoscaler, KubeVirt, vSphere/ESXi, OpenStack
3w
Save
Mark Applied
Hide
Site Reliability Engineer (m/f/x)
Karlsruhe, Baden-Württemberg, Germany
HybridFull Time
Tipico
Tipico: Provides sports betting and online casino gaming services.
2+ YOEBachelor's in computer science or equivalent,2+ years related experience,programming in Java/JavaScript/Python,AWS and Kubernetes experience,CI/CD and Terraform proficiency,fluent English.
Java, JavaScript, Python, AWS, Kubernetes, GitHub Actions, Terraform
3w
Save
Mark Applied
Hide
Site Reliability Engineer (SRE) / DevOps Engineer (m/w/d)
Göttingen or Mannheim or Halle (Saale) or Atlanta
HybridFull Time
eddyson
eddyson: Provides cloud-based electronic data interchange software for businesses.
5+ YOEDegree in (business) informatics or equivalent experience, 5+ years SRE/DevOps experience, experience with Azure or AWS, Kubernetes, Terraform, Ansible, CI/CD (GitLab), Grafana/Datadog, Linux and Bash/Python, on-call availability, fluent German C1.
Azure, AWS, Kubernetes, Terraform, Ansible, GitLab, Grafana, Datadog, Linux, Bash, Python
1mo
Save
Mark Applied
Hide
Senior Site Reliability Engineer, Vehicle SW
Leonberg, Baden-Württemberg, Germany
HybridFull Time
Wayve
Wayve: Develops end-to-end artificial intelligence for autonomous driving systems.
Proven SRE or production reliability experience for distributed systems; strong Linux, CI/CD, Docker, Kubernetes skills; programming in Python, C++ or Rust; observability and incident leadership experience.
Linux, CI/CD, Docker, Kubernetes, Python, C++, Rust, Datadog, Prometheus, Grafana, OpenTelemetry, Splunk, Humio, AWS, GCP, Azure
1mo
Save
Mark Applied
Hide
Senior Site Reliability Engineer, Vehicle SW
Leonberg, Baden-Württemberg, Germany
HybridFull Time
Wayve
Wayve: Develops AI software for autonomous vehicle navigation.
Proven SRE/production reliability experience for distributed systems; strong Linux, CI/CD, Docker, Kubernetes; proficiency in Python, C++, or Rust; observability tooling experience; incident leadership and communication skills.
Linux, CI/CD, Docker, Kubernetes, Python, C++, Rust, Datadog, Prometheus, Grafana, OpenTelemetry, Splunk, Humio, AWS, GCP, Azure
1mo
Save
Mark Applied
Hide
Site Reliability Engineer (m/w/d)*
Stuttgart, Baden-Württemberg, Germany
HybridFull Time
Scalian
Scalian: Consulting firm specializing in digital transformation and engineering services.
5+ YOE3–7 years operating critical platforms, strong Kubernetes and observability experience, monitoring/logging/alerting and incident response skills, German (fluent) and English (good).
Kubernetes