Senior Kubernetes Platform Engineer / DevOps Engineer
prostaff · Zürich, Switzerland
About The Role
Für den Betrieb und die Weiterentwicklung einer modernen Kubernetes-basierten Plattform suchen wir einen erfahrenen Senior Kubernetes Platform Engineer. Zu deinen Hauptaufgaben gehören: Betrieb, Überwachung und kontinuierliche Optimierung einer Kubernetes-basierten Plattform sowie der darauf betriebenen Managed Services wie MongoDB, PostgreSQL und Kafka Sicherstellung von Hochverfügbarkeit, Skalierbarkeit und Ausfallsicherheit der Plattform Proaktives Monitoring, Alerting sowie Incident- und Problem-Management Durchführung und Automatisierung von Day-2-Operations wie Upgrades, Patches, Backup & Restore sowie Capacity Management Analyse komplexer Störungen und Durchführung von Root-Cause-Analysen in produktionsnahen Umgebungen Aufbau, Pflege und Weiterentwicklung der Observability-Landschaft mit Prometheus, Grafana sowie ELK/OpenSearch Automatisierung wiederkehrender Betriebsaufgaben Zusammenarbeit mit Engineering-Teams zur kontinuierlichen Verbesserung von Betriebsprozessen, Runbooks und Automatisierungen Unterstützung bei der Stabilisierung und Optimierung bestehender Plattformen und Services Teilnahme am Pikett-Dienst zur Sicherstellung eines zuverlässigen 24/7-Betriebs Abgeschlossene Ausbildung oder Studium in Informatik, beispielsweise Universität, FH, HF oder EFZ, beziehungsweise eine vergleichbare Weiterbildung Mehrjährige Berufserfahrung im Betrieb produktionskritischer IT-Infrastrukturen Sehr gute praktische Kenntnisse mit Kubernetes Fundierte Erfahrung im Betrieb containerbasierter Plattformen und Services Sehr gute Linux- und System-Engineering-Kenntnisse Erfahrung mit Observability und Monitoring, insbesondere: Prometheus Grafana ELK oder OpenSearch Erfahrung mit Infrastructure as Code und Automatisierung, beispielsweise: Terraform Ansible Helm Gute Kenntnisse moderner CI/CD- und DevOps-Werkzeuge wie: GitLab Git Docker Betriebserfahrung mit mindestens einer der folgenden Technologien: MongoDB PostgreSQL Kafka Erfahrung mit Incident Management, Troubleshooting und strukturierter Root-Cause-Analyse Fähigkeit, sich schnell in bestehende und komplexe Infrastrukturumgebungen einzuarbeiten Selbstständige, strukturierte und lösungsorientierte Arbeitsweise Belastbarkeit und souveränes Verhalten auch bei kritischen Produktionsstörungen Teamfähigkeit sowie Erfahrung mit agilen und Lean-orientierten Arbeitsweisen
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring