jobsswitzerland.ch
← Alle Stellen

Principal SRE Engineer

ID Quantique

Anstellung
Vollzeit
Ort
Geneva
Erstmals ausgeschrieben
Jetzt bewerben
ID Quantique (IDQ) als Teil von IONQ ist ein weltweit führendes Unternehmen in den Bereichen quantensichere Kommunikation und Quantendetektionssysteme. Wir bieten Lösungen zum Schutz von Regierungen, Telekommunikationsinfrastrukturen sowie Banken und Finanzinstituten vor der „Harvest-now, decrypt-later“-Bedrohung und liefern sowohl terrestrische als auch weltraumgestützte quantensichere Netzwerke im globalen Live-Betrieb. Unsere Quantum Detection Systems verschieben die Grenzen der Einzelphotonendetektion und ermöglichen Durchbrüche in der Quantenkommunikation, Sensorik, im Computing und in der ultra-sensitiven Bildgebung in Zusammenarbeit mit führenden Forschern und Technologieinnovatoren weltweit. Was Sie erwartet Das Platform Engineering Team baut, sichert und betreibt skalierbare Infrastrukturen, die cloudverwaltete SaaS-Produkte mit On-Premises-Komponenten unterstützen, die bei Kunden vor Ort eingesetzt werden. Als unser Principal Site Reliability Engineer übernehmen Sie die technische Leitung für die Zuverlässigkeit unserer globalen Plattform. Sie definieren die Strategie, die Standards und das Betriebsmodell, die hochverfügbare, belastbare und sichere Dienste gewährleisten, während Sie gleichzeitig hands-on bei der Entwicklung und dem Betrieb der Technologien bleiben, die unsere Produktionsumgebungen unterstützen. In enger Zusammenarbeit mit Architecture, DevSecOps, Cloud Operations und Product Development treiben Sie eine Kultur der Observability, Automatisierung und kontinuierlichen Verbesserung voran und stellen sicher, dass Probleme identifiziert und gelöst werden, bevor sie die Kunden beeinträchtigen. Definieren und leiten Sie die Zuverlässigkeitsstrategie für Tier 1 und Tier 2 Produktionsdienste, einschließlich Service-Level Objectives, Error Budgets, Observability, Resilienz, Disaster Recovery und Cloud-Sicherheit. Entwickeln und betreiben Sie Observability-Plattformen, leiten Sie Chaos Engineering und Disaster Recovery Initiativen, verbessern Sie die Zuverlässigkeit von PostgreSQL, Redis/Valkey, Kafka und OpenSearch und liefern Sie AI Ops-Funktionen, einschließlich prädiktiver Überwachung, automatisierter Behebung und Self-Healing. Leiten Sie die Reaktion auf Major Incidents, den On-Call-Betrieb und die globale Eskalation, während Sie Ingenieure mentorieren und Engineering-Standards etablieren, die in der gesamten Organisation übernommen werden. Was Sie tun werden Sie verantworten die Zuverlässigkeit, Resilienz und operative Exzellenz unserer Cloud-Plattform und Produktionsdienste, indem Sie Zuverlässigkeitsprinzipien in Architektur-Entscheidungen und das Plattformdesign einbetten. Sie etablieren Observability-Standards, die Metriken, Logs, Distributed Tracing und Profiling abdecken, während Sie Service-Level Objectives und Error Budgets über die Engineering-Teams hinweg steuern. Sie leiten das Resilience Engineering durch Chaos-Tests, Disaster Recovery Planung und validierte Failover-Übungen, teilen die Verantwortung für die Cloud-Sicherheit mit DevSecOps und stellen die Zuverlässigkeit unserer kritischen Daten- und Streaming-Plattformen sicher. Durch die Arbeit über mehrere Engineering-Disziplinen hinweg optimieren Sie auch die Plattform-Effizienz durch Automatisierung, KI-gesteuerte Operationen und kontinuierliche operative Verbesserung. Verantwortung für Produktionszuverlässigkeit, Observability, Service-Level Objectives, Error Budgets, Resilienz, Backup und Disaster Recovery, Cloud-Sicherheit und Plattform-Governance über alle kritischen Dienste hinweg. Leitung des Incident Command, der Kommunikation mit der Geschäftsführung, Post-Incident Reviews, des On-Call-Betriebs und der globalen Eskalation, während Sie prädiktive Überwachung, automatisierte Behebung und Self-Healing-Funktionen bereitstellen. Partnerschaft mit Architecture, DevSecOps, Cloud Operations und Product Development zur Etablierung von Engineering-Standards, Mentoring von Ingenieuren und Bereitstellung einer gemeinsamen Zuverlässigkeits-Roadmap. Was Sie mitbringen Sie sind eine erfahrene Führungspersönlichkeit im Bereich Site Reliability Engineering mit mehr als 15 Jahren Erfahrung im Production Engineering und aktueller Hands-on-Verantwortung für groß angelegte, fehlertolerante Produktionssysteme, die auf AWS oder GCP laufen. Sie haben erfolgreich Observability-Plattformen entworfen und betrieben, Service-Level Objective Programme implementiert und messbare Verbesserungen bei der Verfügbarkeit, Zuverlässigkeit und der Mean Time to Recovery erzielt. Sie haben hochkritische Produktionsvorfälle geleitet, Resilienztests sowie Disaster Recovery Übungen geplant und durchgeführt und Engineering-Praktiken über mehrere Teams hinweg durch technische Führung und Mentoring beeinflusst. 15+ Jahre Erfahrung im Production Engineering mit aktueller Hands-on-Verantwortung für groß angelegte, fehlertolerante Produktionssysteme auf AWS oder GCP, einschließlich der Verantwortung für Observability, Service-Level Objectives und Error Budgets. Nachgewiesene Erfahrung in der Leitung von Resilienz-Initiativen, validierten Disaster Recovery und Failover-Tests, zusammen mit der Beherrschung von hochkritischen Produktionsvorfällen und messbaren Zuverlässigkeitsverbesserungen. Demonstrierte technische Führung durch Architektur-Reviews, Governance, Mentoring, Coaching und Engineering-Standards, die über mehrere Teams und Dienste hinweg übernommen werden. Sie passen hervorragend, wenn Sie: Über tiefe Expertise in Cloud-Infrastruktur, Platform Engineering und Cloud-Sicherheit verfügen, mit praktischer Erfahrung in der Sicherung verteilter Produktionsumgebungen durch Cloud Security Posture Management, Runtime Vulnerability Detection und automatisierte Richtliniendurchsetzung. Verstehen, wie man Zuverlässigkeit, Sicherheit, Networking und operative Effizienz in großem Maßstab ausbalanciert. Sie haben Erfahrung in der Implementierung KI-gestützter operativer Fähigkeiten, der Anwendung von FinOps-Prinzipien zur Opti

Automatisch aus dem Original übersetzt.

Ausgeschrieben vor 6 Tagen

Ort

Auf Google Maps ansehen