Sr. Staff Technical Program Manager - Reliability
- Anstellung
- Vollzeit
- Ort
- Bellevue
- Erstmals ausgeschrieben
P-1489
Über Databricks
Bei Databricks sind wir leidenschaftlich daran interessiert, Datenteams zu befähigen, die komplexesten Herausforderungen der Welt zu bewältigen – von der Realisierung der nächsten Fortbewegungsart bis hin zur Beschleunigung medizinischer Durchbrüche. Wir erreichen dies, indem wir die weltweit beste Daten- und KI-Infrastrukturplattform aufbauen und betreiben, die es unseren Kunden ermöglicht, tiefgehende Dateneinblicke zu nutzen und ihr Geschäft zu verbessern.
Die Rolle
Wir suchen einen außergewöhnlichen Senior Staff Technical Program Manager (TPM) für Reliability, um die Strategie, Ausführung und kontinuierliche Verbesserung unserer kritischsten Reliability-Initiativen über die Infrastruktur- und Produkt-Engineering-Teams bei Databricks zu leiten. Da Databricks skaliert, um Tausende von Kunden und die datenintensivsten Workloads der Welt zu unterstützen, ist Reliability grundlegend für unsere Mission. In dieser Rolle werden Sie unternehmensweite Programme leiten, die die Zuverlässigkeit, Leistung und operational excellence unserer Multi-Cloud-Infrastruktur erheblich verbessern.
Dies ist eine hochgradig sichtbare, wirkungsvolle Führungsrolle, in der Sie eng mit unseren erfahrensten Engineering-Leitern zusammenarbeiten, einschließlich der Reliability Program Executive Sponsors, Senior TLs und Engineering Managers, um die Reliability-Strategie zu definieren, langfristige Ziele festzulegen und mehrquartalige Programme auszuführen, um die zuverlässigste Cloud-Plattform des Planeten aufzubauen, auf der unsere Kunden ihre geschäftskritischen Workloads ausführen können.
Um erfolgreich zu sein, müssen Sie über ein tiefes Verständnis von groß angelegten verteilten Systemen, Cloud-Infrastruktur und Engineering-Prinzipien verfügen, die operational excellence vorantreiben. Sie werden Ihren Hintergrund nutzen, um Risiken vorherzusehen, die technische Richtung zu gestalten und komplexe Programme über Produkt-, Engineering-, SRE- und Cloud-Partner-Teams hinweg zu liefern.
Sie werden die Möglichkeit haben zu:
Reliability Strategie + Mehrquartalige Roadmaps leiten
- Mit der erfahrenen Engineering-Leitung zusammenarbeiten, um die langfristige Reliability-Roadmap zu definieren, die technische Richtung zu beeinflussen und die Abstimmung zwischen den Teams sicherzustellen.
- Klarheit und Abstimmung bei Prioritäten über die Engineering-Teams hinweg gewährleisten, einschließlich Platform Engineering, Compute Fleet Management, SRE, Security und Cloud Partnerships.
Ausführung kritischer Reliability-Programme vorantreiben
- Die Programmausführung End-to-End verantworten: Planung, Risikomanagement, Abhängigkeitskartierung, Trade-off-Entscheidungen, Statusberichterstattung und Lieferung.
- Lücken in Prozessen oder Architekturen identifizieren und mit TLs zusammenarbeiten, um proaktiv organisatorische oder technische Verbesserungen voranzutreiben.
Eng mit dem Engineering zusammenarbeiten & die technische Richtung beeinflussen
- Ihren Hintergrund in Infrastruktur, verteilten Systemen oder SRE nutzen, um Teams bei fundierten Design- und Priorisierungsentscheidungen zu unterstützen.
- Die Abstimmung zwischen funktionsübergreifenden Teams erleichtern, um sicherzustellen, dass Programme technisch fundiert und bereit für die Ausführung sind.
- Systemdenken einbringen, um Reliability-Engpässe zu diagnostizieren und Verbesserungen bei Skalierbarkeit, Fehlertoleranz, Automatisierung und operational Tooling voranzutreiben.
Die Reliability-Kultur in der gesamten Organisation stärken
- Die Einführung von Best Practices für Reliability über die Engineering-Teams hinweg vorantreiben – einschließlich Error Budgets, Incident Reviews, Design-for-Resilience-Mustern und operational readiness.
- Programmgovernance, wiederholbare Prozesse, Metriken und Dokumentation definieren und implementieren, um Reliability-Bemühungen über Teams hinweg zu skalieren.
- Reliability-Erwartungen und engineer-empowering Prozesse evangelisieren, die die operationale Last reduzieren und die Incident-Bereitschaft verbessern.
Was wir suchen:
Erforderliche Erfahrung & Qualifikationen
- 10+ Jahre Erfahrung in der Leitung und Bereitstellung von groß angelegten technischen Programmen in Cloud-Infrastruktur, verteilten Systemen, SRE- oder Platform-Engineering-Umgebungen.
- Erfahrung in der Entwicklung von Infrastruktur bei zwei oder mehr Hyperscale-Cloud-Anbietern (z. B. AWS, Azure, GCP), mit Kenntnissen in Cloud Primitives, Multi-AZ/Region-Architektur und Control Plane/Data Plane Mustern.
- Nachgewiesener Erfolg bei der Leitung von Reliability-Programmen in großem Maßstab – einschließlich Verfügbarkeit, Failover, operational excellence, Incident-Reduzierung oder Dependency Hardening.
- Starkes Verständnis von Infrastruktur, verteilten Systemen oder SRE-Praktiken; vorherige Engineering- oder SRE-Erfahrung wird bevorzugt.
- Erfahrung in der direkten Zusammenarbeit mit der erfahrenen Engineering-Leitung zur Definition von Strategien und zur Leitung großer Multi-Team-Initiativen.
- Fähigkeit, vage Ziele in umsetzbare Programmpläne mit klaren Meilensteinen, KPIs und Erfolgsmetriken zu übersetzen.
- Nachgewiesene Fähigkeit, komplexe organisationsübergreifende Abhängigkeiten, technische Risiken und mehrquartalige Zeitpläne zu verwalten.
- Erfahrung in der Bereitstellung von Programmen über mehrere Clouds und/oder groß angelegte Cloud-native Services hinweg.
- Erfahrung im Aufbau und Skalieren von Engineering-Prozessen, operational Frameworks und Mechanismen zur Stakeholder-Abstimmung.
Bevorzugte Qualifikationen
- Hintergrund in Distributed Systems Engineering, SRE, Platform Infrastructure oder Cloud Services.
- Erfahrung mit groß angelegten Compute Fleets, Container-Orchestrierung, Autoscaling oder Control-Plane-Architektur.
- Vertrautheit mit Reliability-Methodologien wie SLOs, Error Budgets, Chaos Engineering, Failure Mode Analysis und Incident Management Frameworks.
- Expertise in der Verwendung von Jira oder gleichwertigen
Automatisch aus dem Original übersetzt.
Ausgeschrieben vor 3 Tagen