Principal SRE Engineer
- Type de contrat
- Temps plein
- Lieu
- Geneva
- Première publication
ID Quantique (IDQ) en tant que partie de IONQ, est un leader mondial des communications quantiques sécurisées et des systèmes de détection quantique. Nous fournissons des solutions pour protéger les gouvernements, les infrastructures de télécommunications et les institutions bancaires et financières contre la menace « harvest-now, decrypt-later », en déployant des réseaux quantiques sécurisés, tant terrestres que spatiaux, en exploitation réelle à l'échelle mondiale. Nos Quantum Detection Systems repoussent les limites de la détection de photons uniques, alimentant des percées dans la communication quantique, la détection, l'informatique et l'imagerie ultra-sensible en partenariat avec les meilleurs chercheurs et innovateurs technologiques du monde entier.
Ce à quoi vous attendre
L'équipe Platform Engineering construit, sécurise et exploite une infrastructure évolutive prenant en charge des produits SaaS gérés par le cloud avec des composants on-premises déployés sur les sites des clients.
En tant que notre Principal Site Reliability Engineer, vous assurerez le leadership technique de la fiabilité sur l'ensemble de notre plateforme mondiale. Vous définirez la stratégie, les normes et le modèle opérationnel qui garantissent des services hautement disponibles, résilients et sécurisés, tout en restant opérationnel sur la conception et l'exploitation des technologies qui sous-tendent nos environnements de production.
Travaillant en étroite collaboration avec l'Architecture, le DevSecOps, le Cloud Operations et le Product Development, vous piloterez une culture d'observabilité, d'automatisation et d'amélioration continue, en veillant à ce que les problèmes soient identifiés et résolus avant qu'ils n'impactent les clients.
Définir et diriger la stratégie de fiabilité pour les services de production de Tier 1 et Tier 2, y compris les objectifs de niveau de service (SLO), les budgets d'erreur, l'observabilité, la résilience, la reprise après sinistre et la sécurité du cloud.
Concevoir et exploiter des plateformes d'observabilité, diriger les initiatives de chaos engineering et de reprise après sinistre, améliorer la fiabilité de PostgreSQL, Redis/Valkey, Kafka et OpenSearch, et fournir des capacités d'AI Ops incluant la surveillance prédictive, la remédiation automatisée et l'auto-guérison.
Diriger la réponse aux incidents majeurs, les opérations d'astreinte et l'escalade mondiale, tout en encadrant les ingénieurs et en établissant des normes d'ingénierie adoptées dans toute l'organisation.
Ce que vous ferez
Vous serez responsable de la fiabilité, de la résilience et de l'excellence opérationnelle de notre plateforme cloud et de nos services de production, en intégrant les principes de fiabilité dans les décisions architecturales et la conception de la plateforme. Vous établirez des normes d'observabilité couvrant les métriques, les logs, le traçage distribué et le profilage, tout en régissant les objectifs de niveau de service et les budgets d'erreur à travers les équipes d'ingénierie.
Vous dirigerez l'ingénierie de la résilience par des tests de chaos, la planification de la reprise après sinistre et des exercices de basculement validés, co-gérerez la posture de sécurité cloud avec le DevSecOps, et assurerez la fiabilité de nos plateformes de données critiques et de streaming. Travaillant à travers de multiples disciplines d'ingénierie, vous optimiserez également l'efficacité de la plateforme grâce à l'automatisation, aux opérations pilotées par l'IA et à l'amélioration opérationnelle continue.
Assumer la responsabilité de la fiabilité de la production, de l'observabilité, des objectifs de niveau de service, des budgets d'erreur, de la résilience, de la sauvegarde et de la reprise après sinistre, de la sécurité du cloud et de la gouvernance de la plateforme pour tous les services critiques.
Diriger le commandement des incidents, les communications exécutives, les revues post-incident, les opérations d'astreinte et l'escalade mondiale, tout en fournissant des capacités de surveillance prédictive, de remédiation automatisée et d'auto-guérison.
Collaborer avec l'Architecture, le DevSecOps, le Cloud Operations et le Product Development pour établir des normes d'ingénierie, encadrer les ingénieurs et fournir une feuille de route de fiabilité partagée.
Ce que vous apporterez
Vous êtes un leader expérimenté en Site Reliability Engineering avec plus de 15 ans d'expérience en ingénierie de production et une responsabilité opérationnelle récente pour des systèmes de production à grande échelle et tolérants aux pannes fonctionnant sur AWS ou GCP.
Vous avez conçu et exploité avec succès des plateformes d'observabilité, mis en œuvre des programmes d'objectifs de niveau de service et apporté des améliorations mesurables en matière de disponibilité, de fiabilité et de temps moyen de récupération (MTTR). Vous avez dirigé des incidents de production de haute sévérité, planifié et exécuté des tests de résilience et des exercices de reprise après sinistre, et influencé les pratiques d'ingénierie à travers plusieurs équipes par le leadership technique et le mentorat.
15+ ans d'expérience en ingénierie de production avec une responsabilité opérationnelle récente pour des systèmes de production à grande échelle et tolérants aux pannes sur AWS ou GCP, incluant la responsabilité de l'observabilité, des objectifs de niveau de service et des budgets d'erreur.
Expérience avérée dans la direction d'initiatives de résilience, la validation de tests de reprise après sinistre et de basculement, ainsi que la maîtrise des incidents de production de haute sévérité et des améliorations mesurables de la fiabilité.
Leadership technique démontré à travers les revues d'architecture, la gouvernance, le mentorat, le coaching et les normes d'ingénierie adoptées par plusieurs équipes et services.
Vous serez un excellent profil si :
Vous avez une expertise approfondie de l'infrastructure cloud, de l'ingénierie de pl
Traduit automatiquement depuis l’original.
Publié il y a 6 jours