jobsswitzerland.ch
← Tutte le offerte

Principal SRE Engineer

ID Quantique

Tipo di contratto
Tempo pieno
Luogo
Geneva
Prima pubblicazione
Candidati ora
ID Quantique (IDQ) come parte di IONQ, è un leader globale nelle comunicazioni quantum-safe e nei sistemi di rilevamento quantistico. Forniamo soluzioni per proteggere governi, infrastrutture di telecomunicazioni e istituzioni bancarie e finanziarie dalla minaccia “harvest-now, decrypt-later”, fornendo reti quantum-safe sia terrestri che spaziali in funzione live a livello globale. I nostri Quantum Detection Systems spingono i limiti del rilevamento del singolo fotone, alimentando progressi nella comunicazione quantistica, nel sensing, nel computing e nell'imaging ultra-sensibile in partnership con i migliori ricercatori e innovatori tecnologici in tutto il mondo. Cosa aspettarsi Il team di Platform Engineering costruisce, protegge e gestisce infrastrutture scalabili a supporto di prodotti SaaS gestiti tramite cloud con componenti on-premises distribuiti presso i clienti. In qualità di nostro Principal Site Reliability Engineer, fornirai la leadership tecnica per l'affidabilità attraverso la nostra piattaforma globale. Definirai la strategia, gli standard e il modello operativo che garantiscano servizi altamente disponibili, resilienti e sicuri, mantenendo un approccio hands-on con la progettazione e la gestione delle tecnologie che sostengono i nostri ambienti di produzione. Lavorando a stretto contatto con Architecture, DevSecOps, Cloud Operations e Product Development, guiderai una cultura di osservabilità, automazione e miglioramento continuo, assicurando che i problemi vengano identificati e risolti prima che impattino i clienti. Definire e guidare la strategia di affidabilità per i servizi di produzione Tier 1 e Tier 2, inclusi service-level objectives, error budgets, osservabilità, resilienza, disaster recovery e cloud security. Progettare e gestire piattaforme di osservabilità, guidare iniziative di chaos engineering e disaster recovery, migliorare l'affidabilità di PostgreSQL, Redis/Valkey, Kafka e OpenSearch, e fornire capacità di AI Ops inclusi il monitoraggio predittivo, la rimediazione automatizzata e l'auto-riparazione (self-healing). Guidare la risposta ai major incident, le operazioni on-call e l'escalation globale, fornendo al contempo mentoring agli ingegneri e stabilendo standard di ingegneria adottati in tutta l'organizzazione. Cosa farai Sarai responsabile dell'affidabilità, della resilienza e dell'eccellenza operativa della nostra piattaforma cloud e dei servizi di produzione, integrando i principi di affidabilità nelle decisioni architettoniche e nella progettazione della piattaforma. Stabilirai standard di osservabilità che coprano metriche, log, distributed tracing e profiling, gestendo al contempo service-level objectives ed error budgets tra i team di ingegneria. Guiderai l'ingegneria della resilienza attraverso chaos testing, pianificazione del disaster recovery ed esercizi di failover validati, condividerai la responsabilità della cloud security posture con DevSecOps e garantirai l'affidabilità delle nostre piattaforme critiche di dati e streaming. Lavorando attraverso molteplici discipline ingegneristiche, ottimizzerai anche l'efficienza della piattaforma attraverso l'automazione, le operazioni guidate dall'AI e il miglioramento operativo continuo. Gestire l'affidabilità della produzione, l'osservabilità, i service-level objectives, gli error budgets, la resilienza, il backup e il disaster recovery, la cloud security e la governance della piattaforma per tutti i servizi critici. Guidare l'incident command, le comunicazioni executive, le post-incident reviews, le operazioni on-call e l'escalation globale, fornendo al contempo monitoraggio predittivo, rimediazione automatizzata e capacità di self-healing. Collaborare con Architecture, DevSecOps, Cloud Operations e Product Development per stabilire standard di ingegneria, fare mentoring agli ingegneri e fornire una roadmap condivisa per l'affidabilità. Cosa porterai Sei un leader esperto in Site Reliability Engineering con oltre 15 anni di esperienza nell'ingegneria di produzione e una recente responsabilità hands-on per sistemi di produzione su larga scala e fault-tolerant che girano su AWS o GCP. Hai progettato e gestito con successo piattaforme di osservabilità, implementato programmi di service-level objective e fornito miglioramenti misurabili in disponibilità, affidabilità e mean time to recovery. Hai gestito incidenti di produzione ad alta severità, pianificato ed eseguito test di resilienza ed esercizi di disaster recovery, e influenzato le pratiche di ingegneria attraverso molteplici team tramite leadership tecnica e mentoring. 15+ anni di esperienza nell'ingegneria di produzione con recente responsabilità hands-on per sistemi di produzione su larga scala e fault-tolerant su AWS o GCP, inclusa la gestione di osservabilità, service-level objectives ed error budgets. Comprovata esperienza nella guida di iniziative di resilienza, test validati di disaster recovery e failover, insieme alla gestione di incidenti di produzione ad alta severità e miglioramenti misurabili dell'affidabilità. Dimostrata leadership tecnica attraverso revisioni architettoniche, governance, mentoring, coaching e standard di ingegneria adottati in più team e servizi. Sarai un ottimo candidato se: Hai una profonda esperienza in cloud infrastructure, platform engineering e cloud security, con esperienza pratica nel proteggere ambienti di produzione distribuiti attraverso la cloud security posture management, il runtime vulnerability detection e l'automazione delle policy. Capisci come bilanciare affidabilità, sicurezza, networking ed efficienza operativa su scala. Hai esperienza nell'implementazione di capacità operative basate sull'AI, nell'applicazione dei principi FinOps per ottimizzare l'infrastruttura e nella progettazione di sistemi distribuiti altamente disponibili che offrono eccezionale resilienza e performance. Comprovata esperienza con cloud security posture management, workload protection, policy-as-

Tradotto automaticamente dall’originale.

Pubblicato 1 settimana fa

Luogo

Vedi su Google Maps