Site Reliability Engineer
- Tipo di contratto
- Tempo pieno
- Luogo
- Lausanne
- Prima pubblicazione
Adaptyv sta costruendo un laboratorio automatizzato che permette ad agenti AI di eseguire esperimenti biologici.
Stiamo entrando nell'era della scienza agentica, in cui i modelli AI possono ora progettare nuove proteine, proporre ipotesi e iterare sui risultati sperimentali. Ma non possono eseguire gli esperimenti da soli - questo è ancora un processo manuale che dura mesi. Stiamo costruendo l'infrastruttura che dà agli agenti AI l'accesso al mondo fisico.
Siamo una delle aziende biotech a più rapida crescita, di cui si fidano le principali biopharmas, i laboratori AI all'avanguardia e le aziende techbio che spingono il settore in avanti. Questa è una rara opportunità per contribuire ad avanzare alcuni dei lavori più importanti che si stanno svolgendo oggi nel settore biotech.
Il nostro laboratorio automatizzato è alimentato da un profondo stack software + hardware: strumenti di laboratorio del valore di milioni di USD sottoposti a reverse engineering in hardware controllabile tramite API, decine di dispositivi orchestrati attraverso workflow complessi, piena osservabilità su tutto ciò che accade nel laboratorio, pipeline di elaborazione per dati disordinati del mondo fisico e sistemi AI che risolvono problemi nei risultati di produzione e accelerano lo sviluppo dei saggi.
Stiamo crescendo rapidamente e stiamo assumendo persone talentuose per scalare e supportare la massiccia domanda di sperimentazione in wet lab guidata dall'AI.
Adaptyv gestisce un laboratorio fisico attraverso il software. Quando i nostri sistemi si interrompono, non è una pagina che non riesce a caricarsi — è un liquid handler che si ferma a metà esecuzione, uno strumento che perde la sua prenotazione o l'esperimento di un cliente che si blocca con la sua proteina già in una piastra. L'affidabilità qui ha conseguenze nel mondo fisico, e abbiamo bisogno di qualcuno che se ne occupi.
Sarai responsabile della salute dell'intero stack che mantiene in funzione LabOS e la nostra piattaforma rivolta ai clienti: le API, le edge functions, i database, le pipeline di elaborazione, le code di lavoro e le integrazioni che collegano il nostro software a milioni di dollari di hardware di laboratorio. Costruirai l'osservabilità, l'alerting e l'automazione che permettano a un piccolo team di gestire un laboratorio automatizzato 24/7 senza vivere in modalità gestione delle emergenze — e quando qualcosa si rompe, sarai la persona che si assicura che venga rilevato presto, riparato velocemente e che non accada mai più nello stesso modo.
In una data settimana, ciò potrebbe significare:
- Costruire l'osservabilità attraverso lo stack — metriche, log, tracce e dashboard (Grafana) che rendano lo stato del laboratorio e della piattaforma leggibile a colpo d'occhio
- Definire gli SLO per i servizi che contano, strumentarli e impostare l'alerting che segnali i problemi reali e rimanga silenzioso in caso contrario
- Rinforzare le nostre pipeline di dati e di elaborazione in modo che i dati disordinati del mondo fisico non corrompano silenziosamente i risultati o blocchino gli esperimenti
- Gestire la risposta agli incidenti: triage, mitigazione e postmortem senza colpa (blameless) che trasformino ogni interruzione in una soluzione permanente
- Migliorare la sicurezza del deploy e il rollback attraverso i nostri servizi (Vercel, Supabase, Modal, edge functions) in modo che rilasciare velocemente non significhi rilasciare fragilità
- Automatizzare il lavoro ripetitivo (toil) — i passaggi manuali di recupero, il monitoraggio costante, i runbook "riavvialo e basta" — affinché il laboratorio funzioni il più possibile da solo
- Collaborare con i team software e di automazione del laboratorio per rendere l'affidabilità una proprietà del sistema piuttosto che un pensiero successivo
COSA STIAMO CERCANDO
- Solide competenze in sistemi e software engineering. Scrivi codice di produzione (Python e/o TypeScript) e sei a tuo agio nel gestire l'infrastruttura, non solo nel configurarla.
- Vera esperienza di SRE / gestione della produzione. Hai gestito servizi da cui le persone dipendono, hai portato un pager e hai costruito l'osservabilità e l'automazione che hanno reso sostenibile il reperibile.
- Fluidità nell'osservabilità. Metriche, logging, tracing, dashboard, alerting — sai come rendere leggibile un sistema distribuito complesso e hai usato strumenti come Grafana / Prometheus / Loki (o equivalenti) in situazioni critiche.
- Istinto per gli incidenti. Mantieni la calma quando le cose si rompono, trovi rapidamente la causa principale e sei allergico al fatto che lo stesso incidente accada due volte.
- Mentalità automation-first. Preferiresti passare un giorno ad automatizzare un compito ricorrente di 10 minuti piuttosto che farlo manualmente per sempre — e costruisci utilizzando agenti di codifica come Claude Code come standard.
- Pragmatismo riguardo l'affidabilità. Conosci la differenza tra ciò che necessita di cinque nove e ciò che non ne ha bisogno, e dedichi sforzi dove conta davvero.
- Bonus: dove il software incontra il mondo fisico. Hardware / lab / IoT, code e pipeline, o cloud infra su scala — qualsiasi cosa debba continuare a funzionare quando c'è qualcosa di reale dall'altra parte.
- Curiosità per la biologia. Non è richiesto un background specifico, ma dovresti trovare genuinamente interessante il fatto che ciò che mantieni in vita sia un laboratorio in cui l'AI esegue esperimenti reali.
Scadenza per la candidatura
Stiamo esaminando i candidati su base continua.
Tradotto automaticamente dall’originale.
Pubblicato 6 settimane fa