jobsswitzerland.ch
← Tutte le offerte

Apertus Engineer: Infrastructure

ETH Zurich

Tipo di contratto
Tempo pieno
Luogo
Lausanne
Prima pubblicazione
Candidati ora
Apertus Engineer: Infrastructure # 100%, Zurich, fixed-term #### print Drucken  Siamo alla ricerca di un esperto ingegnere delle infrastrutture da inserire nel team Apertus. Il candidato ideale gestirà lo stack di immagini dei container che supporta i nostri carichi di lavoro di pre-training, post-training e serving, e collaborerà con gli ingegneri CSCS per mantenere stabile e veloce l'addestramento su larga scala su Alps. Questo ruolo richiede solide competenze Linux e dei container, esperienza con ambienti HPC e la capacità di lavorare in modo collaborativo con i team di ricerca, ingegneria e operazioni. Contesto del progetto ## Il progetto Apertus, uno sforzo congiunto tra EPFL, ETH Zürich e CSCS, è alla ricerca di un ingegnere delle infrastrutture pratico e motivato per aiutare a costruire la prossima versione di Apertus. Il candidato selezionato gestirà lo stack di immagini dei container e lavorerà a stretto contatto con CSCS per mantenere l'addestramento su larga scala stabile e veloce. Addestriamo modelli foundation open con centinaia di miliardi di parametri su migliaia di GPU su uno dei più grandi supercomputer pronti per l'IA in Europa. Il team conta più di una dozzina di ingegneri full-time che lavorano al fianco di ricercatori leader di EPFL ed ETH Zürich, ha rilasciato i modelli Apertus 1 e Apertus 1.5 e collabora con oltre trenta collaboratori accademici per fornire modelli IA multilingue e multimodali, completamente open (open source) e addestrati in modo responsabile, per la ricerca e l'industria. Apertus è addestrato e sviluppato su Alps, l'infrastruttura di supercalcolo del Centro Nazionale Svizzero per il Supercalcolo (CSCS). Il ruolo richiede una persona a proprio agio nel lavorare in un ambiente HPC e nel collaborare con ricercatori e ingegneri delle infrastrutture. Descrizione del lavoro ## L'ingegnere garantirà stabilità e throughput per le pipeline di pre-training e post-training di Apertus mantenendo le immagini del sistema ML e collaborando con CSCS sull'infrastruttura sottostante. Mantenimento delle immagini del sistema ML • Costruire, mantenere e aggiornare le immagini dei container per tutte le fasi principali dello sviluppo ML: pre-training, post-training/allineamento e serving/deployment del modello • Puntare all'architettura dei nodi basata su ARM (aarch64, Grace-Hopper) di Alps, gestendo l'intero stack di dipendenze (CUDA, NCCL, PyTorch, framework di addestramento e serving) • Mantenere le build delle immagini riproducibili, versionate e documentate, inclusa la CI per build e aggiornamenti • Validare le immagini rispetto ai carichi di lavoro di riferimento di pre-training e post-training insieme agli ingegneri Apertus, e mantenere esempi di avvio funzionanti Partnership computazionale ed efficienza • Fungere da principale punto di contatto tecnico con gli ingegneri e i ricercatori CSCS per quanto riguarda il calcolo, l'affidabilità e l'efficienza • Lavorare in modo collaborativo con il personale CSCS per identificare e implementare miglioramenti nell'efficienza e nelle prestazioni dell'infrastruttura computazionale sottostante, sovrapponendosi all'ingegneria delle prestazioni dei sistemi ML • Contribuire a miglioramenti sistemici nelle risorse basate su CSCS (rete, storage, scheduling) rilevanti per l'addestramento di LLM su larga scala • Documentare e diffondere la conoscenza istituzionale sull'infrastruttura CSCS e sulle migliori pratiche per sfruttare questi sistemi ad alte prestazioni Stress test dell'infrastruttura • Effettuare stress test dell'infrastruttura utilizzando carichi di lavoro rappresentativi di pre-training e post-training, basandosi sulle ricette ed esempi esistenti del progetto, per convalidare stabilità e throughput dopo aggiornamenti delle immagini, manutenzione del sistema e modifiche alla configurazione • Lavorare a stretto contatto con gli ingegneri di pre-training e post-training di Apertus per risolvere problemi a livello di cluster che influenzano la stabilità e il throughput: guasti dei nodi, networking, prestazioni dello storage, checkpointing e scheduling • Supportare lo stack di serving di Apertus, che si basa sulle stesse immagini (la gestione dello stack di serving è affidata a un ingegnere separato) Profilo ## Essenziale • MSc o PhD in Informatica, Data Science, Intelligenza Artificiale, Machine Learning o un campo correlato • Saranno presi in considerazione anche candidati BSc eccezionali con una forte esperienza ingegneristica • Esperienza pratica con ambienti HPC: scheduler di job come Slurm, filesystem condivisi e sistemi GPU multi-nodo • Forti competenze nei sistemi Linux e nei container (Docker/Podman e runtime HPC come enroot o Apptainer) • Forti capacità di collaborazione e comunicazione e capacità di lavorare tra i team di ricerca, ingegneria e operazioni • È richiesta una precedente esperienza pratica nei domini core di questo ruolo • Può trattarsi di esperienza basata su progetti o studi; è preferibile l'esperienza lavorativa formale • Un alto grado di flessibilità: priorità, strumenti e attività quotidiane cambiano con i programmi di addestramento, i rilasci e un campo in rapida evoluzione Fortemente preferito • Familiarità con i framework di addestramento e serving di LLM come Megatron-LM, PyTorch distributed, vLLM o SGLang • Esperienza nella costruzione o adattamento di container per piattaforme ARM64/aarch64 • Familiarità con lo stack di comunicazione e rete HPC: Slingshot, libfabric, NCCL e il suo debugging • Esperienza con filesystem paralleli (es. Lustre) e ottimizzazione delle prestazioni dello storage • Esperienza nell'impostazione di pipeline CI/CD per la costruzione di immagini container Plus • Ricerca pubblicata nei domini rilevanti per questo ruolo, o familiarità con ricerche pubblicate di recente su questi argomenti • Esperienza nel profiling di carichi di lavoro GPU distribuiti (Nsight, DCGM, benchmark di comunicazione) e nel tradurre i risultati in miglioramenti dell'infras

Tradotto automaticamente dall’originale.

Pubblicato 2 giorni fa

Luogo

Vedi su Google Maps