jobsswitzerland.ch
← Toutes les offres

Senior Networking Solution Test Engineer - AI Cluster Debugging

NVIDIA

Type de contrat
Temps plein
Lieu
Zürich
Première publication
Postuler
Nous recherchons un Senior Networking Test Engineer doté de solides compétences en débogage au niveau système pour rejoindre notre équipe End-to-End Verification ! Vous travaillerez sur des clusters d'IA pionniers basés sur NVLink, Ethernet et InfiniBand. De plus, vous serez responsable de problèmes complexes impliquant le matériel, le logiciel système et les charges de travail d'IA. Ce que vous ferez : • Concevoir et examiner les exigences de test et de produit à travers le portefeuille NVLink, Ethernet et InfiniBand / NIC / DPU / Switch, en se concentrant sur le comportement des clusters d'IA à grande échelle. • Construire et maintenir des bancs d'essai réalistes similaires à ceux des clients, incluant du matériel hétérogène, des combinaisons OS / driver et des structures réseau complexes. • Assumer le dépannage de bout en bout des clusters : reproduire les scénarios clients, effectuer le triage à travers la pile et mener les problèmes jusqu'à la cause racine et la correction. • Lire et comprendre le code source pertinent pour identifier les défauts, valider les corrections et améliorer la journalisation (logging) et l'instrumentation. • Collaborer étroitement avec les équipes de développement pour déboguer NCCL, RoCE/RDMA et les composants réseau associés en utilisant les logs, l'inspection du code et des expériences ciblées. • Définir des tests et guider l'équipe d'automatisation pour mettre en œuvre des suites robustes et débogables qui produisent des logs, des métriques et des traces exploitables. • Exécuter des tests de régression, de performance, fonctionnels et d'échelle, analyser les résultats et fournir des rapports clairs et basés sur les données aux collaborateurs. • Profiler et évaluer les performances (benchmark) des charges de travail d'entraînement et d'inférence de deep learning, en corrélant les métriques au niveau du modèle avec la télémétrie système et réseau pour découvrir les goulots d'étranglement. Ce que nous devons voir : • B.A./B.Sc. en informatique, génie électrique, ou expérience équivalente en IT/Réseau/Systèmes. • Plus de 8 ans d'expérience pratique en test et débogage réseau ou au niveau système sur Linux. • Solides compétences en réseau Linux et en débogage (par exemple perf, tcpdump, ethtool, iproute2). • Expérience éprouvée du débogage de niveau production : formuler des hypothèses, mener des expériences et mener les problèmes à la cause racine sous pression. • Expertise dans la validation et le réglage (tuning) des NIC côté hôte (offloads, queues, interrupts, interactions firmware/driver). • Connaissance approfondie des bibliothèques réseau d'IA (telles que NCCL) et des protocoles (tels que RoCE et RDMA), y compris le débogage de la performance et de l'exactitude. • Capacité à lire et à raisonner sur le code source (C/C++/Python ou similaire) et à collaborer étroitement avec les développeurs sur les corrections. • Solides compétences en scripting et automatisation avec Bash / Python / Ansible pour la configuration, la collecte de logs et l'orchestration d'expériences. • Apprentissage rapide, familiarité avec les outils et flux de travail de l'IA moderne, capable de s'adapter rapidement. • Excellentes capacités d'analyse, de résolution de problèmes et de communication, avec un fort sens des responsabilités et une approche collaborative. Façons de se démarquer : • Débogage pratique de bibliothèques de communication collective (par exemple NCCL) ou de clusters d'entraînement / d'inférence de LLM à grande échelle. • Expérience avec des environnements de clusters de grande taille (dizaines à milliers de GPU ou nœuds), incluant la réponse aux incidents et l'analyse post-mortem. • Expertise approfondie dans le réglage et le débogage du contrôle de la congestion et de l'Ethernet sans perte (lossless) pour les charges de travail d'IA (par exemple DCQCN, ECN, PFC). • Familiarité avec les technologies réseau NVIDIA (par exemple BlueField / BF3, NIC ConnectX) et leur pile logicielle et leurs diagnostics. • Expérience du débogage de problèmes couvrant plusieurs couches (L2/L3, transport, frameworks d'IA) ou contribution à des systèmes réseau / IA open-source. Chez NVIDIA, nous valorisons la diversité et nous nous engageons à créer un environnement inclusif pour tous les employés. Nous ne discriminons pas sur la base de la race, la religion, la couleur, l'origine nationale, le sexe, le genre, l'expression de genre, l'orientation sexuelle, l'âge, l'état civil, le statut de vétéran ou le statut de handicap. Nous fournissons des aménagements raisonnables pour garantir que toutes les personnes puissent participer au processus de candidature ou d'entretien, remplir les fonctions essentielles du poste et bénéficier des autres avantages et privilèges de l'emploi. Rejoignez-nous et faites partie d'une équipe qui repousse les limites de la technologie et a un impact réel dans le monde.

Traduit automatiquement depuis l’original.

Publié il y a 4 semaines

Lieu

Voir sur Google Maps