Senior Networking Solution Test Engineer - AI Cluster Debugging
- Type de contrat
- Temps plein
- Lieu
- Zürich
- Première publication
Nous recherchons un Senior Networking Test Engineer doté de solides compétences en débogage au niveau système pour rejoindre notre équipe End-to-End Verification ! Vous travaillerez sur des clusters IA pionniers basés sur NVLink, Ethernet et InfiniBand. De plus, vous serez responsable de problèmes complexes impliquant le matériel, le logiciel système et les charges de travail IA.
Ce que vous ferez :
• Concevoir et réviser les exigences de test et de produit à travers le portefeuille NVLink, Ethernet et InfiniBand / NIC / DPU / Switch, en se concentrant sur le comportement des clusters IA à grande échelle.
• Construire et maintenir des bancs d'essai réalistes similaires à ceux des clients, incluant du matériel hétérogène, des combinaisons d'OS / pilotes et des structures réseau complexes.
• Assurer le dépannage de bout en bout des clusters : reproduire les scénarios clients, effectuer le triage à travers la pile et mener les problèmes jusqu'à la cause racine et la correction.
• Lire et comprendre le code source pertinent pour identifier les défauts, valider les corrections et améliorer la journalisation et l'instrumentation.
• Collaborer étroitement avec les équipes de développement pour déboguer NCCL, RoCE/RDMA et les composants réseau associés en utilisant les logs, l'inspection du code et des expériences ciblées.
• Définir les tests et guider l'équipe d'automatisation pour implémenter des suites robustes et débogables qui produisent des logs, des métriques et des traces exploitables.
• Exécuter des tests de régression, de performance, fonctionnels et d'échelle, analyser les résultats et fournir des rapports clairs et basés sur les données aux collaborateurs.
• Profiler et évaluer les performances des charges de travail d'entraînement et d'inférence de deep learning, en corrélant les métriques au niveau du modèle avec la télémétrie système et réseau pour découvrir les goulots d'étranglement.
Ce que nous devons voir :
• B.A./B.Sc. en informatique, génie électrique, ou une expérience équivalente en IT/Réseau/Systèmes.
• Plus de 8 ans d'expérience pratique en test et débogage réseau ou au niveau système sur Linux.
• Solides compétences en réseau Linux et en débogage (par exemple perf, tcpdump, ethtool, iproute2).
• Expérience éprouvée du débogage de classe production : formuler des hypothèses, mener des expériences et mener les problèmes à la cause racine sous pression.
• Expertise dans la validation et l'optimisation des NIC côté hôte (offloads, files d'attente, interruptions, interactions firmware/pilote).
• Solides connaissances des bibliothèques réseau IA (telles que NCCL) et des protocoles (tels que RoCE et RDMA), y compris le débogage de la performance et de la correction.
• Capacité à lire et à raisonner sur le code source (C/C++/Python ou similaire) et à collaborer étroitement avec les développeurs sur les corrections.
• Solides compétences en scripting et automatisation avec Bash / Python / Ansible pour la configuration, la collecte de logs et l'orchestration d'expériences.
• Apprentissage rapide, familiarité avec les outils et flux de travail IA modernes, capable de s'adapter rapidement.
• Excellentes capacités d'analyse, de résolution de problèmes et de communication, avec un fort sens des responsabilités et une approche collaborative.
Façons de se démarquer :
• Débogage pratique de bibliothèques de communication collective (par exemple NCCL) ou de clusters d'entraînement / d'inférence LLM à grande échelle.
• Expérience avec des environnements de clusters de grande taille (de dizaines à des milliers de GPU ou de nœuds), incluant la réponse aux incidents et l'analyse post-mortem.
• Expertise approfondie dans l'optimisation et le débogage du contrôle de congestion et de l'Ethernet sans perte pour les charges de travail IA (par exemple DCQCN, ECN, PFC).
• Familiarité avec les technologies réseau NVIDIA (par exemple BlueField / BF3, NIC ConnectX) ainsi que leur pile logicielle et leurs diagnostics.
• Expérience du débogage de problèmes couvrant plusieurs couches (L2/L3, transport, frameworks IA) ou contribution à des systèmes réseau / IA open-source.
A NVIDIA, nous valorisons la diversité et nous nous engageons à créer un environnement inclusif pour tous les employés. Nous ne discriminons pas en fonction de la race, de la religion, de la couleur, de l'origine nationale, du sexe, du genre, de l'expression de genre, de l'orientation sexuelle, de l'âge, de l'état civil, du statut de vétéran ou du statut de handicap. Nous fournissons des aménagements raisonnables pour garantir que tous les individus puissent participer au processus de candidature ou d'entretien, accomplir les fonctions essentielles du poste et recevoir d'autres avantages et privilèges liés à l'emploi. Rejoignez-nous et faites partie d'une équipe qui repousse les limites de la technologie et a un impact réel dans le monde.
Traduit automatiquement depuis l’original.
Publié il y a 4 semaines