jobsswitzerland.ch
← Alle Stellen

Senior Networking Solution Test Engineer - AI Cluster Debugging

NVIDIA

Anstellung
Vollzeit
Ort
Zürich
Erstmals ausgeschrieben
Jetzt bewerben
Wir suchen einen Senior Networking Test Engineer mit starken Fähigkeiten im Debugging auf Systemebene, um unser End-to-End Verification Team zu verstärken! Sie werden an wegweisenden NVLink, Ethernet und InfiniBand basierenden AI Clustern arbeiten. Darüber hinaus werden Sie die Verantwortung für komplexe Probleme über Hardware, Systemsoftware und AI Workloads hinweg übernehmen. Was Sie tun werden: • Entwurf und Überprüfung von Test- und Produktanforderungen über das NVLink, Ethernet und InfiniBand / NIC / DPU / Switch Portfolio hinweg, mit Fokus auf das Verhalten von großskaligen AI Clustern. • Aufbau und Wartung realistischer, kundenähnlicher Testbeds, einschließlich heterogener Hardware, OS / Treiber-Kombinationen und komplexer Netzwerk-Fabrics. • Übernahme der End-to-End Cluster-Fehlerbehebung: Reproduktion von Kundenszenarien, Triage über den gesamten Stack hinweg und Leitung der Probleme zur Ursachenanalyse und Fehlerbehebung. • Lesen und Verstehen von relevantem Quellcode, um Defekte zu identifizieren, Fixes zu validieren sowie das Logging und die Instrumentierung zu verbessern. • Enge Zusammenarbeit mit Entwicklungsteams zur Fehlersuche bei NCCL, RoCE/RDMA und verwandten Netzwerkkomponenten mittels Logs, Code-Inspektion und gezielten Experimenten. • Definition von Tests und Anleitung des Automation-Teams zur Implementierung robuster, debuggbarer Test-Suites, die aussagekräftige Logs, Metriken und Traces erzeugen. • Durchführung von Regressions-, Performance-, Funktions- und Skalierungstests, Analyse der Ergebnisse und Erstellung klarer, datengestützter Berichte für Partner. • Profiling und Benchmarking von Deep Learning Training und Inference Workloads, wobei Metriken auf Modellebene mit System- und Netzwerk-Telemetrie korreliert werden, um Engpässe aufzudecken. Was wir sehen wollen: • B.A./B.Sc. in Informatik, Elektrotechnik oder gleichwertige IT/Netzwerk/System-Erfahrung. • 8+ Jahre praktische Erfahrung in der Netzwerk- oder System-Level-Testung und Fehlerbehebung auf Linux. • Starke Linux-Netzwerk- und Debugging-Kenntnisse (zum Beispiel perf, tcpdump, ethtool, iproute2). • Nachgewiesene Erfahrung in der Fehlerbehebung auf Produktionsniveau: Aufstellen von Hypothesen, Durchführung von Experimenten und Leitung von Problemen zur Ursache unter Druck. • Expertise in der Validierung und Abstimmung von hostseitigen NICs (Offloads, Queues, Interrupts, Firmware/Treiber-Interaktionen). • Fundierte Kenntnisse von AI-Netzwerkbibliotheken (wie NCCL) und Protokollen (wie RoCE und RDMA), einschließlich der Fehlerbehebung in Bezug auf Performance und Korrektheit. • Fähigkeit, Quellcode zu lesen und zu interpretieren (C/C++/Python oder ähnlich) und eng mit Entwicklern an Fehlerbehebungen zusammenzuarbeiten. • Solide Scripting- und Automatisierungskenntnisse mit Bash / Python / Ansible für Setup, Log-Sammlung und die Orchestrierung von Experimenten. • Schnelle Auffassungsgabe, vertraut mit modernen AI-Tools und Workflows, fähig zur schnellen Anpassung. • Exzellente analytische Fähigkeiten, Problemlösungskompetenz und Kommunikationsfähigkeit, mit ausgeprägter Eigenverantwortung und einem kollaborativen Ansatz. Wege, um sich von der Masse abzuheben: • Hands-on Debugging von kollektiven Kommunikationsbibliotheken (zum Beispiel NCCL) oder großskaligen LLM Training / Inference Clustern. • Erfahrung mit großen Cluster-Umgebungen (zehn bis tausende GPUs oder Knoten), einschließlich Incident Response und Post-Mortem-Analyse. • Tiefgehende Expertise in der Abstimmung und Fehlerbehebung von Congestion Control und Lossless Ethernet für AI Workloads (zum Beispiel DCQCN, ECN, PFC). • Vertrautheit mit NVIDIA Netzwerktechnologien (zum Beispiel BlueField / BF3, ConnectX NICs) und deren Software-Stack und Diagnostik. • Erfahrung in der Fehlerbehebung bei Problemen, die mehrere Schichten umfassen (L2/L3, Transport, AI Frameworks) oder durch Beiträge zu Open-Source-Netzwerk- / AI-Systemen. Bei NVIDIA schätzen wir Vielfalt und setzen uns dafür ein, ein inklusives Umfeld für alle Mitarbeitenden zu schaffen. Wir diskriminieren nicht aufgrund von Rasse, Religion, Farbe, nationaler Herkunft, Geschlecht, Gender, Geschlechtsausdruck, sexueller Orientierung, Alter, Familienstand, Veteranenstatus oder Behinderungsstatus. Wir bieten angemessene Unterstützung, um sicherzustellen, dass alle Personen am Bewerbungs- oder Interviewprozess teilnehmen, wesentliche Arbeitsfunktionen ausführen und andere Vorteile und Privilegien der Beschäftigung erhalten können. Schließen Sie sich uns an und werden Sie Teil eines Teams, das die Grenzen der Technologie verschiebt und einen echten Einfluss auf die Welt ausübt.

Automatisch aus dem Original übersetzt.

Ausgeschrieben vor 4 Wochen

Ort

Auf Google Maps ansehen