Staff Backline Engineer – ML/AI
- Type de contrat
- Temps plein
- Lieu
- Bellevue
- Salaire
- USD 170.4–255.6
- Première publication
P - 1381
Chez Databricks, nous sommes passionnés par l'idée de permettre aux équipes Data & AI de résoudre les problèmes les plus difficiles au monde — qu'il s'agisse de faire d'un nouveau mode de transport une réalité ou d'accélérer le développement de percées médicales. Nous y parvenons en construisant et en exploitant la meilleure plateforme d'infrastructure de données et d'IA au monde afin que nos clients puissent utiliser des insights de données approfondis pour améliorer leur entreprise.
Fondée par des ingénieurs, nous saisissons chaque opportunité pour relever des défis techniques, de la conception d'UI/UX de nouvelle génération pour l'interaction avec les données à la mise à l'échelle de nos services et de notre infrastructure sur des millions de machines virtuelles. Et nous ne faisons que commencer.
À propos de l'équipe
L'équipe Backline Engineering sert de pont critique entre le Frontline Support et l'Engineering. Nous traitons les problèmes techniques complexes et les escalades à travers l'écosystème Data et AI.
Avec un accent marqué sur le succès des clients, nous nous engageons à offrir une satisfaction client exceptionnelle en fournissant une expertise technique approfondie, une résolution proactive des problèmes et des améliorations continues de la plateforme. Nous mettons l'accent sur l'automatisation et les outils pour améliorer l'efficacité du dépannage, réduire les efforts manuels et améliorer la supportabilité globale de la plateforme et la santé de nos produits.
En développant des solutions intelligentes et en rationalisant les flux de travail, nous stimulons l'excellence opérationnelle et garantissons une expérience réjouissante tant pour les clients que pour les équipes internes.
En tant que Staff Backline Engineer, vous serez un expert technique et un point d'escalade pour certains des problèmes ML/AI les plus complexes. Vous travaillerez avec le Support, l'Engineering, le Product et les clients pour dépanner des problèmes difficiles, reproduire des incidents, identifier les causes racines et les mener à leur résolution.
Ce que vous ferez
- Servir de point d'escalade senior pour les problèmes complexes de ML/AI impliquant l'entraînement de modèles, l'inférence, le Model Serving, MLflow, le Feature Engineering, avec des connaissances de Spark, Delta Lake et des workloads distribués.
- Effectuer des investigations techniques approfondies en utilisant les logs, traces, métriques, le profiling, la configuration, le code source et les workloads des clients pour identifier la cause racine.
- Reproduire les problèmes des clients par l'expérimentation pratique, le développement Python/Spark, la construction de workloads, les changements de configuration et l'analyse de performance.
- Dépanner les échecs d'entraînement et d'inférence de modèles, la dégradation des performances, l'utilisation des ressources, les problèmes de mémoire/CPU/GPU, les problèmes d'exécution distribuée et les échecs de déploiement/runtime.
- Collaborer étroitement avec les équipes Engineering et Product pour mener les problèmes difficiles vers une résolution et influencer les améliorations de produits.
- Identifier les schémas d'échec récurrents et les transformer en meilleurs diagnostics, documentations, outils, automatisation et capacités de compétences Claude.
- Mentorer les ingénieurs et élever les capacités techniques de dépannage de l'organisation Support au sens large.
- Agir en tant que SME technique pour les domaines de la plateforme ML/AI et contribuer à des initiatives transversales à impact mondial.
Ce que nous recherchons
- Une expérience approfondie en dépannage de systèmes ML/AI distribués et la capacité de déboguer des problèmes à travers le code applicatif, les frameworks, l'infrastructure et la plateforme Databricks.
- Une solide expérience pratique de Python et la capacité de construire, modifier et déboguer des workloads ML en utilisant des frameworks tels que PyTorch, TensorFlow ou Scikit-Learn.
- Une compréhension approfondie des technologies Databricks ML/AI, y compris MLflow, Model Serving, Feature Engineering, Spark MLlib et la gestion du cycle de vie des modèles.
- Une solide connaissance d'Apache Spark, y compris les DataFrames, l'exécution de requêtes, le calcul distribué, la gestion de la mémoire, les shuffles et l'optimisation des performances.
- Une expérience du dépannage des performances d'entraînement et d'inférence, y compris l'utilisation CPU/GPU, les problèmes de mémoire, les goulots d'étranglement de données, la concurrence, la latence et l'exécution distribuée.
- Une expérience du déploiement ML et de l'infrastructure telle que Kubernetes, les plateformes ML cloud, CI/CD, le monitoring de modèles et les systèmes ML en production.
- La capacité de lire et de raisonner sur le code, les logs, les stack traces, les métriques, les traces, les plans d'exécution et le comportement du système plutôt que de se fier uniquement à la documentation ou aux recommandations de configuration.
- Une capacité démontrée à assumer de manière autonome des problèmes techniques ambigus à fort impact et à les mener du symptôme → investigation → cause racine → résolution.
- De solides compétences en communication technique et la capacité d'influencer l'Engineering, le Product, le Support et les clients.
Transparence de la fourchette de rémunération
Databricks s'engage à des pratiques de rémunération équitables et justes. La ou les fourchettes de rémunération pour ce rôle sont indiquées ci-dessous et représentent la fourchette de salaire prévue pour les rôles non commissionnables ou les gains cibles pour les rôles commissionnables. Les packages de rémunération réels sont basés sur plusieurs facteurs propres à chaque candidat, incluant mais ne se limitant pas aux compétences liées au poste, à la profondeur de l'expérience, aux certifications et formations pertinentes, et au lieu de travail spécifique. Sur la base des facteurs ci-dessus, Databricks prévoit d'utiliser toute la
Traduit automatiquement depuis l’original.
Publié il y a 3 jours