Je vais résoudre les problèmes et optimiser votre infrastructure Kubernetes
Ingénieur Infrastructure AI et Tech Lead
À propos de ce service
Votre charge de travail AI/ML échoue-t-elle, fonctionne-t-elle lentement ou n’utilise-t-elle pas efficacement vos GPUs ?
Je vais diagnostiquer, configurer et optimiser votre infrastructure GPU basée sur Kubernetes pour les charges de travail AI/ML.
Je peux vous aider avec :
Les charges de travail et déploiements GPU Kubernetes
La configuration et le dépannage des GPU NVIDIA
Docker et les charges de travail AI conteneurisées
La planification GPU et l’allocation des ressources
Les charges de travail distribuées multi-noeuds
Les problèmes de communication NCCL et GPU
InfiniBand et réseaux haute performance
Dépannage des pods, des nœuds et des déploiements
Optimisation des performances et de l’utilisation GPU
Logs, surveillance et débogage de l’infrastructure
Déploiement et fiabilité des charges de travail AI/ML
J’ai une expérience professionnelle dans la construction et l’exploitation d’infrastructures AI à grande échelle, y compris des clusters GPU, des plateformes Kubernetes, des environnements d’entraînement distribués et des charges de travail AI en production.
Ma démarche est pratique et axée sur l’identification de la cause racine, la mise en œuvre de la solution et l’amélioration de la fiabilité et des performances.
Veuillez me contacter avant de commander si votre environnement implique une infrastructure GPU multi-noeuds complexe, un entraînement distribué ou des charges de travail en production.
Outils:
Kubernetes
•
Docker
Frameworks:
Npm
•
Terraform
•
Ansible
Langage de programmation:
Bash
•
Go
•
Java
•
JavaScript
•
Python
•
Golang
Expertise:
Débogage
•
Développement
•
Configuration
