Je vais configurer, valider et dépanner votre cluster GPU et votre infrastructure AI
Ingénieur infrastructure HPC et IA senior, GPU SLURM Linux
À propos de ce service
Vous avez des GPU. Vous avez besoin qu'ils fonctionnent comme une plateforme de calcul fiable.
Je construis et gère des infrastructures GPU et HPC en production : provisioning, validation des pilotes et de la stack CUDA, planification, réseau à haute vitesse et surveillance. Je travaille au niveau de l'infrastructure. Je ne suis pas ingénieur en ML et je ne prétendrai pas l'être.
CE QUE JE FAIS
Activation des nœuds GPU : pilotes NVIDIA, validation de la toolkit CUDA et du runtime, mode persistance, MIG
Validation de la santé : diagnostics DCGM, triage des erreurs Xid et ECC, vérifications thermiques et de puissance
Communication multi-nœuds GPU : tests nccl, benchmarking all-reduce, réglages NCCL, validation du chemin réseau
Planification : partitions GPU SLURM et GRES, cgroups et liaison, ou Kubernetes avec le plugin NVIDIA et GPU Operator
Surveillance : Prometheus, exportateur DCGM, tableaux de bord Grafana
Automatisation : rôles Ansible pour rendre la construction reproductible
AVANT DE COMMANDER
Envoyez-moi un message avec le nombre de nœuds, le modèle de GPU, l'interconnexion et ce que vous observez. Si ce n'est pas quelque chose que je peux réellement réparer, je vous le dirai.
Vous obtenez une configuration fonctionnelle, un rapport de benchmark montrant ce qui a changé, et une documentation écrite.
Serveur:
Serveur de base de données
Système opérateur:
Linux
Autres services de Support informatique I Offre
FAQ
Traduction automatique
Rédigez-vous des kernels CUDA ou entraînez-vous des modèles ?
Non. Je travaille sur l'infrastructure sous-jacente : provisioning, pilotes, planification, réseau et surveillance. Le code des modèles et les scripts d'entraînement sont hors de mon champ, et je préfère le dire plutôt que de prendre en charge un travail que je ne peux pas faire correctement.
De quel accès avez-vous besoin pour commencer ?
Accès SSH avec sudo sur les nœuds, et accès à BMC ou IPMI si des vérifications au niveau matériel sont nécessaires. Pour le diagnostic de base, un accès en lecture seule suffit généralement pour commencer.
Travaillez-vous avec des GPU cloud ou uniquement sur site ?
Les deux. Clusters bare-metal sur site et instances GPU AWS.
Nos GPU sont à peine utilisés. Pouvez-vous en déterminer la raison ?
Généralement oui. La faible utilisation est souvent liée à la planification, au chargement des données, au NUMA et à l'affinité, ou à l'interconnexion. Le diagnostic de base est conçu pour répondre précisément à cette question, et vous obtenez les mesures qui expliquent la réponse.
Supportez-vous les fabrics InfiniBand ?
Mon expérience en réseau à haute vitesse concerne Ethernet et RoCE, pas InfiniBand. Si votre fabric est InfiniBand, je vous le dirai avant que vous commandiez, plutôt que d'apprendre sur votre cluster.
2 avis concernant ce service
| (2) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Détails de la notation
- Niveau de communication avec le freelance
- Qualité de la livraison
- Valeur de la livraison
Trier par
A apreda1

États-Unis
I hired him again he assisted me with my project very effectively. I definitely recommend him
50 $US-100 $US
Prix
1 jour
Durée
Utile?A aimen39

Algérie
Best seller + communication + skills + knowledge
50 $US-100 $US
Prix
1 jour
Durée
H 
Réponse du freelance
Utile?
2 avis concernant ce service
| (2) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Détails de la notation
- Niveau de communication avec le freelance
- Qualité de la livraison
- Valeur de la livraison
Trier par
A apreda1

États-Unis
I hired him again he assisted me with my project very effectively. I definitely recommend him
50 $US-100 $US
Prix
1 jour
Durée
Utile?A aimen39

Algérie
Best seller + communication + skills + knowledge
50 $US-100 $US
Prix
1 jour
Durée
H 
Réponse du freelance
Utile?
