Je déploierai et gérerai l'infrastructure mlops, llm et gpu sur aws et kubernetes
Ingénieur DevOps senior en IA : AWS, Kubernetes, API ComfyUI, DevSecOps
À propos de ce service
Je mets les modèles d'IA en production et je les maintiens en fonctionnement. Un script d'entraînement n'est pas un produit. Un service surveillé, versionné, avec autoscaling l'est.
Outils:
Kubernetes
•
Docker
•
Amazon EKS
Frameworks:
Terraform
•
Ansible
Langage de programmation:
Bash
•
Go
•
Python
Expertise:
Installation
•
Migration
•
Débogage
Autres services de Ingénierie DevOps I Offre
FAQ
Traduction automatique
Quels modèles pouvez-vous déployer ?
Tout modèle open source sur Hugging Face, plus Llama, Mistral, Qwen, DeepSeek et vos propres fine tunes. Pour l'image et la vidéo, je gère aussi Flux, SDXL et Wan. Dites-moi le modèle et je vous confirmerai le GPU nécessaire.
Ai-je besoin de mon propre compte cloud ?
Oui, et c'est volontaire. Tout fonctionne dans votre compte AWS, GCP ou RunPod, vous possédez l'infrastructure et contrôlez la facturation. Je l'installe et vous la remets.
Combien cela coûtera-t-il par mois ?
Cela dépend de la taille du modèle et du trafic. Avant votre commande, je vous donne une estimation de dimensionnement : type de GPU, utilisation prévue et fourchette mensuelle. Les instances spot et le scaling à zéro réduisent généralement beaucoup le coût.
Obtiens-je le code source Terraform et Helm ?
Toujours. Vous recevez le dépôt complet, les Dockerfiles, les charts Terraform ou Helm et la documentation API, pour que vous ou un autre ingénieur puissiez le maintenir plus tard.
Pouvez-vous réparer une configuration existante au lieu d'en créer une nouvelle ?
Oui. Les déploiements défaillants, les crashs OOM, les nœuds GPU qui ne planifient pas, les factures cloud incontrôlées et l'infrastructure non documentée font partie de ce que je gère.
Proposez-vous des LLM auto-hébergés sur site ?
Oui. Ollama ou vLLM avec Open WebUI sur votre propre serveur ou station GPU, totalement hors ligne, sans que les données quittent votre réseau.
Quel type de surveillance puis-je obtenir ?
Prometheus et Grafana avec tableaux de bord pour la latence, le débit, l'utilisation du GPU, le taux d'erreur et le coût par requête, plus des alertes qui vous préviendront avant que vos utilisateurs ne s'en aperçoivent.
Quelles sont vos horaires de travail?
Je suis disponible 24/7 et je travaille selon les horaires US, donc nous pouvons discuter dans votre fuseau horaire. Je réponds généralement en une heure.
