Je déploierai votre LLM en production avec vLLM sur votre GPU cloud

I
ike_kolawole
I
ike_kolawole
Joshua
Certaines informations ont été traduites automatiquement.

À propos de ce service

Traduction automatique

Un modèle qui fonctionne dans un notebook et un autre qui supporte 1 000 utilisateurs simultanés sont deux projets différents. Je m'occupe du second.


Je suis un ingénieur senior en infrastructure ML, avec 7 ans de fiabilité en production. Récemment : infrastructure de service gérant plus de 50 000 tâches simultanées en moins de 100 ms pour plus de 1 000 utilisateurs, construite sur vLLM et SGLang avec des pools de nœuds Kubernetes GPU, à 35 % de coût infra en moins qu’au début.


Ce que vous obtenez :

  • Votre modèle open-weight (Llama, Mistral, Qwen, DeepSeek) servi avec vLLM
  • Déployé dans VOTRE compte cloud : vous gardez les clés, les données et le point d’accès
  • Auto-scaling GPU et batching optimisés pour l’inférence, pas pour le trafic web
  • Résultats de tests de charge, pour connaître la capacité réelle avant que vos utilisateurs la découvrent
  • Tableaux de bord de surveillance ; runbook sur Standard/Premium

Si votre budget GPU et votre objectif de latence ne correspondent pas, je vous le dirai avant que vous ne dépensiez un centime en calcul.


Basic : un modèle, un nœud GPU, testé en charge.

Standard : ajoute auto-scaling, tuning, tableaux de bord.

Premium : multi-modèles, optimisation des coûts, transfert de responsabilité.


Envoyez-moi les détails de votre modèle et de votre trafic ; le formulaire de requirements couvre le reste.

Découvrez Joshua

Joshua

Senior Platform Engineer

  • DeNigeria
  • Membre depuisjuil. 2026
  • Langues

    Anglais
Deployments on my platforms are boring, and that's the point. Seven years of production infrastructure: multi-cloud Kubernetes (EKS/AKS), Terraform at 20+ module scale, CI/CD with automatic rollback at 99.9% deploy success. One team went from 40% failed deploys to 5% after I rebuilt their pipelines; a fintech's PCI-DSS audits returned zero critical findings. I also build ML serving infrastructure: 50,000+ concurrent tasks at sub-100ms using vLLM on GPU node pools. Hand me a breaking pipeline, an untrusted cluster, or a cloud bill that grew quietly, and get it fixed properly.

Traduction automatique

Mon portfolio