Je vais quantifier votre modèle d'IA


À propos de ce service
Traduction automatique
Vos factures GPU cloud deviennent-elles excessives, ou votre modèle fine-tuned est-il trop lourd pour fonctionner sur du matériel en edge ?
Je suis ingénieur en systèmes d'apprentissage automatique spécialisé dans la quantification en faible bit, l'optimisation de l'inférence et le déploiement en edge. Je prends des modèles de langage, de vision et de mélange d'experts (MoE) et réduis leur empreinte mémoire de 50 % à 80 % sans compromettre la précision.
Que vous ayez besoin d'un modèle de 70B compressé pour des GPU grand public, d'un modèle de 7B fonctionnant sur un Mac/iPhone Apple Silicon, ou d'un fichier GGUF calibré pour la conformité locale de votre entreprise, je construirai le pipeline d'exécution exact dont vous avez besoin.
Ce dans quoi je me spécialise :
* Formats & Runtimes : GGUF (llama.cpp), MLX (Apple Silicon Mac/iOS), EXL2, AWQ, GPTQ, bitsandbytes (NF4/FP8).
* Architectures de modèles : Llama 3, Qwen 2.5 / 3.8, Mistral, Gemma, modèles MoE (OLMoE, Mixtral), et modèles Vision-Language (VLMs).
* Matériel cible : GPU NVIDIA unique (L4, A10, RTX 4090), Apple Silicon (mémoire unifiée M-series, iOS), et inférence CPU.
* Précision & qualité : Calibration avancée (imatrix), quantification sensible à l'activation, et vérification de qualité déterministe (Perplexity & évaluations en aval).
Découvrez Kaleb C
Senior Data AI Leader
- DeÉtats-Unis
- Membre depuismai 2024
Langues
Anglais
Traduction automatique

