Je vais optimiser votre application LLM pour une latence et un coût plus faibles


À propos de ce service
Traduction automatique
J'optimise les applications LLM qui sont trop lentes ou trop coûteuses.
Ce que j'ai réalisé en production :
- Réduction de 70 % de la latence p95 et de 38 % des coûts de service grâce au cache de contexte, à la sortie structurée et au routage des modèles
- Diminution de 49 % des tokens de sortie sans perte de qualité
- Accélération des endpoints de liste de 125 fois et d'une requête Threads de 411 ms à 1,6 ms
- Migration de trois modèles LLM et d'embedding vers un DGX sur site sans interruption
Comment cela fonctionne :
1. Vous partagez vos prompts, traces, configuration du modèle et vos chiffres de latence ou de coût
2. Je profile la pipeline et envoie un rapport priorisé
3. J'implémente les corrections et montre les benchmarks avant et après
Stack : OpenAI, Anthropic, vLLM, LangChain, RAG, pgvector, Python, TypeScript, Rust, Go, AWS.
Indiquez-moi votre p95 actuel et votre dépense mensuelle, je vous dirai ce qui est réaliste.
Découvrez Cheolhee Lee
AI Full Stack Developer specializing in LLM and RAG optimization
- DeCorée du Sud
- Membre depuisavr. 2021
- Temps de réponse moy.1 heure
Langues
Coréen, Anglais
Traduction automatique
