Je vais optimiser votre application LLM pour une latence et un coût plus faibles

C
chlee9
C
chlee9
Cheolhee Lee
Certaines informations ont été traduites automatiquement.

À propos de ce service

Traduction automatique

J'optimise les applications LLM qui sont trop lentes ou trop coûteuses.


Ce que j'ai réalisé en production :

- Réduction de 70 % de la latence p95 et de 38 % des coûts de service grâce au cache de contexte, à la sortie structurée et au routage des modèles

- Diminution de 49 % des tokens de sortie sans perte de qualité

- Accélération des endpoints de liste de 125 fois et d'une requête Threads de 411 ms à 1,6 ms

- Migration de trois modèles LLM et d'embedding vers un DGX sur site sans interruption


Comment cela fonctionne :

1. Vous partagez vos prompts, traces, configuration du modèle et vos chiffres de latence ou de coût

2. Je profile la pipeline et envoie un rapport priorisé

3. J'implémente les corrections et montre les benchmarks avant et après


Stack : OpenAI, Anthropic, vLLM, LangChain, RAG, pgvector, Python, TypeScript, Rust, Go, AWS.


Indiquez-moi votre p95 actuel et votre dépense mensuelle, je vous dirai ce qui est réaliste.

Découvrez Cheolhee Lee

Cheolhee Lee

AI Full Stack Developer specializing in LLM and RAG optimization

  • DeCorée du Sud
  • Membre depuisavr. 2021
  • Temps de réponse moy.1 heure
  • Langues

    Coréen, Anglais
I keep my employer and my clients unnamed here. I ship production AI systems end to end at an undisclosed B2B AI SaaS company - a sales-automation SaaS and a public-sector AI evaluation platform. Measured: LLM p95 latency -70%, serving cost -38%, output tokens -49% via context caching and structured output. 125x list speedup, threads query 411ms to 1.6ms, bundle 21.7MB to 2.3MB. Re-homed three LLM models to an on-prem DGX with zero downtime; passed TTA review for Korea's AI Verification program. TypeScript, Python, Rust, Go, React, PostgreSQL, AWS, RAG, vLLM, MCP.

Traduction automatique

Mon portfolio

Autres services de Développement IA I Offre