Je vais créer un agent IA vocal utilisant elevenlabs, STT et LLM en Python


À propos de ce service
Traduction automatique
Déployez un agent IA vocal intelligent capable d'écouter, de raisonner et de parler en temps réel.
Je conçois des architectures personnalisées de Voice AI conversationnelle en Python, combinant un streaming audio à faible latence avec des LLM et la synthèse vocale.
Ce que je propose :
- Pipelines vocaux de bout en bout : détection d'activité vocale (VAD) + Whisper (STT) + raisonnement LLM + ElevenLabs (TTS)
- Routage audio à ultra faible latence via des pipes Linux asynchrones
- Intégration des appels vocaux Telegram via Pyrogram
- Déploiement sur GPU cloud (workers RunPod, traitement parallèle en file d'attente, scaling dynamique)
- Backend Python modulaire avec capture audio isolée et synthèse
Stack : Python, asyncio, ElevenLabs, Whisper, GPU RunPod, Pyrogram.
Veuillez me contacter avant de commander pour vérifier les identifiants API et les exigences de latence vocale.
Découvrez Moddie
Fullstack web developer
- DeUkraine
- Membre depuisoct. 2024
- Temps de réponse moy.1 heure
Langues
Ukrainien, Russe, Anglais
Traduction automatique
Mon portfolio
FAQ
Traduction automatique
Comment obtenez-vous une faible latence en synthèse vocale ?
Je diffuse des morceaux audio via des pipes Linux asynchrones directement dans le lecteur sans enregistrer de fichiers audio temporaires sur le disque, ce qui réduit la latence à moins de 600 ms
Ce agent vocal peut-il passer des appels téléphoniques ou Telegram ?
Oui, je peux intégrer l'agent avec les appels vocaux Telegram via Pyrogram ou des API de téléphonie externes (Twilio/LiveKit)

