Je vais créer une API de transcription whisper pour votre produit


À propos de ce service
Traduction automatique
J'ai construit une pipeline vocale en streaming de bout en bout : reconnaissance vocale avec Whisper, synthèse vocale avec ElevenLabs, fonctionnant sur AWS Bedrock avec mémoire de conversation.
La plupart des services de transcription se limitent à envelopper l’API et s’arrêtent là. Les défis importants viennent après : fichiers longs qui expirent, latence audible lors d’un appel en direct, séparation des locuteurs, et une facture qui augmente plus vite que votre utilisation.
Ce que vous obtenez :
- Transcription Whisper avec horodatages et détection de la langue
- Streaming, pour que le texte arrive pendant que l’audio est encore en cours de lecture
- Mise en file d’attente et retries pour les fichiers longs ou échoués
- Suivi des coûts par minute d’audio
Mon parcours est dans les télécommunications. Je suis titulaire d’un Master en réseaux d’information de l’Odessa National Academy of Telecommunications et d’un CCNA, et j’ai travaillé sur une plateforme VoIP 5G industrielle chez Siemens avec chiffrement de bout en bout dans une équipe de 45 à 50 personnes.
Je travaille depuis l’Ukraine selon l’heure CET.
Indiquez-moi votre volume audio et votre objectif de latence, et je vous dirai ce qui est réaliste avant de passer commande.
Découvrez Michael S.
CTO and AI Developer, 18 Years: LangChain, RAG, Voice AI, Python Backends
- DeUkraine
- Membre depuisfévr. 2023
Langues
Russe, Ukrainien, Anglais, Allemand
Traduction automatique
Mon portfolio
FAQ
Traduction automatique
Quel moteur de reconnaissance vocale utilisez-vous ?
Whisper par défaut, car il gère bien les accents et le bruit de fond. Je travaille aussi avec des alternatives comme Deepgram ou AssemblyAI si votre projet fonctionne déjà avec l’un d’eux, ou si une de leurs fonctionnalités est mieux adaptée à vos besoins.
Supportez-vous la transcription en temps réel ou en streaming ?
Oui, à partir du package Standard. Le texte arrive en streaming pendant que l’audio est encore en cours, plutôt que d’attendre que le fichier soit entièrement traité pour voir le résultat.
Quelles langues sont prises en charge ?
Whisper couvre des dizaines de langues dès la sortie de la boîte, y compris la détection automatique de la langue. Envoyez-moi vos langues cibles et je confirmerai la couverture ainsi que toute éventuelle perte de précision avant votre commande.
Pouvez-vous ajouter la synthèse vocale pour que mon application puisse parler en retour ?
Oui, dans le package Premium. Je combine la transcription avec ElevenLabs pour une sortie vocale naturelle, vous offrant ainsi une pipeline complète de reconnaissance et de synthèse vocale, pas seulement la transcription.
Comment gérez-vous les fichiers audio longs ou échoués ?
Les fichiers longs entrent dans une file d’attente avec retries à partir du package Standard, ce qui évite qu’un seul traitement lent ou échoué bloque le reste de vos uploads ou fasse expirer la requête.
Cela peut-il fonctionner sur mon propre serveur ou compte cloud ?
Oui. Sur le package Premium, je déploie la pipeline dans votre environnement AWS ou Azure, pour que l’audio et l’infrastructure restent sous votre contrôle.
Comment le coût est-il calculé, et puis-je le maîtriser ?
Je consigne le coût par minute d’audio traitée pour chaque package, afin que vous sachiez exactement ce que coûte chaque requête, plutôt que d’être surpris par la facture mensuelle.
