Je vais écrire un script python pour la reconnaissance vocale avec Faster Whisper


À propos de ce service
Traduction automatique
Vous cherchez une utilité privée, hors ligne, de reconnaissance vocale par IA ? Je vais créer un script Python personnalisé ou une application desktop CustomTkinter intégrée au modèle de pointe Faster-Whisper (Large-v3).
Pourquoi choisir cette solution IA locale ?
- 100 % hors ligne : pas de clés API, pas de frais mensuels.
- Accélération GPU : supporte CUDA/cuDNN pour un traitement rapide.
- Extraction automatique : extrait automatiquement l’audio des fichiers vidéo.
Spécifications techniques :
1. Entrées :
- Audio : .mp3, .wav, .m4a, .flac, .ogg
- Vidéo : .mp4, .mkv, .avi, .mov, .flv, .wmv
2. Langues : détection automatique ou sélection parmi plus de 99 langues mondiales (Vietnamien, Anglais, Chinois, Japonais, Coréen, Russe, Français, Allemand, Espagnol, etc.)
3. Exportation de sous-titres (ExportFormat) :
- TXT, SRT, VTT, ASS, XML, TTML
Ce que je propose dans mes packages :
- Scripts Python en ligne de commande propres et commentés avec guides d’installation.
- Applications GUI modernes avec barres de progression utilisant CustomTkinter.
- Packages autonomes .exe avec chargement paresseux intelligent pour les poids IA.
Je fournis un code source propre, bien commenté, et un support local continu. Apportons l’IA open-source directement à votre bureau !
Découvrez I'm Sad
Junior Developer Python Fullstack AI
- DeVietnam
- Membre depuisaoût 2026
Langues
Vietnamien, Russe, Anglais
Traduction automatique
FAQ
Traduction automatique
L’application nécessite-t-elle une connexion internet pour fonctionner ?
Non, le processus de transcription principal fonctionne à 100 % hors ligne sur votre machine locale. Cependant, lors de la toute première utilisation, le script peut télécharger automatiquement les poids du modèle IA nécessaires depuis Hugging Face si vous ne les avez pas téléchargés manuellement.
Cette application peut-elle utiliser ma GPU Nvidia pour un rendu plus rapide ?
Oui ! Si vous achetez le package Standard ou Premium, je configurerai le backend Python/CustomTkinter pour supporter CUDA et cuDNN, permettant au modèle Faster-Whisper d’utiliser votre carte graphique Nvidia pour une vitesse maximale.
Cette application peut-elle traiter directement des fichiers vidéo pour la transcription ?
Oui, absolument ! L’application supporte à la fois les entrées audio et vidéo. Si vous fournissez un fichier vidéo (tel que .mp4, .mkv ou .mov), le script gérera automatiquement l’extraction audio en arrière-plan avant d’exécuter le modèle IA Faster-Whisper.
Quels formats de sous-titres puis-je générer avec cet utilitaire ?
L’application est conçue avec une enum ExportFormat flexible. Vous pouvez exporter vos transcriptions dans 6 formats différents selon vos besoins : TXT (texte brut), SRT, VTT, ASS (sous-titres stylisés avancés), XML, et TTML.
