Une fois un fichier téléchargé, VidBee en extrait le texte sur cet ordinateur. La reconnaissance utilise des modèles IA locaux. L’audio n’est pas envoyé à une API cloud, donc entretiens et fichiers sensibles restent privés, et fonctionnent hors ligne une fois les modèles installés.
La transcription est cherchable, annotée par locuteur, et alignée sur la lecture : cliquez une ligne pour y sauter.
Fonctions principales
- Reconnaissance des locuteurs — séparer les voix, voir le temps de parole, aller à chaque personne
- Transcriptions précises — choisir un modèle local, lire le texte horodaté à côté du lecteur
- 100+ langues — Whisper détecte la langue ; d’autres familles sont plus fortes en CJK ou en anglais
- Recherche — trouver un mot, surligner, copier un passage, sauter à l’instant
- Export — texte, Markdown, sous-titres, ou vidéo avec légendes
- Confidentialité — la parole reste ici ; les modèles tournent sans réseau après le premier téléchargement
- File — déposez plusieurs fichiers ; VidBee les traite en arrière-plan
Ouvrez Transcripts dans la barre latérale, ou partez d’un téléchargement terminé. Importez aussi un fichier local avec Add audio or video, ou déposez / collez un média sur la page Transcripts.

La page est marquée Experimental et pourra plus tard fusionner avec Downloads. Statuts :
- Queued / Processing / Retrying soon — une tâche ASR locale attend ou tourne
- Transcript ready — dictée locale terminée (icône étincelle)
- Video captions — piste de sous-titres du téléchargement
- No speech — aucun voix détectée
- Cancelled ou une erreur — Retry depuis la ligne ou la page
Comment lancer
- Téléchargez une vidéo ou un audio, importez un fichier, ou déposez-le sur Transcripts.
- Attendez la fin de l’enregistrement.
- Cliquez l’élément dans Transcripts, ou Transcribe / View transcript sur la ligne de téléchargement.
- Optionnel : Transcribe after download dans Settings → Transcription. Les téléchargements réussis suivants lancent une transcription en arrière-plan. Les fichiers sans parole sont ignorés. Couper l’option n’annule pas les jobs déjà en file.
Vous pouvez mettre beaucoup de fichiers audio ou vidéo en file — un dossier d’interviews, un backlog de podcasts, un lot d’imports. La reconnaissance a une limite de concurrence (un job par défaut) pour ne pas saturer la RAM. Augmentez Maximum number of active transcripts si cet ordinateur a assez de mémoire. Un long fichier reste en Processing. Vous pouvez Stop un job en cours et Retry un échec.
Le premier usage télécharge les modèles ASR. Une bannière montre la progression. Ensuite, la transcription n’a plus besoin du réseau. Settings → Transcription permet de les retélécharger, d’en changer, ou de supprimer ceux inutilisés.
Lire une transcription
Média à gauche, texte à droite. Faites glisser la poignée pour redimensionner ou replier le panneau.

Lecteur
- Lecture, pause, seek, volume, muet, vitesse, ±15 s, plein écran
- Sous-titres optionnels sur l’image
- Si la lecture in-page échoue, le texte reste lisible ; ouvrez le fichier depuis Downloads pour un autre lecteur
- Une barre now playing reste si vous quittez la page ; la position est mémorisée
Recherche et légendes
- Chaque ligne a un horodatage. Cliquez une ligne (ou un mot) pour sauter
- La recherche trouve un mot ou une phrase dans toute la transcription (y compris les noms de locuteurs). Les correspondances sont surlignées ; précédent / suivant pour circuler
- Sélectionnez un passage, puis copiez ou partagez en image
- Le suivi garde la ligne courante visible ; défiler met en pause, puis Return to the position playing now
Reconnaissance des locuteurs
VidBee sépare les voix qui se chevauchent et étiquette chaque locuteur. Avatars colorés et barres de temps sous le lecteur : cliquez une barre pour aller à cette personne.
- Adjust speakers fixe un nombre (Auto, 1, 2, …) et réétiquette le texte sans relancer l’ASR
- L’onglet Info : chaîne, durée, fichier, modèle, langue, nombre de locuteurs et de segments

Sources
VidBee peut afficher :
- Sous-titres vidéo, y compris par langue et pistes auto
- AI transcript issu de la dictée locale
S’il y en a plusieurs, utilisez le sélecteur dans l’en-tête. Étincelle = ASR local. Icône sous-titres = piste captions.
Précision et modèles
Choisissez un modèle local adapté à cet ordinateur : Tiny pour la vitesse, Small ou Base pour une machine typique, plus lourd pour plus de précision. La lecture reste calée sur le texte : cliquez une ligne pour entendre ce moment.
Not happy with this transcript ? ouvre le choix de modèle, télécharge un modèle plus lourd si besoin, et relance. La transcription actuelle est conservée en historique. Vous pouvez quitter la page.
Si le résultat est No speech, Transcribe anyway quand vous pensez à une erreur (voix faible, musique).
Langues
Les modèles Whisper couvrent 100+ langues et détectent ce qui est parlé. Inutile de choisir la langue d’abord.
Les autres familles privilégient certaines langues :
- SenseVoice — CJK + anglais, dont le cantonais
- Parakeet — surtout l’anglais
- Qwen3-ASR — meilleure précision chinoise
Settings → Transcription indique taille, langues, et une recommandation pour ce PC (OS, GPU, RAM, cœurs, langue d’interface).
Export
Export prévisualise le texte, puis copie ou enregistre.
Styles : Transcript, Subtitles, Segments, Whisper, Video + Subs.
Formats texte : .txt et .md. Options : regroupement (None, Words, Sentences) et Show timestamp.

Pour Video + Subs :
- Soft — piste de sous-titres, activable dans le lecteur, rapide, sans perte
- Hard — incrustation, ré-encodage, sous-titres non désactivables
L’audio seul exporte du texte. Un long export vidéo peut être annulé.
Réglages transcription
Settings → Transcription
- Transcribe after download
- Maximum number of active transcripts
- Catalogue de modèles (taille, langues) et recommandation pour ce PC (OS, GPU, RAM, cœurs, langue d’interface)
Téléchargez, activez ou supprimez un modèle sans toucher aux autres. Le détail des langues est dans la section Langues.

Settings → Advanced → Download source bascule GitHub / Chine (ModelScope) si les téléchargements de modèles sont lents.
Confidentialité
La transcription est faite pour les fichiers qui ne doivent pas quitter la machine.
- Parole sur l’appareil — des modèles locaux font la reconnaissance. VidBee n’envoie pas l’audio pour la dictée.
- Hors ligne — une fois les modèles sur le disque, vous transcrivez sans réseau.
- Fichiers locaux — médias et transcriptions restent dans les dossiers que vous contrôlez.
- L’IA est à part — les prompts IA n’envoient que le texte au fournisseur activé. Ollama et LM Studio gardent aussi cette étape en local. Les clés API restent dans l’app.
Sur une transcription terminée, lancez ces prompts pour un résumé, une FAQ, ou une autre vue du même texte.