tykayn/transcription

Fork 1

Go to file

tykayn e784cec6ab update requirements

2021-03-23 12:06:27 +01:00

.idea

change conversion and readme

2021-02-18 15:46:55 +01:00

input

change conversion and readme

2021-02-18 15:46:55 +01:00

models

add converters from mp3

2021-02-19 10:27:46 +01:00

output

init transcription repo with install instructions

2021-02-18 10:16:30 +01:00

website

move website

2021-03-18 23:04:04 +01:00

.gitignore

fix count of lines in output, add name of original file to outputs

2021-02-21 11:35:48 +01:00

clean.sh

add converters from mp3

2021-02-19 10:27:46 +01:00

conversion_simple_fr.py

init transcription repo with install instructions

2021-02-18 10:16:30 +01:00

extract_srt.py

add conversion to srt file

2021-02-19 11:26:35 +01:00

flac_to_wav.sh

formats conversion files, a bash script for each. needs optimisation

2021-02-21 11:07:47 +01:00

install.sh

bouger modèle fr à l'installation

2021-03-23 11:20:50 +01:00

LICENSE.md

init transcription repo with install instructions

2021-02-18 10:16:30 +01:00

Makefile

rename some files, update readme

2021-02-19 11:08:13 +01:00

mkv_to_wav.sh

formats conversion files, a bash script for each. needs optimisation

2021-02-21 11:07:47 +01:00

mp3_to_wav.sh

formats conversion files, a bash script for each. needs optimisation

2021-02-21 11:07:47 +01:00

mp4_to_wav.sh

formats conversion files, a bash script for each. needs optimisation

2021-02-21 11:07:47 +01:00

ogg_to_wav.sh

formats conversion files, a bash script for each. needs optimisation

2021-02-21 11:07:47 +01:00

README.md

update requirements

2021-03-23 12:06:27 +01:00

transcript.sh

fix file name for outputs

2021-02-23 00:36:22 +01:00

wav_to_wav_mono.sh

fix file name for outputs

2021-02-23 00:36:22 +01:00

README.md

Transcription avec Vosk, par Tykayn

configuration pour transcrire des fichiers audio wav avec Vosk

mode d'emploi

installation

Prérequis

python3 (pour l'école serpentard)
pip3 version 19 (gestionnaire de paquets python)
git (gestion de version)
unzip (décompression de modèle)
jq (pour le nettoyage de fichier json)
ffmpeg (pour la conversion vers wav)
youtube-dl si vous souhaitez utiliser le website
4Go de ram, 2Go serait trop juste pour utiliser le modèle fr par défaut.
testé sur Ubuntu 20.04 pour les installer avec aptitude

sudo apt install jq python3-pip git ffmpeg

cloner ce dépot dans un dossier de travail

git clone https://forge.chapril.org/tykayn/transcription.git && cd transcription

installer vosk via le MakeFile, vérifiez les prérequis ci-dessus. une fois dans votre dossier de transcription fraîchement cloné, faites la commande:

make

mettre un fichier audio dans le dossier "input"
le convertir en wav mono (avec audacity par exemple)
lancer la transcription du wav mono. Une démo est disponible, extraite de l'émission Libre à vous!

make convert file=input/demo.wav

n'oubliez pas l'argument file=

la sortie texte de la transcription se trouve dans output output/demo/4_phrases.txt et devrait être affichée à la fin de l'exécution du script. Chaque fichier transcrit a un sous-dossier de son nom dans le dossier output. Ainsi, pour la démo qui se trouve dans input/demo.wav, les fichiers de transcription sont dans output/demo/

Précisions

vosk est capable de fournir d'autres informations comme la seconde de début et de fin de la phrase détectée. Cela pourrait être utile pour produire des fichiers de sous titre. Cela a été ajouté dans un script perl grâce à @r_a@framapiaf.org
les locuteurs ne sont pas détectés, toutes les phrases sont dites sans cette précision.
si deux personnes parlent rapidement l'une après l'autre, vosk considèrera qu'il s'agit d'une seule phrase.
les transcriptions peuvent être faites pour plusieurs langues, il faudra modifier le fichier "conversion_simple_fr.py" si on veut autre chose que du Français.

évolutions possibles

convertir un fichier mp3 vers WAV mono avec ffmpeg.
nettoyer l'écho et normaliser le fichier audio.
permettre le traitement en masse de plusieurs fichiers de podcast et leur donner un output nommé comme le fichier d'entrée afin de les distinguer.

liens

podcast libre à vous
transcriptions libre à lire
message parlant de transcription dans la liste de diffusion de l'april
site officiel de Vosk : installation , modèles de langue
sur Telegram
- groupe de discussion sur vosk (veille bibliographique sur la reconnaissance automatique de la parole)
- groupe d'aide de vosk
site cipherbliss.com
@tykayn sur Mastodon.

Languages

Shell 49.6%

Python 38.5%

PHP 8.9%

Hack 2.6%

Makefile 0.4%