Data Science & IA · Étude de cas
DeepVox - ASR Ultra-Léger sur Représentations Codec2
Programme de recherche sur la reconnaissance et la traduction vocales hors ligne à partir de représentations discrètes Codec2 ultra-bas-débit.

Le point de départ
Transformer un besoin réel en système exploitable.
DeepVox étudie les frames Codec2 à 1200 bps comme représentation pivot pour construire un écosystème ASR, TTS et traduction vocale multilingue de moins de 200 Mo. La phase phonétique est validée et la phase ASR BiLSTM-CTC atteint désormais 42,6 % de WER et 20,5 % de CER avec KenLM sur Common Voice français. La prochaine expérimentation proposée remplace le BiLSTM par un Conformer-CTC de taille comparable.
Validation scientifique
Validation de la conservation phonétique des features Codec2 sur 80 000 échantillons Common Voice français : PER de 56 %, Top-5 de 80,7 % et voisement reconnu à 93 %.
Conduite de quatre runs ASR progressifs sur 20k, 80k, 300k puis 586k échantillons afin de mesurer l'effet du changement d'échelle et du fine-tuning.
Reconnaissance vocale Codec2
Entraînement d'un BiLSTM-CTC de 9,1 M de paramètres sur 586 000 échantillons, atteignant 52,8 % de WER et 21,3 % de CER en décodage greedy.
Ajout d'un beam search KenLM 5-gram réduisant le WER final à 42,6 % et le CER à 20,5 % sur 29 300 échantillons de test.
Pipeline de recherche & prochaine phase
Pipeline PyTorch/torchaudio reproductible avec preprocessing Codec2, datasets Common Voice, checkpoints inter-sessions Kaggle et évaluation WER/CER.
Étude comparative et protocole proposés pour un Conformer-CTC d'environ 9 M de paramètres, avec critères GO/NO-GO avant lancement du prochain run.
Stack & disciplines
Explorer les compétences du projet.
Clique sur une carte pour comprendre son rôle et la manière dont elle intervient dans la réalisation.