Mesures des 8 et 9 octobre 2026
Résultats et méthode
Tous nos chiffres, avec leurs limites. Ils viennent de jeux de test que les modèles n'ont pas vus pendant l'entraînement ; quand un test est moins propre qu'il n'y paraît, nous le disons.
Reconnaissance de la parole
Transcripteur v4
Base : famille w2v-BERT 2.0 (licence MIT), entraînée par nos soins pour le baoulé. Mesure : le taux de caractères erronés (CER) et de mots erronés (WER), après mise en minuscules et suppression de la ponctuation ; les tons sont conservés. Plus bas est meilleur.
553 phrases lues au téléphone par 4 locuteurs absents de l'entraînement. WER 28,3 %.
Même test, par notre serveur, espaces non comptés. IC 95 % [10,5 – 11,8]. WER 28,3 % [26,9 – 29,9].
| Jeu de test | Extraits | CER | WER |
|---|---|---|---|
| Téléphone, locuteurs jamais entendus | 553 | 10,3 % | 28,3 % |
| Enregistrements de terrain, jeu de test public | 479 | 8,4 % | 25,7 % |
| Phrases lues par des bénévoles, jeu de test public ¹ | 562 | 8,0 % | 20,1 % |
| Textes lus, jeu de test public ² | 192 | 4,1 % | 11,6 % |
| Lecture biblique, livres tenus à l'écart | 420 | 4,1 % | 9,8 % |
Dans ce tableau, le CER compte les espaces comme des caractères. ¹ Phrases différentes de l'entraînement, mais les 15 locuteurs de ce test figurent aussi dans nos données d'entraînement : chiffre optimiste. ² Même genre de textes que le test « téléphone » ; ce jeu ne permet pas de vérifier si ses locuteurs apparaissent aussi dans sa partie d'entraînement.
| Jeu de test | CER sans espaces | CER avec espaces | WER |
|---|---|---|---|
| Téléphone, locuteurs jamais entendus (553) | 11,2 % [10,5 – 11,8] | 10,3 % [9,7 – 10,9] | 28,3 % [26,9 – 29,9] |
| Phrases lues par des bénévoles (562) ¹ | 8,7 % [7,7 – 10,0] | 8,0 % [7,0 – 9,2] | 19,9 % [18,3 – 21,7] |
Recoupements de texte
Une vérification automatique compare le test « téléphone » à tout ce qui a servi à l'entraînement. Aucun enregistrement ni locuteur commun. Mais 16 phrases du test existent telles quelles dans nos textes d'entraînement (13 sont des expressions d'un à trois mots, 3 des phrases complètes présentes dans des données d'entraînement antérieures), et 3 sont presque identiques.
Même genre de textes
Le test « téléphone » et l'un de nos jeux d'entraînement ajoutés pour la v4 sont des lectures du même genre de textes. Les phrases identiques ou presque ont été retirées de l'entraînement, mais une partie du progrès sur ce test peut venir de cette ressemblance.
Deux définitions du CER
Notre évaluation interne compte les espaces ; le banc d'essai de l'API ne les compte pas. Mesurés de la même façon, l'API et l'évaluation interne donnent le même résultat (10,3 %).
Traduction
Baoulé ↔ français
Jeu de test « vie courante » : 316 paires de phrases jamais vues à l'entraînement. Mesure : chrF++ (ressemblance des caractères et des mots avec une traduction de référence humaine, de 0 à 100). Plus haut est meilleur. Le baoulé est noté sans les marques de ton.
| Modèle | Base et licence | baoulé → français | français → baoulé |
|---|---|---|---|
| Commercial (5ᵉ version, 9 octobre) | Famille MADLAD-400, licence Apache 2.0 : utilisable commercialement | 34,7 | 34,1 |
| Recherche (3ᵉ version, 8 octobre) | Famille NLLB-200, licence non commerciale (CC BY-NC 4.0) | 32,3 | 38,0 |
- Intervalles de confiance. Mesuré à travers l'API, le modèle Recherche obtient 32,2 [30,3 – 34,3] et 37,5 [35,5 – 39,6] (le serveur décode avec des réglages légèrement différents). Pour le modèle Commercial, le gain sur sa version précédente est de +1,6 [0,6 – 2,6] vers le français et de +2,2 [1,2 – 3,2] vers le baoulé (rééchantillonnage, 1 000 tirages).
- Lequel choisir ? Le modèle Recherche est le meilleur vers le baoulé ; le modèle Commercial est le meilleur vers le français et le seul utilisable dans un produit payant.
| Partie | Phrases | Commercial bci → fra | Commercial fra → bci | Recherche bci → fra | Recherche fra → bci |
|---|---|---|---|---|---|
| Conversation libre | 166 | 31,6 | 29,7 | 28,2 | 32,2 |
| Exemples de dictionnaire | 112 | 37,4 | 38,8 | 37,3 | 47,0 |
| Questions-réponses sur la santé | 38 | 43,8 | 46,5 | 43,4 | 53,1 |
| Registre | Phrases | Commercial bci → fra | Commercial fra → bci | Recherche bci → fra | Recherche fra → bci |
|---|---|---|---|---|---|
| Contes | 54 | 23,1 | 25,7 | 20,6 | 28,4 |
| Bible, passages tenus à l'écart | 227 | 37,8 | 35,0 | 47,4 | 39,5 |
Un test proche de l'entraînement
Les phrases du test viennent des mêmes sources (mêmes documents, mêmes locuteurs) qu'une partie des données d'entraînement. Les phrases elles-mêmes sont différentes : toute paire d'entraînement identique ou très proche (90 % de ressemblance ou plus) d'une phrase de test a été retirée. Les chiffres sont donc plutôt optimistes.
Notre point faible
Notre partie la plus faible est la conversation libre, et les contes le sont plus encore. C'est exactement ce que le programme Voix Baoulé doit améliorer : de vraies conversations, dans de vraies conditions.
Des tests encore petits
316 phrases, c'est peu : un écart d'un ou deux points entre deux modèles peut tenir au hasard. Il n'existe pas encore de jeu de test public de référence pour le baoulé ; nous en construisons un.
Notre méthode
Quatre étapes, les mêmes pour la parole et pour le texte.
1. Rassembler
Livres bilingues numérisés et lus par notre OCR, enregistrements publics avec leur texte, puis nos propres enregistrements, consentis et rémunérés.
2. Unifier l'orthographe
Les textes anciens sont convertis vers l'orthographe moderne (ɛ, ɔ…). Chaque règle est mesurée : sur un corpus d'essai de 14 499 mots, la conversion finale reconnaît 88,9 % des mots, contre 70,8 % avec des règles simples.
3. Vérifier l'alignement
Chaque extrait audio est aligné sur son texte et noté, chaque phrase sur sa traduction ; les paires douteuses sont écartées avant l'entraînement, et des échantillons sont relus à la main.
4. Mesurer à l'écart
Les jeux de test sont séparés avant l'entraînement ; un contrôle automatique cherche les enregistrements, locuteurs et phrases en commun ; chaque score est donné avec son intervalle de confiance (1 000 rééchantillonnages).
Ce que nous ne publions pas
Nous ne publions ni les poids de nos modèles, ni la liste détaillée de nos sources de données, ni le détail de nos chaînes de traitement. Une question sur ces mesures ? Écrivez à contact@abyshire.ci.
Dernière mise à jour : 10 octobre 2026.