nllb-baoule-v1
Premier modèle de traduction pour le baoulé (Côte d'Ivoire, ISO 639-3 bci,
langue kwa/tano), par 2ADT Consulting. Même méthodologie que
2ADT-Consulting/nllb-susu-v1,
mais modèle entièrement séparé — le baoulé (kwa) et le susu (mandé) n'ont
aucune parenté linguistique, donc aucun transfert n'était attendu en partageant
un checkpoint.
Méthode
- Base : NLLB-200-distilled-600M, nouveau token de langue
bci_Latnajouté, initialisé depuisaka_Latn(akan) — langue kwa/tano la plus proche déjà couverte par NLLB (contrairement au susu, initialisé depuisbam_Latn/bambara). - 4 directions : {fr,en} ↔ bci, un seul modèle.
- Corpus biblique : ~143k paires bci-fr / ~140k bci-en (Bible, via Africa Corpus Builder), sous-échantillonné à 80k paires/direction pour l'entraînement.
- Corpus quotidien (1236 paires train / 77 éval, stratifiées), sur-pondéré ×10 :
- dictionnaire baoulé-français OCRisé (251 pages scannées, tesseract 400dpi, filtré contre un vocabulaire français de référence) — 865 paires
- documents grammaticaux (BAOULE_A5, Parlons Baoulé) — 12 paires
- manuel Peace Corps An Introduction to Spoken Baoule (1968, dialogues de salutations) — 12 paires
- site baoule.ci (salutations, jours de la semaine, nombres 1 à 1 000 000, vocabulaire familial/animaux/nature, pronoms et conjugaison, expressions idiomatiques) — 424 paires
num_train_epochs=1(garantit que chaque exemple, y compris les copies sur-pondérées du quotidien, est vu au moins une fois).
Résultats (chrF++)
| Biblique (test) | Quotidien (éval stratifiée, n=77) | |
|---|---|---|
| bci → fr | 40.7 | 18.2 |
| fr → bci | 44.4 | 10.4 |
Repères : <20 = faible, 30–40 = utilisable, >45 = bon pour une langue peu dotée (échelle du papier Wayen/susu).
Limites (honnêtes)
- Le registre quotidien reste faible en absolu, malgré une nette amélioration au fil des itérations (voir historique ci-dessous). Le corpus biblique domine toujours largement le volume total.
- Le dictionnaire source est un scan OCRisé : le français des définitions est fiable (~95%+), mais du bruit résiduel subsiste sur certains mots baoulé (tons/accents mal reconnus).
- Contrairement au susu, aucune source de dialogue naturel riche n'a été trouvée pour le baoulé (le manuel Peace Corps n'a fourni que 12 paires propres après extraction manuelle — sa mise en page à 3 colonnes rendait l'extraction automatique peu fiable).
- Pas d'évaluation humaine native à ce jour (contrairement au susu, qui a bénéficié d'annotateurs natifs).
Historique des itérations
- Run 1 : biblique complet + quotidien ×4,
max_steps=6000fixe → chrF quotidien quasi nul (7.0/3.4) : seuls 33% du corpus mélangé ont été vus, le quotidien (0.6% du mélange) n'a presque jamais été échantillonné. - Run 2 : biblique sous-échantillonné (80k/direction), quotidien ×10,
num_train_epochs=1→ chrF quotidien mesuré à 14.3/7.1, mais l'éval (50 phrases, uniquement dictionnaire) s'est révélée non représentative après enrichissement du corpus (tests qualitatifs bien meilleurs que le chiffre ne le suggérait : nombres, vocabulaire familial, salutations correctement traduits). - Run 3 (ce modèle) : split train/éval quotidien reconstruit, stratifié sur les 4 sources → chrF quotidien enfin fiable (18.2/10.4).
Licence
Poids sous CC-BY-NC-4.0 (hérité du checkpoint NLLB-200 pré-entraîné). Les données bibliques (via YouVersion) et le dictionnaire OCRisé restent soumis à leurs propres conditions d'utilisation ; vérifier avant toute redistribution.
- Downloads last month
- 20
Model tree for GaindeNdiaye/nllb-baoule-v1
Base model
facebook/nllb-200-distilled-600M