nllb-baoule-v1

Premier modèle de traduction pour le baoulé (Côte d'Ivoire, ISO 639-3 bci, langue kwa/tano), par 2ADT Consulting. Même méthodologie que 2ADT-Consulting/nllb-susu-v1, mais modèle entièrement séparé — le baoulé (kwa) et le susu (mandé) n'ont aucune parenté linguistique, donc aucun transfert n'était attendu en partageant un checkpoint.

Méthode

  • Base : NLLB-200-distilled-600M, nouveau token de langue bci_Latn ajouté, initialisé depuis aka_Latn (akan) — langue kwa/tano la plus proche déjà couverte par NLLB (contrairement au susu, initialisé depuis bam_Latn/bambara).
  • 4 directions : {fr,en} ↔ bci, un seul modèle.
  • Corpus biblique : ~143k paires bci-fr / ~140k bci-en (Bible, via Africa Corpus Builder), sous-échantillonné à 80k paires/direction pour l'entraînement.
  • Corpus quotidien (1236 paires train / 77 éval, stratifiées), sur-pondéré ×10 :
    • dictionnaire baoulé-français OCRisé (251 pages scannées, tesseract 400dpi, filtré contre un vocabulaire français de référence) — 865 paires
    • documents grammaticaux (BAOULE_A5, Parlons Baoulé) — 12 paires
    • manuel Peace Corps An Introduction to Spoken Baoule (1968, dialogues de salutations) — 12 paires
    • site baoule.ci (salutations, jours de la semaine, nombres 1 à 1 000 000, vocabulaire familial/animaux/nature, pronoms et conjugaison, expressions idiomatiques) — 424 paires
  • num_train_epochs=1 (garantit que chaque exemple, y compris les copies sur-pondérées du quotidien, est vu au moins une fois).

Résultats (chrF++)

Biblique (test) Quotidien (éval stratifiée, n=77)
bci → fr 40.7 18.2
fr → bci 44.4 10.4

Repères : <20 = faible, 30–40 = utilisable, >45 = bon pour une langue peu dotée (échelle du papier Wayen/susu).

Limites (honnêtes)

  • Le registre quotidien reste faible en absolu, malgré une nette amélioration au fil des itérations (voir historique ci-dessous). Le corpus biblique domine toujours largement le volume total.
  • Le dictionnaire source est un scan OCRisé : le français des définitions est fiable (~95%+), mais du bruit résiduel subsiste sur certains mots baoulé (tons/accents mal reconnus).
  • Contrairement au susu, aucune source de dialogue naturel riche n'a été trouvée pour le baoulé (le manuel Peace Corps n'a fourni que 12 paires propres après extraction manuelle — sa mise en page à 3 colonnes rendait l'extraction automatique peu fiable).
  • Pas d'évaluation humaine native à ce jour (contrairement au susu, qui a bénéficié d'annotateurs natifs).

Historique des itérations

  1. Run 1 : biblique complet + quotidien ×4, max_steps=6000 fixe → chrF quotidien quasi nul (7.0/3.4) : seuls 33% du corpus mélangé ont été vus, le quotidien (0.6% du mélange) n'a presque jamais été échantillonné.
  2. Run 2 : biblique sous-échantillonné (80k/direction), quotidien ×10, num_train_epochs=1 → chrF quotidien mesuré à 14.3/7.1, mais l'éval (50 phrases, uniquement dictionnaire) s'est révélée non représentative après enrichissement du corpus (tests qualitatifs bien meilleurs que le chiffre ne le suggérait : nombres, vocabulaire familial, salutations correctement traduits).
  3. Run 3 (ce modèle) : split train/éval quotidien reconstruit, stratifié sur les 4 sources → chrF quotidien enfin fiable (18.2/10.4).

Licence

Poids sous CC-BY-NC-4.0 (hérité du checkpoint NLLB-200 pré-entraîné). Les données bibliques (via YouVersion) et le dictionnaire OCRisé restent soumis à leurs propres conditions d'utilisation ; vérifier avant toute redistribution.

Downloads last month
20
Safetensors
Model size
0.6B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for GaindeNdiaye/nllb-baoule-v1

Finetuned
(388)
this model