course documentation
Quiz de fin de chapitre
0. Configuration
1. Les transformers
IntroductionTraitement du langage naturelQue peuvent faire les transformers ?Comment fonctionnent les transformers ?Les modèles basés sur l'encodeurLes modèles basés sur le décodeurLes modèles de séquence-à-séquenceBiais et limitationsRésuméQuiz de fin de chapitre
2. Utilisation de 🤗 Transformers
IntroductionDerrière le pipelineModèlesTokenizersManipulation de plusieurs séquencesTout assemblerUtilisation de base terminée !Quiz de fin de chapitre
3. Finetuner un modèle pré-entraîné
IntroductionPréparer les donnéesFinetuner un modèle avec l'API Trainer API ou KerasUn entraînement completFinetuning, coché !Quiz de fin de chapitre
4. Partager des modèles et des tokenizers
Le Hub d'Hugging FaceUtilisation de modèles pré-entraînésPartager des modèles pré-entraînésCréer une carte de modèlePartie 1 terminée !Quiz de fin de chapitre
5. La bibliothèque 🤗 Datasets
IntroductionQue faire si mon jeu de données n'est pas sur le Hub ?Il est temps de trancher et de découperDonnées massives ? 🤗 Datasets à la rescousse !Création de votre propre jeu de donnéesRecherche sémantique avec FAISS🤗 Datasets, coché !Quiz de fin de chapitre
6. La bibliothèque 🤗 Tokenizer
IntroductionEntraîner un nouveau tokenizer à partir d'un ancienLes pouvoirs spéciaux des tokenizers rapidesLes tokenizers rapides dans le pipeline de QANormalisation et prétokénisationLe tokenizer Byte-Pair EncodingLe tokenizer WordPieceLe tokenizer UnigramConstruction d'un tokenizer bloc par bloc🤗 Tokenizers, coché !Quiz de fin de chapitre
7. Les principales tâches en NLP
IntroductionClassification de tokensFinetuner un modèle de langage masquéTraductionRésumé de textesEntraîner un modèle de langage causal à partir de zéroRéponse aux questionsMaîtriser le NLPQuiz de fin de chapitre
8. Comment demander de l'aide
IntroductionQue faire lorsque vous obtenez une erreurDemander de l'aide sur les forumsDébogage du pipeline d'entraînementComment rédiger une bonne issuePartie 2 terminée !Quiz de fin de chapitre
9. Construire et partager des démos
Introduction à GradioConstruire votre première démoComprendre la classe InterfacePartager ses démos avec les autresIntégrations avec le Hub et SpacesFonctionnalités avancées d'InterfaceIntroduction aux Blocks🤗 Gradio, coché !Quiz de fin de chapitre
Evènements liés au cours
Glossaire
Quiz de fin de chapitre
1. Quel est l’ordre du pipeline de modélisation du langage ?
2. Combien de dimensions le tenseur produit par le <i> transformer </i> de base possède-t-il et quelles sont-elles ?
3. Lequel des éléments suivants est un exemple de tokenisation en sous-mots ?
4. Qu’est-ce qu’une tête de modèle ?
5. Qu’est-ce qu’un AutoModel?
6. Quelles sont les techniques à connaître lors de la mise en batch de séquences de longueurs différentes ?
7. Quel est l’intérêt d’appliquer une fonction SoftMax aux logits produits par un modèle de classification de séquences ?
8. Autour de quelle méthode s’articule la majeure partie de l’API <i> tokenizer </i> ?
9. Que contient la variable result dans cet exemple de code ?
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("bert-base-cased")
result = tokenizer.tokenize("Hello!")10. Y a-t-il un problème avec le code suivant ?
from transformers import AutoTokenizer, AutoModel
tokenizer = AutoTokenizer.from_pretrained("bert-base-cased")
model = AutoModel.from_pretrained("gpt2")
encoded = tokenizer("Hey!", return_tensors="pt")
result = model(**encoded)