course documentation
Quiz de fin de chapitre
0. Configuration
1. Les transformers
IntroductionTraitement du langage naturelQue peuvent faire les transformers ?Comment fonctionnent les transformers ?Les modèles basés sur l'encodeurLes modèles basés sur le décodeurLes modèles de séquence-à-séquenceBiais et limitationsRésuméQuiz de fin de chapitre
2. Utilisation de 🤗 Transformers
IntroductionDerrière le pipelineModèlesTokenizersManipulation de plusieurs séquencesTout assemblerUtilisation de base terminée !Quiz de fin de chapitre
3. Finetuner un modèle pré-entraîné
IntroductionPréparer les donnéesFinetuner un modèle avec l'API Trainer API ou KerasUn entraînement completFinetuning, coché !Quiz de fin de chapitre
4. Partager des modèles et des tokenizers
Le Hub d'Hugging FaceUtilisation de modèles pré-entraînésPartager des modèles pré-entraînésCréer une carte de modèlePartie 1 terminée !Quiz de fin de chapitre
5. La bibliothèque 🤗 Datasets
IntroductionQue faire si mon jeu de données n'est pas sur le Hub ?Il est temps de trancher et de découperDonnées massives ? 🤗 Datasets à la rescousse !Création de votre propre jeu de donnéesRecherche sémantique avec FAISS🤗 Datasets, coché !Quiz de fin de chapitre
6. La bibliothèque 🤗 Tokenizer
IntroductionEntraîner un nouveau tokenizer à partir d'un ancienLes pouvoirs spéciaux des tokenizers rapidesLes tokenizers rapides dans le pipeline de QANormalisation et prétokénisationLe tokenizer Byte-Pair EncodingLe tokenizer WordPieceLe tokenizer UnigramConstruction d'un tokenizer bloc par bloc🤗 Tokenizers, coché !Quiz de fin de chapitre
7. Les principales tâches en NLP
IntroductionClassification de tokensFinetuner un modèle de langage masquéTraductionRésumé de textesEntraîner un modèle de langage causal à partir de zéroRéponse aux questionsMaîtriser le NLPQuiz de fin de chapitre
8. Comment demander de l'aide
IntroductionQue faire lorsque vous obtenez une erreurDemander de l'aide sur les forumsDébogage du pipeline d'entraînementComment rédiger une bonne issuePartie 2 terminée !Quiz de fin de chapitre
9. Construire et partager des démos
Introduction à GradioConstruire votre première démoComprendre la classe InterfacePartager ses démos avec les autresIntégrations avec le Hub et SpacesFonctionnalités avancées d'InterfaceIntroduction aux Blocks🤗 Gradio, coché !Quiz de fin de chapitre
Evènements liés au cours
Glossaire
Quiz de fin de chapitre
Testons ce que vous avez appris dans ce chapitre !
1. Laquelle des tâches suivantes peut être considérée comme un problème de classification de <i> tokens </i> ?
2. Quelle partie du prétraitement pour la classification de <i> tokens </i> diffère des autres pipelines de prétraitement ?
3. Quel problème se pose lorsque nous tokenisons les mots dans un problème de classification de <i> tokens </i> et que nous voulons étiqueter les <i> tokens </i> ?
4. Que signifie « adaptation au domaine » ?
5. Quelles sont les étiquettes dans un problème de modélisation du langage masqué ?
6. Laquelle de ces tâches peut être considérée comme un problème de séquence à séquence ?
7. Quelle est la bonne façon de prétraiter les données pour un problème de séquence à séquence ?
8. Pourquoi existe-t-il une sous-classe spécifique de <code> Trainer </code> pour les problèmes de séquence à séquence ?
10. Quand devez-vous pré-entraîner un nouveau modèle ?
11. Pourquoi est-il facile de prétraîner un modèle de langage sur des batchs de textes ?
12. Quels sont les principaux défis lors du prétraitement des données pour une tâche de réponse à des questions ?
13. Comment le post-traitement est-il généralement effectué dans les réponses aux questions ?
Update on GitHub Trainer pour les problèmes de séquence à séquence ? compile() sur un transformer ?