# 章末小測驗

讓我們測試一下您在本章中學到了什麼！

### 1.你應該什麼時候訓練一個新的標記器？

### 2.當使用“ train_new_from_iterator()”時，使用文本列表生成器與文本列表相比有什麼優點？
 train_new_from_iterator()  接受的唯一類型。",
			explain: "文本列表是一種特殊的文本列表生成器，因此該方法也會接受這種方法。再試一次！"
		},
		{
			text: "您將避免立即將整個數據集載入內存中。",
			explain: "沒錯！每一批文本都會在你迭代的時候從內存中釋放出來，如果你使用數據集存儲文本的話，增益將尤其明顯。",
			correct: true
		},
		{
			text: "這將允許 Tokenizers 庫使用並行處理。",
			explain: "不，無論如何它都將使用並行處理。"
		},
        {
			text: "你訓練的標記器將產生更好的文本。",
			explain: "Tokenizer 不生成文本——您是否將其與語言模型混淆了？"
		}
	]}
/>

### 3.使用“快速”標記器的優點是什麼？

### 4.“token-classification”管道如何處理跨多個標記的實體？

### 5.“question-answering”流水線如何處理長上下文？

### 6.什麼是標準化？

### 7.什麼是子詞標記化的前標記化？

### 8.選擇描述標記化 BPE 模式最準確的句子。

### 9.選擇適用於 WordPiece 標記模型的句子。

### 10.選擇適用於 Unigram 標記模式的句子。

