Затем я загружаю BertTokenizer со следующими кодами:
Код: Выделить всё
from transformers import BertTokenizer
tokenizer = BertTokenizer.from_pretrained("./vocab")
print(len(tokenizer)) # 261173
print(tokenizer.vocab_size) # 51271
print(len(tokenizer.get_vocab())) # 261173
Причина, по которой я спрашиваю, заключается в том, что я использую платформу MEGATRON для предварительного обучения модели с помощью этого токенизатора, но после предварительного обучения кажется, что недавно добавленные словари все еще не используются. Соответствующий скрипт MEGATRON можно найти здесь.
Следует ли вручную заменить строку на return len(self.tokenizer) или return len(self.tokenizer.get_vocab()) ?
Подробнее здесь: https://stackoverflow.com/questions/790 ... -tokenizer