BertTokenizer.from_pretrained вызывает ошибку UnicodeDecodeErrorPython

Программы на Python
Anonymous
BertTokenizer.from_pretrained вызывает ошибку UnicodeDecodeError

Сообщение Anonymous »

Я предварительно обучил pytorch_model.bin на основе сценария предварительного обучения. Однако когда я загружаю его следующими кодами, он вызывает UnicodeDecodeError. Коды следующие:

Код: Выделить всё

from transformers import BertTokenizer
tokenizer = BertTokenizer.from_pretrained("/path/to/pytorch_model.bin") # Raise UnicodeDecodeError
Обратная трассировка:

Код: Выделить всё

Traceback (most recent call last):
File "", line 1, in 
File "/home/jupyter-raptor/.local/lib/python3.10/site-packages/transformers/tokenization_utils_base.py", line 1811, in from_pretrained
return cls._from_pretrained(
File "/home/jupyter-raptor/.local/lib/python3.10/site-packages/transformers/tokenization_utils_base.py", line 1965, in _from_pretrained
tokenizer = cls(*init_inputs, **init_kwargs)
File "/home/jupyter-raptor/.local/lib/python3.10/site-packages/transformers/models/bert/tokenization_bert.py", line 218, in __init__
self.vocab = load_vocab(vocab_file)
File "/home/jupyter-raptor/.local/lib/python3.10/site-packages/transformers/models/bert/tokenization_bert.py", line 121, in load_vocab
tokens = reader.readlines()
File "/opt/tljh/user/lib/python3.10/codecs.py", line 322, in decode
(result, consumed) = self._buffer_decode(data, self.errors, final)
UnicodeDecodeError: 'utf-8' codec can't decode byte 0x80 in position 64: invalid start byte
Как решить эту проблему?
Версии:
  • трансформеры 4.28.1
  • токенизаторы 0.13.3
  • Python 3.10.10


Подробнее здесь: https://stackoverflow.com/questions/789 ... ecodeerror

Вернуться в «Python»