Я использую приведенный выше пример кода unsloth со своими собственными данными для точной настройки с помощью lora_adapter, но когда я меняю приведенный ниже фрагмент, если False на True , выходные данные модели адаптера Lora изменяются. Кажется, что загрузка модели с помощью lora_model меняет поведение, но я понятия не имею, как сделать выходные данные одинаковыми до и после загрузки модели адаптера Lora. Помимо использования собственных данных и изменения приведенного ниже фрагмента, если значение False на True, я ничего не меняю в примере кода.
#the snippet
if True: # change False to True
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained(
model_name = "lora_model", # YOUR MODEL YOU USED FOR TRAINING
max_seq_length = max_seq_length,
dtype = dtype,
load_in_4bit = load_in_4bit,
)
FastLanguageModel.for_inference(model) # Enable native 2x faster inference
# alpaca_prompt = You MUST copy from above!
inputs = tokenizer(
[
alpaca_prompt.format(
"What is a famous tall tower in Paris?", # instruction
"", # input
"", # output - leave this blank for generation!
)
], return_tensors = "pt").to("cuda")
from transformers import TextStreamer
text_streamer = TextStreamer(tokenizer)
_ = model.generate(**inputs, streamer = text_streamer, max_new_tokens = 128)
Подробнее здесь: https://stackoverflow.com/questions/790 ... ined-model