фрагмент моего кода:
Код: Выделить всё
params = SamplingParams(temperature=TEMPERATURE,
min_tokens=128,
max_tokens=1024)
llm = LLM(MODEL_NAME,
tensor_parallel_size=4,
dtype="half",
gpu_memory_utilization=0.5,
max_model_len=27_000)
message = SYSTEM_PROMPT + "\n\n" + f"Question: {question}\n\nDocument: {document}"
response = llm.generate(message, params)
Я использовал vllm==0.5.0.post1, когда я первым написал этот код.
Есть ли у кого-нибудь опыт реализации потоковой передачи для LLM=Любые рекомендации или примеры будут оценены!
Подробнее здесь: https://stackoverflow.com/questions/788 ... using-vllm