Вывод потока с использованием VLLMPython

Программы на Python
Anonymous
Вывод потока с использованием VLLM

Сообщение Anonymous »

Я работаю над приложением, в котором использую LLM для анализа различных документов. Я хочу улучшить взаимодействие с пользователем путем потоковой передачи ответов в режиме реального времени.

фрагмент моего кода:

Код: Выделить всё

params = SamplingParams(temperature=TEMPERATURE,
                    min_tokens=128,
                    max_tokens=1024)
llm = LLM(MODEL_NAME,
      tensor_parallel_size=4,
      dtype="half",
      gpu_memory_utilization=0.5,
      max_model_len=27_000)

message = SYSTEM_PROMPT + "\n\n" + f"Question: {question}\n\nDocument: {document}"

response = llm.generate(message, params)
В своей текущей форме метод Generate ожидает, пока не будет сгенерирован весь ответ. Я хотел бы изменить это так, чтобы ответы передавались в потоковом режиме и отображались пользователю постепенно, повышая интерактивность.
Я использовал vllm==0.5.0.post1, когда я первым написал этот код.
Есть ли у кого-нибудь опыт реализации потоковой передачи для LLM=Любые рекомендации или примеры будут оценены!

Подробнее здесь: https://stackoverflow.com/questions/788 ... using-vllm

Вернуться в «Python»