Оллама мультимодальный - Джемма не видит изображенияPython

Программы на Python
Anonymous
Оллама мультимодальный - Джемма не видит изображения

Сообщение Anonymous »

В этом примере multimodal/main.py показан Оллама
Я пытаюсь сделать то же самое с изображением, загруженным с моей машины. Я использую модель gemma2:27b. Модель работает с чатом, так что это не проблема.
мой код

Код: Выделить всё

import os.path
import PIL.Image
from dotenv import load_dotenv
from ollama import generate

load_dotenv()
CHAT_MODEL_NAME = os.getenv("MODEL_NAME_LATEST")

image_path = os.path.join("data", "image_one.jpg")
test_image = PIL.Image.open(image_path)

# test 1:

for response in generate(CHAT_MODEL_NAME, 'What do you see', images=[test_image], stream=True):
print(response['response'], end='', flush=True)

# response: ollama._types.RequestError: image must be bytes, path-like object, or file-like object

# test 2: bytes

for response in generate(CHAT_MODEL_NAME, 'What do you see', images=[test_image.tobytes()], stream=True):
print(response['response'], end='', flush=True)

# response: Please provide me with the image!

# test 3: Path
for response in generate(CHAT_MODEL_NAME, 'What do you see', images=[image_path], stream=True):
print(response['response'], end='', flush=True)

# response: Please provide me with the image!
Как правильно загрузить изображение в Gemma
Кросс опубликован на форуме проблемы 289

Подробнее здесь: https://stackoverflow.com/questions/790 ... eing-image

Вернуться в «Python»