Я перехожу от ручной настройки моего решения RAG в Azure к настройке всего программного обеспечения с помощью пакета SDK Azure Python. У меня есть контейнер с одним pdf. При настройке вручную вы увидите, что количество документов в созданном индексе составляет 401, а при настройке фрагментирования - 256. При использовании моего пользовательского набора навыков:
split_skill = SplitSkill( имя="разделить", описание="Разделение навыков на фрагменты документов", контекст="/документ", text_split_mode="страницы", default_language_code="ru", Maximum_page_length=300, # почему нельзя установить значение 256, если это можно сделать вручную? page_overlap_length = 30, входы=[ InputFieldMappingEntry(name="text", source="/document/content"), ], выходы=[ OutputFieldMappingEntry(name="textItems", target_name="pages") ], ) Я получаю 271. Я хочу максимально имитировать настройку ручной разбивки, поскольку у меня уже хорошая производительность. Что мне не хватает? Альтернативно, может ли кто-нибудь указать мне настройку по умолчанию для разбиения на фрагменты, когда оно выполняется вручную?
РЕДАКТИРОВАНИЕ 22 ФЕВРАЛЯ
Отвечаю @JayashankarGS
Согласно этому документу минимальное значение, которое вам нужно указать, — 300. Learn.microsoft.com/en-us/azure/search/… Разбиение на части в RAG не так то же, что и MaximumPageLength в разделенном наборе навыков.
Мне кажется, что maximum_page_length в точности равен chunking_size. Но вы правы, на сегодняшний день нет ничего, что можно было бы сделать с выбором размера чанка меньше 300 с помощью SplitSkill...
