Что вообще делает параметр chunk_size langchain CharacterTextSplitter?Python

Программы на Python
Anonymous
Что вообще делает параметр chunk_size langchain CharacterTextSplitter?

Сообщение Anonymous »


Мое предположение по умолчанию заключалось в том, что параметр chunk_size будет устанавливать потолок размера фрагментов/разделений, получаемых из метода split_text, но это явно неверно :

из langchain.text_splitter import RecursiveCharacterTextSplitter, CharacterTextSplitter chunk_size = 6 chunk_overlap = 2 c_splitter = CharacterTextSplitter(chunk_size=chunk_size, chunk_overlap=chunk_overlap) текст = 'abcdefghijklmnopqrstuvwxyz' c_splitter.split_text(текст) выводит: ['abcdefghijklmnopqrstuvwxyz'], т. е. один фрагмент, который намного больше, чем chunk_size=6.

Я так понимаю, он не разбил текст на куски, потому что никогда не встречал разделитель. Но тогда вопрос в том, что вообще делает chunk_size?

Я проверил страницу документации для langchain.text_splitter.CharacterTextSplitter здесь, но не нашел ответа на этот вопрос. И я спросил «исправляемую» функцию поиска чата с langchain-docs, но получил ответ: «Параметр chunk_size в CharacterTextSplitter определяет максимальное количество символов в каждом фрагменте текста»... что неверно, поскольку приведенный выше пример кода.

Вернуться в «Python»