Может ли PatternRank извлечь ключевые фразы с инфиксом «-»?Python

Программы на Python
Anonymous
Может ли PatternRank извлечь ключевые фразы с инфиксом «-»?

Сообщение Anonymous »


Я пытался использовать PatternRank для извлечения ключевых фраз из текстового документа с тегами частей речи. Однако некоторые ключевые слова с инфиксом «-», «/» и т. д. не могут быть распознаны и могут быть целевыми, тогда как «_» может распознаваться PatternRank.

Пример:

импортировать пространство импортировать панд как pd импортировать numpy как np из импорта keybert KeyBERT из keyphrase_vectorizers импортировать KeyphraseCountVectorizer из sklearn.feature_extraction.text импортировать CountVectorizer text = ['''BERT — это предварительно обученная модель для НЛП.'''] kw_model1.extract_keywords(docs=text, векторизатор=KeyphraseCountVectorizer(spacy_pipeline=nlp, нижний регистр=False, pos_pattern='*****', stop_words='английский'), use_mmr=True) >> вывод: [('BERT is', 0,6578), ('NLP', 0,5684)] Но если я заменю «-» на «_»:

импортировать пространство импортировать панд как pd импортировать numpy как np из импорта keybert KeyBERT из keyphrase_vectorizers импортировать KeyphraseCountVectorizer из sklearn.feature_extraction.text импортировать CountVectorizer text = ['''BERT — это предварительно обученная модель для НЛП.'''] kw_model1.extract_keywords(docs=text, векторизатор=KeyphraseCountVectorizer(spacy_pipeline=nlp, нижний регистр=False, pos_pattern='*****', stop_words='английский'), use_mmr=True) >> вывод: [('BERT is', 0,6579), ('NLP', 0,5666), ('предварительно обученная модель', 0,5215)] Я изменил шаблоны инфиксов токенизатора с помощью spaCy, как показано ниже, чтобы они оставались такими инфиксами, как «-», «/» и т. д. Но это все равно не работает.
импортировать повторно из spacy.lang.char_classes импортируйте ALPHA, ALPHA_LOWER, ALPHA_UPPER из spacy.lang.char_classes импортируйте CONCAT_QUOTES, LIST_ELLIPSES, LIST_ICONS, LIST_PUNCT, LIST_QUOTES, CURRENCY, UNITS, PUNCT, LIST_CURRENCY из spacy.util import compile_infix_regex, compile_prefix_regex, compile_suffix_regex из spacy.tokenizer импортировать токенизатор # Изменить шаблоны инфиксов токенизатора # Не хочу, чтобы токенизатор разбивался на дефисы между буквами инфиксы = ( СПИСОК_ЭЛЛИПСОВ + СПИСОК_ICONS + [ r"(?

Вернуться в «Python»