Gava regex не совпадает за пределами диапазона ASCII, ведет себя иначе, чем питонаJAVA

Программисты JAVA общаются здесь
Anonymous
Gava regex не совпадает за пределами диапазона ASCII, ведет себя иначе, чем питона

Сообщение Anonymous »

Я хочу отфильтровать строки из документов так же, как и график, склонный к Sklearn. Он использует следующую regex: (? U) \ b \ w \ w+\ b < /code>.
Этот код Java должен вести себя так же: < /p>

Код: Выделить всё

Pattern regex = Pattern.compile("(?u)\\b\\w\\w+\\b");
Matcher matcher = regex.matcher("this is the document.!? äöa m²");

while(matcher.find()) {
String match = matcher.group();
System.out.println(match);
}
< /code>
Но это не производит желаемый вывод, как это происходит в Python: < /p>
this
is
the
document
äöa
m²
< /code>
Это вместо этого выводит: < /p>
this
is
the
document
Что я могу сделать, чтобы включить символы не ASCII, как это делает Python Regeex?

Подробнее здесь: https://stackoverflow.com/questions/494 ... n-python-r

Вернуться в «JAVA»