Для обработки текста я использую Nltk и Scikit Learn. Однако в моем списке документов есть некоторые документы не на английском языке. Например, следующее может быть правдой:
Код: Выделить всё
[ "this is some text written in English",
"this is some more text written in English",
"Ce n'est pas en anglais" ]
Для целей моего анализа я хочу, чтобы все предложения не на английском языке были удалены в рамках предварительной обработки. Однако есть ли хороший способ сделать это? Я гуглил, но не нашел ничего конкретного, что позволило бы мне распознать, написаны ли строки на английском языке или нет. Это то, чего нет в качестве функциональности ни в Nltk, ни в Scikit Learn? EDIT[/b] Я видел такие вопросы, как этот и этот, но оба предназначены для отдельных слов... Не "документ". Придется ли мне перебирать каждое слово в предложении, чтобы проверить, написано ли все предложение на английском языке?
Я использую Python, поэтому библиотеки, написанные на Python, будут предпочтительнее, но при необходимости я могу переключить язык, просто подумал, что Python подойдет для этого лучше всего.
Подробнее здесь:
https://stackoverflow.com/questions/433 ... in-english