Имея опыт работы с Java, Pascal, PERL, SQL и R, я хочу найти путь наименьшего сопротивления для (полу)автоматического извлечения концепций из текста и превращения результата во что-то статистически анализируемое. Я предполагаю, что мне нужно будет выполнить некоторые задачи НЛП над текстом, в частности, обработку POS, идентификацию именных фраз, устранение неоднозначности смысла слов. Последнее, я считаю, может потребовать машинного обучения с частичным контролем для обеспечения точности.
С чего мне начать изучение практического НЛП?
Курс или книги по НЛП содержат гораздо больше деталей, чем мне нужно. Мне просто нужно знать, что он делает, насколько он точен и какие существуют альтернативы. Я использовал GATE для обработки POS, но выходные данные были либо в формате XML, который я понятия не имею, как обрабатывать, либо в формате PostgreSQL, которым было сложно манипулировать. Кроме того, в то время у GATE не было хорошего метода определения смысла слов.
Подробнее здесь: https://stackoverflow.com/questions/192 ... processing