Все.
Сейчас я работаю над проектом, и у меня есть файл .txt. файл, который мне нужно преобразовать, поскольку данные не структурированы должным образом, и я не знаю, как действовать. В настоящее время файл содержит все данные с заголовками и данные в строках с разными разделителями.
Я включил образец файла в виде изображения. Поля в красных квадратах необходимы для AccessIdentifier. Мне нужны только числа, следующие за «MG:» или «CP:», но у меня есть AccessIdentifier в виде столбца с числами «MG:» или «CP:» в строке (я не знаю). Мне нужны оба, только MG, если CP не указан.
Имя пользователя также является заголовком столбца, и ему потребуются все символы в этой строке после двоеточия в строках, «почта» — это еще один столбец (электронные письма), мне нужно будет поместите в качестве заголовка и все данные в этой строке после двоеточия в строках.
Наконец, «порталы» также должны быть заголовком столбца со всеми данными в этой строке после двоеточия в строках и должны содержать порт 52.
текстовый файл
Как видите, в текстовом файле заголовки повторяются в каждой строке, а данные следуют за двоеточием. Это было бы намного проще, если бы не было дополнительных. двоеточия в некоторых строках (например, в изображении AccessIdentifier имеет различные двоеточия и точки с запятой.
столбец «dn» можно включить, но его также можно удалить, и он будет включать все данные в этой строке в строках и исключать данные после первой запятой. Я пытался найти решение, но безрезультатно. Не уверен, что это проблема, с которой еще не сталкивались, или мои критерии поиска неверны. В любом случае, любая помощь очень ценится. Файл .txt
Я попробовал несколько разных методов в PowerBI, выполнил поиск в Google, просмотрел более 40 ответов сайтов, найденных при поиске в Интернете, на моем ноутбуке не установлена Anaconda, но она скоро будет установлена. и я просто новичок в Python, но считаю, что это будет лучший вариант для того, что мне нужно.
Подробнее здесь: https://stackoverflow.com/questions/790 ... or-powerbi