Здесь новичок в Python. Я хочу просмотреть большой файл mbox, анализируя сообщения электронной почты. Я могу сделать это с помощью:
Код: Выделить всё
import sys
import mailbox
def gen_summary(filename):
mbox = mailbox.mbox(filename)
for message in mbox:
subj = message['subject']
print subj
if __name__ == "__main__":
if len(sys.argv) != 2:
print 'Usage: python genarchivesum.py mbox'
sys.exit(1)
gen_summary(sys.argv[1])
Но мне нужно больше контроля. Мне нужно иметь возможность получить позицию байта начала данного электронного письма в файле mbox, а также мне нужно получить количество байтов в сообщении (как представлено на диске). И тогда в будущем, вместо того, чтобы выполнять итерацию с начала файла mbox, мне нужно будет иметь возможность искать заданное сообщение и просто анализировать его (отсюда одна из потребностей в получении позиции байта на диске). Это большие файлы mbox, и их эффективность вызывает беспокойство.
Цель всего этого состоит в том, чтобы я мог создать сводный файл, содержащий небольшие сведения о каждом электронном письме в mbox, а затем в будущем эффективно искать отдельные электронные письма в mbox.
Цель всего этого состоит в том, чтобы я мог создать сводный файл, содержащий небольшие сведения о каждом электронном письме в mbox.>