Как запросить большой файл с помощью панд (или альтернативы)?Python

Программы на Python
Anonymous
Как запросить большой файл с помощью панд (или альтернативы)?

Сообщение Anonymous »

У меня есть большой файл (6 ГБ, около 17 миллионов строк) с 5 столбцами. Я хочу использовать первый столбец в качестве ключа и получить остальные 4 столбца. Я хочу дать несколько ключей. Мой код на данный момент таков:

Код: Выделить всё

import pandas as pd

df = pd.read_csv('large_file.gz',
chunksize=1000000)

key = "find_this" # an element of column 1

for data in df:
if key in data['col1'].tolist():
found = data[data['col1'] == key]
break

print(found)
Как я могу оптимизировать это для нескольких элементов?
РЕДАКТИРОВАТЬ:
Я в основном хочу создать сокращенный локальный dbSNP, где я может запросить геномное местоположение (хромосома, положение, ссылка, альтернатива) с помощью rsID.
Для этого я загрузил этот VCF (16 ГБ) и предварительно обработал его с помощью awk

Код: Выделить всё

gzcat 00-All.vcf.gz | grep -v ## | awk '{print $3, $1, $2, $4, $4}' | gzip > 00-All_relevant.vcf.gz
из этого файла я хочу запросить #CHROM, POS, REF и ALT, используя идентификатор столбца.

Подробнее здесь: https://stackoverflow.com/questions/790 ... lternative

Вернуться в «Python»