Код: Выделить всё
import pandas as pd
df = pd.read_csv('large_file.gz',
chunksize=1000000)
key = "find_this" # an element of column 1
for data in df:
if key in data['col1'].tolist():
found = data[data['col1'] == key]
break
print(found)
РЕДАКТИРОВАТЬ:
Я в основном хочу создать сокращенный локальный dbSNP, где я может запросить геномное местоположение (хромосома, положение, ссылка, альтернатива) с помощью rsID.
Для этого я загрузил этот VCF (16 ГБ) и предварительно обработал его с помощью awk
Код: Выделить всё
gzcat 00-All.vcf.gz | grep -v ## | awk '{print $3, $1, $2, $4, $4}' | gzip > 00-All_relevant.vcf.gz
Подробнее здесь: https://stackoverflow.com/questions/790 ... lternative