Преобразование файла XLSX в формат FASTA в PythonPython

Программы на Python
Anonymous
Преобразование файла XLSX в формат FASTA в Python

Сообщение Anonymous »

Необходимо извлечь данные (Peptide_Sequence) из выходного файла XLSX в файл FASTA. Я использую панд. Файл FASTA — это стандартный текстовый формат в биоинформатике, используемый для хранения нуклеотидных или аминокислотных последовательностей.
Он состоит из двух элементов:
Строка заголовка (идентификатор), которая должна начинаться с символа «больше» (>).
Необработанная последовательность, представленная однобуквенными кодами, в следующих строках.
Код, используемый для создания файла XLSX:
peptides_interets = df[df[colonne_recherche]>=seuil_confiance].copy()

#Extraire les colonnes acession, et sequence avec PTM
peptides_interets = peptides_interets[peptides_interets['Found By'] == 'DB Search'].copy()
peptides_interets = peptides_interets[['tag(>=0.0%)', 'Accession']].copy()

#Extraire uniquement les séquences peptidiques
peptides_interets['Peptide_Sequence'] = peptides_interets['tag(>=0.0%)'].str.replace(r'[^A-Za-z]', '', regex=True)

#Retirer les doublons chez les numéro d'accession, en gardant la première occurrence (Bibliothèque pandas)
peptides_uniques = peptides_interets.drop_duplicates(subset=['Accession'], keep='first')
#Nom modifiable selon le besoin, texte entre "" modifiable, extension .xlsx à conserver (si Excel)
nom_fichier_final = "Peptides_identifiés_EnCoRe_Accession.xlsx"
peptides_uniques.to_excel(nom_fichier_final, sheet_name='Peptides', index=False)
print(f"Terminé, sur {len(df)} peptides, le modèle a trouvé {len(peptides_uniques)} neuropeptides.")
print(f"Fichier sauvegardé sous : {nom_fichier_final}")`

Вернуться в «Python»