{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.10.12","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import os\nimport re\nimport sys\nimport numpy as np\nimport pandas as pd\nfrom Bio import SeqIO\n","metadata":{"execution":{"iopub.status.busy":"2023-09-08T14:54:18.427467Z","iopub.execute_input":"2023-09-08T14:54:18.427806Z","iopub.status.idle":"2023-09-08T14:54:18.919795Z","shell.execute_reply.started":"2023-09-08T14:54:18.427780Z","shell.execute_reply":"2023-09-08T14:54:18.918798Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"base_path = '/kaggle/input/stanford-ribonanza-rna-folding'","metadata":{"execution":{"iopub.status.busy":"2023-09-08T14:54:18.921573Z","iopub.execute_input":"2023-09-08T14:54:18.922113Z","iopub.status.idle":"2023-09-08T14:54:18.926034Z","shell.execute_reply.started":"2023-09-08T14:54:18.922082Z","shell.execute_reply":"2023-09-08T14:54:18.925155Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train = pd.read_csv(base_path + \"/train_data.csv\")\ntest = pd.read_csv(base_path + \"/test_sequences.csv\")\nsub = pd.read_csv(base_path + \"/sample_submission.csv\")","metadata":{"execution":{"iopub.status.busy":"2023-09-08T14:54:18.927225Z","iopub.execute_input":"2023-09-08T14:54:18.927531Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"display(train.head(5))\ndisplay(train.info())\ndisplay(test.head(5))\ndisplay(test.info())\ndisplay(sub.head(5))\ndisplay(sub.info())","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# Ribonanza_bpp_files","metadata":{}},{"cell_type":"code","source":"ribonanza = os.listdir(base_path + \"/Ribonanza_bpp_files/extra_data\")\nprint(ribonanza)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"for i in ribonanza:\n    temp_ = os.listdir(base_path + f'/Ribonanza_bpp_files/extra_data/{i}')\n    print(f\"Ribonanza_bpp_files/extra_data/{i} has \\n{temp_}\\n\")","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"ribonanza_0 = os.listdir(base_path + '/Ribonanza_bpp_files/extra_data/0')\nfor i in ribonanza_0:\n    temp_ = os.listdir(base_path + f'/Ribonanza_bpp_files/extra_data/0/{i}')\n    print(f\"Ribonanza_bpp_files/extra_data/0/{i} has \\n{temp_}\\n\")","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"ribonanza_0_7 = os.listdir(base_path + '/Ribonanza_bpp_files/extra_data/0/7')\nfor i in ribonanza_0_7:\n    temp_ = os.listdir(base_path + f'/Ribonanza_bpp_files/extra_data/0//7/{i}')\n    print(f\"Ribonanza_bpp_files/extra_data/0/7/{i} has \\n{temp_}\\n\")\n    break","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"ribonanza_0_7_ed0205d75d78 = os.listdir(base_path + '/Ribonanza_bpp_files/extra_data/0/7/7')\nwith open(base_path + \"/Ribonanza_bpp_files/extra_data/0/7/7/ed0205d75d78.txt\") as f:\n    print(f.readlines())","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# eterna_openknot_metadata","metadata":{}},{"cell_type":"code","source":"eterna = os.listdir(base_path + \"/eterna_openknot_metadata\")\nprint(eterna)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"for i in eterna:\n    try:\n        if i.endswith('.tsv'):\n            temp = pd.read_csv(base_path + f\"/eterna_openknot_metadata/{i}\", sep='\\t')\n            display(temp.head(5))\n            display(temp.info())\n            print()\n        if i.endswith('.csv'):\n            temp = pd.read_csv(base_path + f\"/eterna_openknot_metadata/{i}\")\n            display(temp.head(5))\n            display(temp.info())\n            print()\n    except:\n        print(f\"{i} has an error in the document\\n\")","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# sequence_libraries","metadata":{}},{"cell_type":"code","source":"def read_fasta(fp):\n    name, seq = None, []\n    for line in fp:\n        line = line.rstrip()\n        if line.startswith(\">\"):\n            if name: yield (name, ''.join(seq))\n            name, seq = line, []\n        else:\n            seq.append(line)\n    if name: yield (name, ''.join(seq))\n\nsequence = os.listdir(base_path + \"/sequence_libraries\")\nfor i in sequence:\n    fasta_sequences = SeqIO.parse(open(base_path + f\"/sequence_libraries/{i}\"),'fasta')\n    with open(base_path + f\"/sequence_libraries/{i}\") as fp:\n        count = 0\n        for name, seq in read_fasta(fp):\n            if count == 3:\n                break\n            print(name, seq)\n            count += 1\n            \n    continue","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# supplementary_silico_predictions","metadata":{}},{"cell_type":"code","source":"silico = os.listdir(base_path + '/supplementary_silico_predictions')\n\nfor i in silico:\n    temp = pd.read_csv(base_path + f'/supplementary_silico_predictions/{i}')\n    display(temp.head(5))\n    display(temp.info())\n    print()","metadata":{"trusted":true},"execution_count":null,"outputs":[]}],"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}}