{"cells":[{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nf_cnt_map = {}\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    f_cnt_map[dirname] = len(filenames)\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session\n\nfor idx, d_name in enumerate(f_cnt_map.keys()):\n    print(\"idx:\", idx, \" ,d_name:\", d_name, \" ,f_cnt:\", f_cnt_map[d_name])\nprint(\"---\")    \n\nprn_cnt = 0\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n        prn_cnt += 1 \n        if(prn_cnt>=30): break","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"# file count\n- train: 8만개  \n- test: 2천개\n```\nidx: 0  ,d_name: /kaggle/input  ,f_cnt: 0\nidx: 1  ,d_name: /kaggle/input/hpa-single-cell-image-classification  ,f_cnt: 2\nidx: 2  ,d_name: /kaggle/input/hpa-single-cell-image-classification/train_tfrecords  ,f_cnt: 64\nidx: 3  ,d_name: /kaggle/input/hpa-single-cell-image-classification/test_tfrecords  ,f_cnt: 16\nidx: 4  ,d_name: /kaggle/input/hpa-single-cell-image-classification/test  ,f_cnt: 2236\nidx: 5  ,d_name: /kaggle/input/hpa-single-cell-image-classification/train  ,f_cnt: 87224\n```"},{"metadata":{"trusted":true},"cell_type":"code","source":"#../input/hpa-single-cell-image-classification\nimport numpy as np # linear algebra\nfrom PIL import Image\nimport matplotlib.pyplot as plt","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"!ls /kaggle/input/hpa-single-cell-image-classification/test/","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"!ls -alrt /kaggle/input/hpa-single-cell-image-classification/test/0040581b-f1f2-4fbe-b043-b6bfea5404bb_blue.png","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"# image size\n- 2~3 Mbyte  \n- Traint 데이터 기준 87000*2.5M = 2OOG  \n- 전체 158G임으로 평균적으로 2~2.5M하는 듯!"},{"metadata":{"trusted":true},"cell_type":"code","source":"# 이미지 샘플(test-set) 보기!\nimg_array = np.array(Image.open('/kaggle/input/hpa-single-cell-image-classification/test/0040581b-f1f2-4fbe-b043-b6bfea5404bb_blue.png'))\nplt.imshow(img_array)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"# Label data 확인\n# /kaggle/input/hpa-single-cell-image-classification/train.csv\n# /kaggle/input/hpa-single-cell-image-classification/test.csv\n\nimport pandas as pd\ntrain_csv = pd.read_csv(\"/kaggle/input/hpa-single-cell-image-classification/train.csv\")\nprint(train_csv.head())","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"#1-1. 그룹별 갯수 확인\ntr_group = train_csv.sort_values(by=\"Label\", ascending=False).groupby(by=['Label'])\nprint(tr_group.size().sort_values(ascending=False))\nprint()\n\n#1-2. label 갯수 확인\n#l_list = []\nla_map = {}\nfor idx, label in enumerate(train_csv[\"Label\"]):\n    for one_la in label.split(\"|\"):\n        if one_la in la_map.keys(): \n            la_map[one_la] = la_map[one_la] + 1\n        else:\n            la_map[one_la] = 0\nfor idx, label in enumerate(la_map.keys()):\n    print('idx:', idx, ',label count:', la_map[label])\nprint()\n\n#1-3. uniq label 갯수 확인\nprint('uniq label:', len(la_map.keys()))","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat":4,"nbformat_minor":4}