{"cells":[{"metadata":{"trusted":true},"cell_type":"code","source":"import os\nimport sys\nimport numpy as np\nimport pandas as pd\nimport matplotlib.pyplot as plt\nimport seaborn as sns\nimport random\nimport cv2\nfrom tensorflow.keras.preprocessing.image import ImageDataGenerator\nfrom shutil import copy\nfrom tensorflow.keras.layers import Input, Conv2D, MaxPooling2D, UpSampling2D, add, Dropout, Flatten, Dense, Reshape, GlobalAveragePooling2D, BatchNormalization\nfrom tensorflow.keras.models import Model\nfrom zipfile import ZipFile\nimport sys\nfrom tensorflow.keras.models import Sequential, load_model\nfrom  tensorflow import keras\nfrom sklearn.metrics import roc_curve, roc_auc_score","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 5GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","trusted":true},"cell_type":"code","source":"allData = pd.read_csv('../input/siim-isic-melanoma-classification/train.csv', sep = ',')\ndf = pd.DataFrame(allData)\nmalignant = df.groupby(df.target).get_group(1) \nbenign = df.groupby(df.target).get_group(0)\n\nmalignant_file_names = malignant.image_name.values\nbenign_file_names = benign.image_name.values","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"print(len(malignant_file_names))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"\n#make the required directories\ndirs = ['Data', 'Data/train', 'Data/test', 'Data/train/benign', 'Data/train/malignant', 'Data/test/benign', 'Data/test/malignant']\n\nfor dir in dirs:\n    os.mkdir(dir)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"#Copy benigns\nsource = '../input/resize-jpg-siimisic-melanoma-classification/300x300/train'\ntraindest = 'Data/train/benign' \ntestdest = 'Data/test/benign' \ntrainSize = 32000\ntestSize = 100\nbenign_file_names_train = benign_file_names[:trainSize]\nbenign_file_names_test = benign_file_names[trainSize:trainSize+testSize]\n\nfor i,file in enumerate(benign_file_names_train):\n  os.system('cp -r %s %s'%(source+'/'+file+'.jpg', traindest+'/'+file+'.jpg'))\n  sys.stdout.write('\\r %d%%: Copying %s to %s'%((i/len(benign_file_names_train))*100, file, traindest))\n  sys.stdout.flush()\nprint(\"\\rComplete\")\n\nfor i,file in enumerate(benign_file_names_test):\n  os.system('cp -r %s %s'%(source+'/'+file+'.jpg', testdest+'/'+file+'.jpg'))\n  sys.stdout.write('\\r %d%%: Copying %s to %s'%((i/len(benign_file_names_test))*100, file, testdest))\n  sys.stdout.flush()\nprint(\"\\rComplete\")","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"#Copy malignants\nsource = '../input/resize-jpg-siimisic-melanoma-classification/300x300/train'\ntraindest = 'Data/train/malignant' \ntestdest = 'Data/test/malignant' \ntestSize = 50\nmalignant_file_names_train = malignant_file_names[testSize:]\nmalignant_file_names_test = malignant_file_names[:testSize]\n\nfor i,file in enumerate(malignant_file_names_train):\n  os.system('cp -r %s %s'%(source+'/'+file+'.jpg', traindest+'/'+file+'.jpg'))\n  sys.stdout.write('\\r %d%%: Copying %s to %s'%((i/len(malignant_file_names_train))*100, file, traindest))\n  sys.stdout.flush()\nprint(\"\\rComplete\")\n\nfor i,file in enumerate(malignant_file_names_test):\n  os.system('cp -r %s %s'%(source+'/'+file+'.jpg', testdest+'/'+file+'.jpg'))\n  sys.stdout.write('\\r %d%%: Copying %s to %s'%((i/len(malignant_file_names_test))*100, file, testdest))\n  sys.stdout.flush()\nprint(\"\\rComplete\")","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"import shutil\nshutil.make_archive('Data', 'zip', 'Data')\nshutil.rmtree('Data')","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat":4,"nbformat_minor":4}