{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","execution":{"iopub.status.busy":"2021-05-25T02:33:53.851294Z","iopub.execute_input":"2021-05-25T02:33:53.851586Z","iopub.status.idle":"2021-05-25T02:34:11.71499Z","shell.execute_reply.started":"2021-05-25T02:33:53.85152Z","shell.execute_reply":"2021-05-25T02:34:11.694218Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import glob\nimport shutil\nimport json\nimport itertools\nimport seaborn as sns\nfrom PIL import Image\nfrom collections import Counter\nimport tensorflow as tf\nimport keras\nimport matplotlib.pyplot as plt\nfrom tensorflow.keras.models import Sequential\nfrom tensorflow.keras.layers import GlobalAveragePooling2D, Flatten, Dense, Dropout, BatchNormalization\nfrom tensorflow.keras.optimizers import RMSprop, Adam, SGD\nfrom tensorflow.keras.callbacks import EarlyStopping, ModelCheckpoint, ReduceLROnPlateau","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:34:27.869358Z","iopub.execute_input":"2021-05-25T02:34:27.869792Z","iopub.status.idle":"2021-05-25T02:34:33.286498Z","shell.execute_reply.started":"2021-05-25T02:34:27.869749Z","shell.execute_reply":"2021-05-25T02:34:33.285544Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"work_dir = '../input/cassava-leaf-disease-classification/'\nos.listdir(work_dir)\ntrain_path = '/kaggle/input/cassava-leaf-disease-classification/train_images/'","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:35:10.813002Z","iopub.execute_input":"2021-05-25T02:35:10.813363Z","iopub.status.idle":"2021-05-25T02:35:10.81936Z","shell.execute_reply.started":"2021-05-25T02:35:10.813332Z","shell.execute_reply":"2021-05-25T02:35:10.818571Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"data = pd.read_csv(work_dir + 'train.csv')\n# data.head()\nprint(Counter(data['label']))","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:35:15.412877Z","iopub.execute_input":"2021-05-25T02:35:15.413217Z","iopub.status.idle":"2021-05-25T02:35:15.451015Z","shell.execute_reply.started":"2021-05-25T02:35:15.413184Z","shell.execute_reply":"2021-05-25T02:35:15.450244Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"data['label'].hist()","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:35:18.895443Z","iopub.execute_input":"2021-05-25T02:35:18.895751Z","iopub.status.idle":"2021-05-25T02:35:19.066733Z","shell.execute_reply.started":"2021-05-25T02:35:18.895722Z","shell.execute_reply":"2021-05-25T02:35:19.065788Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"f = open(work_dir + 'label_num_to_disease_map.json')\nreal_labels = json.load(f)\nreal_labels = {int(k):v for k, v in real_labels.items()}\n\ndata['class_name'] = data.label.map(real_labels)\nprint(data.head())","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:35:22.526869Z","iopub.execute_input":"2021-05-25T02:35:22.527238Z","iopub.status.idle":"2021-05-25T02:35:22.54641Z","shell.execute_reply.started":"2021-05-25T02:35:22.527203Z","shell.execute_reply":"2021-05-25T02:35:22.545547Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"data['class_name'].unique()","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:35:25.863915Z","iopub.execute_input":"2021-05-25T02:35:25.864252Z","iopub.status.idle":"2021-05-25T02:35:25.8716Z","shell.execute_reply.started":"2021-05-25T02:35:25.864222Z","shell.execute_reply":"2021-05-25T02:35:25.870732Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def showImages(images):\n    random_images = [np.random.choice(images) for i in range(16)]\n    \n    #Adjust size of image\n    plt.figure(figsize = (16, 12))\n    \n    \n    for i in range(16):\n        plt.subplot(4, 4, i+1)\n        img = plt.imread(train_path + random_images[i])\n        plt.imshow(img, cmap = 'gray')\n        plt.axis('off')\n        \n    plt.tight_layout()","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:35:48.195333Z","iopub.execute_input":"2021-05-25T02:35:48.19567Z","iopub.status.idle":"2021-05-25T02:35:48.201183Z","shell.execute_reply.started":"2021-05-25T02:35:48.19564Z","shell.execute_reply":"2021-05-25T02:35:48.200207Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"mask = data['label'] == 4\nclassHealthy = data[mask]","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:35:50.822025Z","iopub.execute_input":"2021-05-25T02:35:50.822432Z","iopub.status.idle":"2021-05-25T02:35:50.828606Z","shell.execute_reply.started":"2021-05-25T02:35:50.822396Z","shell.execute_reply":"2021-05-25T02:35:50.827621Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"showImages(classHealthy['image_id'])","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:35:54.155614Z","iopub.execute_input":"2021-05-25T02:35:54.15593Z","iopub.status.idle":"2021-05-25T02:35:56.270577Z","shell.execute_reply.started":"2021-05-25T02:35:54.1559Z","shell.execute_reply":"2021-05-25T02:35:56.269799Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"classCBB = data[data['label'] == 0]\nclassCBSD = data[data['label'] == 1]\nclassCMD = data[data['label'] == 3]\nclassCGM = data[data['label'] == 2]","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:36:02.280837Z","iopub.execute_input":"2021-05-25T02:36:02.281176Z","iopub.status.idle":"2021-05-25T02:36:02.290895Z","shell.execute_reply.started":"2021-05-25T02:36:02.281142Z","shell.execute_reply":"2021-05-25T02:36:02.289965Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"class0 = classCBB.sample(frac = 0.99)\nclass1 = classCBSD.sample(frac = 0.9)\nclass2 = classCGM.sample(frac = 0.9)\nclass3 = classCMD.sample(frac = 0.9)\nclass4 = classHealthy.sample(frac = 0.9)\n\nframes = [class0, class1, class2, class3, class4]\nfinalData = pd.concat(frames)\n# finalData.tail()\nlen(finalData)","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:36:05.423431Z","iopub.execute_input":"2021-05-25T02:36:05.423759Z","iopub.status.idle":"2021-05-25T02:36:05.441879Z","shell.execute_reply.started":"2021-05-25T02:36:05.423728Z","shell.execute_reply":"2021-05-25T02:36:05.441167Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"from sklearn.model_selection import train_test_split\n\ntrain, val = train_test_split(finalData, test_size = 0.05, random_state = 37, stratify = finalData['class_name'])","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:36:08.509881Z","iopub.execute_input":"2021-05-25T02:36:08.510269Z","iopub.status.idle":"2021-05-25T02:36:08.696531Z","shell.execute_reply.started":"2021-05-25T02:36:08.510239Z","shell.execute_reply":"2021-05-25T02:36:08.695654Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"from keras.preprocessing.image import ImageDataGenerator\n\nimg_size = 227\nsize = (img_size, img_size)\nn_class = 5\n\ndatapen = ImageDataGenerator(preprocessing_function = None,\n                            rotation_range = 60,\n                            width_shift_range = 0.2,\n                            height_shift_range = 0.2,\n                            shear_range = 0.2,\n                            zoom_range = 0.2,\n                            horizontal_flip = True,\n                            vertical_flip = True,\n                            fill_mode = 'nearest'\n                            )\n\ntrain_set = datapen.flow_from_dataframe(train,\n                                       directory = train_path,\n                                       seed = 7,\n                                       x_col = 'image_id',\n                                       y_col = 'class_name',\n                                       target_size = size,\n                                       class_mode = 'categorical',\n                                       interpolation = 'nearest',\n                                       shuffle = True,\n                                       batch_size = 32)\n\nval_set = datapen.flow_from_dataframe(val,\n                                       directory = train_path,\n                                       seed = 7,\n                                       x_col = 'image_id',\n                                       y_col = 'class_name',\n                                       target_size = size,\n                                       class_mode = 'categorical',\n                                       interpolation = 'nearest',\n                                       shuffle = True,\n                                       batch_size = 32)","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:36:11.283727Z","iopub.execute_input":"2021-05-25T02:36:11.284058Z","iopub.status.idle":"2021-05-25T02:36:17.859859Z","shell.execute_reply.started":"2021-05-25T02:36:11.284027Z","shell.execute_reply":"2021-05-25T02:36:17.858757Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def create_model():\n    model = keras.models.Sequential([\n    keras.layers.Conv2D(filters=96, kernel_size=(11,11), strides=(4,4), activation='relu', input_shape=(227,227,3)),\n    keras.layers.BatchNormalization(),\n    keras.layers.MaxPool2D(pool_size=(3,3), strides=(2,2)),\n        \n    keras.layers.Conv2D(filters=256, kernel_size=(5,5), strides=(1,1), activation='relu', padding=\"same\"),\n    keras.layers.BatchNormalization(),\n    keras.layers.MaxPool2D(pool_size=(3,3), strides=(2,2)),\n        \n    keras.layers.Conv2D(filters=384, kernel_size=(3,3), strides=(1,1), activation='relu', padding=\"same\"),\n    keras.layers.BatchNormalization(),\n        \n    keras.layers.Conv2D(filters=384, kernel_size=(3,3), strides=(1,1), activation='relu', padding=\"same\"),\n    keras.layers.BatchNormalization(),\n        \n    keras.layers.Conv2D(filters=256, kernel_size=(3,3), strides=(1,1), activation='relu', padding=\"same\"),\n    keras.layers.BatchNormalization(),\n        \n    keras.layers.MaxPool2D(pool_size=(3,3), strides=(2,2)),\n    keras.layers.Flatten(),\n    keras.layers.Dense(4096, activation='relu'),\n    keras.layers.BatchNormalization(),\n    keras.layers.Dropout(0.4),\n    keras.layers.Dense(4096, activation='relu'),\n    keras.layers.BatchNormalization(),\n    keras.layers.Dropout(0.4),\n    keras.layers.Dense(5, activation='softmax')\n    ])\n    \n    return model","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:36:22.82532Z","iopub.execute_input":"2021-05-25T02:36:22.825656Z","iopub.status.idle":"2021-05-25T02:36:22.837546Z","shell.execute_reply.started":"2021-05-25T02:36:22.825627Z","shell.execute_reply":"2021-05-25T02:36:22.836586Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"model = create_model()\nmodel.summary()","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:36:29.716393Z","iopub.execute_input":"2021-05-25T02:36:29.716732Z","iopub.status.idle":"2021-05-25T02:36:31.944293Z","shell.execute_reply.started":"2021-05-25T02:36:29.716703Z","shell.execute_reply":"2021-05-25T02:36:31.943477Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"epoch = 30\nstep_size_train = train_set.n//train_set.batch_size\nstep_size_valid = val_set.n//val_set.batch_size","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:36:38.372541Z","iopub.execute_input":"2021-05-25T02:36:38.372857Z","iopub.status.idle":"2021-05-25T02:36:38.3792Z","shell.execute_reply.started":"2021-05-25T02:36:38.372827Z","shell.execute_reply":"2021-05-25T02:36:38.378336Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"METRICS = [\n      keras.metrics.TruePositives(name='tp'),\n      keras.metrics.FalsePositives(name='fp'),\n      keras.metrics.TrueNegatives(name='tn'),\n      keras.metrics.FalseNegatives(name='fn'), \n      keras.metrics.CategoricalAccuracy(name='categorical_accuracy'),\n      keras.metrics.Precision(name='precision'),\n      keras.metrics.Recall(name='recall')\n      \n]","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:39:00.761169Z","iopub.execute_input":"2021-05-25T02:39:00.761479Z","iopub.status.idle":"2021-05-25T02:39:00.792795Z","shell.execute_reply.started":"2021-05-25T02:39:00.761452Z","shell.execute_reply":"2021-05-25T02:39:00.792069Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def model_fit():\n    leaf_model = create_model()\n    \n    \n    loss = tf.keras.losses.CategoricalCrossentropy(from_logits = False,\n                                                   label_smoothing = 0.001,\n                                                   name = 'categorical_crossentropy')\n    \n    leaf_model.compile(optimizer = Adam(learning_rate = 2e-5),\n                      loss = loss,\n                      metrics = METRICS)\n    \n    \n    checkpoint_cb = ModelCheckpoint('Cassava_model',\n                                   save_best_only = True,\n                                   monitor = 'val_loss',\n                                   mode = 'min')\n    \n    reduce_lr = ReduceLROnPlateau(monitor = 'val_loss',\n                                 factor = 0.3,\n                                 patience = 3,\n                                 min_lr = 1e-6,\n                                 mode = 'min',\n                                 verbose = 1)\n    \n    history = leaf_model.fit(train_set,\n                            validation_data = val_set,\n                            epochs = epoch,\n                            steps_per_epoch = step_size_train,\n                            validation_steps = step_size_valid,\n                            callbacks = [ checkpoint_cb, reduce_lr])\n    \n    \n    leaf_model.save('Cassava_model_alexnet.h5')\n    \n    return history","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:39:22.566444Z","iopub.execute_input":"2021-05-25T02:39:22.566755Z","iopub.status.idle":"2021-05-25T02:39:22.574813Z","shell.execute_reply.started":"2021-05-25T02:39:22.566726Z","shell.execute_reply":"2021-05-25T02:39:22.573917Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"history = model_fit()","metadata":{"execution":{"iopub.status.busy":"2021-05-25T02:39:27.687539Z","iopub.execute_input":"2021-05-25T02:39:27.687872Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"tp1 = history.history['tp']\nprint(tp1)\nfp1 = history.history['fp']\nprint(fp1)\ntn1 = history.history['tn']\nprint(tn1)\nfn1 = history.history['fn']\nprint(fn1)\n\npre = history.history['precision']\nprint(pre)\nrec = history.history['recall']\nprint(rec)\nacc = history.history['categorical_accuracy']\nprint(acc)\nval_acc = history.history['val_categorical_accuracy']\nprint(val_acc)\n\n\n\nloss = history.history['loss']\nval_loss = history.history['val_loss']\n","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"","metadata":{},"execution_count":null,"outputs":[]}]}