{"cells":[{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"import tensorflow as tf\nfrom keras import backend as K\n\nimport glob\n\nfrom keras.preprocessing.image import ImageDataGenerator\nfrom keras.models import model_from_json\n\nfrom keras.utils import np_utils\n\nfrom keras.callbacks import EarlyStopping, ModelCheckpoint\n\nfrom keras.models import Sequential\n\nfrom keras.layers import Activation, Convolution2D\n\nfrom keras.layers import Conv2D, MaxPooling2D, Dropout,SpatialDropout2D,BatchNormalization, Dense, Flatten\nfrom keras.layers.advanced_activations import ELU\nfrom keras.optimizers import Adam\n\nfrom keras.wrappers.scikit_learn import KerasClassifier\n\nfrom keras.models import load_model\n\nfrom matplotlib import pyplot as plt\nfrom matplotlib.legend_handler import HandlerBase\nfrom matplotlib.text import Text\n%matplotlib inline\n\nimport numpy as np\n\n#import matplotlib.pyplot as plt\nfrom sklearn.model_selection import StratifiedKFold, train_test_split, GridSearchCV, RandomizedSearchCV\n\nfrom sklearn.utils import class_weight\n\n\n#import pickle as pkl\n#import gzip\n\nimport json\nimport cv2\nimport csv\nimport pandas as pd\nimport seaborn as sns\n\nimport os","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"path = \"../input/cassava-leaf-disease-classification/\"","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train = pd.read_csv(path+'train.csv')\nprint(train)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"test = pd.read_csv(path+'sample_submission.csv')\nprint(test)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train['label'] = train['label'].astype('str')\ntrain.head()\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"with open(os.path.join(path, \"label_num_to_disease_map.json\")) as file:\n    map_classes = json.loads(file.read())    \nprint(json.dumps(map_classes, indent=1))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"class MakeLegend(HandlerBase):\n    def create_artists(self, legend, tup ,xdescent, ydescent,\n                        width, height, fontsize,trans):\n        tx = Text(width/2.,height/2,tup[0], fontsize=fontsize,\n                  ha=\"center\", va=\"center\", color=tup[1], fontweight=\"bold\")\n        return [tx]\n\n\ndef plot_label_count(data):\n    label_numbers = [\"0\", \"1\", \"2\", \"3\", \"4\"]\n    label_texts = [json.dumps(map_classes[\"0\"]), json.dumps(map_classes[\"1\"]),\n                   json.dumps(map_classes[\"2\"]), json.dumps(map_classes[\"3\"]),\n                   json.dumps(map_classes[\"4\"])]\n\n    ax = sns.countplot(x=data['label'])\n    t = ax.get_xticklabels()\n    labeldict = dict(zip(label_numbers, label_texts))\n    labels = [labeldict[h.get_text()] for h in t]\n    handles = [(h.get_text(), c.get_fc()) for h,c, in zip(t,ax.patches)]\n    #ax.legend(handles, labels, handler_map={tuple : MakeLegend()}) \n    box = ax.get_position()\n    ax.set_position([box.x0, box.y0, box.width*1.0, box.height])\n    ax.legend(handles, labels, handler_map={tuple : MakeLegend()},loc='center right', bbox_to_anchor=(1.85, 0.5), ncol=1)\n    plt.show()\n    \n    \ndef create_model():\n    model = Sequential()\n    model.add(Conv2D(32, kernel_size=(3,3), input_shape=(300,300,3)))\n    model.add(BatchNormalization())\n    model.add(ELU(alpha=1.0))\n    model.add(Conv2D(32, kernel_size=(3,3)))\n    model.add(BatchNormalization())\n    model.add(ELU(alpha=1.0))\n    model.add(MaxPooling2D(pool_size=(2,2)))\n    model.add(SpatialDropout2D(0.2))\n    \n    model.add(Conv2D(64, kernel_size=(3,3)))\n    model.add(BatchNormalization())\n    model.add(ELU(alpha=1.0))\n    model.add(Conv2D(64, kernel_size=(3,3)))\n    model.add(BatchNormalization())\n    model.add(ELU(alpha=1.0))\n    model.add(MaxPooling2D(pool_size=(2,2)))\n    model.add(SpatialDropout2D(0.2))\n    \n    model.add(Conv2D(128, kernel_size=(3,3)))\n    model.add(BatchNormalization())\n    model.add(ELU(alpha=1.0))\n    model.add(Conv2D(128, kernel_size=(3,3)))\n    model.add(BatchNormalization())\n    model.add(ELU(alpha=1.0))\n    model.add(Conv2D(128, kernel_size=(3,3)))\n    model.add(BatchNormalization())\n    model.add(ELU(alpha=1.0))\n    model.add(MaxPooling2D(pool_size=(2,2)))\n    model.add(SpatialDropout2D(0.2))\n    \n    model.add(Conv2D(256, kernel_size=(3,3)))\n    model.add(BatchNormalization())\n    model.add(ELU(alpha=1.0))\n    model.add(Conv2D(256, kernel_size=(3,3)))\n    model.add(BatchNormalization())\n    model.add(ELU(alpha=1.0))\n    model.add(Conv2D(256, kernel_size=(3,3)))\n    model.add(BatchNormalization())\n    model.add(ELU(alpha=1.0))\n    model.add(MaxPooling2D(pool_size=(2,2)))\n    model.add(SpatialDropout2D(0.2))\n    \n    model.add(Flatten())\n    model.add(Dense(512))\n    model.add(BatchNormalization())\n    \n    model.add(ELU(alpha=1.0))\n    model.add(Dropout(0.5))\n    model.add(Dense(5, activation='softmax'))\n    model.compile(loss=\"sparse_categorical_crossentropy\", optimizer=Adam(), metrics=['accuracy'])\n    return model","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"plot_label_count(train)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"# the training dataset is highly imbalanced\ntrain['label'].value_counts()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"def plot_training_progress(hist):\n    acc = hist.history['accuracy']\n    acc_val = hist.history['val_accuracy']\n    loss = hist.history['loss']\n    loss_val = hist.history['val_loss']\n    epochs = range(len(acc))\n    plt.plot(epochs, acc, 'b', label='training accuracy')\n    plt.plot(epochs, acc_val, 'r', label='validation accuracy')\n    plt.title('learning curves')\n    plt.legend()\n    \n    plt.figure()\n    plt.plot(epochs, loss, 'b', label='training loss')\n    plt.plot(epochs, loss_val, 'r', label='validation loss')\n    plt.title('training and validation loss')\n    plt.legend()\n    plt.show()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_data,val_data = train_test_split(train, test_size = 0.1, random_state = 42, \n                                       stratify = train['label'])","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_datagen = ImageDataGenerator(\n    featurewise_center=False,\n    featurewise_std_normalization=False,\n    horizontal_flip = True,\n    vertical_flip = True,\n    zoom_range=0.2,\n    brightness_range=[0.9, 1.1],\n    rotation_range=270)   \n    \ntest_datagen = ImageDataGenerator()\n\ntrain_dir = path+'train_images'\n\ntrain_generator = train_datagen.flow_from_dataframe(train_data, directory=train_dir,\n                                                    x_col='image_id',\n                                                    y_col='label',\n                                                    target_size=(300,300),\n                                                    class_mode='sparse',\n                                                    interpolation='nearest',\n                                                    shuffle = True,\n                                                    batch_size=32)\n\nvalidation_generator = test_datagen.flow_from_dataframe(val_data,\n                                                        directory=train_dir,\n                                                        x_col='image_id',\n                                                        y_col='label',\n                                                        target_size=(300,300),\n                                                        class_mode='sparse',\n                                                        interpolation='nearest',\n                                                        shuffle=True,\n                                                        batch_size=32)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"model = create_model()\nmodel.summary()\nes = EarlyStopping(monitor='val_loss', patience = 10, mode='min', restore_best_weights=True)\n\n\nhistory = model.fit_generator(train_generator,\n                              validation_data=validation_generator,                              \n                              epochs=45,verbose=1,\n                              steps_per_epoch=train_generator.n//train_generator.batch_size,\n                              validation_steps=validation_generator.n//validation_generator.batch_size,\n                              callbacks=[es])\n\nplot_training_progress(history)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"ss = pd.read_csv(os.path.join(os.path.join(path, \"sample_submission.csv\")))\nprint(ss)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"from PIL import Image\n\npreds = []\n\nfor image_id in ss.image_id:\n    image = Image.open(os.path.join(path, \"test_images\", image_id))\n    image = image.resize((300,300))\n    image = np.expand_dims(image, axis = 0)\n    preds.append(np.argmax(model.predict(image)))\n\nss['label'] = preds\n\nprint(ss)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"ss.to_csv(\"submission.csv\", index=False)\nprint(\"done\")","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"import h5py\nmodel.save(\"cnn_spat_300.hdf5\")","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat":4,"nbformat_minor":4}