{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import numpy as np\nimport pandas as pd \nimport matplotlib.pyplot as plt\nimport matplotlib.image as mpimg\n\nfrom sklearn.model_selection import train_test_split\nfrom keras.preprocessing.image import ImageDataGenerator\n\n\nimport tensorflow as tf\nfrom keras.models import Sequential\nfrom keras.layers.convolutional import Conv2D\nfrom keras.layers.convolutional import MaxPooling2D\nfrom keras.layers.core import Activation\nfrom keras.layers.core import Flatten\nfrom keras.layers.core import Dropout\nfrom keras.layers.core import Dense\nfrom keras.optimizers import Adam\nimport pickle\n","metadata":{"execution":{"iopub.status.busy":"2023-11-13T04:56:50.887138Z","iopub.execute_input":"2023-11-13T04:56:50.887503Z","iopub.status.idle":"2023-11-13T04:56:50.894526Z","shell.execute_reply.started":"2023-11-13T04:56:50.887475Z","shell.execute_reply":"2023-11-13T04:56:50.893440Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"# Load the training data into a DataFrame. \n# Print the shape of the resulting DataFrame.\n\nhcd = pd.read_csv('/kaggle/input/histopathologic-cancer-detection/train_labels.csv')\nprint(hcd.shape)","metadata":{"execution":{"iopub.status.busy":"2023-11-13T03:30:46.518434Z","iopub.execute_input":"2023-11-13T03:30:46.519116Z","iopub.status.idle":"2023-11-13T03:30:46.903427Z","shell.execute_reply.started":"2023-11-13T03:30:46.519081Z","shell.execute_reply":"2023-11-13T03:30:46.902386Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"# Display the head of the train DataFrame. \nhcd.head()","metadata":{"execution":{"iopub.status.busy":"2023-11-13T03:30:46.904730Z","iopub.execute_input":"2023-11-13T03:30:46.905040Z","iopub.status.idle":"2023-11-13T03:30:46.927387Z","shell.execute_reply.started":"2023-11-13T03:30:46.905014Z","shell.execute_reply":"2023-11-13T03:30:46.926312Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"#label distrobution\n(hcd.label.value_counts() / len(hcd)).to_frame()","metadata":{"execution":{"iopub.status.busy":"2023-11-13T03:30:46.928748Z","iopub.execute_input":"2023-11-13T03:30:46.929175Z","iopub.status.idle":"2023-11-13T03:30:46.950646Z","shell.execute_reply.started":"2023-11-13T03:30:46.929143Z","shell.execute_reply":"2023-11-13T03:30:46.949441Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"#Adding a variable for the image directory\nimg_dir = '/kaggle/input/histopathologic-cancer-detection/train'","metadata":{"execution":{"iopub.status.busy":"2023-11-13T03:30:46.956872Z","iopub.execute_input":"2023-11-13T03:30:46.957380Z","iopub.status.idle":"2023-11-13T03:30:46.962230Z","shell.execute_reply.started":"2023-11-13T03:30:46.957344Z","shell.execute_reply":"2023-11-13T03:30:46.961097Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"sample = hcd.sample(n=9).reset_index()\n\nplt.figure(figsize=(3,3))\n\nfor i, row in sample.iterrows():\n\n    img = mpimg.imread(f'{img_dir}/{row.id}.tif')    \n    label = row.label\n\n    plt.subplot(3,3,i+1)\n    plt.imshow(img)\n    plt.text(0, -5, f'Class {label}', color='k')\n        \n    plt.axis('off')\n\nplt.tight_layout()\nplt.show()\n    ","metadata":{"execution":{"iopub.status.busy":"2023-11-13T03:30:46.963593Z","iopub.execute_input":"2023-11-13T03:30:46.963947Z","iopub.status.idle":"2023-11-13T03:30:47.898309Z","shell.execute_reply.started":"2023-11-13T03:30:46.963914Z","shell.execute_reply":"2023-11-13T03:30:47.896881Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"#using data generators \ntrain_df, valid_df = train_test_split(hcd, test_size=0.2, random_state=39, stratify=hcd.label)\n\nprint(train_df.shape)\nprint(valid_df.shape)","metadata":{"execution":{"iopub.status.busy":"2023-11-13T03:30:47.899911Z","iopub.execute_input":"2023-11-13T03:30:47.900598Z","iopub.status.idle":"2023-11-13T03:30:48.022149Z","shell.execute_reply.started":"2023-11-13T03:30:47.900546Z","shell.execute_reply":"2023-11-13T03:30:48.021039Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"#scaling images \ntrain_datagen = ImageDataGenerator(rescale=1/255)\nvalid_datagen = ImageDataGenerator(rescale=1/255)","metadata":{"execution":{"iopub.status.busy":"2023-11-13T03:30:48.023714Z","iopub.execute_input":"2023-11-13T03:30:48.024041Z","iopub.status.idle":"2023-11-13T03:30:48.028472Z","shell.execute_reply.started":"2023-11-13T03:30:48.024014Z","shell.execute_reply":"2023-11-13T03:30:48.027516Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_df['id'] = train_df['id'] + '.tif'\nvalid_df['id'] = valid_df['id'] + '.tif'","metadata":{"execution":{"iopub.status.busy":"2023-11-13T03:30:48.029661Z","iopub.execute_input":"2023-11-13T03:30:48.029922Z","iopub.status.idle":"2023-11-13T03:30:48.095132Z","shell.execute_reply.started":"2023-11-13T03:30:48.029899Z","shell.execute_reply":"2023-11-13T03:30:48.094358Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"# Creating Data Generators for CNN\ntrain_datagen = ImageDataGenerator(\n    rescale=1/255,\n    rotation_range=40,\n    width_shift_range=0.2,\n    height_shift_range=0.2,\n    shear_range=0.2,\n    zoom_range=0.2,\n    horizontal_flip=True,\n    fill_mode='nearest'\n)\n\nvalid_datagen = ImageDataGenerator(rescale=1/255)\n\ntrain_df['label'] = train_df['label'].astype(str)\nvalid_df['label'] = valid_df['label'].astype(str)\n\ntrain_generator = train_datagen.flow_from_dataframe(\n    dataframe=train_df,\n    directory=img_dir,\n    x_col='id',\n    y_col='label',\n    target_size=(96, 96),\n    batch_size=32,\n    class_mode='binary'\n)\n\nvalidation_generator = valid_datagen.flow_from_dataframe(\n    dataframe=valid_df,\n    directory=img_dir,\n    x_col='id',\n    y_col='label',\n    target_size=(96, 96),\n    batch_size=32,\n    class_mode='binary'\n)","metadata":{"execution":{"iopub.status.busy":"2023-11-13T03:30:48.096306Z","iopub.execute_input":"2023-11-13T03:30:48.096961Z","iopub.status.idle":"2023-11-13T03:44:16.731851Z","shell.execute_reply.started":"2023-11-13T03:30:48.096926Z","shell.execute_reply":"2023-11-13T03:44:16.730644Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"model = Sequential()\n\n# Convolutional layer\nmodel.add(Conv2D(32, (3, 3), activation='relu', input_shape=(96, 96, 3)))\nmodel.add(MaxPooling2D((2, 2)))\n\n# Second layer\nmodel.add(Conv2D(64, (3, 3), activation='relu'))\nmodel.add(MaxPooling2D((2, 2)))\n\n# Third layer\nmodel.add(Conv2D(128, (3, 3), activation='relu'))\nmodel.add(MaxPooling2D((2, 2)))\n\nmodel.add(Flatten())\n\nmodel.add(Dense(128, activation='relu'))\n\n# Dropout layer\nmodel.add(Dropout(0.5))\n\n# Output layer\nmodel.add(Dense(1, activation='sigmoid'))\n\n#optimizing \nopt = tf.keras.optimizers.Adam(0.005)\n\n# Compiling the model\nmodel.compile(loss='binary_crossentropy', optimizer='adam', metrics=['accuracy'])","metadata":{"execution":{"iopub.status.busy":"2023-11-13T03:49:50.474364Z","iopub.execute_input":"2023-11-13T03:49:50.474767Z","iopub.status.idle":"2023-11-13T03:49:51.357181Z","shell.execute_reply.started":"2023-11-13T03:49:50.474736Z","shell.execute_reply":"2023-11-13T03:49:51.356363Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"TR_STEPS = len(train_generator)\nVA_STEPS = len(validation_generator)\n","metadata":{"execution":{"iopub.status.busy":"2023-11-13T03:52:10.384122Z","iopub.execute_input":"2023-11-13T03:52:10.385011Z","iopub.status.idle":"2023-11-13T03:52:10.389385Z","shell.execute_reply.started":"2023-11-13T03:52:10.384963Z","shell.execute_reply":"2023-11-13T03:52:10.388159Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"%%time \n\nGo1 = model.fit(\n    x = train_generator, \n    steps_per_epoch = TR_STEPS, \n    epochs = 1,\n    validation_data = validation_generator, \n    validation_steps = VA_STEPS, \n    verbose = 1\n)","metadata":{"execution":{"iopub.status.busy":"2023-11-13T03:54:24.817144Z","iopub.execute_input":"2023-11-13T03:54:24.817546Z","iopub.status.idle":"2023-11-13T04:54:58.608015Z","shell.execute_reply.started":"2023-11-13T03:54:24.817516Z","shell.execute_reply":"2023-11-13T04:54:58.607011Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"model.save('SEAB_Take_1_HCD.Go1')\npickle.dump(Go1.history, open(f'SEAB_Take_1_HCD_history.pkl', 'wb'))","metadata":{"execution":{"iopub.status.busy":"2023-11-13T04:56:55.003401Z","iopub.execute_input":"2023-11-13T04:56:55.004071Z","iopub.status.idle":"2023-11-13T04:56:56.248620Z","shell.execute_reply.started":"2023-11-13T04:56:55.004041Z","shell.execute_reply":"2023-11-13T04:56:56.247778Z"},"trusted":true},"execution_count":null,"outputs":[]}]}