{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\n # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"!pip install pretrainedmodels\n\n!pip install --upgrade efficientnet-pytorch","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import numpy as np\nimport pandas as pd\nimport torch\nfrom torch import nn\nimport torch.nn.functional as f \nfrom torchvision import datasets, transforms\nfrom sklearn.model_selection import StratifiedKFold\nimport cv2\nimport albumentations as A\nfrom albumentations.pytorch import ToTensorV2\nfrom torch.utils.data import Dataset, DataLoader\nimport tensorflow as tf\n# from tensorflow.keras.applications import EfficientNetB7\n# from efficientnet_pytorch import EfficientNet\nfrom PIL import Image\nimport matplotlib.pyplot as plt\nfrom torch.autograd import Variable","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"if torch.cuda.is_available():\n        device = 'cuda:0'\nelse:\n        device = 'cpu'\ndevice","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"dataset = \"/kaggle/input/plant-pathology-2021-fgvc8/train.csv\"\ndata = pd.read_csv(dataset)\ndata","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"\nlabels = list(data['labels'].value_counts().keys())\nlabels\nlabels_dict = dict(zip(labels,range(12)))\nlabels_dict\ndata = data.replace({\"labels\":labels_dict})\ndata\n","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"# img = cv2.imread(data['image'][0])\npath = \"/kaggle/input/plant-pathology-2021-fgvc8/train_images/\"\nimag = Image.open(path + data['image'][99])\nimg = np.array(imag)\nplt.imshow(img)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"from sklearn.model_selection import train_test_split \nX_train, X_test, y_train, y_test = train_test_split(data['image'], data['labels'], test_size = .2, random_state = 2) ## splitting into train and test set\nlen(X_train), len(X_test)\ntype(X_train)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"# k = 6\n# skfold = StratifiedKFold(k)\n# X = data['image']; Y = data['labels']\n# for train_index , val_index in skfold.split(X,Y):\n#     train_data = data.iloc[train_index]\n#     val_data = data.iloc[val_index]\n#     break\n# print(train_data.shape)\n# print(val_data.shape)\n# #","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"class DatasetLoading(Dataset):\n    def __init__(self, image,labels, transform ):\n#         self.image = image.reshape((-1,64,64)).astype(np.float32)\n        self.transform = transform\n#         print(image.values)\n#         self.image = image.values.astype(np.float64)\n        self.labels = labels\n        self.image_path = image\n#         self.image = self.image.astype(np.float32)\n#         self.image = torch.from_numpy(self.image).long()\n        \n    def __len__(self):\n        return len(self.labels)\n    def __getitem__(self,index):\n        path = \"/kaggle/input/plant-pathology-2021-fgvc8/train_images/\"\n        image = Image.open(path + self.image_path[index])\n        image_arr = np.array(image)\n#         im_arr32 = image_arr.astype(np.float32)\n#         im_tensor = torch.tensor(im_arr32)\n#         im_tensor = im_tensor.unsqueeze(0)\n#         image = cv2.imread(self.image_path[index])\n#         image = cv2.cvtColor(image, cv2.COLOR_BGR2RGB)\n        return self.transform(image_arr), torch.tensor(self.labels[index],dtype=torch.int64)\n        ","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"#  class PlantDataset(Dataset):\n#     def __init__(self, df , transform = None):\n#         self.imgid = df['image'].values\n#         self.labels = df['labels'].values\n#         self.transform = transform\n#     def __len__(self):\n#         return len(self.labels)\n#     def __getitem__(self, index):\n#          return self.transform(self.imgid[index]), self.label[index]\n# # test_data = MNISTDataset(test_images, test_labels, transform)\n# # # dataloaders\n# # trainloader = DataLoader(train_data, batch_size=128, shuffle=True)\n# # testloader = DataLoader(test_data, batch_size=128, shuffle=True)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import os\nimport matplotlib.image as mpimg\n\nclass ImageData(Dataset):\n    def __init__(self,df,data_dir,transform):\n        super().__init__()\n        \n        self.df = df\n        self.transform = transform\n        self.data_dir = data_dir\n        \n    def __len__(self):\n        return len(self.df)\n    \n    def __getitem__(self,index):\n        \n        img_name = self.df.image[index]\n        label = self.df.labels[index]\n        #print(\"yo\",img_name,index)\n        img_path = os.path.join(self.data_dir,img_name)\n        image = mpimg.imread(img_path)\n        image = self.transform(image)\n        return image,label","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_transform= transforms.Compose([\n            transforms.ToPILImage(),\n            transforms.ToTensor(),\n            transforms.Resize((224,224)),\n            transforms.RandomHorizontalFlip(p=0.5),\n            transforms.RandomRotation(degrees=(-90, 90)),\n#             transforms.RandomBrightnessContrast(p=0.5),\n            transforms.Normalize((0.5, ), (0.5, )),\n            \n            ])\nval_transform = transforms.Compose(\n    [transforms.ToPILImage(),\n     transforms.ToTensor(),\n     transforms.Normalize((0.5, ), (0.5, ))\n])","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_dir = '../input/plant-pathology-2021-fgvc8/train_images'\n\n\ntrain_data = ImageData(df = data,data_dir=train_dir,transform=train_transform)\ntrainloader = DataLoader(dataset = train_data,batch_size = 64)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"\ndataset_train = DatasetLoading(X_train,y_train,train_transform)\n\n\ntrain_loader = DataLoader(dataset_train, batch_size = 32, shuffle = True,num_workers=4,\n                          pin_memory = True)","metadata":{"_kg_hide-input":true,"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"dataset_val = DatasetLoading(X_test,y_test,val_transform)\n\nval_loader = DataLoader(dataset_val, batch_size = 32, shuffle = False,num_workers=4)\n                          ","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"class Net(nn.Module):\n    def __init__(self):\n        super(Net,self).__init__()\n        self.cnn_layers = nn.Sequential(\n            nn.Conv2d(1, 32, kernel_size=3, stride=1, padding=1),\n            nn.BatchNorm2d(32),\n            nn.ReLU(inplace=True),\n            nn.Conv2d(32, 32, kernel_size=3, stride=1, padding=1),\n            nn.BatchNorm2d(32),\n            nn.ReLU(inplace=True),\n            nn.MaxPool2d(kernel_size=2, stride=2),\n        )\n        self.linear_layers = nn.Sequential(\n            # Adding Dropout\n            nn.Dropout(p = 0.5),\n            nn.Linear(32 * 32 * 32, 512),\n            nn.BatchNorm1d(512),\n            nn.ReLU(inplace=True),\n            nn.Dropout(p = 0.5),\n            nn.Linear(512, 12),\n        )\n        \n    # Defining the forward pass    \n    def forward(self, x):\n        print(type(x))\n#         x = y.unsqueeze(1)\n        x = self.cnn_layers(x)\n        x = x.view(x.size(0), -1)\n        # Forwrd pass through Fully Connected Layers\n        x = self.linear_layers(x)\n        return F.log_softmax(x) ","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import torch.optim as optim\nfrom torch.optim import lr_scheduler\nmodel = Net()\noptimizer = optim.Adam(model.parameters(), lr=0.01)\ncriterion = nn.CrossEntropyLoss()\nexp_lr_scheduler = lr_scheduler.StepLR(optimizer, step_size=7, gamma=0.1)\nif torch.cuda.is_available():\n    model = model.cuda()\n    criterion = criterion.cuda()","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def train(epoch):\n    model.train()\n    exp_lr_scheduler.step()\n    tr_loss = 0\n    correct = 0\n    total = 0\n    for data,target in trainloader:\n#         print(batch_idx)\n#         data, target = dt\n        print(type(data))\n        print(type(target))\n        data, target = Variable(data), Variable(target)\n        if torch.cuda.is_available():\n            data = data.cuda()\n            target = target.cuda()\n            \n        # Clearing the Gradients of the model parameters\n        optimizer.zero_grad()\n#         data.unsqueeze_(1)\n        output = model(data)\n        pred = torch.max(output.data, 1)[1]\n        correct += (pred == target).sum()\n        total += len(data)\n        \n        # Computing the loss\n        loss = criterion(output, target)\n        \n        # Computing the updated weights of all the model parameters\n        loss.backward()\n        optimizer.step()\n        tr_loss = loss.item()\n        if (batch_idx + 1)% 100 == 0:\n            print('Train Epoch: {} [{}/{} ({:.0f}%)]\\tLoss: {:.6f} \\t Accuracy: {} %'.format(\n                epoch, (batch_idx + 1) * len(data), len(train_loader.dataset),\n                100. * (batch_idx + 1) / len(train_loader), loss.item(),100 * correct / total))\n            torch.save(model.state_dict(), './model.pth')\n            torch.save(model.state_dict(), './optimizer.pth')\n    train_loss.append(tr_loss / len(train_loader))\n    train_accuracy.append(100 * correct / total)\n    print(type(dt))","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"n_epochs = 5\ntrain_loss = []\ntrain_accuracy = []\nvalid_loss = []\nvalid_accuracy = []\nfor epoch in range(n_epochs):\n    train(epoch)\n    evaluate(test_loader)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def evaluate(data_loader):\n    model.eval()\n    loss = 0\n    correct = 0\n    total = 0\n    for data, target in data_loader:\n        data, target = Variable(data, volatile=True), Variable(target)\n        if torch.cuda.is_available():\n            data = data.cuda()\n            target = target.cuda()\n        \n        output = model(data)\n        loss += F.cross_entropy(output, target, size_average=False).item()\n        pred = torch.max(output.data, 1)[1]\n        total += len(data)\n        correct += (pred == target).sum()\n    loss /= len(data_loader.dataset)\n    valid_loss.append(loss)    \n    valid_accuracy.append(100 * correct / total)\n    print('\\nAverage Validation loss: {:.5f}\\tAccuracy: {} %'.format(loss, 100 * correct / total))","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_dataset = PlantDataset(train_data, transformer)\nvalid_dataset = PlantDataset(val_data, transformer)\n\n\ntrain_loader = DataLoader(train_dataset, batch_size=32, shuffle=True, num_workers=2, pin_memory=True, drop_last=True)\nvalid_loader = DataLoader(valid_dataset, batch_size=32, shuffle=False, num_workers=2)\ntrain_loader","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"for epoch in range(epochs):\n    for img, labels in train_loader:\n        step+=1\n        img , labels = image.to(device),labels.to(device)\n        optimizer.zero_grad()\n        logprob = model(img)\n        loss = criterion(logprob,labels)\n        loss.backward()\n        optimizer.step()\n        running_loss += loss.item()\n        ","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"class Plant_dataset(Dataset):\n    def __init__(self, df , transform = None):\n        self.imgid = df['image'].values\n        self.labels = df['labels'].values\n        self.transform = transform\n    def __len__(self):\n        return len(self.labels)\n    \n    def __getitem__(self,index):\n        imgid = self.imgid[index]\n        label = self.labels[index]\n        image_path = \"/kaggle/input/plant-pathology-2021-fgvc8/train_images/\" + imgid\n        image = cv2.imread(image_path)\n        image = cv2.cvtColor(image, cv2.COLOR_BGR2RGB)\n        augmented = self.transform(image = image)\n#         image = transformed['image']\n        image = augmented['image']\n        return {'image':image, 'target': label}\n        \n\n","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import matplotlib.pyplot as plt\nimage_path = \"/kaggle/input/plant-pathology-2021-fgvc8/train_images/\" + '923fd2cb9b0c6c61.jpg'\nimage = cv2.imread(image_path)\nimage = cv2.cvtColor(image, cv2.COLOR_BGR2RGB)\nplt.imshow(image)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"len(train_data)\na = train_data['image'].values\n# a = cv2.imread(a[2])\n# plt.imshow(a)\na[2]","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def get_transform(phase: str):\n    if phase == 'train':\n        return transforms.Compose([\n            A.RandomResizedCrop(height= 224, width= 224),\n            A.HorizontalFlip(p=0.5),\n            A.ShiftScaleRotate(p=0.5),\n            A.RandomBrightnessContrast(p=0.5),\n            A.Normalize(),\n            ToTensorV2(),\n        ])\n    else:\n        return transforms.Compose([\n            A.Resize(height=224, width=224),\n            A.Normalize(),\n            ToTensorV2(),\n        ])","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_dataset = Plant_dataset(train_data, get_transform('train'))\nvalid_dataset = Plant_dataset(val_data, get_transform('valid'))\n\ntrain_loader = DataLoader(train_dataset, batch_size=32, shuffle=True, num_workers=2, pin_memory=True, drop_last=True)\nvalid_loader = DataLoader(valid_dataset, batch_size=32, shuffle=False, num_workers=2)\ntrain_loader","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"model = 'efficientnet-b7'\nmodel = EfficientNet.from_pretrained(model, num_classes=12)\n\n","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"model","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"from torch import optim\ncriterion = nn.NLLLoss()\noptimizer = optim.Adam(model.parameters(),lr = 0.01)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"epochs = 1 \nsteps = 0\nrunning_loss = 0\nprint_every = 5\n","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"for epoch in range(epochs):\n    for img, labels in train_loader:\n        step+=1\n        img , labels = image.to(device),labels.to(device)\n        optimizer.zero_grad()\n        logprob = model(img)\n        loss = criterion(logprob,labels)\n        loss.backward()\n        optimizer.step()\n        running_loss += loss.item()\n        \n#     if step% %print_every == 0:\n#         img, labels = img.to(device),labels.to(device)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_fold_results = []\n\nfor epoch in range(epochs):\n\n    print('  Epoch {}/{}'.format(epoch + 1, epochs))\n    print('  ' + ('-' * 20))\n\n    model.train()\n    tr_loss = 0\n\n    for step, batch in enumerate(train_loader):\n\n        images = batch[0]\n        labels = batch[1]\n\n        images = images.to(device, dtype=torch.float)\n        labels = labels.to(device, dtype=torch.float)\n\n        outputs = model(images)\n        loss = criterion(outputs, labels.squeeze(-1))                \n        loss.backward()\n\n        tr_loss += loss.item()\n\n        optimizer.step()\n        optimizer.zero_grad()\n","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"","metadata":{"trusted":true},"execution_count":null,"outputs":[]}]}