{"cells":[{"metadata":{},"cell_type":"markdown","source":"# UNIVERSIDADE FEDERAL DE PELOTAS\n\nDOUTORADO EM COMPUTAÇÃO\n\nTRABALHO FINAL DA DISCIPLINA DE APRENDIZADO DE MÁQUINA\n\nBY KARLISE SOARES NASCIMENTO\n\n20/12/2020"},{"metadata":{},"cell_type":"markdown","source":"**|O objetivo é identificar e classificar doenças em imagens da planta Cassava (mandioca), problema disponibilizado no site Kaggle.**\n \n"},{"metadata":{},"cell_type":"markdown","source":"A entrega será composta de:\n\nDeve conter, no mínimo:\n* Avaliação de pelo menos três modelos e comparação e discussão adequadas;\n* Técnicas aplicadas que não funcionaram (e comparação com as que funcionaram);\n* Se for feita mais de uma submissão ao Kaggle, mostrar o desempenho no ranking de cada submissão e discutir as diferenças (incentiva-se múltiplas submissões);\n* Quaisquer outros detalhes importantes para compreender as decisões tomadas.\n* Envie um único arquivo ZIP contendo as informações solicitadas na descrição. Facilite a vida dos colegas com nomes de arquivos que façam sentido.\nDemonstração da submissão no Kaggle (username e captura da tela mostrando a posição)"},{"metadata":{},"cell_type":"markdown","source":"# Parte 1. Importando e verificando versões das bibliotecas"},{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"import os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# (/kaggle/input/) will list all files under the input directory\n# (/kaggle/working/) You can write up to 20GB to the current directory - that gets preserved as output when you create a version using \"Save & Run All\" \n# (/kaggle/temp/) You can also write temporary files, but they won't be saved outside of the current session","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"# Python version\nimport sys\nprint('Python: {}'.format(sys.version))\n# scipy\nimport scipy\nprint('scipy: {}'.format(scipy.__version__))\n# numpy\nimport numpy as np\nprint('numpy: {}'.format(np.__version__))\n# matplotlib\nimport matplotlib\nprint('matplotlib: {}'.format(matplotlib.__version__))\n# pandas\nimport pandas as pd\nprint('pandas: {}'.format(pd.__version__))\n# scikit-learn\nimport sklearn\nprint('sklearn: {}'.format(sklearn.__version__))\n# TensorFlow e tf.keras\nimport tensorflow as tf\nfrom tensorflow import keras\nprint('tensorFlow: {}'.format(tf.__version__))\n","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"# Instalando fastai"},{"metadata":{"trusted":true},"cell_type":"code","source":"! [ -e /content ] && pip install -Uqq fastai","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"from fastai.vision.all import *","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"raw","source":""},{"metadata":{},"cell_type":"markdown","source":"# Parte 2. Carregando o dataset"},{"metadata":{"trusted":true},"cell_type":"code","source":"dados_treino = pd.read_csv(\"/kaggle/input/cassava-leaf-disease-classification/train.csv\") \n\n#dados_treino = dados_treino[:5000]\ndados_treino.head()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"dls = ImageDataLoaders.from_df(dados_treino, path=\"/kaggle/input/cassava-leaf-disease-classification/train_images/\", item_tfms=Resize(224), batch_tfms=[*aug_transforms(size=256), Normalize.from_stats(*imagenet_stats)])\ndls.show_batch()","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"# Parte 3. Treinando um modelo com Redes Convolucionais (CNN)\n\nNesta etapa foram comparados os modelos de treinamento: ResNet18, AlexNet, ResNet50 e DenseNet121.\n\nO melhor resultado foi obtido com o DenseNet121, realizando o treinamento com 30 épocas. \n\nTambém observei que o uso do parâmetro batch_tfms afetou o desempenho de forma positiva.\n","attachments":{}},{"metadata":{"trusted":true},"cell_type":"code","source":"#learn = cnn_learner(dls, resnet18, metrics=[error_rate,accuracy], pretrained=False)#versão 2 score 64,1 - fit 5 - dados totais\n#learn = cnn_learner(dls, alexnet, metrics=[error_rate,accuracy], pretrained=False) #versão 3 score 65,0 - fit 30 - dados totais\n#learn = cnn_learner(dls, resnet50, metrics=[error_rate,accuracy], pretrained=False) #versão 4 score 60,0 - fit 10 - 5000 imgs\n#learn = cnn_learner(dls, resnet50, metrics=[error_rate,accuracy], pretrained=False) #versão 5 score 66,6 - fit 30 - dados totais\n#learn = cnn_learner(dls, densenet121, metrics=[error_rate,accuracy], pretrained=False) #versão 6 - 70,6 - fit 30 - dados totais\nlearn = cnn_learner(dls, densenet121, metrics=[error_rate,accuracy], pretrained=False) #versão 7 - 80,0 - fit 30 - dados totais + batch_tfms\n\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"learn.fit(30)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"# Parte 4. Analisando os resultados"},{"metadata":{"trusted":true},"cell_type":"code","source":"#Gráfico de loss\nlearn.recorder.plot_loss()\n ","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"#Matriz de Confusão\ninterp = ClassificationInterpretation.from_learner(learn)\ninterp.plot_confusion_matrix(normalize=\"true\")\n\n","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"# Parte 5. Gerando o arquivo de submissão"},{"metadata":{"trusted":true},"cell_type":"code","source":"#path='/content/drive/MyDrive/Colab Notebooks/KAGGLE_CASSAVA'\npath='/kaggle/input/cassava-leaf-disease-classification/'\nsubmission_df = pd.read_csv(path+'/sample_submission.csv')\nsubmission_df","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"test_data_path = submission_df['image_id'].apply(lambda x: path+'/test_images/'+x)\ntst_dl = learn.dls.test_dl(test_data_path)\npredictions = learn.tta(dl = tst_dl, n=10)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"submission_df['label'] = np.argmax(predictions[0],axis=1)\nsubmission_df","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"submission_df.to_csv('/kaggle/working/submission.csv',index=False)","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat":4,"nbformat_minor":4}