{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import os\nimport numpy as np \nimport glob\nimport shutil","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"## データを読み込む","metadata":{}},{"cell_type":"code","source":"# sample_submission.csvファイルを自分の作業するディレクトリにコピー\nshutil.copyfile('/kaggle/input/dogs-vs-cats-redux-kernels-edition/sample_submission.csv',\n                '/kaggle/working/sample_submission.csv')\n\n\n# zipファイルを自分の作業するディレクトリに解凍\nimport zipfile\nwith zipfile.ZipFile('/kaggle/input/dogs-vs-cats-redux-kernels-edition/train.zip') as existing_zip:\n    existing_zip.extractall()\nwith zipfile.ZipFile('/kaggle/input/dogs-vs-cats-redux-kernels-edition/test.zip') as existing_zip:\n    existing_zip.extractall()\n\n\n# 自分の作業するディレクトリを確認\nfiles = glob.glob('/kaggle/working/*')\nfor file in files:\n    print(file)","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"## 読み込んだデータの確認","metadata":{}},{"cell_type":"code","source":"# trainファイルの中身を確認\nfiles = sorted(glob.glob('/kaggle/working/train/*'))\nprint('訓練用フォルダの中には', len(files), '個の訓練用の画像ファイルが入っています．')\n\n# testファイルの中身を確認\nfiles = sorted(glob.glob('/kaggle/working/test/*'))\nprint('テスト用フォルダの中には', len(files), '個のテスト用の画像ファイルが入っています．')\n\n# 学習させる猫と犬の画像数を確認\nn_cat = 0# 猫用\nn_dog = 0# 犬用\nfiles = glob.glob('/kaggle/working/train/*')\nfor file in files:\n    if 'cat' in file:\n        n_cat += 1\n    else:\n        n_dog += 1\nprint('学習させる画像数...')\nprint('猫の画像数：', n_cat, '枚')\nprint('犬の画像数：', n_dog, '枚')","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"## 猫の画像と犬の画像を分ける","metadata":{}},{"cell_type":"code","source":"# 犬と猫の画像をそれぞれ保存するファイルパスを定義\ndog_dir = '/kaggle/working/train/dog'\ncat_dir = '/kaggle/working/train/cat'\n\n# ファイル作成\nif(os.path.exists(dog_dir) == False):\n    os.mkdir(dog_dir)\nif(os.path.exists(cat_dir) == False):\n    os.mkdir(cat_dir)\n\n# 犬と猫の画像を分ける\nfiles = glob.glob('/kaggle/working/train/*.jpg')\nfor file in files:\n    file_name = os.path.basename(file)\n    if 'cat' in file:\n        shutil.move(file,'/kaggle/working/train/cat/' + file_name)\n    else:\n        shutil.move(file,'/kaggle/working/train/dog/' + file_name)","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"## 一部を検証データに分ける","metadata":{}},{"cell_type":"code","source":"from sklearn.model_selection import train_test_split\n\n#バリデーションデータ用のファイルパスを定義\nval = '/kaggle/working/val'\nval_dog = '/kaggle/working/val/dog'\nval_cat = '/kaggle/working/val/cat'\n\n# ファイル作成\nif(os.path.exists(val) == False):\n    os.mkdir(val)\n    os.mkdir(val_dog)\n    os.mkdir(val_cat)\n\n# 犬の訓練データの一部を，バリデーションデータ用に分割\ndog_files = glob.glob('/kaggle/working/train/dog/*.jpg')\ndog_train, dog_val = train_test_split(dog_files, test_size=0.2, random_state=42)\n# 画像の一部をバリデーションフォルダに移動させる\nfor file in dog_val:\n    file_name = os.path.basename(file)\n    shutil.move(file,'/kaggle/working/val/dog/' + file_name)\n\n# 猫の訓練データの一部を，バリデーションデータ用に分割\ncat_files = glob.glob('/kaggle/working/train/cat/*.jpg')\ncat_train, cat_val = train_test_split(cat_files, test_size=0.2, random_state=42)\n# バリデーションフォルダに移動させる\nfor file in cat_val:\n    file_name = os.path.basename(file)\n    shutil.move(file,'/kaggle/working/val/cat/' + file_name)","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"## 学習モデルの定義","metadata":{}},{"cell_type":"code","source":"from keras.applications.vgg16 import VGG16\nfrom keras.preprocessing.image import ImageDataGenerator\nfrom keras.models import Sequential , Model\nfrom keras.layers import Dense, Dropout, Flatten , Input\nfrom keras.preprocessing.image import ImageDataGenerator\nfrom keras import optimizers\n\n#入力画像のサイズ\nimg_width, img_height = 224, 224\n\ntrain_data_dir = '/kaggle/working/train'\ntest_data_dir = '/kaggle/working/val'\n\n# 分類するクラスの設定\nclasses = ['dog','cat']\nnb_classes = len(classes)\n\n\n# VGG16モデルのロード\nvgg_model = VGG16(\n        include_top = False,\n        weights = 'imagenet',\n        input_shape = (img_height, img_width, 3))\n\n\n# VGG16モデルの下に全結合層を追加\ntop_model = Sequential()\ntop_model.add(Flatten(input_shape= vgg_model.output_shape[1:]))\ntop_model.add(Dense(256, activation='relu'))\ntop_model.add(Dropout(0.5))\ntop_model.add(Dense(nb_classes, activation='softmax'))\n\nmodel = Model( vgg_model.input,top_model(vgg_model.output))\n\nfor layer in vgg_model.layers[:15]:\n    layer.trainable = False\n\nmodel.summary()\n\n# 最適化関数のパラメータ設定\nsgd = optimizers.gradient_descent_v2.SGD(learning_rate = 0.001, momentum = 0.1, decay = 0.0)\n\n# 損失関数は交差エントロピー、最適化関数は確率的勾配法\nmodel.compile(\n        loss = 'categorical_crossentropy',\n        optimizer = sgd,\n        metrics = ['accuracy'])\n\n# 学習データのデータを正規化\ntrain_datagen = ImageDataGenerator(rescale = 1.0 / 255)\n\n# 検証データのデータを正規化\ntest_datagen = ImageDataGenerator(rescale = 1.0 / 255)\n\n# 訓練データ\ntrain_generator = train_datagen.flow_from_directory(\n        train_data_dir,\n        target_size = (img_height, img_width),\n        classes = classes,\n        batch_size = 32,\n        class_mode = 'categorical')\n\n# 検証データ\ntest_generator = test_datagen.flow_from_directory(\n        test_data_dir,\n        target_size = (img_height, img_width),\n        classes = classes,\n        batch_size = 32,\n        class_mode = 'categorical')","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"## 学習の開始","metadata":{}},{"cell_type":"code","source":"from keras.callbacks import ModelCheckpoint\n\nepoch = 10\n\n# モデルの学習する\nhistory = model.fit_generator(\n    train_generator,\n    epochs=epoch,\n    validation_data = test_generator)\n    \n#学習済みモデルの保存\nmodel.save(\"/kaggle/working/dog_cat.h5\")","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"from keras.preprocessing import image\nfrom keras.models import load_model\nimport re\nimport csv\nimport glob","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"## 予測","metadata":{}},{"cell_type":"code","source":"p = re.compile(r'\\d+')\nimcount = 1\ntest_list = glob.glob('/kaggle/working/test/*.jpg')\ntest_list = sorted(test_list,key=lambda s: int(p.search(s).group()))\n\n#学習済みモデルの読み込み\nmodel = load_model('../working/dog_cat.h5')\n\n#csv書き込み\nwith open('../working/submission.csv', 'w') as f:\n    writer= csv.writer(f, lineterminator='\\n')\n    writer.writerow(['id', 'label'])\n    for i in test_list:\n        print(imcount)\n        img = image.load_img(i, target_size=(224, 224))\n        x = image.img_to_array(img)\n        x = np.expand_dims(x, axis=0)\n        x = x / 255.0\n        result_predict = model.predict(x)\n        writer.writerow([imcount, result_predict[0][0]])\n        imcount += 1","metadata":{},"execution_count":null,"outputs":[]}]}