{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","execution":{"iopub.status.busy":"2022-06-03T05:14:32.297087Z","iopub.execute_input":"2022-06-03T05:14:32.297633Z","iopub.status.idle":"2022-06-03T05:14:35.46064Z","shell.execute_reply.started":"2022-06-03T05:14:32.297545Z","shell.execute_reply":"2022-06-03T05:14:35.459487Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import os\nimport json \nimport librosa\nimport numpy as np\nimport pandas as pd\nfrom sklearn.model_selection import train_test_split\nimport tensorflow as tf\nfrom tensorflow.keras.models import Model\nfrom tensorflow.keras.layers import Dense, GlobalAveragePooling2D\nfrom tensorflow.keras.callbacks import ModelCheckpoint, EarlyStopping, ReduceLROnPlateau\nfrom tensorflow.keras.optimizers import Adam\nfrom tensorflow.keras import optimizers\nfrom tensorflow.keras.utils import plot_model, Sequence\nfrom tensorflow.keras.utils import to_categorical\nfrom tensorflow.keras.applications import MobileNetV2\nfrom tensorflow.keras.layers import Input, Concatenate\nfrom tqdm import tqdm\nfrom tensorflow.keras.models import Sequential\nfrom tensorflow.keras.layers import Flatten, Conv2D, MaxPooling2D, Dropout","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:14:35.46282Z","iopub.execute_input":"2022-06-03T05:14:35.463476Z","iopub.status.idle":"2022-06-03T05:14:44.557522Z","shell.execute_reply.started":"2022-06-03T05:14:35.463419Z","shell.execute_reply":"2022-06-03T05:14:44.556335Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_meta = pd.read_csv(\"/kaggle/input/birdclef-2022/train_metadata.csv\")\ntrain_meta","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:14:44.559132Z","iopub.execute_input":"2022-06-03T05:14:44.559975Z","iopub.status.idle":"2022-06-03T05:14:44.695716Z","shell.execute_reply.started":"2022-06-03T05:14:44.559926Z","shell.execute_reply":"2022-06-03T05:14:44.694665Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"labels = list(train_meta['primary_label'].unique())","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:14:44.698542Z","iopub.execute_input":"2022-06-03T05:14:44.699247Z","iopub.status.idle":"2022-06-03T05:14:44.710551Z","shell.execute_reply.started":"2022-06-03T05:14:44.699201Z","shell.execute_reply":"2022-06-03T05:14:44.709308Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"## Split audio into 5 seconds chunks","metadata":{}},{"cell_type":"code","source":"import soundfile as sf\nimport os\n\ndef cutAudio(file_path, is_save):\n    # First load the file\n    filename = file_path.replace(\"/\", \"_\")\n    file_path = \"/kaggle/input/birdclef-2022/train_audio/\" + file_path\n    audio, sr = librosa.load(file_path)\n\n    # Get number of samples for 5 seconds; replace 5 by any number\n    buffer = 5 * sr\n\n    samples_total = len(audio)\n    samples_wrote = 0\n    counter = 1\n\n    audio_split = []\n    audio_filenames = []\n    while samples_wrote < samples_total:\n        #check if the buffer is not exceeding total samples \n        if buffer > (samples_total - samples_wrote):\n            buffer = samples_total - samples_wrote\n\n        block = audio[samples_wrote : (samples_wrote + buffer)]\n        audio_split.append(block)\n\n        # Write 5 second segment\n        if is_save == True:\n            out_filename = \"/kaggle/working/each5s/split_\" + str(counter) + \"_\" + filename\n            audio_filenames.append(out_filename)\n            sf.write(out_filename, block, sr)\n        counter += 1\n        samples_wrote += buffer\n    return audio_split, sr, audio_filenames","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:14:44.712023Z","iopub.execute_input":"2022-06-03T05:14:44.713386Z","iopub.status.idle":"2022-06-03T05:14:44.725816Z","shell.execute_reply.started":"2022-06-03T05:14:44.71333Z","shell.execute_reply":"2022-06-03T05:14:44.724501Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def splitTrainAudio(_df):\n    data = []\n    for index, row in tqdm(_df.iterrows()):\n        cutAudio(row[\"filename\"], True)\n        audio_lst, sr, filenames = cutAudio(row[\"filename\"], True)\n        for idx, y in enumerate(audio_lst):\n            data.append([row[\"primary_label\"], row[\"filename\"], filenames[idx]])\n\n    data_df = pd.DataFrame(data, columns=['primary_label', 'original_filename', 'filename'])\n    data_df.to_csv(\"/kaggle/working/data_df.csv\", index=False)","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:14:44.727193Z","iopub.execute_input":"2022-06-03T05:14:44.728271Z","iopub.status.idle":"2022-06-03T05:14:44.741042Z","shell.execute_reply.started":"2022-06-03T05:14:44.728192Z","shell.execute_reply":"2022-06-03T05:14:44.739843Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"# Sample Data\ndata_frames = []\nfor label in labels:\n    tmp_df = train_meta[train_meta[\"primary_label\"] == label].sample(n=1, replace=True).reset_index(drop=True)\n    data_frames.append(tmp_df)\nsample_df = pd.concat(data_frames).reset_index(drop=True)\nsample_df","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:14:44.742821Z","iopub.execute_input":"2022-06-03T05:14:44.743334Z","iopub.status.idle":"2022-06-03T05:14:45.299742Z","shell.execute_reply.started":"2022-06-03T05:14:44.74329Z","shell.execute_reply":"2022-06-03T05:14:45.298623Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"!mkdir -p \"/kaggle/working/each5s\"\nsplitTrainAudio(sample_df)","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:14:45.301544Z","iopub.execute_input":"2022-06-03T05:14:45.302Z","iopub.status.idle":"2022-06-03T05:24:42.68205Z","shell.execute_reply.started":"2022-06-03T05:14:45.301957Z","shell.execute_reply":"2022-06-03T05:24:42.680618Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"data_df = pd.read_csv(\"/kaggle/working/data_df.csv\")\ndata_df","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:24:42.684Z","iopub.execute_input":"2022-06-03T05:24:42.684487Z","iopub.status.idle":"2022-06-03T05:24:42.70641Z","shell.execute_reply.started":"2022-06-03T05:24:42.684436Z","shell.execute_reply":"2022-06-03T05:24:42.70536Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"## Training","metadata":{}},{"cell_type":"code","source":"num_rows = 216\nnum_columns = 216\nnum_channels = 1\nn_mels = 512\n\ndef extractFeatures(y, sr):\n    feat = librosa.feature.mfcc(y=y, sr=sr, n_mfcc=num_rows, n_mels=n_mels)\n    if feat.shape[1] <= num_columns:\n        pad_width = num_columns - feat.shape[1]\n        feat = np.pad(feat, pad_width=((0,0),(0,pad_width)), mode='constant')\n    return feat","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:24:42.710425Z","iopub.execute_input":"2022-06-03T05:24:42.71078Z","iopub.status.idle":"2022-06-03T05:24:42.717658Z","shell.execute_reply.started":"2022-06-03T05:24:42.710753Z","shell.execute_reply":"2022-06-03T05:24:42.716558Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"class DataGenerator(Sequence):\n    def __init__(self,\n                _X,\n                batch_size=32,\n                n_channels=1,\n                n_columns=470,\n                n_rows=120,\n                shuffle=True):\n        self.batch_size = batch_size\n        self.X = _X\n        self.n_channels = n_channels\n        self.n_columns = n_columns\n        self.n_rows = n_rows\n        self.shuffle = shuffle\n        self.img_indexes = np.arange(len(self.X))\n        self.on_epoch_end()\n        \n    def __len__(self):\n        'Denotes the number of batches per epoch'\n        return int(np.floor(len(self.img_indexes) / self.batch_size))\n\n    def __getitem__(self, index):\n        'Generate one batch of data'\n        # Generate indexes of the batch\n        indexes = self.indexes[index*self.batch_size:(index+1)*self.batch_size]\n        # Find list of IDs\n        list_IDs_temps = [self.img_indexes[k] for k in indexes]\n\n        # Generate data\n        X, y = self.__data_generation(list_IDs_temps)\n        return X, y\n\n    def on_epoch_end(self):\n        'Updates indexes after each epoch'\n        self.indexes = np.arange(len(self.X))\n        if self.shuffle == True:\n            np.random.shuffle(self.indexes)\n\n    def __data_generation(self, list_IDs_temps):\n        X = np.empty((self.batch_size, self.n_rows, self.n_columns))\n        y = np.empty((self.batch_size), dtype=int)\n        for i, ID in enumerate(list_IDs_temps):\n            file_path = self.X.iloc[ID][\"filename\"]\n            audio, sr = librosa.load(file_path)\n            feat = extractFeatures(audio, sr)\n            x_features = feat.tolist()\n            label = self.X.iloc[ID][\"target\"]\n            X[i] = np.array(x_features)\n            y[i] = label\n        X = X.reshape(X.shape[0], self.n_rows, self.n_columns, self.n_channels)\n        \n        return X, to_categorical(y, num_classes=len(labels))","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:24:42.719569Z","iopub.execute_input":"2022-06-03T05:24:42.720401Z","iopub.status.idle":"2022-06-03T05:24:42.739362Z","shell.execute_reply.started":"2022-06-03T05:24:42.720358Z","shell.execute_reply":"2022-06-03T05:24:42.738261Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"params = dict(\n    batch_size=128,\n    n_rows=num_rows,\n    n_columns=num_columns,\n    n_channels=num_channels,\n)\nparams_train = dict(\n    shuffle=True,\n    **params\n)\nparams_valid = dict(\n    shuffle=False,\n    **params\n)","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:24:42.741036Z","iopub.execute_input":"2022-06-03T05:24:42.741615Z","iopub.status.idle":"2022-06-03T05:24:42.753845Z","shell.execute_reply.started":"2022-06-03T05:24:42.741572Z","shell.execute_reply":"2022-06-03T05:24:42.752708Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import matplotlib.pyplot as plt\n\ndef plot_his(history):\n    plt.figure(1, figsize = (15,8))\n    plt.subplot(221)\n    plt.plot(history.history['accuracy'])\n    plt.plot(history.history['val_accuracy'])\n    plt.title('model accuracy')\n    plt.ylabel('accuracy')\n    plt.xlabel('epoch')\n    plt.legend(['train', 'valid'])\n    plt.subplot(222)\n    plt.plot(history.history['loss'])\n    plt.plot(history.history['val_loss'])\n    plt.title('model loss')\n    plt.ylabel('loss')\n    plt.xlabel('epoch')\n    plt.legend(['train', 'valid'])\n    plt.show()","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:24:42.75544Z","iopub.execute_input":"2022-06-03T05:24:42.756223Z","iopub.status.idle":"2022-06-03T05:24:42.769109Z","shell.execute_reply.started":"2022-06-03T05:24:42.756167Z","shell.execute_reply":"2022-06-03T05:24:42.768057Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def create_cnn():\n    model = Sequential()\n    model.add(Conv2D(32, (3, 3), activation='relu', input_shape=(num_rows, num_columns, num_channels)))\n    model.add(MaxPooling2D((2, 2)))\n    model.add(Dropout(0.2))\n    model.add(Conv2D(64, (3, 3), activation='relu'))\n    model.add(MaxPooling2D((2, 2)))\n    model.add(Dropout(0.2))\n    model.add(Conv2D(64, (3, 3), activation='relu'))\n    model.add(Flatten())\n    model.add(Dropout(0.2))\n    model.add(Dense(len(labels), activation='softmax'))\n    return model","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:24:42.770951Z","iopub.execute_input":"2022-06-03T05:24:42.771415Z","iopub.status.idle":"2022-06-03T05:24:42.783441Z","shell.execute_reply.started":"2022-06-03T05:24:42.771371Z","shell.execute_reply":"2022-06-03T05:24:42.782436Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"data_df['target'] = data_df['primary_label'].apply(lambda x: labels.index(x))\ndata_df","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:24:42.785137Z","iopub.execute_input":"2022-06-03T05:24:42.785802Z","iopub.status.idle":"2022-06-03T05:24:42.808238Z","shell.execute_reply.started":"2022-06-03T05:24:42.785758Z","shell.execute_reply":"2022-06-03T05:24:42.806831Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def train_model(model, train_gen, val_gen):\n    checkpoint_model_path = \"/kaggle/working/CNNModel.h5\"\n    metric = \"val_accuracy\"\n    model.compile(optimizer=tf.keras.optimizers.Adam(learning_rate=0.001), loss='categorical_crossentropy', metrics=[\"accuracy\"])\n    num_epochs = 50\n    checkpointer = ModelCheckpoint(\n        filepath=checkpoint_model_path,\n        monitor=metric, verbose=1, save_best_only=True)\n    es_callback = EarlyStopping(monitor=metric, patience=5, verbose=1)\n    reduce_lr = ReduceLROnPlateau(monitor=metric, factor=0.3, patience=1, verbose=1, min_delta=0.0001, cooldown=1, min_lr=0.00001)\n\n    history = model.fit(\n        train_gen,\n        epochs=num_epochs,\n        validation_data=val_gen,\n        callbacks=[checkpointer,es_callback,reduce_lr],\n        verbose=1\n    )\n\n    plot_his(history)","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:24:42.810544Z","iopub.execute_input":"2022-06-03T05:24:42.811225Z","iopub.status.idle":"2022-06-03T05:24:42.823289Z","shell.execute_reply.started":"2022-06-03T05:24:42.811181Z","shell.execute_reply":"2022-06-03T05:24:42.822044Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"X_train, X_valid, _, _ = train_test_split(data_df, data_df[\"target\"], test_size=0.1, random_state=42)\ntrain_generator = DataGenerator(X_train, **params_train)\nvalid_generator = DataGenerator(X_valid, **params_valid)\ncnn_model = create_cnn()\ntrain_model(cnn_model, train_generator, valid_generator)","metadata":{"execution":{"iopub.status.busy":"2022-06-03T05:24:42.824598Z","iopub.execute_input":"2022-06-03T05:24:42.825066Z","iopub.status.idle":"2022-06-03T05:53:53.054448Z","shell.execute_reply.started":"2022-06-03T05:24:42.825039Z","shell.execute_reply":"2022-06-03T05:53:53.053459Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"## Submission","metadata":{}},{"cell_type":"code","source":"data_df = pd.read_csv(\"/kaggle/working/data_df.csv\")\nlabels = list(data_df['primary_label'].unique())","metadata":{"execution":{"iopub.status.busy":"2022-06-03T06:00:46.930148Z","iopub.execute_input":"2022-06-03T06:00:46.930578Z","iopub.status.idle":"2022-06-03T06:00:46.943255Z","shell.execute_reply.started":"2022-06-03T06:00:46.930549Z","shell.execute_reply":"2022-06-03T06:00:46.942096Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"test_path = \"/kaggle/input/birdclef-2022/test_soundscapes/\"\nfiles = [f.split('.')[0] for f in sorted(os.listdir(test_path))]\n\nbirds_path = \"/kaggle/input/birdclef-2022/scored_birds.json\"\nwith open(birds_path) as bf:\n    birds = json.load(bf)\n\ndata = []\nfor f in files:\n    file_path = test_path + f + '.ogg'\n    audio, sr = librosa.load(file_path)\n    # Get number of samples for 5 seconds; replace 5 by any number\n    buffer = 5 * sr\n    samples_total = len(audio)\n    samples_wrote = 0\n    counter = 1\n\n    while samples_wrote < samples_total:\n        #check if the buffer is not exceeding total samples \n        if buffer > (samples_total - samples_wrote):\n            buffer = samples_total - samples_wrote\n\n        block = audio[samples_wrote : (samples_wrote + buffer)]\n        feat = extractFeatures(block, sr)\n        x = feat.reshape(1, num_rows, num_columns, num_channels)\n        pred = cnn_model.predict(x)\n        label_index = np.argmax(pred,axis=1)[0]\n        \n        for b in birds:\n            segment_end = counter * 5   \n            row_id = f + '_' + b + '_' + str(segment_end)\n            target = False\n            if labels[label_index] == b:\n                target = True\n            data.append([row_id, target])\n        counter += 1\n        samples_wrote += buffer\n        \nsubmission_df = pd.DataFrame(data, columns=['row_id', 'target'])\nsubmission_df","metadata":{"execution":{"iopub.status.busy":"2022-06-03T06:00:49.052481Z","iopub.execute_input":"2022-06-03T06:00:49.052907Z","iopub.status.idle":"2022-06-03T06:00:52.662837Z","shell.execute_reply.started":"2022-06-03T06:00:49.05286Z","shell.execute_reply":"2022-06-03T06:00:52.661575Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"submission_df.to_csv(\"/kaggle/working/submission.csv\", index=False)","metadata":{"execution":{"iopub.status.busy":"2022-06-03T06:00:57.580745Z","iopub.execute_input":"2022-06-03T06:00:57.581098Z","iopub.status.idle":"2022-06-03T06:00:57.590053Z","shell.execute_reply.started":"2022-06-03T06:00:57.58107Z","shell.execute_reply":"2022-06-03T06:00:57.588955Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import shutil\nshutil.rmtree(\"/kaggle/working/each5s\")","metadata":{"execution":{"iopub.status.busy":"2022-06-03T06:01:01.733121Z","iopub.execute_input":"2022-06-03T06:01:01.733512Z","iopub.status.idle":"2022-06-03T06:01:02.129812Z","shell.execute_reply.started":"2022-06-03T06:01:01.73348Z","shell.execute_reply":"2022-06-03T06:01:02.126942Z"},"trusted":true},"execution_count":null,"outputs":[]}]}