{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import numpy as np\nimport pandas as pd\nimport wave\nfrom scipy.io import wavfile\nimport os\nimport librosa\nfrom librosa.feature import melspectrogram\nimport warnings\nfrom sklearn import metrics\nfrom sklearn.metrics import confusion_matrix\nfrom sklearn.utils import shuffle\nfrom sklearn.utils import class_weight\nfrom PIL import Image\nfrom uuid import uuid4\nimport sklearn\nfrom sklearn.model_selection import train_test_split\nfrom tqdm import tqdm\n\nimport tensorflow as tf\nfrom tensorflow.keras.models import Sequential\nfrom tensorflow.keras import layers\nfrom tensorflow.keras import Input\nfrom tensorflow.keras.models import Model\nfrom tensorflow.keras.layers import Dense, Flatten, Dropout, Activation\nfrom tensorflow.keras.layers import BatchNormalization, GlobalAveragePooling2D\nfrom tensorflow.keras.callbacks import ModelCheckpoint, ReduceLROnPlateau, EarlyStopping\nfrom tensorflow.keras.utils import to_categorical\nfrom tensorflow.keras.layers import Dense, Flatten, Dropout, Activation, LSTM, SimpleRNN, Conv1D, Input, BatchNormalization, GlobalAveragePooling2D\nfrom tensorflow.keras.preprocessing.image import ImageDataGenerator\nfrom tensorflow.keras.applications import EfficientNetB0\n\n\nimport matplotlib.pyplot as plt\nimport seaborn as sns\nsns.set()","metadata":{"execution":{"iopub.status.busy":"2021-09-19T09:50:03.06836Z","iopub.execute_input":"2021-09-19T09:50:03.068842Z","iopub.status.idle":"2021-09-19T09:50:10.644524Z","shell.execute_reply.started":"2021-09-19T09:50:03.06876Z","shell.execute_reply":"2021-09-19T09:50:10.643405Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_df = pd.read_csv('/kaggle/input/birdsong-recognition/train.csv')","metadata":{"execution":{"iopub.status.busy":"2021-09-19T09:50:17.601108Z","iopub.execute_input":"2021-09-19T09:50:17.60148Z","iopub.status.idle":"2021-09-19T09:50:18.114463Z","shell.execute_reply.started":"2021-09-19T09:50:17.601445Z","shell.execute_reply":"2021-09-19T09:50:18.113432Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"print(train_df)","metadata":{"execution":{"iopub.status.busy":"2021-09-19T09:50:21.092079Z","iopub.execute_input":"2021-09-19T09:50:21.092407Z","iopub.status.idle":"2021-09-19T09:50:21.134768Z","shell.execute_reply.started":"2021-09-19T09:50:21.092379Z","shell.execute_reply":"2021-09-19T09:50:21.13381Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_df = train_df.query(\"rating>=3\")\n\nbirds_count = {}\nfor bird_species, count in zip(train_df.ebird_code.unique(), train_df.groupby(\"ebird_code\")[\"ebird_code\"].count().values):\n    birds_count[bird_species] = count\nmost_represented_birds = [key for key,value in birds_count.items() if value == 100]\n\ntrain_df = train_df.query(\"ebird_code in @most_represented_birds\")","metadata":{"execution":{"iopub.status.busy":"2021-09-19T09:50:31.93263Z","iopub.execute_input":"2021-09-19T09:50:31.933014Z","iopub.status.idle":"2021-09-19T09:50:31.995218Z","shell.execute_reply.started":"2021-09-19T09:50:31.932984Z","shell.execute_reply":"2021-09-19T09:50:31.994133Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"print(len(train_df.ebird_code.unique()))","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:13:32.832193Z","iopub.execute_input":"2021-09-19T11:13:32.83256Z","iopub.status.idle":"2021-09-19T11:13:32.843827Z","shell.execute_reply.started":"2021-09-19T11:13:32.832532Z","shell.execute_reply":"2021-09-19T11:13:32.842077Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"birds_to_recognise = sorted(most_represented_birds)\nprint(birds_to_recognise)","metadata":{"execution":{"iopub.status.busy":"2021-09-19T09:50:44.820121Z","iopub.execute_input":"2021-09-19T09:50:44.820468Z","iopub.status.idle":"2021-09-19T09:50:44.826898Z","shell.execute_reply.started":"2021-09-19T09:50:44.820424Z","shell.execute_reply":"2021-09-19T09:50:44.825689Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_df = shuffle(train_df)\ntrain_df.head()","metadata":{"execution":{"iopub.status.busy":"2021-09-19T09:50:48.516773Z","iopub.execute_input":"2021-09-19T09:50:48.517175Z","iopub.status.idle":"2021-09-19T09:50:48.564059Z","shell.execute_reply.started":"2021-09-19T09:50:48.517146Z","shell.execute_reply":"2021-09-19T09:50:48.562493Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"len(train_df)","metadata":{"execution":{"iopub.status.busy":"2021-09-19T09:50:56.420337Z","iopub.execute_input":"2021-09-19T09:50:56.420722Z","iopub.status.idle":"2021-09-19T09:50:56.428214Z","shell.execute_reply.started":"2021-09-19T09:50:56.420675Z","shell.execute_reply":"2021-09-19T09:50:56.42658Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def get_sample(filename, bird, output_folder):\n    wave_data, wave_rate = librosa.load(filename)\n    wave_data, _ = librosa.effects.trim(wave_data)\n    #only take 5s samples and add them to the dataframe\n    song_sample = []\n    sample_length = 5*wave_rate\n    samples_from_file = []\n    #The variable below is chosen mainly to create a 216x216 image\n    N_mels=216\n    for idx in range(0,len(wave_data),sample_length): \n        song_sample = wave_data[idx:idx+sample_length]\n        if len(song_sample)>=sample_length:\n            mel = melspectrogram(song_sample, n_mels=N_mels)\n            db = librosa.power_to_db(mel)\n            normalised_db = sklearn.preprocessing.minmax_scale(db)\n            filename = str(uuid4())+\".tif\"\n            db_array = (np.asarray(normalised_db)*255).astype(np.uint8)\n            db_image =  Image.fromarray(np.array([db_array, db_array, db_array]).T)\n            db_image.save(\"{}{}\".format(output_folder,filename))\n            \n            samples_from_file.append({\"song_sample\":\"{}{}\".format(output_folder,filename),\n                                            \"bird\":bird})\n    return samples_from_file","metadata":{"execution":{"iopub.status.busy":"2021-09-19T09:51:02.577224Z","iopub.execute_input":"2021-09-19T09:51:02.577617Z","iopub.status.idle":"2021-09-19T09:51:02.586656Z","shell.execute_reply.started":"2021-09-19T09:51:02.577587Z","shell.execute_reply":"2021-09-19T09:51:02.585485Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"%%time\nwarnings.filterwarnings(\"ignore\")\nsamples_df = pd.DataFrame(columns=[\"song_sample\",\"bird\"])\n\n#We limit the number of audio files being sampled to 1000 in this notebook to save time\n#on top of having limited the number of bird species previously\nsample_limit = 1000\nsample_list = []\n\noutput_folder = \"/kaggle/working/melspectrogram_dataset/\"\nos.mkdir(output_folder)\nwith tqdm(total=sample_limit) as pbar:\n    for idx, row in train_df[:sample_limit].iterrows():\n        pbar.update(1)\n        try:\n            audio_file_path = '/kaggle/input/birdsong-recognition/train_audio/'\n            audio_file_path += row.ebird_code\n            if row.ebird_code in birds_to_recognise:\n                sample_list+=get_sample('{}/{}'.format(audio_file_path, row.filename), row.ebird_code, output_folder)\n            else:\n                sample_list+=get_sample('{}/{}'.format(audio_file_path, row.filename), \"nocall\", output_folder)\n            \n        except:\n            raise\n            print(\"{} is corrupted\".format(audio_file_path))\n        \n            \nsamples_df = pd.DataFrame(sample_list)","metadata":{"execution":{"iopub.status.busy":"2021-09-19T09:51:09.221474Z","iopub.execute_input":"2021-09-19T09:51:09.223631Z","iopub.status.idle":"2021-09-19T11:08:37.619428Z","shell.execute_reply.started":"2021-09-19T09:51:09.223585Z","shell.execute_reply":"2021-09-19T11:08:37.617951Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"demo_img = Image.open(samples_df.iloc[20].song_sample)\nplt.imshow(demo_img)\nplt.show()","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:13:42.613315Z","iopub.execute_input":"2021-09-19T11:13:42.613754Z","iopub.status.idle":"2021-09-19T11:13:42.918655Z","shell.execute_reply.started":"2021-09-19T11:13:42.613719Z","shell.execute_reply":"2021-09-19T11:13:42.916477Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"samples_df = shuffle(samples_df)\nsamples_df[:10]","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:13:46.719423Z","iopub.execute_input":"2021-09-19T11:13:46.719817Z","iopub.status.idle":"2021-09-19T11:13:46.737913Z","shell.execute_reply.started":"2021-09-19T11:13:46.719786Z","shell.execute_reply":"2021-09-19T11:13:46.736821Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"#model creation\ntraining_percentage = 0.9\n\ntraining_df,validation_df = train_test_split(samples_df, test_size=0.2, random_state=25)","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:13:50.559181Z","iopub.execute_input":"2021-09-19T11:13:50.55954Z","iopub.status.idle":"2021-09-19T11:13:50.568631Z","shell.execute_reply.started":"2021-09-19T11:13:50.559508Z","shell.execute_reply":"2021-09-19T11:13:50.567508Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"classes_to_predict = sorted(samples_df.bird.unique())\ninput_shape = (216,216, 3)\neffnet_layers = EfficientNetB0(weights=None, include_top=False, input_shape=input_shape)\n\nfor layer in effnet_layers.layers:\n    layer.trainable = True\n\ndropout_dense_layer = 0.3\n\nmodel = Sequential()\nmodel.add(effnet_layers)\n    \nmodel.add(GlobalAveragePooling2D())\nmodel.add(Dense(256, use_bias=False))\nmodel.add(BatchNormalization())\nmodel.add(Activation('relu'))\nmodel.add(Dropout(dropout_dense_layer))\n\nmodel.add(Dense(len(classes_to_predict), activation=\"softmax\"))\n    \nmodel.summary()","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:13:54.663601Z","iopub.execute_input":"2021-09-19T11:13:54.664021Z","iopub.status.idle":"2021-09-19T11:14:00.111516Z","shell.execute_reply.started":"2021-09-19T11:13:54.663985Z","shell.execute_reply":"2021-09-19T11:14:00.110464Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"callbacks = [ReduceLROnPlateau(monitor='val_loss', patience=2, verbose=1, factor=0.7),\n             EarlyStopping(monitor='val_loss', patience=5),\n             ModelCheckpoint(filepath='best_model.h5', monitor='val_loss', save_best_only=True)]\nmodel.compile(loss=\"categorical_crossentropy\", optimizer='adam',metrics=['accuracy'])","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:14:04.891543Z","iopub.execute_input":"2021-09-19T11:14:04.891929Z","iopub.status.idle":"2021-09-19T11:14:04.916384Z","shell.execute_reply.started":"2021-09-19T11:14:04.891898Z","shell.execute_reply":"2021-09-19T11:14:04.915253Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"class_weights = class_weight.compute_class_weight(\"balanced\", classes_to_predict, samples_df.bird.values)\nclass_weights_dict = {i : class_weights[i] for i,label in enumerate(classes_to_predict)}","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:14:08.235728Z","iopub.execute_input":"2021-09-19T11:14:08.236136Z","iopub.status.idle":"2021-09-19T11:14:08.247335Z","shell.execute_reply.started":"2021-09-19T11:14:08.236103Z","shell.execute_reply":"2021-09-19T11:14:08.245954Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"training_batch_size = 32\nvalidation_batch_size = 32\ntarget_size = (216,216)\n\ntrain_datagen = ImageDataGenerator(rescale=1. / 255)\n\ntrain_generator = train_datagen.flow_from_dataframe(\n    dataframe = training_df,\n    x_col='song_sample',\n    y_col='bird',\n    directory='',\n    target_size=target_size,\n    batch_size=training_batch_size,\n    shuffle=True,\n    class_mode='categorical')\n\n\nvalidation_datagen = ImageDataGenerator(rescale=1. / 255)\nvalidation_generator = validation_datagen.flow_from_dataframe(\n    dataframe = validation_df,\n    x_col='song_sample',\n    y_col='bird',\n    directory='',\n    target_size=target_size,\n    shuffle=False,\n    batch_size=validation_batch_size,\n    class_mode='categorical')","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:14:11.46767Z","iopub.execute_input":"2021-09-19T11:14:11.468105Z","iopub.status.idle":"2021-09-19T11:14:11.620645Z","shell.execute_reply.started":"2021-09-19T11:14:11.46807Z","shell.execute_reply":"2021-09-19T11:14:11.619543Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"history = model.fit(train_generator,\n          epochs = 20, \n          validation_data=validation_generator,\n#           class_weight=class_weights_dict,\n          callbacks=callbacks)","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:14:39.66737Z","iopub.execute_input":"2021-09-19T11:14:39.667759Z","iopub.status.idle":"2021-09-19T11:38:09.865516Z","shell.execute_reply.started":"2021-09-19T11:14:39.667726Z","shell.execute_reply":"2021-09-19T11:38:09.8643Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"plt.plot(history.history['loss'])\nplt.plot(history.history['val_loss'])\nplt.title('Loss over epochs')\nplt.ylabel('Loss')\nplt.xlabel('Epoch')\nplt.legend(['Train', 'Validation'], loc='best')\nplt.show()","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:38:18.205657Z","iopub.execute_input":"2021-09-19T11:38:18.206119Z","iopub.status.idle":"2021-09-19T11:38:18.488802Z","shell.execute_reply.started":"2021-09-19T11:38:18.206084Z","shell.execute_reply":"2021-09-19T11:38:18.487381Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"plt.plot(history.history['accuracy'])\nplt.plot(history.history['val_accuracy'])\nplt.title('Accuracy over epochs')\nplt.ylabel('Accuracy')\nplt.xlabel('Epoch')\nplt.legend(['Train', 'Validation'], loc='best')\nplt.show()","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:38:31.101398Z","iopub.execute_input":"2021-09-19T11:38:31.101804Z","iopub.status.idle":"2021-09-19T11:38:31.376161Z","shell.execute_reply.started":"2021-09-19T11:38:31.101772Z","shell.execute_reply":"2021-09-19T11:38:31.374833Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"#place to add confusion matrix\npreds = model.predict_generator(validation_generator)\npredictions = model.predict(validation_generator)\npredicted_classes = np.argmax(predictions, axis=1)\n\ntrue_classes = validation_generator.classes\nclass_labels = list(validation_generator.class_indices.keys())  \ncm = confusion_matrix(y_true=true_classes, y_pred=predicted_classes) \n\nfig, ax = plt.subplots(figsize=(40,40))    \nsns.heatmap(cm, annot=True, xticklabels=class_labels, yticklabels=class_labels,linewidths=.5, ax=ax,cmap='Blues')\nplt.title(\"Confusion Matrix for 137 Species\")\nplt.savefig('heatmap-137.jpg')","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:38:46.741761Z","iopub.execute_input":"2021-09-19T11:38:46.742211Z","iopub.status.idle":"2021-09-19T11:40:13.933336Z","shell.execute_reply.started":"2021-09-19T11:38:46.742162Z","shell.execute_reply":"2021-09-19T11:40:13.932013Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"model.load_weights(\"best_model.h5\")","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:40:50.00825Z","iopub.execute_input":"2021-09-19T11:40:50.008614Z","iopub.status.idle":"2021-09-19T11:40:50.365871Z","shell.execute_reply.started":"2021-09-19T11:40:50.008552Z","shell.execute_reply":"2021-09-19T11:40:50.364181Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def predict_on_melspectrogram(song_sample, sample_length):\n    N_mels=216\n\n    if len(song_sample)>=sample_length:\n        mel = melspectrogram(song_sample, n_mels=N_mels)\n        db = librosa.power_to_db(mel)\n        normalised_db = sklearn.preprocessing.minmax_scale(db)\n        db_array = (np.asarray(normalised_db)*255).astype(np.uint8)\n\n        prediction = model.predict(np.array([np.array([db_array, db_array, db_array]).T]))\n        predicted_bird = classes_to_predict[np.argmax(prediction)]\n        return predicted_bird\n    else:\n        return \"nocall\"","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:41:00.393345Z","iopub.execute_input":"2021-09-19T11:41:00.39374Z","iopub.status.idle":"2021-09-19T11:41:00.402064Z","shell.execute_reply.started":"2021-09-19T11:41:00.393708Z","shell.execute_reply":"2021-09-19T11:41:00.400726Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def predict_submission(df, audio_file_path):\n        \n    loaded_audio_sample = []\n    previous_filename = \"\"\n    wave_data = []\n    wave_rate = None\n    sample_length = None\n    \n    for idx,row in df.iterrows():\n        #I added this exception as I've heard that some files may be corrupted.\n        try:\n            if previous_filename == \"\" or previous_filename!=row.audio_id:\n                filename = '{}/{}.mp3'.format(audio_file_path, row.audio_id)\n                wave_data, wave_rate = librosa.load(filename)\n                sample_length = 5*wave_rate\n            previous_filename = row.audio_id\n\n            #basically allows to check if we are running the examples or the test set.\n            if \"site\" in df.columns:\n                if row.site==\"site_1\" or row.site==\"site_2\":\n                    song_sample = np.array(wave_data[int(row.seconds-5)*wave_rate:int(row.seconds)*wave_rate])\n                elif row.site==\"site_3\":\n                    #for now, I only take the first 5s of the samples from site_3 as they are groundtruthed at file level\n                    song_sample = np.array(wave_data[0:sample_length])\n            else:\n                #same as the first condition but I isolated it for later and it is for the example file\n                song_sample = np.array(wave_data[int(row.seconds-5)*wave_rate:int(row.seconds)*wave_rate])\n            \n            predicted_bird = predict_on_melspectrogram(song_sample, sample_length)\n            df.at[idx,\"birds\"] = predicted_bird\n        except:\n            df.at[idx,\"birds\"] = \"nocall\"\n    return df","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:41:09.049089Z","iopub.execute_input":"2021-09-19T11:41:09.049457Z","iopub.status.idle":"2021-09-19T11:41:09.061609Z","shell.execute_reply.started":"2021-09-19T11:41:09.04941Z","shell.execute_reply":"2021-09-19T11:41:09.060206Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"audio_file_path = \"example_test_audio\"\nexample_df = pd.read_csv(\"example_test_audio_summary.csv\")\n#Ajusting the example filenames and creating the audio_id column to match with the test file.\nexample_df[\"audio_id\"] = [ \"BLKFR-10-CPL_20190611_093000.pt540\" if filename==\"BLKFR-10-CPL\" else \"ORANGE-7-CAP_20190606_093000.pt623\" for filename in example_df[\"filename\"]]\n\nif os.path.exists(audio_file_path):\n    example_df = predict_submission(example_df, audio_file_path)\nexample_df","metadata":{"execution":{"iopub.status.busy":"2021-09-19T11:41:14.981305Z","iopub.execute_input":"2021-09-19T11:41:14.981688Z","iopub.status.idle":"2021-09-19T11:41:15.060344Z","shell.execute_reply.started":"2021-09-19T11:41:14.981656Z","shell.execute_reply":"2021-09-19T11:41:15.057248Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"","metadata":{"execution":{"iopub.status.busy":"2021-08-17T05:51:41.100673Z","iopub.status.idle":"2021-08-17T05:51:41.101264Z"},"trusted":true},"execution_count":null,"outputs":[]}]}