{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","_kg_hide-input":true,"_kg_hide-output":true,"execution":{"iopub.status.busy":"2022-06-03T09:44:32.964671Z","iopub.execute_input":"2022-06-03T09:44:32.966002Z","iopub.status.idle":"2022-06-03T09:44:33.559434Z","shell.execute_reply.started":"2022-06-03T09:44:32.965955Z","shell.execute_reply":"2022-06-03T09:44:33.558042Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# **COMPX525 Assignment 1 - Benedict Johnson 1349629**","metadata":{}},{"cell_type":"markdown","source":"> **Referenced Code Files**\n> * https://www.kaggle.com/code/duythanhng/birdclef-2022-keras-simple-tutorial\n> * https://scikit-learn.org/stable/modules/generated/sklearn.preprocessing.OneHotEncoder.html\n> *https://numpy.org/doc/stable/reference/generated/numpy.reshape.html\n> *https://www.kaggle.com/code/foolishboi/birdclef22-playing-with-data","metadata":{}},{"cell_type":"markdown","source":"# **1. Import all necessary modules**","metadata":{}},{"cell_type":"code","source":"import warnings\nwarnings.filterwarnings('ignore')\nimport os\nimport json \nimport ast\nimport sklearn\nimport random\nimport soundfile as sf\nimport librosa\nimport librosa.display\nimport IPython.display as ipd\nimport plotly.express as px\nimport soundfile as sf\nimport descartes\nimport geopandas as gpd\nimport numpy as np\nimport pandas as pd\nimport seaborn as sns\nimport matplotlib.pyplot as plt\nimport tensorflow as tf\nimport matplotlib.pyplot as plt\nimport matplotlib.image as mpimg\nimport tensorflow.keras.backend as K\nimport tensorflow as tf\nimport math\nimport sys\nimport gc\n\nfrom tensorflow.keras.applications import EfficientNetB5\nfrom shapely.geometry import Point, Polygon\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.preprocessing import OneHotEncoder \nfrom matplotlib.offsetbox import AnnotationBbox, OffsetImage\nfrom tensorflow.keras.models import Model\nfrom tensorflow.keras.layers import Dense, GlobalAveragePooling2D\nfrom tensorflow.keras.callbacks import ModelCheckpoint, EarlyStopping, ReduceLROnPlateau\nfrom tensorflow.keras.optimizers import Adam\nfrom tensorflow.keras import optimizers\nfrom tensorflow.keras.utils import plot_model, Sequence\nfrom tensorflow.keras.utils import to_categorical\nfrom tensorflow.keras.preprocessing import image\nfrom tensorflow.keras.models import Model\nfrom tensorflow.keras.layers import Input, Concatenate\nfrom sklearn.preprocessing import LabelEncoder\nfrom tqdm import tqdm\nfrom math import ceil\nfrom numpy import array","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:33.561545Z","iopub.execute_input":"2022-06-03T09:44:33.561977Z","iopub.status.idle":"2022-06-03T09:44:33.582667Z","shell.execute_reply.started":"2022-06-03T09:44:33.561945Z","shell.execute_reply":"2022-06-03T09:44:33.581478Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# **2. EfficientNet-B5 Model Parameters**","metadata":{}},{"cell_type":"code","source":"chosen_buffer = 5 #5s\nrow = random.randint(0,100)\ndata_frames = []\nnum_rows = 216\nnum_columns = 216\nnum_channels = 1\nn_mels = 512\n\nchosen_test = 0.2 #20% test, %80 training\nepochs = 50 #2 hours training time\nchosen_optimizer = tf.keras.optimizers.Adam(learning_rate=0.001)\nchosen_activation = 'sigmoid'\nchosen_loss = 'categorical_crossentropy'\nchosen_metrics = [\"accuracy\"]\nbatch_number = 32 #Low to ensure enough memory from system","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:33.584818Z","iopub.execute_input":"2022-06-03T09:44:33.58581Z","iopub.status.idle":"2022-06-03T09:44:33.605494Z","shell.execute_reply.started":"2022-06-03T09:44:33.585759Z","shell.execute_reply":"2022-06-03T09:44:33.604145Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"#  **3. Define Audio Functions**","metadata":{}},{"cell_type":"code","source":"path = '/kaggle/input/birdclef-2022/'\nos.listdir(path)\nwith open(path+'scored_birds.json') as f:\n    scored_birds = json.load(f)\ndef read_ogg_file(path, file):\n    data, samplerate = sf.read(path+file)\n    return data, samplerate\ndef wave_function(data, samplerate):\n    sr = samplerate\n    fig = plt.figure(figsize=(8, 4))\n    x = range(len(data))\n    y = data\n    plt.plot(x, y)\n    plt.legend(loc='upper center')\n    plt.grid()","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:33.608537Z","iopub.execute_input":"2022-06-03T09:44:33.608948Z","iopub.status.idle":"2022-06-03T09:44:33.623003Z","shell.execute_reply.started":"2022-06-03T09:44:33.608914Z","shell.execute_reply":"2022-06-03T09:44:33.621726Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# **4. Loading Data**","metadata":{}},{"cell_type":"code","source":"path = '/kaggle/input/birdclef-2022/'\nos.listdir(path)\ntrain = pd.read_csv(path+'train_metadata.csv')\nlabels = list(train['primary_label'].unique())\ntest = pd.read_csv(path+'test.csv')\ntax_data = pd.read_csv(path+'eBird_Taxonomy_v2021.csv')\nsub_csv = pd.read_csv(path+'sample_submission.csv')\n#Submission Soundscape\nos.listdir(path+'test_soundscapes')","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:33.626406Z","iopub.execute_input":"2022-06-03T09:44:33.627409Z","iopub.status.idle":"2022-06-03T09:44:33.810484Z","shell.execute_reply.started":"2022-06-03T09:44:33.627352Z","shell.execute_reply":"2022-06-03T09:44:33.809692Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"#  **5. Understanding The Data**","metadata":{}},{"cell_type":"markdown","source":"> **Display number of bird classes**","metadata":{}},{"cell_type":"code","source":"print(\"Total number of bird species is {:,}! \".format(len(train['common_name'].unique())))\n#Display ratings values.\nplt.figure(figsize=(15, 6))\nax = sns.countplot(train['rating'], palette=\"Spectral\")\nplt.title(\"Class Audio Ratings (float 0.0-5.0)\", fontsize=15)\nplt.ylabel(\"Samples\", fontsize=14)\nplt.xlabel(\"Ratings Value\", fontsize = 14)\nplt.xticks(rotation=90, fontsize=12)\nplt.yticks(fontsize=12)\n","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:33.811823Z","iopub.execute_input":"2022-06-03T09:44:33.812314Z","iopub.status.idle":"2022-06-03T09:44:34.087216Z","shell.execute_reply.started":"2022-06-03T09:44:33.812278Z","shell.execute_reply":"2022-06-03T09:44:34.085866Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":">**Display number of bird sound types**","metadata":{}},{"cell_type":"code","source":"z = train['type'].apply(lambda x: x[2:-2].split(\"', '\")).reset_index().explode(\"type\")\nz = z['type'].apply(lambda x: x.strip().lower()).reset_index()\nz['type'] = z['type'].replace('calls', 'call')\nt = list(z['type'].value_counts().head(15).reset_index()['index'])\nindex_data = z[z['type'].isin(t)]\nplt.figure(figsize=(15, 6))\nax = sns.countplot(index_data['type'], palette=\"Spectral\", order = index_data['type'].value_counts().index)\nplt.title(\"Most-Frequent Bird Sound Types\", fontsize=15)\nplt.ylabel(\"Occurances\", fontsize=14)\nplt.xlabel(\"Bird Sound Type\", fontsize=14)\nplt.yticks(fontsize=12)\nplt.xticks(rotation=90, fontsize=12)\n\n","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:34.088723Z","iopub.execute_input":"2022-06-03T09:44:34.08989Z","iopub.status.idle":"2022-06-03T09:44:34.486908Z","shell.execute_reply.started":"2022-06-03T09:44:34.089851Z","shell.execute_reply":"2022-06-03T09:44:34.486082Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"> **Random Sample File**","metadata":{}},{"cell_type":"code","source":"train.iloc[row]\nfilename = train.loc[row, 'filename']\nsample_label = train.loc[row, 'primary_label']\nfilename.split('/')[1] in os.listdir(path+'train_audio/'+sample_label)\ndata, samplerate = sf.read(path+'train_audio/'+filename)","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:34.488103Z","iopub.execute_input":"2022-06-03T09:44:34.488607Z","iopub.status.idle":"2022-06-03T09:44:34.630777Z","shell.execute_reply.started":"2022-06-03T09:44:34.488569Z","shell.execute_reply":"2022-06-03T09:44:34.62964Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"row","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:34.63221Z","iopub.execute_input":"2022-06-03T09:44:34.632757Z","iopub.status.idle":"2022-06-03T09:44:34.640169Z","shell.execute_reply.started":"2022-06-03T09:44:34.632717Z","shell.execute_reply":"2022-06-03T09:44:34.639129Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"> **Visualizing Random Sample File**","metadata":{}},{"cell_type":"code","source":"wave_function(data, samplerate)","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:34.643364Z","iopub.execute_input":"2022-06-03T09:44:34.644623Z","iopub.status.idle":"2022-06-03T09:44:35.621924Z","shell.execute_reply.started":"2022-06-03T09:44:34.644528Z","shell.execute_reply":"2022-06-03T09:44:35.620638Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":" # **6. Attempted Implementation of One-Hot Encoding**","metadata":{}},{"cell_type":"code","source":"encoder = LabelEncoder()\ndef one_hot_encoding(labels):\n    encoded_int = encoder.fit_transform(array(labels))\n    encoded_int = encoded_int.reshape(len(encoded_int),1)\n    encoding_one_hot = OneHotEncoder(sparse=False) #Returns array sparse = False\n    return encoding_one_hot.fit_transform(encoded_int)\nohe_labels = one_hot_encoding(labels)\nohe_labels","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:35.623265Z","iopub.execute_input":"2022-06-03T09:44:35.623598Z","iopub.status.idle":"2022-06-03T09:44:35.638607Z","shell.execute_reply.started":"2022-06-03T09:44:35.623568Z","shell.execute_reply":"2022-06-03T09:44:35.637494Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# **7. Data Preperation**","metadata":{}},{"cell_type":"code","source":"def sample_audio(file_path, is_save):\n    filename = file_path.replace(\"/\", \"_\")\n    file_path = \"/kaggle/input/birdclef-2022/train_audio/\" + file_path\n    audio, sr = librosa.load(file_path)\n    buffer = chosen_buffer * sr\n    samples_total = len(audio)\n    samples_wrote = 0\n    counter = 1\n    audio_split = []\n    audio_filenames = []\n    while samples_wrote < samples_total:\n        #check if the buffer is not exceeding total samples \n        if buffer > (samples_total - samples_wrote):\n            buffer = samples_total - samples_wrote\n\n        block = audio[samples_wrote : (samples_wrote + buffer)]\n        audio_split.append(block)\n\n        # Write 5 second segment\n        if is_save == True:\n            out_filename = \"/kaggle/working/each5s/split_\" + str(counter) + \"_\" + filename\n            audio_filenames.append(out_filename)\n            sf.write(out_filename, block, sr)\n        counter += 1\n        samples_wrote += buffer\n    return audio_split, sr, audio_filenames\n\ndef audio_split(_df):\n    data = []\n    for index, row in _df.iterrows():\n        sample_audio(row[\"filename\"], True)\n        audio_lst, sr, filenames = sample_audio(row[\"filename\"], True)\n        for idx, y in enumerate(audio_lst):\n            data.append([row[\"primary_label\"], row[\"filename\"], filenames[idx]])\n\n    dataframe = pd.DataFrame(data, columns=['primary_label', 'original_filename', 'filename'])\n    dataframe.to_csv(\"/kaggle/working/dataframe.csv\", index=False)","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:35.640127Z","iopub.execute_input":"2022-06-03T09:44:35.641209Z","iopub.status.idle":"2022-06-03T09:44:35.654495Z","shell.execute_reply.started":"2022-06-03T09:44:35.641173Z","shell.execute_reply":"2022-06-03T09:44:35.653289Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"data_frames = []\nfor label in labels:\n    tmp_df = train[train[\"primary_label\"] == label].sample(n=1, replace=True).reset_index(drop=True)\n    data_frames.append(tmp_df)\nsample_df = pd.concat(data_frames).reset_index(drop=True)\nsample_df","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:35.655949Z","iopub.execute_input":"2022-06-03T09:44:35.656362Z","iopub.status.idle":"2022-06-03T09:44:36.242606Z","shell.execute_reply.started":"2022-06-03T09:44:35.656327Z","shell.execute_reply":"2022-06-03T09:44:36.241449Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"!mkdir -p \"/kaggle/working/each5s\"\naudio_split(sample_df)","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:44:36.244595Z","iopub.execute_input":"2022-06-03T09:44:36.245055Z","iopub.status.idle":"2022-06-03T09:51:39.101396Z","shell.execute_reply.started":"2022-06-03T09:44:36.245008Z","shell.execute_reply":"2022-06-03T09:51:39.099888Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"dataframe = pd.read_csv(\"/kaggle/working/dataframe.csv\")\ndataframe","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:51:39.103906Z","iopub.execute_input":"2022-06-03T09:51:39.104311Z","iopub.status.idle":"2022-06-03T09:51:39.124192Z","shell.execute_reply.started":"2022-06-03T09:51:39.104272Z","shell.execute_reply":"2022-06-03T09:51:39.123355Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# **8. Training/Inferencing EfficientNet-B5**","metadata":{}},{"cell_type":"markdown","source":"> **Setup Functions**","metadata":{}},{"cell_type":"code","source":"def features(y, sr):\n    feat = librosa.feature.mfcc(y=y, sr=sr, n_mfcc=num_rows, n_mels=n_mels)\n    if feat.shape[1] <= num_columns:\n        pad_width = num_columns - feat.shape[1]\n        feat = np.pad(feat, pad_width=((0,0),(0,pad_width)), mode='constant')\n    return feat","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:51:39.125212Z","iopub.execute_input":"2022-06-03T09:51:39.126342Z","iopub.status.idle":"2022-06-03T09:51:39.133075Z","shell.execute_reply.started":"2022-06-03T09:51:39.126303Z","shell.execute_reply":"2022-06-03T09:51:39.132182Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"class process_data(Sequence):\n    def __init__(self,\n                _X,\n                batch_size=32,\n                n_channels=1,\n                n_columns=470,\n                n_rows=120,\n                shuffle=True):\n        self.batch_size = batch_size\n        self.X = _X\n        self.n_channels = n_channels\n        self.n_columns = n_columns\n        self.n_rows = n_rows\n        self.shuffle = shuffle\n        self.img_indexes = np.arange(len(self.X))\n        self.on_epoch_end()\n        \n    def __len__(self):\n        'Denotes the number of batches per epoch'\n        return int(np.floor(len(self.img_indexes) / self.batch_size))\n\n    def __getitem__(self, index):\n        'Generate one batch of data'\n        # Generate indexes of the batch\n        indexes = self.indexes[index*self.batch_size:(index+1)*self.batch_size]\n        # Find list of IDs\n        list_IDs_temps = [self.img_indexes[k] for k in indexes]\n\n        # Generate data\n        X, y = self.__data_generation(list_IDs_temps)\n        return X, y\n\n    def on_epoch_end(self):\n        'Updates indexes after each epoch'\n        self.indexes = np.arange(len(self.X))\n        if self.shuffle == True:\n            np.random.shuffle(self.indexes)\n\n    def __data_generation(self, list_IDs_temps):\n        X = np.empty((self.batch_size, self.n_rows, self.n_columns))\n        y = np.empty((self.batch_size), dtype=int)\n        for i, ID in enumerate(list_IDs_temps):\n            file_path = self.X.iloc[ID][\"filename\"]\n            audio, sr = librosa.load(file_path)\n            feat = features(audio, sr)\n            x_features = feat.tolist()\n            label = self.X.iloc[ID][\"target\"]\n            X[i] = np.array(x_features)\n            y[i] = label\n        X = X.reshape(X.shape[0], self.n_rows, self.n_columns, self.n_channels)\n        \n        return X, to_categorical(y, num_classes=len(labels))","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:51:39.13456Z","iopub.execute_input":"2022-06-03T09:51:39.135711Z","iopub.status.idle":"2022-06-03T09:51:39.15705Z","shell.execute_reply.started":"2022-06-03T09:51:39.13564Z","shell.execute_reply":"2022-06-03T09:51:39.155647Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"> **Setup EfficientNet-B5 Model & Training**","metadata":{}},{"cell_type":"code","source":"parameters = dict(batch_size=batch_number,n_rows=num_rows,n_columns=num_columns,n_channels=num_channels)\nparameters_train = dict(shuffle=True,**parameters)\nparameters_valid = dict(shuffle=False,**parameters)\ndataframe['target'] = dataframe['primary_label'].apply(lambda x: labels.index(x))\ndataframe","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:51:39.159162Z","iopub.execute_input":"2022-06-03T09:51:39.15977Z","iopub.status.idle":"2022-06-03T09:51:39.191145Z","shell.execute_reply.started":"2022-06-03T09:51:39.159718Z","shell.execute_reply":"2022-06-03T09:51:39.190026Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def efficientNet_model():\n    model_input = Input(shape=(num_rows, num_columns, num_channels))\n    model_conc = Concatenate()([model_input, model_input, model_input])\n    base_model = EfficientNetB5(include_top=False, weights='../input/d/datasets/aeryss/keras-pretrained-models/EfficientNetB5_NoTop_ImageNet.h5', input_tensor=model_conc)\n    avgpool = GlobalAveragePooling2D()(base_model.output)\n    outputs = Dense(len(labels), activation=chosen_activation)(avgpool)\n    model = Model(inputs=base_model.input, outputs=outputs)\n    return model\n","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:51:39.192784Z","iopub.execute_input":"2022-06-03T09:51:39.193159Z","iopub.status.idle":"2022-06-03T09:51:39.210861Z","shell.execute_reply.started":"2022-06-03T09:51:39.193125Z","shell.execute_reply":"2022-06-03T09:51:39.209511Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def train_efficientNet_model(model, train_gen, val_gen):\n    checkpoint_model_path = \"/kaggle/working/EfficientNetB5.h5\"\n    metric = \"val_accuracy\"\n    model.compile(optimizer=chosen_optimizer, loss=chosen_loss, metrics=chosen_metrics)\n    num_epochs = epochs\n    checkpointer = ModelCheckpoint(filepath=checkpoint_model_path,monitor=metric, verbose=1, save_best_only=True)\n    es_callback = EarlyStopping(monitor=metric, patience=5, verbose=1)\n    reduce_lr = ReduceLROnPlateau(monitor=metric, factor=0.3, patience=1, verbose=1, min_delta=0.0001, cooldown=1, min_lr=0.00001)\n    fitted_model = model.fit(train_gen,epochs=num_epochs,validation_data=val_gen,callbacks=[checkpointer,es_callback,reduce_lr],verbose=1)\n    #Plot training and validation scores\n    plt.figure(1, figsize = (15,10))\n    plt.subplot(221)\n    plt.plot(fitted_model.history['loss'])\n    plt.plot(fitted_model.history['val_loss'])\n    plt.title('EfficientNet-B5 Loss vs Number of Epochs')\n    plt.ylabel('loss')\n    plt.xlabel('epoch')\n    plt.legend(['Training EfficientNet-B5 Loss', 'EfficientNet-B5 Validation Loss'])\n    plt.subplot(222)\n    plt.plot(fitted_model.history['accuracy'])\n    plt.plot(fitted_model.history['val_accuracy'])\n    plt.title('EfficientNet-B5 Accuracy vs Number of Epochs')\n    plt.ylabel('accuracy')\n    plt.xlabel('epoch')\n    plt.legend(['Training EfficientNet-B5 Accuracy', 'EfficientNet-B5 Validation Accuracy'])\n    plt.show()","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:51:39.213411Z","iopub.execute_input":"2022-06-03T09:51:39.214404Z","iopub.status.idle":"2022-06-03T09:51:39.227378Z","shell.execute_reply.started":"2022-06-03T09:51:39.214347Z","shell.execute_reply":"2022-06-03T09:51:39.226505Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"X_train, X_valid, _, _ = train_test_split(dataframe, dataframe[\"target\"], test_size=chosen_test, random_state=42)\ntrain_generator = process_data(X_train, **parameters_train)\nvalid_generator = process_data(X_valid, **parameters_valid)\ncnn_model = efficientNet_model()\ntrain_efficientNet_model(cnn_model, train_generator, valid_generator)","metadata":{"execution":{"iopub.status.busy":"2022-06-03T09:51:39.228588Z","iopub.execute_input":"2022-06-03T09:51:39.229432Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# **9. Load Model & Submission**","metadata":{}},{"cell_type":"code","source":"pred = {'row_id': [], 'target': []}\n\n#Setup Model\ncnn_model = efficientNet_model()\n#Load trained model weights!\ncnn_model.load_weights(\"./EfficientNetB5.h5\")\ndataframe = pd.read_csv(\"./dataframe.csv\")\nlabels = list(dataframe['primary_label'].unique())\ntest_path = \"/kaggle/input/birdclef-2022/test_soundscapes/\"\nfiles = [f.split('.')[0] for f in sorted(os.listdir(test_path))]\nbirds_path = \"/kaggle/input/birdclef-2022/scored_birds.json\"\nwith open(birds_path) as bf:\n    birds = json.load(bf)\n\nsample_submission = pd.read_csv('../input/birdclef-2022/sample_submission.csv')\n\n\nfor f in files:\n    file_path = test_path + f + '.ogg'\n    audio, sr = librosa.load(file_path)\n    # Get number of samples for 5 seconds; replace 5 by any number\n    buffer = 5 * sr\n    samples_total = len(audio)\n    samples_wrote = 0\n    counter = 1\n\n    while samples_wrote < samples_total:\n        #check if the buffer is not exceeding total samples \n        if buffer > (samples_total - samples_wrote):\n            buffer = samples_total - samples_wrote\n\n        block = audio[samples_wrote : (samples_wrote + buffer)]\n        feat = features(block, sr)\n        x = feat.reshape(1, num_rows, num_columns, num_channels)\n        prediction = cnn_model.predict(x)\n        label_index = np.argmax(prediction,axis=1)[0]\n        \n        for b in range(len(sample_submission)):\n            sample = sample_submission.row_id[b]\n            segment_end = counter * 5   \n            row_id = sample.split(\"_\")[0] + \"_\" + sample.split(\"_\")[1] + \"_\" + sample.split(\"_\")[3]\n            target_bird = sample.split(\"_\")[2]\n            if labels[label_index] == b:\n                target = True\n            else:\n                target = False\n            #data.append([row_id, target])\n            pred['row_id'].append(row_id)\n            pred['target'].append(True if target > 0.006 else False)\n        counter += 1\n        samples_wrote += buffer\n        \n#sample_submission = pd.DataFrame(data, columns=['row_id', 'target'])","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"sample_submission = pd.read_csv('../input/birdclef-2022/sample_submission.csv')\n\n\nfor i in range(len(sample_submission)):\n    sample = sample_submission.row_id[i]\n    key = sample.split(\"_\")[0] + \"_\" + sample.split(\"_\")[1] + \"_\" + sample.split(\"_\")[3]\n    target_bird = sample.split(\"_\")[2]\n    print(key, target_bird)\n    if key in prediction_dicts:\n        sample_submission.iat[i, 1] = (target_bird in prediction_dicts[key])\nsample_submission.to_csv(\"submission.csv\", index=False)\n# submission = prediction(test_audios=all_audios,\n#                         models_cfg=CFG.models_cfg,\n#                         threshold=threshold, \n#                         threshold_long=threshold_long)\n# submission.to_csv(\"submission.csv\", index=False)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"results = pd.DataFrame(pred, columns = ['row_id', 'target'])\n\nprint(results.head()) \n\nresults.to_csv(\"submission.csv\", index=False)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"#sample_submission.to_csv(\"/kaggle/working/submission.csv\", index=False)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"#sample_submission","metadata":{"trusted":true},"execution_count":null,"outputs":[]}]}