{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":19596,"databundleVersionId":1292430,"sourceType":"competition"}],"isInternetEnabled":true,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import IPython.display as ipd\nimport numpy as np\nimport pandas as pd\nimport librosa\nimport matplotlib.pyplot as plt\n\nfrom scipy.io import wavfile as wav\nfrom sklearn import metrics\nfrom sklearn.preprocessing import LabelEncoder\nfrom sklearn.model_selection import train_test_split\n\nfrom keras.models import Sequential\nfrom keras.layers import Dense, Dropout, Activation\nfrom keras.optimizers import Adam\nfrom keras.utils import to_categorical","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df = pd.read_csv('/kaggle/input/birdsong-recognition/test.csv')\nlabels = list(df['class'].unique())\nfiles = dict()\nfor i in range(len(labels)):\n    tmp = df[df['class'] == labels[i]][:1].reset_index()\n    path = 'UrbanSound8K/audio/fold{}/{}'.format(tmp['fold'][0], tmp['slice_file_name'][0])\n    files[labels[i]] = path","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"fig = plt.figure(figsize=(15,15))# Log graphic of waveforms to Comet\nexperiment.log_image('class_examples.png')\nfig.subplots_adjust(hspace=0.4, wspace=0.4)\nfor i, label in enumerate(labels):\n    fn = files[label]\n    fig.add_subplot(5, 2, i+1)\n    plt.title(label)\n    data, sample_rate = librosa.load(fn)\n    librosa.display.waveplot(data, sr= sample_rate)\nplt.savefig('class_examples.png')","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"for label in labels:\n    fn = files[label]\n    experiment.log_audio(fn, metadata = {'name': label})","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"experiment.log_image('class_examples.png')","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"fn = 'UrbanSound8K/audio/fold1/191431-9-0-66.wav'\nlibrosa_audio, librosa_sample_rate = librosa.load(fn)\nscipy_sample_rate, scipy_audio = wav.read(fn)\nprint(\"Original sample rate: {}\".format(scipy_sample_rate))\nprint(\"Librosa sample rate: {}\".format(librosa_sample_rate))","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"print('Original audio file min~max range: {} to {}'.format(np.min(scipy_audio), np.max(scipy_audio)))print('Librosa audio file min~max range: {0:.2f} to {0:.2f}'.format(np.min(librosa_audio), np.max(librosa_audio)))","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"plt.figure(figsize=(12, 4))\nplt.plot(scipy_audio)\nplt.savefig('original_audio.png')\nexperiment.log_image('original_audio.png')","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"plt.figure(figsize=(12,4))\nplt.plot(librosa_audio)\nplt.savefig('librosa_audio.png')\nexperiment.log_image('librosa_audio.png')","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"mfccs = librosa.feature.mfcc(y=librosa_audio, sr=librosa_sample_rate, n_mfcc = 40)","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"print(mfccs.shape)","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"plt.figure(figsize=(8,8))\nlibrosa.display.specshow(mfccs, sr=librosa_sample_rate, x_axis='time')\nplt.savefig('MFCCs.png')\nexperiment.log_image('MFCCs.png')","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def extract_features(file_name):audio, sample_rate = librosa.load(file_name, res_type='kaiser_fast') \n    mfccs = librosa.feature.mfcc(y=audio, sr=sample_rate, n_mfcc=40)\n    mfccs_processed = np.mean(mfccs.T,axis=0)\n     \n    return mfccs_processed","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"features = [] \nfor index, row in metadata.iterrows():file_name = os.path.join(os.path.abspath(fulldatasetpath),'fold'+str(row[\"fold\"])+'/',str(row[\"slice_file_name\"]))\n    \n    class_label = row[\"class\"]\n    data = extract_features(file_name)\n    \n    features.append([data, class_label])\n \nfeaturesdf = pd.DataFrame(features, columns=['feature','class_label'])","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"featuresdf.head()","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"featuresdf.iloc[0]['feature']","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"from sklearn.preprocessing import LabelEncoder\nfrom keras.utils import to_categorical\n\nX = np.array(featuresdf.feature.tolist())\ny = np.array(featuresdf.class_label.tolist())\n\nle = LabelEncoder()\nyy = to_categorical(le.fit_transform(y))","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"from sklearn.model_selection import train_test_split \nx_train, x_test, y_train, y_test = train_test_split(X, yy, test_size=0.2, random_state = 127)","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"num_labels = yy.shape[1]\nfilter_size = 2def build_model_graph(input_shape=(40,)):\n    model = Sequential()\n    model.add(Dense(256))\n    model.add(Activation('relu'))\n    model.add(Dropout(0.5))\n    model.add(Dense(256))\n    model.add(Activation('relu'))\n    model.add(Dropout(0.5))\n    model.add(Dense(num_labels))\n    model.add(Activation('softmax'))\n    # Compile the model\n    model.compile(loss='categorical_crossentropy', metrics=['accuracy'], optimizer='adam')\n    return modelmodel = build_model_graph()","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"model.summary()\nscore = model.evaluate(x_test, y_test, verbose=0)\naccuracy = 100*score[1]","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"print(\"Pre-training accuracy: %.4f%%\" % accuracy)","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"from keras.callbacks import ModelCheckpoint \nfrom datetime import datetime \nnum_epochs = 100\nnum_batch_size = 32\nmodel.fit(x_train, y_train, batch_size=num_batch_size, epochs=num_epochs, validation_data=(x_test, y_test), verbose=1)","metadata":{},"execution_count":null,"outputs":[]}]}