{"cells":[{"metadata":{"_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","trusted":true},"cell_type":"code","source":"from keras.preprocessing.text import Tokenizer\nfrom keras.preprocessing.sequence import pad_sequences\n\nimport os\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\nfrom tqdm import tqdm\n\nimport math\nfrom sklearn.model_selection import train_test_split","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"21f85dfd5b9bf3d8b27ba29149d52253e5d64049"},"cell_type":"markdown","source":"# Setup"},{"metadata":{"trusted":true,"_uuid":"78578eab64a477d0a5ad6b1c917ae154868a44df"},"cell_type":"code","source":"train_df = pd.read_csv(\"../input/train.csv\")\ntrain_df, val_df = train_test_split(train_df, test_size=0.1)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"92ffbf2ef35d2dc5863ee27c61eadd1869ca5440"},"cell_type":"code","source":"# embdedding setup\n# Source https://blog.keras.io/using-pre-trained-word-embeddings-in-a-keras-model.html\nembeddings_index = {}\nf = open('../input/embeddings/glove.840B.300d/glove.840B.300d.txt')\nfor line in tqdm(f):\n    values = line.split(\" \")\n    word = values[0]\n    coefs = np.asarray(values[1:], dtype='float32')\n    embeddings_index[word] = coefs\nf.close()\n\nprint('Found %s word vectors.' % len(embeddings_index))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"9cc8b0bcd285225ce651d024f506615d4656b9f7"},"cell_type":"code","source":"# Convert values to embeddings\ndef text_to_array(text):\n    empyt_emb = np.zeros(300)\n    text = text[:-1].split()[:100]\n    embeds = [embeddings_index.get(x, empyt_emb) for x in text]\n    embeds+= [empyt_emb] * (100 - len(embeds))\n    return np.array(embeds)\n\n# train_vects = [text_to_array(X_text) for X_text in tqdm(train_df[\"question_text\"])]\nval_vects = np.array([text_to_array(X_text) for X_text in tqdm(val_df[\"question_text\"][:5000])])\nval_y = np.array(val_df[\"target\"][:5000])\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"6a029ac36a6026a3c2dc40aaa98234bf4af7c270"},"cell_type":"code","source":"val_vects.shape","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"0c950448e0717eaebb920d93cfdc6b4561e21853"},"cell_type":"code","source":"# Data providers\nbatch_size = 128\n\ndef batch_gen(train_df):\n    n_batches = math.ceil(len(train_df) / batch_size)\n    while True: \n        train_df = train_df.sample(frac=1.)  # Shuffle the data.\n        for i in range(n_batches):\n            texts = train_df.iloc[i*batch_size:(i+1)*batch_size, 1]\n            text_arr = np.array([text_to_array(text) for text in texts])\n            yield text_arr, np.array(train_df[\"target\"][i*batch_size:(i+1)*batch_size])\n","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"706c0224b6112e5a8f00ad25f35e90fbb9519a5f"},"cell_type":"markdown","source":"# Training"},{"metadata":{"trusted":true,"_uuid":"798c303ec834fb530a60a1e590cfbd9a86f93fde"},"cell_type":"code","source":"from keras.models import Sequential, Input\nfrom keras.models import Model\nfrom keras.layers import concatenate, GlobalAveragePooling1D, GlobalMaxPooling1D, CuDNNLSTM, CuDNNGRU, Dense, Bidirectional, SpatialDropout1D, Conv1D","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"9ad418c95b31ab5691d49b72c7c9622ef9ea42cf"},"cell_type":"code","source":"dr = 0.25\nunits = 96\n\ninp = Input(shape = ((100, 300)))\nx1 = SpatialDropout1D(dr)(inp)\n\nx = Bidirectional(CuDNNGRU(units, return_sequences = True))(x1)\nx = Conv1D(64, kernel_size = 2, padding = \"valid\", kernel_initializer = \"he_uniform\")(x)\n    \ny = Bidirectional(CuDNNLSTM(units, return_sequences = True))(x1)\ny = Conv1D(64, kernel_size = 2, padding = \"valid\", kernel_initializer = \"he_uniform\")(y)\n    \navg_pool1 = GlobalAveragePooling1D()(x)\nmax_pool1 = GlobalMaxPooling1D()(x)\n    \navg_pool2 = GlobalAveragePooling1D()(y)\nmax_pool2 = GlobalMaxPooling1D()(y)\n    \n    \nx = concatenate([avg_pool1, max_pool1, avg_pool2, max_pool2])\n\nx = Dense(1, activation = \"sigmoid\")(x)\nmodel = Model(inputs = inp, outputs = x)\n\nmodel.compile(loss='binary_crossentropy',\n              optimizer='adam',\n              metrics=['accuracy'])","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"3f0b703ded691293450beb4ddf2d903d0e08c737"},"cell_type":"code","source":"mg = batch_gen(train_df)\nmodel.fit_generator(mg, epochs=30,\n                    steps_per_epoch=1000,\n                    validation_data=(val_vects, val_y),\n                    verbose=True)","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"d6cdda0e301be0b84e826e29f0f3a85c41aa6da9"},"cell_type":"markdown","source":"# Inference"},{"metadata":{"trusted":true,"_uuid":"b58cd95254f41e5002a17de0c3feab54a5fc3c67"},"cell_type":"code","source":"# prediction part\nbatch_size = 256\ndef batch_gen(test_df):\n    n_batches = math.ceil(len(test_df) / batch_size)\n    for i in range(n_batches):\n        texts = test_df.iloc[i*batch_size:(i+1)*batch_size, 1]\n        text_arr = np.array([text_to_array(text) for text in texts])\n        yield text_arr\n\ntest_df = pd.read_csv(\"../input/test.csv\")\n\nall_preds = []\nfor x in tqdm(batch_gen(test_df)):\n    all_preds.extend(model.predict(x).flatten())","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"ba652bf22320e2ab53e9ea48ec7615dd5e0a1b07"},"cell_type":"code","source":"all_preds_val = []\nfor x in tqdm(batch_gen(val_df)):\n    all_preds_val.extend(model.predict(x).flatten())","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"2876633b98c94b49b70c110d0dca55b53c8d5fbf"},"cell_type":"code","source":"val_y = val_df[\"target\"].values","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"9845d9744b5049ec9a331db82364368d7f3660a2"},"cell_type":"code","source":"from sklearn.metrics import f1_score","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"429345ac394b8de42c89359273a2f88dfa0a16c7"},"cell_type":"code","source":"y_val = (np.array(all_preds_val) > 0.1).astype(np.int)\nf1_score(val_y, y_val)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"3a6d90189aa5b05cda96127af691a4e6ea0753f1"},"cell_type":"code","source":"0.6764157867991644","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"c5f574bf5f7c805e22e8ebab369db9a0d3f435a9"},"cell_type":"code","source":"0.6762409528694363","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"2ef54f05e56a85905124f91cbec0533b8355d7a2"},"cell_type":"code","source":"0.6733616435211752","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"9b3e283bcbd8ae649f15958b20760290358c8522"},"cell_type":"code","source":"0.6676628479716642","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"08cd92e743b7fac290a943afbacca0577660fb29"},"cell_type":"code","source":"f1_score(val_y, y_val)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"57dbdce788bc50f1b252d3febe8e4f955401e7cd"},"cell_type":"code","source":"score = 0\nthresh = .5\nfor i in np.arange(0.1, 0.991, 0.01):\n    y_val = (np.array(all_preds_val) > i).astype(np.int)\n    temp_score = f1_score(val_y, y_val)\n    if(temp_score > score):\n        score = temp_score\n        thresh = i\n\nprint(\"CV: {}, Threshold: {}\".format(score, thresh))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"3e6ed54def110c881f401c6f8a844752baedcfbd"},"cell_type":"code","source":"y_te = (np.array(all_preds) > thresh).astype(np.int)\n\nsubmit_df = pd.DataFrame({\"qid\": test_df[\"qid\"], \"prediction\": y_te})\nsubmit_df.to_csv(\"submission.csv\", index=False)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"e3e8c5191d82d71c082453c3c049f7bbb6054694"},"cell_type":"code","source":"","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"name":"python","version":"3.6.6","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat":4,"nbformat_minor":1}