{"cells":[{"metadata":{"_uuid":"975ee723bcdf842790872a99b79600dc37385384"},"cell_type":"markdown","source":"This is a pytorch starter code. \n\nCode is based on previous Keras implementation: https://www.kaggle.com/mihaskalic/lstm-is-all-you-need-well-maybe-embeddings-also\n\nFuture improvements (#TODOs):\n- Pytorch loaders?\n- Improved reporting metrics"},{"metadata":{"_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","trusted":true},"cell_type":"code","source":"import os\nimport numpy as np\nimport pandas as pd\nfrom tqdm import tqdm_notebook as tqdm\nimport math\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.metrics import f1_score\nfrom keras.utils.data_utils import GeneratorEnqueuer  # We only want this for multithreaded \n\nfrom torch.autograd import Variable\nimport torch.nn as nn\nimport torch.optim as optim\nfrom torch.nn.utils.rnn import pack_padded_sequence\nfrom torch import Tensor","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"21f85dfd5b9bf3d8b27ba29149d52253e5d64049"},"cell_type":"markdown","source":"# Setup"},{"metadata":{"trusted":true,"_uuid":"78578eab64a477d0a5ad6b1c917ae154868a44df"},"cell_type":"code","source":"train_df = pd.read_csv(\"../input/train.csv\")\n\nkeep = [len(x[:-1].split()) > 0 for x in train_df[\"question_text\"]]\ntrain_df = train_df[keep]\ntrain_df, val_df = train_test_split(train_df, test_size=0.1)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"92ffbf2ef35d2dc5863ee27c61eadd1869ca5440"},"cell_type":"code","source":"# embdedding setup\n# Source https://blog.keras.io/using-pre-trained-word-embeddings-in-a-keras-model.html\nembeddings_index = {}\nf = open('../input/embeddings/glove.840B.300d/glove.840B.300d.txt')\nfor line in tqdm(f):\n    values = line.split(\" \")\n    word = values[0]\n    coefs = np.asarray(values[1:], dtype='float32')\n    embeddings_index[word] = coefs\nf.close()\n\nprint('Found %s word vectors.' % len(embeddings_index))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"9cc8b0bcd285225ce651d024f506615d4656b9f7"},"cell_type":"code","source":"# Convert values to embeddings\ndef text_to_array(text):\n    empyt_emb = np.zeros(300)\n    text = text[:-1].split()[:120]\n    embeds = [embeddings_index.get(x, empyt_emb) for x in text]\n    seq_len = len(embeds)\n    embeds+= [empyt_emb] * (120 - len(embeds))\n    return np.array(embeds), seq_len\n\nembeddings = [text_to_array(X_text) for X_text in tqdm(val_df[\"question_text\"][:5000])]\nval_x, val_xlen = zip(*embeddings)\n\n# For dynamic LSTM the values have to be ordered.\nsorder = np.argsort(val_xlen)[::-1]\n\nval_xlen = np.array(val_xlen)[sorder]\nval_x = np.array(val_x)[sorder]\nval_y = np.array(val_df[\"target\"][:5000])[sorder]","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"0c950448e0717eaebb920d93cfdc6b4561e21853"},"cell_type":"code","source":"# Train data providers\nbatch_size = 128\ndef batch_gen(train_df):\n    n_batches = math.ceil(len(train_df) / batch_size)\n    while True: \n        train_df = train_df.sample(frac=1.)  # Shuffle the data.\n        for i in range(n_batches):\n            texts = train_df.iloc[i*batch_size:(i+1)*batch_size, 1]\n            text_arr, text_len = zip(*[text_to_array(text) for text in texts])\n            sorder = np.argsort(text_len)[::-1]\n            text_arr = np.array(text_arr)[sorder]\n            text_len = np.array(text_len)[sorder]\n            yield text_arr, text_len, np.array(train_df[\"target\"][i*batch_size:(i+1)*batch_size])[sorder]","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"706c0224b6112e5a8f00ad25f35e90fbb9519a5f"},"cell_type":"markdown","source":"# Training"},{"metadata":{"trusted":true,"_uuid":"798c303ec834fb530a60a1e590cfbd9a86f93fde"},"cell_type":"code","source":"class BiLSTM_model(nn.Module):\n    def __init__(self, embedding_size=300, hidden_size=128):\n        super(BiLSTM_model, self).__init__()\n        self.lstm = nn.LSTM(300, hidden_size, \n                            batch_first=True, num_layers=2,\n                            bidirectional=True)\n        \n        self.fc = nn.Linear(hidden_size*2, 1)\n        self.sigmoid = nn.Sigmoid()\n        \n    def forward(self, x, input_lengths):\n        x = pack_padded_sequence(x, input_lengths, batch_first=True)\n        out = self.lstm(x)\n        out = out[1][1][2:] # TODO check if :2 really is FW and BW of last layer!\n        out = out.transpose(0,1)\n        out = out.flatten(start_dim=1)\n        out = self.fc(out)\n        return self.sigmoid(out).flatten()\n        # return memory\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"f95518aabadff9a2c771c28d2105591bed4cbe65"},"cell_type":"code","source":"model = BiLSTM_model()\nmodel.cuda()\nmodel.train()\noptimizer = optim.Adam(model.parameters(), lr=0.0005)\nbcloss = nn.BCELoss()\n\nmy_generator = GeneratorEnqueuer(batch_gen(train_df))\nmy_generator.start()\nmg =  my_generator.get()\n\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"78f16f30ce8206e2a6f0d33df1c3fb05db13f339"},"cell_type":"code","source":"def val_gen(batch_size=256):\n    n_batches = math.ceil(len(val_x) / batch_size)\n    for idx in range(n_batches):\n        xb = val_x[idx *batch_size:(idx+1) * batch_size]\n        xlb = val_xlen[idx *batch_size:(idx+1) * batch_size]\n        yb = val_y[idx *batch_size:(idx+1) * batch_size]\n        yield xb, xlb, yb","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"43cceaf12b83226f71aaa505b0f059091420b902","scrolled":false},"cell_type":"code","source":"losses = []\nfor i, (x, xlen, y) in tqdm(enumerate(mg)):\n    optimizer.zero_grad()\n    \n    x = Tensor(x).cuda()\n    y_pred = model(x, xlen)\n    loss = bcloss(y_pred, Tensor(y).cuda())\n    loss.backward()\n    \n    losses.append(loss.data.cpu().numpy())\n    optimizer.step()\n    \n    if (i + 1) % 1000 == 0:\n        print(\"Iter: {}\".format(i+1))\n        print(\"\\tAverage training loss: {:.5f}\".format(np.mean(losses)))\n        losses = []\n        # Evalute F1 on validation set\n        model.eval()\n        all_preds = []\n        for x, xlen, y in val_gen():\n            y_pred = model(Variable(Tensor(x)).cuda(), xlen)\n            all_preds.extend(y_pred.cpu().data.numpy())\n        score = f1_score(val_y, np.array(all_preds).flatten() > 0.5)\n        print(\"\\tVal F1 score: {:.5f}\".format(score))\n        model.train()\n    if  i == 10000:\n        print(\"Reducing LR\")\n        for g in optimizer.param_groups:\n            g['lr'] = 0.0001\n    if (i + 1) % 12000 == 0:  # We are done\n        break","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"bea188ff3c50821c704350779d26759694de776d"},"cell_type":"code","source":"","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"d6cdda0e301be0b84e826e29f0f3a85c41aa6da9"},"cell_type":"markdown","source":"# Inference"},{"metadata":{"trusted":true,"_uuid":"b58cd95254f41e5002a17de0c3feab54a5fc3c67"},"cell_type":"code","source":"batch_size = 256\n\ndef batch_gen(test_df):\n    n_batches = math.ceil(len(test_df) / batch_size)\n    for i in range(n_batches):\n        ids = test_df[\"qid\"][i*batch_size:(i+1)*batch_size]\n        texts = test_df.iloc[i*batch_size:(i+1)*batch_size, 1]\n        text_arr, text_len = zip(*[text_to_array(text) for text in texts])\n        sorder = np.argsort(text_len)[::-1]\n        \n        text_arr = np.array(text_arr)[sorder]\n        text_len = np.array(text_len)[sorder]\n        ids = np.array(ids)[sorder]\n        yield text_arr, text_len, ids\n    \ntest_df = pd.read_csv(\"../input/test.csv\")\n\nall_preds = []\nall_ids = []\n\nmodel.eval()\nfor x, xlen, xid in tqdm(batch_gen(test_df)):\n    preds = model(Variable(Tensor(x).cuda()), xlen)\n    preds = preds.data.cpu().numpy()\n    all_preds.extend(preds)\n    all_ids.extend(xid)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"3e6ed54def110c881f401c6f8a844752baedcfbd"},"cell_type":"code","source":"y_te = (np.array(all_preds).flatten() > 0.5).astype(np.int)\n\nsubmit_df = pd.DataFrame({\"qid\": all_ids, \"prediction\": y_te})\nsubmit_df.to_csv(\"submission.csv\", index=False)","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"name":"python","version":"3.6.6","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat":4,"nbformat_minor":1}