{"cells":[{"metadata":{"trusted":true},"cell_type":"code","source":"from keras.preprocessing.text import Tokenizer\nfrom keras.preprocessing.sequence import pad_sequences\n\nfrom keras.models import Sequential\nfrom keras.layers import CuDNNLSTM, Dense, Bidirectional, Flatten, LSTM\n\nimport os\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\nfrom tqdm import tqdm, tqdm_notebook\nimport math\nfrom sklearn.model_selection import train_test_split\nimport pickle\nfrom sklearn.metrics import f1_score, precision_score, recall_score, confusion_matrix\nimport re\nfrom gensim.models import Word2Vec\n\nfrom nltk.stem import WordNetLemmatizer\nimport nltk\nfrom nltk.tokenize import sent_tokenize, word_tokenize\nfrom nltk.corpus import stopwords\nfrom nltk.corpus import wordnet\n\nlemmatizer = WordNetLemmatizer()\nsw = nltk.corpus.stopwords.words('english')\nsw.append([\"?\",\"’\",\",\",\"?\"])","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"# from google.colab import drive\n# drive.mount('/content/drive')\n\ntrain_df = pd.read_csv(\"/kaggle/input/quora-insincere-questions-classification/train.csv\")\ntest_df = pd.read_csv(\"/kaggle/input/quora-insincere-questions-classification/test.csv\")","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"print(len(train_df))\nprint(len(test_df))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"def preprocess(text):\n    # lower case:\n    lower_text = text.lower()\n    # tokenize lemmatize stopword removal:\n    lemmatized_q = [lemmatizer.lemmatize(word=word,pos='v') for word in word_tokenize(lower_text.replace(\",\", \" \").replace(\".\", \" \").replace(\"?\", \" \").replace(\"-\", \" \").replace(\"\\\"\", \" \").replace(\"'\", \" \")) if word not in sw]\n    # TODO: use phrases for better tokenization\n    # TODO: use normalization for abbrv words ex: luv => love, fb => facebook,\n    return lemmatized_q\n\nlemmatized_qs = [preprocess(text) for text in tqdm_notebook(train_df['question_text'])]","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"lenmax = 40\ni = 0\nfor x in lemmatized_qs:\n    if len(x) > lenmax:\n        i += 1\n        \nprint(i/len(lemmatized_qs))\n\n# if we choose 40 as lenght of sentence, only less than 0.0002 of data will be discarded, instead we will have a smaller faster network","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"w2v_model = Word2Vec(lemmatized_qs, size=300, window=5, min_count=1, workers=8)","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","trusted":true},"cell_type":"code","source":"def sentence_to_np_embedding(text):\n    text = preprocess(text)[:40]\n    embeddings = []\n    for word in text:\n      try:\n        vector = w2v_model.wv[word]\n      except Exception as e:\n        vector = np.zeros(300)\n      embeddings.append(vector)\n    embeddings += [np.zeros(300)] * (40 - len(embeddings))\n    return np.array(embeddings)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"# Data providers\ntrain_batch_size = 128\ndef train_batch_gen(train_df):\n    n_batches = math.ceil(len(train_df) / train_batch_size)\n    while True: \n        train_df = train_df.sample(frac=1.)  # Shuffle the data.\n        for i in range(n_batches):\n            texts = train_df.iloc[i*train_batch_size:(i+1)*train_batch_size, 1]\n            text_arr = np.array([sentence_to_np_embedding(text) for text in texts])\n            yield text_arr, np.array(train_df[\"target\"][i*train_batch_size:(i+1)*train_batch_size])\n            # yield text_arr, to_categorical(np.array(train_df[\"target\"][i*train_batch_size:(i+1)*train_batch_size]), num_classes=None)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"model = Sequential()\nmodel.add(LSTM(128, input_shape=(40, 300)))\nmodel.add(Dense(1, activation=\"sigmoid\"))\nmodel.compile(loss='mean_squared_error', optimizer='adam')\nmodel.fit_generator(train_batch_gen(train_df),\n                    epochs=3,\n                    steps_per_epoch=math.ceil(len(train_df) / train_batch_size),\n                    verbose=True)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"batch_size = 512\ndef test_batch_gen(test_df):\n    n_batches = math.ceil(len(test_df) / batch_size)\n    for i in range(n_batches):\n        texts = test_df.iloc[i*batch_size:(i+1)*batch_size, 1]\n        text_arr = np.array([sentence_to_np_embedding(text) for text in texts])\n        yield text_arr\n\n# test_df = pd.read_csv(\"drive/My Drive/Kaggle/test.csv\")\n\n\nall_preds = []\nfor x in tqdm_notebook(test_batch_gen(test_df)):\n    all_preds.extend(model.predict(x).flatten())\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"# y_pred = []\n# for i in all_preds:\n#   if i > 0.100:\n#     y_pred.append(1)\n#   else:\n#     y_pred.append(0)\n    \n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"y_te = (np.array(all_preds) > 0.400).astype(np.int)\n\nsubmit_df = pd.DataFrame({\"qid\": test_df[\"qid\"], \"prediction\": y_te})\nsubmit_df.to_csv(\"submission.csv\", index=False)","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat":4,"nbformat_minor":1}