{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"!unzip -n ../input/quora-insincere-questions-classification/embeddings.zip","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"from keras.preprocessing.text import Tokenizer\nfrom keras.preprocessing.sequence import pad_sequences\nfrom keras.models import Sequential\nfrom keras.layers import LSTM, Dense, Bidirectional\nfrom keras.layers import Dense, Input, LSTM, Embedding, Dropout, Activation, GRU, Conv1D\nfrom keras.layers import Bidirectional, GlobalMaxPool1D, GlobalMaxPooling1D, GlobalAveragePooling1D\nfrom keras.layers import Input, Embedding, Dense, Conv2D, MaxPool2D, concatenate\nfrom keras.layers import Reshape, Flatten, Concatenate, Dropout, SpatialDropout1D\nfrom keras.optimizers import Adam\nfrom keras.models import Model\nfrom keras import backend as K\nfrom keras.engine.topology import Layer\nfrom keras import initializers, regularizers, constraints, optimizers, layers\nfrom keras.engine import InputSpec, Layer\n\nfrom sklearn.model_selection import train_test_split\nfrom sklearn import metrics\nfrom sklearn.model_selection import GridSearchCV, StratifiedKFold\nfrom sklearn.metrics import f1_score, roc_auc_score\n\nimport re\nimport random\nimport os\nimport sys\nimport numpy as np\nimport pandas as pd\nfrom tqdm import tqdm\nimport string\ntqdm.pandas()","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import tensorflow as tf\nimport keras\nprint(f\"tf version: {tf.__version__}\")\nprint(f\"keras version: {keras.__version__}\")","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"max_length = 60 # max number of words in a question to use\n\nembedding_size = 600\nlearning_rate = 0.001\nbatch_size = 512\nnum_epoch = 4","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train = pd.read_csv(\"../input/quora-insincere-questions-classification/train.csv\")\ntest = pd.read_csv(\"../input/quora-insincere-questions-classification/test.csv\")","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"regex = re.compile(\"[\"+re.escape(string.punctuation) + \"0-9\\\\r\\\\t\\\\n]\")\ndef clean_text(x):\n    return regex.sub(\"\",x)","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"mispell_dict = {'colour': 'color', 'centre': 'center', 'favourite': 'favorite', 'travelling': 'traveling', 'counselling': 'counseling', 'theatre': 'theater', 'cancelled': 'canceled', 'labour': 'labor', 'organisation': 'organization', 'wwii': 'world war 2', 'citicise': 'criticize', 'youtu ': 'youtube ', 'Qoura': 'Quora', 'sallary': 'salary', 'Whta': 'What', 'narcisist': 'narcissist', 'howdo': 'how do', 'whatare': 'what are', 'howcan': 'how can', 'howmuch': 'how much', 'howmany': 'how many', 'whydo': 'why do', 'doI': 'do I', 'theBest': 'the best', 'howdoes': 'how does', 'mastrubation': 'masturbation', 'mastrubate': 'masturbate', \"mastrubating\": 'masturbating', 'pennis': 'penis', 'Etherium': 'Ethereum', 'narcissit': 'narcissist', 'bigdata': 'big data', '2k17': '2017', '2k18': '2018', 'qouta': 'quota', 'exboyfriend': 'ex boyfriend', 'airhostess': 'air hostess', \"whst\": 'what', 'watsapp': 'whatsapp', 'demonitisation': 'demonetization', 'demonitization': 'demonetization', 'demonetisation': 'demonetization'}\ndef correct_spelling(x):\n    for word in mispell_dict.keys():\n        x = x.replace(word, mispell_dict[word])\n    return x","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train[\"question_text\"] = train[\"question_text\"].progress_apply(lambda x: x.lower())\ntest[\"question_text\"] = test[\"question_text\"].progress_apply(lambda x: x.lower())\ntrain[\"question_text\"] = train[\"question_text\"].progress_apply(clean_text)\ntest[\"question_text\"] = test[\"question_text\"].progress_apply(clean_text)\ntrain[\"question_text\"] = train[\"question_text\"].progress_apply(correct_spelling)\ntest[\"question_text\"] = test[\"question_text\"].progress_apply(correct_spelling)","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_X = train[\"question_text\"].values\ntest_X = test[\"question_text\"].values","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"tokenizer = Tokenizer()\ntokenizer.fit_on_texts(list(train_X))\ntrain_X = tokenizer.texts_to_sequences(train_X)\ntest_X = tokenizer.texts_to_sequences(test_X)\ntrain_X = pad_sequences(train_X, maxlen=max_length)\ntest_X = pad_sequences(test_X, maxlen=max_length)\n\ntrain_y = train['target'].values","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"embedding_files={\"glove\":r\"glove.840B.300d/glove.840B.300d.txt\",\"para\":r\"paragram_300_sl999/paragram_300_sl999.txt\",\"wiki\":r\"wiki-news-300d-1M/wiki-news-300d-1M.vec\"}\ndef get_coefs(word,*arr): \n    return word, np.asarray(arr, dtype='float32')\n\ndef load_data(embedding,word_index):\n    embedding_file=embedding_files.get(embedding)\n    if embedding==\"glove\":\n        embeddings_index = dict(get_coefs(*o.split(\" \")) for o in open(embedding_file))\n    elif embedding==\"para\":\n        embeddings_index = dict(get_coefs(*o.split(\" \")) for o in open(embedding_file, encoding=\"utf8\", errors='ignore') if len(o)>100)\n    elif embedding==\"wiki\":\n        embeddings_index = dict(get_coefs(*o.split(\" \")) for o in open(embedding_file) if len(o)>100)\n    all_embs = np.stack(embeddings_index.values())\n    emb_mean,emb_std = all_embs.mean(), all_embs.std()\n    embed_size = all_embs.shape[1]\n\n    nb_words = len(word_index)+1\n    embedding_matrix = np.random.normal(emb_mean, emb_std, (nb_words, embed_size))\n    for word, i in word_index.items():\n        embedding_vector = embeddings_index.get(word)\n        if embedding_vector is not None: \n            embedding_matrix[i] = embedding_vector\n    return embedding_matrix \n","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def build_model(embedding_matrix, nb_words, embedding_size=300):\n    inp = Input(shape=(max_length,))\n    x = Embedding(nb_words, embedding_size, weights=[embedding_matrix], trainable=False)(inp)\n    x = SpatialDropout1D(0.3)(x)\n    x1 = Bidirectional(LSTM(256, return_sequences=True))(x)\n    x2 = Bidirectional(GRU(128, return_sequences=True))(x1)\n    max_pool1 = GlobalMaxPooling1D()(x1)\n    max_pool2 = GlobalMaxPooling1D()(x2)\n    conc = Concatenate()([max_pool1, max_pool2])\n    predictions = Dense(1, activation='sigmoid')(conc)\n    model = Model(inputs=inp, outputs=predictions)\n    adam = optimizers.Adam(lr=learning_rate)\n    model.compile(optimizer=adam, loss='binary_crossentropy', metrics=['accuracy'])\n    return model","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_pred = np.zeros((len(train_X),), dtype=np.float32)\npred_prob = np.zeros((len(test_X),), dtype=np.float32)\n\n\nprint(\"Loading embedding matrix...\")\nembedding_matrix_wiki = load_data(\"wiki\",tokenizer.word_index)\nembedding_matrix_glove = load_data(\"glove\",tokenizer.word_index)\nembedding_matrix_para = load_data(\"para\",tokenizer.word_index)","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"embedding_matrix = np.concatenate((embedding_matrix_glove, embedding_matrix_wiki), axis=1)\nmodel = build_model(embedding_matrix, len(embedding_matrix), embedding_size)\nmodel.fit(train_X, train_y, batch_size=batch_size, epochs=num_epoch,validation_split=0.01 ,verbose=1)\ntrain_pred += 0.5*np.squeeze(model.predict(train_X, batch_size=batch_size, verbose=1))\npred_prob += 0.5*np.squeeze(model.predict(test_X, batch_size=batch_size, verbose=1))","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"embedding_matrix = np.concatenate((embedding_matrix_glove, embedding_matrix_para), axis=1)\nmodel = build_model(embedding_matrix, len(embedding_matrix), embedding_size)\nmodel.fit(train_X, train_y, batch_size=batch_size, epochs=num_epoch,validation_split=0.01 ,verbose=1)\ntrain_pred += 0.5*np.squeeze(model.predict(train_X, batch_size=batch_size, verbose=1))\npred_prob += 0.5*np.squeeze(model.predict(test_X, batch_size=batch_size, verbose=1))","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"i=0.01\nmaxi=0.99\nmaxf1=0\nwhile i<0.99:\n    pred_train = (train_pred > i).astype(np.int)\n    f1=f1_score(train_y, pred_train)\n    if f1>maxf1:\n        maxi=i\n        maxf1=f1\n    i+=0.01\nprint(f\"threshold: {maxi}\")\nprint(f\"max f1 score: {maxf1}\")","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"submission = pd.DataFrame.from_dict({'qid': test['qid']})\nsubmission['prediction'] = (pred_prob>maxi).astype(int)\nsubmission.to_csv('submission.csv', index=False)","metadata":{"trusted":true},"execution_count":null,"outputs":[]}]}