{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import numpy as np \nimport pandas as pd \n\nimport os\nprint(os.listdir(\"../input\"))\n\nimport matplotlib.pyplot as plt\nimport seaborn as sns\n","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","execution":{"iopub.status.busy":"2022-09-21T16:10:57.331759Z","iopub.execute_input":"2022-09-21T16:10:57.332116Z","iopub.status.idle":"2022-09-21T16:10:57.337701Z","shell.execute_reply.started":"2022-09-21T16:10:57.332084Z","shell.execute_reply":"2022-09-21T16:10:57.336733Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"## some config values \nembed_size = 300 # how big is each word vector\nmax_features = 95000 # how many unique words to use (i.e num rows in embedding vector)\nmaxlen = 70 # max number of words in a question to use","metadata":{"execution":{"iopub.status.busy":"2022-09-21T16:10:57.340615Z","iopub.execute_input":"2022-09-21T16:10:57.340882Z","iopub.status.idle":"2022-09-21T16:10:57.348945Z","shell.execute_reply.started":"2022-09-21T16:10:57.340858Z","shell.execute_reply":"2022-09-21T16:10:57.347780Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train = pd.read_csv('../input/quora-insincere-questions-classification/train.csv')\ntest = pd.read_csv('../input/quora-insincere-questions-classification/test.csv')\nsample = pd.read_csv(\"../input/quora-insincere-questions-classification/sample_submission.csv\")","metadata":{"execution":{"iopub.status.busy":"2022-09-21T16:10:57.350260Z","iopub.execute_input":"2022-09-21T16:10:57.350570Z","iopub.status.idle":"2022-09-21T16:11:00.546594Z","shell.execute_reply.started":"2022-09-21T16:10:57.350537Z","shell.execute_reply":"2022-09-21T16:11:00.545716Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import os\nimport time\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\nfrom tqdm import tqdm\nimport math\nfrom sklearn.model_selection import train_test_split\nfrom sklearn import metrics\n\nfrom keras.preprocessing.text import Tokenizer\nfrom keras.preprocessing.sequence import pad_sequences\nfrom keras.layers import Dense, Input, CuDNNLSTM, Embedding, Dropout, Activation, CuDNNGRU, Conv1D\nfrom keras.layers import Bidirectional, GlobalMaxPool1D, GlobalMaxPooling1D, GlobalAveragePooling1D\nfrom keras.layers import Input, Embedding, Dense, Conv2D, MaxPool2D, concatenate, Lambda\nfrom keras.layers import Reshape, Flatten, Concatenate, Dropout, SpatialDropout1D\nfrom keras.models import Model\nfrom keras import backend as K\nfrom keras import initializers, regularizers, constraints, optimizers, layers","metadata":{"execution":{"iopub.status.busy":"2022-09-21T16:11:00.548009Z","iopub.execute_input":"2022-09-21T16:11:00.548351Z","iopub.status.idle":"2022-09-21T16:11:00.555270Z","shell.execute_reply.started":"2022-09-21T16:11:00.548315Z","shell.execute_reply":"2022-09-21T16:11:00.554302Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def load_glove(word_index):\n    EMBEDDING_FILE = '../input/embeddings/glove-emebeddings/glove.6B.300d.txt'\n    def get_coefs(word,*arr): return word, np.asarray(arr, dtype='float32')\n    embeddings_index = dict(get_coefs(*o.split(\" \")) for o in open(EMBEDDING_FILE))\n\n    all_embs = np.stack(embeddings_index.values())\n    emb_mean,emb_std = all_embs.mean(), all_embs.std()\n    embed_size = all_embs.shape[1]\n\n    # word_index = tokenizer.word_index\n    nb_words = min(max_features, len(word_index))\n    embedding_matrix = np.random.normal(emb_mean, emb_std, (nb_words, embed_size))\n    for word, i in tqdm(word_index.items()):\n        if i >= max_features: continue\n        embedding_vector = embeddings_index.get(word)\n        if embedding_vector is not None: embedding_matrix[i] = embedding_vector\n            \n    return embedding_matrix ","metadata":{"execution":{"iopub.status.busy":"2022-09-21T16:14:43.335045Z","iopub.execute_input":"2022-09-21T16:14:43.335410Z","iopub.status.idle":"2022-09-21T16:14:43.342774Z","shell.execute_reply.started":"2022-09-21T16:14:43.335372Z","shell.execute_reply":"2022-09-21T16:14:43.341848Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"","metadata":{},"execution_count":null,"outputs":[]}]}