{"cells":[{"metadata":{"_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","trusted":true},"cell_type":"code","source":"import numpy as np\nimport pandas as pd","execution_count":null,"outputs":[]},{"metadata":{"trusted":false,"_uuid":"e4061c67089ddfd27f37618b6a4fc7cf1221752c"},"cell_type":"code","source":"trainset = pd.read_csv(r\"../input/train.csv\")\n\nimport re\ndatatr=[]\nkeystr=[]\nfor i in range(0, len(trainset)):\n    m=trainset.question_text[i]\n    m=m.lower()\n    datatr.append(re.split(\"[^a-z]\", m))\n    keystr.append(trainset.target[i])\n\nfor i in range(0, len(datatr)):\n    for j in range (len(datatr[i])-1, -1, -1):\n        if datatr[i][j]==' ' or datatr[i][j]=='':\n            del datatr[i][j]            ","execution_count":null,"outputs":[]},{"metadata":{"trusted":false,"_uuid":"d550e5db5b3a0b3cabb56b589fb4761ac529cee5"},"cell_type":"code","source":"testset = pd.read_csv(r\"../input/test.csv\")\n\ndatate=[]\nidte=[]\nfor i in range(0, len(testset)):\n    m=testset.question_text[i]\n    m=m.lower()\n    datate.append(re.split(\"[^a-z]\", m))\n    idte.append(testset.qid[i])\n\nfor i in range(0, len(datate)):\n    for j in range (len(datate[i])-1, -1, -1):\n        if datate[i][j]==' ' or datate[i][j]=='':\n            del datate[i][j]  ","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"902265ac9ba0a6d1ef27dfed933eb46ca8f5434c","trusted":false},"cell_type":"code","source":"import nltk","execution_count":null,"outputs":[]},{"metadata":{"trusted":false,"_uuid":"6a8b5cc5e51bfb5fedb9959b03e5196c02386ee3"},"cell_type":"code","source":"lemma = nltk.WordNetLemmatizer()\nfor i in range(0, len(datatr)):\n    datatr[i] = [lemma.lemmatize(each) for each in datatr[i]]","execution_count":null,"outputs":[]},{"metadata":{"trusted":false,"_uuid":"e794280e13a74fcb3d097ac67af5be78cdbb3e3b"},"cell_type":"code","source":"for i in range(0, len(datate)):\n    datate[i] = [lemma.lemmatize(each) for each in datate[i]]","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"144258d2fc56c53d68a76b10042572063c82b521","trusted":false},"cell_type":"code","source":"from sklearn.feature_extraction.text import CountVectorizer\nmax_features = 20\ncount_vectorizer = CountVectorizer(stop_words = \"english\",max_features = max_features) \ndatatr1 = count_vectorizer.fit_transform(trainset.question_text).toarray()\ndatate1 = count_vectorizer.fit_transform(testset.question_text).toarray()","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"636af2788fbbf7323fa5311607fcb5fcd5c6a9d3","trusted":false},"cell_type":"code","source":"from sklearn.naive_bayes import GaussianNB\nnb = GaussianNB()\nnb.fit(datatr1,keystr)","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"610196f8904d8e86540388836a38203d68fe7cf7","trusted":false},"cell_type":"code","source":"y_pred = nb.predict(datate1)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"2420e780b8be670d2c8f1af303310dbd6513501c"},"cell_type":"code","source":"answer1='qid,prediction\\n'\nfor i in range(0,len(idte)):\n    answer1=answer1+str(idte[i])+','+str(int(y_pred[i]))+'\\n'\n\nf = open('submission.csv', 'w')\nf.write(answer1)\nf.close()","execution_count":null,"outputs":[]},{"metadata":{"trusted":false,"_uuid":"4b21efa8faef7ba6a30f5bea56c792ade273e5ce"},"cell_type":"code","source":"","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"name":"python","version":"3.6.6","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat":4,"nbformat_minor":1}