{"cells":[{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"import numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n#1: unreliable\n#0: reliable\ntrain=pd.read_csv('../input/jigsaw-multilingual-toxic-comment-classification/jigsaw-toxic-comment-train.csv')\ntest=pd.read_csv('../input/jigsaw-multilingual-toxic-comment-classification/test.csv')\ntest=pd.read_csv('/kaggle/input/jigsaw-multilingual-toxic-test-translated/jigsaw_miltilingual_test_translated.csv')\ntrain","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train[train.toxic==1]","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"test","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","scrolled":true,"trusted":true},"cell_type":"code","source":"from sklearn.feature_extraction.text import CountVectorizer\nfrom sklearn.naive_bayes import MultinomialNB\nfrom sklearn.feature_extraction.text import TfidfTransformer\n\n#data prep\ntest=test.fillna(' ')\ntrain=train.fillna(' ')\n\n#tfidf\n#transformer = TfidfTransformer(smooth_idf=False)\ncount_vectorizer = CountVectorizer(ngram_range=(1, 1))\ncount_vectorizer.fit_transform(train[train.toxic==1]['comment_text'])\ntoxic_words=count_vectorizer.get_feature_names()\ncvec=count_vectorizer.transform(test['translated'])\n\n\n\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"test_words=count_vectorizer.get_feature_names()\ntest_words=pd.DataFrame(test_words)\ntest_words['teller']=cvec.sum(axis=0).reshape(-1,1)\ntest_words=test_words.replace(0,np.nan).dropna()\ncommon_words=test_words.sort_values('teller',ascending=False)[0].values","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"count_vectorizer = CountVectorizer(ngram_range=(1, 1),vocabulary=common_words)\ntrain_tf=count_vectorizer.fit_transform(train['comment_text'])\ntest_tf=count_vectorizer.transform(test['content'])\ntrain_tf,test_tf","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"14a0bd63310ff47390c66618ad4cc6c92910a7a5","_cell_guid":"365b59da-b511-47ce-9965-4dc16197e237","trusted":true},"cell_type":"code","source":"from sklearn.linear_model import LogisticRegression\n\nlogreg = LogisticRegression(max_iter=2000)\nlogreg.fit(train_tf, train['toxic'].values)\npredictions = logreg.predict(test_tf)\npred=pd.DataFrame(predictions,columns=['toxic'])\npred['id']=test['id']\npred.groupby('toxic').count()","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"63673cfcef9abdfe7cdc859ab1c9a279bddbde09","_cell_guid":"d8589f7b-ba90-4bb6-bd80-fce957373eb1","trusted":true},"cell_type":"code","source":"pred.to_csv('submission.csv', index=False)\n","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat":4,"nbformat_minor":4}