{"cells":[{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"# data exploration (for fun)\nimport os\nimport pandas as pd\nfrom nltk.corpus import stopwords\nfrom nltk.stem import WordNetLemmatizer\nfrom nltk.tokenize import RegexpTokenizer\n\n\ntokenizer = RegexpTokenizer(r'\\w+')\nwordnet_lemmatizer = WordNetLemmatizer()\n# NLTK Stop words\nstop_words = stopwords.words('english')\n\n\ntrain_df = pd.read_csv('../input/train.csv')","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"bc0f81d9b16c79db75d0d69ca25959a7cc1405c4"},"cell_type":"code","source":"# tokenize, remove stopwords, and lemmatize\ndef prepare_text(txt):\n    tokens = tokenizer.tokenize(txt)\n    tokens = [token for token in tokens if token.lower() not in stop_words]\n    tokens = [wordnet_lemmatizer.lemmatize(token) for token in tokens]\n    return tokens\n\n\n# process toxic questions\nprocessed_list = [prepare_text(x) for x in train_df['question_text']]\ntoxic_processed_list = [processed_list[x] for x in train_df[train_df['target'] == 1].index]\nflat_toxic_processed_list = [item for sublist in toxic_processed_list for item in sublist]\nflat_toxic_string = \" \".join(x for x in flat_toxic_processed_list)","execution_count":null,"outputs":[]},{"metadata":{"_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","collapsed":true,"_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","trusted":false},"cell_type":"code","source":"from wordcloud import WordCloud\n# generate wordcloud\nwordcloud = WordCloud(width = 800, height = 800, \n                background_color ='black', \n                min_font_size = 10).generate(flat_toxic_string) \n  \n\nimport matplotlib.pyplot as plt\n# plot the WordCloud image                        \nplt.figure(figsize = (8, 8), facecolor = None) \nplt.imshow(wordcloud) \nplt.axis(\"off\") \nplt.tight_layout(pad = 0) \nplt.show() ","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"name":"python","version":"3.6.6","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat":4,"nbformat_minor":1}