{"cells":[{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load in \n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the \"../input/\" directory.\n# For example, running this (by clicking run or pressing Shift+Enter) will list the files in the input directory\n\nimport os\nprint(os.listdir(\"../input\"))\n\n# Any results you write to the current directory are saved as output.","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"ec4327286103cef5754cdbb6a10abe4b3b1a2d2b"},"cell_type":"code","source":"import pandas as pd\nimport numpy as np\nimport matplotlib.pyplot as plt\nfrom wordcloud import WordCloud, STOPWORDS","execution_count":null,"outputs":[]},{"metadata":{"_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","trusted":true},"cell_type":"code","source":"\ntrain = pd.read_csv(\"../input/train.csv\")\ntest = pd.read_csv(\"../input/test.csv\")\nsample_sub = pd.read_csv(\"../input/sample_submission.csv\")\n#emb_glove = pd.read_csv(\"../input/embeddings/glove.840B.300d/glove.840B.300d.txt\")\n#emb_wiki = pd.read_csv(\"../input/embeddings/wiki-news-300d-1M/wiki-news-300d-1M.vec\")","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"a859f0f68190578ef4168f75f81274343b48156a"},"cell_type":"code","source":"train.info()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"9bd6a21200427635ec9da92f675222cfada3d477"},"cell_type":"code","source":"test.info()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"dfab543881a2c252a474fa9c88ad9e4741d82fad"},"cell_type":"code","source":"insincere = train[train.target == 1]\nsincere = train[train.target == 0]","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"253886d92f909bf06553f55b20e7b85b8293a6cc"},"cell_type":"code","source":"train.target.value_counts().plot(kind = 'bar')","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"bcb88b75ce056d50345c2983a7f30a57dddd6463"},"cell_type":"markdown","source":"**Above graph suggest \"Class Imbalance Problem\"**"},{"metadata":{"trusted":true,"_uuid":"b60a269da7e14ee6bc37b81eb6c421ead7a9cd79"},"cell_type":"code","source":"def word_cloud_plot(df, col):\n    comment_words = ' '\n    stopwords = set(STOPWORDS) \n\n    # iterate through the csv file \n    for val in df[col]: \n\n        # typecaste each val to string \n        val = str(val) \n\n        # split the value \n        tokens = val.split() \n\n        # Converts each token into lowercase \n        for i in range(len(tokens)): \n            tokens[i] = tokens[i].lower() \n\n        for words in tokens: \n            comment_words = comment_words + words + ' '\n\n\n    wordcloud = WordCloud(width = 800, height = 800, \n                    background_color ='white', \n                    stopwords = stopwords, \n                    min_font_size = 10).generate(comment_words) \n\n    # plot the WordCloud image                        \n    plt.figure(figsize = (8, 8), facecolor = None) \n    plt.imshow(wordcloud) \n    plt.axis(\"off\") \n    plt.tight_layout(pad = 0) \n\n    plt.show() ","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"dde71d6d9c4d82b4234fd16a307008df68f06c2e"},"cell_type":"code","source":"wordcloud = WordCloud().generate(str(insincere.question_text.values))\nplt.figure(figsize = (10,10))\nplt.title(\"insincere word cloud\")\nplt.imshow(wordcloud, interpolation='bilinear')","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"2fd79dc65083538ebbbcc486a4685742bb8fdb56"},"cell_type":"code","source":"wordcloud = WordCloud().generate(str(sincere.question_text.values))\nplt.figure(figsize = (10,10))\nplt.title(\"sincere word cloud\")\nplt.imshow(wordcloud, interpolation='bilinear')","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"c369cc0782e390782503264fe4149922f9db33d4"},"cell_type":"code","source":"train.columns","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"2d6196c78baea82424a6c823507eaf018b6a02f0"},"cell_type":"code","source":"","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"name":"python","version":"3.6.6","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat":4,"nbformat_minor":1}