{"cells":[{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load in \n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the \"../input/\" directory.\n# For example, running this (by clicking run or pressing Shift+Enter) will list the files in the input directory\n\nimport os\nimport plotly.offline as py\npy.init_notebook_mode(connected=True)\nimport plotly.graph_objs as go\nimport collections\n\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"ac0810a0ec709500e1c4e035943f365fcae4c22c"},"cell_type":"code","source":"print('Current working directory: ' + os.getcwd())\nprint(os.listdir(\"../input\"))\n\n# Any results you write to the current directory are saved as output.","execution_count":null,"outputs":[]},{"metadata":{"_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","trusted":true},"cell_type":"code","source":"df_train = pd.read_csv('../input/train.csv')\ndf_test = pd.read_csv('../input/test.csv')\n# 0-> sincere.\n# 1->insincere.\n# print(df_train.head(5))\nprint(\"Training set sample:\")\ndisplay(df_train.sample(5)) \ndf_train_1s = df_train[df_train.target==0]\nprint(\"Training set: total qid: \"+str(len(df_train.qid)))\nprint(\"Training set: No. of 0s:\" +str(len(df_train[df_train.target==0].target.tolist())))\nprint(\"Training set: No. of 1s: \"+str(len(df_train[df_train.target==1].target.tolist())))\nprint(\"\\nTesting set sample:\")\ndisplay(df_test.sample(5))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"726e33f6cad82a27658ae255beb1c46531a8a1cd"},"cell_type":"code","source":"train_X = df_train[['qid','question_text']]\ntrain_y = df_train['target']\ntest_X = df_test[['qid','question_text']]\n\nprint('train_X: ' + str(train_X.shape))\nprint('train_y: ' + str(train_y.shape))\nprint('test_X: ' + str(test_X.shape))\n\nprint(\"\\ntrain_y's 1:\"+str(len([x for x in train_y if x ==1])) + \" ,0:\"+str(len([x for x in train_y if x ==0])))\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"e1c8f8ac3ad795f3bfb8e643ff987d9b2c0452d4"},"cell_type":"code","source":"","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"name":"python","version":"3.6.6","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat":4,"nbformat_minor":1}