{"cells":[{"metadata":{"trusted":true,"_uuid":"0f8a475fd492f9f66a58432eb37e8b0ab3193d0f"},"cell_type":"code","source":"import pandas as pd\nimport numpy as np","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"29072fa0d3616c95d1761cbb57086e2112709fd8"},"cell_type":"code","source":"train=pd.read_csv(\"../input/train.csv\")\ntrain.head(2)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"d4548209188362d814841cf2c1eba712cc7de7ed"},"cell_type":"code","source":"##information from train dataset\ntrain.info()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"97014d348e466cbd51e79a4523793f55565a86f2"},"cell_type":"code","source":"#Dropping Cabin Column for more than 70 % of missing points\ntrain.drop('Cabin',axis=1,inplace=True)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"39e56334d7a9d7d3e884d3e6af25973396c40fe8"},"cell_type":"code","source":"##Filling Missing Values Based on Mean\ntrain.fillna(round(train.mean(),0), inplace=True)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"fc9df0664c97ad50310eebe284630417ba443841"},"cell_type":"code","source":"##Dropping only Two rows in Embarked which is having Two missing Values\ntrain.dropna(axis=0,inplace=True)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"177412ccde53b560bd58f4ba5797081d82d11377"},"cell_type":"code","source":"from sklearn.preprocessing import LabelEncoder","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"80983bcc6ad26a0f58d0e893c77ea94f6dcaa6c4"},"cell_type":"code","source":"#Selecting only Numeric Columns\ntrain_numeric=train.select_dtypes(exclude=['object'])","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"3aa3fb6869a42496f2520437bf284075b8900f6d"},"cell_type":"code","source":"#Selecting Only Object Columns\ntrain_categorical=train.select_dtypes(include=[\"object\"])\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"45a6483c2950c54e04e1e4e746fb202d1b17a149"},"cell_type":"code","source":"##Making categorical columns into numerical ones\n\nlbmake=LabelEncoder()\nb=[\"Name\",\"Sex\", \"Ticket\",\"Embarked\"]\nfor i in range(0,len(b)):\n    train_categorical[b[i]]= lbmake.fit_transform(train_categorical[b[i]])\nprint(train_categorical.head(3))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"d768d30168cf75b4f27572bcf121b2e762b15c94"},"cell_type":"code","source":"#Droping Name and Ticket number for model not needed\ntrain_categorical.drop([\"Name\",\"Ticket\"],axis=1,inplace=True)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"321734cc5a43364889967104764a04229c3c562d"},"cell_type":"code","source":"#Merging of Datasets\ntrain_last=pd.concat([train_categorical,train_numeric],axis=1)\ntrain_last.drop(\"PassengerId\",axis=1,inplace=True)\ntrain_last.head(3)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"897097d2d2aa143e68ebf397ad2f3aa9d096e86f"},"cell_type":"code","source":"from sklearn.linear_model import LogisticRegression","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"77fc5033c292e80cd38bf199c3887142540e7844"},"cell_type":"code","source":"y_train=train_last.iloc[:,2:3]\ny_train.head(3)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"236b7fc4152b615e782d4f2826e5f31b2c98678a"},"cell_type":"code","source":"x_train=train_last.iloc[:,[0,1,2,4,5,6,7]]\nx_train.head(3)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"3425a30f107b2e20265607e1e93921d815c70968"},"cell_type":"code","source":"##Model Fitting\nlogisticRegr=LogisticRegression()\nlog_model=logisticRegr.fit(x_train, y_train)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"e93edf1ff102e6250ae1bf85903d4541c63486aa"},"cell_type":"code","source":"##Testing Process\ntest=pd.read_csv(\"../input/test.csv\")\ntest.drop('Cabin',axis=1,inplace=True)\ntest.fillna(round(test.mean(),0), inplace=True)\ntest.dropna(axis=0,inplace=True)\ntest_numeric=test.select_dtypes(exclude=['object'])\ntest_categorical=test.select_dtypes(include=[\"object\"])\nlbmake=LabelEncoder()\nb=[\"Name\",\"Sex\", \"Ticket\",\"Embarked\"]\nfor i in range(0,len(b)):\n    test_categorical[b[i]]= lbmake.fit_transform(test_categorical[b[i]])\nprint(test_categorical.head(3))\n\ntest_last=pd.concat([test_categorical,test_numeric],axis=1)\ntest_last.drop([\"PassengerId\",\"Ticket\",\"Name\"],axis=1,inplace=True)\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"45e8b602fa0d45e3bedca45311fd4385af86bcd5"},"cell_type":"code","source":"##Training of Model using Train set\nfrom sklearn.linear_model import LogisticRegression","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"d7909529f498212a9009e858cd99727eb406ccab"},"cell_type":"code","source":"log_make=LogisticRegression()\nlog_model=log_make.fit(x_train,y_train)\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"e7358fc15e7504e75c1aeaa8e00b0289350a6b07"},"cell_type":"code","source":"#Testing of Model using test set\ntest[\"Survived\"]=log_model.predict(test_last)\n\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"881fcd79dc1a1b075b99e758ab11aef663ce3801"},"cell_type":"code","source":"##For  Submit to Check Prediction\n##gen_sub1=pd.read_csv(\"C:/Users/Selvamani/Desktop/gen_sub1.csv\")\n##gen_sub1[\"Survived\"]=test[\"Survived\"]\n##gen_sub1.to_csv(\"C:/Users/Selvamani/Desktop/gen_sub2.csv\")","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"codemirror_mode":{"name":"ipython","version":3},"file_extension":".py","mimetype":"text/x-python","name":"python","nbconvert_exporter":"python","pygments_lexer":"ipython3","version":"3.6.5"}},"nbformat":4,"nbformat_minor":1}