{"cells":[{"metadata":{"_uuid":"71980647a6e1c2ab4939361c41a5f8e129af349d"},"cell_type":"markdown","source":"## Advanced Ensemble Techniques Blending\nthis Kernel is built in base to this documents: https://www.analyticsvidhya.com/blog/2018/06/comprehensive-guide-for-ensemble-models/ \nIf I help you please upvote"},{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"import numpy as np \nimport pandas as pd \n\nfrom sklearn.tree import DecisionTreeClassifier\nfrom sklearn.neighbors import KNeighborsClassifier\nfrom sklearn.linear_model import LogisticRegression\nfrom sklearn.model_selection import StratifiedKFold\n\nfrom sklearn.model_selection import train_test_split\n#from sklearn.cross_validation import KFold\nfrom sklearn.model_selection import StratifiedKFold\nfrom sklearn.metrics import accuracy_score\nfrom sklearn.ensemble import RandomForestClassifier, GradientBoostingClassifier\nimport os\nprint(os.listdir(\"../input\"))\nnp.random.seed(0)","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"2274d593afcfed41094d407a30cde4011f764aff"},"cell_type":"markdown","source":"This Kernel es a basic example of implementation about Stacking, this technique is very import for understand techniques more avanzed "},{"metadata":{"_uuid":"0fd8820554e4d5ec3c030d85177582184c9ee6ec"},"cell_type":"markdown","source":"Upload dataset"},{"metadata":{"_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","trusted":true},"cell_type":"code","source":"train = pd.read_csv(\"../input/train.csv\",index_col='PassengerId')\ntest = pd.read_csv(\"../input/test.csv\",index_col='PassengerId')#","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"897624171ee48b1e145793d9af99e9d5ddde1dac"},"cell_type":"markdown","source":"i count data missing and count dataset"},{"metadata":{"trusted":true,"_uuid":"34541edcec4b1ba6b54c837c830bdc0a4baafd1b"},"cell_type":"code","source":"train.shape,test.shape","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"fa018c097c6890d8c282baff33cc5f530aa78d89"},"cell_type":"markdown","source":"Show my Dataset"},{"metadata":{"trusted":true,"_uuid":"3a19168f8678db6521566b50ea99ade0642c4ac1"},"cell_type":"code","source":"train[(train['Age'].isna())].head(12)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"88edf20ef7950afbf10fbd44caedb21892d453cd"},"cell_type":"code","source":"train[(train['SibSp']==0) & (train['Parch']==0) &(train['Embarked']=='Q')&(train['Sex']=='male')].head(5)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"e3f5d9a0688626477eed93e8068f041cbac8b32e"},"cell_type":"code","source":"train.head(5)","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"e13782676239cc3b8397f230be441041bfecd500"},"cell_type":"markdown","source":"## Engineer Features\nWe work in the features Dataset, this example is about Stacking, and it's not important to deep in the feature"},{"metadata":{"trusted":true,"_uuid":"5fb3186e04a61ffe54f40b258a851ddf3bbfb267"},"cell_type":"code","source":"def replaceGen(sex):\n    gen =0\n    if sex=='male':\n        gen=0\n    elif sex=='female':\n        gen=1\n    return gen\n    ","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"a5ee98397528744e0b0d492a5abec238f1e07375"},"cell_type":"code","source":"train['Sex'] = train['Sex'].apply(replaceGen)\ntest['Sex'] = test['Sex'].apply(replaceGen)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"e155ccccf7e71607ae997029e1abfde3ecaa5843"},"cell_type":"code","source":"train['Age'].hist(figsize=(10, 4));","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"b76b45b1e0a8f6ef501919b96b58b3f9166e3da6"},"cell_type":"code","source":"train['Age'].fillna(train['Age'].mean(), inplace=True)\ntest['Age'].fillna(test['Age'].mean(), inplace=True)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"cddea238031a7561ca7d6a4ce32638e46ace0dbc"},"cell_type":"code","source":"test[test['Fare'].isna()]","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"ff5805332e8bef65cc36f46e0ebbd659aacb7f18"},"cell_type":"code","source":"Age_mean = train[(train['Pclass']==3) & (train['Embarked']=='S') & (train['Age']>55) & (train['Sex']==0)]['Fare'].mean()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"ec8cac02db2ae3880de0ac937964eab4de40b240"},"cell_type":"code","source":"test['Fare'].fillna(Age_mean, inplace=True)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"faec9e1b22822738638eaa15d01ba289abd38f5f"},"cell_type":"code","source":"X =train.drop(['Survived','Name','Ticket','Cabin','Embarked'],axis=1)\ny =pd.DataFrame(train['Survived'])\ntest_f =test.drop(['Name','Ticket','Cabin','Embarked'],axis=1)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"6d6e90651f277110b7e2b9cc7ddd596a1b883958"},"cell_type":"code","source":"X.shape,y.shape","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"9432e1526c673f06e3c007bb5492e3c8cc1bd2b1"},"cell_type":"markdown","source":"Split the Dataset in Train and test and data validation\n\n![Explained](https://s3-ap-south-1.amazonaws.com/av-blog-media/wp-content/uploads/2018/05/image-7-300x226.png)"},{"metadata":{"trusted":true,"_uuid":"6f8846ac6b7f84364dd1e9a923dc9c40364d6669"},"cell_type":"code","source":"x_train, x_test, y_train, y_test = train_test_split(X, y, test_size=0.33, random_state=42)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"4ceffc58d668c7a63fa0ba198da31694bc24631b"},"cell_type":"code","source":"x_train, x_val, y_train, y_val = train_test_split(x_train, y_train, test_size=0.33, random_state=42)","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"334c947620c2181c5ecf8f5bd47d48334feaeeb5"},"cell_type":"markdown","source":"We test the models and its accuracy"},{"metadata":{"trusted":true,"_uuid":"3d0d1c2d9d0df0343c22fc9b66f957cbd75933d1"},"cell_type":"code","source":"model1 = DecisionTreeClassifier()\nmodel1.fit(x_train, y_train)\nval_pred1=pd.DataFrame(model1.predict(x_val))\ntest_pred1=pd.DataFrame(model1.predict(x_test))\n\nmodel2 = KNeighborsClassifier()\nmodel2.fit(x_train,y_train)\nval_pred2=pd.DataFrame(model2.predict(x_val))\ntest_pred2=pd.DataFrame(model2.predict(x_test))\n\nmodel3 = RandomForestClassifier()\nmodel3.fit(x_train,y_train)\nval_pred3=pd.DataFrame(model3.predict(x_val))\ntest_pred3=pd.DataFrame(model3.predict(x_test))\n\nmodel4 = GradientBoostingClassifier()\nmodel4.fit(x_train,y_train)\nval_pred4=pd.DataFrame(model4.predict(x_val))\ntest_pred4=pd.DataFrame(model4.predict(x_test))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"ce4bdc29b0eb632b337c4fe35378e551709fb469"},"cell_type":"code","source":"x_val.head()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"962ba3f28ea70cbb1fc3aa661adb8bf47a69cd2b"},"cell_type":"code","source":"df_val=pd.concat([x_val.reset_index(drop=True), val_pred1.reset_index(drop=True),val_pred2.reset_index(drop=True),val_pred3.reset_index(drop=True),val_pred4.reset_index(drop=True)],axis=1)\ndf_test=pd.concat([x_test.reset_index(drop=True), test_pred1.reset_index(drop=True),test_pred2.reset_index(drop=True),test_pred3.reset_index(drop=True),test_pred4.reset_index(drop=True)],axis=1)\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"830519d59f28c2b4704fb78fce3ab4e5419ed05e"},"cell_type":"code","source":"df_val.head()","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"206f1aea8d31cb6f4cccb476e6ec63a104bd8f59"},"cell_type":"markdown","source":"Show the accuracy in the model of second level"},{"metadata":{"trusted":true,"_uuid":"59c3bdabf9d819744eb75760f2fba377a09c6876"},"cell_type":"code","source":"model = LogisticRegression()\nmodel.fit(df_val,y_val)\nmodel.score(df_test,y_test)","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"734c3bfeaa44341d11fe5468bb3317d44adcfb69"},"cell_type":"markdown","source":"\n\n\n\nRun model with all Dataset"},{"metadata":{"trusted":true,"_uuid":"499eaf086306cca003afec32d92f1198e40e30d2"},"cell_type":"code","source":"x_train, x_val, y_train, y_val = train_test_split(X, y, test_size=0.33, random_state=42)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"16df936c952ff6a97c98c9d32b981fc6977d79b6"},"cell_type":"code","source":"model1 = DecisionTreeClassifier()\nmodel1.fit(x_train, y_train)\nval_pred1=pd.DataFrame(model1.predict(x_val))\ntest_pred1=pd.DataFrame(model1.predict(test_f))\n\nmodel2 = KNeighborsClassifier()\nmodel2.fit(x_train,y_train)\nval_pred2=pd.DataFrame(model2.predict(x_val))\ntest_pred2=pd.DataFrame(model2.predict(test_f))\n\nmodel3 = RandomForestClassifier()\nmodel3.fit(x_train,y_train)\nval_pred3=pd.DataFrame(model3.predict(x_val))\ntest_pred3=pd.DataFrame(model3.predict(test_f))\n\nmodel4 = GradientBoostingClassifier()\nmodel4.fit(x_train,y_train)\nval_pred4=pd.DataFrame(model4.predict(x_val))\ntest_pred4=pd.DataFrame(model4.predict(test_f))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"780dc4d17d46be8796f3764809fe39570a8da939"},"cell_type":"code","source":"x_val.head()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"79c875295f334fcdffaf5e62073f5c116362fbf3"},"cell_type":"code","source":"df_val=pd.concat([x_val.reset_index(drop=True), val_pred1.reset_index(drop=True),val_pred2.reset_index(drop=True),val_pred3.reset_index(drop=True),val_pred4.reset_index(drop=True)],axis=1)\ndf_test=pd.concat([test_f.reset_index(drop=True), test_pred1.reset_index(drop=True),test_pred2.reset_index(drop=True),test_pred3.reset_index(drop=True),test_pred4.reset_index(drop=True)],axis=1)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"23be467d2d0bca58467b291781f23dd12931b538"},"cell_type":"code","source":"df_val.head()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"ea47fa80daaa7150374f58aa96722b7374fe6bd5"},"cell_type":"code","source":"model = LogisticRegression()\nmodel.fit(df_val,y_val)\ny_target = model.predict(df_test)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"9d8078f953e26003f792e809003ac04a7f26c2c8"},"cell_type":"code","source":"test_salida = pd.DataFrame( { 'PassengerId': test_f.index , 'Survived': y_target } )","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"92af87653f51a7500b06a859eb9c9abdef47bf5d"},"cell_type":"code","source":"#Show Output\ntest_salida.head(20)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"9913243b153105a0c6004f724f991d21c22c6dd1"},"cell_type":"code","source":"test_salida.to_csv( 'titanic_pred.csv' , index = False )","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"10594cadc88f75432cba7b361e244a84a1197890"},"cell_type":"code","source":"","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"name":"python","version":"3.6.6","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat":4,"nbformat_minor":1}