{"cells":[{"metadata":{"trusted":true,"_uuid":"d1aa682c22d68ee5f8ddadd85a2da819f2ff5e44"},"cell_type":"code","source":"import pandas as pd\nimport numpy as np\nimport seaborn as sns","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"9f06b43acba8ad16b0357853e121b200c2715499"},"cell_type":"code","source":"df1 = pd.read_csv(\"../input/elo-blending/BlendingRLSR.csv\")\ndf1.head()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"8793f7bdf6b47d46cdf1e3fd5b9ab7073c7130ae"},"cell_type":"code","source":"df2 = pd.read_csv(\"../input/elo-blending/combining_submission (1).csv\")\ndf2.head()\n\ndf3 = pd.read_csv(\"../input/simple-lightgbm-without-blending/submission.csv\")\ndf3.head()\n\ndf2['target'] = df2['target'] * 0.35 + df1['target'] * 0.65\ndf2['target'] = df2['target'] * 0.57 + df3['target'] * 0.43\ndf2.to_csv(\"blend.csv\",index = False)","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"bfc238107445fd22ba885cc29d55ab84bdccd3a9"},"cell_type":"markdown","source":"#### Biggest Blending"},{"metadata":{"trusted":true,"_uuid":"921becb898265ae9b478f098d8c2bd3085f80014"},"cell_type":"code","source":"import numpy as np # NUMPY\nimport pandas as p # PANDAS\n\n# DATA VIZUALIZATION LIBRARIES\nfrom matplotlib import pyplot as plt\nimport seaborn as sns\n\n# METRICS TO MEASURE RMSE\nfrom math import sqrt\nfrom sklearn import metrics","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"29c2ac5baee95163734a6633d0d3ebba8a4ef74e"},"cell_type":"code","source":"#ALL PUBLIC SOLUTION RMSE < 0.2269 (WITHOUT REPETITIONS)\ndf_base0 = p.read_csv('../input/elo-blending/3.695.csv',names=[\"card_id\",\"target0\"], skiprows=[0],header=None)\ndf_base1 = p.read_csv('../input/elo-blending/3.696.csv',names=[\"card_id\",\"target1\"], skiprows=[0],header=None)\ndf_base2 = p.read_csv('../input/elo-blending/3.6999.csv',names=[\"card_id\",\"targe2\"], skiprows=[0],header=None)\ndf_base3 = p.read_csv('../input/elo-blending/3.69991.csv',names=[\"card_id\",\"target3\"], skiprows=[0],header=None)\ndf_base4 = p.read_csv('../input/elo-blending/3.699992.csv',names=[\"card_id\",\"target4\"], skiprows=[0],header=None)\ndf_base5 = p.read_csv('../input/elo-blending/3.70.csv',names=[\"card_id\",\"target5\"], skiprows=[0],header=None)\ndf_base6 = p.read_csv('../input/elo-blending/3.701.csv',names=[\"card_id\",\"target6\"], skiprows=[0],header=None)\ndf_base7 = p.read_csv('../input/elo-blending/3.702.csv',names=[\"card_id\",\"target7\"], skiprows=[0],header=None)\ndf_base8 = p.read_csv('../input/elo-blending/3.703.csv',names=[\"card_id\",\"target8\"], skiprows=[0],header=None)\ndf_base9 = p.read_csv('../input/elo-blending/3.704.csv',names=[\"card_id\",\"target9\"], skiprows=[0],header=None)\ndf_base10 = p.read_csv('../input/elo-blending/Blending.csv',names=[\"card_id\",\"target10\"], skiprows=[0],header=None)\ndf_base11 = p.read_csv('../input/elo-blending/BlendingRLS.csv',names=[\"card_id\",\"target11\"], skiprows=[0],header=None)\ndf_base12 = p.read_csv('../input/elo-blending/combining_submission (1).csv',names=[\"card_id\",\"target12\"], skiprows=[0],header=None)\ndf_base13 = p.read_csv('../input/elo-blending/BlendingRLSR.csv',names=[\"card_id\",\"target13\"], skiprows=[0],header=None)\ndf_base14 = p.read_csv('../input/simple-lightgbm-without-blending/submission.csv',names=[\"card_id\",\"target14\"], skiprows=[0],header=None)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"fbbd092b999a4f444f1cc8a9a2cab03fe406f33b"},"cell_type":"code","source":"df_base = p.merge(df_base12,df_base0,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base1,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base2,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base3,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base4,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base5,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base6,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base7,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base8,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base9,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base10,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base11,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base12,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base13,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base14,how='inner',on='card_id')","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"3762e426d74b24ff567cca750550c2e40c5dd4c9"},"cell_type":"code","source":"#CORRELATION MATRIX (Pearson Correlation to measure how similar are 2 solutions)\nplt.figure(figsize=(16,12))\nsns.heatmap(df_base.iloc[:,1:].corr(),annot=True,fmt=\".2f\")","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"810e3383ed510b1aee2d50ff4a5a890c85cea367"},"cell_type":"code","source":"# ALTERNATIVE WAY - RMSE MATRIX (RMSE to measure how similar are 2 solutions)\nM = np.zeros([df_base.iloc[:,1:].shape[1],df_base.iloc[:,1:].shape[1]])\nfor i in np.arange(M.shape[1]):\n    for j in np.arange(M.shape[1]):\n        M[i,j] = sqrt(metrics.mean_squared_error(df_base.iloc[:,i+1], df_base.iloc[:,j+1]))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"4754200b6e563ebb53915e507664e1fa825a3117"},"cell_type":"code","source":"#SOLUTION = MEAN OF COLUMNS\ndf_base['target'] = df_base.iloc[:,1:].mean(axis=1)\ndf_base[['card_id','target']].to_csv(\"Bestoutput.csv\",index=False)","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"fa9bcab568e84012066afef836f127150fdcbc34"},"cell_type":"markdown","source":"# We have take less correlation columns to blend data"},{"metadata":{"trusted":true,"_uuid":"df6907a1123f78fc33e79c38796d856fe879ba14"},"cell_type":"code","source":"df_base14 = p.read_csv('../input/simple-lightgbm-without-blending/submission.csv',names=[\"card_id\",\"target14\"], skiprows=[0],header=None)\n# df_base5 = p.read_csv('../input/elo-blending/3.70.csv',names=[\"card_id\",\"target5\"], skiprows=[0],header=None)\ndf_base6 = p.read_csv('../input/elo-blending/3.701.csv',names=[\"card_id\",\"target6\"], skiprows=[0],header=None)\ndf_base7 = p.read_csv('../input/elo-blending/3.702.csv',names=[\"card_id\",\"target7\"], skiprows=[0],header=None)\n# df_base8 = p.read_csv('../input/elo-blending/3.703.csv',names=[\"card_id\",\"target8\"], skiprows=[0],header=None)\n\ndf_base = p.merge(df_base12,df_base6,how='inner',on='card_id')\n# df_base = p.merge(df_base,df_base5,how='inner',on='card_id')\ndf_base = p.merge(df_base,df_base7,how='inner',on='card_id')\n# df_base = p.merge(df_base,df_base7,how='inner',on='card_id')\n# df_base = p.merge(df_base,df_base8,how='inner',on='card_id')\n#CORRELATION MATRIX (Pearson Correlation to measure how similar are 2 solutions)\nplt.figure(figsize=(16,12))\nsns.heatmap(df_base.iloc[:,1:].corr(),annot=True,fmt=\".2f\")","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"b70be6a4f21afc22153e4cf3dfbe06d77a333976"},"cell_type":"code","source":"# ALTERNATIVE WAY - RMSE MATRIX (RMSE to measure how similar are 2 solutions)\nM = np.zeros([df_base.iloc[:,1:].shape[1],df_base.iloc[:,1:].shape[1]])\nfor i in np.arange(M.shape[1]):\n    for j in np.arange(M.shape[1]):\n        M[i,j] = sqrt(metrics.mean_squared_error(df_base.iloc[:,i+1], df_base.iloc[:,j+1]))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"8d4bbec1d04bf4216cf6bb88bd3ce1c0c8071b2b"},"cell_type":"code","source":"#SOLUTION = MEAN OF COLUMNS\ndf_base['target'] = df_base.iloc[:,1:].mean(axis=1)\ndf_base[['card_id','target']].to_csv(\"blend2.csv\",index=False)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"63f798c3b557d7b5c81c67660ccfc3e40358e5d7"},"cell_type":"code","source":"df_base['target'] = df2['target']* 0.3 + df_base['target'] * 0.7\n\nplt.figure(figsize=(8,8))\nplt.subplot(1, 2, 1)\nsns.boxplot(df2['target'],orient='v')\n\nplt.subplot(1, 2, 2)\nsns.boxplot(df_base['target'], orient='v')\nplt.show()\n# df_base[['card_id','target']].to_csv(\"blend3.csv\",index=False)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"92552352063aecc8090c333263ffb88fc5822de6"},"cell_type":"code","source":"from scipy.stats import truncnorm","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"7c50373632b435aeb865ebc80e2d0356ea270772"},"cell_type":"code","source":"df_base['target'] = truncnorm.mean(df2['target'],df_base['target'])\ndf_base[['card_id','target']].to_csv(\"blend3.csv\",index=False)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"4ab5d53e0cebadc59669673897834677160cbc07"},"cell_type":"code","source":"display(df_base['target'].head())\nplt.figure(figsize=(15,8))\nsns.boxplot(df_base['target'], orient='h')\nplt.show()","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"name":"python","version":"3.6.6","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat":4,"nbformat_minor":1}