{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","execution":{"iopub.status.busy":"2022-07-20T14:57:53.396771Z","iopub.execute_input":"2022-07-20T14:57:53.397186Z","iopub.status.idle":"2022-07-20T14:57:53.406507Z","shell.execute_reply.started":"2022-07-20T14:57:53.397133Z","shell.execute_reply":"2022-07-20T14:57:53.405307Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import pandas as pd\n\nfrom sklearn.preprocessing import LabelEncoder\nfrom xgboost import XGBRFRegressor \nimport xgboost\n\nimport numpy as np\nfrom sklearn.impute import SimpleImputer\nfrom numpy.random import seed\nseed(0)\n\nfrom sklearn.cluster import KMeans\nkmeans = KMeans(n_clusters=4)\n\nle = LabelEncoder()\n\ndf = pd.read_csv('../input/house-prices-advanced-regression-techniques/train.csv').set_index('Id')\n\n\n\n\ncat = df.select_dtypes(\"object\")\n\nfor col in cat:\n   df[col] = le.fit_transform(df[col])\n\nnum = df.select_dtypes(\"number\")\ncorr1=[]\nfor col in num:\n corr=abs(df['SalePrice'].corr(df[col]))\n corr1.append(corr)\n \n \ncorr = pd.Series(corr1, name=\"corr Scores\", index=df.columns)\ncorr = corr.sort_values(ascending=False)\nprint(corr)\nf1=corr.index[corr < 0.05].tolist()\n\n\n\n\nu=df.isnull().sum()/len(df)\nf2=u.index[ u> 0].tolist()\n\nX=df.drop(f2,axis=1)\n\n\nkmeans.fit_predict(X)\n\n\n\n\nx=df.drop('SalePrice',axis=1)\ny=df['SalePrice']\nx=x.drop(f1,axis=1)\n\n\n\n\n\nfrom sklearn.model_selection import train_test_split\n\nX_train, X_test, y_train, y_test = train_test_split(x, y, test_size=0.3)\n\nim = SimpleImputer(missing_values=np.nan,strategy='most_frequent')\nim.fit(X_train)\nX_train = im.transform(X_train)\nX_test = im.transform(X_test)\n\n\n\nfrom sklearn.preprocessing import StandardScaler\nsc = StandardScaler()\nX_train= sc.fit_transform(X_train)\nX_test = sc.fit_transform(X_test)\n\n\n\n                \nmodel = XGBRFRegressor(n_estimators=800,max_depth=20)\n\n\n\n\n             \nmodel.fit(X_train, y_train)\ny_pred = model.predict(X_test)\n \nimport sklearn.metrics as sm\nprint(\"R2 score =\", round(sm.r2_score(y_test, y_pred), 2))\nfrom sklearn.metrics import mean_squared_error\nprint(mean_squared_error(y_test,y_pred))\n\n\ndf1 = pd.read_csv('../input/house-prices-advanced-regression-techniques/test.csv').set_index('Id')\n\nprint(df1.shape)\n\n\n\n\nfor col in cat:\n   df1[col] = le.fit_transform(df1[col])\n\n\nu1=df1.isnull().sum()/len(df1)\nf3=u1.index[ u1> 0].tolist()\n\nX1=df1.drop(f3,axis=1)\nkmeans.fit_predict(X1)\n\nx1=df1.drop(f1,axis=1)\n\nim.fit(x1)\nx1 = im.transform(x1)\nx1= sc.fit_transform(x1)\n\ndf_subm=pd.read_csv('../input/house-prices-advanced-regression-techniques/sample_submission.csv')\nsubm = model.predict(x1)\ndf_subm[\"SalePrice\"]= subm\n\ndf_subm.to_csv('submission.csv', index=False)\nprint(df_subm[:50].set_index('Id'))","metadata":{"execution":{"iopub.status.busy":"2022-07-20T14:57:53.427109Z","iopub.execute_input":"2022-07-20T14:57:53.428093Z","iopub.status.idle":"2022-07-20T14:58:09.332972Z","shell.execute_reply.started":"2022-07-20T14:57:53.428035Z","shell.execute_reply":"2022-07-20T14:58:09.332053Z"},"trusted":true},"execution_count":null,"outputs":[]}]}