{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\nimport matplotlib.pyplot as plt\n\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","execution":{"iopub.status.busy":"2022-07-10T12:27:41.951442Z","iopub.execute_input":"2022-07-10T12:27:41.952040Z","iopub.status.idle":"2022-07-10T12:27:41.962978Z","shell.execute_reply.started":"2022-07-10T12:27:41.952009Z","shell.execute_reply":"2022-07-10T12:27:41.961665Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"data_df = train_set = pd.read_csv('../input/tabular-playground-series-jul-2022/data.csv',index_col=0)\n\n#check for missing values\nassert data_df.isna().sum().sum() == 0","metadata":{"execution":{"iopub.status.busy":"2022-07-10T12:27:44.062311Z","iopub.execute_input":"2022-07-10T12:27:44.062696Z","iopub.status.idle":"2022-07-10T12:27:44.511926Z","shell.execute_reply.started":"2022-07-10T12:27:44.062666Z","shell.execute_reply":"2022-07-10T12:27:44.511285Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"data_df1 = data_df.copy()\n\nfrom sklearn.preprocessing import StandardScaler\n\nsc = StandardScaler()\ndata_df1[data_df1.columns] = sc.fit_transform(data_df1[data_df1.columns])\n\n\nfrom sklearn.cluster import MiniBatchKMeans\n\ndata_dict = {}\n\nfor i in range(2,67,5):\n    kmeans = MiniBatchKMeans(i)\n    kmeans.fit(data_df1)\n    data_dict[i] = kmeans.inertia_\n    \nX = list(data_dict.keys())\ny = list(data_dict.values())\nplt.plot(X,y)\nplt.xticks(X)\nplt.title(\"Cluster Vs Distortion\")\nplt.xlabel(\"# Clusters\")\nplt.ylabel(\"Distortion\")\nplt.axvline(12, c='r', linestyle='--')","metadata":{"execution":{"iopub.status.busy":"2022-07-10T13:25:01.149086Z","iopub.execute_input":"2022-07-10T13:25:01.149481Z","iopub.status.idle":"2022-07-10T13:25:01.307426Z","shell.execute_reply.started":"2022-07-10T13:25:01.149451Z","shell.execute_reply":"2022-07-10T13:25:01.305790Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"kmeans = MiniBatchKMeans(12)\nkmeans.fit(data_df1)\n\nsubmission_df = pd.DataFrame({'id':data_df1.index,'Predicted':kmeans.labels_})\nsubmission_df.to_csv('submission.csv', index=False)","metadata":{"execution":{"iopub.status.busy":"2022-07-10T13:31:07.787460Z","iopub.execute_input":"2022-07-10T13:31:07.787800Z","iopub.status.idle":"2022-07-10T13:31:08.336247Z","shell.execute_reply.started":"2022-07-10T13:31:07.787776Z","shell.execute_reply":"2022-07-10T13:31:08.335485Z"},"trusted":true},"execution_count":null,"outputs":[]}]}