{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.10.12","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":81933,"databundleVersionId":9643020,"sourceType":"competition"}],"dockerImageVersionId":30822,"isInternetEnabled":false,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import os\nimport numpy as np\nimport pandas as pd\nimport matplotlib.pyplot as plt\n\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.ensemble import RandomForestClassifier\nfrom sklearn.preprocessing import StandardScaler\nfrom sklearn.decomposition import PCA\nfrom sklearn.metrics import classification_report, confusion_matrix\nfrom sklearn.impute import KNNImputer\n\nimport seaborn as sns","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:47.913310Z","iopub.execute_input":"2024-12-21T08:30:47.913735Z","iopub.status.idle":"2024-12-21T08:30:49.991359Z","shell.execute_reply.started":"2024-12-21T08:30:47.913699Z","shell.execute_reply":"2024-12-21T08:30:49.989805Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"# Read Dataset","metadata":{}},{"cell_type":"code","source":"train = pd.read_csv(\"/kaggle/input/child-mind-institute-problematic-internet-use/train.csv\")\ntest = pd.read_csv(\"/kaggle/input/child-mind-institute-problematic-internet-use/test.csv\")\nprint(\"train size: {}, test size: {}\".format(train.shape, test.shape))\n\ntrain_id = train['id']\ntest_id = test['id']\n\ntrain.head()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:49.993242Z","iopub.execute_input":"2024-12-21T08:30:49.993774Z","iopub.status.idle":"2024-12-21T08:30:50.131025Z","shell.execute_reply.started":"2024-12-21T08:30:49.993738Z","shell.execute_reply":"2024-12-21T08:30:50.129960Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"train.info()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:50.133195Z","iopub.execute_input":"2024-12-21T08:30:50.133542Z","iopub.status.idle":"2024-12-21T08:30:50.167094Z","shell.execute_reply.started":"2024-12-21T08:30:50.133512Z","shell.execute_reply":"2024-12-21T08:30:50.165742Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"test.info()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:50.168894Z","iopub.execute_input":"2024-12-21T08:30:50.169252Z","iopub.status.idle":"2024-12-21T08:30:50.184014Z","shell.execute_reply.started":"2024-12-21T08:30:50.169204Z","shell.execute_reply":"2024-12-21T08:30:50.182633Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"# Preprocess Dataset","metadata":{}},{"cell_type":"markdown","source":"## Remove data in train that do not have sii","metadata":{}},{"cell_type":"code","source":"# Remove data in train that do not have sii\ntrain = train.dropna(subset=['sii'])\ntarget = train['sii']\n\nprint(train.shape, target.shape)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:50.185170Z","iopub.execute_input":"2024-12-21T08:30:50.185475Z","iopub.status.idle":"2024-12-21T08:30:50.214258Z","shell.execute_reply.started":"2024-12-21T08:30:50.185436Z","shell.execute_reply":"2024-12-21T08:30:50.212972Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## Find and remove data that exist in train but not in test","metadata":{}},{"cell_type":"code","source":"# Look for columns than do not exist in test and remove columns in train\ntest_missing_columns = set(train.columns) - set(test.columns)\nprint(test_missing_columns)\n\nfor column in test_missing_columns:\n    train.drop(columns=column, inplace=True)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:50.215463Z","iopub.execute_input":"2024-12-21T08:30:50.215959Z","iopub.status.idle":"2024-12-21T08:30:50.261071Z","shell.execute_reply.started":"2024-12-21T08:30:50.215907Z","shell.execute_reply":"2024-12-21T08:30:50.259895Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## Remove columns that have large percentage of missing data","metadata":{}},{"cell_type":"code","source":"# Remove columns that have less than threshold of avaliable data\nthreshold = 40\n\ntrain_non_missing = train.notnull().mean() * 100\ntest_non_missing = test.notnull().mean() * 100\n\ncolumns_to_keep = list(train_non_missing[(train_non_missing >= threshold) & (test_non_missing >= threshold)].index)\n\nprint(columns_to_keep)\n\ntrain = train[columns_to_keep]\ntest = test[columns_to_keep]","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:50.262606Z","iopub.execute_input":"2024-12-21T08:30:50.262932Z","iopub.status.idle":"2024-12-21T08:30:50.279167Z","shell.execute_reply.started":"2024-12-21T08:30:50.262890Z","shell.execute_reply":"2024-12-21T08:30:50.277604Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## Map data contain season to number","metadata":{}},{"cell_type":"code","source":"# Map season(Spring, Summer, Fall, Winter) to number\nseason_mapping = {\n    'Spring': 0,\n    'Summer': 1,\n    'Fall': 2,\n    'Winter': 3\n}\ntrain = train.replace(season_mapping)\ntest = test.replace(season_mapping)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:50.280514Z","iopub.execute_input":"2024-12-21T08:30:50.281319Z","iopub.status.idle":"2024-12-21T08:30:50.322889Z","shell.execute_reply.started":"2024-12-21T08:30:50.281253Z","shell.execute_reply":"2024-12-21T08:30:50.321533Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## Fill Na data","metadata":{}},{"cell_type":"code","source":"# Fill with 0\ntrain_na_0 = train.fillna(0)\ntrain_na_0 = train_na_0.replace(season_mapping)\n\n# # Fill with mean of columns\n# train_numeric_cols = train.select_dtypes(include=['number']).columns\n# test_numeric_cols = test.select_dtypes(include=['number']).columns\n# train_mean = train\n# test_mean = test\n# train_mean[train_numeric_cols] = train[train_numeric_cols].fillna(train[train_numeric_cols].mean())\n# test_mean[test_numeric_cols] = test[test_numeric_cols].fillna(test[test_numeric_cols].mean())\n\n\n# train_mean = train_mean.replace(season_mapping)\n# test_mean = test_mean.replace(season_mapping)\n# train_mean = train_mean.fillna(0)\n# test_mean = test_mean.fillna(0)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:50.327544Z","iopub.execute_input":"2024-12-21T08:30:50.327973Z","iopub.status.idle":"2024-12-21T08:30:50.337775Z","shell.execute_reply.started":"2024-12-21T08:30:50.327941Z","shell.execute_reply":"2024-12-21T08:30:50.336219Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Fill with KNN Imputer\nimputer = KNNImputer(n_neighbors=4)  # k=4\nimputed_train_data = imputer.fit_transform(train.drop(columns='id'))\nimputed_test_data = imputer.fit_transform(test.drop(columns='id'))\n\ntrain_knn = pd.DataFrame(imputed_train_data, columns=train.drop(columns='id').columns)\ntest_knn = pd.DataFrame(imputed_test_data, columns=test.drop(columns='id').columns)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:50.339204Z","iopub.execute_input":"2024-12-21T08:30:50.339506Z","iopub.status.idle":"2024-12-21T08:30:52.405579Z","shell.execute_reply.started":"2024-12-21T08:30:50.339479Z","shell.execute_reply":"2024-12-21T08:30:52.404444Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## Correlation Matrix","metadata":{}},{"cell_type":"code","source":"train_no_id = train_na_0.drop(columns='id')\ncorrelation_matrix = train_no_id.corr()\n# Plot the heatmap\nplt.figure(figsize=(30, 30))\nsns.heatmap(correlation_matrix, annot=True, fmt='.1f', cmap='coolwarm', square=True)\nplt.title('Correlation Heatmap')\nplt.show()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:52.406966Z","iopub.execute_input":"2024-12-21T08:30:52.407398Z","iopub.status.idle":"2024-12-21T08:30:57.546326Z","shell.execute_reply.started":"2024-12-21T08:30:52.407356Z","shell.execute_reply":"2024-12-21T08:30:57.545033Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"# Models","metadata":{}},{"cell_type":"code","source":"# X_train = train_mean.drop(columns=['id', 'Basic_Demos-Enroll_Season', 'FGC-FGC_SRL_Zone', 'FGC-FGC_SRR_Zone','BIA-BIA_BMC', 'BIA-BIA_Fat'])\n# X_test = test_mean.drop(columns=['id', 'Basic_Demos-Enroll_Season', 'FGC-FGC_SRL_Zone', 'FGC-FGC_SRR_Zone','BIA-BIA_BMC', 'BIA-BIA_Fat'])\n\n# X_train = train_mean.drop(columns=['id'])\n# X_test = test_mean.drop(columns=['id'])\n\nX_train = train_knn\nX_test = test_knn\n\ny_train = target","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:57.547525Z","iopub.execute_input":"2024-12-21T08:30:57.547808Z","iopub.status.idle":"2024-12-21T08:30:57.552564Z","shell.execute_reply.started":"2024-12-21T08:30:57.547783Z","shell.execute_reply":"2024-12-21T08:30:57.551366Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"X_train = np.array(X_train)\ny_train = np.array(y_train)\n\nX_test = np.array(X_test)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:57.553842Z","iopub.execute_input":"2024-12-21T08:30:57.554190Z","iopub.status.idle":"2024-12-21T08:30:57.589609Z","shell.execute_reply.started":"2024-12-21T08:30:57.554154Z","shell.execute_reply":"2024-12-21T08:30:57.588460Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Split dataset\nX_t_train, X_t_test, y_t_train, y_t_test = train_test_split(X_train, y_train, test_size=0.3, random_state=42)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:57.590670Z","iopub.execute_input":"2024-12-21T08:30:57.591141Z","iopub.status.idle":"2024-12-21T08:30:57.615880Z","shell.execute_reply.started":"2024-12-21T08:30:57.591094Z","shell.execute_reply":"2024-12-21T08:30:57.614242Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Feature Scaling\nscaler = StandardScaler()\nX_train_scaled = scaler.fit_transform(X_train)\nX_test_scaled = scaler.transform(X_test)\n\nX_t_train_scaled = scaler.fit_transform(X_t_train)\nX_t_test_scaled = scaler.fit_transform(X_t_test)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:57.617172Z","iopub.execute_input":"2024-12-21T08:30:57.617506Z","iopub.status.idle":"2024-12-21T08:30:57.643420Z","shell.execute_reply.started":"2024-12-21T08:30:57.617466Z","shell.execute_reply":"2024-12-21T08:30:57.642150Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Apply PCA\npca = PCA(n_components=0.95)  # Keep 95% of the variance\nX_train_pca = pca.fit_transform(X_train_scaled)\nX_test_pca = pca.transform(X_test_scaled)\n\nX_t_train_pca = pca.fit_transform(X_t_train)\nX_t_test_pca = pca.fit_transform(X_t_test)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:57.644902Z","iopub.execute_input":"2024-12-21T08:30:57.645277Z","iopub.status.idle":"2024-12-21T08:30:57.704605Z","shell.execute_reply.started":"2024-12-21T08:30:57.645244Z","shell.execute_reply":"2024-12-21T08:30:57.703620Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Random Forest\nmodel = RandomForestClassifier(random_state=80)\nmodel.fit(X_train_pca, y_train)\n\nrf_model = RandomForestClassifier(random_state=80)\nrf_model.fit(X_t_train_pca, y_t_train)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:57.705376Z","iopub.execute_input":"2024-12-21T08:30:57.705700Z","iopub.status.idle":"2024-12-21T08:30:59.534756Z","shell.execute_reply.started":"2024-12-21T08:30:57.705670Z","shell.execute_reply":"2024-12-21T08:30:59.533617Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"# Model Evaluation","metadata":{}},{"cell_type":"code","source":"y_pred = rf_model.predict(X_t_test_pca)\n\nprint(classification_report(y_t_test, y_pred))","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:30:59.535705Z","iopub.execute_input":"2024-12-21T08:30:59.535980Z","iopub.status.idle":"2024-12-21T08:30:59.575239Z","shell.execute_reply.started":"2024-12-21T08:30:59.535957Z","shell.execute_reply":"2024-12-21T08:30:59.574175Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"# Create submission","metadata":{}},{"cell_type":"code","source":"y_pred = model.predict(X_test_pca)\n\nsubmission = pd.DataFrame({\n    'id'  : test_id,\n    'sii' : y_pred\n})\n\n# Save to CSV file\nsubmission.to_csv('submission.csv', index=False)\nsubmission","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-21T08:31:18.727008Z","iopub.execute_input":"2024-12-21T08:31:18.727376Z","iopub.status.idle":"2024-12-21T08:31:18.752924Z","shell.execute_reply.started":"2024-12-21T08:31:18.727348Z","shell.execute_reply":"2024-12-21T08:31:18.751420Z"}},"outputs":[],"execution_count":null}]}