{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.10.12","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":81933,"databundleVersionId":9643020,"sourceType":"competition"}],"dockerImageVersionId":30822,"isInternetEnabled":false,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# Import necessary libraries\nimport pandas as pd\nimport numpy as np\nfrom xgboost import XGBRegressor\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.metrics import mean_squared_error, r2_score\nfrom sklearn.preprocessing import StandardScaler\n\n# Load the data\ntrain_data = pd.read_csv('/kaggle/input/child-mind-institute-problematic-internet-use/train.csv')\ntest_data = pd.read_csv('/kaggle/input/child-mind-institute-problematic-internet-use/test.csv')\n\n# Replace inf values with NaN in the dataset\ntrain_data.replace([np.inf, -np.inf], np.nan, inplace=True)\ntest_data.replace([np.inf, -np.inf], np.nan, inplace=True)\n\n# Data Cleaning\nnumeric_columns = train_data.select_dtypes(include=['float64', 'int64']).columns\ncategorical_columns = train_data.select_dtypes(include=['object']).columns\n\n# Fill missing values\ntrain_data[numeric_columns] = train_data[numeric_columns].fillna(train_data[numeric_columns].mean())\ntrain_data[categorical_columns] = train_data[categorical_columns].fillna(train_data[categorical_columns].mode().iloc[0])\n\n# Align test data columns with train data\ntest_data = test_data.reindex(columns=train_data.columns, fill_value=np.nan)\ntest_data[numeric_columns] = test_data[numeric_columns].fillna(train_data[numeric_columns].mean())\ntest_data[categorical_columns] = test_data[categorical_columns].fillna(train_data[categorical_columns].mode().iloc[0])\n\n# Separate features and target variable\nX = train_data.drop(columns=['PCIAT-PCIAT_Total', 'id'], errors='ignore')\ny = train_data['PCIAT-PCIAT_Total']\n\n# Perform one-hot encoding for categorical variables\nX = pd.get_dummies(X, drop_first=True)\ntest_data = pd.get_dummies(test_data, drop_first=True)\n\n# Align columns between train and test data\nmissing_cols = set(X.columns) - set(test_data.columns)\nfor col in missing_cols:\n    test_data[col] = 0\ntest_data = test_data[X.columns]\n\n# Normalize data using StandardScaler\nscaler = StandardScaler()\nX = scaler.fit_transform(X)\ntest_data = scaler.transform(test_data)\n\n# Split data into training and validation sets\nX_train, X_val, y_train, y_val = train_test_split(X, y, test_size=0.2, random_state=42)\n\n# Parameter tuning and comparison\nparam_grid = [\n    {'n_estimators': 100, 'learning_rate': 0.1, 'max_depth': 3, 'subsample': 0.7, 'colsample_bytree': 0.7, 'min_child_weight': 1},\n    {'n_estimators': 200, 'learning_rate': 0.05, 'max_depth': 5, 'subsample': 0.8, 'colsample_bytree': 0.8, 'min_child_weight': 3},\n    {'n_estimators': 300, 'learning_rate': 0.01, 'max_depth': 7, 'subsample': 1.0, 'colsample_bytree': 0.7, 'min_child_weight': 5},\n]\n\nresults = []\n\n# Train and evaluate models with different parameter combinations\nfor params in param_grid:\n    model = XGBRegressor(random_state=42, **params)\n    model.fit(X_train, y_train)\n    y_val_pred = model.predict(X_val)\n    mse = mean_squared_error(y_val, y_val_pred)\n    r2 = r2_score(y_val, y_val_pred)\n    results.append({'params': params, 'mse': mse, 'r2': r2})\n\n# Output results for parameter comparison\nfor i, res in enumerate(results):\n    print(f\"Model {i+1} Parameters: {res['params']}\")\n    print(f\"Validation MSE: {res['mse']:.4f}, R²: {res['r2']:.4f}\")\n    print(\"-\" * 40)\n\n# Select the best model (based on lowest MSE)\nbest_model_idx = np.argmin([res['mse'] for res in results])\nbest_params = results[best_model_idx]['params']\n\nprint(f\"Best Parameters: {best_params}\")\n\n# Train the best model\nbest_model = XGBRegressor(random_state=42, **best_params)\nbest_model.fit(X_train, y_train)\ny_val_pred_best = best_model.predict(X_val)\n\n# Final evaluation\nprint(\"Best Model Validation MSE:\", mean_squared_error(y_val, y_val_pred_best))\nprint(\"Best Model Validation R-squared:\", r2_score(y_val, y_val_pred_best))\n\n# Predict on test data\ntest_predictions = best_model.predict(test_data)\n\n# Scale predictions to [0, 3]\nmin_pred = test_predictions.min()\nmax_pred = test_predictions.max()\nscaled_predictions = np.round(3 * (test_predictions - min_pred) / (max_pred - min_pred)).astype(int)\nscaled_predictions = np.clip(scaled_predictions, 0, 3)\n\n# Generate the submission file\noriginal_test_data = pd.read_csv('/kaggle/input/child-mind-institute-problematic-internet-use/test.csv')\nsubmission = pd.DataFrame({\n    'id': original_test_data['id'],\n    'sii': scaled_predictions\n})\n\n# Save the submission file\nsubmission.to_csv('submission.csv', index=False)\nprint(\"Submission file saved as 'submission.csv'.\")","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true,"execution":{"iopub.status.busy":"2024-12-24T09:48:29.588615Z","iopub.execute_input":"2024-12-24T09:48:29.589037Z","iopub.status.idle":"2024-12-24T09:48:31.933062Z","shell.execute_reply.started":"2024-12-24T09:48:29.589007Z","shell.execute_reply":"2024-12-24T09:48:31.931642Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"","metadata":{"trusted":true},"outputs":[],"execution_count":null}]}