{"metadata":{"colab":{"provenance":[],"authorship_tag":"ABX9TyNlCkYEk1eVFaLKYS2nY6z9"},"kernelspec":{"name":"python3","display_name":"Python 3","language":"python"},"language_info":{"name":"python","version":"3.10.14","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":81933,"databundleVersionId":9643020,"sourceType":"competition"},{"sourceId":9505588,"sourceType":"datasetVersion","datasetId":5785458},{"sourceId":9505610,"sourceType":"datasetVersion","datasetId":5785477},{"sourceId":9506214,"sourceType":"datasetVersion","datasetId":5785903}],"dockerImageVersionId":30775,"isInternetEnabled":false,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"#fix it in here-!pip install --upgrade --force-reinstall --no-deps kaggle >> log  # upgrade kaggle package (to avoid a warning)\n!cp /kaggle/input/kjason/kaggle.json ~/.kaggle/kaggle.json >> log  \n!cp /kaggle.json ~/.kaggle/kaggle.json >>log  # First, download kaggle.json from kaggle.com (in Account page) and place it in the root of mounted Google Drive\n!cp kaggle.json ~/.kaggle/kaggle.json >> log                   # Alternative location of kaggle.json (without a connection to Google Drive)\n!chmod 600 ~/.kaggle/kaggle.json                              # give only the owner full read/write access to kaggle.json\n!kaggle config set -n competition -v child-mind-institute-problematic-internet-use        # set the competition context for the next few kaggle API calls. !kaggle config view - shows current settings\n!kaggle competitions download >> log                          # download competition dataset as a zip file\n!unzip -o *.zip >> log                                        # Kaggle dataset is copied as a single file and needs to be unzipped.\n!kaggle competitions leaderboard --show","metadata":{"id":"kwcm-p5XG3IY","executionInfo":{"status":"ok","timestamp":1727568640232,"user_tz":240,"elapsed":48557,"user":{"displayName":"Funmilola Akeju","userId":"16061302661469727427"}},"outputId":"4bc2a503-d083-4cdb-876d-f31ec8f68af4","execution":{"iopub.status.busy":"2024-09-30T17:30:22.576242Z","iopub.execute_input":"2024-09-30T17:30:22.576683Z","iopub.status.idle":"2024-09-30T17:34:32.284944Z","shell.execute_reply.started":"2024-09-30T17:30:22.576641Z","shell.execute_reply":"2024-09-30T17:34:32.282965Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"                     # print public leaderboard# Import necessary libraries for data analysis and visualization\nimport numpy as np  # Useful for numerical operations\nimport pandas as pd  # For data manipulation and analysis\nimport os  # For directory and file operations\nimport matplotlib.pyplot as plt  # For data visualization\nimport seaborn as sns  # For advanced visualizations\n\n# Display the files in the Kaggle input directory to understand the available data\nfor dirpath, _, files in os.walk('/kaggle/input'):\n    for file_name in files:\n        print(f\"Located file: {os.path.join(dirpath, file_name)}\")\n\n# Load training, testing, and sample submission datasets\ntrain_df = pd.read_csv('/kaggle/input/internett/train.csv')\ntest_df = pd.read_csv('/kaggle/input/internett/test.csv')\nsample_submission = pd.read_csv('/kaggle/input/internett/sample_submission.csv')\n\n# Display basic information about the datasets\nprint(f\"Training Data Shape: {train_df.shape}\")\nprint(f\"Testing Data Shape: {test_df.shape}\")\nprint(f\"Sample Submission Shape: {sample_submission.shape}\")","metadata":{"id":"3vqY8u-4HiVQ","executionInfo":{"status":"ok","timestamp":1727569523127,"user_tz":240,"elapsed":444,"user":{"displayName":"Funmilola Akeju","userId":"16061302661469727427"}},"outputId":"e3f30f6e-cd86-4bfd-aab3-a9fee5a103bb","execution":{"iopub.status.busy":"2024-09-30T16:53:30.228554Z","iopub.execute_input":"2024-09-30T16:53:30.229018Z","iopub.status.idle":"2024-09-30T16:53:34.903126Z","shell.execute_reply.started":"2024-09-30T16:53:30.228977Z","shell.execute_reply":"2024-09-30T16:53:34.901952Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import numpy as np\nimport pandas as pd\nimport os\nfrom sklearn.impute import SimpleImputer\nfrom sklearn.metrics import cohen_kappa_score\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.preprocessing import OneHotEncoder\nimport xgboost as xgb\n\n# As a simple approach:\n# - Only use labeled tabular data for now.\n# - Ignore parquet data.\n# - Ignore PCIAT columns which don't exist in test set (these are directly used to calculate sii, so we could consider them as intermediate targets to predict)\n# - One-hot encode strings.\n# - Impute missing numbers as mean of that feature. This includes string one-hot encodings for now.\n# - Avoid further prep by using XGBoost as model\n# - Use simple set-aside test set for local evaluation. Do not tune hyperparameters yet.\n\ndf_train = pd.read_csv('/kaggle/input/child-mind-institute-problematic-internet-use/train.csv')\ndf_test = pd.read_csv('/kaggle/input/child-mind-institute-problematic-internet-use/test.csv')\n\ndf_train = df_train.drop(columns=df_train.filter(like='PCIAT').columns)\ndf_train = df_train.drop(columns=['id'], axis=1)\ndf_train_unlabeled = df_train.query('sii!=sii') # TODO - determine what to do with this. Clustering?\ndf_train_labeled = df_train.query('sii==sii')\nX_train_labeled, Y_train_labeled = df_train_labeled.drop('sii', axis=1), df_train_labeled['sii']\n\ndf_test, index_test = df_test.drop(columns=['id'], axis=1), df_test['id']\n\n# Do not use unlabeled data for now.\ntX, vX, tY, vY = train_test_split(X_train_labeled, Y_train_labeled, test_size=0.2, random_state=42)\n\nstring_encoder = OneHotEncoder(drop=None, handle_unknown='ignore')\ntX = string_encoder.fit_transform(tX)\nvX = string_encoder.transform(vX)\ndf_test = string_encoder.transform(df_test)\n\nnumeric_imputer = SimpleImputer(missing_values=np.nan, strategy='mean', copy=True)\ntX = numeric_imputer.fit_transform(tX)\nvX = numeric_imputer.transform(vX)\ndf_test = numeric_imputer.transform(df_test)\n\nmodel = xgb.XGBClassifier(tree_method=\"hist\")\nmodel.fit(tX, tY)\nvY_pred = model.predict(vX)\ntestY_pred = model.predict(df_test)\n\nprint(cohen_kappa_score(vY, vY_pred, weights='quadratic'))\n\npY = pd.DataFrame(testY_pred, index=index_test, columns=['sii'])\npY.astype(int).to_csv('submission.csv', index_label='id')","metadata":{"id":"enLkGb8qK3fe","executionInfo":{"status":"ok","timestamp":1727569564161,"user_tz":240,"elapsed":2181,"user":{"displayName":"Funmilola Akeju","userId":"16061302661469727427"}},"outputId":"274e3e50-4847-4519-de79-1fcfaea6b819","execution":{"iopub.status.busy":"2024-10-05T16:57:05.978622Z","iopub.execute_input":"2024-10-05T16:57:05.979075Z","iopub.status.idle":"2024-10-05T16:57:13.539914Z","shell.execute_reply.started":"2024-10-05T16:57:05.979035Z","shell.execute_reply":"2024-10-05T16:57:13.538910Z"},"trusted":true},"execution_count":null,"outputs":[]}]}