{"metadata":{"kernelspec":{"name":"python3","display_name":"Python 3","language":"python"},"language_info":{"name":"python","version":"3.10.14","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"colab":{"provenance":[],"authorship_tag":"ABX9TyMFeEzZXtTgqWi6/00o0BOw"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":81933,"databundleVersionId":9643020,"sourceType":"competition"}],"dockerImageVersionId":30804,"isInternetEnabled":false,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# Import \nimport numpy as np\nimport pandas as pd\nimport matplotlib.pyplot as plt\nimport seaborn as sns\nimport random\nimport os\nfrom tqdm import tqdm\nfrom sklearn.preprocessing import StandardScaler\nfrom sklearn.metrics import cohen_kappa_score\nfrom sklearn.ensemble import GradientBoostingRegressor\nfrom xgboost import XGBRegressor\nfrom catboost import CatBoostRegressor\nfrom sklearn.metrics import make_scorer\nfrom scipy.optimize import minimize\nfrom sklearn.model_selection import KFold\nimport random\nimport torch\nfrom concurrent.futures import ThreadPoolExecutor\nimport torch.nn as nn\nimport torch.optim as optim","metadata":{"id":"DnWrDjFNhifP","executionInfo":{"status":"ok","timestamp":1733802531878,"user_tz":-420,"elapsed":21051,"user":{"displayName":"Nguyên Nguyễn Khôi","userId":"07606726277784151804"}},"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:35.764584Z","iopub.execute_input":"2024-12-18T16:32:35.765069Z","iopub.status.idle":"2024-12-18T16:32:35.776429Z","shell.execute_reply.started":"2024-12-18T16:32:35.765006Z","shell.execute_reply":"2024-12-18T16:32:35.774065Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"\"\"\"\nSeed for reproducibility. This ensures that the training and\ntesting process produce the same results when they are rerun.\n\"\"\" \ndef seed_everything(seed):\n    random.seed(seed)\n    os.environ['PYTHONHASHSEED'] = str(seed)\n    np.random.seed(seed)\n    torch.manual_seed(seed)\n    torch.cuda.manual_seed(seed)\n    torch.backends.cudnn.deterministic = True\n    torch.backends.cudnn.benchmark = True\nseed_everything(2024)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:35.779468Z","iopub.execute_input":"2024-12-18T16:32:35.779953Z","iopub.status.idle":"2024-12-18T16:32:35.800168Z","shell.execute_reply.started":"2024-12-18T16:32:35.779915Z","shell.execute_reply":"2024-12-18T16:32:35.797830Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Load csv files\ndf_train = pd.read_csv(\"/kaggle/input/child-mind-institute-problematic-internet-use/train.csv\")\ndf_test = pd.read_csv(\"/kaggle/input/child-mind-institute-problematic-internet-use/test.csv\")\ndf_dictionary = pd.read_csv('/kaggle/input/child-mind-institute-problematic-internet-use/data_dictionary.csv')","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:35.801996Z","iopub.execute_input":"2024-12-18T16:32:35.802457Z","iopub.status.idle":"2024-12-18T16:32:35.877636Z","shell.execute_reply.started":"2024-12-18T16:32:35.802418Z","shell.execute_reply":"2024-12-18T16:32:35.876271Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_train","metadata":{"id":"NJa8gjZLl-nG","executionInfo":{"status":"ok","timestamp":1733663274441,"user_tz":-420,"elapsed":326,"user":{"displayName":"Nguyên Nguyễn Khôi","userId":"07606726277784151804"}},"outputId":"ddf66121-cda8-4399-cce1-d81d41379e3f","trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:35.879645Z","iopub.execute_input":"2024-12-18T16:32:35.880216Z","iopub.status.idle":"2024-12-18T16:32:35.923465Z","shell.execute_reply.started":"2024-12-18T16:32:35.880150Z","shell.execute_reply":"2024-12-18T16:32:35.922142Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Age distribution\nplt.figure(figsize=(8, 6))\nplt.hist(df_train['Basic_Demos-Age'], bins=15, color='skyblue', edgecolor='black')\nplt.title('Participants\\' Age', fontsize=16)\nplt.xlabel('Age', fontsize=12)\nplt.ylabel('Frequency', fontsize=12)\nplt.grid(axis='y', alpha=0.75)\nplt.show()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:35.926429Z","iopub.execute_input":"2024-12-18T16:32:35.926848Z","iopub.status.idle":"2024-12-18T16:32:36.243669Z","shell.execute_reply.started":"2024-12-18T16:32:35.926809Z","shell.execute_reply":"2024-12-18T16:32:36.242125Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Gender distribution\nplt.figure(figsize=(8, 6))\ngender_counts = df_train['Basic_Demos-Sex'].value_counts()\nplt.bar(gender_counts.index.astype(str), gender_counts.values, color=['skyblue', 'lightcoral'], edgecolor='black')\nplt.title('Gender', fontsize=16)\nplt.xlabel('0=Male, 1=Female', fontsize=12)\nplt.ylabel('Frequency', fontsize=12)\nplt.grid(axis='y', alpha=0.75)\nplt.show()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:36.245799Z","iopub.execute_input":"2024-12-18T16:32:36.246368Z","iopub.status.idle":"2024-12-18T16:32:36.707344Z","shell.execute_reply.started":"2024-12-18T16:32:36.246320Z","shell.execute_reply":"2024-12-18T16:32:36.705219Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Plot the relation between ages and problematic internet use (PIU) level\nplt.figure(figsize=(8, 6))\nsns.boxplot(x='sii', y='Basic_Demos-Age', data=df_train, palette='pastel')\nplt.title('Age and PIU level', fontsize=16)\nplt.xlabel('sii', fontsize=12)\nplt.ylabel('Age', fontsize=12)\nplt.grid(axis='y', alpha=0.75)\nplt.show()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:36.708832Z","iopub.execute_input":"2024-12-18T16:32:36.709611Z","iopub.status.idle":"2024-12-18T16:32:36.982409Z","shell.execute_reply.started":"2024-12-18T16:32:36.709551Z","shell.execute_reply":"2024-12-18T16:32:36.980908Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Plot the relation between genders and PIU level\nplt.figure(figsize=(8, 6))\ngrouped_data = df_train.groupby(['Basic_Demos-Sex', 'sii']).size().reset_index(name='Count')\nsns.barplot(x='Basic_Demos-Sex', y='Count', hue='sii', data=grouped_data, palette='Set1')\nplt.title('Gender and sii', fontsize=16)\nplt.xlabel('Gender (0=Male, 1=Female)', fontsize=12)\nplt.ylabel('Count', fontsize=12)\nplt.legend(title='sii Categories')\nplt.grid(axis='y', alpha=0.75)\nplt.show()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:36.983991Z","iopub.execute_input":"2024-12-18T16:32:36.984487Z","iopub.status.idle":"2024-12-18T16:32:37.332113Z","shell.execute_reply.started":"2024-12-18T16:32:36.984436Z","shell.execute_reply":"2024-12-18T16:32:37.330649Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Plot the relation between Physical-BMI and sii\nplt.figure(figsize=(8, 6))\nsns.boxplot(x='sii', y='Physical-BMI', data=df_train, palette='pastel')\nplt.title('Physical-BMI and sii', fontsize=16)\nplt.xlabel('sii', fontsize=12)\nplt.ylabel('Physical-BMI', fontsize=12)\nplt.grid(axis='y', alpha=0.75)\nplt.show()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:37.333933Z","iopub.execute_input":"2024-12-18T16:32:37.334465Z","iopub.status.idle":"2024-12-18T16:32:37.627749Z","shell.execute_reply.started":"2024-12-18T16:32:37.334410Z","shell.execute_reply":"2024-12-18T16:32:37.626533Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Remove samples with NaN values in 'sii' field\ndf_train = df_train.drop(df_train.loc[df_train['sii'].isnull()].index, errors='ignore')\ndf_train = df_train.reset_index(drop=True)\ndf_train","metadata":{"id":"4OmVVll6ss8v","executionInfo":{"status":"ok","timestamp":1733663280345,"user_tz":-420,"elapsed":328,"user":{"displayName":"Nguyên Nguyễn Khôi","userId":"07606726277784151804"}},"outputId":"ba99980d-b9f3-4fac-f317-9faf12a50964","trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:37.629210Z","iopub.execute_input":"2024-12-18T16:32:37.629582Z","iopub.status.idle":"2024-12-18T16:32:37.671671Z","shell.execute_reply.started":"2024-12-18T16:32:37.629547Z","shell.execute_reply":"2024-12-18T16:32:37.670273Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Remove features with the percentage of missing values > 40%\ntotal = df_train.isnull().sum().sort_values(ascending=False)\nproportion = (df_train.isnull().sum() / df_train.isnull().count()).sort_values(ascending=False)\nmissing_data = pd.concat([total, proportion], axis=1, keys=['Total', 'Percentage'])\nmissing_data[missing_data['Percentage'] > 0.4]","metadata":{"id":"lxWwAv96tylQ","executionInfo":{"status":"ok","timestamp":1733663282661,"user_tz":-420,"elapsed":316,"user":{"displayName":"Nguyên Nguyễn Khôi","userId":"07606726277784151804"}},"outputId":"cd8f6767-9850-4a8b-c08d-c413bf2502db","trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:37.673220Z","iopub.execute_input":"2024-12-18T16:32:37.673662Z","iopub.status.idle":"2024-12-18T16:32:37.707748Z","shell.execute_reply.started":"2024-12-18T16:32:37.673624Z","shell.execute_reply":"2024-12-18T16:32:37.705692Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_train = df_train.drop((missing_data[missing_data['Percentage'] > 0.4]).index, axis=1, errors='ignore')\ndf_train","metadata":{"id":"cJbmk5qVudLB","executionInfo":{"status":"ok","timestamp":1733663285828,"user_tz":-420,"elapsed":320,"user":{"displayName":"Nguyên Nguyễn Khôi","userId":"07606726277784151804"}},"outputId":"bc3a4488-c5d0-40fb-af57-dcff88ae7990","trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:37.710272Z","iopub.execute_input":"2024-12-18T16:32:37.710866Z","iopub.status.idle":"2024-12-18T16:32:37.758432Z","shell.execute_reply.started":"2024-12-18T16:32:37.710811Z","shell.execute_reply":"2024-12-18T16:32:37.756913Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Impute numerical data by KNNImputer\nfrom sklearn.impute import KNNImputer\nknn_imputer = KNNImputer(n_neighbors=5)\nnum_cols = df_train.select_dtypes(include=['float64', 'int64']).columns\ndf_train[num_cols] = knn_imputer.fit_transform(df_train[num_cols])\n\n\n# Impute categorical data by SimpleImputer\nfrom sklearn.impute import SimpleImputer\ncat_cols = df_train.select_dtypes(include=['object']).columns\ncat_imputer = SimpleImputer(strategy='most_frequent')\ndf_train[cat_cols] = cat_imputer.fit_transform(df_train[cat_cols])\ndf_train","metadata":{"id":"Oxbex0PHvX5J","executionInfo":{"status":"ok","timestamp":1733663290441,"user_tz":-420,"elapsed":2335,"user":{"displayName":"Nguyên Nguyễn Khôi","userId":"07606726277784151804"}},"outputId":"93c421c9-1c14-4346-aa06-e400e8664ca8","trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:37.760659Z","iopub.execute_input":"2024-12-18T16:32:37.761364Z","iopub.status.idle":"2024-12-18T16:32:39.650575Z","shell.execute_reply.started":"2024-12-18T16:32:37.761306Z","shell.execute_reply":"2024-12-18T16:32:39.649257Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Season mapping\nseason_mapping = {'Spring': 1, 'Summer': 2, 'Fall': 3, 'Winter': 4}\ntrain_season_cols = [col for col in df_train.columns if 'Season' in col]\nfor col in train_season_cols:\n    df_train[col] = df_train[col].replace(season_mapping).astype('int')\ndf_train","metadata":{"id":"jW0HlxWixllw","executionInfo":{"status":"ok","timestamp":1733663293169,"user_tz":-420,"elapsed":319,"user":{"displayName":"Nguyên Nguyễn Khôi","userId":"07606726277784151804"}},"outputId":"d9c338ab-5dc8-4c72-8f84-00b099a4afe9","trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:39.656740Z","iopub.execute_input":"2024-12-18T16:32:39.657227Z","iopub.status.idle":"2024-12-18T16:32:39.720886Z","shell.execute_reply.started":"2024-12-18T16:32:39.657191Z","shell.execute_reply":"2024-12-18T16:32:39.719704Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# drop all \"PCIAT\" features because they represent the subjective opinions of parents.\npciat_columns = [col for col in df_train.columns if 'PCIAT' in col]\ndf_train = df_train.drop(pciat_columns, axis=1, errors='ignore')\ndf_train","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:39.722568Z","iopub.execute_input":"2024-12-18T16:32:39.723109Z","iopub.status.idle":"2024-12-18T16:32:39.766410Z","shell.execute_reply.started":"2024-12-18T16:32:39.723033Z","shell.execute_reply":"2024-12-18T16:32:39.764877Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"def feature_engineering(df):\n    df['BMI_Age'] = df['Physical-BMI'] * df['Basic_Demos-Age']\n    df['Internet_Hours_Age'] = df['PreInt_EduHx-computerinternet_hoursday'] * df['Basic_Demos-Age']\n    df['BMI_Internet_Hours'] = df['Physical-BMI'] * df['PreInt_EduHx-computerinternet_hoursday']\n    df['BFP_BMI'] = df['BIA-BIA_Fat'] / df['BIA-BIA_BMI']\n    df['FFMI_BFP'] = df['BIA-BIA_FFMI'] / df['BIA-BIA_Fat']\n    df['FMI_BFP'] = df['BIA-BIA_FMI'] / df['BIA-BIA_Fat']\n    df['LST_TBW'] = df['BIA-BIA_LST'] / df['BIA-BIA_TBW']\n    df['BFP_BMR'] = df['BIA-BIA_Fat'] * df['BIA-BIA_BMR']\n    df['BFP_DEE'] = df['BIA-BIA_Fat'] * df['BIA-BIA_DEE']\n    df['BMR_Weight'] = df['BIA-BIA_BMR'] / df['Physical-Weight']\n    df['DEE_Weight'] = df['BIA-BIA_DEE'] / df['Physical-Weight']\n    df['SMM_Height'] = df['BIA-BIA_SMM'] / df['Physical-Height']\n    df['Muscle_to_Fat'] = df['BIA-BIA_SMM'] / df['BIA-BIA_FMI']\n    df['Hydration_Status'] = df['BIA-BIA_TBW'] / df['Physical-Weight']\n    df['ICW_TBW'] = df['BIA-BIA_ICW'] / df['BIA-BIA_TBW']\n    df['BMI_PHR'] = df['Physical-BMI'] * df['Physical-HeartRate']\n    \n    return df\n\ndf_train = feature_engineering(df_train)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:39.768203Z","iopub.execute_input":"2024-12-18T16:32:39.768576Z","iopub.status.idle":"2024-12-18T16:32:39.798541Z","shell.execute_reply.started":"2024-12-18T16:32:39.768541Z","shell.execute_reply":"2024-12-18T16:32:39.796938Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Create a correlation matrix to show correlations between features in the data.\ndf_train_no_id = df_train.drop(['id'], axis=1, errors='ignore')\ncorrmat = df_train_no_id.corr()\nplt.figure(figsize=(30, 30))\nsns.heatmap(corrmat, annot=True, fmt=\".2f\", cmap=\"coolwarm\", cbar=True)\nplt.title('Correlation Matrix', fontsize=16)\nplt.show()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:39.799989Z","iopub.execute_input":"2024-12-18T16:32:39.800388Z","iopub.status.idle":"2024-12-18T16:32:48.813248Z","shell.execute_reply.started":"2024-12-18T16:32:39.800348Z","shell.execute_reply":"2024-12-18T16:32:48.810748Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# drop features that cause multicollinearity\nmulticollinerity = set()\nfor i in range(len(corrmat.columns)):\n    for j in range(i):\n        if abs(corrmat.iloc[i, j]) > 0.8:\n            multicollinerity.add(corrmat.columns[i])\nmulticollinerity.discard('sii')\ndf_train = df_train.drop(multicollinerity, axis=1, errors='ignore')\nprint(f\"Removed columns: {multicollinerity}\")\ndf_train","metadata":{"id":"TeJotk4K0pCJ","executionInfo":{"status":"ok","timestamp":1733663296959,"user_tz":-420,"elapsed":353,"user":{"displayName":"Nguyên Nguyễn Khôi","userId":"07606726277784151804"}},"outputId":"02343995-6980-464b-e8c9-9a67d16fa009","trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:48.815334Z","iopub.execute_input":"2024-12-18T16:32:48.816005Z","iopub.status.idle":"2024-12-18T16:32:48.913067Z","shell.execute_reply.started":"2024-12-18T16:32:48.815919Z","shell.execute_reply":"2024-12-18T16:32:48.911551Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Function to load and process parquet files\ndef process_parquet(filename, dirname):\n    df = pd.read_parquet(os.path.join(dirname, filename, 'part-0.parquet'))\n    df.drop('step', axis=1, inplace=True)\n    return df.describe().values.reshape(-1), filename.split('=')[1]\n\n# Optimize loading time series\ndef load_time_series(dirname) -> pd.DataFrame:\n    ids = os.listdir(dirname)\n    with ThreadPoolExecutor() as executor:\n        results = list(tqdm(executor.map(lambda fname: process_parquet(fname, dirname), ids), total=len(ids)))\n    \n    stats, indexes = zip(*results)\n    df = pd.DataFrame(stats, columns=[f\"stat_{i}\" for i in range(len(stats[0]))])\n    df['id'] = indexes\n    return df\n\n# AutoEncoder class\nclass AutoEncoder(nn.Module):\n    def __init__(self, input_dim, encoding_dim):\n        super(AutoEncoder, self).__init__()\n        self.encoder = nn.Sequential(\n            nn.Linear(input_dim, encoding_dim * 3), nn.ReLU(),\n            nn.Linear(encoding_dim * 3, encoding_dim * 2), nn.ReLU(),\n            nn.Linear(encoding_dim * 2, encoding_dim), nn.ReLU()\n        )\n        self.decoder = nn.Sequential(\n            nn.Linear(encoding_dim, input_dim * 2), nn.ReLU(),\n            nn.Linear(input_dim * 2, input_dim * 3), nn.ReLU(),\n            nn.Linear(input_dim * 3, input_dim), nn.Sigmoid()\n        )\n\n    def forward(self, x):\n        encoded = self.encoder(x)\n        decoded = self.decoder(encoded)\n        return decoded\n\n# Optimize Autoencoder Training Function\ndef perform_autoencoder(df, encoding_dim=50, epochs=50, batch_size=32):\n    scaler = StandardScaler()\n    df_scaled = scaler.fit_transform(df)\n    data_tensor = torch.FloatTensor(df_scaled)\n    \n    input_dim = data_tensor.shape[1]\n    autoencoder = AutoEncoder(input_dim, encoding_dim)\n    criterion = nn.MSELoss()\n    optimizer = optim.Adam(autoencoder.parameters())\n    \n    for epoch in range(epochs):\n        for i in range(0, len(data_tensor), batch_size):\n            batch = data_tensor[i:i + batch_size]\n            optimizer.zero_grad()\n            reconstructed = autoencoder(batch)\n            loss = criterion(reconstructed, batch)\n            loss.backward()\n            optimizer.step()\n            \n        if (epoch + 1) % 10 == 0:\n            print(f'Epoch [{epoch + 1}/{epochs}], Loss: {loss.item():.4f}')\n    \n    with torch.no_grad():\n        encoded_data = autoencoder.encoder(data_tensor).numpy()\n    df_encoded = pd.DataFrame(encoded_data, columns=[f'Enc_{i + 1}' for i in range(encoded_data.shape[1])])\n    return df_encoded","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:48.914600Z","iopub.execute_input":"2024-12-18T16:32:48.915158Z","iopub.status.idle":"2024-12-18T16:32:48.931420Z","shell.execute_reply.started":"2024-12-18T16:32:48.915115Z","shell.execute_reply":"2024-12-18T16:32:48.930087Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Load parquet files\ntrain_ts = load_time_series(\"/kaggle/input/child-mind-institute-problematic-internet-use/series_train.parquet\")\ntest_ts = load_time_series(\"/kaggle/input/child-mind-institute-problematic-internet-use/series_test.parquet\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:32:48.933314Z","iopub.execute_input":"2024-12-18T16:32:48.933741Z","iopub.status.idle":"2024-12-18T16:34:35.622192Z","shell.execute_reply.started":"2024-12-18T16:32:48.933701Z","shell.execute_reply":"2024-12-18T16:34:35.620672Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Use AutoEncoder to reduce dimensionality of the data\n# Then merge the parquet data into the csv data\ntrain_ts_no_id = train_ts.drop('id', axis=1)\ntest_ts_no_id = test_ts.drop('id', axis=1)\n\ntrain_ts_encoded = perform_autoencoder(train_ts_no_id, encoding_dim=60, epochs=100, batch_size=32)\ntest_ts_encoded = perform_autoencoder(test_ts_no_id, encoding_dim=60, epochs=100, batch_size=32)\n\ntrain_ts_encoded[\"id\"] = train_ts[\"id\"]\ntest_ts_encoded['id'] = test_ts[\"id\"]\n\ndf_train = pd.merge(df_train, train_ts_encoded, how=\"left\", on='id')\ndf_test = pd.merge(df_test, test_ts_encoded, how=\"left\", on='id')","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:34:35.623898Z","iopub.execute_input":"2024-12-18T16:34:35.624262Z","iopub.status.idle":"2024-12-18T16:34:49.284082Z","shell.execute_reply.started":"2024-12-18T16:34:35.624228Z","shell.execute_reply":"2024-12-18T16:34:49.282787Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_train","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:34:49.285713Z","iopub.execute_input":"2024-12-18T16:34:49.286241Z","iopub.status.idle":"2024-12-18T16:34:49.320860Z","shell.execute_reply.started":"2024-12-18T16:34:49.286184Z","shell.execute_reply":"2024-12-18T16:34:49.319141Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"knn_imputer = KNNImputer(n_neighbors=5)\nnum_cols = df_train.select_dtypes(include=['int32', 'int64', 'float32', 'float64']).columns\ndf_train[num_cols] = knn_imputer.fit_transform(df_train[num_cols])\ndf_train = df_train.dropna(thresh=10, axis=0)\ndf_train","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:34:49.322800Z","iopub.execute_input":"2024-12-18T16:34:49.323341Z","iopub.status.idle":"2024-12-18T16:34:53.042109Z","shell.execute_reply.started":"2024-12-18T16:34:49.323287Z","shell.execute_reply":"2024-12-18T16:34:53.040676Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_test","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:34:53.044972Z","iopub.execute_input":"2024-12-18T16:34:53.045496Z","iopub.status.idle":"2024-12-18T16:34:53.084872Z","shell.execute_reply.started":"2024-12-18T16:34:53.045446Z","shell.execute_reply":"2024-12-18T16:34:53.083619Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Feature engineering for test data\ndf_test = feature_engineering(df_test)\ndf_test","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:34:53.086511Z","iopub.execute_input":"2024-12-18T16:34:53.086985Z","iopub.status.idle":"2024-12-18T16:34:53.134322Z","shell.execute_reply.started":"2024-12-18T16:34:53.086935Z","shell.execute_reply":"2024-12-18T16:34:53.133159Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# We keep df_test's features that are the same with df_train's features except the 'sii' feature\ncols_to_keep = df_train.columns.drop('sii')\ndf_test = df_test[cols_to_keep]\ndf_test","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:34:53.135655Z","iopub.execute_input":"2024-12-18T16:34:53.135988Z","iopub.status.idle":"2024-12-18T16:34:53.178074Z","shell.execute_reply.started":"2024-12-18T16:34:53.135954Z","shell.execute_reply":"2024-12-18T16:34:53.176740Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# KNNImputer\nknn_imputer = KNNImputer(n_neighbors=5)\nnum_cols = df_test.select_dtypes(include=['int64', 'float64', 'int32', 'float32']).columns\ndf_test[num_cols] = knn_imputer.fit_transform(df_test[num_cols])\n\n# SimpleImputer\nsimple_imputer = SimpleImputer(strategy='most_frequent')\ncat_cols = df_test.select_dtypes(include=['object']).columns\ndf_test[cat_cols] = simple_imputer.fit_transform(df_test[cat_cols])\ndf_test","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:34:53.179558Z","iopub.execute_input":"2024-12-18T16:34:53.179985Z","iopub.status.idle":"2024-12-18T16:34:53.283612Z","shell.execute_reply.started":"2024-12-18T16:34:53.179921Z","shell.execute_reply":"2024-12-18T16:34:53.282412Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"season_mapping = {'Spring': 1, 'Summer': 2, 'Fall': 3, 'Winter': 4}\nseason_cols = [col for col in df_test.columns if 'Season' in col]\nfor col in season_cols:\n    df_test[col] = df_test[col].replace(season_mapping).astype('int')\ndf_test","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:34:53.285156Z","iopub.execute_input":"2024-12-18T16:34:53.285616Z","iopub.status.idle":"2024-12-18T16:34:53.342105Z","shell.execute_reply.started":"2024-12-18T16:34:53.285564Z","shell.execute_reply":"2024-12-18T16:34:53.340566Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"def threshold_rounder(oof_non_rounded, thresholds):\n    \"\"\"\n    Convert unrounded values ​​to rounded values ​​based on thresholds.\n    \"\"\"\n    return np.digitize(oof_non_rounded, thresholds, right=True)\n\ndef quadratic_weighted_kappa(y_true, y_pred): \n    \"\"\"\n    Calculate the quadratic weighted kappa between y_true and y_pred.\n    \"\"\"\n    rounded_y_true = threshold_rounder(y_true, [0.5, 1.5, 2.5])\n    rounded_y_pred = threshold_rounder(y_pred, [0.5, 1.5, 2.5])\n    return cohen_kappa_score(rounded_y_true, rounded_y_pred, weights='quadratic')\n\ndef evaluate_predictions(thresholds, y_true, oof_non_rounded):\n    \"\"\"\n    Evaluate predictions by optimizing quadratic weighted kappa.\n    \"\"\"\n    rounded_y_true = threshold_rounder(y_true, thresholds)\n    rounded_p = threshold_rounder(oof_non_rounded, thresholds)\n    return -quadratic_weighted_kappa(rounded_y_true, rounded_p)\n\ndef preprocess_data(train_data, test_data, target_column):\n    \"\"\"\n    Data preprocessing: prepare training and testing data.\n    \"\"\"\n    X = train_data.drop(columns=[target_column, 'id'])\n    y = train_data[target_column]\n    test_data_dropped = test_data.drop(columns=['id'])\n\n    return X, y, test_data_dropped, test_data['id']\n\ndef train_and_predict(X, y, test_data_dropped, models, n_splits=5, random_state=42):\n    \"\"\"\n    Train the models and predict on the test set.\n    \"\"\"\n    SKF = KFold(n_splits=n_splits, shuffle=True, random_state=random_state)\n    \n    oof_non_rounded = np.zeros(len(y), dtype=float)\n    test_preds = np.zeros((len(test_data_dropped), n_splits))\n    \n    for fold, (train_idx, test_idx) in enumerate(tqdm(SKF.split(X, y), desc=\"Training Folds\", total=n_splits)):\n        X_train, X_val = X.iloc[train_idx], X.iloc[test_idx]\n        y_train, y_val = y.iloc[train_idx], y.iloc[test_idx]\n        \n        for model_name, model in models.items():\n            model.fit(X_train, y_train)\n            y_val_pred = model.predict(X_val)\n            oof_non_rounded[test_idx] += y_val_pred / len(models)\n            test_preds[:, fold] += model.predict(test_data_dropped) / len(models)\n    \n    return oof_non_rounded, test_preds\n\ndef optimize_threshold(y_true, oof_non_rounded):\n    \"\"\"\n    Optimize threshold to improve QWK score.\n    \"\"\"\n    KappaOptimizer = minimize(\n        evaluate_predictions, x0=[0.5, 1.5, 2.5],\n        args=(y_true, oof_non_rounded), method='Nelder-Mead'\n    )\n    assert KappaOptimizer.success, \"Optimization did not converge.\"\n    return KappaOptimizer.x\n\ndef create_submission(test_ids, target_column, tpTuned):\n    \"\"\"\n    Create submission file from final prediction results.\n    \"\"\"\n    submission = pd.DataFrame({\n        'id': test_ids,\n        target_column: tpTuned\n    })\n    return submission\n\ndef TrainML(train_data, test_data, target_column, n_splits=5, random_state=42):\n    \"\"\"\n    Main function to train the model, optimize the threshold and create submission.\n    \"\"\"\n    X, y, test_data_dropped, test_ids = preprocess_data(train_data, test_data, target_column)\n    \n    models = {\n        'xgboost': XGBRegressor(\n            learning_rate=0.05, max_depth=6, n_estimators=200, subsample=0.8,\n            colsample_bytree=0.8, reg_alpha=1, reg_lambda=5, random_state=random_state\n        ),\n        'gboost': GradientBoostingRegressor(\n            learning_rate=0.05, max_depth=6, n_estimators=200, random_state=random_state\n        ),\n        'catboost': CatBoostRegressor(\n            learning_rate=0.05, depth=6, iterations=200, random_state=random_state, verbose=0\n        )\n    }\n\n    oof_non_rounded, test_preds = train_and_predict(X, y, test_data_dropped, models, n_splits, random_state)\n\n    optimal_threshold = optimize_threshold(y, oof_non_rounded)\n    \n    oof_tuned = threshold_rounder(oof_non_rounded, optimal_threshold)\n    tKappa = quadratic_weighted_kappa(y, oof_tuned)\n    print(f\"----> || Optimized QWK SCORE :: {tKappa:.3f}\")\n    \n    tpm = test_preds.mean(axis=1)\n    tpTuned = threshold_rounder(tpm, optimal_threshold)\n\n    # Tạo submission\n    submission = create_submission(test_ids, target_column, tpTuned)\n\n    return submission","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:34:53.345948Z","iopub.execute_input":"2024-12-18T16:34:53.346765Z","iopub.status.idle":"2024-12-18T16:34:53.369057Z","shell.execute_reply.started":"2024-12-18T16:34:53.346726Z","shell.execute_reply":"2024-12-18T16:34:53.367977Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"submission = TrainML(df_train, df_test, target_column=\"sii\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:34:53.372955Z","iopub.execute_input":"2024-12-18T16:34:53.373968Z","iopub.status.idle":"2024-12-18T16:36:57.175363Z","shell.execute_reply.started":"2024-12-18T16:34:53.373925Z","shell.execute_reply":"2024-12-18T16:36:57.174111Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"submission","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:36:57.176860Z","iopub.execute_input":"2024-12-18T16:36:57.177244Z","iopub.status.idle":"2024-12-18T16:36:57.189515Z","shell.execute_reply.started":"2024-12-18T16:36:57.177209Z","shell.execute_reply":"2024-12-18T16:36:57.188117Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"submission.to_csv('submission.csv', index=False)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-18T16:36:57.191519Z","iopub.execute_input":"2024-12-18T16:36:57.192007Z","iopub.status.idle":"2024-12-18T16:36:57.204261Z","shell.execute_reply.started":"2024-12-18T16:36:57.191950Z","shell.execute_reply":"2024-12-18T16:36:57.202917Z"}},"outputs":[],"execution_count":null}]}