{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.10.12","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"nvidiaTeslaT4","dataSources":[{"sourceId":84493,"databundleVersionId":9871156,"sourceType":"competition"},{"sourceId":9756372,"sourceType":"datasetVersion","datasetId":5973876},{"sourceId":9801075,"sourceType":"datasetVersion","datasetId":6006872},{"sourceId":9806342,"sourceType":"datasetVersion","datasetId":6010899},{"sourceId":203900450,"sourceType":"kernelVersion"}],"dockerImageVersionId":30823,"isInternetEnabled":false,"language":"python","sourceType":"notebook","isGpuEnabled":true}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import numpy as np\nimport pandas as pd\nimport torch\nfrom torch.utils.data import DataLoader, TensorDataset\nimport gc\nfrom sklearn.metrics import r2_score\nfrom tqdm import tqdm\n\ndef preprocess_data(data: pd.DataFrame, feature_cols: list) -> torch.FloatTensor:\n    \"\"\"Prepare input data by filling missing values.\"\"\"\n    data = data[feature_cols].fillna(method='ffill').fillna(0)\n    return torch.FloatTensor(data.values)\n\ndef predict_with_models(models, input_data: torch.FloatTensor) -> np.ndarray:\n    \"\"\"Predict using multiple PyTorch models.\"\"\"\n    predictions = np.zeros((input_data.shape[0],))\n    with torch.no_grad():\n        for model in models:\n            model.eval()\n            predictions += model(input_data).cpu().numpy() / len(models)\n    return predictions\n\ndef clear_memory(*variables):\n    \"\"\"Clear variables from memory and force garbage collection.\"\"\"\n    for var in variables:\n        del var\n    gc.collect()\n\nimport polars as pl\nimport os, gc\nfrom matplotlib import pyplot as plt\nimport pickle\n\nimport torch\nimport torch.nn as nn\nimport torch.nn.functional as F\nfrom pytorch_lightning import (LightningModule)\nfrom pytorch_lightning.callbacks import EarlyStopping, ModelCheckpoint, Timer\n\nfrom sklearn.model_selection import train_test_split\nfrom torch.utils.data import Dataset, DataLoader\nfrom lightgbm import LGBMRegressor\nimport lightgbm as lgb\nfrom xgboost import XGBRegressor\nfrom catboost import CatBoostRegressor\nfrom sklearn.ensemble import VotingRegressor\nimport warnings\nwarnings.filterwarnings('ignore')\npd.options.display.max_columns = None\n\nimport kaggle_evaluation.jane_street_inference_server","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-24T01:49:56.421730Z","iopub.execute_input":"2024-12-24T01:49:56.421960Z","iopub.status.idle":"2024-12-24T01:50:09.036812Z","shell.execute_reply.started":"2024-12-24T01:49:56.421941Z","shell.execute_reply":"2024-12-24T01:50:09.036119Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"class CONFIG:\n    seed = 42\n    target_col = \"responder_6\"\n    feature_cols = [f\"feature_{idx:02d}\" for idx in range(79)] + [f\"responder_{idx}_lag_1\" for idx in range(9)]\n    nn_model_dir = \"/kaggle/input/js-xs-nn-trained-model\"  # NN学習済みモデル\n    xgb_model_path = \"/kaggle/input/js-with-lags-trained-xgb/result.pkl\"  # XGB学習済みモデル\n\ndef r2_val(y_true, y_pred, sample_weight):\n    \"\"\"Weighted R2.\"\"\"\n    r2 = 1 - np.average((y_pred - y_true) ** 2, weights=sample_weight) / (np.average((y_true) ** 2, weights=sample_weight) + 1e-41)\n    return r2","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-24T01:50:09.037674Z","iopub.execute_input":"2024-12-24T01:50:09.038336Z","iopub.status.idle":"2024-12-24T01:50:09.043378Z","shell.execute_reply.started":"2024-12-24T01:50:09.038303Z","shell.execute_reply":"2024-12-24T01:50:09.042388Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# NN define\nclass NN(LightningModule):\n    def __init__(self, input_dim, hidden_dims, dropouts, lr, weight_decay):\n        super().__init__()\n        self.save_hyperparameters()\n        layers = []\n        in_dim = input_dim\n        for i, hidden_dim in enumerate(hidden_dims):\n            layers.append(nn.BatchNorm1d(in_dim))\n            if i > 0:\n                layers.append(nn.SiLU())\n            if i < len(dropouts):\n                layers.append(nn.Dropout(dropouts[i]))\n            layers.append(nn.Linear(in_dim, hidden_dim))\n            in_dim = hidden_dim\n        layers.append(nn.Linear(in_dim, 1))\n        layers.append(nn.Tanh())\n        self.model = nn.Sequential(*layers)\n        self.lr = lr\n        self.weight_decay = weight_decay\n        self.validation_step_outputs = []\n\n    def forward(self, x):\n        return 5 * self.model(x).squeeze(-1)\n\n    def training_step(self, batch):\n        x, y, w = batch\n        y_hat = self(x)\n        loss = F.mse_loss(y_hat, y, reduction='none') * w\n        loss = loss.mean()\n        self.log('train_loss', loss, on_step=False, on_epoch=True, batch_size=x.size(0))\n        return loss\n\n    def validation_step(self, batch):\n        x, y, w = batch\n        y_hat = self(x)\n        loss = F.mse_loss(y_hat, y, reduction='none') * w\n        loss = loss.mean()\n        self.log('val_loss', loss, on_step=False, on_epoch=True, batch_size=x.size(0))\n        self.validation_step_outputs.append((y_hat, y, w))\n        return loss\n\n    def on_validation_epoch_end(self):\n        y = torch.cat([x[1] for x in self.validation_step_outputs]).cpu().numpy()\n        prob = torch.cat([x[0] for x in self.validation_step_outputs]).cpu().numpy()\n        weights = torch.cat([x[2] for x in self.validation_step_outputs]).cpu().numpy()\n        val_r_square = r2_val(y, prob, weights)\n        self.log(\"val_r_square\", val_r_square, prog_bar=True, on_step=False, on_epoch=True)\n        self.validation_step_outputs.clear()\n\n    def configure_optimizers(self):\n        optimizer = torch.optim.Adam(self.parameters(), lr=self.lr, weight_decay=self.weight_decay)\n        scheduler = torch.optim.lr_scheduler.ReduceLROnPlateau(optimizer, mode='min', factor=0.5, patience=5, verbose=True)\n        return {\n            'optimizer': optimizer,\n            'lr_scheduler': {\n                'scheduler': scheduler,\n                'monitor': 'val_loss',\n            }\n        }\n\n    def on_train_epoch_end(self):\n        if self.trainer.sanity_checking:\n            return\n        epoch = self.trainer.current_epoch\n        metrics = {k: v.item() if isinstance(v, torch.Tensor) else v for k, v in self.trainer.logged_metrics.items()}\n        formatted_metrics = {k: f\"{v:.5f}\" for k, v in metrics.items()}\n        print(f\"Epoch {epoch}: {formatted_metrics}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-24T01:50:59.084945Z","iopub.execute_input":"2024-12-24T01:50:59.085277Z","iopub.status.idle":"2024-12-24T01:50:59.098277Z","shell.execute_reply.started":"2024-12-24T01:50:59.085251Z","shell.execute_reply":"2024-12-24T01:50:59.097413Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Load\n# -- Load XGB Model\nwith open(CONFIG.xgb_model_path, \"rb\") as fp:\n    result = pickle.load(fp)\n    xgb_model = result[\"model\"]\n\n# -- Load NN Models (5-Fold)\nN_folds = 5\nmodels_nn = []\nfor fold in range(N_folds):\n    checkpoint_path = f\"{CONFIG.nn_model_dir}/nn_{fold}.model\"\n    model = NN.load_from_checkpoint(checkpoint_path)\n    models_nn.append(model.to(\"cuda:0\"))\n\n# -- LightGBM & CatBoost (Validationで簡易Fitする例: 本来はtrainで学習）\n# 後で推論時に使うため、ここで仮に宣言だけしておく\nlgb_model = None\ncat_model = None","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-24T01:52:02.169817Z","iopub.execute_input":"2024-12-24T01:52:02.170158Z","iopub.status.idle":"2024-12-24T01:52:03.391657Z","shell.execute_reply.started":"2024-12-24T01:52:02.170133Z","shell.execute_reply":"2024-12-24T01:52:03.391031Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# validation load & train lgb/cat\nvalid_pl = pl.scan_parquet(\"/kaggle/input/js24-preprocessing-create-lags/validation.parquet/\").collect()\nvalid = valid_pl.to_pandas()\n\nX_valid_nn = preprocess_data(valid, CONFIG.feature_cols)\ny_valid = valid[CONFIG.target_col].values\nw_valid = valid[\"weight\"].values\nprint(\"Validation data prepared:\", X_valid_nn.shape, y_valid.shape, w_valid.shape)\n\n# NN Predict\ny_pred_valid_nn = predict_with_models(models_nn, X_valid_nn.to(\"cuda:0\"))\nscore_nn = r2_score(y_valid, y_pred_valid_nn, sample_weight=w_valid)\nprint(f\"Validation R2 score (NN): {score_nn:.5f}\")\n\n# XGB Predict\nxgb_feature_cols = [\"symbol_id\", \"time_id\"] + CONFIG.feature_cols\nX_valid_xgb = valid[xgb_feature_cols].fillna(method='ffill').fillna(0)\ny_pred_valid_xgb = xgb_model.predict(X_valid_xgb)\nscore_xgb = r2_score(y_valid, y_pred_valid_xgb, sample_weight=w_valid)\nprint(f\"Validation R2 score (XGB): {score_xgb:.5f}\")\n\n# ここでLightGBM, CatBoostを簡易的にvalidで学習 (本番ではtrainでCVする)\nlgb_model = LGBMRegressor(n_estimators=500, learning_rate=0.05, random_state=CONFIG.seed)\nlgb_model.fit(X_valid_xgb, y_valid, sample_weight=w_valid)\ny_pred_valid_lgb = lgb_model.predict(X_valid_xgb)\nscore_lgb = r2_score(y_valid, y_pred_valid_lgb, sample_weight=w_valid)\nprint(f\"Validation R2 score (LGB): {score_lgb:.5f}\")\n\ncat_model = CatBoostRegressor(iterations=500, learning_rate=0.05, depth=6, random_seed=CONFIG.seed, verbose=False)\ncat_model.fit(X_valid_xgb, y_valid, sample_weight=w_valid)\ny_pred_valid_cat = cat_model.predict(X_valid_xgb)\nscore_cat = r2_score(y_valid, y_pred_valid_cat, sample_weight=w_valid)\nprint(f\"Validation R2 score (CAT): {score_cat:.5f}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-24T01:53:16.933038Z","iopub.execute_input":"2024-12-24T01:53:16.933371Z","iopub.status.idle":"2024-12-24T01:56:13.863341Z","shell.execute_reply.started":"2024-12-24T01:53:16.933348Z","shell.execute_reply":"2024-12-24T01:56:13.862550Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# weighted blending\nweight_lgb = 0.5\nweight_cat = 0.2\nweight_nn  = 0.2\nweight_xgb = 0.1\n\nensemble_pred = (\n    weight_lgb * y_pred_valid_lgb +\n    weight_cat * y_pred_valid_cat +\n    weight_nn  * y_pred_valid_nn  +\n    weight_xgb * y_pred_valid_xgb\n)\n\nscore_ensemble = r2_score(y_valid, ensemble_pred, sample_weight=w_valid)\nprint(f\"Validation R2 score (Weighted Ensemble): {score_ensemble:.5f}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-24T01:56:13.864465Z","iopub.execute_input":"2024-12-24T01:56:13.864743Z","iopub.status.idle":"2024-12-24T01:56:13.887673Z","shell.execute_reply.started":"2024-12-24T01:56:13.864712Z","shell.execute_reply":"2024-12-24T01:56:13.886918Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# 本番用推論: test, lagsを受け取り、4モデルで重み付きアンサンブル\nlags_ : pl.DataFrame | None = None\n\ndef predict(test: pl.DataFrame, lags: pl.DataFrame | None) -> pl.DataFrame | pd.DataFrame:\n    global lags_\n    if lags is not None:\n        lags_ = lags\n\n    predictions = test.select(\n        'row_id',\n        pl.lit(0.0).alias('responder_6'),\n    )\n\n    if lags is not None:\n        lags = lags.group_by([\"date_id\", \"symbol_id\"], maintain_order=True).last()\n        test = test.join(lags, on=[\"date_id\", \"symbol_id\"], how=\"left\")\n    else:\n        for idx in range(9):\n            test = test.with_columns(\n                pl.lit(0.0).alias(f'responder_{idx}_lag_1')\n            )\n\n    # XGB input\n    test_xgb_df = test[xgb_feature_cols].to_pandas().fillna(method='ffill').fillna(0)\n    preds_xgb = xgb_model.predict(test_xgb_df)\n\n    # NN input\n    test_nn_df = test[CONFIG.feature_cols].to_pandas().fillna(method='ffill').fillna(0)\n    test_nn_inp = torch.FloatTensor(test_nn_df.values).to(\"cuda:0\")\n    preds_nn = np.zeros((test_nn_inp.shape[0],))\n    with torch.no_grad():\n        for nn_model in models_nn:\n            nn_model.eval()\n            preds_nn += nn_model(test_nn_inp).cpu().numpy() / len(models_nn)\n\n    # LGB\n    preds_lgb = lgb_model.predict(test_xgb_df)\n\n    # CAT\n    preds_cat = cat_model.predict(test_xgb_df)\n\n    # =========================\n    # ==> Weighted Blending <==\n    # =========================\n    final_preds = (\n        weight_lgb * preds_lgb +\n        weight_cat * preds_cat +\n        weight_nn  * preds_nn  +\n        weight_xgb * preds_xgb\n    )\n\n    predictions = (\n        test.select('row_id')\n        .with_columns(\n            pl.Series(\n                name='responder_6',\n                values=np.clip(final_preds, a_min=-5, a_max=5),\n                dtype=pl.Float64,\n            )\n        )\n    )\n\n    # Check\n    assert isinstance(predictions, (pl.DataFrame, pd.DataFrame))\n    assert list(predictions.columns) == ['row_id', 'responder_6']\n    assert len(predictions) == len(test)\n\n    return predictions","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-24T01:56:13.888970Z","iopub.execute_input":"2024-12-24T01:56:13.889222Z","iopub.status.idle":"2024-12-24T01:56:13.897309Z","shell.execute_reply.started":"2024-12-24T01:56:13.889201Z","shell.execute_reply":"2024-12-24T01:56:13.896576Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"inference_server = kaggle_evaluation.jane_street_inference_server.JSInferenceServer(predict)\n\nif os.getenv('KAGGLE_IS_COMPETITION_RERUN'):\n    inference_server.serve()\nelse:\n    inference_server.run_local_gateway(\n        (\n            '/kaggle/input/jane-street-real-time-market-data-forecasting/test.parquet',\n            '/kaggle/input/jane-street-real-time-market-data-forecasting/lags.parquet',\n        )\n    )","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-24T01:56:13.898203Z","iopub.execute_input":"2024-12-24T01:56:13.898506Z","iopub.status.idle":"2024-12-24T01:56:14.183299Z","shell.execute_reply.started":"2024-12-24T01:56:13.898476Z","shell.execute_reply":"2024-12-24T01:56:14.182625Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"","metadata":{"trusted":true},"outputs":[],"execution_count":null}]}