{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.11.11","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"gpu","dataSources":[{"sourceId":96164,"databundleVersionId":11418275,"sourceType":"competition"}],"dockerImageVersionId":31041,"isInternetEnabled":true,"language":"python","sourceType":"notebook","isGpuEnabled":true}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import random\nimport numpy as np\nimport pandas as pd\nimport matplotlib.pyplot as plt\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.preprocessing import StandardScaler\nfrom torch.utils.data import Dataset, DataLoader\nimport torch\nimport torch.nn as nn\nfrom tqdm import tqdm","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true,"execution":{"iopub.status.busy":"2025-05-21T16:23:24.347066Z","iopub.execute_input":"2025-05-21T16:23:24.347570Z","iopub.status.idle":"2025-05-21T16:23:24.434744Z","shell.execute_reply.started":"2025-05-21T16:23:24.347547Z","shell.execute_reply":"2025-05-21T16:23:24.433957Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"torch.manual_seed(28)\ntorch.cuda.manual_seed(28)\nnp.random.seed(28)\nrandom.seed(28)","metadata":{"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"train = pd.read_parquet('/kaggle/input/drw-crypto-market-prediction/train.parquet')\ntest = pd.read_parquet('/kaggle/input/drw-crypto-market-prediction/test.parquet')\n\nfeatures = [col for col in train.columns if col.startswith('X_')] + ['bid_qty', 'ask_qty', 'buy_qty', 'sell_qty', 'volume']\nlabel_col = 'label'\n\nscaler = StandardScaler()\ntrain[features] = scaler.fit_transform(train[features])\ntest[features] = scaler.transform(test[features])","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-05-21T15:53:18.930194Z","iopub.execute_input":"2025-05-21T15:53:18.930516Z","iopub.status.idle":"2025-05-21T15:54:00.702025Z","shell.execute_reply.started":"2025-05-21T15:53:18.930498Z","shell.execute_reply":"2025-05-21T15:54:00.701139Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"SEQ_LEN = 60  \nTARGET_COL = 'label'\n\nclass CryptoDataset(Dataset):\n    def __init__(self, df, seq_len, is_train=True):\n        self.features = df[features].values\n        self.labels = df[label_col].values if is_train else None\n        self.seq_len = seq_len\n        self.is_train = is_train\n\n    def __len__(self):\n        return len(self.features) - self.seq_len\n\n    def __getitem__(self, idx):\n        x = self.features[idx:idx+self.seq_len]\n        if self.is_train:\n            y = self.labels[idx + self.seq_len]\n            return torch.tensor(x, dtype=torch.float32), torch.tensor(y, dtype=torch.float32)\n        return torch.tensor(x, dtype=torch.float32)\n\ntrain_df, val_df = train_test_split(train, test_size=0.1, shuffle=False)\n\ntrain_dataset = CryptoDataset(train_df, SEQ_LEN, is_train=True)\nval_dataset = CryptoDataset(val_df, SEQ_LEN, is_train=True)\n\ntrain_loader = DataLoader(train_dataset, batch_size=256, shuffle=True)\nval_loader = DataLoader(val_dataset, batch_size=256, shuffle=False)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-05-21T16:23:28.044664Z","iopub.execute_input":"2025-05-21T16:23:28.045161Z","iopub.status.idle":"2025-05-21T16:23:32.302175Z","shell.execute_reply.started":"2025-05-21T16:23:28.045136Z","shell.execute_reply":"2025-05-21T16:23:32.301547Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"class LSTMRegressor(nn.Module):\n    def __init__(self, input_size, hidden_size=128, num_layers=2):\n        super(LSTMRegressor, self).__init__()\n        self.lstm = nn.LSTM(input_size, hidden_size, num_layers, batch_first=True)\n        self.fc = nn.Linear(hidden_size, 1)\n\n    def forward(self, x):\n        out, _ = self.lstm(x)\n        out = out[:, -1, :]  \n        out = self.fc(out)\n        return out.squeeze()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-05-21T15:54:00.726149Z","iopub.execute_input":"2025-05-21T15:54:00.726402Z","iopub.status.idle":"2025-05-21T15:54:00.731223Z","shell.execute_reply.started":"2025-05-21T15:54:00.726380Z","shell.execute_reply":"2025-05-21T15:54:00.730479Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"def train_model(model, train_loader, val_loader, criterion, optimizer, scheduler, device, epochs=10, patience=5):\n    class EarlyStopping:\n        def __init__(self, patience=patience, delta=1e-4):\n            self.patience = patience\n            self.counter = 0\n            self.best_loss = None\n            self.early_stop = False\n            self.delta = delta\n            self.best_model_state = None\n\n        def __call__(self, val_loss, model):\n            if self.best_loss is None or val_loss < self.best_loss - self.delta:\n                self.best_loss = val_loss\n                self.counter = 0\n                self.best_model_state = model.state_dict()\n            else:\n                self.counter += 1\n                if self.counter >= self.patience:\n                    self.early_stop = True\n\n    def evaluate(model, dataloader, device):\n        model.eval()\n        losses = []\n        all_preds = []\n        all_targets = []\n        with torch.no_grad():\n            for x_batch, y_batch in dataloader:\n                x_batch, y_batch = x_batch.to(device), y_batch.to(device)\n                preds = model(x_batch)\n                loss = criterion(preds, y_batch)\n                losses.append(loss.item())\n                all_preds.extend(preds.cpu().numpy())\n                all_targets.extend(y_batch.cpu().numpy())\n        avg_loss = np.mean(losses)\n        try:\n            from scipy.stats import pearsonr\n            corr = pearsonr(all_preds, all_targets)[0]\n        except:\n            corr = 0.0\n        return avg_loss, corr\n\n    early_stopping = EarlyStopping()\n    \n    history = {\n        \"train_loss\": [],\n        \"val_loss\": [],\n        \"val_corr\": [],\n        \"lr\": []\n    }\n    \n    for epoch in range(epochs):\n        model.train()\n        total_loss = 0\n        loop = tqdm(train_loader, desc=f\"Epoch {epoch+1}/{epochs}\")\n        for x_batch, y_batch in loop:\n            x_batch, y_batch = x_batch.to(device), y_batch.to(device)\n\n            optimizer.zero_grad()\n            preds = model(x_batch)\n            loss = criterion(preds, y_batch)\n            loss.backward()\n            optimizer.step()\n\n            total_loss += loss.item()\n            loop.set_postfix(loss=loss.item())\n        \n        train_loss = total_loss / len(train_loader)\n        val_loss, val_corr = evaluate(model, val_loader, device)\n        scheduler.step(val_loss)\n\n        history[\"train_loss\"].append(train_loss)\n        history[\"val_loss\"].append(val_loss)\n        history[\"val_corr\"].append(val_corr)\n        history[\"lr\"].append(optimizer.param_groups[0]['lr'])\n\n        print(f\"Epoch {epoch+1} | Train Loss: {train_loss:.5f} | Val Loss: {val_loss:.5f} | Val Corr: {val_corr:.4f} | LR: {history['lr'][-1]:.6f}\")\n\n        early_stopping(val_loss, model)\n        if early_stopping.early_stop:\n            print(\"Early stopping triggered.\")\n            break\n\n    model.load_state_dict(early_stopping.best_model_state)\n\n    fig, ax1 = plt.subplots(figsize=(10,6))\n\n    ax1.set_xlabel('Epoch')\n    ax1.set_ylabel('Loss', color='tab:blue')\n    ax1.plot(history[\"train_loss\"], label='Train Loss', color='tab:blue', linestyle='-')\n    ax1.plot(history[\"val_loss\"], label='Val Loss', color='tab:blue', linestyle='--')\n    ax1.tick_params(axis='y', labelcolor='tab:blue')\n    ax1.legend(loc='upper left')\n\n    ax2 = ax1.twinx()  \n    ax2.set_ylabel('Learning Rate / Val Corr', color='tab:orange')\n    ax2.plot(history[\"lr\"], label='Learning Rate', color='tab:orange', linestyle='-.')\n    ax2.plot(history[\"val_corr\"], label='Val Corr', color='tab:green', linestyle=':')\n    ax2.tick_params(axis='y', labelcolor='tab:orange')\n    ax2.legend(loc='upper right')\n\n    plt.title('Training Metrics and Learning Rate')\n    plt.show()\n\n    return model, history","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-05-21T16:23:37.569955Z","iopub.execute_input":"2025-05-21T16:23:37.570484Z","iopub.status.idle":"2025-05-21T16:23:37.583178Z","shell.execute_reply.started":"2025-05-21T16:23:37.570460Z","shell.execute_reply":"2025-05-21T16:23:37.582484Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"device = torch.device('cuda' if torch.cuda.is_available() else 'cpu')\nmodel = LSTMRegressor(input_size=len(features)).to(device)\n\ncriterion = nn.MSELoss()\noptimizer = torch.optim.Adam(model.parameters(), lr=1e-3)\nscheduler = torch.optim.lr_scheduler.ReduceLROnPlateau(optimizer, mode='min', patience=2, factor=0.5, verbose=True)\n\ntrained_model, history = train_model(model, train_loader, val_loader, criterion, optimizer, scheduler, device, epochs=50, patience=3)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-05-21T16:23:41.448683Z","iopub.execute_input":"2025-05-21T16:23:41.448944Z","iopub.status.idle":"2025-05-21T16:26:41.146380Z","shell.execute_reply.started":"2025-05-21T16:23:41.448925Z","shell.execute_reply":"2025-05-21T16:26:41.145619Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"test_dataset = CryptoDataset(test, SEQ_LEN, is_train=False)\ntest_loader = DataLoader(test_dataset, batch_size=256, shuffle=False)\n\nmodel.eval()\npreds = []\n\nwith torch.no_grad():\n    for x_batch in tqdm(test_loader, desc=\"Predicting\"):\n        x_batch = x_batch.to(device)\n        outputs = model(x_batch)\n        preds.extend(outputs.cpu().numpy())\n\nsample_submission = pd.read_csv('/kaggle/input/drw-crypto-market-prediction/sample_submission.csv')\nsample_submission['prediction'] = [0]*SEQ_LEN + preds  \nsample_submission.to_csv('submission.csv', index=False)\nprint(sample_submission.tail())","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-05-21T16:29:12.995947Z","iopub.execute_input":"2025-05-21T16:29:12.996259Z","iopub.status.idle":"2025-05-21T16:29:29.778466Z","shell.execute_reply.started":"2025-05-21T16:29:12.996239Z","shell.execute_reply":"2025-05-21T16:29:29.777775Z"}},"outputs":[],"execution_count":null}]}