{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.11.11","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":96164,"databundleVersionId":11418275,"sourceType":"competition"}],"dockerImageVersionId":31040,"isInternetEnabled":true,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the\" read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true,"execution":{"iopub.status.busy":"2025-07-07T09:32:16.630973Z","iopub.execute_input":"2025-07-07T09:32:16.631276Z","iopub.status.idle":"2025-07-07T09:32:17.013648Z","shell.execute_reply.started":"2025-07-07T09:32:16.631254Z","shell.execute_reply":"2025-07-07T09:32:17.012647Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"import pandas as pd\nimport numpy as np\nimport matplotlib.pyplot as plt\nfrom sklearn.model_selection import train_test_split, GridSearchCV, cross_val_score\nfrom sklearn.tree import DecisionTreeRegressor\nfrom sklearn.ensemble import RandomForestRegressor\nfrom sklearn.metrics import mean_squared_error\nfrom scipy.stats import pearsonr\nfrom sklearn.preprocessing import StandardScaler\nfrom sklearn.feature_selection import mutual_info_regression","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T09:32:17.015638Z","iopub.execute_input":"2025-07-07T09:32:17.016060Z","iopub.status.idle":"2025-07-07T09:32:18.335725Z","shell.execute_reply.started":"2025-07-07T09:32:17.016036Z","shell.execute_reply":"2025-07-07T09:32:18.334736Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"train = pd.read_parquet('/kaggle/input/drw-crypto-market-prediction/train.parquet')\ntest = pd.read_parquet('/kaggle/input/drw-crypto-market-prediction/test.parquet')\n\nprint('done read')","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T09:32:18.336695Z","iopub.execute_input":"2025-07-07T09:32:18.337060Z","iopub.status.idle":"2025-07-07T09:33:13.849483Z","shell.execute_reply.started":"2025-07-07T09:32:18.337038Z","shell.execute_reply":"2025-07-07T09:33:13.845537Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"train = train.replace([np.inf, -np.inf], np.nan)\ntest = test.replace([np.inf, -np.inf], np.nan)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T09:33:13.854350Z","iopub.execute_input":"2025-07-07T09:33:13.855106Z","iopub.status.idle":"2025-07-07T09:33:52.162573Z","shell.execute_reply.started":"2025-07-07T09:33:13.855031Z","shell.execute_reply":"2025-07-07T09:33:52.161214Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Impute missing values with median for numerical columns\nfor col in train.select_dtypes(include=[np.number]).columns:\n    train[col] = train[col].fillna(train[col].median())\n    if col in test.columns:\n        test[col] = test[col].fillna(train[col].median())","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T09:33:52.164116Z","iopub.execute_input":"2025-07-07T09:33:52.164915Z","iopub.status.idle":"2025-07-07T09:34:10.519019Z","shell.execute_reply.started":"2025-07-07T09:33:52.164870Z","shell.execute_reply":"2025-07-07T09:34:10.518056Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Drop columns with all NaNs and align test set\ntrain = train.dropna(axis=1, how='all')\ntest = test[train.drop(columns=[\"label\"]).columns]\n\n# Split features and target\nX_all = train.drop(columns=[\"label\"])\ny = train[\"label\"]\n","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T09:37:29.093846Z","iopub.execute_input":"2025-07-07T09:37:29.094386Z","iopub.status.idle":"2025-07-07T09:37:45.369716Z","shell.execute_reply.started":"2025-07-07T09:37:29.094359Z","shell.execute_reply":"2025-07-07T09:37:45.368671Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"rf = RandomForestRegressor(\n    n_estimators=50,\n    max_depth=5,\n    n_jobs=-1,\n    random_state=42\n)\n\n# Fit the model\nrf.fit(X_all.sample(frac=0.2, random_state=42), y.sample(frac=0.2, random_state=42))\n# Get feature importances\nimportances = pd.Series(rf.feature_importances_, index=X_all.columns)\n\n# Sort and get top 200 features\ntop_features = importances.sort_values(ascending=False).head(100).index\n","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T09:51:45.978644Z","iopub.execute_input":"2025-07-07T09:51:45.979196Z","iopub.status.idle":"2025-07-07T10:10:25.594514Z","shell.execute_reply.started":"2025-07-07T09:51:45.979162Z","shell.execute_reply":"2025-07-07T10:10:25.593199Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Final feature set\nX = X_all[top_features]\nX_test = test[top_features]\n\n# Feature Scaling\nscaler = StandardScaler()\nX_scaled = scaler.fit_transform(X)\nX_test_scaled = scaler.transform(X_test)\n\nprint('Done scaling')","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T10:22:40.603411Z","iopub.execute_input":"2025-07-07T10:22:40.604443Z","iopub.status.idle":"2025-07-07T10:22:43.219985Z","shell.execute_reply.started":"2025-07-07T10:22:40.604410Z","shell.execute_reply":"2025-07-07T10:22:43.218955Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# Train-validation split\nX_train, X_val, y_train, y_val = train_test_split(X_scaled, y, test_size=0.2, random_state=42)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T10:22:47.251239Z","iopub.execute_input":"2025-07-07T10:22:47.251605Z","iopub.status.idle":"2025-07-07T10:22:49.090753Z","shell.execute_reply.started":"2025-07-07T10:22:47.251583Z","shell.execute_reply":"2025-07-07T10:22:49.089647Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# #decision tree\n\n# model = DecisionTreeRegressor(max_depth=9, random_state=42)\n# model.fit(X_train, y_train)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T10:22:49.092232Z","iopub.execute_input":"2025-07-07T10:22:49.092537Z","iopub.status.idle":"2025-07-07T10:22:49.097826Z","shell.execute_reply.started":"2025-07-07T10:22:49.092512Z","shell.execute_reply":"2025-07-07T10:22:49.096176Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# #evaluating decision tree\n\n# y_train_pred = model.predict(X_train)\n# y_val_pred = model.predict(X_val)\n\n# # Train metrics\n# train_mse = mean_squared_error(y_train, y_train_pred)\n# train_corr, _ = pearsonr(y_train, y_train_pred)\n\n# # Val metrics\n# val_mse = mean_squared_error(y_val, y_val_pred)\n# val_corr, _ = pearsonr(y_val, y_val_pred)\n\n# print(f\"Train MSE: {train_mse:.4f}, Val MSE: {val_mse:.4f}\")\n# print(f\"Train Pearson: {train_corr:.4f}, Val Pearson: {val_corr:.4f}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T10:22:49.147167Z","iopub.execute_input":"2025-07-07T10:22:49.147591Z","iopub.status.idle":"2025-07-07T10:22:49.152473Z","shell.execute_reply.started":"2025-07-07T10:22:49.147564Z","shell.execute_reply":"2025-07-07T10:22:49.151331Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# from sklearn.ensemble import RandomForestRegressor\n\n# rf_model = RandomForestRegressor(\n#     n_estimators=200,\n#     max_depth=7,\n#     min_samples_leaf=30,\n#     max_features='sqrt',\n#     n_jobs=-1,\n#     random_state=42\n# )\n\n# rf_model.fit(X_train, y_train)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T10:22:49.457437Z","iopub.execute_input":"2025-07-07T10:22:49.457767Z","iopub.status.idle":"2025-07-07T10:22:49.463032Z","shell.execute_reply.started":"2025-07-07T10:22:49.457746Z","shell.execute_reply":"2025-07-07T10:22:49.461640Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# #random forest evaluate\n\n# y_train_pred = rf_model.predict(X_train)\n# y_val_pred = rf_model.predict(X_val)\n\n# # Train metrics\n# train_mse = mean_squared_error(y_train, y_train_pred)\n# train_corr, _ = pearsonr(y_train, y_train_pred)\n\n# # Val metrics\n# val_mse = mean_squared_error(y_val, y_val_pred)\n# val_corr, _ = pearsonr(y_val, y_val_pred)\n\n# print(f\"Train MSE: {train_mse:.4f}, Val MSE: {val_mse:.4f}\")\n# print(f\"Train Pearson: {train_corr:.4f}, Val Pearson: {val_corr:.4f}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T10:22:56.212104Z","iopub.execute_input":"2025-07-07T10:22:56.212458Z","iopub.status.idle":"2025-07-07T10:22:56.217869Z","shell.execute_reply.started":"2025-07-07T10:22:56.212437Z","shell.execute_reply":"2025-07-07T10:22:56.216694Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"#hist \n\nfrom sklearn.ensemble import HistGradientBoostingRegressor\n\nhgb_model = HistGradientBoostingRegressor(\n    max_iter=300,             # same as n_estimators\n    learning_rate=0.05,\n    max_depth=5,\n    min_samples_leaf=30,\n    random_state=42\n)\n\nhgb_model.fit(X_train, y_train)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T10:22:56.634062Z","iopub.execute_input":"2025-07-07T10:22:56.634422Z","iopub.status.idle":"2025-07-07T10:23:26.379999Z","shell.execute_reply.started":"2025-07-07T10:22:56.634402Z","shell.execute_reply":"2025-07-07T10:23:26.378950Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"#evaluate hist\n\ny_train_pred = hgb_model.predict(X_train)\ny_val_pred = hgb_model.predict(X_val)\n\n# Train metrics\ntrain_mse = mean_squared_error(y_train, y_train_pred)\ntrain_corr, _ = pearsonr(y_train_pred, y_train )\n\n# Val metrics\nval_mse = mean_squared_error(y_val, y_val_pred)\nval_corr, _ = pearsonr(y_train_pred, y_train )\n\nprint(f\"Train MSE: {train_mse:.4f}, Val MSE: {val_mse:.4f}\")\nprint(f\"Train Pearson: {train_corr:.4f}, Val Pearson: {val_corr:.4f}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T10:37:01.414901Z","iopub.execute_input":"2025-07-07T10:37:01.415507Z","iopub.status.idle":"2025-07-07T10:37:16.016140Z","shell.execute_reply.started":"2025-07-07T10:37:01.415472Z","shell.execute_reply":"2025-07-07T10:37:16.014848Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"val_corr\n","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T10:38:04.018150Z","iopub.execute_input":"2025-07-07T10:38:04.018514Z","iopub.status.idle":"2025-07-07T10:38:04.025431Z","shell.execute_reply.started":"2025-07-07T10:38:04.018494Z","shell.execute_reply":"2025-07-07T10:38:04.024057Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"test_pred_hgb = hgb_model.predict(X_test_scaled)\n\n\nsubmission = pd.read_csv(\"/kaggle/input/drw-crypto-market-prediction/sample_submission.csv\")\nsubmission[\"prediction\"] = test_pred_hgb\nsubmission.to_csv(\"submission.csv\", index=False)\nprint(\"📁 Submission file saved as 'submission.csv'\")\n\nsubmission.head()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T10:39:16.154273Z","iopub.execute_input":"2025-07-07T10:39:16.154696Z","iopub.status.idle":"2025-07-07T10:39:24.855347Z","shell.execute_reply.started":"2025-07-07T10:39:16.154671Z","shell.execute_reply":"2025-07-07T10:39:24.854242Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"\n#XG boost\n\nfrom xgboost import XGBRegressor\n\nxgb_model = XGBRegressor(\n    n_estimators=300,\n    learning_rate=0.05,\n    max_depth=5,\n    subsample=0.8,\n    colsample_bytree=0.8,\n    reg_alpha=0.0,\n    reg_lambda=1.0,\n    n_jobs=-1,\n    random_state=42,\n    verbosity=0\n)\n\nxgb_model.fit(X_train, y_train)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-07-07T10:30:13.010701Z","iopub.execute_input":"2025-07-07T10:30:13.011277Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# light gbm\n\nfrom lightgbm import LGBMRegressor\n\nlgb_model = LGBMRegressor(\n    n_estimators=500,\n    learning_rate=0.01,\n    max_depth=6,\n    num_leaves=40,\n    subsample=0.8,\n    colsample_bytree=0.8,\n    random_state=42\n)\n\nlgb_model.fit(X_train, y_train)","metadata":{"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# evaluate xg boost\n\ny_train_pred = xgb_model.predict(X_train)\ny_val_pred = xgb_model.predict(X_val)\n\n# Train metrics\ntrain_mse = mean_squared_error(y_train, y_train_pred)\ntrain_corr, _ = pearsonr(y_train, y_train_pred)\n\n# Val metrics\nval_mse = mean_squared_error(y_val, y_val_pred)\nval_corr, _ = pearsonr(y_val, y_val_pred)\n\nprint(f\"Train MSE: {train_mse:.4f}, Val MSE: {val_mse:.4f}\")\nprint(f\"Train Pearson: {train_corr:.4f}, Val Pearson: {val_corr:.4f}\")","metadata":{"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"#evaluate light gbm\n\ny_train_pred = lgb_model.predict(X_train)\ny_val_pred = lgb_model.predict(X_val)\n\n# Train metrics\ntrain_mse = mean_squared_error(y_train, y_train_pred)\ntrain_corr, _ = pearsonr(y_train, y_train_pred)\n\n# Val metrics\nval_mse = mean_squared_error(y_val, y_val_pred)\nval_corr, _ = pearsonr(y_val, y_val_pred)\n\nprint(f\"Train MSE: {train_mse:.4f}, Val MSE: {val_mse:.4f}\")\nprint(f\"Train Pearson: {train_corr:.4f}, Val Pearson: {val_corr:.4f}\")","metadata":{"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"","metadata":{"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"","metadata":{"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"","metadata":{"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"","metadata":{"trusted":true},"outputs":[],"execution_count":null}]}