{
  "id": 349628,
  "title": "LightGBM correlation score (validation) of each column",
  "url": "/competitions/open-problems-multimodal/discussion/349628",
  "author_name": "",
  "post_date": "2022-09-02T04:20:41.841664600Z",
  "votes": 8,
  "comment_count": 4,
  "views": 0,
  "content": "<p>In citeseq prediction step, we have to predict 140 columns and we can predict these columns by using LightGBM (on the other hand, in multiome step, It's difficult to use LightGBM because we have to predict as many as  23418 columns )</p>\n<p>Some public notebook use lightGBM and <a href=\"https://scikit-learn.org/stable/modules/generated/sklearn.multioutput.MultiOutputRegressor.html\" target=\"_blank\">MultiOutputRegressor</a> to parallel the training of each column.<br>\n(ex. <a href=\"https://www.kaggle.com/code/xiafire/lb0-830-lgbm-optuna-msci-citeseq\" target=\"_blank\">https://www.kaggle.com/code/xiafire/lb0-830-lgbm-optuna-msci-citeseq</a>)</p>\n<p>In this case, we can't get detail information about each column, so I stopped using MultiOutputRegressor and tried to get mse and correlation score of each columns.</p>\n<p>The result is as follows. Train epoch was 3000, and default parameter of LightGBM was used. </p>\n<pre><code>column 0 corr : 0.42742, mse : 1.587\ncolumn 1 corr : 0.26612, mse : 0.7435\ncolumn 2 corr : 0.37858, mse : 0.73042\ncolumn 3 corr : 0.69567, mse : 3.3373\ncolumn 4 corr : 0.78367, mse : 1.6105\ncolumn 5 corr : 0.69951, mse : 6.5945\ncolumn 6 corr : 0.83551, mse : 8.5851\ncolumn 7 corr : 0.37232, mse : 0.95906\ncolumn 8 corr : 0.4236, mse : 0.60492\ncolumn 9 corr : 0.51874, mse : 1.1348\ncolumn 10 corr : 0.13112, mse : 0.70519\ncolumn 11 corr : 0.16224, mse : 1.3\ncolumn 12 corr : 0.24292, mse : 1.0288\ncolumn 13 corr : 0.30361, mse : 1.2359\ncolumn 14 corr : 0.66835, mse : 13.79\ncolumn 15 corr : 0.53836, mse : 5.3492\ncolumn 16 corr : 0.6943, mse : 5.5079\ncolumn 17 corr : 0.80723, mse : 2.5513\ncolumn 18 corr : 0.6733, mse : 4.1982\ncolumn 19 corr : 0.095586, mse : 4.0711\ncolumn 20 corr : 0.40377, mse : 0.71356\ncolumn 21 corr : 0.77971, mse : 1.9514\ncolumn 22 corr : 0.084315, mse : 1.0544\ncolumn 23 corr : 0.3648, mse : 1.3238\ncolumn 24 corr : 0.71367, mse : 10.077\ncolumn 25 corr : 0.22287, mse : 0.89397\ncolumn 26 corr : 0.086837, mse : 0.81057\ncolumn 27 corr : 0.19487, mse : 0.77259\ncolumn 28 corr : 0.44912, mse : 0.60956\ncolumn 29 corr : 0.32676, mse : 0.57155\ncolumn 30 corr : 0.27999, mse : 0.64354\ncolumn 31 corr : 0.27316, mse : 0.68355\ncolumn 32 corr : 0.21002, mse : 0.58395\ncolumn 33 corr : 0.18865, mse : 0.59525\ncolumn 34 corr : 0.15787, mse : 0.85502\ncolumn 35 corr : 0.21313, mse : 0.74834\ncolumn 36 corr : 0.42872, mse : 0.89762\ncolumn 37 corr : 0.72655, mse : 17.968\ncolumn 38 corr : 0.42338, mse : 0.75664\ncolumn 39 corr : 0.14268, mse : 1.4524\ncolumn 40 corr : 0.13996, mse : 0.87398\ncolumn 41 corr : 0.27728, mse : 0.98423\ncolumn 42 corr : 0.31822, mse : 0.84024\ncolumn 43 corr : 0.85786, mse : 6.4984\ncolumn 44 corr : 0.27664, mse : 0.74467\ncolumn 45 corr : 0.23616, mse : 0.67678\ncolumn 46 corr : 0.42821, mse : 1.6505\ncolumn 47 corr : 0.38101, mse : 1.125\ncolumn 48 corr : 0.80454, mse : 8.7605\ncolumn 49 corr : 0.16717, mse : 0.69685\ncolumn 50 corr : 0.41376, mse : 0.64471\ncolumn 51 corr : 0.25906, mse : 0.78804\ncolumn 52 corr : 0.60519, mse : 2.3395\ncolumn 53 corr : 0.099069, mse : 1.0339\ncolumn 54 corr : 0.54477, mse : 1.2798\ncolumn 55 corr : 0.63137, mse : 0.89817\ncolumn 56 corr : 0.26927, mse : 0.74435\ncolumn 57 corr : 0.72378, mse : 3.6119\ncolumn 58 corr : 0.27051, mse : 1.3201\ncolumn 59 corr : 0.167, mse : 1.0692\ncolumn 60 corr : 0.42875, mse : 1.1039\ncolumn 61 corr : 0.51522, mse : 0.51254\ncolumn 62 corr : 0.43843, mse : 0.68283\ncolumn 63 corr : 0.33171, mse : 0.63433\ncolumn 64 corr : 0.43446, mse : 1.5482\ncolumn 65 corr : 0.36284, mse : 1.0983\ncolumn 66 corr : 0.5135, mse : 1.5294\ncolumn 67 corr : 0.39328, mse : 0.94378\ncolumn 68 corr : 0.66844, mse : 1.4445\ncolumn 69 corr : 0.42312, mse : 1.081\ncolumn 70 corr : 0.34383, mse : 0.46845\ncolumn 71 corr : 0.32078, mse : 0.48736\ncolumn 72 corr : 0.16551, mse : 1.1104\ncolumn 73 corr : 0.78839, mse : 11.617\ncolumn 74 corr : 0.22975, mse : 0.68587\ncolumn 75 corr : 0.75782, mse : 7.9632\ncolumn 76 corr : 0.19665, mse : 0.94025\ncolumn 77 corr : 0.5266, mse : 3.9247\ncolumn 78 corr : 0.12933, mse : 1.1679\ncolumn 79 corr : 0.41072, mse : 1.0073\ncolumn 80 corr : 0.65375, mse : 5.7579\ncolumn 81 corr : 0.44214, mse : 0.98362\ncolumn 82 corr : 0.48351, mse : 0.73663\ncolumn 83 corr : 0.29811, mse : 0.85087\ncolumn 84 corr : 0.15594, mse : 0.63294\ncolumn 85 corr : 0.19054, mse : 0.60432\ncolumn 86 corr : 0.37158, mse : 0.68677\ncolumn 87 corr : 0.17149, mse : 0.73667\ncolumn 88 corr : 0.71259, mse : 1.5214\ncolumn 89 corr : 0.91071, mse : 4.9133\ncolumn 90 corr : 0.47468, mse : 0.85397\ncolumn 91 corr : 0.25076, mse : 0.57275\ncolumn 92 corr : 0.40818, mse : 0.47832\ncolumn 93 corr : 0.4314, mse : 0.79987\ncolumn 94 corr : 0.77899, mse : 2.0578\ncolumn 95 corr : 0.20019, mse : 3.0368\ncolumn 96 corr : 0.37872, mse : 0.94991\ncolumn 97 corr : 0.76401, mse : 3.0957\ncolumn 98 corr : 0.22201, mse : 0.68278\ncolumn 99 corr : 0.81019, mse : 5.9999\ncolumn 100 corr : 0.74052, mse : 2.2513\ncolumn 101 corr : 0.057188, mse : 1.191\ncolumn 102 corr : 0.542, mse : 9.0587\ncolumn 103 corr : 0.3713, mse : 0.99192\ncolumn 104 corr : 0.73317, mse : 4.1059\ncolumn 105 corr : 0.262, mse : 1.1055\ncolumn 106 corr : 0.73602, mse : 5.261\ncolumn 107 corr : 0.36392, mse : 2.0415\ncolumn 108 corr : 0.84969, mse : 4.0542\ncolumn 109 corr : 0.61389, mse : 2.8284\ncolumn 110 corr : 0.71405, mse : 1.3666\ncolumn 111 corr : 0.71619, mse : 2.663\ncolumn 112 corr : 0.61201, mse : 0.99702\ncolumn 113 corr : 0.79846, mse : 22.457\ncolumn 114 corr : 0.28763, mse : 1.0337\ncolumn 115 corr : 0.50282, mse : 7.5751\ncolumn 116 corr : 0.63954, mse : 2.4324\ncolumn 117 corr : 0.28398, mse : 1.0072\ncolumn 118 corr : 0.29263, mse : 1.4431\ncolumn 119 corr : 0.70502, mse : 6.9682\ncolumn 120 corr : 0.24617, mse : 0.86647\ncolumn 121 corr : 0.68199, mse : 11.657\ncolumn 122 corr : 0.11568, mse : 0.94423\ncolumn 123 corr : 0.086913, mse : 1.129\ncolumn 124 corr : 0.34568, mse : 0.90464\ncolumn 125 corr : 0.318, mse : 0.88465\ncolumn 126 corr : 0.16576, mse : 0.7848\ncolumn 127 corr : 0.56212, mse : 1.0641\ncolumn 128 corr : 0.23079, mse : 0.75945\ncolumn 129 corr : 0.26613, mse : 0.84702\ncolumn 130 corr : 0.21548, mse : 0.66532\ncolumn 131 corr : 0.63861, mse : 6.0231\ncolumn 132 corr : 0.44438, mse : 1.036\ncolumn 133 corr : 0.30064, mse : 0.49387\ncolumn 134 corr : 0.56718, mse : 2.1944\ncolumn 135 corr : 0.36066, mse : 0.77444\ncolumn 136 corr : 0.75436, mse : 3.5668\ncolumn 137 corr : 0.63618, mse : 1.1059\ncolumn 138 corr : 0.82011, mse : 2.4266\ncolumn 139 corr : 0.58421, mse : 4.0052\n</code></pre>",
  "messages": [
    {
      "id": "1923208",
      "postDate": "09/02/2022 04:20:41",
      "content": "<p>In citeseq prediction step, we have to predict 140 columns and we can predict these columns by using LightGBM (on the other hand, in multiome step, It's difficult to use LightGBM because we have to predict as many as  23418 columns )</p>\n<p>Some public notebook use lightGBM and <a href=\"https://scikit-learn.org/stable/modules/generated/sklearn.multioutput.MultiOutputRegressor.html\" target=\"_blank\">MultiOutputRegressor</a> to parallel the training of each column.<br>\n(ex. <a href=\"https://www.kaggle.com/code/xiafire/lb0-830-lgbm-optuna-msci-citeseq\" target=\"_blank\">https://www.kaggle.com/code/xiafire/lb0-830-lgbm-optuna-msci-citeseq</a>)</p>\n<p>In this case, we can't get detail information about each column, so I stopped using MultiOutputRegressor and tried to get mse and correlation score of each columns.</p>\n<p>The result is as follows. Train epoch was 3000, and default parameter of LightGBM was used. </p>\n<pre><code>column 0 corr : 0.42742, mse : 1.587\ncolumn 1 corr : 0.26612, mse : 0.7435\ncolumn 2 corr : 0.37858, mse : 0.73042\ncolumn 3 corr : 0.69567, mse : 3.3373\ncolumn 4 corr : 0.78367, mse : 1.6105\ncolumn 5 corr : 0.69951, mse : 6.5945\ncolumn 6 corr : 0.83551, mse : 8.5851\ncolumn 7 corr : 0.37232, mse : 0.95906\ncolumn 8 corr : 0.4236, mse : 0.60492\ncolumn 9 corr : 0.51874, mse : 1.1348\ncolumn 10 corr : 0.13112, mse : 0.70519\ncolumn 11 corr : 0.16224, mse : 1.3\ncolumn 12 corr : 0.24292, mse : 1.0288\ncolumn 13 corr : 0.30361, mse : 1.2359\ncolumn 14 corr : 0.66835, mse : 13.79\ncolumn 15 corr : 0.53836, mse : 5.3492\ncolumn 16 corr : 0.6943, mse : 5.5079\ncolumn 17 corr : 0.80723, mse : 2.5513\ncolumn 18 corr : 0.6733, mse : 4.1982\ncolumn 19 corr : 0.095586, mse : 4.0711\ncolumn 20 corr : 0.40377, mse : 0.71356\ncolumn 21 corr : 0.77971, mse : 1.9514\ncolumn 22 corr : 0.084315, mse : 1.0544\ncolumn 23 corr : 0.3648, mse : 1.3238\ncolumn 24 corr : 0.71367, mse : 10.077\ncolumn 25 corr : 0.22287, mse : 0.89397\ncolumn 26 corr : 0.086837, mse : 0.81057\ncolumn 27 corr : 0.19487, mse : 0.77259\ncolumn 28 corr : 0.44912, mse : 0.60956\ncolumn 29 corr : 0.32676, mse : 0.57155\ncolumn 30 corr : 0.27999, mse : 0.64354\ncolumn 31 corr : 0.27316, mse : 0.68355\ncolumn 32 corr : 0.21002, mse : 0.58395\ncolumn 33 corr : 0.18865, mse : 0.59525\ncolumn 34 corr : 0.15787, mse : 0.85502\ncolumn 35 corr : 0.21313, mse : 0.74834\ncolumn 36 corr : 0.42872, mse : 0.89762\ncolumn 37 corr : 0.72655, mse : 17.968\ncolumn 38 corr : 0.42338, mse : 0.75664\ncolumn 39 corr : 0.14268, mse : 1.4524\ncolumn 40 corr : 0.13996, mse : 0.87398\ncolumn 41 corr : 0.27728, mse : 0.98423\ncolumn 42 corr : 0.31822, mse : 0.84024\ncolumn 43 corr : 0.85786, mse : 6.4984\ncolumn 44 corr : 0.27664, mse : 0.74467\ncolumn 45 corr : 0.23616, mse : 0.67678\ncolumn 46 corr : 0.42821, mse : 1.6505\ncolumn 47 corr : 0.38101, mse : 1.125\ncolumn 48 corr : 0.80454, mse : 8.7605\ncolumn 49 corr : 0.16717, mse : 0.69685\ncolumn 50 corr : 0.41376, mse : 0.64471\ncolumn 51 corr : 0.25906, mse : 0.78804\ncolumn 52 corr : 0.60519, mse : 2.3395\ncolumn 53 corr : 0.099069, mse : 1.0339\ncolumn 54 corr : 0.54477, mse : 1.2798\ncolumn 55 corr : 0.63137, mse : 0.89817\ncolumn 56 corr : 0.26927, mse : 0.74435\ncolumn 57 corr : 0.72378, mse : 3.6119\ncolumn 58 corr : 0.27051, mse : 1.3201\ncolumn 59 corr : 0.167, mse : 1.0692\ncolumn 60 corr : 0.42875, mse : 1.1039\ncolumn 61 corr : 0.51522, mse : 0.51254\ncolumn 62 corr : 0.43843, mse : 0.68283\ncolumn 63 corr : 0.33171, mse : 0.63433\ncolumn 64 corr : 0.43446, mse : 1.5482\ncolumn 65 corr : 0.36284, mse : 1.0983\ncolumn 66 corr : 0.5135, mse : 1.5294\ncolumn 67 corr : 0.39328, mse : 0.94378\ncolumn 68 corr : 0.66844, mse : 1.4445\ncolumn 69 corr : 0.42312, mse : 1.081\ncolumn 70 corr : 0.34383, mse : 0.46845\ncolumn 71 corr : 0.32078, mse : 0.48736\ncolumn 72 corr : 0.16551, mse : 1.1104\ncolumn 73 corr : 0.78839, mse : 11.617\ncolumn 74 corr : 0.22975, mse : 0.68587\ncolumn 75 corr : 0.75782, mse : 7.9632\ncolumn 76 corr : 0.19665, mse : 0.94025\ncolumn 77 corr : 0.5266, mse : 3.9247\ncolumn 78 corr : 0.12933, mse : 1.1679\ncolumn 79 corr : 0.41072, mse : 1.0073\ncolumn 80 corr : 0.65375, mse : 5.7579\ncolumn 81 corr : 0.44214, mse : 0.98362\ncolumn 82 corr : 0.48351, mse : 0.73663\ncolumn 83 corr : 0.29811, mse : 0.85087\ncolumn 84 corr : 0.15594, mse : 0.63294\ncolumn 85 corr : 0.19054, mse : 0.60432\ncolumn 86 corr : 0.37158, mse : 0.68677\ncolumn 87 corr : 0.17149, mse : 0.73667\ncolumn 88 corr : 0.71259, mse : 1.5214\ncolumn 89 corr : 0.91071, mse : 4.9133\ncolumn 90 corr : 0.47468, mse : 0.85397\ncolumn 91 corr : 0.25076, mse : 0.57275\ncolumn 92 corr : 0.40818, mse : 0.47832\ncolumn 93 corr : 0.4314, mse : 0.79987\ncolumn 94 corr : 0.77899, mse : 2.0578\ncolumn 95 corr : 0.20019, mse : 3.0368\ncolumn 96 corr : 0.37872, mse : 0.94991\ncolumn 97 corr : 0.76401, mse : 3.0957\ncolumn 98 corr : 0.22201, mse : 0.68278\ncolumn 99 corr : 0.81019, mse : 5.9999\ncolumn 100 corr : 0.74052, mse : 2.2513\ncolumn 101 corr : 0.057188, mse : 1.191\ncolumn 102 corr : 0.542, mse : 9.0587\ncolumn 103 corr : 0.3713, mse : 0.99192\ncolumn 104 corr : 0.73317, mse : 4.1059\ncolumn 105 corr : 0.262, mse : 1.1055\ncolumn 106 corr : 0.73602, mse : 5.261\ncolumn 107 corr : 0.36392, mse : 2.0415\ncolumn 108 corr : 0.84969, mse : 4.0542\ncolumn 109 corr : 0.61389, mse : 2.8284\ncolumn 110 corr : 0.71405, mse : 1.3666\ncolumn 111 corr : 0.71619, mse : 2.663\ncolumn 112 corr : 0.61201, mse : 0.99702\ncolumn 113 corr : 0.79846, mse : 22.457\ncolumn 114 corr : 0.28763, mse : 1.0337\ncolumn 115 corr : 0.50282, mse : 7.5751\ncolumn 116 corr : 0.63954, mse : 2.4324\ncolumn 117 corr : 0.28398, mse : 1.0072\ncolumn 118 corr : 0.29263, mse : 1.4431\ncolumn 119 corr : 0.70502, mse : 6.9682\ncolumn 120 corr : 0.24617, mse : 0.86647\ncolumn 121 corr : 0.68199, mse : 11.657\ncolumn 122 corr : 0.11568, mse : 0.94423\ncolumn 123 corr : 0.086913, mse : 1.129\ncolumn 124 corr : 0.34568, mse : 0.90464\ncolumn 125 corr : 0.318, mse : 0.88465\ncolumn 126 corr : 0.16576, mse : 0.7848\ncolumn 127 corr : 0.56212, mse : 1.0641\ncolumn 128 corr : 0.23079, mse : 0.75945\ncolumn 129 corr : 0.26613, mse : 0.84702\ncolumn 130 corr : 0.21548, mse : 0.66532\ncolumn 131 corr : 0.63861, mse : 6.0231\ncolumn 132 corr : 0.44438, mse : 1.036\ncolumn 133 corr : 0.30064, mse : 0.49387\ncolumn 134 corr : 0.56718, mse : 2.1944\ncolumn 135 corr : 0.36066, mse : 0.77444\ncolumn 136 corr : 0.75436, mse : 3.5668\ncolumn 137 corr : 0.63618, mse : 1.1059\ncolumn 138 corr : 0.82011, mse : 2.4266\ncolumn 139 corr : 0.58421, mse : 4.0052\n</code></pre>",
      "rawMarkdown": "In citeseq prediction step, we have to predict 140 columns and we can predict these columns by using LightGBM (on the other hand, in multiome step, It's difficult to use LightGBM because we have to predict as many as  23418 columns )\n\nSome public notebook use lightGBM and [MultiOutputRegressor](https://scikit-learn.org/stable/modules/generated/sklearn.multioutput.MultiOutputRegressor.html) to parallel the training of each column.\n(ex. https://www.kaggle.com/code/xiafire/lb0-830-lgbm-optuna-msci-citeseq)\n\nIn this case, we can't get detail information about each column, so I stopped using MultiOutputRegressor and tried to get mse and correlation score of each columns.\n\nThe result is as follows. Train epoch was 3000, and default parameter of LightGBM was used. \n\n```\ncolumn 0 corr : 0.42742, mse : 1.587\ncolumn 1 corr : 0.26612, mse : 0.7435\ncolumn 2 corr : 0.37858, mse : 0.73042\ncolumn 3 corr : 0.69567, mse : 3.3373\ncolumn 4 corr : 0.78367, mse : 1.6105\ncolumn 5 corr : 0.69951, mse : 6.5945\ncolumn 6 corr : 0.83551, mse : 8.5851\ncolumn 7 corr : 0.37232, mse : 0.95906\ncolumn 8 corr : 0.4236, mse : 0.60492\ncolumn 9 corr : 0.51874, mse : 1.1348\ncolumn 10 corr : 0.13112, mse : 0.70519\ncolumn 11 corr : 0.16224, mse : 1.3\ncolumn 12 corr : 0.24292, mse : 1.0288\ncolumn 13 corr : 0.30361, mse : 1.2359\ncolumn 14 corr : 0.66835, mse : 13.79\ncolumn 15 corr : 0.53836, mse : 5.3492\ncolumn 16 corr : 0.6943, mse : 5.5079\ncolumn 17 corr : 0.80723, mse : 2.5513\ncolumn 18 corr : 0.6733, mse : 4.1982\ncolumn 19 corr : 0.095586, mse : 4.0711\ncolumn 20 corr : 0.40377, mse : 0.71356\ncolumn 21 corr : 0.77971, mse : 1.9514\ncolumn 22 corr : 0.084315, mse : 1.0544\ncolumn 23 corr : 0.3648, mse : 1.3238\ncolumn 24 corr : 0.71367, mse : 10.077\ncolumn 25 corr : 0.22287, mse : 0.89397\ncolumn 26 corr : 0.086837, mse : 0.81057\ncolumn 27 corr : 0.19487, mse : 0.77259\ncolumn 28 corr : 0.44912, mse : 0.60956\ncolumn 29 corr : 0.32676, mse : 0.57155\ncolumn 30 corr : 0.27999, mse : 0.64354\ncolumn 31 corr : 0.27316, mse : 0.68355\ncolumn 32 corr : 0.21002, mse : 0.58395\ncolumn 33 corr : 0.18865, mse : 0.59525\ncolumn 34 corr : 0.15787, mse : 0.85502\ncolumn 35 corr : 0.21313, mse : 0.74834\ncolumn 36 corr : 0.42872, mse : 0.89762\ncolumn 37 corr : 0.72655, mse : 17.968\ncolumn 38 corr : 0.42338, mse : 0.75664\ncolumn 39 corr : 0.14268, mse : 1.4524\ncolumn 40 corr : 0.13996, mse : 0.87398\ncolumn 41 corr : 0.27728, mse : 0.98423\ncolumn 42 corr : 0.31822, mse : 0.84024\ncolumn 43 corr : 0.85786, mse : 6.4984\ncolumn 44 corr : 0.27664, mse : 0.74467\ncolumn 45 corr : 0.23616, mse : 0.67678\ncolumn 46 corr : 0.42821, mse : 1.6505\ncolumn 47 corr : 0.38101, mse : 1.125\ncolumn 48 corr : 0.80454, mse : 8.7605\ncolumn 49 corr : 0.16717, mse : 0.69685\ncolumn 50 corr : 0.41376, mse : 0.64471\ncolumn 51 corr : 0.25906, mse : 0.78804\ncolumn 52 corr : 0.60519, mse : 2.3395\ncolumn 53 corr : 0.099069, mse : 1.0339\ncolumn 54 corr : 0.54477, mse : 1.2798\ncolumn 55 corr : 0.63137, mse : 0.89817\ncolumn 56 corr : 0.26927, mse : 0.74435\ncolumn 57 corr : 0.72378, mse : 3.6119\ncolumn 58 corr : 0.27051, mse : 1.3201\ncolumn 59 corr : 0.167, mse : 1.0692\ncolumn 60 corr : 0.42875, mse : 1.1039\ncolumn 61 corr : 0.51522, mse : 0.51254\ncolumn 62 corr : 0.43843, mse : 0.68283\ncolumn 63 corr : 0.33171, mse : 0.63433\ncolumn 64 corr : 0.43446, mse : 1.5482\ncolumn 65 corr : 0.36284, mse : 1.0983\ncolumn 66 corr : 0.5135, mse : 1.5294\ncolumn 67 corr : 0.39328, mse : 0.94378\ncolumn 68 corr : 0.66844, mse : 1.4445\ncolumn 69 corr : 0.42312, mse : 1.081\ncolumn 70 corr : 0.34383, mse : 0.46845\ncolumn 71 corr : 0.32078, mse : 0.48736\ncolumn 72 corr : 0.16551, mse : 1.1104\ncolumn 73 corr : 0.78839, mse : 11.617\ncolumn 74 corr : 0.22975, mse : 0.68587\ncolumn 75 corr : 0.75782, mse : 7.9632\ncolumn 76 corr : 0.19665, mse : 0.94025\ncolumn 77 corr : 0.5266, mse : 3.9247\ncolumn 78 corr : 0.12933, mse : 1.1679\ncolumn 79 corr : 0.41072, mse : 1.0073\ncolumn 80 corr : 0.65375, mse : 5.7579\ncolumn 81 corr : 0.44214, mse : 0.98362\ncolumn 82 corr : 0.48351, mse : 0.73663\ncolumn 83 corr : 0.29811, mse : 0.85087\ncolumn 84 corr : 0.15594, mse : 0.63294\ncolumn 85 corr : 0.19054, mse : 0.60432\ncolumn 86 corr : 0.37158, mse : 0.68677\ncolumn 87 corr : 0.17149, mse : 0.73667\ncolumn 88 corr : 0.71259, mse : 1.5214\ncolumn 89 corr : 0.91071, mse : 4.9133\ncolumn 90 corr : 0.47468, mse : 0.85397\ncolumn 91 corr : 0.25076, mse : 0.57275\ncolumn 92 corr : 0.40818, mse : 0.47832\ncolumn 93 corr : 0.4314, mse : 0.79987\ncolumn 94 corr : 0.77899, mse : 2.0578\ncolumn 95 corr : 0.20019, mse : 3.0368\ncolumn 96 corr : 0.37872, mse : 0.94991\ncolumn 97 corr : 0.76401, mse : 3.0957\ncolumn 98 corr : 0.22201, mse : 0.68278\ncolumn 99 corr : 0.81019, mse : 5.9999\ncolumn 100 corr : 0.74052, mse : 2.2513\ncolumn 101 corr : 0.057188, mse : 1.191\ncolumn 102 corr : 0.542, mse : 9.0587\ncolumn 103 corr : 0.3713, mse : 0.99192\ncolumn 104 corr : 0.73317, mse : 4.1059\ncolumn 105 corr : 0.262, mse : 1.1055\ncolumn 106 corr : 0.73602, mse : 5.261\ncolumn 107 corr : 0.36392, mse : 2.0415\ncolumn 108 corr : 0.84969, mse : 4.0542\ncolumn 109 corr : 0.61389, mse : 2.8284\ncolumn 110 corr : 0.71405, mse : 1.3666\ncolumn 111 corr : 0.71619, mse : 2.663\ncolumn 112 corr : 0.61201, mse : 0.99702\ncolumn 113 corr : 0.79846, mse : 22.457\ncolumn 114 corr : 0.28763, mse : 1.0337\ncolumn 115 corr : 0.50282, mse : 7.5751\ncolumn 116 corr : 0.63954, mse : 2.4324\ncolumn 117 corr : 0.28398, mse : 1.0072\ncolumn 118 corr : 0.29263, mse : 1.4431\ncolumn 119 corr : 0.70502, mse : 6.9682\ncolumn 120 corr : 0.24617, mse : 0.86647\ncolumn 121 corr : 0.68199, mse : 11.657\ncolumn 122 corr : 0.11568, mse : 0.94423\ncolumn 123 corr : 0.086913, mse : 1.129\ncolumn 124 corr : 0.34568, mse : 0.90464\ncolumn 125 corr : 0.318, mse : 0.88465\ncolumn 126 corr : 0.16576, mse : 0.7848\ncolumn 127 corr : 0.56212, mse : 1.0641\ncolumn 128 corr : 0.23079, mse : 0.75945\ncolumn 129 corr : 0.26613, mse : 0.84702\ncolumn 130 corr : 0.21548, mse : 0.66532\ncolumn 131 corr : 0.63861, mse : 6.0231\ncolumn 132 corr : 0.44438, mse : 1.036\ncolumn 133 corr : 0.30064, mse : 0.49387\ncolumn 134 corr : 0.56718, mse : 2.1944\ncolumn 135 corr : 0.36066, mse : 0.77444\ncolumn 136 corr : 0.75436, mse : 3.5668\ncolumn 137 corr : 0.63618, mse : 1.1059\ncolumn 138 corr : 0.82011, mse : 2.4266\ncolumn 139 corr : 0.58421, mse : 4.0052\n```",
      "votes": null
    },
    {
      "id": "1924197",
      "postDate": "09/02/2022 19:41:07",
      "content": "<p>Nice! Thanks.<br>\nIt would be nice for biology to get feature importance  and somehow analyse it.<br>\nYes there are many targets ,so it is messy, but still </p>",
      "rawMarkdown": "Nice! Thanks.\nIt would be nice for biology to get feature importance  and somehow analyse it.\nYes there are many targets ,so it is messy, but still",
      "votes": null
    },
    {
      "id": "1924601",
      "postDate": "09/03/2022 08:03:20",
      "content": "<p>I will try checking feature importance of each features, but train_data has huge columns.<br>\nI will also check other discussions to reveal important features.</p>",
      "rawMarkdown": "I will try checking feature importance of each features, but train_data has huge columns.\nI will also check other discussions to reveal important features.",
      "votes": null
    },
    {
      "id": "1924617",
      "postDate": "09/03/2022 08:27:44",
      "content": "<p>The first important feature should be gene itself.<br>\nTake a look:<br>\n<a href=\"https://www.kaggle.com/competitions/open-problems-multimodal/discussion/349242\" target=\"_blank\">https://www.kaggle.com/competitions/open-problems-multimodal/discussion/349242</a></p>",
      "rawMarkdown": "The first important feature should be gene itself.\nTake a look:\nhttps://www.kaggle.com/competitions/open-problems-multimodal/discussion/349242",
      "votes": null
    },
    {
      "id": "1924631",
      "postDate": "09/03/2022 08:53:52",
      "content": "<p>Thank you for the excellent information!<br>\nThose features sound very important.</p>",
      "rawMarkdown": "Thank you for the excellent information!\nThose features sound very important.",
      "votes": null
    }
  ],
  "comments": [
    {
      "id": 1924197,
      "author_name": "alexandervc",
      "author_url": "",
      "post_date": "09/02/2022 19:41:07",
      "content": "<p>Nice! Thanks.<br>\nIt would be nice for biology to get feature importance  and somehow analyse it.<br>\nYes there are many targets ,so it is messy, but still </p>",
      "votes": null,
      "replies": [
        {
          "id": 1924601,
          "author_name": "kotanoda",
          "author_url": "",
          "post_date": "09/03/2022 08:03:20",
          "content": "<p>I will try checking feature importance of each features, but train_data has huge columns.<br>\nI will also check other discussions to reveal important features.</p>",
          "votes": null,
          "replies": []
        },
        {
          "id": 1924617,
          "author_name": "alexandervc",
          "author_url": "",
          "post_date": "09/03/2022 08:27:44",
          "content": "<p>The first important feature should be gene itself.<br>\nTake a look:<br>\n<a href=\"https://www.kaggle.com/competitions/open-problems-multimodal/discussion/349242\" target=\"_blank\">https://www.kaggle.com/competitions/open-problems-multimodal/discussion/349242</a></p>",
          "votes": null,
          "replies": []
        },
        {
          "id": 1924631,
          "author_name": "kotanoda",
          "author_url": "",
          "post_date": "09/03/2022 08:53:52",
          "content": "<p>Thank you for the excellent information!<br>\nThose features sound very important.</p>",
          "votes": null,
          "replies": []
        }
      ]
    }
  ],
  "raw_markdown_by_id": {
    "1923208": "In citeseq prediction step, we have to predict 140 columns and we can predict these columns by using LightGBM (on the other hand, in multiome step, It's difficult to use LightGBM because we have to predict as many as  23418 columns )\n\nSome public notebook use lightGBM and [MultiOutputRegressor](https://scikit-learn.org/stable/modules/generated/sklearn.multioutput.MultiOutputRegressor.html) to parallel the training of each column.\n(ex. https://www.kaggle.com/code/xiafire/lb0-830-lgbm-optuna-msci-citeseq)\n\nIn this case, we can't get detail information about each column, so I stopped using MultiOutputRegressor and tried to get mse and correlation score of each columns.\n\nThe result is as follows. Train epoch was 3000, and default parameter of LightGBM was used. \n\n```\ncolumn 0 corr : 0.42742, mse : 1.587\ncolumn 1 corr : 0.26612, mse : 0.7435\ncolumn 2 corr : 0.37858, mse : 0.73042\ncolumn 3 corr : 0.69567, mse : 3.3373\ncolumn 4 corr : 0.78367, mse : 1.6105\ncolumn 5 corr : 0.69951, mse : 6.5945\ncolumn 6 corr : 0.83551, mse : 8.5851\ncolumn 7 corr : 0.37232, mse : 0.95906\ncolumn 8 corr : 0.4236, mse : 0.60492\ncolumn 9 corr : 0.51874, mse : 1.1348\ncolumn 10 corr : 0.13112, mse : 0.70519\ncolumn 11 corr : 0.16224, mse : 1.3\ncolumn 12 corr : 0.24292, mse : 1.0288\ncolumn 13 corr : 0.30361, mse : 1.2359\ncolumn 14 corr : 0.66835, mse : 13.79\ncolumn 15 corr : 0.53836, mse : 5.3492\ncolumn 16 corr : 0.6943, mse : 5.5079\ncolumn 17 corr : 0.80723, mse : 2.5513\ncolumn 18 corr : 0.6733, mse : 4.1982\ncolumn 19 corr : 0.095586, mse : 4.0711\ncolumn 20 corr : 0.40377, mse : 0.71356\ncolumn 21 corr : 0.77971, mse : 1.9514\ncolumn 22 corr : 0.084315, mse : 1.0544\ncolumn 23 corr : 0.3648, mse : 1.3238\ncolumn 24 corr : 0.71367, mse : 10.077\ncolumn 25 corr : 0.22287, mse : 0.89397\ncolumn 26 corr : 0.086837, mse : 0.81057\ncolumn 27 corr : 0.19487, mse : 0.77259\ncolumn 28 corr : 0.44912, mse : 0.60956\ncolumn 29 corr : 0.32676, mse : 0.57155\ncolumn 30 corr : 0.27999, mse : 0.64354\ncolumn 31 corr : 0.27316, mse : 0.68355\ncolumn 32 corr : 0.21002, mse : 0.58395\ncolumn 33 corr : 0.18865, mse : 0.59525\ncolumn 34 corr : 0.15787, mse : 0.85502\ncolumn 35 corr : 0.21313, mse : 0.74834\ncolumn 36 corr : 0.42872, mse : 0.89762\ncolumn 37 corr : 0.72655, mse : 17.968\ncolumn 38 corr : 0.42338, mse : 0.75664\ncolumn 39 corr : 0.14268, mse : 1.4524\ncolumn 40 corr : 0.13996, mse : 0.87398\ncolumn 41 corr : 0.27728, mse : 0.98423\ncolumn 42 corr : 0.31822, mse : 0.84024\ncolumn 43 corr : 0.85786, mse : 6.4984\ncolumn 44 corr : 0.27664, mse : 0.74467\ncolumn 45 corr : 0.23616, mse : 0.67678\ncolumn 46 corr : 0.42821, mse : 1.6505\ncolumn 47 corr : 0.38101, mse : 1.125\ncolumn 48 corr : 0.80454, mse : 8.7605\ncolumn 49 corr : 0.16717, mse : 0.69685\ncolumn 50 corr : 0.41376, mse : 0.64471\ncolumn 51 corr : 0.25906, mse : 0.78804\ncolumn 52 corr : 0.60519, mse : 2.3395\ncolumn 53 corr : 0.099069, mse : 1.0339\ncolumn 54 corr : 0.54477, mse : 1.2798\ncolumn 55 corr : 0.63137, mse : 0.89817\ncolumn 56 corr : 0.26927, mse : 0.74435\ncolumn 57 corr : 0.72378, mse : 3.6119\ncolumn 58 corr : 0.27051, mse : 1.3201\ncolumn 59 corr : 0.167, mse : 1.0692\ncolumn 60 corr : 0.42875, mse : 1.1039\ncolumn 61 corr : 0.51522, mse : 0.51254\ncolumn 62 corr : 0.43843, mse : 0.68283\ncolumn 63 corr : 0.33171, mse : 0.63433\ncolumn 64 corr : 0.43446, mse : 1.5482\ncolumn 65 corr : 0.36284, mse : 1.0983\ncolumn 66 corr : 0.5135, mse : 1.5294\ncolumn 67 corr : 0.39328, mse : 0.94378\ncolumn 68 corr : 0.66844, mse : 1.4445\ncolumn 69 corr : 0.42312, mse : 1.081\ncolumn 70 corr : 0.34383, mse : 0.46845\ncolumn 71 corr : 0.32078, mse : 0.48736\ncolumn 72 corr : 0.16551, mse : 1.1104\ncolumn 73 corr : 0.78839, mse : 11.617\ncolumn 74 corr : 0.22975, mse : 0.68587\ncolumn 75 corr : 0.75782, mse : 7.9632\ncolumn 76 corr : 0.19665, mse : 0.94025\ncolumn 77 corr : 0.5266, mse : 3.9247\ncolumn 78 corr : 0.12933, mse : 1.1679\ncolumn 79 corr : 0.41072, mse : 1.0073\ncolumn 80 corr : 0.65375, mse : 5.7579\ncolumn 81 corr : 0.44214, mse : 0.98362\ncolumn 82 corr : 0.48351, mse : 0.73663\ncolumn 83 corr : 0.29811, mse : 0.85087\ncolumn 84 corr : 0.15594, mse : 0.63294\ncolumn 85 corr : 0.19054, mse : 0.60432\ncolumn 86 corr : 0.37158, mse : 0.68677\ncolumn 87 corr : 0.17149, mse : 0.73667\ncolumn 88 corr : 0.71259, mse : 1.5214\ncolumn 89 corr : 0.91071, mse : 4.9133\ncolumn 90 corr : 0.47468, mse : 0.85397\ncolumn 91 corr : 0.25076, mse : 0.57275\ncolumn 92 corr : 0.40818, mse : 0.47832\ncolumn 93 corr : 0.4314, mse : 0.79987\ncolumn 94 corr : 0.77899, mse : 2.0578\ncolumn 95 corr : 0.20019, mse : 3.0368\ncolumn 96 corr : 0.37872, mse : 0.94991\ncolumn 97 corr : 0.76401, mse : 3.0957\ncolumn 98 corr : 0.22201, mse : 0.68278\ncolumn 99 corr : 0.81019, mse : 5.9999\ncolumn 100 corr : 0.74052, mse : 2.2513\ncolumn 101 corr : 0.057188, mse : 1.191\ncolumn 102 corr : 0.542, mse : 9.0587\ncolumn 103 corr : 0.3713, mse : 0.99192\ncolumn 104 corr : 0.73317, mse : 4.1059\ncolumn 105 corr : 0.262, mse : 1.1055\ncolumn 106 corr : 0.73602, mse : 5.261\ncolumn 107 corr : 0.36392, mse : 2.0415\ncolumn 108 corr : 0.84969, mse : 4.0542\ncolumn 109 corr : 0.61389, mse : 2.8284\ncolumn 110 corr : 0.71405, mse : 1.3666\ncolumn 111 corr : 0.71619, mse : 2.663\ncolumn 112 corr : 0.61201, mse : 0.99702\ncolumn 113 corr : 0.79846, mse : 22.457\ncolumn 114 corr : 0.28763, mse : 1.0337\ncolumn 115 corr : 0.50282, mse : 7.5751\ncolumn 116 corr : 0.63954, mse : 2.4324\ncolumn 117 corr : 0.28398, mse : 1.0072\ncolumn 118 corr : 0.29263, mse : 1.4431\ncolumn 119 corr : 0.70502, mse : 6.9682\ncolumn 120 corr : 0.24617, mse : 0.86647\ncolumn 121 corr : 0.68199, mse : 11.657\ncolumn 122 corr : 0.11568, mse : 0.94423\ncolumn 123 corr : 0.086913, mse : 1.129\ncolumn 124 corr : 0.34568, mse : 0.90464\ncolumn 125 corr : 0.318, mse : 0.88465\ncolumn 126 corr : 0.16576, mse : 0.7848\ncolumn 127 corr : 0.56212, mse : 1.0641\ncolumn 128 corr : 0.23079, mse : 0.75945\ncolumn 129 corr : 0.26613, mse : 0.84702\ncolumn 130 corr : 0.21548, mse : 0.66532\ncolumn 131 corr : 0.63861, mse : 6.0231\ncolumn 132 corr : 0.44438, mse : 1.036\ncolumn 133 corr : 0.30064, mse : 0.49387\ncolumn 134 corr : 0.56718, mse : 2.1944\ncolumn 135 corr : 0.36066, mse : 0.77444\ncolumn 136 corr : 0.75436, mse : 3.5668\ncolumn 137 corr : 0.63618, mse : 1.1059\ncolumn 138 corr : 0.82011, mse : 2.4266\ncolumn 139 corr : 0.58421, mse : 4.0052\n```",
    "1924197": "Nice! Thanks.\nIt would be nice for biology to get feature importance  and somehow analyse it.\nYes there are many targets ,so it is messy, but still",
    "1924601": "I will try checking feature importance of each features, but train_data has huge columns.\nI will also check other discussions to reveal important features.",
    "1924617": "The first important feature should be gene itself.\nTake a look:\nhttps://www.kaggle.com/competitions/open-problems-multimodal/discussion/349242",
    "1924631": "Thank you for the excellent information!\nThose features sound very important."
  },
  "source": "meta"
}