{"cells":[{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"import os\nimport numpy as np\nimport pandas as pd\nimport matplotlib.pyplot as plt\nplt.style.use(\"ggplot\")\nimport seaborn as sns","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","trusted":true},"cell_type":"code","source":"train_stft = pd.read_csv(\"../input/volcano-20201231-feature-engineering/train_features.csv\")\ntest_stft = pd.read_csv(\"../input/volcano-20201231-feature-engineering/test_features.csv\")\n\ntrain_fft = pd.read_csv(\"../input/volcano-2020-10-19/train_features.csv\")\ntest_fft = pd.read_csv(\"../input/volcano-2020-10-19/test_features.csv\")\n\ntrain_features = pd.concat([train_stft, train_fft], axis=1)\ntest_features = pd.concat([test_stft, test_fft], axis=1)\n\nfeatures = pd.concat([train_features, test_features], axis=0)\nfeatures.fillna(0, inplace=True)\nfeatures","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"tmp = features.sample(n=40, axis=1, random_state=91)\ntmp","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fig, axes = plt.subplots(8, 5, figsize=(25, 20))\n\nfor i, col in enumerate(tmp.columns):\n    axes.ravel()[i].hist(tmp[col], bins=50, color=\"teal\")\n    \nplt.show()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"from scipy.special import erfinv\n\n# ランクガウス変換する関数を定義する\ndef rank_gauss(x):\n    n = x.shape[0]    # サンプル数\n    temp = x.argsort()\n    rank_x = temp.argsort() / n\n    rank_x -= rank_x.mean()\n    rank_x *= 2\n    efi_x = erfinv(rank_x)\n    efi_x -= efi_x.mean()\n    return efi_x","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fig, axes = plt.subplots(8, 5, figsize=(25, 20))\n\nfor i, col in enumerate(tmp.columns):\n    rg = rank_gauss(tmp[col])\n    axes.ravel()[i].hist(rg, bins=50, color=\"teal\")\n    \nplt.show()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"X_rg = pd.DataFrame()\n\nfor col in features.columns:\n    rg = rank_gauss(features[col])\n    X_rg = pd.concat([X_rg, rg], axis=1)\n    \nX_rg","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"X = X_rg.iloc[:len(train_features), :]\nX_test = X_rg.iloc[len(train_features):, :]\n\nX = np.array(X)\nX_test = np.array(X_test)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train = pd.read_csv(\"../input/predict-volcanic-eruptions-ingv-oe/train.csv\")\ny = train[\"time_to_eruption\"]\ny","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"## Prediction"},{"metadata":{"trusted":true},"cell_type":"code","source":"import lightgbm as lgb\nfrom sklearn.model_selection import train_test_split, KFold\nfrom sklearn.metrics import mean_absolute_error as mae\nfrom hyperopt import fmin, tpe, hp, STATUS_OK, Trials","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"X_train, X_val, y_train, y_val = train_test_split(X, y, test_size=0.2, random_state=34)\n\nprint(X_train.shape)\nprint(X_val.shape)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"kf1 = KFold(n_splits=10, shuffle=True, random_state=95)\nkf2 = KFold(n_splits=10, shuffle=True, random_state=43)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"## lgb"},{"metadata":{"trusted":true},"cell_type":"code","source":"lgb_train = lgb.Dataset(X_train, label=y_train)\nlgb_val = lgb.Dataset(X_val, label=y_val, reference=lgb_train)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"def lgb_score(params):\n\n    params[\"num_leaves\"] = int(params[\"num_leaves\"])\n    params[\"min_data_in_leaf\"] = int(params[\"min_data_in_leaf\"])\n\n    model = lgb.train(params=lgb_params,\n                      train_set=lgb_train,\n                      valid_sets=(lgb_train, lgb_val),\n                      num_boost_round=10000,\n                      early_stopping_rounds=20,\n                      verbose_eval=0)\n    \n    pred = model.predict(X_val, num_iteration=model.best_iteration)    \n    score = mae(pred, y_val)\n    \n    history.append((params, score))\n    \n    return {\"loss\": score, \"status\": STATUS_OK}","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"lgb_params = {\n    \"task\": \"train\",\n    \"boosting_type\": \"gbdt\",\n    \"objective\": \"regression\",\n    \"eval_metric\": \"mae\",\n    \"num_leaves\": 31,\n    \"learning_rate\": 0.08,\n    \"bagging_fraction\": 0.8,\n    \"feature_fraction\": 0.8,\n    \"min_data_in_leaf\": 20,\n    \"random_state\": 93\n}\n\n# 探索するパラメータ空間を指定\nparams_space = {\n    \"num_leaves\": hp.quniform(\"num_leaves\", 25, 50, 1),\n    \"min_data_in_leaf\": hp.quniform(\"min_data_in_leaf\", 10, 70, 1),\n    \"bagging_fraction\": hp.quniform(\"bagging_fraction\", 0.6, 0.95, 0.025),\n    \"feature_fraction\": hp.quniform(\"feature_fraction\", 0.6, 0.95, 0.025)\n}\n\ntrials = Trials()\nhistory = []\n\nfmin(lgb_score, params_space, algo=tpe.suggest, trials=trials, max_evals=100)\n\nhistory = sorted(history, key=lambda tpl: tpl[1])\nbest = history[0]\n\nprint(f\"best_params: {best[0]}, mae: {best[1]:.10f}\")","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"lgb_params = {\n    \"task\": \"train\",\n    \"boosting_type\": \"gbdt\",\n    \"objective\": \"regression\",\n    \"eval_metric\": \"mae\",\n    \"num_leaves\": best[0][\"num_leaves\"],\n    \"learning_rate\": 0.05,\n    \"bagging_fraction\": best[0][\"bagging_fraction\"],\n    \"feature_fraction\": best[0][\"feature_fraction\"],\n    \"min_data_in_leaf\": best[0][\"min_data_in_leaf\"],\n    \"random_state\": 93\n}","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"pred_lgb1 = pd.DataFrame()\n\nfor k, (tr_id, vl_id) in enumerate(kf1.split(X, y)):\n    \n    X_train, X_val = X[tr_id, :], X[vl_id, :]\n    y_train, y_val = y[tr_id], y[vl_id]\n    \n    lgb_train = lgb.Dataset(X_train, label=y_train)\n    lgb_val = lgb.Dataset(X_val, label=y_val, reference=lgb_train)\n    \n    model = lgb.train(params=lgb_params,\n                      train_set=lgb_train,\n                      valid_sets=(lgb_train, lgb_val),\n                      num_boost_round=20000,\n                      early_stopping_rounds=100,\n                      verbose_eval=0)\n    \n    pred = model.predict(X_val, num_iteration=model.best_iteration)\n    print(f\"k={k+1}, mae: {mae(pred, y_val)}\")\n    \n    pred = model.predict(X_test, num_iteration=model.best_iteration)\n    pred = pd.Series(pred)\n    pred_lgb1 = pd.concat([pred_lgb1, pred], axis=1)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"pred_lgb1","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"pred_lgb2 = pd.DataFrame()\n\nfor k, (tr_id, vl_id) in enumerate(kf2.split(X, y)):\n    \n    X_train, X_val = X[tr_id, :], X[vl_id, :]\n    y_train, y_val = y[tr_id], y[vl_id]\n    \n    lgb_train = lgb.Dataset(X_train, label=y_train)\n    lgb_val = lgb.Dataset(X_val, label=y_val, reference=lgb_train)\n    \n    model = lgb.train(params=lgb_params,\n                      train_set=lgb_train,\n                      valid_sets=(lgb_train, lgb_val),\n                      num_boost_round=20000,\n                      early_stopping_rounds=100,\n                      verbose_eval=0)\n    \n    pred = model.predict(X_val, num_iteration=model.best_iteration)\n    print(f\"k={k+1}, mae: {mae(pred, y_val)}\")\n    \n    pred = model.predict(X_test, num_iteration=model.best_iteration)\n    pred = pd.Series(pred)\n    pred_lgb2 = pd.concat([pred_lgb2, pred], axis=1)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"pred_lgb2","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"# Submission"},{"metadata":{"trusted":true},"cell_type":"code","source":"pred = pd.concat([pred_lgb1, pred_lgb2], axis=1)\npred = pred.mean(axis=1)\npred","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"sample_sub = pd.read_csv(\"../input/predict-volcanic-eruptions-ingv-oe/sample_submission.csv\")\nsub = sample_sub.copy()\nsub[\"time_to_eruption\"] = pred\n\nsub","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"sub.to_csv(\"submission.csv\", index=False)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat":4,"nbformat_minor":4}