{"cells":[{"metadata":{},"cell_type":"markdown","source":"I made too much simple XGboosting model.\nhttps://www.kaggle.com/artgor helped me.\n\nI'm beginner, so there may be many strange point.\nPlease give me a advise.\n\n--------------------------------------------------------------\n\nXGboostingによるシンプルな回帰モデルを構築しました。\nhttps://www.kaggle.com/artgor　さんのkernelsを参考にさせていただきました。\n\n日本語で書かれたkernelsがほとんどなかったため\n少しでも初心者の助けになればとこちらのkernelsを作成します。\n\nなお、私自身も初心者ですので理解のできていない点が多くあるかと思います。\nご指摘やアドバイスがあれば是非お願いします。"},{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true,"_kg_hide-input":true,"_kg_hide-output":true},"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load in \n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\nimport matplotlib.pyplot as plt\n%matplotlib inline\nfrom tqdm import tqdm_notebook\nfrom sklearn.preprocessing import StandardScaler\nfrom sklearn.svm import NuSVR, SVR\nfrom sklearn.metrics import mean_absolute_error\npd.options.display.precision = 15\n\nimport lightgbm as lgb\nimport xgboost as xgb\nimport time\nimport datetime\n\nfrom sklearn.preprocessing import LabelEncoder\nfrom sklearn.model_selection import StratifiedKFold, KFold, RepeatedKFold\nfrom sklearn.metrics import mean_squared_error, mean_absolute_error\nfrom sklearn.linear_model import Ridge, RidgeCV\nimport gc\nfrom catboost import CatBoostRegressor\nimport seaborn as sns\n# Input data files are available in the \"../input/\" directory.\n# For example, running this (by clicking run or pressing Shift+Enter) will list the files in the input directory\n\nimport os\nprint(os.listdir(\"../input\"))\n","execution_count":1,"outputs":[{"output_type":"stream","text":"['test', 'train.csv', 'sample_submission.csv']\n","name":"stdout"}]},{"metadata":{},"cell_type":"markdown","source":"Loading Data.\n\n-------------------\n\nデータの読み込み。"},{"metadata":{"_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","trusted":true},"cell_type":"code","source":"X = pd.read_csv(\"../input/train.csv\", nrows = 600000000, dtype={'acoustic_data': np.int16, 'time_to_failure': np.float64})","execution_count":2,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Making Features.\n\n-----------------------\n\n特徴量の作成。"},{"metadata":{"trusted":true},"cell_type":"code","source":"%time\n\nrows = 150_000\ntrain = X\nsegments = int(np.floor(train.shape[0] / rows))\n\nX_tr = pd.DataFrame(index=range(segments), dtype=np.float64,\n                       columns=['ave', 'std', 'max', 'min',\n                               'av_change_abs', 'av_change_rate', 'abs_max', 'abs_min',\n                               'std_first_50000', 'std_last_50000', 'std_first_10000', 'std_last_10000',\n                               'avg_first_50000', 'avg_last_50000', 'avg_first_10000', 'avg_last_10000',\n                               'min_first_50000', 'min_last_50000', 'min_first_10000', 'min_last_10000',\n                               'max_first_50000', 'max_last_50000', 'max_first_10000', 'max_last_10000'])\ny_tr = pd.DataFrame(index=range(segments), dtype=np.float64,\n                       columns=['time_to_failure'])\n\ntotal_mean = train['acoustic_data'].mean()\ntotal_std = train['acoustic_data'].std()\ntotal_max = train['acoustic_data'].max()\ntotal_min = train['acoustic_data'].min()\ntotal_sum = train['acoustic_data'].sum()\ntotal_abs_max = np.abs(train['acoustic_data']).sum()\n\nfor segment in tqdm_notebook(range(segments)):\n    seg = train.iloc[segment*rows:segment*rows+rows]\n    x = seg['acoustic_data'].values\n    y = seg['time_to_failure'].values[-1]\n    \n    y_tr.loc[segment, 'time_to_failure'] = y\n    X_tr.loc[segment, 'ave'] = x.mean()\n    X_tr.loc[segment, 'std'] = x.std()\n    X_tr.loc[segment, 'max'] = x.max()\n    X_tr.loc[segment, 'min'] = x.min()\n    \n    \n    X_tr.loc[segment, 'av_change_abs'] = np.mean(np.diff(x))\n    X_tr.loc[segment, 'av_change_rate'] = np.mean(np.nonzero((np.diff(x) / x[:-1]))[0])\n    X_tr.loc[segment, 'abs_max'] = np.abs(x).max()\n    X_tr.loc[segment, 'abs_min'] = np.abs(x).min()\n    \n    X_tr.loc[segment, 'std_first_50000'] = x[:50000].std()\n    X_tr.loc[segment, 'std_last_50000'] = x[-50000:].std()\n    X_tr.loc[segment, 'std_first_10000'] = x[:10000].std()\n    X_tr.loc[segment, 'std_last_10000'] = x[-10000:].std()\n    \n    X_tr.loc[segment, 'avg_first_50000'] = x[:50000].mean()\n    X_tr.loc[segment, 'avg_last_50000'] = x[-50000:].mean()\n    X_tr.loc[segment, 'avg_first_10000'] = x[:10000].mean()\n    X_tr.loc[segment, 'avg_last_10000'] = x[-10000:].mean()\n    \n    X_tr.loc[segment, 'min_first_50000'] = x[:50000].min()\n    X_tr.loc[segment, 'min_last_50000'] = x[-50000:].min()\n    X_tr.loc[segment, 'min_first_10000'] = x[:10000].min()\n    X_tr.loc[segment, 'min_last_10000'] = x[-10000:].min()\n    \n    X_tr.loc[segment, 'max_first_50000'] = x[:50000].max()\n    X_tr.loc[segment, 'max_last_50000'] = x[-50000:].max()\n    X_tr.loc[segment, 'max_first_10000'] = x[:10000].max()\n    X_tr.loc[segment, 'max_last_10000'] = x[-10000:].max()","execution_count":3,"outputs":[{"output_type":"stream","text":"CPU times: user 0 ns, sys: 0 ns, total: 0 ns\nWall time: 9.54 µs\n","name":"stdout"},{"output_type":"display_data","data":{"text/plain":"HBox(children=(IntProgress(value=0, max=4000), HTML(value='')))","application/vnd.jupyter.widget-view+json":{"version_major":2,"version_minor":0,"model_id":"9a46925cd4b347ebb31dc4eab172b8fb"}},"metadata":{}},{"output_type":"stream","text":"/opt/conda/lib/python3.6/site-packages/ipykernel_launcher.py:37: RuntimeWarning: divide by zero encountered in true_divide\n/opt/conda/lib/python3.6/site-packages/ipykernel_launcher.py:37: RuntimeWarning: invalid value encountered in true_divide\n","name":"stderr"},{"output_type":"stream","text":"\n","name":"stdout"}]},{"metadata":{},"cell_type":"markdown","source":"Normalize Features.\n\n------------------------\n\n作成した特徴量の正規化。"},{"metadata":{"trusted":true},"cell_type":"code","source":"scaler = StandardScaler()\nscaler.fit(X_tr)\nX_train_scaled = pd.DataFrame(scaler.transform(X_tr), columns=X_tr.columns)","execution_count":4,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Making data to predict.\n\n--------------------------------\n\n訓練データの作成。"},{"metadata":{"trusted":true},"cell_type":"code","source":"submission = pd.read_csv('../input/sample_submission.csv', index_col='seg_id')\nX_test = pd.DataFrame(columns=X_tr.columns, dtype=np.float64, index=submission.index)\nplt.figure(figsize=(22, 16))\n\nfor i, seg_id in enumerate(tqdm_notebook(X_test.index)):\n    seg = pd.read_csv('../input/test/' + seg_id + '.csv')\n    \n    x = seg['acoustic_data'].values\n    X_test.loc[seg_id, 'ave'] = x.mean()\n    X_test.loc[seg_id, 'std'] = x.std()\n    X_test.loc[seg_id, 'max'] = x.max()\n    X_test.loc[seg_id, 'min'] = x.min()\n        \n    X_test.loc[seg_id, 'av_change_abs'] = np.mean(np.diff(x))\n    X_test.loc[seg_id, 'av_change_rate'] = np.mean(np.nonzero((np.diff(x) / x[:-1]))[0])\n    X_test.loc[seg_id, 'abs_max'] = np.abs(x).max()\n    X_test.loc[seg_id, 'abs_min'] = np.abs(x).min()\n    \n    X_test.loc[seg_id, 'std_first_50000'] = x[:50000].std()\n    X_test.loc[seg_id, 'std_last_50000'] = x[-50000:].std()\n    X_test.loc[seg_id, 'std_first_10000'] = x[:10000].std()\n    X_test.loc[seg_id, 'std_last_10000'] = x[-10000:].std()\n    \n    X_test.loc[seg_id, 'avg_first_50000'] = x[:50000].mean()\n    X_test.loc[seg_id, 'avg_last_50000'] = x[-50000:].mean()\n    X_test.loc[seg_id, 'avg_first_10000'] = x[:10000].mean()\n    X_test.loc[seg_id, 'avg_last_10000'] = x[-10000:].mean()\n    \n    X_test.loc[seg_id, 'min_first_50000'] = x[:50000].min()\n    X_test.loc[seg_id, 'min_last_50000'] = x[-50000:].min()\n    X_test.loc[seg_id, 'min_first_10000'] = x[:10000].min()\n    X_test.loc[seg_id, 'min_last_10000'] = x[-10000:].min()\n    \n    X_test.loc[seg_id, 'max_first_50000'] = x[:50000].max()\n    X_test.loc[seg_id, 'max_last_50000'] = x[-50000:].max()\n    X_test.loc[seg_id, 'max_first_10000'] = x[:10000].max()\n    X_test.loc[seg_id, 'max_last_10000'] = x[-10000:].max()\n    \nX_test_scaled = pd.DataFrame(scaler.transform(X_test), columns=X_test.columns)","execution_count":5,"outputs":[{"output_type":"display_data","data":{"text/plain":"HBox(children=(IntProgress(value=0, max=2624), HTML(value='')))","application/vnd.jupyter.widget-view+json":{"version_major":2,"version_minor":0,"model_id":"e21764eabc8a473c825c4e1e46c0f918"}},"metadata":{}},{"output_type":"stream","text":"/opt/conda/lib/python3.6/site-packages/ipykernel_launcher.py:15: RuntimeWarning: divide by zero encountered in true_divide\n  from ipykernel import kernelapp as app\n/opt/conda/lib/python3.6/site-packages/ipykernel_launcher.py:15: RuntimeWarning: invalid value encountered in true_divide\n  from ipykernel import kernelapp as app\n","name":"stderr"},{"output_type":"stream","text":"\n","name":"stdout"},{"output_type":"display_data","data":{"text/plain":"<Figure size 1584x1152 with 0 Axes>"},"metadata":{}}]},{"metadata":{},"cell_type":"markdown","source":"Trainig and Predict by XGboosting.\n\n--------------------------------------\n\nXGboostingのよる学習および予測。"},{"metadata":{"trusted":true},"cell_type":"code","source":"import xgboost as xgb\n\nmodel = xgb.XGBRegressor(n_estimators=100)\nmodel.fit(X_train_scaled,y_tr)\ny_pred_xgb = model.predict(X_test_scaled)\n","execution_count":6,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Making data to submit.\n\n---------------------------\n\n提出用データの作成。"},{"metadata":{"trusted":true},"cell_type":"code","source":"sample = pd.read_csv(\"../input/sample_submission.csv\")\nsample['time_to_failure'] = y_pred_xgb\nsample.to_csv('submission.csv',index=False)","execution_count":7,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Cross Validation.\n\n---------------------------\n\n交差検証。"},{"metadata":{"trusted":true},"cell_type":"code","source":"%time\n\nfrom sklearn.model_selection import StratifiedKFold\nfrom sklearn.metrics import log_loss, roc_auc_score\n\nn_estimators = [10,100,1000]\netas = [0.001,0.3,0.5]\nfor eta in etas: \n  for n_est in  n_estimators:\n    print(n_est)\n    print(eta)\n    cv = KFold(n_splits=5, shuffle=True,random_state=0)\n    for train, valid in cv.split(X_train_scaled, y_tr):\n        x_train = X_train_scaled.iloc[train]\n        x_valid = X_train_scaled.iloc[valid]\n        y_train = y_tr.iloc[train]\n        y_valid = y_tr.iloc[valid]\n        model = xgb.XGBRegressor(n_estimators=n_est,eta=eta, n_jobs=-1,random_state=0)\n        model.fit(x_train, y_train)\n        y_pred = model.predict(x_valid)\n        print(mean_absolute_error(y_valid, y_pred))  ","execution_count":8,"outputs":[{"output_type":"stream","text":"CPU times: user 0 ns, sys: 0 ns, total: 0 ns\nWall time: 9.3 µs\n10\n0.001\n2.683987722271573\n2.7298331665057805\n2.80459446991714\n2.737652078109021\n2.5551283200849335\n100\n0.001\n2.3057418598952366\n2.3075799990810437\n2.315764464867556\n2.3186728980245745\n2.1503154865790326\n1000\n0.001\n2.422291125075444\n2.4667909128593313\n2.3967191598603095\n2.498579481511002\n2.2913207146522314\n10\n0.3\n2.683987722271573\n2.7298331665057805\n2.80459446991714\n2.737652078109021\n2.5551283200849335\n100\n0.3\n2.3057418598952366\n2.3075799990810437\n2.315764464867556\n2.3186728980245745\n2.1503154865790326\n1000\n0.3\n2.422291125075444\n2.4667909128593313\n2.3967191598603095\n2.498579481511002\n2.2913207146522314\n10\n0.5\n2.683987722271573\n2.7298331665057805\n2.80459446991714\n2.737652078109021\n2.5551283200849335\n100\n0.5\n2.3057418598952366\n2.3075799990810437\n2.315764464867556\n2.3186728980245745\n2.1503154865790326\n1000\n0.5\n2.422291125075444\n2.4667909128593313\n2.3967191598603095\n2.498579481511002\n2.2913207146522314\n","name":"stdout"}]}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"name":"python","version":"3.6.4","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat":4,"nbformat_minor":1}