{"cells":[{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load in \n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the \"../input/\" directory.\n# For example, running this (by clicking run or pressing Shift+Enter) will list the files in the input directory\n\nimport os\nprint(os.listdir(\"../input\"))\n\nimport matplotlib.pyplot as plt\n%matplotlib inline\n\nfrom sklearn.linear_model import Lasso\nfrom scipy.signal import argrelextrema\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.metrics import mean_absolute_error as MAE\nimport seaborn as sns\n\n# Any results you write to the current directory are saved as output.","execution_count":144,"outputs":[{"output_type":"stream","text":"['test', 'train.csv', 'sample_submission.csv']\n","name":"stdout"}]},{"metadata":{"_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","trusted":true},"cell_type":"code","source":"train = pd.read_csv(\"../input/train.csv\",\n                    dtype={'acoustic_data': np.int16\n                           , 'time_to_failure': np.float64\n                          },engine='c',low_memory=True)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"def split_to_expirements(t):\n    def split(t): # split to matrix that represent the samples and coresponding y\n        n = len(t)\n        n = n - n % 4096\n        x = np.array(t[\"acoustic_data\"].values[:n]).reshape([-1,4096])\n        y = np.array(t[\"time_to_failure\"][4095:n:4096])\n        return x,y\n    x,y = split(t) \n    quake_point = [i+1 for i in argrelextrema(y, np.less, order=2)[0]] # get split indexes by quake times\n    return [(x,y) for x,y in zip(np.split(x, quake_point, axis=0), np.split(y,quake_point,axis=0))]","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"exps = split_to_expirements(train)\ndel train","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"def create_train_data(exps):\n    res_x = []\n    res_y = []\n    for x,y in exps:\n        n = len(y)\n        n = n - (n % 36)\n        x = x[:n]\n        y = y[:n]\n        res_x.extend(np.split(x, n//36, axis=0))\n        res_y.extend(y[35:n:36])\n    return res_x, res_y","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_x, train_y = create_train_data(exps)\ndel exps","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"def filter(train_x, train_y):\n    train_x = np.array(train_x)\n    train_y = np.array(train_y)\n    mask = np.logical_and(train_y <= 12.5,train_y >=1)\n    return train_x[mask], train_y[mask]","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_x_filtered, train_y_filtered = filter(train_x, train_y)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"X_train, X_test, y_train, y_test = train_test_split(train_x_filtered, train_y_filtered, test_size=0.33, random_state=42)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"def preprocess(x):\n    quant = [0,0.01,0.05,0.95,0.99,1]\n    res = []\n    \n    for sample in x:\n        abs_sample = np.abs(sample)\n        features = []\n        \n        features.append(np.max(abs_sample))\n        features.append(np.mean([np.max(ms) for ms in abs_sample]))\n        \n        features.append(np.std(sample)**2)\n        features.append(np.std(abs_sample)**2)\n        features.append(np.mean([np.std(ms)**2 for ms in sample]))\n        features.append(np.mean([np.std(ms)**2 for ms in abs_sample]))\n        \n#         for ms in sample:\n            \n        \n        res.append(np.array(features))\n    \n    return np.array(res)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"post_X_test = preprocess(X_test)\npost_X_train = preprocess(X_train)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_test_err = []\nalphas = np.logspace(-3,5,num=20)\nfor alpha in alphas:\n    model = Lasso(alpha=alpha)\n    model.fit(post_X_train, y_train)\n    y_pred_train = model.predict(post_X_train)\n    y_pred_test = model.predict(post_X_test)\n    train_test_err.append([MAE(y_train, y_pred_train), MAE(y_test, y_pred_test)])\ntrain_test_err = np.array(train_test_err)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"plt.plot( alphas, train_test_err[:,0], label='train')\nplt.plot( alphas, train_test_err[:,1], label='test')\nplt.legend()\nplt.xscale('log')","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"best_alpha = alphas[np.argmin(train_test_err[:,1])]\nbest_alpha = 1.2","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"model = Lasso(alpha=best_alpha)\nmodel.fit(post_X_train, y_train)\ny_pred_train = model.predict(post_X_train)\ny_pred_test = model.predict(post_X_test)\nprint(\"train:\", MAE(y_train, y_pred_train), \"test:\" ,MAE(y_test, y_pred_test))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"np.set_printoptions(precision=3)\nprint(model.intercept_)\n# print(model.coef_.reshape(37,-1))\nprint(model.coef_)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"y_test = np.array(y_test)\nerr = np.abs(y_test-y_pred_test)\nprint(np.mean(err[y_test<10]))\nsns.distplot(err[y_test<10])","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"def to_segment(X_test):\n    n = len(X_test)\n    n = n - (n % 4096)\n    return X_test[:n].reshape(-1,4096)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"subm = pd.read_csv('../input/sample_submission.csv')","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"def pred(fn):\n    test = pd.read_csv(f\"../input/test/{fn}.csv\",\n                    dtype={'acoustic_data': np.int16},engine='c',low_memory=True)\n    test = np.array(test)\n    test=to_segment(test).reshape([1,36,4096])\n    test = preprocess(test)\n    return model.predict(test)[0]","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"subm['time_to_failure'] = [pred(x) for x in subm['seg_id'].values]","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"max_with_0 = subm['time_to_failure'].values\nmax_with_0[max_with_0<0]=0\nsubm['time_to_failure']=max_with_0","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"subm.to_csv(\"submission.csv\", index=False)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"subm_1 = pd.read_csv('submission.csv')","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"np.allclose(subm_1['time_to_failure'].values,subm['time_to_failure'].values)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"subm_1","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"name":"python","version":"3.6.4","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat":4,"nbformat_minor":1}