{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","_kg_hide-input":true,"execution":{"iopub.status.busy":"2023-02-11T12:04:27.587756Z","iopub.execute_input":"2023-02-11T12:04:27.588782Z","iopub.status.idle":"2023-02-11T12:04:27.657165Z","shell.execute_reply.started":"2023-02-11T12:04:27.588742Z","shell.execute_reply":"2023-02-11T12:04:27.656281Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"","metadata":{}},{"cell_type":"markdown","source":"# Train_SET","metadata":{}},{"cell_type":"code","source":"import pandas as pd\n%pip install pyarrow\n","metadata":{"execution":{"iopub.status.busy":"2023-02-11T12:04:27.658836Z","iopub.execute_input":"2023-02-11T12:04:27.659181Z","iopub.status.idle":"2023-02-11T12:04:34.179484Z","shell.execute_reply.started":"2023-02-11T12:04:27.659152Z","shell.execute_reply":"2023-02-11T12:04:34.178544Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_meta=pd.read_parquet('/kaggle/input/icecube-neutrinos-in-deep-ice/train_meta.parquet', engine='pyarrow')\ntrain_meta.to_csv('train_meta.csv')","metadata":{"execution":{"iopub.status.busy":"2023-02-11T12:04:34.180735Z","iopub.execute_input":"2023-02-11T12:04:34.181041Z","iopub.status.idle":"2023-02-11T12:21:19.886241Z","shell.execute_reply.started":"2023-02-11T12:04:34.181013Z","shell.execute_reply":"2023-02-11T12:21:19.884841Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"DATA_PATH = '/kaggle/working/train_meta.csv'\ntrain_meta = pd.read_csv(DATA_PATH)\ntrain_meta.tail()","metadata":{"execution":{"iopub.status.busy":"2023-02-11T12:21:19.888787Z","iopub.execute_input":"2023-02-11T12:21:19.889129Z","iopub.status.idle":"2023-02-11T12:23:18.819434Z","shell.execute_reply.started":"2023-02-11T12:21:19.889101Z","shell.execute_reply":"2023-02-11T12:23:18.818401Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"%pip install fast_ml\n%pip install -U scikit-learn\n%pip install seaborn","metadata":{"execution":{"iopub.status.busy":"2023-02-11T12:24:09.350695Z","iopub.execute_input":"2023-02-11T12:24:09.350987Z","iopub.status.idle":"2023-02-11T12:24:20.897035Z","shell.execute_reply.started":"2023-02-11T12:24:09.350962Z","shell.execute_reply":"2023-02-11T12:24:20.895621Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"\n\n# train_size equal to len of train_meta\n# test_size equal to len of tes_meta\n\n\n\nfrom sklearn import datasets, linear_model\nfrom sklearn.metrics import mean_squared_error, r2_score\nfrom fast_ml.model_development import train_valid_test_split\n\ntrain_size=0.5\nvalid_size=0.3\ntest_size=0.2\n\n\nX_event_idtrain, y_event_idtrain, X_event_idvalid, y_event_idvalid, X_event_idtest, y_event_idtest = train_valid_test_split(train_meta, target = 'event_id', \n                                                                            method='sorted', sort_by_col='event_id',\n                                                                            train_size= train_size, valid_size=valid_size, test_size=test_size )\n\n\n\nX_azimuthtrain, y_azimuthtrain, X_azimuthvalid, y_azimuthvalid, X_azimuthtest, y_azimuthtest = train_valid_test_split(train_meta, target = 'azimuth', \n                                                                            method='sorted', sort_by_col='azimuth',\n                                                                            train_size= train_size, valid_size=valid_size, test_size=test_size )\n \n\n\n\n\nX_zenithtrain, y_zenithtrain, X_zenithvalid, y_zenithvalid, X_zenithtest, y_zenithtest = train_valid_test_split(train_meta, target = 'zenith', \n                                                                            method='sorted', sort_by_col='zenith',\n                                                                            train_size= train_size, valid_size=valid_size, test_size=test_size )\n\n","metadata":{"execution":{"iopub.status.busy":"2023-02-11T12:24:20.898811Z","iopub.execute_input":"2023-02-11T12:24:20.899169Z","iopub.status.idle":"2023-02-11T12:26:35.313938Z","shell.execute_reply.started":"2023-02-11T12:24:20.899136Z","shell.execute_reply":"2023-02-11T12:26:35.312725Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import numpy as np\nfrom sklearn.linear_model import LinearRegression\n\n\nregr = linear_model.LinearRegression()\n\nregr.fit(X_azimuthtrain, y_azimuthtrain)\n\n# Make predictions using the testing set\nazimuth_pred = regr.predict( X_azimuthtest)\n\n","metadata":{"execution":{"iopub.status.busy":"2023-02-11T12:27:54.434151Z","iopub.execute_input":"2023-02-11T12:27:54.434648Z","iopub.status.idle":"2023-02-11T12:28:17.934747Z","shell.execute_reply.started":"2023-02-11T12:27:54.434611Z","shell.execute_reply":"2023-02-11T12:28:17.933135Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"regr = linear_model.LinearRegression()\n\nregr.fit(X_zenithtrain, y_zenithtrain)\n\n# Make predictions using the testing set\nzenith_pred = regr.predict(X_zenithtest)","metadata":{"execution":{"iopub.status.busy":"2023-02-11T12:29:45.090963Z","iopub.execute_input":"2023-02-11T12:29:45.091711Z","iopub.status.idle":"2023-02-11T12:30:09.873074Z","shell.execute_reply.started":"2023-02-11T12:29:45.091678Z","shell.execute_reply":"2023-02-11T12:30:09.871305Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"data = {'event_id': y_event_idtest,\n        'azimuth': azimuth_pred,\n        'zenith': zenith_pred}\n  \n# Create DataFrame\nsubmission = pd.DataFrame(data)\npath = './'\nsubmission.to_csv(path + 'submission.csv')","metadata":{"execution":{"iopub.status.busy":"2023-02-11T12:30:17.926001Z","iopub.execute_input":"2023-02-11T12:30:17.926486Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"#  ","metadata":{}}]}