{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.10.12","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":60095,"databundleVersionId":6542333,"sourceType":"competition"}],"dockerImageVersionId":30698,"isInternetEnabled":false,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import glob\nfrom dataclasses import dataclass\nimport numpy as np\nimport pandas as pd\nfrom tqdm.notebook import tqdm\nfrom scipy.interpolate import InterpolatedUnivariateSpline\n\nINPUT_PATH = '/kaggle/input/smartphone-decimeter-2023'\n\nWGS84_SEMI_MAJOR_AXIS = 6378137.0\nWGS84_SEMI_MINOR_AXIS = 6356752.314245\nWGS84_SQUARED_FIRST_ECCENTRICITY  = 6.69437999013e-3\nWGS84_SQUARED_SECOND_ECCENTRICITY = 6.73949674226e-3\n\nHAVERSINE_RADIUS = 6_371_000","metadata":{"execution":{"iopub.status.busy":"2024-05-11T10:30:17.504745Z","iopub.execute_input":"2024-05-11T10:30:17.505148Z","iopub.status.idle":"2024-05-11T10:30:17.612359Z","shell.execute_reply.started":"2024-05-11T10:30:17.505118Z","shell.execute_reply":"2024-05-11T10:30:17.611233Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df_sample_trail_gnss = pd.read_csv(\"/kaggle/input/smartphone-decimeter-2023/sdc2023/train/2020-06-25-00-34-us-ca-mtv-sb-101/pixel4/device_gnss.csv\")\ndf_sample_trail_gt = pd.read_csv(\"/kaggle/input/smartphone-decimeter-2023/sdc2023/train/2020-06-25-00-34-us-ca-mtv-sb-101/pixel4/ground_truth.csv\")","metadata":{"execution":{"iopub.status.busy":"2024-05-11T10:30:17.614616Z","iopub.execute_input":"2024-05-11T10:30:17.615163Z","iopub.status.idle":"2024-05-11T10:30:18.433688Z","shell.execute_reply.started":"2024-05-11T10:30:17.615123Z","shell.execute_reply":"2024-05-11T10:30:18.432916Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df_sample_trail_gnss.head()","metadata":{"execution":{"iopub.status.busy":"2024-05-11T10:30:18.434922Z","iopub.execute_input":"2024-05-11T10:30:18.435252Z","iopub.status.idle":"2024-05-11T10:30:18.466319Z","shell.execute_reply.started":"2024-05-11T10:30:18.435219Z","shell.execute_reply":"2024-05-11T10:30:18.465226Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df_sample_trail_gt.head()","metadata":{"execution":{"iopub.status.busy":"2024-05-11T10:30:18.469307Z","iopub.execute_input":"2024-05-11T10:30:18.470058Z","iopub.status.idle":"2024-05-11T10:30:18.490342Z","shell.execute_reply.started":"2024-05-11T10:30:18.470029Z","shell.execute_reply":"2024-05-11T10:30:18.489331Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"@dataclass\nclass ECEF:\n    x: np.array\n    y: np.array\n    z: np.array\n\n    def to_numpy(self):\n        return np.stack([self.x, self.y, self.z], axis=0)\n\n    @staticmethod\n    def from_numpy(pos):\n        x, y, z = [np.squeeze(w) for w in np.split(pos, 3, axis=-1)]\n        return ECEF(x=x, y=y, z=z)\n\n@dataclass\nclass BLH:\n    lat : np.array\n    lng : np.array\n    hgt : np.array\n\ndef ECEF_to_BLH(ecef):\n    a = WGS84_SEMI_MAJOR_AXIS\n    b = WGS84_SEMI_MINOR_AXIS\n    e2  = WGS84_SQUARED_FIRST_ECCENTRICITY\n    e2_ = WGS84_SQUARED_SECOND_ECCENTRICITY\n    x = ecef.x\n    y = ecef.y\n    z = ecef.z\n    r = np.sqrt(x**2 + y**2)\n    t = np.arctan2(z * (a/b), r)\n    B = np.arctan2(z + (e2_*b)*np.sin(t)**3, r - (e2*a)*np.cos(t)**3)\n    L = np.arctan2(y, x)\n    n = a / np.sqrt(1 - e2*np.sin(B)**2)\n    H = (r / np.cos(B)) - n\n    return BLH(lat=B, lng=L, hgt=H)\n\ndef haversine_distance(blh_1, blh_2):\n    dlat = blh_2.lat - blh_1.lat\n    dlng = blh_2.lng - blh_1.lng\n    a = np.sin(dlat/2)**2 + np.cos(blh_1.lat) * np.cos(blh_2.lat) * np.sin(dlng/2)**2\n    dist = 2 * HAVERSINE_RADIUS * np.arcsin(np.sqrt(a))\n    return dist\n\ndef pandas_haversine_distance(df1, df2):\n    blh1 = BLH(\n        lat=np.deg2rad(df1['LatitudeDegrees'].to_numpy()),\n        lng=np.deg2rad(df1['LongitudeDegrees'].to_numpy()),\n        hgt=0,\n    )\n    blh2 = BLH(\n        lat=np.deg2rad(df2['LatitudeDegrees'].to_numpy()),\n        lng=np.deg2rad(df2['LongitudeDegrees'].to_numpy()),\n        hgt=0,\n    )\n    return haversine_distance(blh1, blh2)\n","metadata":{"execution":{"iopub.status.busy":"2024-05-11T10:30:18.491654Z","iopub.execute_input":"2024-05-11T10:30:18.491965Z","iopub.status.idle":"2024-05-11T10:30:18.508463Z","shell.execute_reply.started":"2024-05-11T10:30:18.491941Z","shell.execute_reply":"2024-05-11T10:30:18.507249Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"def ecef_to_lat_lng(tripID, gnss_df, UnixTimeMillis):\n    ecef_columns = ['WlsPositionXEcefMeters', 'WlsPositionYEcefMeters', 'WlsPositionZEcefMeters']\n    columns = ['utcTimeMillis'] + ecef_columns\n    ecef_df = (gnss_df.drop_duplicates(subset='utcTimeMillis')[columns]\n               .dropna().reset_index(drop=True))\n    ecef = ECEF.from_numpy(ecef_df[ecef_columns].to_numpy())\n    blh  = ECEF_to_BLH(ecef)\n\n    TIME = ecef_df['utcTimeMillis'].to_numpy()\n    lat = InterpolatedUnivariateSpline(TIME, blh.lat, ext=3)(UnixTimeMillis)\n    lng = InterpolatedUnivariateSpline(TIME, blh.lng, ext=3)(UnixTimeMillis)\n    return pd.DataFrame({\n        'tripId' : tripID,\n        'UnixTimeMillis'   : UnixTimeMillis,\n        'LatitudeDegrees'  : np.degrees(lat),\n        'LongitudeDegrees' : np.degrees(lng),\n    })\n\ndef calc_score(tripID, pred_df, gt_df):\n    d = pandas_haversine_distance(pred_df, gt_df)\n    score = np.mean([np.quantile(d, 0.50), np.quantile(d, 0.95)])    \n    return score\n","metadata":{"execution":{"iopub.status.busy":"2024-05-11T10:30:18.509768Z","iopub.execute_input":"2024-05-11T10:30:18.510064Z","iopub.status.idle":"2024-05-11T10:30:18.521336Z","shell.execute_reply.started":"2024-05-11T10:30:18.510041Z","shell.execute_reply":"2024-05-11T10:30:18.520673Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"%%capture --no-stdout\n\npred_dfs  = []\nscore_list = []\nfor dirname in sorted(glob.glob(f'/kaggle/input/smartphone-decimeter-2023/sdc2023/train/*/*')):\n    drive, phone = dirname.split('/')[-2:]\n    tripID  = f'{drive}/{phone}'\n    gnss_df = pd.read_csv(f'{dirname}/device_gnss.csv')\n    gt_df   = pd.read_csv(f'{dirname}/ground_truth.csv')\n    pred_df = ecef_to_lat_lng(tripID, gnss_df, gt_df['UnixTimeMillis'].to_numpy())\n    pred_dfs.append(pred_df)\n    score = calc_score(tripID, pred_df, gt_df)\n    print(f'{tripID:<45}: score = {score:.3f}')\n    score_list.append(score)","metadata":{"execution":{"iopub.status.busy":"2024-05-11T10:30:18.522187Z","iopub.execute_input":"2024-05-11T10:30:18.522889Z","iopub.status.idle":"2024-05-11T10:32:51.765942Z","shell.execute_reply.started":"2024-05-11T10:30:18.522864Z","shell.execute_reply":"2024-05-11T10:32:51.764598Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"baseline_train_df = pd.concat(pred_dfs)\nbaseline_train_df.to_csv('baseline_train.csv', index=False)","metadata":{"execution":{"iopub.status.busy":"2024-05-11T10:32:51.767173Z","iopub.execute_input":"2024-05-11T10:32:51.768081Z","iopub.status.idle":"2024-05-11T10:32:53.632173Z","shell.execute_reply.started":"2024-05-11T10:32:51.768049Z","shell.execute_reply":"2024-05-11T10:32:53.631237Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"mean_score = np.mean(score_list)\nprint(f'mean_score = {mean_score:.3f}')","metadata":{"execution":{"iopub.status.busy":"2024-05-11T10:32:53.633974Z","iopub.execute_input":"2024-05-11T10:32:53.634477Z","iopub.status.idle":"2024-05-11T10:32:53.639091Z","shell.execute_reply.started":"2024-05-11T10:32:53.634436Z","shell.execute_reply":"2024-05-11T10:32:53.638131Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import warnings\nwarnings.filterwarnings('ignore')\n\nsample_df = pd.read_csv(f'/kaggle/input/smartphone-decimeter-2023/sdc2023/sample_submission.csv')\npred_dfs  = []\nfor dirname in tqdm(sorted(glob.glob(f'/kaggle/input/smartphone-decimeter-2023/sdc2023/test/*/*'))):\n    drive, phone = dirname.split('/')[-2:]\n    tripID  = f'{drive}/{phone}'\n    gnss_df = pd.read_csv(f'{dirname}/device_gnss.csv')\n    UnixTimeMillis = sample_df[sample_df['tripId'] == tripID]['UnixTimeMillis'].to_numpy()\n    pred_dfs.append(ecef_to_lat_lng(tripID, gnss_df, UnixTimeMillis))\nbaseline_test_df = pd.concat(pred_dfs)\nbaseline_test_df.to_csv('baseline_test.csv', index=False)\nbaseline_test_df.to_csv('submission.csv', index=False)","metadata":{"_kg_hide-output":true,"execution":{"iopub.status.busy":"2024-05-11T10:32:53.642545Z","iopub.execute_input":"2024-05-11T10:32:53.642970Z","iopub.status.idle":"2024-05-11T10:33:38.307543Z","shell.execute_reply.started":"2024-05-11T10:32:53.642933Z","shell.execute_reply":"2024-05-11T10:33:38.306104Z"},"trusted":true},"execution_count":null,"outputs":[]}]}