{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.10.13","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":50160,"databundleVersionId":7602123,"sourceType":"competition"}],"dockerImageVersionId":30664,"isInternetEnabled":true,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\nfrom pathlib import Path\nimport polars as pl\nfrom glob import glob\nimport matplotlib.pyplot as plt\nimport seaborn as sns","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","execution":{"iopub.status.busy":"2024-03-07T13:59:18.234573Z","iopub.execute_input":"2024-03-07T13:59:18.235964Z","iopub.status.idle":"2024-03-07T13:59:18.243204Z","shell.execute_reply.started":"2024-03-07T13:59:18.235909Z","shell.execute_reply":"2024-03-07T13:59:18.241823Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"class Pipeline:\n    @staticmethod\n    def set_table_dtypes(df): #Standardize the dtype.\n        for col in df.columns:\n            if col in [\"case_id\", \"WEEK_NUM\", \"num_group1\", \"num_group2\"]:\n                df = df.with_columns(pl.col(col).cast(pl.Int64))\n            elif col in [\"date_decision\"]:\n                df = df.with_columns(pl.col(col).cast(pl.Date))\n            elif col[-1] in (\"P\", \"A\"):\n                df = df.with_columns(pl.col(col).cast(pl.Float64))\n            elif col[-1] in (\"M\",):\n                df = df.with_columns(pl.col(col).cast(pl.String))\n            elif col[-1] in (\"D\",):\n                df = df.with_columns(pl.col(col).cast(pl.Date))            \n\n        return df\n    \n    @staticmethod\n    def handle_dates(df): #Change the feature for D to the difference in days from date_decision.\n        for col in df.columns:\n            if col[-1] in (\"D\",):\n                df = df.with_columns(pl.col(col) - pl.col(\"date_decision\"))\n                df = df.with_columns(pl.col(col).dt.total_days())\n                \n        df = df.drop(\"date_decision\", \"MONTH\")\n\n        return df\n    \n    @staticmethod\n    def filter_cols(df): #Remove those with an average is_null exceeding 0.95 and those that do not fall within the range 1 < nunique < 200.\n        for col in df.columns:\n            if col not in [\"target\", \"case_id\", \"WEEK_NUM\"]:\n                isnull = df[col].is_null().mean()\n\n                if isnull > 0.95:\n                    df = df.drop(col)\n\n        for col in df.columns:\n            if (col not in [\"target\", \"case_id\", \"WEEK_NUM\"]) & (df[col].dtype == pl.String):\n                freq = df[col].n_unique()\n\n                if (freq == 1) | (freq > 200):\n                    df = df.drop(col)\n\n        return df\n    \nclass Aggregator:\n    @staticmethod\n    def num_expr(df): #Extract the maximum and minimum values for features P and A, and add them as additional features.\n        cols = [col for col in df.columns if col[-1] in (\"P\", \"A\")]\n\n        expr_max = [pl.max(col).alias(f\"max_{col}\") for col in cols]\n        expr_min = [pl.min(col).alias(f\"min_{col}\") for col in cols]\n\n        return expr_max, expr_min\n\n    @staticmethod\n    def date_expr(df): #Extract the maximum and minimum values for features D, and add them as additional features.\n        cols = [col for col in df.columns if col[-1] in (\"D\",)]\n\n        expr_max = [pl.max(col).alias(f\"max_{col}\") for col in cols]\n        expr_min = [pl.min(col).alias(f\"min_{col}\") for col in cols]\n\n        return expr_max, expr_min\n\n    @staticmethod\n    def str_expr(df): #Extract the maximum and minimum values for features M, and add them as additional features.\n        cols = [col for col in df.columns if col[-1] in (\"M\",)]\n        \n        expr_max = [pl.max(col).alias(f\"max_{col}\") for col in cols]\n        expr_min = [pl.min(col).alias(f\"min_{col}\") for col in cols]\n\n        return expr_max, expr_min\n\n    @staticmethod\n    def other_expr(df): #Extract the maximum and minimum values for features T and L, and add them as additional features.\n        cols = [col for col in df.columns if col[-1] in (\"T\", \"L\")]\n        \n        expr_max = [pl.max(col).alias(f\"max_{col}\") for col in cols]\n        expr_min = [pl.min(col).alias(f\"min_{col}\") for col in cols]\n\n        return expr_max, expr_min\n    \n    @staticmethod\n    def count_expr(df): #Extract the maximum and minimum values for each num_group and add them as additional features.\n        cols = [col for col in df.columns if \"num_group\" in col]\n\n        expr_max = [pl.max(col).alias(f\"max_{col}\") for col in cols]\n        expr_min = [pl.min(col).alias(f\"min_{col}\") for col in cols]\n\n        return expr_max, expr_min\n\n    @staticmethod\n    def get_exprs(df): #Execute the above function and return the result.\n        maxexprs = Aggregator.num_expr(df)[0] + \\\n                Aggregator.date_expr(df)[0] + \\\n                Aggregator.str_expr(df)[0] + \\\n                Aggregator.other_expr(df)[0] + \\\n                Aggregator.count_expr(df)[0]\n        \n        minexprs = Aggregator.num_expr(df)[1] + \\\n                Aggregator.date_expr(df)[1] + \\\n                Aggregator.str_expr(df)[1] + \\\n                Aggregator.other_expr(df)[1] + \\\n                Aggregator.count_expr(df)[1]\n\n        return maxexprs, minexprs\n    \ndef read_file(path, depth=None): \n    df = pl.read_parquet(path)\n    df = df.pipe(Pipeline.set_table_dtypes)\n    \n    if depth in [1, 2]:\n        maxexprs, minexprs = Aggregator.get_exprs(df)\n        df = df.group_by(\"case_id\").agg(*maxexprs, *minexprs)\n    \n    return df\n\ndef read_files(regex_path, depth=None):\n    chunks = []\n    for path in glob(str(regex_path)):\n        chunks.append(pl.read_parquet(path).pipe(Pipeline.set_table_dtypes))\n        \n    df = pl.concat(chunks, how=\"vertical_relaxed\")\n    if depth in [1, 2]:\n        maxexprs, minexprs = Aggregator.get_exprs(df)\n        df = df.group_by(\"case_id\").agg(*maxexprs, *minexprs)\n    \n    return df\n\ndef feature_eng(df_base, depth_0, depth_1, depth_2):\n    df_base = (\n        df_base\n        .with_columns(\n            month_decision = pl.col(\"date_decision\").dt.month(),\n            weekday_decision = pl.col(\"date_decision\").dt.weekday(),\n        )\n    )\n        \n    for i, df in enumerate(depth_0 + depth_1 + depth_2):\n        df_base = df_base.join(df, how=\"left\", on=\"case_id\", suffix=f\"_{i}\")\n        \n    df_base = df_base.pipe(Pipeline.handle_dates)\n    \n    return df_base\n\ndef to_pandas(df_data, cat_cols=None):\n    df_data = df_data.to_pandas()\n    \n    if cat_cols is None:\n        cat_cols = list(df_data.select_dtypes(\"object\").columns)\n    \n    df_data[cat_cols] = df_data[cat_cols].astype(\"category\")\n    \n    return df_data, cat_cols","metadata":{"execution":{"iopub.status.busy":"2024-03-07T13:20:27.959550Z","iopub.execute_input":"2024-03-07T13:20:27.960011Z","iopub.status.idle":"2024-03-07T13:20:27.999976Z","shell.execute_reply.started":"2024-03-07T13:20:27.959979Z","shell.execute_reply":"2024-03-07T13:20:27.998995Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"\nROOT            = Path(\"/kaggle/input/home-credit-credit-risk-model-stability\")\nTRAIN_DIR       = ROOT / \"parquet_files\" / \"train\"\nTEST_DIR        = ROOT / \"parquet_files\" / \"test\"","metadata":{"execution":{"iopub.status.busy":"2024-03-07T13:20:28.259188Z","iopub.execute_input":"2024-03-07T13:20:28.259903Z","iopub.status.idle":"2024-03-07T13:20:28.265826Z","shell.execute_reply.started":"2024-03-07T13:20:28.259807Z","shell.execute_reply":"2024-03-07T13:20:28.264660Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"data_store = {\n    \"df_base\": read_file(TRAIN_DIR / \"train_base.parquet\"),\n    \"depth_0\": [\n        read_file(TRAIN_DIR / \"train_static_cb_0.parquet\"),\n        read_files(TRAIN_DIR / \"train_static_0_*.parquet\"),\n    ],\n    \"depth_1\": [\n        read_files(TRAIN_DIR / \"train_applprev_1_*.parquet\", 1),\n        read_file(TRAIN_DIR / \"train_tax_registry_a_1.parquet\", 1),\n        read_file(TRAIN_DIR / \"train_tax_registry_b_1.parquet\", 1),\n        read_file(TRAIN_DIR / \"train_tax_registry_c_1.parquet\", 1),\n        read_file(TRAIN_DIR / \"train_credit_bureau_b_1.parquet\", 1),\n        read_file(TRAIN_DIR / \"train_other_1.parquet\", 1),\n        read_file(TRAIN_DIR / \"train_person_1.parquet\", 1),\n        read_file(TRAIN_DIR / \"train_deposit_1.parquet\", 1),\n        read_file(TRAIN_DIR / \"train_debitcard_1.parquet\", 1),\n    ],\n    \"depth_2\": [\n        read_file(TRAIN_DIR / \"train_credit_bureau_b_2.parquet\", 2),\n    ]\n}","metadata":{"execution":{"iopub.status.busy":"2024-03-07T13:20:28.844191Z","iopub.execute_input":"2024-03-07T13:20:28.844590Z","iopub.status.idle":"2024-03-07T13:21:10.868300Z","shell.execute_reply.started":"2024-03-07T13:20:28.844558Z","shell.execute_reply":"2024-03-07T13:21:10.867070Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df_train = feature_eng(**data_store)\n\nprint(\"train data shape:\\t\", df_train.shape)","metadata":{"execution":{"iopub.status.busy":"2024-03-07T13:21:10.870518Z","iopub.execute_input":"2024-03-07T13:21:10.870877Z","iopub.status.idle":"2024-03-07T13:21:21.263946Z","shell.execute_reply.started":"2024-03-07T13:21:10.870846Z","shell.execute_reply":"2024-03-07T13:21:21.262559Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df_train = df_train.pipe(Pipeline.filter_cols)\nprint(\"train data shape:\\t\", df_train.shape)\ndf_train, cat_cols = to_pandas(df_train)","metadata":{"execution":{"iopub.status.busy":"2024-03-07T13:22:20.262108Z","iopub.execute_input":"2024-03-07T13:22:20.262793Z","iopub.status.idle":"2024-03-07T13:22:51.472161Z","shell.execute_reply.started":"2024-03-07T13:22:20.262749Z","shell.execute_reply":"2024-03-07T13:22:51.471007Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"**inittransactioncode_186L**: Transaction type of the initial credit transaction.  \n**numinstlallpaidearly3d_817L**: Number of instalments paid at least 3 days prior to their due date.  \n**max_actualdpd_943P**: Days Past Due (DPD) of previous contract (actual).","metadata":{}},{"cell_type":"markdown","source":"## inittransactioncode_186L  \nTransaction type of the initial credit transaction.","metadata":{}},{"cell_type":"code","source":"df_train['inittransactioncode_186L'].describe()","metadata":{"execution":{"iopub.status.busy":"2024-03-07T13:23:04.702226Z","iopub.execute_input":"2024-03-07T13:23:04.703517Z","iopub.status.idle":"2024-03-07T13:23:04.738197Z","shell.execute_reply.started":"2024-03-07T13:23:04.703452Z","shell.execute_reply":"2024-03-07T13:23:04.736920Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df_train['inittransactioncode_186L'].isnull().sum()","metadata":{"execution":{"iopub.status.busy":"2024-03-07T13:23:27.448086Z","iopub.execute_input":"2024-03-07T13:23:27.448841Z","iopub.status.idle":"2024-03-07T13:23:27.459831Z","shell.execute_reply.started":"2024-03-07T13:23:27.448789Z","shell.execute_reply":"2024-03-07T13:23:27.457769Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df_train['inittransactioncode_186L'].unique()","metadata":{"execution":{"iopub.status.busy":"2024-03-07T13:23:55.279376Z","iopub.execute_input":"2024-03-07T13:23:55.279807Z","iopub.status.idle":"2024-03-07T13:23:55.298970Z","shell.execute_reply.started":"2024-03-07T13:23:55.279763Z","shell.execute_reply":"2024-03-07T13:23:55.297249Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"* NDF란 선물환거래의 일종으로 만기일에 당초 약정환율(Contract Rate)과 만기일의 현물환율(Fixing Rate)간의 차액을 특정통화로 결제하는 거래입니다. (그냥 not defined일 수도..)   \nPOS는 검색해도 어울리는 단어는 못 찾겠다..","metadata":{}},{"cell_type":"markdown","source":"## numinstlallpaidearly3d_817L  \nNumber of instalments paid at least 3 days prior to their due date.\n(만기일 최소 3일 전 납부한 횟수)","metadata":{}},{"cell_type":"code","source":"n_null = df_train['numinstlallpaidearly3d_817L'].isnull().sum()\nprint(f'ratio of null: {n_null}/{len(df_train)} ({n_null/len(df_train)*100:.2f}%)')","metadata":{"execution":{"iopub.status.busy":"2024-03-07T13:36:31.196262Z","iopub.execute_input":"2024-03-07T13:36:31.196695Z","iopub.status.idle":"2024-03-07T13:36:31.206366Z","shell.execute_reply.started":"2024-03-07T13:36:31.196664Z","shell.execute_reply":"2024-03-07T13:36:31.205138Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df_train['numinstlallpaidearly3d_817L'].describe()","metadata":{"execution":{"iopub.status.busy":"2024-03-07T13:41:37.828924Z","iopub.execute_input":"2024-03-07T13:41:37.829324Z","iopub.status.idle":"2024-03-07T13:41:37.924674Z","shell.execute_reply.started":"2024-03-07T13:41:37.829295Z","shell.execute_reply":"2024-03-07T13:41:37.923560Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"# sns.set_theme(theme=\"whitegrid\")\nsns.histplot(df_train['numinstlallpaidearly3d_817L'].dropna(), kde=True, element='poly', palette='pastel')\n# df_train['numinstlallpaidearly3d_817L'].plot.hist()","metadata":{"execution":{"iopub.status.busy":"2024-03-07T13:55:16.593889Z","iopub.execute_input":"2024-03-07T13:55:16.594353Z","iopub.status.idle":"2024-03-07T13:55:25.014136Z","shell.execute_reply.started":"2024-03-07T13:55:16.594318Z","shell.execute_reply":"2024-03-07T13:55:25.012932Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"","metadata":{},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"unique_values = df_train['numinstlallpaidearly3d_817L'].dropna().unique()\nunique_values.sort()\ndf = df_train[['numinstlallpaidearly3d_817L', 'target']].dropna()\npos_ratios = []\nfor uv in unique_values:\n    pos_ratio = len(df.query('numinstlallpaidearly3d_817L == @uv & target==1')) / len(df.query('numinstlallpaidearly3d_817L == @uv'))\n    pos_ratios.append(pos_ratio)\nplt.bar(unique_values, pos_ratios)","metadata":{"execution":{"iopub.status.busy":"2024-03-07T14:36:10.613655Z","iopub.execute_input":"2024-03-07T14:36:10.614106Z","iopub.status.idle":"2024-03-07T14:36:11.427265Z","shell.execute_reply.started":"2024-03-07T14:36:10.614043Z","shell.execute_reply":"2024-03-07T14:36:11.426122Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"납부횟수가 많아질수록 target이 1인 비율이 낮아지다가 다시 높아진다.","metadata":{}},{"cell_type":"markdown","source":"## max_actualdpd_943P\nDays Past Due (DPD) of previous contract (actual). (그 중 max)","metadata":{}},{"cell_type":"code","source":"n_null = df_train['max_actualdpd_943P'].isnull().sum()\nprint(f'ratio of null: {n_null}/{len(df_train)} ({n_null/len(df_train)*100:.2f}%)')","metadata":{"execution":{"iopub.status.busy":"2024-03-07T14:13:49.081890Z","iopub.execute_input":"2024-03-07T14:13:49.083129Z","iopub.status.idle":"2024-03-07T14:13:49.093268Z","shell.execute_reply.started":"2024-03-07T14:13:49.083087Z","shell.execute_reply":"2024-03-07T14:13:49.091565Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df_train['max_actualdpd_943P'].describe()","metadata":{"execution":{"iopub.status.busy":"2024-03-07T14:13:31.012826Z","iopub.execute_input":"2024-03-07T14:13:31.013354Z","iopub.status.idle":"2024-03-07T14:13:31.132253Z","shell.execute_reply.started":"2024-03-07T14:13:31.013317Z","shell.execute_reply":"2024-03-07T14:13:31.130985Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df = df_train['max_actualdpd_943P'].dropna()\nprint('0: ', sum(df == 0.) / len(df)*100, '%')","metadata":{"execution":{"iopub.status.busy":"2024-03-07T14:23:06.054190Z","iopub.execute_input":"2024-03-07T14:23:06.054741Z","iopub.status.idle":"2024-03-07T14:23:06.235812Z","shell.execute_reply.started":"2024-03-07T14:23:06.054703Z","shell.execute_reply":"2024-03-07T14:23:06.234442Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"연체일수인데 대부분은 연체를 안 한 모양이다.","metadata":{}},{"cell_type":"code","source":"len(df[np.logical_and(df != 0., df < 30.)])/sum(df != 0.)","metadata":{"execution":{"iopub.status.busy":"2024-03-07T14:26:20.190995Z","iopub.execute_input":"2024-03-07T14:26:20.191418Z","iopub.status.idle":"2024-03-07T14:26:20.395543Z","shell.execute_reply.started":"2024-03-07T14:26:20.191388Z","shell.execute_reply":"2024-03-07T14:26:20.394077Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"연체자 중 94%가 30일보다 적게 연체했으니 30일까지만 분석해보자.","metadata":{}},{"cell_type":"code","source":"sns.histplot(df[np.logical_and(df != 0., df < 30.)], kde=True, element='bars', palette='pastel')","metadata":{"execution":{"iopub.status.busy":"2024-03-07T14:27:22.038922Z","iopub.execute_input":"2024-03-07T14:27:22.040079Z","iopub.status.idle":"2024-03-07T14:27:22.578510Z","shell.execute_reply.started":"2024-03-07T14:27:22.040000Z","shell.execute_reply":"2024-03-07T14:27:22.577322Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"# unique_values = df_train['max_actualdpd_943P'].dropna().unique()\n# unique_values.sort()\n# df = df_train[['max_actualdpd_943P', 'target']].dropna()\n# pos_ratios = []\n# for uv in unique_values:\n#     pos_ratio = len(df.query('max_actualdpd_943P == @uv & target==1')) / len(df.query('max_actualdpd_943P == @uv'))\n#     pos_ratios.append(pos_ratio)\nplt.bar(unique_values[:130], pos_ratios[:130])","metadata":{"execution":{"iopub.status.busy":"2024-03-07T14:38:16.409321Z","iopub.execute_input":"2024-03-07T14:38:16.409775Z","iopub.status.idle":"2024-03-07T14:38:16.913448Z","shell.execute_reply.started":"2024-03-07T14:38:16.409737Z","shell.execute_reply":"2024-03-07T14:38:16.912155Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"연체일 13일까지는 미납율이 높아진다. 그 뒤로는 표본 자체가 부족해 해석하기 어렵다.","metadata":{}}]}