{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.7.12","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"markdown","source":"## American Express: Create Training Pickle File","metadata":{}},{"cell_type":"code","source":"import numpy as np\nimport pandas as pd\nimport gc","metadata":{"execution":{"iopub.status.busy":"2022-10-08T06:38:27.302886Z","iopub.execute_input":"2022-10-08T06:38:27.303357Z","iopub.status.idle":"2022-10-08T06:38:27.330455Z","shell.execute_reply.started":"2022-10-08T06:38:27.303266Z","shell.execute_reply":"2022-10-08T06:38:27.329642Z"},"trusted":true},"execution_count":1,"outputs":[]},{"cell_type":"code","source":"%%time\ntrain_data = pd.DataFrame()\nwith pd.read_csv('/kaggle/input/amex-default-prediction/train_data.csv', chunksize=10**5) as reader:\n    for counter, chunk in enumerate(reader):\n        for column in chunk.columns:\n            if str(chunk[column].dtype) == \"float64\":\n                chunk[column] = chunk[column].astype(np.float32)\n            if str(chunk[column].dtype) == \"int64\":\n                chunk[column] = chunk[column].astype(np.int32)\n        train_data = pd.concat([train_data, chunk])\n        gc.collect()","metadata":{"execution":{"iopub.status.busy":"2022-10-08T06:38:27.331863Z","iopub.execute_input":"2022-10-08T06:38:27.332195Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_data.to_pickle(\"train_data.pkl\")","metadata":{"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_labels = pd.read_csv(\"/kaggle/input/amex-default-prediction/train_labels.csv\")\ntrain_labels.to_pickle(\"train_labels.pkl\")","metadata":{"trusted":true},"execution_count":null,"outputs":[]}]}