{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import numpy as np\nimport pandas as pd\nimport os\n\n!pip install openpyxl","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","execution":{"iopub.status.busy":"2022-02-18T04:06:37.498587Z","iopub.execute_input":"2022-02-18T04:06:37.498908Z","iopub.status.idle":"2022-02-18T04:06:48.968988Z","shell.execute_reply.started":"2022-02-18T04:06:37.498826Z","shell.execute_reply":"2022-02-18T04:06:48.968184Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"first_name_df = pd.read_excel(\"../input/us-first-names-databasee/SSA_Names_DB.xlsx\")\ncommon_names = first_name_df[\"Name\"]\n\nsurname_df = pd.read_csv(\"../input/us-first-names-databasee/Common_Surnames_Census_2000.csv\")\nsurnames = surname_df.name.str.capitalize()\n\ntrain_df = pd.read_csv(\"../input/happy-whale-and-dolphin/train.csv\")","metadata":{"execution":{"iopub.status.busy":"2022-02-18T04:08:06.637233Z","iopub.execute_input":"2022-02-18T04:08:06.637593Z","iopub.status.idle":"2022-02-18T04:08:06.718899Z","shell.execute_reply.started":"2022-02-18T04:08:06.637546Z","shell.execute_reply":"2022-02-18T04:08:06.717584Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"individual_id_to_first_name = {_ind_id:_name for _ind_id,_name in zip(train_df.individual_id.unique(), common_names.tolist())}\nspecies_to_last_name = {_species:_surname for _species,_surname in zip(train_df.species.unique(), surnames.tolist())}\n\nnew_individual_first_name_list = common_names.tolist()[15587:]\n\ntrain_df[\"first_name\"] = train_df[\"individual_id\"].map(individual_id_to_first_name)\ntrain_df[\"last_name\"] = train_df[\"species\"].map(species_to_last_name)\n\ntrain_df","metadata":{"execution":{"iopub.status.busy":"2022-02-18T04:11:43.726792Z","iopub.execute_input":"2022-02-18T04:11:43.727135Z","iopub.status.idle":"2022-02-18T04:11:43.785042Z","shell.execute_reply.started":"2022-02-18T04:11:43.727102Z","shell.execute_reply":"2022-02-18T04:11:43.784252Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"train_df.sort_values(by=\"individual_id\").head(50)","metadata":{"execution":{"iopub.status.busy":"2022-02-18T04:13:10.134667Z","iopub.execute_input":"2022-02-18T04:13:10.134988Z","iopub.status.idle":"2022-02-18T04:13:10.233579Z","shell.execute_reply.started":"2022-02-18T04:13:10.134957Z","shell.execute_reply":"2022-02-18T04:13:10.232640Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"import pickle\nimport json\n\nwith open(r\"./new_individual_first_name_list.pickle\", \"wb\") as output_file:\n    pickle.dump(new_individual_first_name_list, output_file)\n\nwith open(r\"./individual_id_to_first_name.pickle\", \"wb\") as output_file:\n    pickle.dump(individual_id_to_first_name, output_file)\n\nwith open(r\"./species_to_last_name.pickle\", \"wb\") as output_file:\n    pickle.dump(species_to_last_name, output_file)\n    \nwith open('./individual_id_to_first_name.json', 'w') as fp:\n    json.dump(individual_id_to_first_name, fp,  indent=4)\n    \nwith open('./species_to_last_name.json', 'w') as fp:\n    json.dump(species_to_last_name, fp,  indent=4)","metadata":{"execution":{"iopub.status.busy":"2022-02-18T04:14:37.699626Z","iopub.execute_input":"2022-02-18T04:14:37.700716Z","iopub.status.idle":"2022-02-18T04:14:37.749978Z","shell.execute_reply.started":"2022-02-18T04:14:37.700656Z","shell.execute_reply":"2022-02-18T04:14:37.749352Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"","metadata":{},"execution_count":null,"outputs":[]}]}