{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"markdown","source":"Setup\n\nref: https://www.kaggle.com/code/kevingreene2/titanic-competition-using-adaboost/edit","metadata":{}},{"cell_type":"code","source":"import numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\ndf_train = pd.read_csv(\"/kaggle/input/titanic/train.csv\")\ndf_test = pd.read_csv(\"/kaggle/input/titanic/test.csv\")","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","execution":{"iopub.status.busy":"2022-08-05T03:59:56.375868Z","iopub.execute_input":"2022-08-05T03:59:56.376374Z","iopub.status.idle":"2022-08-05T03:59:56.399091Z","shell.execute_reply.started":"2022-08-05T03:59:56.376334Z","shell.execute_reply":"2022-08-05T03:59:56.397803Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"Examining the Data","metadata":{}},{"cell_type":"code","source":"df_train.head(5)\n","metadata":{"execution":{"iopub.status.busy":"2022-08-04T20:10:18.181182Z","iopub.execute_input":"2022-08-04T20:10:18.181660Z","iopub.status.idle":"2022-08-04T20:10:18.202328Z","shell.execute_reply.started":"2022-08-04T20:10:18.181622Z","shell.execute_reply":"2022-08-04T20:10:18.200896Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df_train.info()","metadata":{"execution":{"iopub.status.busy":"2022-08-04T20:03:39.455919Z","iopub.execute_input":"2022-08-04T20:03:39.456313Z","iopub.status.idle":"2022-08-04T20:03:39.469150Z","shell.execute_reply.started":"2022-08-04T20:03:39.456281Z","shell.execute_reply":"2022-08-04T20:03:39.467939Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"df_train.describe()","metadata":{"execution":{"iopub.status.busy":"2022-08-04T20:03:42.668956Z","iopub.execute_input":"2022-08-04T20:03:42.669396Z","iopub.status.idle":"2022-08-04T20:03:42.705467Z","shell.execute_reply.started":"2022-08-04T20:03:42.669344Z","shell.execute_reply":"2022-08-04T20:03:42.704397Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"","metadata":{"jupyter":{"source_hidden":true}},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"","metadata":{}},{"cell_type":"markdown","source":"Filling in blank data","metadata":{}},{"cell_type":"code","source":"df_train.isna().sum()","metadata":{"execution":{"iopub.status.busy":"2022-08-04T20:37:30.614391Z","iopub.execute_input":"2022-08-04T20:37:30.614940Z","iopub.status.idle":"2022-08-04T20:37:30.625537Z","shell.execute_reply.started":"2022-08-04T20:37:30.614894Z","shell.execute_reply":"2022-08-04T20:37:30.624601Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"Plot","metadata":{}},{"cell_type":"code","source":"mean_age = df_train['Age'].mean()\ndf_train['Age'].fillna(value=mean_age, inplace=True)\ndf_train['Age']\ndf_train.isna().sum()\n\nmean_age = df_test['Age'].mean()\nmean_fare = df_test['Fare'].mean()\ndf_test['Age'].fillna(value=mean_age, inplace=True)\ndf_test['Fare'].fillna(value=mean_fare, inplace=True)\ndf_test['Age']\ndf_test.isna().sum()\nz = df_test[[\"Age\",\"Fare\"]]\n#z.isna().sum()\nz.head()","metadata":{"execution":{"iopub.status.busy":"2022-08-05T04:08:29.032293Z","iopub.execute_input":"2022-08-05T04:08:29.032722Z","iopub.status.idle":"2022-08-05T04:08:29.058733Z","shell.execute_reply.started":"2022-08-05T04:08:29.032690Z","shell.execute_reply":"2022-08-05T04:08:29.057244Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"","metadata":{}},{"cell_type":"markdown","source":"Begin Modelling","metadata":{}},{"cell_type":"code","source":"from sklearn.tree import DecisionTreeRegressor\nfrom IPython.display import HTML\ndef fix(num):\n    if num < 1:\n        return 0\n    else:\n        return 1\ny = df_train[\"Survived\"]\nx = df_train[[\"Age\",\"Fare\"]]\nz = df_test[[\"Age\",\"Fare\"]]\ntitanic_model = DecisionTreeRegressor(random_state=1)\ntitanic_model.fit(x,y)\nprediction = pd.DataFrame(titanic_model.predict(z))\nprediction.head()\nx = prediction.join(df_train)\nx = x[[\"PassengerId\", 0]]\nx = x.rename(columns={0:'Survived'})\nx[\"Survived\"] = x[\"Survived\"].apply(fix)\nx\nx.to_csv('submission.csv', index = False)\n\ndef create_download_link(title = \"Download CSV file\", filename = \"data.csv\"):  \n    html = '<a href={filename}>{title}</a>'\n    html = html.format(title=title,filename=filename)\n    return HTML(html)\n\n# # create a link to download the dataframe which was saved with .to_csv method\ncreate_download_link(filename='submission.csv')","metadata":{"execution":{"iopub.status.busy":"2022-08-05T04:08:43.049583Z","iopub.execute_input":"2022-08-05T04:08:43.050082Z","iopub.status.idle":"2022-08-05T04:08:43.091532Z","shell.execute_reply.started":"2022-08-05T04:08:43.050018Z","shell.execute_reply":"2022-08-05T04:08:43.090097Z"},"trusted":true},"execution_count":null,"outputs":[]}]}