{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.10.14","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":81933,"databundleVersionId":9643020,"sourceType":"competition"}],"dockerImageVersionId":30786,"isInternetEnabled":false,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"markdown","source":"# Introduction\n\nThis is one of my notebooks with higher score among my submissions, scoring exactly 0.285. It's a simple approach using only the internet comsumption feature and a Logistic Regression model, I placed 1899 in the competition.","metadata":{}},{"cell_type":"markdown","source":"# 0. Import libraries.","metadata":{}},{"cell_type":"code","source":"import pandas as pd\nimport warnings\nwarnings.filterwarnings('ignore')","metadata":{"execution":{"iopub.status.busy":"2024-10-14T01:03:27.021717Z","iopub.execute_input":"2024-10-14T01:03:27.022168Z","iopub.status.idle":"2024-10-14T01:03:27.028499Z","shell.execute_reply.started":"2024-10-14T01:03:27.022125Z","shell.execute_reply":"2024-10-14T01:03:27.027178Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# 1. Import data.","metadata":{}},{"cell_type":"code","source":"train_df = pd.read_csv('/kaggle/input/child-mind-institute-problematic-internet-use/train.csv')\ntest_df = pd.read_csv('/kaggle/input/child-mind-institute-problematic-internet-use/test.csv')","metadata":{"execution":{"iopub.status.busy":"2024-10-14T01:03:27.031197Z","iopub.execute_input":"2024-10-14T01:03:27.031571Z","iopub.status.idle":"2024-10-14T01:03:27.107232Z","shell.execute_reply.started":"2024-10-14T01:03:27.031532Z","shell.execute_reply":"2024-10-14T01:03:27.106095Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# 2. Feature selection.","metadata":{}},{"cell_type":"code","source":"selected_train = train_df.copy()\nselected_train = selected_train[['PreInt_EduHx-computerinternet_hoursday',\n                                 'sii']]\nselected_train","metadata":{"execution":{"iopub.status.busy":"2024-10-14T01:04:45.529639Z","iopub.execute_input":"2024-10-14T01:04:45.530722Z","iopub.status.idle":"2024-10-14T01:04:45.548817Z","shell.execute_reply.started":"2024-10-14T01:04:45.530669Z","shell.execute_reply":"2024-10-14T01:04:45.547617Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"selected_test = test_df.copy()\nselected_test = selected_test[['PreInt_EduHx-computerinternet_hoursday']]\nselected_test","metadata":{"execution":{"iopub.status.busy":"2024-10-14T01:04:40.577218Z","iopub.execute_input":"2024-10-14T01:04:40.577693Z","iopub.status.idle":"2024-10-14T01:04:40.593683Z","shell.execute_reply.started":"2024-10-14T01:04:40.577648Z","shell.execute_reply":"2024-10-14T01:04:40.592350Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# 3. Data preprocessing.","metadata":{}},{"cell_type":"code","source":"selected_train.fillna(0, inplace=True)\nselected_train['sii'] = selected_train.pop('sii')\nselected_train","metadata":{"execution":{"iopub.status.busy":"2024-10-14T01:04:51.069985Z","iopub.execute_input":"2024-10-14T01:04:51.070463Z","iopub.status.idle":"2024-10-14T01:04:51.088502Z","shell.execute_reply.started":"2024-10-14T01:04:51.070418Z","shell.execute_reply":"2024-10-14T01:04:51.087180Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"selected_test.fillna(0, inplace=True)\nselected_test","metadata":{"execution":{"iopub.status.busy":"2024-10-14T01:04:54.731016Z","iopub.execute_input":"2024-10-14T01:04:54.731688Z","iopub.status.idle":"2024-10-14T01:04:54.745919Z","shell.execute_reply.started":"2024-10-14T01:04:54.731640Z","shell.execute_reply":"2024-10-14T01:04:54.744660Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# 4. Model training.","metadata":{}},{"cell_type":"code","source":"from sklearn.model_selection import train_test_split\nfrom sklearn.preprocessing import MinMaxScaler\nfrom sklearn.linear_model import LogisticRegression\nfrom sklearn.metrics import accuracy_score, classification_report\n\nX = selected_train.drop(columns=['sii'])  \ny = selected_train['sii']  \n\nscaler = MinMaxScaler()\nX = scaler.fit_transform(X)\n\nX_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)\n\nmodel = LogisticRegression(random_state=42)\n\nmodel.fit(X_train, y_train)\n\ny_pred = model.predict(X_test)","metadata":{"execution":{"iopub.status.busy":"2024-10-14T01:05:00.256886Z","iopub.execute_input":"2024-10-14T01:05:00.257356Z","iopub.status.idle":"2024-10-14T01:05:00.297968Z","shell.execute_reply.started":"2024-10-14T01:05:00.257316Z","shell.execute_reply":"2024-10-14T01:05:00.295644Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# 5. Evaluation.","metadata":{}},{"cell_type":"code","source":"accuracy = accuracy_score(y_test, y_pred)\nreport = classification_report(y_test, y_pred)\n\nprint(f\"Accuracy: {accuracy}\")\nprint(\"Report:\")\nprint(report)","metadata":{"execution":{"iopub.status.busy":"2024-10-14T01:05:02.751105Z","iopub.execute_input":"2024-10-14T01:05:02.752125Z","iopub.status.idle":"2024-10-14T01:05:02.772807Z","shell.execute_reply.started":"2024-10-14T01:05:02.752057Z","shell.execute_reply":"2024-10-14T01:05:02.771032Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# 6. Model output.","metadata":{}},{"cell_type":"code","source":"predictions = model.predict(selected_test).astype(int)\n\npredictions_df = pd.DataFrame({\n    'id': test_df['id'],  \n    'sii': predictions  \n})\n\npredictions_df","metadata":{"execution":{"iopub.status.busy":"2024-10-14T01:05:05.771732Z","iopub.execute_input":"2024-10-14T01:05:05.772230Z","iopub.status.idle":"2024-10-14T01:05:05.788399Z","shell.execute_reply.started":"2024-10-14T01:05:05.772184Z","shell.execute_reply":"2024-10-14T01:05:05.787109Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"predictions_df.to_csv('/kaggle/working/submission.csv', index=False)","metadata":{"execution":{"iopub.status.busy":"2024-10-14T01:03:28.366565Z","iopub.execute_input":"2024-10-14T01:03:28.367145Z","iopub.status.idle":"2024-10-14T01:03:28.378401Z","shell.execute_reply.started":"2024-10-14T01:03:28.367069Z","shell.execute_reply":"2024-10-14T01:03:28.377103Z"},"trusted":true},"execution_count":null,"outputs":[]}]}