{"nbformat_minor": 0, "cells": [{"outputs": [], "metadata": {"_execution_state": "idle", "_cell_guid": "85ece1c4-4f38-4c27-affc-b3499d745c7b", "collapsed": false, "_uuid": "13916f71a064ab732e07a06a7bb52cdad27530b7"}, "execution_count": null, "source": "Predictions based off mean probabilities by zone", "cell_type": "markdown"}, {"outputs": [], "metadata": {"_execution_state": "idle", "trusted": false, "_cell_guid": "4c8b704a-b7cd-4c63-bddd-6931aa70d87e", "_uuid": "87990c90a9fee4db19441a2e08be54c80f811c5d"}, "execution_count": null, "source": "import numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Read input data files\nlabels = pd.read_csv('../input/stage1_labels.csv')\n\n# split the Id to create a column for zones and person ('subject')\nnew_list = []\nfor i,r in labels.iterrows():\n    subject = r['Id'].split('_')[0]\n    zone = r['Id'].split('_')[1][4:]\n    prob = r['Probability']\n    new_list.append({'Id': r['Id'], 'subject': subject, 'zone': zone, 'prob':prob})\n    \ndf = pd.DataFrame(new_list)\n\n", "cell_type": "code"}, {"outputs": [], "metadata": {"_execution_state": "idle", "trusted": false, "_cell_guid": "dbfc0041-d9ec-4ccc-a25d-9531b51e4b12", "collapsed": false, "_uuid": "527085be0bef465b54553bba02bf7e17f1e1cf89"}, "execution_count": null, "source": "# get mean probabilitys by zone\nzone_means = df.groupby(['zone'])['prob'].mean()\nzone_means.plot.bar()\n\n# write the csv\nsample = pd.read_csv('../input/stage1_sample_submission.csv')\noutput = []\nfor i,r in sample.iterrows():\n    zone = r['Id'].split('_')[1][4:]\n    prob = zone_means[zone]\n    output.append({'Id': r['Id'],'Probability':prob})\nop_csv = pd.DataFrame(output)\nop_csv.to_csv('output.csv', index=False)", "cell_type": "code"}, {"outputs": [], "metadata": {"_execution_state": "idle", "trusted": false, "_cell_guid": "7f6a8b1c-74c1-4698-a3c3-49cafe8a6655", "collapsed": false, "_uuid": "a8b30e1d9828dd8e4bf6cf66bebaad62985e7047"}, "execution_count": null, "source": "\n# write the csv\nsample = pd.read_csv('../input/stage1_sample_submission.csv')\noutput = []\nfor i,r in sample.iterrows():\n    zone = r['Id'].split('_')[1][4:]\n    prob = zone_means[zone]\n    output.append({'Id': r['Id'],'Probability':prob})\nop_csv = pd.DataFrame(output)\nop_csv.to_csv('output.csv', index=False)", "cell_type": "code"}], "metadata": {"language_info": {"name": "python", "version": "3.6.1", "codemirror_mode": {"name": "ipython", "version": 3}, "file_extension": ".py", "nbconvert_exporter": "python", "mimetype": "text/x-python", "pygments_lexer": "ipython3"}, "kernelspec": {"name": "python3", "display_name": "Python 3", "language": "python"}}, "nbformat": 4}