{"cells":[{"cell_type":"code","execution_count":null,"metadata":{"collapsed":false},"outputs":[],"source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load in \n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the \"../input/\" directory.\n# For example, running this (by clicking run or pressing Shift+Enter) will list the files in the input directory\n\nfrom subprocess import check_output\nprint(check_output([\"ls\", \"../input\"]).decode(\"utf8\"))\n\n# Any results you write to the current directory are saved as output."},{"cell_type":"code","execution_count":null,"metadata":{"collapsed":false},"outputs":[],"source":"import string\nimport numpy as np\nfrom numpy.random import randn\nfrom pandas import Series, DataFrame\nimport pandas as pd\nimport csv\nimport matplotlib\nimport matplotlib.pyplot as plt\nfrom scipy import stats\n%matplotlib inline \ntypelist = {'date_time'\t:\t'string'\n,'site_name':'int'\n,'posa_continent'\t:\t'int'\n,'user_location_country'\t:\t'int'\n,'user_location_region'\t:\t'int'\n,'user_location_city'\t:\t'int'\n,'orig_destination_distance'\t:\t'double'\n,'user_id'\t:\t'int'\n,'is_mobile'\t:\t'tinyint'\n,'is_package'\t:\t'int'\n,'channel'\t:\t'int'\n,'srch_ci'\t:\t'string'\n,'srch_co'\t:\t'string'\n,'srch_adults_cnt'\t:\t'int'\n,'srch_children_cnt'\t:\t'int'\n,'srch_rm_cnt'\t:\t'int'\n,'srch_destination_id'\t:\t'int'\n,'srch_destination_type_id'\t:\t'int'\n,'hotel_continent'\t:\t'int'\n,'hotel_country'\t:\t'int'\n,'hotel_market'\t:\t'int'\n,'is_booking'\t:\t'tinyint'\n,'cnt'\t:\t'bigint'\n,'hotel_cluster'\t:\t'int'\n,'id':'int'}\nfile = open(\"../input/train.csv\")\nnamelist = dict()\nline = file.next().strip().split(\",\")\nord = 0\nfor name in line:\n    namelist.update({name:ord})\n    ord += 1\ndef getvr(name):\n    variable = []\n    ix = namelist[name]\n    file = open(\"../input/train.csv\")\n    file.next()\n    for line in file:\n        arr = line.split(\",\")\n        variable.append(arr[ix])\n    return variable\ndef extract(vr):\n    extvr = []\n    n = 0\n    for x in vr:\n        if x != '':\n            extvr.append(x)\n        else:\n            n += 1\n    return [extvr,n]\n\ndef transform(vr):\n    return [float(x) for x in vr]\n\ndef StatDisp():\n    n = 0\n    for name in namelist:\n        vr = getvr(name)\n        tmp = extract(vr)\n        vr = tmp[0]\n        lossnum = tmp[1]\n        fig=plt.figure(figsize=(20,77))\n        n += 1 \n        if typelist[name] == 'string':\n            print ('====================================')\n            print (name)\n            print ('------------------------------------')\n            extvr = Series(vr)\n            print (extvr.describe())\n            print ('Number of loss data:'+str(lossnum))\n        else:\n            print ('====================================')\n            print (name)\n            print ('------------------------------------')\n            extvr = transform(vr)\n            extvr = Series(extvr)\n            print (extvr.describe())\n            ax = fig.add_subplot(11,2,n)\n            ax.set_title(name)\n            extvr.hist(bins = 20)\n            print ('Number of loss data:'+str(lossnum))\n"}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"}},"nbformat":4,"nbformat_minor":0}