{"cells":[{"cell_type":"code","execution_count":null,"metadata":{"_cell_guid":"2e6cbb4a-9bea-5fda-f1f7-c81efc7dbd8b"},"outputs":[],"source":"# -*- coding: utf-8 -*-\n\"\"\"\nCreated on Thu Apr 06 21:48:33 2017\n\n@author: amurp\n\"\"\"\n\n# coding: utf-8\n__author__ = 'ZFTurbo: https://kaggle.com/zfturbo'\n\nimport datetime\nfrom heapq import nlargest\nfrom operator import itemgetter\nfrom collections import defaultdict\nimport ml_metrics as metrics\nimport numpy as np\nimport math\nimport matplotlib.pyplot as plt\nfrom sklearn import svm, datasets, metrics\nfrom sklearn.model_selection import KFold\nfrom sklearn import preprocessing\nfrom sklearn.neural_network import MLPClassifier\nfrom sklearn.neighbors import KNeighborsClassifier\nfrom sklearn.svm import SVC\nfrom sklearn.tree import DecisionTreeClassifier\nfrom sklearn.ensemble import RandomForestClassifier, AdaBoostClassifier\nfrom sklearn.naive_bayes import GaussianNB\nfrom sklearn.discriminant_analysis import QuadraticDiscriminantAnalysis\nfrom sklearn import mixture\nfrom sklearn.model_selection import cross_val_predict\nimport pandas as pd\n\ndef run_solution():\n    print('Preparing arrays...')\n    f = open(\"f = open(\"../input/train.csv\", \"r\")\")\n    f.readline()\n    best_hotels_od_ulc = defaultdict(lambda: defaultdict(int))\n    best_hotels_search_dest = defaultdict(lambda: defaultdict(int))\n    best_hotels_search_dest1 = defaultdict(lambda: defaultdict(int))\n    best_hotel_country = defaultdict(lambda: defaultdict(int))\n    popular_hotel_cluster = defaultdict(int)\n    total = 0\n\n    # Calc counts\n    while 1:\n        line = f.readline().strip()\n        total += 1\n\n        if total % 10000 == 0:\n            print('Read {} lines...'.format(total))\n\n        if line == '':\n            break\n\n        arr = line.split(\",\")\n        book_year = int(arr[0][:4])\n        user_location_city = arr[5]\n        orig_destination_distance = arr[6]\n        srch_destination_id = arr[16]\n        is_booking = int(arr[18])   \n        hotel_country = arr[21]\n        hotel_market = arr[22]\n        hotel_cluster = arr[23]\n        \n    print(arr)\n        \n    \"\"\"predictors = [c for c in arr if c not in [arr[23]]]\n    \n    clf1 = SVC(gamma=0.5, C=3, probability=True)\n    predictedCV1 = cross_val_predict(clf1, predictors, arr[23], cv=10)\n    metrics.accuracy_score(arr[23], predictedCV1)\"\"\"\n    \nrun_solution()"}],"metadata":{"_change_revision":0,"_is_fork":false,"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"codemirror_mode":{"name":"ipython","version":3},"file_extension":".py","mimetype":"text/x-python","name":"python","nbconvert_exporter":"python","pygments_lexer":"ipython3","version":"3.6.0"}},"nbformat":4,"nbformat_minor":0}