{"cells":[{"cell_type":"markdown","metadata":{"_cell_guid":"d2145ada-3572-ef8e-42e0-8d8f39fcd974"},"source":"*Use this one simple trick to get to the top of the leaderboard - Grandmasters hate him!*\n\nHere's quite a high-level EDA - since the data is so huge, we want to get a better understanding of what we actually have."},{"cell_type":"code","execution_count":null,"metadata":{"_cell_guid":"b17a89d6-cffd-506b-7472-321286a8db56"},"outputs":[],"source":"import numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\nimport os\nimport gc # We're gonna be clearing memory a lot\n\nprint('# File sizes')\nfor f in os.listdir('../input'):\n    print(f.ljust(30) + str(round(os.path.getsize('../input/' + f) / 1000000, 2)) + 'MB')"},{"cell_type":"code","execution_count":null,"metadata":{"_cell_guid":"eba641aa-5ed8-9611-c718-171f7a462169"},"outputs":[],"source":"df_train = pd.read_csv('../input/clicks_train.csv')\ndf_test = pd.read_csv('../input/clicks_test.csv')\n\nsizes_train = df_train.groupby('display_id')['ad_id'].count().value_counts()\nsizes_train"},{"cell_type":"code","execution_count":null,"metadata":{"_cell_guid":"b3eaee8d-12cb-cbdb-6286-50b4244f029d"},"outputs":[],"source":""}],"metadata":{"_change_revision":0,"_is_fork":false,"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"codemirror_mode":{"name":"ipython","version":3},"file_extension":".py","mimetype":"text/x-python","name":"python","nbconvert_exporter":"python","pygments_lexer":"ipython3","version":"3.5.2"}},"nbformat":4,"nbformat_minor":0}