{"cells":[{"cell_type":"code","execution_count":null,"metadata":{"_cell_guid":"7930754e-2199-5ff6-3b6f-8b1299322459"},"outputs":[],"source":"import numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\nimport os\nimport gc # We're gonna be clearing memory a lot\nimport matplotlib.pyplot as plt\nimport seaborn as sns\n%matplotlib inline\n\np = sns.color_palette()\n\nprint('# File sizes')\nfor f in os.listdir('../input'):\n    if 'zip' not in f:\n        print(f.ljust(30) + str(round(os.path.getsize('../input/' + f) / 1000000, 2)) + 'MB')"},{"cell_type":"code","execution_count":null,"metadata":{"_cell_guid":"4c0d7246-ed17-b543-7a39-09cf67bdbd22"},"outputs":[],"source":"df_train = pd.read_csv('../input/clicks_train.csv')\ndf_test = pd.read_csv('../input/clicks_test.csv')\nsizes_train = df_train.groupby('display_id')['ad_id'].count().value_counts()\nsizes_test = df_test.groupby('display_id')['ad_id'].count().value_counts()\nsizes_train = sizes_train / np.sum(sizes_train)\nsizes_test = sizes_test / np.sum(sizes_test)\nprint (sizes_train)\nprint (sizes_test)\nplt.figure(figsize=(12,4))\nsns.barplot(sizes_train.index, sizes_train.values, alpha=0.8, color=p[0], label='train')\nsns.barplot(sizes_test.index, sizes_test.values, alpha=0.6, color=p[1], label='test')\nplt.legend()\nplt.xlabel('Number of Ads in display', fontsize=12)\nplt.ylabel('Proportion of set', fontsize=12)"}],"metadata":{"_change_revision":0,"_is_fork":false,"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"codemirror_mode":{"name":"ipython","version":3},"file_extension":".py","mimetype":"text/x-python","name":"python","nbconvert_exporter":"python","pygments_lexer":"ipython3","version":"3.5.2"}},"nbformat":4,"nbformat_minor":0}