{"cells":[
 {
  "cell_type": "code",
  "execution_count": null,
  "metadata": {
   "collapsed": false
  },
  "outputs": [],
  "source": "import sys\nsys.path.append('/usr/local/lib/python2.7/site-packages') # For cv2 finding\nimport os, glob, math, cv2, time\nimport numpy as np\nfrom joblib import Parallel, delayed"
 },
 {
  "cell_type": "code",
  "execution_count": null,
  "metadata": {
   "collapsed": false
  },
  "outputs": [],
  "source": "train_folder = '../input/train'\ntest_folder = '../input/test'"
 },
 {
  "cell_type": "code",
  "execution_count": null,
  "metadata": {
   "collapsed": false
  },
  "outputs": [],
  "source": "'''\nGet information about the images in the dataset\n1. How many images in the training set\n2. How many belonging to each category in the train set\n3. How many images in the test set\n4. Stats about sizes of images in train and test set: This was \n\n'''\ndef image_stats_train(train_folder, num_classes):\n    numfiles = []\n    filesizevector = [480,640]\n    for j in range(num_classes):\n        path = os.path.join(train_folder, 'c' + str(j), '*.jpg')\n        files = glob.glob(path)\n        numfiles.append(np.size(files))\n        for eachfile in files:\n            a = cv2.imread(eachfile)\n            filesize = [np.size(a,0),np.size(a,1)]\n            filesizevector = np.vstack((filesizevector,filesize))\n    return (numfiles,filesizevector)"
 },
 {
  "cell_type": "code",
  "execution_count": null,
  "metadata": {
   "collapsed": false
  },
  "outputs": [],
  "source": "retval   = image_stats_train(train_folder,10)\nfsvector = retval[1]\nnumimg   = retval[0]\na = [('class ' + str(i)+ ' : '+ str(numimg[i])) for i in range(10)] \nprint(a)"
 },
 {
  "cell_type": "code",
  "execution_count": null,
  "metadata": {
   "collapsed": false
  },
  "outputs": [],
  "source": "print(np.mean(fsvector,0))\nprint(np.std(fsvector,0))"
 },
 {
  "cell_type": "code",
  "execution_count": null,
  "metadata": {
   "collapsed": false
  },
  "outputs": [],
  "source": "def image_stats_test(test_folder):\n    numfiles = []\n    filesizevector = [480,640]\n    path = os.path.join(test_folder, '*.jpg')\n    files = glob.glob(path)\n    numfiles.append(np.size(files))\n    for eachfile in files:\n        a = cv2.imread(eachfile)\n        filesize = [np.size(a,0),np.size(a,1)]\n        filesizevector = np.vstack((filesizevector,filesize))\n    return (numfiles,filesizevector)"
 },
 {
  "cell_type": "code",
  "execution_count": null,
  "metadata": {
   "collapsed": false
  },
  "outputs": [],
  "source": "retval   = image_stats_test(test_folder)\nfsvector = retval[1]\nprint('Number of test images: ' +str(retval[0]))"
 },
 {
  "cell_type": "code",
  "execution_count": null,
  "metadata": {
   "collapsed": false
  },
  "outputs": [],
  "source": ""
 }
],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"}}, "nbformat": 4, "nbformat_minor": 0}