{"cells":[{"metadata":{"trusted":true},"cell_type":"code","source":"import matplotlib.pyplot as plt\nfrom PIL import Image\nimport seaborn as sns\nimport pandas as pd\nimport numpy as np\nimport math\nimport sklearn\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.metrics import mean_squared_error,r2_score,mean_absolute_error\nimport matplotlib.pyplot as plt\nimport seaborn as sb\nfrom sklearn import preprocessing\nfrom sklearn.feature_extraction.text import CountVectorizer\nimport time\nimport warnings \nwarnings.filterwarnings('ignore')","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","trusted":true},"cell_type":"code","source":"import json, codecs\nwith codecs.open(\"../input/herbarium-2020-fgvc7/nybg2020/train/metadata.json\", 'r',\n                 encoding='utf-8', errors='ignore') as f:\n    train= json.load(f)\n    \nwith codecs.open(\"../input/herbarium-2020-fgvc7/nybg2020/test/metadata.json\", 'r',\n                 encoding='utf-8', errors='ignore') as f:\n    test = json.load(f)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"display(train.keys())\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_data = pd.DataFrame(train['annotations'])\ndisplay(train_data)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"Cat = pd.DataFrame(train['categories'])\ndisplay(Cat)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_img = pd.DataFrame(train['images'])\ntrain_img.columns = ['file_name', 'height', 'image_id', 'license', 'width']\ndisplay(train_img)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"licenses = pd.DataFrame(train['licenses'])\ndisplay(licenses)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"regions = pd.DataFrame(train['regions'])\ndisplay(regions)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Merge"},{"metadata":{"trusted":true},"cell_type":"code","source":"train_data = train_data.merge(Cat, on='id', how='outer')\ntrain_data = train_data.merge(train_img, on='image_id', how='outer')\ntrain_data = train_data.merge(regions, on='id', how='outer')","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"print(train_data.info())\n\ndisplay(train_data)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"test_data = pd.DataFrame(test['images'])\ntest_data.columns = ['file_name', 'height', 'image_id', 'license', 'width']\nprint(test_data.info())\ndisplay(test_data)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"print(len(train_data.id.unique()))\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"sub = pd.DataFrame()\nsub['Id'] = test_data.image_id\nsub['Predicted'] = list(map(int, np.random.randint(1, 32093, (test_data.shape[0]))))\ndisplay(sub)\nsub.to_csv('submission.csv', index=False)","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat":4,"nbformat_minor":4}