{"cells":[{"cell_type":"code","execution_count":null,"metadata":{"collapsed":false},"outputs":[],"source":"# This R environment comes with all of CRAN preinstalled, as well as many other helpful packages\n# The environment is defined by the kaggle/rstats docker image: https://github.com/kaggle/docker-rstats\n# For example, here's several helpful packages to load in \n\nlibrary(ggplot2) # Data visualization\nlibrary(readr) # CSV file I/O, e.g. the read_csv function\nlibrary(data.table)\n\n\ntrain <- read_csv(\"../input/ItemInfo_train.csv\")\ntrainItem <- read_csv(\"../input/ItemPairs_train.csv\")\ntrainItem <- data.table(trainItem)\n\n\ntrain <- train[,c(\"itemID\",\"categoryID\",\"locationID\",\"lat\",\"lon\",\"title\",\"description\",\"price\")]\nnames(train) <- c(\"itemID_1\",\"categoryID1\",\"locationID1\",\"lat1\",\"lon1\",\"title1\",\"description1\",\"price1\")\ntrain <- data.table(train)\nsetkey(train,\"itemID_1\")\nsetkey(trainItem,\"itemID_1\")\n\ntrainItem <- merge(trainItem,train,all.x=TRUE)\nnames(train) <- c(\"itemID_2\",\"categoryID2\",\"locationID2\",\"lat2\",\"lon2\",\"title2\",\"description2\",\"price2\")\nsetkey(train,\"itemID_2\")\nsetkey(trainItem,\"itemID_2\")\n\ntrainItem <- merge(trainItem,train,all.x=TRUE)\n"},{"cell_type":"code","execution_count":null,"metadata":{"collapsed":false},"outputs":[],"source":"rem <- c(9,10,16,17)\n(trainItem[,-rem])\nduplicates <-trainItem[trainItem$isDuplicate == 1,]\n#head(duplicates)\n#print (duplicates$price1)\n#print ( sum(duplicates$price1 == duplicates$price2))"},{"cell_type":"code","execution_count":null,"metadata":{"collapsed":false},"outputs":[],"source":"colnames(trainItem)"},{"cell_type":"code","execution_count":null,"metadata":{"collapsed":false},"outputs":[],"source":""}],"metadata":{"kernelspec":{"display_name":"R","language":"R","name":"ir"}},"nbformat":4,"nbformat_minor":0}