{"cells":[{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true,"collapsed":true},"cell_type":"code","source":"library(tidyverse)\nlibrary(GGally) # ggpairs()\nlibrary(glmnet)\nlibrary(reshape) # Flexibly Reshape Data","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"\n# O banco 201701"},{"metadata":{"trusted":true},"cell_type":"code","source":"#lendo o banco:\nd.201701 <- read.csv(\"../input/kddbr-2020/201701.csv\")\n#names(d.201701)\nglimpse(d.201701)\nhead(d.201701)\n\ntable(d.201701$date)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"### A variável input:\n\nA variável `input_i_j` tem  índices `i` variando de 0 a 556 e `j` variando de 1 a 14.\n\nNão está claro o que o índice `i` significa, mas o `j` quer dizer a quantidade de dias em que ocorreu aquela observação antes da data estipulada na variável `"},{"metadata":{"trusted":true},"cell_type":"code","source":"# selecionando a variável com i = 4 eg para explorar as relações entre os j's\nd.4 <- d.201701 %>% \n    select(grep(\"input_4_\", names(d.201701), value=TRUE))\nglimpse(d.4)\nggpairs(d.4, columns=1:14)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"# selecionando a variável com i = 556 eg para explorar as relações entre os j's\nd.556 <- d.201701 %>% \n    select(grep(\"input_556_\", names(d.201701), value=TRUE))\nglimpse(d.556)\nggpairs(d.556, columns=1:14, \n        mapping = ggplot2::aes(size = 1)\n        )","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"## Treino: 201702. Teste: 201802 "},{"metadata":{"trusted":true},"cell_type":"code","source":"d1702 <- read.csv(\"../input/kddbr-2020/201702.csv\")\nhead(d1702, 1)\ntable(d1702$date)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"d1802 <- read.csv(\"../input/kddbr-2020/201802.csv\")\nhead(d1802, 1)\ntable(d1802$date)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Temos 80 obs todos os dias de fevereiro de 2017 e de 2018."},{"metadata":{"trusted":true},"cell_type":"code","source":"# padronizando todas as variáveis numericas\nX <- rbind(d1702, d1802)\nXnum <- X %>% select(7:ncol(d1702))\n#head(X, 1)\nXsnum <- Xnum %>% scale(center = T, scale = T)\n#head(Xs, 1)\nXs <- X %>% select(1:6) %>% cbind(Xsnum)\n#names(Xs)\n#matriz das featuers (inputs) padronizadas\nX <- Xs %>% select(3:(ncol(d1702)-7*16))\n#glimpse(X)\n#os 7*16 outputs\ny <- Xs %>% select((ncol(d1702)-(7*16)+1):ncol(d1702))\nnames(y)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"nlambda <- 100\ny1 <- as.vector(y[,1])\nX1 <- na.exclude(X)\nX1 <- as.matrix(X)\nis.matrix(X1)\nlasso_reg <- glmnet(X1, y1, alpha = 1, nlambda = 100, family = 'gaussian')\n#summary(lasso_reg)\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"name":"ir","display_name":"R","language":"R"},"language_info":{"name":"R","codemirror_mode":"r","pygments_lexer":"r","mimetype":"text/x-r-source","file_extension":".r","version":"3.6.3"}},"nbformat":4,"nbformat_minor":4}