{"cells":[{"metadata":{},"cell_type":"markdown","source":""},{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load in \n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the \"../input/\" directory.\n# For example, running this (by clicking run or pressing Shift+Enter) will list the files in the input directory\n\nimport os\nprint(os.listdir(\"../input\"))\nfrom keras.callbacks import EarlyStopping, ModelCheckpoint, ReduceLROnPlateau\n# Any results you write to the current directory are saved as output.","execution_count":null,"outputs":[]},{"metadata":{"_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","trusted":true},"cell_type":"code","source":"train_data_df = pd.read_csv('../input/PLAsTiCC-2018/training_set.csv')\ntrain_metadata_df = pd.read_csv('../input/PLAsTiCC-2018/training_set_metadata.csv')\ntrain_metadata_df.target","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"23d3593c5c0b001243ff3ce282b23653b34bbbf9"},"cell_type":"code","source":"train_data_df['flux_ratio_sq'] = np.power(train_data_df['flux'] / train_data_df['flux_err'], 2.0)\ntrain_data_df['flux_by_flux_ratio_sq'] = train_data_df['flux'] * train_data_df['flux_ratio_sq']","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"ea222492f509c790746d0035935c4b3716725e3a"},"cell_type":"code","source":"data_features = train_data_df.columns[1:]\nmetadata_features = train_metadata_df.columns[1:]","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"9ee1737cdf1bf098837f2029ca0152ec3d670928"},"cell_type":"code","source":"groupObjects = train_data_df.groupby('object_id')[data_features]\n\nprint(\"Add constant object features\")\nfeatures = train_metadata_df.drop(['target'], axis=1)\n\nprint(\"Add mean of mutable object features\")\nfeatures = pd.merge(features, groupObjects.agg('mean'), how='right', on='object_id', suffixes=['', '_mean'])\n\nprint(\"Add sum of mutable object features\")\nfeatures = pd.merge(features, groupObjects.agg('sum'), how='right', on='object_id', suffixes=['', '_sum'])\n\nprint(\"Add median of mutable features\")\nfeatures = pd.merge(features, groupObjects.agg('median'), how='right', on='object_id', suffixes=['', '_median'])\n\nprint(\"Add minimum of mutable features\")\nfeatures = pd.merge(features, groupObjects.agg('min'), how='right', on='object_id', suffixes=['', '_min'])\n\nprint(\"Add maximum of mutable features\")\nfeatures = pd.merge(features, groupObjects.agg('max'), how='right', on='object_id', suffixes=['', '_max'])\n\nprint(\"Add range of mutable features\")\nfeatures = pd.merge(features, groupObjects.agg(lambda x: max(x) - min(x)), how='right', on='object_id', suffixes=['', '_range'])\n\nprint(\"Add standard deviation of mutable features\")\nfeatures = pd.merge(features, groupObjects.agg('std'), how='right', on='object_id', suffixes=['', '_stddev'])\n\nprint(\"Add skew of mutable features\")\nfeatures = pd.merge(features, groupObjects.agg('skew'), how='right', on='object_id', suffixes=['', '_skew'])","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"1b134970ee1752c684547024216f440a9f60c63d"},"cell_type":"code","source":"features = features.fillna(features.mean())","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"495afe1e32b26b87ab71e47af658750b28f71e35"},"cell_type":"code","source":"features","execution_count":null,"outputs":[]},{"metadata":{"trusted":true,"_uuid":"3c9a93d095f0c395008db5b8f782fb9aeb58ce93"},"cell_type":"code","source":"# train_metadata_df['target'] = train_metadata_df.target.map({6:0, 15:1, 16:2, 42:3, 52:4, 53:5, 62:6, 64:7, 65:8, 67:9, 88:10, 90:11, 92:12, 95:13,99:14})\ntargets = train_metadata_df['target']\nfeatures.shape,targets.shape","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"features_df = pd.DataFrame(features)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"features_df.dtypes","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_data_df.dtypes","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_metadata_df.dtypes","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Exploratory data analysis"},{"metadata":{"trusted":true},"cell_type":"code","source":"features_df.describe()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"from collections import Counter\nCounter(targets)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"import numpy as np\nimport pandas as pd\nimport seaborn as sns\n\nimport matplotlib.pyplot as plt\n\nfrom sklearn.preprocessing import StandardScaler\nscaler = StandardScaler()\nscaler.fit(features)\nX = scaler.transform(features)\nsns.set(color_codes=True)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"A histogram is a great tool for quickly assessing a probability distribution that is easy for interpretation by almost any audience"},{"metadata":{"trusted":true},"cell_type":"code","source":"plt.figure(figsize = (4,3))\nplt.hist(targets)\nplt.xlabel('target')\nplt.ylabel('count')\nplt.tight_layout","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"The Heat Map procedure shows the distribution of a quantitative variable over all combinations of 2 categorical factors. If one of the 2 factors represents time, then the evolution of the variable can be easily viewed using the map. A gradient color scale is used to represent the values of the quantitative variable. The correlation between two random variables is a number that runs from -1 through 0 to +1 and indicates a strong inverse relationship, no relationship, and a strong direct relationship, respectively."},{"metadata":{"trusted":true},"cell_type":"code","source":"correlation_matrix = features_df.corr().round(2)\nsns.heatmap(data=correlation_matrix,annot=True)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"cov_matrix = features_df.cov().round(2)\nsns.heatmap(data=cov_matrix,annot=True)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"IQR:\nThe interquartile range (IQR) is a measure of statistical dispersion, being equal to the difference between 75th and 25th percentiles, or between upper and lower quartiles."},{"metadata":{"trusted":true},"cell_type":"code","source":"Q1 = features_df.quantile(0.25)\nQ3 = features_df.quantile(0.75)\nIQR = Q3-Q1\nprint(IQR)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"PCA"},{"metadata":{"trusted":true},"cell_type":"code","source":"import numpy as np\nfrom sklearn.decomposition import PCA\nclf = PCA(n_components=30)\ngiri = clf.fit(X)\nprint(clf.explained_variance_ratio_)\nprint(clf.singular_values_)\nR = clf.transform(X)\n\n# from sklearn.ensemble import RandomForestClassifier\n# X_train, X_test, y_train, y_test = train_test_split(X, targets, test_size=0.2)\n# clf = RandomForestClassifier(max_depth=20, random_state=0)\n# clf=clf.fit(X_train, y_train)\n# y_pred = clf.predict(X_train)\n# print((X_train.shape[0], (y_train == y_pred).sum()))\n# sha=X_train.shape[0]\n# pr=(y_train == y_pred).sum()\n# print(pr/sha)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"R_df = pd.DataFrame(R)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"cor_matrix = R_df.corr().round(2)\nsns.heatmap(data=cor_matrix,annot=True)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"cov_matrix = R_df.cov().round(2)\nsns.heatmap(data=cov_matrix,annot=True)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"print(R.shape)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"K-means"},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.cluster import KMeans\nwcss = []\nfor i in range(1, 17):\n    kmeans = KMeans(n_clusters = i, init = 'k-means++', random_state = 42)\n    kmeans.fit(X)\n    # inertia method returns wcss for that model\n    wcss.append(kmeans.inertia_)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"plt.figure(figsize=(10,5))\nsns.lineplot(range(1, 17), wcss,marker='o',color='red')\nplt.title('The Elbow Method')\nplt.xlabel('Number of clusters')\nplt.ylabel('WCSS')\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"kmeans = KMeans(n_clusters = 14, init = 'k-means++', random_state = 42)\ny_kmeans = kmeans.fit_predict(X)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"plt.figure(figsize=(15,7))\nsns.scatterplot(X[y_kmeans == 0, 0], X[y_kmeans == 0, 1], color = 'yellow', label = 'Cluster 1',s=50)\nsns.scatterplot(X[y_kmeans == 1, 0], X[y_kmeans == 1, 1], color = 'blue', label = 'Cluster 2',s=50)\nsns.scatterplot(X[y_kmeans == 2, 0], X[y_kmeans == 2, 1], color = 'green', label = 'Cluster 3',s=50)\nsns.scatterplot(X[y_kmeans == 3, 0], X[y_kmeans == 3, 1], color = 'grey', label = 'Cluster 4',s=50)\nsns.scatterplot(X[y_kmeans == 4, 0], X[y_kmeans == 4, 1], color = 'orange', label = 'Cluster 5',s=50)\nsns.scatterplot(X[y_kmeans == 5, 0], X[y_kmeans == 5, 1], color = 'black', label = 'Cluster 6',s=50)\nsns.scatterplot(X[y_kmeans == 6, 0], X[y_kmeans == 6, 1], color = 'blue', label = 'Cluster 7',s=50)\nsns.scatterplot(X[y_kmeans == 7, 0], X[y_kmeans == 7, 1], color = 'green', label = 'Cluster 8',s=50)\nsns.scatterplot(X[y_kmeans == 8, 0], X[y_kmeans == 8, 1], color = 'grey', label = 'Cluster 9',s=50)\nsns.scatterplot(X[y_kmeans == 9, 0], X[y_kmeans == 9, 1], color = 'orange', label = 'Cluster 10',s=50)\nsns.scatterplot(X[y_kmeans == 10, 0], X[y_kmeans == 10, 1], color = 'yellow', label = 'Cluster 11',s=50)\nsns.scatterplot(X[y_kmeans == 11, 0], X[y_kmeans == 11, 1], color = 'blue', label = 'Cluster 12',s=50)\nsns.scatterplot(X[y_kmeans == 12, 0], X[y_kmeans == 12, 1], color = 'green', label = 'Cluster 13',s=50)\nsns.scatterplot(X[y_kmeans == 13, 0], X[y_kmeans == 13, 1], color = 'grey', label = 'Cluster 14',s=50)\n# sns.scatterplot(X[y_kmeans == 4, 0], X[y_kmeans == 4, 1], color = 'orange', label = 'Cluster 5',s=50)\nsns.scatterplot(kmeans.cluster_centers_[:, 0], kmeans.cluster_centers_[:, 1], color = 'red', \n                label = 'Centroids',s=300,marker=',')\nplt.grid(False)\nplt.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.cluster import KMeans\nfrom sklearn.model_selection import train_test_split\nX_train, X_test, y_train, y_test = train_test_split(R, targets, test_size=0.1, random_state=0)\nprint(X_train.shape)\nprint(y_train.shape)\nkmeans = KMeans(n_clusters=14, random_state=0).fit(X_train)\n# kmeans.labels_\ny_kmeans = kmeans.predict(X_train)\n# kmeans.cluster_centers_","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"km=KMeans(algorithm='auto', copy_x=True, init='k-means++', max_iter=300,n_clusters=14, n_init=10, n_jobs=1, precompute_distances='auto',random_state=None, tol=0.0001, verbose=0)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"kmeans=km.fit(X_train)\nkmeans.labels_","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_labels=km.fit_predict(X_train)\ntest_labels=km.fit_predict(X_test)\nprint(test_labels)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"# # y_pred = kmeans.predict(X_train[0])\n# # kmeans.cluster_centers_\n# y_pred=kmeans.predict(X_train)\n# for i in range(7):\n#     print(y_train[0])\n# # print((X_train.shape[0], (y_train == y_pred).sum()))\n# # sha=X_train.shape[0]\n# # pr=(y_train == y_pred).sum()\n# # print(pr/sha)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.linear_model import LogisticRegression\nfrom sklearn.metrics import confusion_matrix\nclf = LogisticRegression().fit(X, targets)\npd.DataFrame(confusion_matrix(targets, clf.predict(X)))\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"clf.predict(X)\nprint((X.shape[0], (X == clf).sum()))","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":" Supervised machine-learning techniques"},{"metadata":{},"cell_type":"markdown","source":"KNN"},{"metadata":{"trusted":true},"cell_type":"code","source":"# clf = LogisticRegression().fit(X, targets)\n# gnb = GaussianNB()\nfrom sklearn.neighbors import KNeighborsClassifier\nX_train, X_test, y_train, y_test = train_test_split(X, targets, test_size=0.1, random_state=0)\nnbg = []\nsampK = []\nfor i in range(1,15):\n    neigh = KNeighborsClassifier(n_neighbors=i)\n    clf=neigh.fit(X_train, y_train)\n    # clf = clf.fit(X, targets)\n    y_pred = clf.predict(X_test)\n    print((X_test.shape[0], (y_test==y_pred).sum()))\n    sha=X_test.shape[0]\n    pr=(y_test == y_pred).sum()\n    print(pr/sha)\n    nbg.append(pr/sha)\n    sampK.append(i)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fig, ax = plt.subplots()\nax.set_xlabel(\"Neighbors\")\nax.set_ylabel(\"accuracy\")\nax.set_title(\"Accuracy vs Neighbors for testing sets\")\nax.plot(sampK, nbg, marker='o', label=\"test\",\n        drawstyle=\"steps-post\")\n# ax.plot(sample, test_scores, marker='o', label=\"test\",\n#         drawstyle=\"steps-post\")\nax.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Bagging on KNN"},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.ensemble import BaggingClassifier\nfrom sklearn import tree\nX_train, X_test, y_train, y_test = train_test_split(X, targets, test_size=0.1)\npre = []\nsample = []\nfor i in range(1,11):\n    clf = BaggingClassifier(KNeighborsClassifier(),max_samples=(i/10), max_features=0.9)\n    clf=clf.fit(X_train, y_train)\n    y_pred = clf.predict(X_test)\n    print((X_test.shape[0], (y_test == y_pred).sum()))\n    sha=X_test.shape[0]\n    pr=(y_test == y_pred).sum()\n    print(pr/sha)\n    pre.append(pr/sha)\n    sample.append(i/10)\nprint(pre) ","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fig, ax = plt.subplots()\nax.set_xlabel(\"sample size\")\nax.set_ylabel(\"accuracy\")\nax.set_title(\"Accuracy vs sample size for testing sets\")\nax.plot(sample, pre, marker='o', label=\"test\",\n        drawstyle=\"steps-post\")\n# ax.plot(sample, test_scores, marker='o', label=\"test\",\n#         drawstyle=\"steps-post\")\nax.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Naive Bayes Classifier"},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.model_selection import train_test_split\nfrom sklearn.naive_bayes import GaussianNB\nX_train, X_test, y_train, y_test = train_test_split(X, targets, test_size=0.2)\ngnb = GaussianNB()\ny_pred = gnb.fit(X_train, y_train).predict(X_test)\nprint((X_test.shape[0], (y_test == y_pred).sum()))\nsha=X_test.shape[0]\npr=(y_test == y_pred).sum()\nprint(pr/sha)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Decision Tree"},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn import tree\nX_train, X_test, y_train, y_test = train_test_split(X, targets, test_size=0.2)\n# gnb = GaussianNB()\n# X, y = load_iris(return_X_y=True)\nclf = tree.DecisionTreeClassifier()\nclf = clf.fit(X_train, y_train)\ny_pred = clf.predict(X_test)\nprint((X_test.shape[0], (y_test == y_pred).sum()))\nsha=X_test.shape[0]\npr=(y_test == y_pred).sum()\nprint(pr/sha)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"data = pd.DataFrame(confusion_matrix(y_test, clf.predict(X_test)))\nprint(data)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"heat_map = sns.heatmap(data)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"pruning"},{"metadata":{"trusted":true},"cell_type":"code","source":"clf = tree.DecisionTreeClassifier(random_state=0)\npath = clf.cost_complexity_pruning_path(X_train, y_train)\nccp_alphas, impurities = path.ccp_alphas, path.impurities\nfig, ax = plt.subplots()\nax.plot(ccp_alphas[:-1], impurities[:-1], marker='o', drawstyle=\"steps-post\")\nax.set_xlabel(\"effective alpha\")\nax.set_ylabel(\"total impurity of leaves\")\nax.set_title(\"Total Impurity vs effective alpha for training set\")\nclfs = []\nfor ccp_alpha in ccp_alphas:\n    clf = tree.DecisionTreeClassifier(random_state=0, ccp_alpha=ccp_alpha)\n    clf.fit(X_train, y_train)\n    clfs.append(clf)\nprint(\"Number of nodes in the last tree is: {} with ccp_alpha: {}\".format(\n      clfs[-1].tree_.node_count, ccp_alphas[-1]))\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"clfs = clfs[:-1]\nccp_alphas = ccp_alphas[:-1]\n\nnode_counts = [clf.tree_.node_count for clf in clfs]\ndepth = [clf.tree_.max_depth for clf in clfs]\nfig, ax = plt.subplots(2, 1)\nax[0].plot(ccp_alphas, node_counts, marker='o', drawstyle=\"steps-post\")\nax[0].set_xlabel(\"alpha\")\nax[0].set_ylabel(\"number of nodes\")\nax[0].set_title(\"Number of nodes vs alpha\")\nax[1].plot(ccp_alphas, depth, marker='o', drawstyle=\"steps-post\")\nax[1].set_xlabel(\"alpha\")\nax[1].set_ylabel(\"depth of tree\")\nax[1].set_title(\"Depth vs alpha\")\nfig.tight_layout()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_scores = [clf.score(X_train, y_train) for clf in clfs]\ntest_scores = [clf.score(X_test, y_test) for clf in clfs]\n\nfig, ax = plt.subplots()\nax.set_xlabel(\"alpha\")\nax.set_ylabel(\"accuracy\")\nax.set_title(\"Accuracy vs alpha for training and testing sets\")\nax.plot(ccp_alphas, train_scores, marker='o', label=\"train\",\n        drawstyle=\"steps-post\")\nax.plot(ccp_alphas, test_scores, marker='o', label=\"test\",\n        drawstyle=\"steps-post\")\nax.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Bagging on Decision Tree"},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.ensemble import BaggingClassifier\nfrom sklearn import tree\nX_train, X_test, y_train, y_test = train_test_split(X, targets, test_size=0.2)\npre = []\nsample = []\nfor i in range(1,11):\n    clf = BaggingClassifier(tree.DecisionTreeClassifier(),max_samples=(i/10), max_features=0.5)\n    clf=clf.fit(X_train, y_train)\n    y_pred = clf.predict(X_test)\n    print((X_test.shape[0], (y_test == y_pred).sum()))\n    sha=X_test.shape[0]\n    pr=(y_test == y_pred).sum()\n    print(pr/sha)\n    pre.append(pr/sha)\n    sample.append(i/10)\nprint(pre)    \n    ","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fig, ax = plt.subplots()\nax.set_xlabel(\"sample size\")\nax.set_ylabel(\"accuracy\")\nax.set_title(\"Accuracy vs sample size for testing sets\")\nax.plot(sample, pre, marker='o', label=\"test\",\n        drawstyle=\"steps-post\")\n# ax.plot(sample, test_scores, marker='o', label=\"test\",\n#         drawstyle=\"steps-post\")\nax.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"ANN"},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.neural_network import MLPClassifier\n\nfrom sklearn.datasets import load_iris\nfrom sklearn import tree\nX_train, X_test, y_train, y_test = train_test_split(X, targets, test_size=0.1)\npre = []\nsamM = []\nclf = MLPClassifier(solver='lbfgs', alpha=1e-5,activation='logistic',\n                    hidden_layer_sizes=(10,5,), random_state=1)\n\nclf=clf.fit(X_train, y_train)\ny_pred = clf.predict(X_test)\nprint((X_test.shape[0], (y_test == y_pred).sum()))\nsha=X_test.shape[0]\npr=(y_test == y_pred).sum()\nprint(pr/sha)\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"pre=[]\nsamM=[]\npre.append(0.7261146496815286)\nsamM.append('tanh')\npre.append(0.7184713375796178)\nsamM.append('relu')\npre.append(0.6993630573248407)\nsamM.append('identity')\npre.append(0.70828025477707)\nsamM.append('logistic')\nprint(samM)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fig, ax = plt.subplots()\nax.set_xlabel(\"activation function\")\nax.set_ylabel(\"accuracy\")\nax.set_title(\"Accuracy vs activation function for testing sets\")\nax.plot(samM, pre, marker='o', label=\"test\",\n        drawstyle=\"steps-post\")\n# ax.plot(sample, test_scores, marker='o', label=\"test\",\n#         drawstyle=\"steps-post\")\nax.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"Random Forest","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.ensemble import RandomForestClassifier\nX_train, X_test, y_train, y_test = train_test_split(X, targets, test_size=0.2)\npre =[]\nsamR = []\nfor i in range(1,30,5):\n    clf = RandomForestClassifier(max_depth=i, random_state=0)\n    clf=clf.fit(X_train, y_train)\n    y_pred = clf.predict(X_test)\n    print((X_test.shape[0], (y_test == y_pred).sum()))\n    sha=X_test.shape[0]\n    pr=(y_test == y_pred).sum()\n    print(pr/sha)\n    pre.append(pr/sha)\n    samR.append(i)\nprint(pre)\nprint(samR)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fig, ax = plt.subplots()\nax.set_xlabel(\"maxDepth\")\nax.set_ylabel(\"accuracy\")\nax.set_title(\"Accuracy vs maxDepth for testing sets\")\nax.plot(samR, pre, marker='o', label=\"test\",\n        drawstyle=\"steps-post\")\n# ax.plot(sample, test_scores, marker='o', label=\"test\",\n#         drawstyle=\"steps-post\")\nax.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"print(X)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"After PCA KNN"},{"metadata":{"trusted":true},"cell_type":"code","source":"\nfrom sklearn.neighbors import KNeighborsClassifier\nX_train, X_test, y_train, y_test = train_test_split(R, targets, test_size=0.1, random_state=0)\nnbg = []\nsampK = []\nfor i in range(1,15):\n    neigh = KNeighborsClassifier(n_neighbors=i)\n    clf=neigh.fit(X_train, y_train)\n    # clf = clf.fit(X, targets)\n    y_pred = clf.predict(X_test)\n    print((X_test.shape[0], (y_test==y_pred).sum()))\n    sha=X_test.shape[0]\n    pr=(y_test == y_pred).sum()\n    print(pr/sha)\n    nbg.append(pr/sha)\n    sampK.append(i)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fig, ax = plt.subplots()\nax.set_xlabel(\"Neighbors\")\nax.set_ylabel(\"accuracy\")\nax.set_title(\"Accuracy vs Neighbors for testing sets\")\nax.plot(sampK, nbg, marker='o', label=\"test\",\n        drawstyle=\"steps-post\")\n# ax.plot(sample, test_scores, marker='o', label=\"test\",\n#         drawstyle=\"steps-post\")\nax.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Bagging onn knn after PCA"},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.ensemble import BaggingClassifier\nfrom sklearn import tree\nX_train, X_test, y_train, y_test = train_test_split(R, targets, test_size=0.1)\npre = []\nsample = []\nfor i in range(1,11):\n    clf = BaggingClassifier(KNeighborsClassifier(),max_samples=(i/10), max_features=0.9)\n    clf=clf.fit(X_train, y_train)\n    y_pred = clf.predict(X_test)\n    print((X_test.shape[0], (y_test == y_pred).sum()))\n    sha=X_test.shape[0]\n    pr=(y_test == y_pred).sum()\n    print(pr/sha)\n    pre.append(pr/sha)\n    sample.append(i/10)\nprint(pre) ","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fig, ax = plt.subplots()\nax.set_xlabel(\"sample size\")\nax.set_ylabel(\"accuracy\")\nax.set_title(\"Accuracy vs sample size for testing sets\")\nax.plot(sample, pre, marker='o', label=\"test\",\n        drawstyle=\"steps-post\")\n# ax.plot(sample, test_scores, marker='o', label=\"test\",\n#         drawstyle=\"steps-post\")\nax.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Naiva Bayes after PCA"},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.model_selection import train_test_split\nfrom sklearn.naive_bayes import GaussianNB\nX_train, X_test, y_train, y_test = train_test_split(R, targets, test_size=0.1)\ngnb = GaussianNB()\ny_pred = gnb.fit(X_train, y_train).predict(X_test)\nprint((X_test.shape[0], (y_test == y_pred).sum()))\nsha=X_test.shape[0]\npr=(y_test == y_pred).sum()\nprint(pr/sha)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Decision tree after PCA"},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn import tree\nX_train, X_test, y_train, y_test = train_test_split(R, targets, test_size=0.2)\n# gnb = GaussianNB()\n# X, y = load_iris(return_X_y=True)\nclf = tree.DecisionTreeClassifier()\nclf = clf.fit(X_train, y_train)\ny_pred = clf.predict(X_test)\nprint((X_test.shape[0], (y_test == y_pred).sum()))\nsha=X_test.shape[0]\npr=(y_test == y_pred).sum()\nprint(pr/sha)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"data = pd.DataFrame(confusion_matrix(y_test, clf.predict(X_test)))\nprint(data)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"heat_map = sns.heatmap(data)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Pruninig after PCA "},{"metadata":{"trusted":true},"cell_type":"code","source":"clf = tree.DecisionTreeClassifier(random_state=0)\npath = clf.cost_complexity_pruning_path(X_train, y_train)\nccp_alphas, impurities = path.ccp_alphas, path.impurities\nfig, ax = plt.subplots()\nax.plot(ccp_alphas[:-1], impurities[:-1], marker='o', drawstyle=\"steps-post\")\nax.set_xlabel(\"effective alpha\")\nax.set_ylabel(\"total impurity of leaves\")\nax.set_title(\"Total Impurity vs effective alpha for training set\")\nclfs = []\nfor ccp_alpha in ccp_alphas:\n    clf = tree.DecisionTreeClassifier(random_state=0, ccp_alpha=ccp_alpha)\n    clf.fit(X_train, y_train)\n    clfs.append(clf)\nprint(\"Number of nodes in the last tree is: {} with ccp_alpha: {}\".format(\n      clfs[-1].tree_.node_count, ccp_alphas[-1]))\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"clfs = clfs[:-1]\nccp_alphas = ccp_alphas[:-1]\n\nnode_counts = [clf.tree_.node_count for clf in clfs]\ndepth = [clf.tree_.max_depth for clf in clfs]\nfig, ax = plt.subplots(2, 1)\nax[0].plot(ccp_alphas, node_counts, marker='o', drawstyle=\"steps-post\")\nax[0].set_xlabel(\"alpha\")\nax[0].set_ylabel(\"number of nodes\")\nax[0].set_title(\"Number of nodes vs alpha\")\nax[1].plot(ccp_alphas, depth, marker='o', drawstyle=\"steps-post\")\nax[1].set_xlabel(\"alpha\")\nax[1].set_ylabel(\"depth of tree\")\nax[1].set_title(\"Depth vs alpha\")\nfig.tight_layout()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_scores = [clf.score(X_train, y_train) for clf in clfs]\ntest_scores = [clf.score(X_test, y_test) for clf in clfs]\n\nfig, ax = plt.subplots()\nax.set_xlabel(\"alpha\")\nax.set_ylabel(\"accuracy\")\nax.set_title(\"Accuracy vs alpha for training and testing sets\")\nax.plot(ccp_alphas, train_scores, marker='o', label=\"train\",\n        drawstyle=\"steps-post\")\nax.plot(ccp_alphas, test_scores, marker='o', label=\"test\",\n        drawstyle=\"steps-post\")\nax.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Bagging on Decision tree after PCA"},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.ensemble import BaggingClassifier\nfrom sklearn import tree\nX_train, X_test, y_train, y_test = train_test_split(R, targets, test_size=0.2)\npre = []\nsample = []\nfor i in range(1,11):\n    clf = BaggingClassifier(tree.DecisionTreeClassifier(),max_samples=(i/10), max_features=0.9)\n    clf=clf.fit(X_train, y_train)\n    y_pred = clf.predict(X_test)\n    print((X_test.shape[0], (y_test == y_pred).sum()))\n    sha=X_test.shape[0]\n    pr=(y_test == y_pred).sum()\n    print(pr/sha)\n    pre.append(pr/sha)\n    sample.append(i/10)\nprint(pre)    \n    ","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fig, ax = plt.subplots()\nax.set_xlabel(\"sample size\")\nax.set_ylabel(\"accuracy\")\nax.set_title(\"Accuracy vs sample size for testing sets\")\nax.plot(sample, pre, marker='o', label=\"test\",\n        drawstyle=\"steps-post\")\n# ax.plot(sample, test_scores, marker='o', label=\"test\",\n#         drawstyle=\"steps-post\")\nax.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"ANN after PCA"},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.neural_network import MLPClassifier\n\nfrom sklearn.datasets import load_iris\nfrom sklearn import tree\nX_train, X_test, y_train, y_test = train_test_split(R, targets, test_size=0.1)\npre = []\nsamM = []\nclf = MLPClassifier(solver='lbfgs', alpha=1e-5,activation='identity',\n                    hidden_layer_sizes=(10,5,), random_state=1)\n\nclf=clf.fit(X_train, y_train)\ny_pred = clf.predict(X_test)\nprint((X_test.shape[0], (y_test == y_pred).sum()))\nsha=X_test.shape[0]\npr=(y_test == y_pred).sum()\nprint(pr/sha)\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"pre=[]\nsamM=[]\npre.append(0.73121019108280256)\nsamM.append('tanh')\npre.append(0.7031847133757961)\nsamM.append('relu')\npre.append(0.6687898089171974)\nsamM.append('identity')\npre.append(0.6929936305732484)\nsamM.append('logistic')\nprint(samM)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fig, ax = plt.subplots()\nax.set_xlabel(\"activation function\")\nax.set_ylabel(\"accuracy\")\nax.set_title(\"Accuracy vs activation function for testing sets\")\nax.plot(samM, pre, marker='o', label=\"test\",\n        drawstyle=\"steps-post\")\n# ax.plot(sample, test_scores, marker='o', label=\"test\",\n#         drawstyle=\"steps-post\")\nax.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Random Forest after PCA"},{"metadata":{"trusted":true},"cell_type":"code","source":"from sklearn.ensemble import RandomForestClassifier\nX_train, X_test, y_train, y_test = train_test_split(R, targets, test_size=0.2)\npre =[]\nsamR = []\nfor i in range(1,30,5):\n    clf = RandomForestClassifier(max_depth=i, random_state=0)\n    clf=clf.fit(X_train, y_train)\n    y_pred = clf.predict(X_test)\n    print((X_test.shape[0], (y_test == y_pred).sum()))\n    sha=X_test.shape[0]\n    pr=(y_test == y_pred).sum()\n    print(pr/sha)\n    pre.append(pr/sha)\n    samR.append(i)\nprint(pre)\nprint(samR)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fig, ax = plt.subplots()\nax.set_xlabel(\"maxDepth\")\nax.set_ylabel(\"accuracy\")\nax.set_title(\"Accuracy vs maxDepth for testing sets\")\nax.plot(samR, pre, marker='o', label=\"test\",\n        drawstyle=\"steps-post\")\n# ax.plot(sample, test_scores, marker='o', label=\"test\",\n#         drawstyle=\"steps-post\")\nax.legend()\nplt.show()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"print(R)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"targets","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"display_name":"Python 3","language":"python","name":"python3"},"language_info":{"name":"python","version":"3.6.6","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"}},"nbformat":4,"nbformat_minor":4}