{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"markdown","source":"source:\n    https://github.com/rahul15197/Disease-Detection-based-on-Symptoms","metadata":{}},{"cell_type":"code","source":"from decimal import Decimal\nimport pandas as pd\nfrom sklearn.tree import DecisionTreeClassifier\nfrom sklearn.linear_model import LogisticRegression\nfrom sklearn.neighbors import KNeighborsClassifier\nfrom sklearn.svm import SVC\nfrom sklearn.metrics import accuracy_score\nfrom sklearn.model_selection import train_test_split, cross_val_score\nfrom sklearn.model_selection import GridSearchCV\nfrom sklearn.naive_bayes import MultinomialNB\nfrom sklearn.ensemble import RandomForestClassifier\nfrom sklearn.neural_network import MLPClassifier\nfrom sklearn.linear_model import SGDClassifier\nfrom xgboost import XGBClassifier\nfrom catboost import CatBoostClassifier, Pool\nfrom sklearn.discriminant_analysis import LinearDiscriminantAnalysis\nimport lightgbm as lgb\n####from sklego.mixture import BayesianGMMClassifier\nimport matplotlib.pyplot as plt\n# ignore warnings generated due to usage of old version of tensorflow\n#warnings.simplefilter(\"ignore\")\n\n\"\"\"**Disease Symptom dataset** was created in a separate python program.\n\n**Dataset scrapping** was done using **NHP website** and **wikipedia data**\n\"\"\"\n\n# Load Dataset scraped from NHP (https://www.nhp.gov.in/disease-a-z) & Wikipedia\n# Scrapping and creation of dataset csv is done in a separate program\nprint('loading')\ndf_comb = pd.read_csv(\"https://raw.githubusercontent.com/rahul15197/Disease-Detection-based-on-Symptoms/master/Dataset/dis_sym_dataset_comb.csv\")#/content/drive/My Drive/Python Project data/IR_Project/dis_sym_dataset_comb.csv\")\n\n# creation of features and label for training the models\nX = df_comb.iloc[:, 1:]\nY = df_comb.iloc[:, 0:1]\n\n\"\"\"*Train Test Split*\"\"\"\n\n# splitting data for training the classifiers and testing\nx_train, x_test, y_train, y_test = train_test_split(X, Y, test_size=0.10)\n\n# lists used for accuracy plots\naccuracy_list = []\n\nclassif=[MultinomialNB(),\n         RandomForestClassifier(n_estimators=10, criterion='entropy'),\n         KNeighborsClassifier(n_neighbors=7, weights='distance', n_jobs=4),\n        ####BayesianGMMClassifier( n_components=7,        random_state = xi, tol =1e-3,  covariance_type = 'full',  n_init=xi,  init_params='kmeans')\n        lgb.LGBMClassifier(scale_pos_weight=33,n_estimators=140 ),\n        SGDClassifier(),\n        \n         LogisticRegression(),\n         SVC(),\n         DecisionTreeClassifier(),\n         LinearDiscriminantAnalysis(),\n         #XGBClassifier(),\n         MLPClassifier(hidden_layer_sizes=(32, 32, 32), activation='relu', solver='adam', max_iter=50),\n         CatBoostClassifier(verbose=310),]\n\nfor cla in classif:\n    cla.fit(x_train,y_train)\n    pred = cla.predict(x_test)\n    accuracy_list.append([cla,accuracy_score(y_test, pred)])#,cross_val_score(cla, X, Y, cv=5).mean()])\n    print(pd.DataFrame(accuracy_list).sort_values(1))\n\n\n\n","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","execution":{"iopub.status.busy":"2022-08-14T15:25:21.662635Z","iopub.execute_input":"2022-08-14T15:25:21.663073Z","iopub.status.idle":"2022-08-14T15:35:50.546938Z","shell.execute_reply.started":"2022-08-14T15:25:21.663035Z","shell.execute_reply":"2022-08-14T15:35:50.545589Z"},"trusted":true},"execution_count":null,"outputs":[]}]}