{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.7.10","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":25383,"databundleVersionId":2684322,"sourceType":"competition"},{"sourceId":20270,"databundleVersionId":1222630,"sourceType":"competition"}],"dockerImageVersionId":30123,"isInternetEnabled":true,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import numpy as np\nimport pandas as pd\n\nfrom sklearn import datasets\nfrom sklearn import model_selection","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","execution":{"iopub.status.busy":"2025-10-08T18:03:32.543767Z","iopub.execute_input":"2025-10-08T18:03:32.544173Z","iopub.status.idle":"2025-10-08T18:03:33.669479Z","shell.execute_reply.started":"2025-10-08T18:03:32.544042Z","shell.execute_reply":"2025-10-08T18:03:33.668456Z"},"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"def create_folds(data, num_splits):\n    data[\"kfold\"] = -1\n    num_bins = int(np.floor(1 + np.log2(len(data))))\n    print('num_bins: ',num_bins)\n\n    data.loc[:, \"bins\"] = pd.cut(data[\"target\"], bins=num_bins, labels=False)\n\n    kf = model_selection.StratifiedKFold(n_splits=num_splits, shuffle=True, random_state=42)\n    \n    for f, (t_, v_) in enumerate(kf.split(X=data, y=data.bins.values)):\n        data.loc[v_, 'kfold'] = f\n#     print(data.head())\n    data = data.drop(\"bins\", axis=1)\n\n    return data","metadata":{"execution":{"iopub.status.busy":"2025-10-08T18:03:33.671791Z","iopub.execute_input":"2025-10-08T18:03:33.672152Z","iopub.status.idle":"2025-10-08T18:03:33.680392Z","shell.execute_reply.started":"2025-10-08T18:03:33.672108Z","shell.execute_reply":"2025-10-08T18:03:33.679477Z"},"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df = pd.read_csv(\"/kaggle/input/siim-isic-melanoma-classification/train.csv\")\n\ndf_5 = create_folds(df, num_splits=5)\ndf_10 = create_folds(df, num_splits=10)","metadata":{"execution":{"iopub.status.busy":"2025-10-08T18:03:33.682098Z","iopub.execute_input":"2025-10-08T18:03:33.682320Z","iopub.status.idle":"2025-10-08T18:03:33.830433Z","shell.execute_reply.started":"2025-10-08T18:03:33.682294Z","shell.execute_reply":"2025-10-08T18:03:33.829451Z"},"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_5.to_csv(\"train_5folds.csv\", index=False)\ndf_10.to_csv(\"train_10folds.csv\", index=False)","metadata":{"execution":{"iopub.status.busy":"2025-10-08T18:03:33.831767Z","iopub.execute_input":"2025-10-08T18:03:33.832106Z","iopub.status.idle":"2025-10-08T18:03:34.079777Z","shell.execute_reply.started":"2025-10-08T18:03:33.832055Z","shell.execute_reply":"2025-10-08T18:03:34.078962Z"},"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"","metadata":{"trusted":true},"outputs":[],"execution_count":null}]}