{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.11.13","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"nvidiaTeslaT4","dataSources":[{"sourceId":20270,"databundleVersionId":1222630,"sourceType":"competition"}],"dockerImageVersionId":31154,"isInternetEnabled":true,"language":"python","sourceType":"notebook","isGpuEnabled":true}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"import numpy as np\nimport pandas as pd\n\nfrom sklearn import datasets\nfrom sklearn import model_selection","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-10-11T14:59:25.599656Z","iopub.execute_input":"2025-10-11T14:59:25.599879Z","iopub.status.idle":"2025-10-11T14:59:27.604016Z","shell.execute_reply.started":"2025-10-11T14:59:25.599854Z","shell.execute_reply":"2025-10-11T14:59:27.602625Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"def create_folds(data, num_splits):\n    data[\"kfold\"] = -1\n    num_bins = int(np.floor(1 + np.log2(len(data))))\n    print('num_bins: ',num_bins)\n\n    # data.loc[:, \"bins\"] = pd.cut(data[\"Pawpularity\"], bins=num_bins, labels=False)\n\n    data.loc[:, \"bins\"] = pd.cut(data[\"target\"], bins=num_bins, labels=False)\n\n    kf = model_selection.StratifiedKFold(n_splits=num_splits, shuffle=True, random_state=42)\n    \n    for f, (t_, v_) in enumerate(kf.split(X=data, y=data.bins.values)):\n        data.loc[v_, 'kfold'] = f\n#     print(data.head())\n    data = data.drop(\"bins\", axis=1)\n\n    return data","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-10-11T14:59:27.606115Z","iopub.execute_input":"2025-10-11T14:59:27.606580Z","iopub.status.idle":"2025-10-11T14:59:27.612347Z","shell.execute_reply.started":"2025-10-11T14:59:27.606529Z","shell.execute_reply":"2025-10-11T14:59:27.611688Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df = pd.read_csv(\"/kaggle/input/siim-isic-melanoma-classification/train.csv\")\n\ndf_5 = create_folds(df, num_splits=5)\ndf_10 = create_folds(df, num_splits=10)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-10-11T14:59:27.612927Z","iopub.execute_input":"2025-10-11T14:59:27.613170Z","iopub.status.idle":"2025-10-11T14:59:27.829521Z","shell.execute_reply.started":"2025-10-11T14:59:27.613148Z","shell.execute_reply":"2025-10-11T14:59:27.828597Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_5.to_csv(\"train_5folds.csv\", index=False)\ndf_10.to_csv(\"train_10folds.csv\", index=False)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2025-10-11T14:59:27.830437Z","iopub.execute_input":"2025-10-11T14:59:27.830727Z","iopub.status.idle":"2025-10-11T14:59:28.089611Z","shell.execute_reply.started":"2025-10-11T14:59:27.830706Z","shell.execute_reply":"2025-10-11T14:59:28.088790Z"}},"outputs":[],"execution_count":null}]}