{"cells":[{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"import gc\nimport os\nimport random\n\nimport numpy as np\nimport pandas as pd\nimport tqdm\nimport pickle\n\nfrom sklearn.model_selection import GroupShuffleSplit","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"def seed_everything(seed):\n    random.seed(seed)\n    os.environ['PYTHONHASHSEED'] = str(seed)\n    np.random.seed(seed)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"class config:\n    SEED = 416\n    N_FOLD = 3\n    TEST_RATIO = 0.3\n    N_SAMPLE_TEST = 0.1","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train = pd.read_feather(\"/kaggle/input/riiid-make-train-feather/train.feather\")\ntrain = train[train[\"answered_correctly\"] != -1].reset_index(drop=True)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"cv_index = {\"train\":[], \"valid\":[]}\ngsp = GroupShuffleSplit(config.N_FOLD, test_size=config.TEST_RATIO, random_state=config.SEED)\nfor fold, (train_idx, valid_idx) in enumerate(gsp.split(train, groups=train['user_id'])):\n    print(f\"### Fold-{fold} ###\")\n    seed_everything(config.SEED)\n    \n    user_count_dict = train['user_id'].iloc[valid_idx].value_counts().to_dict()\n    new_train_id = []\n    for user in tqdm.tqdm_notebook(user_count_dict.keys()):\n        if np.random.rand() > (1 - config.N_SAMPLE_TEST):\n            samples_to_add = np.random.binomial(user_count_dict[user], 0.50)\n            if samples_to_add > 0:\n                new_train_id = new_train_id + list(train[train['user_id'] == user].index[:samples_to_add])\n\n    #train_idx = np.array(new_train_id + list(train_idx))\n    valid_idx = np.array(list(set(valid_idx).difference(set(new_train_id))))\n    \n    #cv_index[\"train\"].append(train_idx)\n    cv_index[\"valid\"].append(valid_idx)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"#with open(\"riiid_cv_index.pkl\", \"wb\") as f:\n#    pickle.dump(cv_index, f)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train = train[[\"row_id\"]]\ngc.collect()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train[\"valid_fold\"] = -1\n\nfor fold, v_idx in enumerate(cv_index[\"valid\"]):\n    train[\"valid_fold\"].iloc[v_idx] = fold\n\ntrain.to_csv(f\"cv_fold_info.csv\", index=None)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat":4,"nbformat_minor":4}