{
  "id": 469243,
  "title": "Please help me understand the data.",
  "url": "/competitions/hms-harmful-brain-activity-classification/discussion/469243",
  "author_name": "",
  "post_date": "2024-01-19T16:58:17.522309300Z",
  "votes": null,
  "comment_count": 2,
  "views": 0,
  "content": "<p>​H​ello Kagglers,</p>\n<p>Within the file, I am finding numerous EEG files such as:</p>\n<p>/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/2208063991.parquet<br>\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/1712674008.parquet<br>\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/3959808174.parquet<br>\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/2958965493.parquet, and more….</p>\n<p>as well as spectrograms like:</p>\n<p>kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1050123564.parquet<br>\n/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1390259642.parquet<br>\n/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/26202716.parquet<br>\nand more….</p>\n<p>Train set has a dimension of</p>\n<p>train = pd.read_csv('/kaggle/input/hms-harmful-brain-activity-classification/train.csv')</p>\n<p>shape: (106800, 15)</p>\n<p>EEGs have different dimensions:</p>\n<p>eeg1 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/3959808174.parquet')</p>\n<p>shape:(10000, 20)</p>\n<p>eeg2 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/2208063991.parquet')</p>\n<p>shape:(12000, 20)</p>\n<p>Same for spectrograms:</p>\n<p>spec1 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1050123564.parquet')</p>\n<p>shape:(311, 401)</p>\n<p>spec2 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1390259642.parquet')</p>\n<p>shape:(475, 401)</p>\n<p>I find myself perplexed regarding the files. Is it okay to utilize only the information from train.csv (assuming that the data in the training set is derived from EEG and spectrogram files) for classification, or should I also incorporate EEGs? If the latter is the case, which specific file should I use?</p>",
  "messages": [
    {
      "id": "2609727",
      "postDate": "01/19/2024 16:58:17",
      "content": "<p>​H​ello Kagglers,</p>\n<p>Within the file, I am finding numerous EEG files such as:</p>\n<p>/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/2208063991.parquet<br>\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/1712674008.parquet<br>\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/3959808174.parquet<br>\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/2958965493.parquet, and more….</p>\n<p>as well as spectrograms like:</p>\n<p>kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1050123564.parquet<br>\n/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1390259642.parquet<br>\n/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/26202716.parquet<br>\nand more….</p>\n<p>Train set has a dimension of</p>\n<p>train = pd.read_csv('/kaggle/input/hms-harmful-brain-activity-classification/train.csv')</p>\n<p>shape: (106800, 15)</p>\n<p>EEGs have different dimensions:</p>\n<p>eeg1 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/3959808174.parquet')</p>\n<p>shape:(10000, 20)</p>\n<p>eeg2 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/2208063991.parquet')</p>\n<p>shape:(12000, 20)</p>\n<p>Same for spectrograms:</p>\n<p>spec1 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1050123564.parquet')</p>\n<p>shape:(311, 401)</p>\n<p>spec2 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1390259642.parquet')</p>\n<p>shape:(475, 401)</p>\n<p>I find myself perplexed regarding the files. Is it okay to utilize only the information from train.csv (assuming that the data in the training set is derived from EEG and spectrogram files) for classification, or should I also incorporate EEGs? If the latter is the case, which specific file should I use?</p>",
      "rawMarkdown": "​H​ello Kagglers,\n\nWithin the file, I am finding numerous EEG files such as:\n\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/2208063991.parquet\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/1712674008.parquet\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/3959808174.parquet\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/2958965493.parquet, and more....\n\nas well as spectrograms like:\n\nkaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1050123564.parquet\n/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1390259642.parquet\n/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/26202716.parquet\nand more....\n\nTrain set has a dimension of\n\ntrain = pd.read_csv('/kaggle/input/hms-harmful-brain-activity-classification/train.csv')\n\nshape: (106800, 15)\n\nEEGs have different dimensions:\n\neeg1 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/3959808174.parquet')\n\nshape:(10000, 20)\n\neeg2 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/2208063991.parquet')\n\nshape:(12000, 20)\n\nSame for spectrograms:\n\nspec1 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1050123564.parquet')\n\nshape:(311, 401)\n\nspec2 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1390259642.parquet')\n \nshape:(475, 401)\n\nI find myself perplexed regarding the files. Is it okay to utilize only the information from train.csv (assuming that the data in the training set is derived from EEG and spectrogram files) for classification, or should I also incorporate EEGs? If the latter is the case, which specific file should I use?",
      "votes": null
    },
    {
      "id": "2609942",
      "postDate": "01/19/2024 19:27:55",
      "content": "<p><a href=\"https://www.kaggle.com/anupaav\" target=\"_blank\">@anupaav</a> go through all discussions mention in this <a href=\"https://www.kaggle.com/competitions/hms-harmful-brain-activity-classification/discussion/458864#2604944\" target=\"_blank\">disucssion comment</a> for better understanding competition and data</p>",
      "rawMarkdown": "anupaav go through all discussions mention in this [disucssion comment](https://www.kaggle.com/competitions/hms-harmful-brain-activity-classification/discussion/458864#2604944) for better understanding competition and data",
      "votes": null
    },
    {
      "id": "2610131",
      "postDate": "01/19/2024 23:09:18",
      "content": "<p>Check the discussion section. I'm sure you will find clarification</p>",
      "rawMarkdown": "Check the discussion section. I'm sure you will find clarification",
      "votes": null
    }
  ],
  "comments": [
    {
      "id": 2609942,
      "author_name": "seshurajup",
      "author_url": "",
      "post_date": "01/19/2024 19:27:55",
      "content": "<p><a href=\"https://www.kaggle.com/anupaav\" target=\"_blank\">@anupaav</a> go through all discussions mention in this <a href=\"https://www.kaggle.com/competitions/hms-harmful-brain-activity-classification/discussion/458864#2604944\" target=\"_blank\">disucssion comment</a> for better understanding competition and data</p>",
      "votes": null,
      "replies": []
    },
    {
      "id": 2610131,
      "author_name": "yantxx",
      "author_url": "",
      "post_date": "01/19/2024 23:09:18",
      "content": "<p>Check the discussion section. I'm sure you will find clarification</p>",
      "votes": null,
      "replies": []
    }
  ],
  "raw_markdown_by_id": {
    "2609727": "​H​ello Kagglers,\n\nWithin the file, I am finding numerous EEG files such as:\n\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/2208063991.parquet\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/1712674008.parquet\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/3959808174.parquet\n/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/2958965493.parquet, and more....\n\nas well as spectrograms like:\n\nkaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1050123564.parquet\n/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1390259642.parquet\n/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/26202716.parquet\nand more....\n\nTrain set has a dimension of\n\ntrain = pd.read_csv('/kaggle/input/hms-harmful-brain-activity-classification/train.csv')\n\nshape: (106800, 15)\n\nEEGs have different dimensions:\n\neeg1 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/3959808174.parquet')\n\nshape:(10000, 20)\n\neeg2 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_eegs/2208063991.parquet')\n\nshape:(12000, 20)\n\nSame for spectrograms:\n\nspec1 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1050123564.parquet')\n\nshape:(311, 401)\n\nspec2 = pd.read_parquet('/kaggle/input/hms-harmful-brain-activity-classification/train_spectrograms/1390259642.parquet')\n \nshape:(475, 401)\n\nI find myself perplexed regarding the files. Is it okay to utilize only the information from train.csv (assuming that the data in the training set is derived from EEG and spectrogram files) for classification, or should I also incorporate EEGs? If the latter is the case, which specific file should I use?",
    "2609942": "anupaav go through all discussions mention in this [disucssion comment](https://www.kaggle.com/competitions/hms-harmful-brain-activity-classification/discussion/458864#2604944) for better understanding competition and data",
    "2610131": "Check the discussion section. I'm sure you will find clarification"
  },
  "source": "meta"
}