{
  "id": 208320,
  "title": "Conjunto de datos Censo ",
  "url": "/competitions/interbank20/discussion/208320",
  "author_name": "",
  "post_date": "2021-01-02T22:24:30.993289Z",
  "votes": null,
  "comment_count": 1,
  "views": 0,
  "content": "<p>Buenas tardes, estoy intentando trabajar el conjunto de datos censo, descubrí que la presencia de una persona en el censo o no, aumenta entre 0.03 a 0.05 en CV pero en LB hace que los resultados sean peores(que sin considerar censo) . Mi punto de vista es que esto sucede por causa de la diferencia de los años, posiblemente la distribución de los puntos cambió, o son solo variables que ocasionan ruido. Alguien tuvo suceso con el conjunto censo?</p>",
  "messages": [
    {
      "id": "1136268",
      "postDate": "01/02/2021 22:24:30",
      "content": "<p>Buenas tardes, estoy intentando trabajar el conjunto de datos censo, descubrí que la presencia de una persona en el censo o no, aumenta entre 0.03 a 0.05 en CV pero en LB hace que los resultados sean peores(que sin considerar censo) . Mi punto de vista es que esto sucede por causa de la diferencia de los años, posiblemente la distribución de los puntos cambió, o son solo variables que ocasionan ruido. Alguien tuvo suceso con el conjunto censo?</p>",
      "rawMarkdown": "Buenas tardes, estoy intentando trabajar el conjunto de datos censo, descubrí que la presencia de una persona en el censo o no, aumenta entre 0.03 a 0.05 en CV pero en LB hace que los resultados sean peores(que sin considerar censo) . Mi punto de vista es que esto sucede por causa de la diferencia de los años, posiblemente la distribución de los puntos cambió, o son solo variables que ocasionan ruido. Alguien tuvo suceso con el conjunto censo?",
      "votes": null
    },
    {
      "id": "1136819",
      "postDate": "01/03/2021 13:07:45",
      "content": "<p>Hola Diego, en mi caso me ocurre exactamente lo mismo. Pienso que la diferencia radica en que, a pesar que la info del Censo tiene valores que correlacionan muy bien con la variable objetivo, existen demasiados missing values, de hecho la info del censo con valores es:</p>\n<ul>\n<li>Para Train (153.129 valores/358.487 total --&gt; 57% missing).</li>\n<li>Para Test (200.499 valores/396.666 total--&gt; 32% missing).</li>\n</ul>\n<p>Saludos<br>\nOmar Vivas</p>",
      "rawMarkdown": "Hola Diego, en mi caso me ocurre exactamente lo mismo. Pienso que la diferencia radica en que, a pesar que la info del Censo tiene valores que correlacionan muy bien con la variable objetivo, existen demasiados missing values, de hecho la info del censo con valores es:\n- Para Train (153.129 valores/358.487 total --> 57% missing).\n- Para Test (200.499 valores/396.666 total--> 32% missing).\n\nSaludos\nOmar Vivas",
      "votes": null
    }
  ],
  "comments": [
    {
      "id": 1136819,
      "author_name": "omarvivas",
      "author_url": "",
      "post_date": "01/03/2021 13:07:45",
      "content": "<p>Hola Diego, en mi caso me ocurre exactamente lo mismo. Pienso que la diferencia radica en que, a pesar que la info del Censo tiene valores que correlacionan muy bien con la variable objetivo, existen demasiados missing values, de hecho la info del censo con valores es:</p>\n<ul>\n<li>Para Train (153.129 valores/358.487 total --&gt; 57% missing).</li>\n<li>Para Test (200.499 valores/396.666 total--&gt; 32% missing).</li>\n</ul>\n<p>Saludos<br>\nOmar Vivas</p>",
      "votes": null,
      "replies": []
    }
  ],
  "raw_markdown_by_id": {
    "1136268": "Buenas tardes, estoy intentando trabajar el conjunto de datos censo, descubrí que la presencia de una persona en el censo o no, aumenta entre 0.03 a 0.05 en CV pero en LB hace que los resultados sean peores(que sin considerar censo) . Mi punto de vista es que esto sucede por causa de la diferencia de los años, posiblemente la distribución de los puntos cambió, o son solo variables que ocasionan ruido. Alguien tuvo suceso con el conjunto censo?",
    "1136819": "Hola Diego, en mi caso me ocurre exactamente lo mismo. Pienso que la diferencia radica en que, a pesar que la info del Censo tiene valores que correlacionan muy bien con la variable objetivo, existen demasiados missing values, de hecho la info del censo con valores es:\n- Para Train (153.129 valores/358.487 total --> 57% missing).\n- Para Test (200.499 valores/396.666 total--> 32% missing).\n\nSaludos\nOmar Vivas"
  },
  "source": "meta"
}