{
  "id": 205832,
  "title": "Consejos para principiantes",
  "url": "/competitions/interbank20/discussion/205832",
  "author_name": "",
  "post_date": "2020-12-22T05:24:19.785180800Z",
  "votes": 5,
  "comment_count": 2,
  "views": 0,
  "content": "<p>Hola a todos.<br>\nSiendo esta mi primera competencia de ciencia de datos, quisiera que puedan darme algunas pautas y resolver algunas dudas que tengo:</p>\n<ul>\n<li>Cuando entreno mi modelo, tomando como base el cv del kernel de ejemplo, veo que tengo un auc de 0.86 aprox; sin embargo en la tabla pública tengo una puntuación de 0.81. Esto les está sucediendo a todos, o estoy haciendo algo mal?</li>\n<li>Por ahora he tratado de explotar más la tabla del rcc, en base a tablas cruzadas (como en el ejemplo) considerando conteos, sumas y promedios (alguna sugerencia de cómo más explotar esta tabla). Noté que las otras tablas (demográficas, sunat y censo) te dan un aumento de casi 3 puntos de auc, pero aún no he hecho algún tratamiento a estas tablas ya que el cruce es directo, han explotado de alguna manera estas otras fuentes?</li>\n<li>Han podido usar el archivo productos.csv?, pq parecer haber un error con el archivo. No tiene id y no están todos los códigos que aparecen en train y test.</li>\n</ul>\n<p>Espero puedan darme algunos consejos y ganar experiencia y conocimientos en este campo de ciencia de datos.</p>\n<p>Saludos.</p>",
  "messages": [
    {
      "id": "1121996",
      "postDate": "12/22/2020 05:24:19",
      "content": "<p>Hola a todos.<br>\nSiendo esta mi primera competencia de ciencia de datos, quisiera que puedan darme algunas pautas y resolver algunas dudas que tengo:</p>\n<ul>\n<li>Cuando entreno mi modelo, tomando como base el cv del kernel de ejemplo, veo que tengo un auc de 0.86 aprox; sin embargo en la tabla pública tengo una puntuación de 0.81. Esto les está sucediendo a todos, o estoy haciendo algo mal?</li>\n<li>Por ahora he tratado de explotar más la tabla del rcc, en base a tablas cruzadas (como en el ejemplo) considerando conteos, sumas y promedios (alguna sugerencia de cómo más explotar esta tabla). Noté que las otras tablas (demográficas, sunat y censo) te dan un aumento de casi 3 puntos de auc, pero aún no he hecho algún tratamiento a estas tablas ya que el cruce es directo, han explotado de alguna manera estas otras fuentes?</li>\n<li>Han podido usar el archivo productos.csv?, pq parecer haber un error con el archivo. No tiene id y no están todos los códigos que aparecen en train y test.</li>\n</ul>\n<p>Espero puedan darme algunos consejos y ganar experiencia y conocimientos en este campo de ciencia de datos.</p>\n<p>Saludos.</p>",
      "rawMarkdown": "Hola a todos.\nSiendo esta mi primera competencia de ciencia de datos, quisiera que puedan darme algunas pautas y resolver algunas dudas que tengo:\n\n- Cuando entreno mi modelo, tomando como base el cv del kernel de ejemplo, veo que tengo un auc de 0.86 aprox; sin embargo en la tabla pública tengo una puntuación de 0.81. Esto les está sucediendo a todos, o estoy haciendo algo mal?\n- Por ahora he tratado de explotar más la tabla del rcc, en base a tablas cruzadas (como en el ejemplo) considerando conteos, sumas y promedios (alguna sugerencia de cómo más explotar esta tabla). Noté que las otras tablas (demográficas, sunat y censo) te dan un aumento de casi 3 puntos de auc, pero aún no he hecho algún tratamiento a estas tablas ya que el cruce es directo, han explotado de alguna manera estas otras fuentes?\n- Han podido usar el archivo productos.csv?, pq parecer haber un error con el archivo. No tiene id y no están todos los códigos que aparecen en train y test.\n\nEspero puedan darme algunos consejos y ganar experiencia y conocimientos en este campo de ciencia de datos.\n\nSaludos.",
      "votes": null
    },
    {
      "id": "1122425",
      "postDate": "12/22/2020 12:36:31",
      "content": "<p>Hola <a href=\"https://www.kaggle.com/TheLastDragon\" target=\"_blank\">@TheLastDragon</a> luego de varias competencias en Kaggle, sin ser un experto como otros compañeros en la competencia, me permito compartir algunas respuestas:</p>\n<p><strong>1) Diferencias entre CV y resultados en la tabla pública:</strong><br>\nLos valores obtenidos en tu CV puede variar con la tabla pública dado que la se basa sólo en el 30% de los datos, por lo tanto es posible que los datos se adapten mejor o no a tu modelo, por lo tanto los resultados finales en la tabla privada suelen ser bastante distintos.</p>\n<p><strong>2) Uso de las tablas:</strong><br>\na)* Rcc_(train/test)* es la tabla más importante y puede sacar mucha información para el modelo, sugiero que hagas más cruces.<br>\nb) <em>Se_(train/test)</em> tiene datos muy buenos del perfil de la persona, ten cuidado porque no todos los datos cruzan pero casi todos están en ambas tablas. (Puedes trabaja los missing values).<br>\nb) <em>Sunat_(train/test)</em> tiene datos buenos pero no tanto como los anteriores, además tiene filas repetidas y no cruzan todos los clientes (Debes Trabaja los missing values).<br>\nc) <em>Censo_(train/test)</em> tiene mucha data, pero muchos missing values, he intentado cruzarla varias veces pero, a pesar que aumenta el CV los resultados finales no son tan bueno. Aquí es obligatorio llenar los missing values.</p>\n<p><strong>3) Usos de la tabla producto:</strong><br>\nLa tabla producto se cruza con rcc por el campo producto, es más de índole informativa, pero puede darte luces por ejemplo, si el cliente tiene créditos castigados:<br>\nNombre                                                            id<br>\nCREDITOS CASTIGOS                                            12<br>\nCREDITO CASTIGADOS SIENDO AMORTIZADOS    25</p>\n<p>Espero que le puede servir de ayuda a todos y mucho éxito en la competencia, si tiene otros consejos por favor envíenlos.</p>\n<p>PD: Gracias por aumentar los envíos a 5 por día para poder probar más alternativas.</p>\n<p>Saludos<br>\nOmar Vivas</p>",
      "rawMarkdown": "Hola @TheLastDragon luego de varias competencias en Kaggle, sin ser un experto como otros compañeros en la competencia, me permito compartir algunas respuestas:\n\n**1) Diferencias entre CV y resultados en la tabla pública:**\nLos valores obtenidos en tu CV puede variar con la tabla pública dado que la se basa sólo en el 30% de los datos, por lo tanto es posible que los datos se adapten mejor o no a tu modelo, por lo tanto los resultados finales en la tabla privada suelen ser bastante distintos.\n\n**2) Uso de las tablas:**\na)* Rcc_(train/test)* es la tabla más importante y puede sacar mucha información para el modelo, sugiero que hagas más cruces.\nb) *Se_(train/test)* tiene datos muy buenos del perfil de la persona, ten cuidado porque no todos los datos cruzan pero casi todos están en ambas tablas. (Puedes trabaja los missing values).\nb) *Sunat_(train/test)* tiene datos buenos pero no tanto como los anteriores, además tiene filas repetidas y no cruzan todos los clientes (Debes Trabaja los missing values).\nc) *Censo_(train/test)* tiene mucha data, pero muchos missing values, he intentado cruzarla varias veces pero, a pesar que aumenta el CV los resultados finales no son tan bueno. Aquí es obligatorio llenar los missing values.\n\n**3) Usos de la tabla producto:**\nLa tabla producto se cruza con rcc por el campo producto, es más de índole informativa, pero puede darte luces por ejemplo, si el cliente tiene créditos castigados:\nNombre\t\t\t\t\t                                        id\nCREDITOS CASTIGOS\t\t\t                                12\nCREDITO CASTIGADOS SIENDO AMORTIZADOS\t25\n\nEspero que le puede servir de ayuda a todos y mucho éxito en la competencia, si tiene otros consejos por favor envíenlos.\n\nPD: Gracias por aumentar los envíos a 5 por día para poder probar más alternativas.\n\nSaludos\nOmar Vivas",
      "votes": null
    },
    {
      "id": "1122836",
      "postDate": "12/22/2020 18:28:45",
      "content": "<p>Buenas tardes  <a href=\"https://www.kaggle.com/TheLastDragon\" target=\"_blank\">@TheLastDragon</a>, te recomiendo algunos puntos:</p>\n<p>1) Recuerda el esquema de los datos. estamos utilizando datos históricos en dos líneas de tiempos diferentes para train y test. Así, el experimento que hagas debe ser lo mas parecido para que tu CV train y tabla pública sean lo mas parecidas.</p>\n<p>2) En base a 1), el conjunto de datos Censo_(train/test) fue obtenido en 2017, lo cual hay una diferencia de un año y dos años para los dados de train y test. (te recomiendo no usar los datos Censo). </p>\n<p>3) Obtener tablas experimentales de RCC y utilizar penalizaciones para reducir el número de variables. Acá literalmente puedes obtener mas de 2000 variables.</p>",
      "rawMarkdown": "Buenas tardes  @TheLastDragon, te recomiendo algunos puntos:\n\n1) Recuerda el esquema de los datos. estamos utilizando datos históricos en dos líneas de tiempos diferentes para train y test. Así, el experimento que hagas debe ser lo mas parecido para que tu CV train y tabla pública sean lo mas parecidas.\n\n2) En base a 1), el conjunto de datos Censo_(train/test) fue obtenido en 2017, lo cual hay una diferencia de un año y dos años para los dados de train y test. (te recomiendo no usar los datos Censo). \n\n3) Obtener tablas experimentales de RCC y utilizar penalizaciones para reducir el número de variables. Acá literalmente puedes obtener mas de 2000 variables.",
      "votes": null
    }
  ],
  "comments": [
    {
      "id": 1122425,
      "author_name": "omarvivas",
      "author_url": "",
      "post_date": "12/22/2020 12:36:31",
      "content": "<p>Hola <a href=\"https://www.kaggle.com/TheLastDragon\" target=\"_blank\">@TheLastDragon</a> luego de varias competencias en Kaggle, sin ser un experto como otros compañeros en la competencia, me permito compartir algunas respuestas:</p>\n<p><strong>1) Diferencias entre CV y resultados en la tabla pública:</strong><br>\nLos valores obtenidos en tu CV puede variar con la tabla pública dado que la se basa sólo en el 30% de los datos, por lo tanto es posible que los datos se adapten mejor o no a tu modelo, por lo tanto los resultados finales en la tabla privada suelen ser bastante distintos.</p>\n<p><strong>2) Uso de las tablas:</strong><br>\na)* Rcc_(train/test)* es la tabla más importante y puede sacar mucha información para el modelo, sugiero que hagas más cruces.<br>\nb) <em>Se_(train/test)</em> tiene datos muy buenos del perfil de la persona, ten cuidado porque no todos los datos cruzan pero casi todos están en ambas tablas. (Puedes trabaja los missing values).<br>\nb) <em>Sunat_(train/test)</em> tiene datos buenos pero no tanto como los anteriores, además tiene filas repetidas y no cruzan todos los clientes (Debes Trabaja los missing values).<br>\nc) <em>Censo_(train/test)</em> tiene mucha data, pero muchos missing values, he intentado cruzarla varias veces pero, a pesar que aumenta el CV los resultados finales no son tan bueno. Aquí es obligatorio llenar los missing values.</p>\n<p><strong>3) Usos de la tabla producto:</strong><br>\nLa tabla producto se cruza con rcc por el campo producto, es más de índole informativa, pero puede darte luces por ejemplo, si el cliente tiene créditos castigados:<br>\nNombre                                                            id<br>\nCREDITOS CASTIGOS                                            12<br>\nCREDITO CASTIGADOS SIENDO AMORTIZADOS    25</p>\n<p>Espero que le puede servir de ayuda a todos y mucho éxito en la competencia, si tiene otros consejos por favor envíenlos.</p>\n<p>PD: Gracias por aumentar los envíos a 5 por día para poder probar más alternativas.</p>\n<p>Saludos<br>\nOmar Vivas</p>",
      "votes": null,
      "replies": []
    },
    {
      "id": 1122836,
      "author_name": "ggxgboostgg",
      "author_url": "",
      "post_date": "12/22/2020 18:28:45",
      "content": "<p>Buenas tardes  <a href=\"https://www.kaggle.com/TheLastDragon\" target=\"_blank\">@TheLastDragon</a>, te recomiendo algunos puntos:</p>\n<p>1) Recuerda el esquema de los datos. estamos utilizando datos históricos en dos líneas de tiempos diferentes para train y test. Así, el experimento que hagas debe ser lo mas parecido para que tu CV train y tabla pública sean lo mas parecidas.</p>\n<p>2) En base a 1), el conjunto de datos Censo_(train/test) fue obtenido en 2017, lo cual hay una diferencia de un año y dos años para los dados de train y test. (te recomiendo no usar los datos Censo). </p>\n<p>3) Obtener tablas experimentales de RCC y utilizar penalizaciones para reducir el número de variables. Acá literalmente puedes obtener mas de 2000 variables.</p>",
      "votes": null,
      "replies": []
    }
  ],
  "raw_markdown_by_id": {
    "1121996": "Hola a todos.\nSiendo esta mi primera competencia de ciencia de datos, quisiera que puedan darme algunas pautas y resolver algunas dudas que tengo:\n\n- Cuando entreno mi modelo, tomando como base el cv del kernel de ejemplo, veo que tengo un auc de 0.86 aprox; sin embargo en la tabla pública tengo una puntuación de 0.81. Esto les está sucediendo a todos, o estoy haciendo algo mal?\n- Por ahora he tratado de explotar más la tabla del rcc, en base a tablas cruzadas (como en el ejemplo) considerando conteos, sumas y promedios (alguna sugerencia de cómo más explotar esta tabla). Noté que las otras tablas (demográficas, sunat y censo) te dan un aumento de casi 3 puntos de auc, pero aún no he hecho algún tratamiento a estas tablas ya que el cruce es directo, han explotado de alguna manera estas otras fuentes?\n- Han podido usar el archivo productos.csv?, pq parecer haber un error con el archivo. No tiene id y no están todos los códigos que aparecen en train y test.\n\nEspero puedan darme algunos consejos y ganar experiencia y conocimientos en este campo de ciencia de datos.\n\nSaludos.",
    "1122425": "Hola @TheLastDragon luego de varias competencias en Kaggle, sin ser un experto como otros compañeros en la competencia, me permito compartir algunas respuestas:\n\n**1) Diferencias entre CV y resultados en la tabla pública:**\nLos valores obtenidos en tu CV puede variar con la tabla pública dado que la se basa sólo en el 30% de los datos, por lo tanto es posible que los datos se adapten mejor o no a tu modelo, por lo tanto los resultados finales en la tabla privada suelen ser bastante distintos.\n\n**2) Uso de las tablas:**\na)* Rcc_(train/test)* es la tabla más importante y puede sacar mucha información para el modelo, sugiero que hagas más cruces.\nb) *Se_(train/test)* tiene datos muy buenos del perfil de la persona, ten cuidado porque no todos los datos cruzan pero casi todos están en ambas tablas. (Puedes trabaja los missing values).\nb) *Sunat_(train/test)* tiene datos buenos pero no tanto como los anteriores, además tiene filas repetidas y no cruzan todos los clientes (Debes Trabaja los missing values).\nc) *Censo_(train/test)* tiene mucha data, pero muchos missing values, he intentado cruzarla varias veces pero, a pesar que aumenta el CV los resultados finales no son tan bueno. Aquí es obligatorio llenar los missing values.\n\n**3) Usos de la tabla producto:**\nLa tabla producto se cruza con rcc por el campo producto, es más de índole informativa, pero puede darte luces por ejemplo, si el cliente tiene créditos castigados:\nNombre\t\t\t\t\t                                        id\nCREDITOS CASTIGOS\t\t\t                                12\nCREDITO CASTIGADOS SIENDO AMORTIZADOS\t25\n\nEspero que le puede servir de ayuda a todos y mucho éxito en la competencia, si tiene otros consejos por favor envíenlos.\n\nPD: Gracias por aumentar los envíos a 5 por día para poder probar más alternativas.\n\nSaludos\nOmar Vivas",
    "1122836": "Buenas tardes  @TheLastDragon, te recomiendo algunos puntos:\n\n1) Recuerda el esquema de los datos. estamos utilizando datos históricos en dos líneas de tiempos diferentes para train y test. Así, el experimento que hagas debe ser lo mas parecido para que tu CV train y tabla pública sean lo mas parecidas.\n\n2) En base a 1), el conjunto de datos Censo_(train/test) fue obtenido en 2017, lo cual hay una diferencia de un año y dos años para los dados de train y test. (te recomiendo no usar los datos Censo). \n\n3) Obtener tablas experimentales de RCC y utilizar penalizaciones para reducir el número de variables. Acá literalmente puedes obtener mas de 2000 variables."
  },
  "source": "meta"
}