{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"markdown","source":"# 인사말(Introduction)\n\n우리는 어떻게 기계 학습(machine learning) 모델들이 어떻게 작동하고 사용되는 지에 대해 개괄적으로 살펴보며 시작할 것입니다. 여러분이 이미 통계적인 모델링(statistical modeling)이나 기계 학습(machine learning)을 이전에 공부해본 사람들이라면 이번 시간이 너무 쉬울 수 있을 것 같아요. 하지만 걱정하지 말아요 곧 강력한 모델들을 만들어 나갈 것이니까요!\n\n이 코스는 다음과 같은 시나리오를 해야할 때 여러분이 모델을 만들도록 할 것입니다.\n\n당신의 사촌이 부동산 투기를 통해 수십 억원을 벌었습니다. 그 사촌은 당신이 데이터 과학(data science)에 관심을 가지고 있기 때문에 여러분에게 사업 파트너가 되겠다고 제안했습니다. 그 사촌은 돈을 공급하고 여러분은 다양한 주택의 가치를 예측하는 모델을 공급하게 될 것입니다.\n\n이제 여러분은 사촌에게 과거에 부동산 가치를 어떻게 예측했는 지 물어볼 것입니다. 그러면 사촌은 이렇게 답하겠죠. '감.' 당황함을 미루어두고 여러분은 여러가지 질문을 통해 사촌이 과거에 봤던 집들의 가격 패턴을 알아냈고 사촌은 그 패턴을 자신이 고려하고 있는 다른 집들에 대한 예측을 하기위해 사용하고 있다는 것을 밝혀냈습니다.\n\n기계학습(machine learning)도 같은 방식으로 작동합니다. 의사결정 나무(Decision Tree)라는 모델부터 시작하겠습니다. 더 정확한 예측을 해주는 더 멋진 모델들이 있지만 의사 결정 나무는 이해하기 쉽기도 한 동시에 데이터 과학에서의 최고 모델 중 일부를 구성하는 기본 요소이기도 합니다. \n\n단순하게 가장 간단한 의사결정 나무부터 시작하겠습니다. \n\n![First Decision Trees](http://i.imgur.com/7tsb5b1.png)\n\n위 그림에서는 집을 단순히 두 개의 범주(category)로 나눕니다. 아래에 나뉜 주택의 예측된 가격은 그 범주에 속하는 주택의 과거 평균 가격입니다.\n \n우리는 데이터를 사용하여 집을 두 그룹으로 나누고, 다시 각 그룹의 예측 가격을 결정하는 방법(위 그림에서 침실이 두 개 이상 있는가? 와 같은 의사결정 후 범주의 평균 가격 구하기)을 결정합니다. 이렇게 데이터에서 규칙(pattern)을 찾아내는 이 과정을 모델을 적합(**fitting**)시킨다, 학습(**training**)시킨다라고 표현합니다. 모델을 적합(**fit**)시키는 데에 사용하는 데이터를 **학습용 데이터**(training data)라고 부릅니다.\n\n어떻게 모델이 적합해지는지에 대한 세세한 정보들(예: 데이터를 분할하는 방법 등)은 복잡하여서 지금 다루지는 않을 것입니다. 또 여러분은 모델을 적합시킨 후에 새 데이터(학습된 데이터가 아닌 새로운 데이터들)에 적용하여 추가적인 주택들의 가격을 **예측**(predict)할 수 있게 됩니다.\n\n---\n# 의사결정 나무 개선하기(Improving the Decision Tree)\n\n다음 두 가지 의사결정 나무 중 부동산 투기 학습용 데이터에 잘 적합될 가능성이 높은 것은 무엇이라고 생각하시나요?\n\n![First Decision Trees](http://i.imgur.com/prAjgku.png)\n\n아마 왼쪽을 고르셨을 겁니다. 왼쪽의 의사결정 나무(1st Decision Tree)는 침실이 많은 집이 침실이 적은 집보다 더 높은 가격에 팔리는 경향이 있다는 현실을 잘 담고 있기 때문이겠죠. 하지만 이 모델의 가장 큰 단점은 주택의 가격이 침실의 개수만으로 결정되지 않는 다는 것일 겁니다. 욕실의 수, 부지의 크기, 주택의 위치 등 집값에 영향을 미치는 대부분의 요소를 포착하지 못했기 때문에 아직 좋은 모델이라고 할 수 없을 것입니다.\n\n더 많은 \"분할(splits)\"이 있는 나무를 이용하여 더 많은 요인을 고려할 수 있을 것입니다. 더 많은 분할을 가질수록 우리는 \"더 깊은(deeper)\" 나무 라고 부릅니다. 각 주택의 총 부지 크기 또한 고려하는 의사결정 나무는 다음과 같은 모습을 가질 수 있습니다.:\n![Depth 2 Tree](http://i.imgur.com/R3ywQsR.png)\n\n의사결정 나무를 계속 따라가며 어떤 집의 가격이든 예측을하고 항상 해당 집의 특성에 맞는 경로를 선택하게 될 것입니다. 그 집의 예상 가격은 의사결정 나무의 가장 아래에 위치하게 될 것입니다. 우리가 최종적으로 예측하게 되는 의사결정 나무의 가장 아래의 부분(현재의 문제에서는 가격)을 **잎**(leaf)이라고 부릅니다.\n\n잎의 분할과 값은 데이터에 따라서 결정됩니다. 그러니 이제는 여러분이 작업할 데이터에 대해 확인해야겠죠?\n\n# 계속해서(Continue)\n좀 더 구체적으로 말해보면.... 이제 **[데이터 검토](https://www.kaggle.com/dansbecker/basic-data-exploration)**를 할 차례입니다.\n","metadata":{}},{"cell_type":"markdown","source":"---\n\n\n\n\n*Have questions or comments? Visit the [course discussion forum](https://www.kaggle.com/learn/intro-to-machine-learning/discussion) to chat with other learners.*\n\n질문이나 나누고픈 말들이 있다면 위 course discussion forum에 방문해서 다른 사람들과 이야기해보세요!","metadata":{}}]}