{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"markdown","source":"# 데이터에 대해 잘 알기 위해 Pandas 라이브러리를 사용하기(Using Pandas to Get Familiar With Your Data)\n\n모든 기계학습(machine learning) 프로젝트의 첫 시작은 데이터와 친해지는 것입니다. 여러분은 데이터와 친해지기 위해서 Pandas 라이브러리를 사용하게 될 것입니다. Pandas는 데이터 사이언티스트들이 데이터를 탐색하고 다루기위해서 사용하는 주요 데이터 도구(tool) 입니다. 추가적으로 Pandas는 우리가 작성할 코드에서 `Pd`라고 줄여서 부르는 경우가 많습니다. ","metadata":{}},{"cell_type":"code","source":"import pandas as pd","metadata":{"execution":{"iopub.status.busy":"2022-08-10T13:07:03.826507Z","iopub.execute_input":"2022-08-10T13:07:03.827863Z","iopub.status.idle":"2022-08-10T13:07:03.856996Z","shell.execute_reply.started":"2022-08-10T13:07:03.827627Z","shell.execute_reply":"2022-08-10T13:07:03.855954Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"판다스(Pandas) 라이브러리에서 가장 중요한 부분은 데이터 프레임(DataFrame)입니다. 데이터 프레임은 표과 비슷한 데이터 유형이 들어있습니다. 이 데이터 프레임은 Excel의 시트 또는 SQL 데이터베이스의 표와 유사합니다.\n\n판다스는 이러한 유형의 데이터로 원하는 대부분의 작업을 할 수 있는 라이브러리입니다.\n\n예를 들어, 호주 멜버른에서의 [집값에 대한 데이터](https://www.kaggle.com/dansbecker/melbourne-housing-snapshot)를 살펴보겠습니다. 실습에서는 아이오와 주의 집값이 있는 새 데이터 세트에 동일한 과정을 적용할 것입니다.\n\n예제(멜버른) 데이터의 파일 경로는 다음과 같습니다. **`../input/melbourne-housing-snapshot/melb_data.csv`**.\n\n아래의 명령을 실행해서 데이터를 로드하고 탐색하겠습니다.","metadata":{}},{"cell_type":"code","source":"# save filepath to variable for easier access 더 쉬운 접근을 위한 파일경로 변수 저장\nmelbourne_file_path = '../input/melbourne-housing-snapshot/melb_data.csv'\n# read the data and store data in DataFrame titled melbourne_data\n# melbourne_data로 이름 붙여진 DataFrame에서 데이터를 읽고 저장\nmelbourne_data = pd.read_csv(melbourne_file_path) \n# print a summary of the data in Melbourne data  melbourne_data 데이터의 요약 출력\nmelbourne_data.describe()","metadata":{"execution":{"iopub.status.busy":"2022-08-10T13:07:03.858686Z","iopub.execute_input":"2022-08-10T13:07:03.859261Z","iopub.status.idle":"2022-08-10T13:07:04.026269Z","shell.execute_reply.started":"2022-08-10T13:07:03.859227Z","shell.execute_reply":"2022-08-10T13:07:04.024994Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# 데이터 분석 해석(Interpreting Data Description)\n\n결과는 원래 데이터 집합의 각 열에 대해 8개의 값을 보여줍니다. 첫 번째 값 **개수(count)**는 결측값(Missing value)이 없는 행의 수를 나타냅니다.\n\n결측값은 여러 가지 이유로 발생합니다. 이에 관해서는 다음에 살펴 보겠습니다.\n\n두 번째 값은 **평균(mean)**은 평균값을 의미합니다. 그 아래의 **표준편차(std, standard deviation)**는 값이 얼마나 퍼져있는 지를 숫자로 나타내고 있습니다.\n\n**최소값(min), 제 1 사분위수(25%), 제 2 사분위수(50%), 제 3 사분위수(75%), 최대값(max)**값을 해석하려면 각 열을 가장 낮은 값에서 가장 높은 값으로 정렬하는 것을 생각해 보아야합니다. 첫 번째로 올 가장 작은 값이 바로 최소값에 해당됩니다. 이 수의 나열에서 1/4 지점을 살펴보면 값들의 25%보다 크고 75%보다 작은 숫자를 찾을 수 있을 것입니다. 이 값이 바로 제 1 사분위수(25%)이고 제 2 사분위수와 제 3 사분위수도 유사하게 정의됩니다. 최대값은 가장 큰 숫자이고요.\n\n# 당신의 차례입니다! (Your Turn)\n**[첫 번째 코딩 실습](https://www.kaggle.com/kernels/fork/1258954)**을 시작해보세요!","metadata":{}},{"cell_type":"markdown","source":"---\n\n\n\n\n*Have questions or comments? Visit the [course discussion forum](https://www.kaggle.com/learn/intro-to-machine-learning/discussion) to chat with other learners.*\n\n질문이나 하고 싶은 말이 있다면? course discussion forum에 방문해서 다른 사람들과 이야기해보세요!","metadata":{}}]}