{"cells":[{"metadata":{},"cell_type":"markdown","source":"# <a id='0'>Daftar Isi</a>\n   - <a href='#01'>Abstrak</a> \n   - <a href='#02'>Kata Pengantar</a>   \n   \n- <a href='#1'>Bab I Pendahuluan</a> \n    - <a href='#11'>Latar Belakang</a>\n    - <a href='#12'>Rumusan Masalah</a>\n    - <a href='#13'>Batasan masalah</a>\n    - <a href='#14'>Tujuan Penelitian</a>\n    - <a href='#15'>Manfaat Penelitian</a> \n- <a href='#2'> Bab II Landasan Teori </a> \n    - <a href='#21'>Peneliti Terdahulu</a> \n    - <a href='#22'>Statistik Deskriptif</a>  \n    - <a href='#23'>Machine Learning</a> \n- <a href='#3'>Bab III Metode Penelitian</a>  \n    - <a href='#31'>Jenis Penelitian</a>  \n    - <a href='#32'>Metode Pengumpulan Data</a>\n    - <a href='#33'>Lokasi Pengumpulan Data</a>\n    - <a href='#34'>Objek Penelitian</a>\n    - <a href='#35'>Flow Chart</a>\n- <a href='#4'>Bab IV Hasil dan Diskusi</a>\n    - <a href='#41'>Import Data</a>\n    - <a href='#42'>Visualisasi Data</a>\n    - <a href='#43'>Analisis Korelasi</a>\n    - <a href='#44'>Proses Klasifikasi K-means</a>\n    - <a href='#45'>Perbandingan Model</a>\n    - <a href='#46'>Hasil Klastering</a>\n    - <a href='#47'>Visualisasi Hasil Klastering</a>\n- <a href='#5'>Bab V Kesimpulan dan Saran</a>  \n- <a href='#6'>Daftar Pustaka</a>\n\n\n"},{"metadata":{},"cell_type":"markdown","source":" # <a id='01'>Abstrak</a> \n \nDiera global seperti sekarang ini, setiap pelaku bisnis disektor apapun harus mampu mengedepankan kebutuhan pasar dengan baik. Oleh sebab itu, mereka harus mampu melakukan analisis terhadap data yang dikumpulkan dari internal maupun external untuk dapat memberikan solusi terbaik pada setiap permasalahan yang ditemukan. Lebih daripada itu, mereka juga harus mampu melakukan peramalan berdasarkan data, dengan mensimulasikan semua kemungkinan yang ada tanpa harus menunggu ketidakpastian terjadi. Setidaknya mereka dapat meramalkan persentasi kemungkinan yang akan terjadi untuk dapat mengoptimalkan keuntungan dan sekaligus meminimalkan resiko. \n\nDalam penelitian ini, penulis akan melakukan penerapan salah satu aplikasi yang paling populer dalam konsep Mechine Learning yakni analisis segmentasi pengunjung suatu Mall dengan metode klasifikasi K-means. Kita semua tahu, untuk melakukan analisa dan menemukan segmentasi pelanggan terbaik diperlukan metodologi terbaik. Sehingga penelitian ini, melakukan analisis deskriptif terhadap data pengunjung suatu Mall dan kemudian mengimplementasikan beberapa model algoritma K-means. Setelah menemukan klasifikasi terbaik, maka direkomendasikan kepada para pelaku bisnis dalam Mall tersebut agar mereka meninjau ulang pruduk-pruduk yang seharusnya mereka sediakan untuk mengoptimalkan keuntungan dan meminimalkan resikonya. Tentu saja penelitian ini juga masih bisa dikembangkan lagi dengan menambahkan varibel-variabel lain yang saling mempengaruhi. Dapat juga dijadikan sebagai referensi untuk penelitian pada dataset yang berbeda dengan tujuan melakukan klasifikasi (klustering).\n\n**Kata kunci:** Analisis Segmentasi, Statistik Deskriptif, Klasifikasi, Machine Learning, dan K-Mean Klastering.\n\n\n # <a id='02'>Kata Pengantar</a> \n \nDengan memanjatkan segala puji syukur kehadirat Tuhan yang Maha Esa yang telah melimpahkan berkat dan rahmat-Nya, karena penulis dapat menyelesaikan tugas ini dengan judul **“Analisis Segmetasi Pengunjung suatu Mall dengan Meggunakan Metode Klasifikasi K-means”**, sebagai salah satu referensi bagi anda yang sedang melakukan ataupun yang sedang belajar meneliti. Penulis menyadari bahwa tulisan ini tidak mungkin terselesaikan tanpa adanya inspirasi yang mendorong saya untuk melakukannya. Olekarena itu, pada kesempatan ini penulis menyampaikan terima kasih setulus-tulusnya kepada:\n\n* Mahasiswa-i saya di Matana University (Khususnya-SBM17)\n* Semua pihak yang tidak dapat disebutkan satu per satu, yang telah dengan tulus ikhlas memberikan doa dan motivasi sehingga dapat terselesaikannya tulisan ini.\n\nSudah menjadi barang tentu, tulisian ini tidak mungkin luput dari kekurangan dan kesalahan, karena itu segala kritik dan saran yang membangun akan menyempurnakan penulisan penelitian ini, serta bermanfaat bagi penulis dan para pembaca (silahkan di kolom komentar).\n\n\nTangerang, 13 April 2020\n\nPenulis,\n\n\n\nBakti Siregar, S.Si, M.Sc\n\nsiregarbakti@gmail.com"},{"metadata":{},"cell_type":"markdown","source":"# <a id='1'>Bab I Pendahuluan</a> \n\n## <a id='11'>Latar Belakang</a>\n\nSegmentasi Pelanggan adalah salah satu aplikasi paling penting dalam dunia bisnis, secara khusus untuk analisis Mareketing. Dengan menggunakan teknik pengelompokan (clustering), perusahaan dapat mengidentifikasi beberapa segmen pelanggan yang memungkinkan mereka untuk menargetkan basis pengguna (konsumen) potensial. Dalam penlitian ini, akan digunakan pengelompokan K-means yang merupakan algoritma penting untuk pengelompokan dataset yang tidak berlabel (unsuperpised). Sebelum terlalu jauh dalam projek ini, sebenarnya apa itu segmentasi pelanggan?. Sebagai islustrasi, maka diperlihatkan gabar berikut;\n\nMenurut definisinya segmentasi pelanggan adalah proses pembagian basis pelanggan menjadi beberapa kelompok individu yang memiliki kesamaan dalam berbagai cara relevan dengan pemasaran seperti jenis kelamin, usia, minat, dan kebiasaan pengeluaran lain-lain. Perusahaan biasanya menggunakan segmentasi pelanggan berada di bawah anggapan bahwa setiap pelanggan memiliki persyaratan yang berbeda dan memerlukan upaya pemasaran khusus untuk mengatasinya dengan tepat. Perusahaan bertujuan untuk mendapatkan pendekatan lebih dalam terhadap pelanggan yang menjadi target. Oleh karena itu, perusahaan mempunyai kepentingan untuk mengetahui lebih spesifik dan harus merancang menyiapkan pruduk-produk baru (lebih tepat) untuk memenuhi kebutuhan setiap pelanggan. Selain itu, melalui data perusahaan dapat memperoleh pemahaman yang lebih dalam tentang preferensi pelanggan serta persyaratan untuk menemukan segmen berharga dan akan mendapat untung untung maksimal. Dengan cara ini, perusahaan dapat menyusun strategi teknik pemasaran mereka dengan lebih efisien dan meminimalkan kemungkinan risiko terhadap investasi.\n\nKotler, dalam Precylia Cyndi Kembuan (2012), menyatakan segmentasi memiliki peran penting karena beberapa alasan yaitu pertama, segmentasi memungkinkan perusahaan untuk lebih fokus dalam mengalokasikan sumber daya. Dengan membagi pasar menjadi segmen-segmen akan memberikan gambaran bagi perusahaan untuk menetapkan segmen mana yang akan dilayani. Segmentasi memungkinkan perusahaan mendapatkan gambaran yang lebih jelas mengenai peta kompetisi serta menentukan posisi pasar perusahaan. Segmentasi merupakan dasar untuk menentukan komponen-komponen strategi. Segmentasi yang disertai dengan pemilihan target pasar.Segmentasi juga merupakan faktor kunci untuk mengalahkan pesaing, dengan memandang pasar dari sudut yang unik dan cara berbeda dari yang dilakukan pesaing. \n\nSanusi, Anuar, 2015. Dalam penelitiannya  menunjukkan bahwa secara berurutan variabel yang paling tinggi tingkat efektifitasnya membentuk positioning adalah variable proses, variable pelayanan, variable tempat, variable harga, variable promosi. Sejalan dengan keputusan dalam model pembelian. Teknik segmentasi pelanggan tergantung pada beberapa pembeda utama adalah membagi pelanggan menjadi kelompok-kelompok yang akan ditargetkan. Data tentunya saling terkait dengan demografi, geografi, status ekonomi serta pola perilaku memainkan peran penting dalam menentukan arah perusahaan menuju penanganan berbagai segmen. Sehingga, berdasarkan latar belakang dan permasalahan yang disebutkan diatas maka penulis menentukan judul untuk projek ini adalah \"Analisis Segmentasi Pelanggan Suatu Perusahaan dengan Metode K-means Klustering\".\n\n\n## <a id='12'>Rumusan Masalah</a>\n\nAdapun yang menjadi permasalahan dalam penelitian ini adalah bagaimana untuk menemukan menemukan konsumen yang lebih potensial untuk dilakukan pendampingan yang lebih tepat untuk meningkatkan keuntungan yang akan diperoleh pelaku bisnis dalam Mall. Masalah lainya adalah bagaimana utuk menemukan model yang tepat untuk menentuk pembagian segementasi konsumen berdasarkan data yang Ada.\n\n\n## <a id='13'>Batasan masalah</a> \n\nAda banyak sekali metode yang dapat digunakan untuk mengklasifikasikan segmentasi pelanggan ini, sehingga pada projek ini peneliti hanya menggunkan metode K-means Clustering untuk pemodelannya. Keterbatasan lainnya juga adalah mengenai data yang tersedia, untuk analisis lebih rinci sangat diperlukan variabel-variabel lainnya yang mendukung.\n\n\n## <a id='14'>Tujuan Penelitian</a> \n\nSesuai dengan rumusan dan batasan masalah di atas, maka tujuan penelitian ini adalah:\n* Untuk melakukan analisis statistik deskriftif terhadap data pengunjung.\n* Menemukan karakteristik pengunjung berdasarkan penghasilan, usia dan pengularan (biaya belanja yang biasa dilakukan) oleh pengunjung.\n* Untuk menemukan berapa banyak klasifikasi segmentasi yang tepat berdasarkan data pengunjung Mall tersebut.\n\n## <a id='15'>Manfaat Penelitian</a> \n\nMelalui tulisan ini dapat diambil beberapa manfaat antara lain:\n\n* Bagi Peneliti: berguna untuk menjelaskan teori-teori statistika yang dapat diterapkan dalam penelitian dan dalam kehidupan sehari-hari. Sebagai contoh; Penerapan analisis Statistik Deskriptif dan Metode K-Means Klastering (Machine Learning) dalam menentukan Segementasi Pelanggan.\n* Bagi Pelaku Bisinis: rekomendasi untuk memahami segmentasi pelanggan mereka, sehingga dapat menentukan target pasar dan produk-produk yang seharusnya mereka sediakan. \n\n\n# <a id='2'>Bab II Landasan Teori</a> \n\nSebagai acuan mendasar dalam penelitian ini, berikut dilampirkan beberapa landasan teori yang dapat dijadikan rujukan: \n\n## <a id='21'>Peneliti Terdahulu</a>\n\nDalam jurnal Gunawan Adi Chandra Makens (2016) menyatakan bahwa **Segmentasi Demografis** adalah segmentasi yang membagi pasar menjadi berbagai kelompok berdasarkan variabel seperti usia, jenis kelamin,siklus hidup keluarga, pendapatan, pekerjaan, pendidikan, agama, ras dan kebangsaan. Faktor-faktor Demografis paling sering dipakai sebagai dasar untuk mensegmentasi kelompok konsumen.Salah satu alasannya adalah kebutuhan, keinginan dan tingkat penggunaan konsumen berhubungan erat dengan variabel demografis. Alasan yang lainnya adalah bahwa variabel demografis lebih mudah diukur jika dibandingkan dengan jenis variabel lainnya. \n\nHal serupa juga dinyakan oleh Philip Kotler (2007, h.236) **Segmentasi Demografis** dapat dapat dibagi menjadi kelompok-kelompok berdasarkan variabel seperti usia, ukuran keluarga, siklus hidup keluarga, jenis kelamin, penghasilan, pekerjaan, pendidikan, agama, ras, genersi kebangsaan dan kelas sosial. Berikut bagian variabel Demografis tertentu yang digunakan untuk mensegmentasi pasar: \n\n*  Usia dan tahap siklus hidup, produk keinginan dan kemampuan konsumen berubah sesuai dengan usia. \n*  Tahap kehidupan, orang yang berbeda di bagian siklus hidup hidup  yang sama mungkin mempunyai hidup yang berbeda. \n* Jenis kelamin, pria dan wanita mempunyai sikap dan prilaku yang berbeda, sebagian berdasarkan susunan genetik dan sebagian karena sosialisasi. \n*  Pendapatan, segmentaasi pendapatan merupakan praktik lama dalam kategori seperti otomotif, pakaian, kosmetik, layanan keuangan, dan perjalanan. Meskipun demikian, pendapatan tidak selalu memprediksikan pelanggan terbaik untuk produk tertentu. \n* Generasi, setiap generasi sangan di pengaruhi oleh saat saat pertumbuhan mereka musk, filem, politik, dan mendefinisikan kejadian pada priode tersebut. \n* Kelas sosial, kelas sosial berpengaruh kuat terhadap preferensi mobil, pakean, perlengkapan rumah, kegiatan bersenang-senang, kebiasaan membaca dan pengecer serta banyak perusahaan merancang produk dan jasa untuk kelas sosial tertentu.\n\nAda banyak segemen yang harus dipertimbangkan untuk melakukan analisis kebutuhuan pelanggan, tetapi dalam penelitian ini hanya dibatasi dengen Variabel Jenis Kelamin, usia, Penghasilan, dan Pengeluaran (biaya belanja yang biasa dilakukan. Beberapa segmen lain tersebut adalah: \n\n* Segmentasi Pasar Geografis: Sofjan Assauri (2015, h.155) menyatakan bahwa segmentasi pasar konsumen berdasarkan Segmentasi Geografis, Segmentasi pasar ini dilakukan dengan mengelompokkan konsumen menjadi bagian pasar menurut skala wilayah atau letak geografis.\n* Segmentasi Psikografis: Dalam jurnal Gunawan AdiChandra, Makens (2016) Kotler, menyatakan bahwa Segmentasi Psikografis (psychographic segmentation) Segmentasi ini membagi konsumen menjadi kelompok yang berbeda-beda berdasarkan karakteristik gaya hidup dan kepribadian konsumen.\n* Segmentasi Tingkah Laku: Kotler (2012, h214), menyatakan bahwa  Segmentasi prilaku adalah membagi pasar menjadi beberapa kelompok berdasarkan pengetahuan, sikap, penggunaan, atau respon konsumen terhadap sebuah produk. Banyak pemasar yang meyakini variabel perilaku terbaik sebagai nilai awal untuk membangun segmentasi pasar adalah Manfaat, Status Pengguna, Tingkat Pemakaian, Tahap kesiapan pembeli, Sikap, Setatus Kesetiaan. \n\n## <a id='22'>Statistik Deskriptif</a>\n\nKata statistik berasal dari bahasa Latin, yaitu status yang artinya negara atau menyatakan hal-hal yang berhubungan dengan ketatanegaraan. Pengertian statistik ini kemudian terus berkembang siiring perkembangan zaman, secara garis besar dapat dinyatakan sebagai berikut:  \n\n* Statistik adalah sekumpulan angka yang dapat menjelaskan sesuatu, baik angka acak maupun yang sudah tersusun dalam suatu tabel \n* Statistik adalah cara dan aturan tentang bagaimana mengumpulkan, mengolah, menganalisis, serta menafsirankan data menjadi lebih bermakna.\n* Statistik adalah sekumpulan angka yang menjelaskan sifat-sifat dari data atau hasil pengamatan/penelitian. \n\nDengan kata lain, statistik adalah ilmu yang mempelajari tentang karakteristik data yaitu dengan pengumpulan, pengolahan, penafsiran dan penarikan kesimpulan dari data yang berbentuk angka-angka yang dapat juga diperlihatkan dengan visualisasi tabel, gambar, dan grafik. \n\nHasan (2001:7) menjelaskan : Statistik deskriptif atau statistik deduktif adalah bagian dari statistik mempelajari cara pengumpulan data dan penyajian data sehingga muda dipahami. Statistik deskriptif hanya berhubungan dengan hal menguraikan atau memberikan keterangan-keterangan mengenai suatu data atau keadaan atau fenomena. Dengan kata statistik deskriptif berfungsi menerangkan keadaan, gejala, atau persoalan. Penarikan kesimpulan pada statistik deskriptif (jika ada) hanya ditujukan pada kumpulan data yang ada. Didasarkan pada ruang lingkup bahasannya statistik deskriptif mencakup : \n\n* Distribusi frekuensi beserta bagianbagiannya seperti :\n- Grafik distribusi (histogram, poligon frekuensi, dan ogif); \n- Ukuran nilai pusat (rata-rata, median, modus, kuartil dan sebagainya);  \n- Ukuran dispersi (jangkauan, simpangan rata-rata, variasi, simpangan baku, dan sebagianya); \n- Kemencengan dan keruncingan kurva \n* Angka indeks. \n* Times series/deret waktu atau berkala.\n* Korelasi dan regresi sederhana. \n\nSuryoatmono (2007:18) menyatakan: Statistika Deskriptif adalah statistika yang menggunakan data pada suatu kelompok untuk menjelaskan atau menarik kesimpulan mengenai kelompok itu saja \n\n* Ukuran Lokasi: mode, mean, median, dll \n* Ukuran Variabilitas: varians, deviasi standar, range, dll \n* Ukuran Bentuk: skewness, kurtosis, dan Boxplot.\n\n\n## <a id='23'>Machine Learning</a>\n\nSalah satu metode yang paling popular dalam Machine Learning adalah Algoritma K-means, berikut akan dilakukan review mengenai teori dan konsepnya. \n\n### K-means Algorithm \n\nK-means clustering adalah metode clustering non-hierarkis untuk mengklasifikasikan data dalam satu bentuk atau lebih cluster. Dalam hal ini, data memiliki karakteristik yang sama diklasifikasikan dalam satu cluster, dan data memiliki karakteristik yang berbeda diklasifikasikan dengan cluster lain. Karena itu, jika data terdaftar dalam satu cluster berarti memiliki tingkat varians yang kecil. Metode Klastering K-means mendeklarasikan nilai awal cluster, di mana pusat cluster adalah yang pertama dipilih secara acak, kemudian menghitung jarak setiap cluster ke pusat data menggunakan rumus Euclidean dalam. Menurut jurnal Nanda, Dkk (2010), rumus untuk  Metode Klastering K-means adalah:\n\n$$ D_{ij} = \\sqrt{(X_{1i}-X_{1j})^2 + (X_{2i}-X_{2j})^2 + \\cdots + (X_{ki}-X_{kj})^2}$$\n\ndimana,\n* $D_{ij}:$ jarak data dari $i$ ke pusat cluster $j.$\n* $X_{ki}:$ data $i$ pada data atribut $k.$\n* $X_{kj}:$ titik pusat ke $j$ di atribut ke $k.$\n\nPerhitungan pusat cluster dilakukan berulang-ulang dengan dataset yang sama untuk setiap kemungkinan cluster, di mana pusat cluster adalah rata-rata dari semua data. Selanjutnya, lakukan perhitungan jarak dengan pusat data yang telah diperbarui, jika tidak ada perubahan berarti tekniknya sudah selesai. \n\nAda beberapa prosedur yang harus dipenuhi untuk menggunakan algoritma k-means clustering yakni:\n\n* Menentukan sembarang jumlah cluster yang akan digunakan dalam algoritma.\n* Algoritma memilih kluster secara acak berdasarkan variabel yang ada dari dataset. $k$ ini adalah kluster atau mean awal.\n* Centroid terdekat mendapatkan tugas pengamatan baru. kemudian melakukan training baru pada Jarak Euclidean antara objek dan pusat massa.\n* Cluster $k$ dalam titik data akan memperbarui centroid melalui perhitungan nilai rata-rata baru yang ada di semua titik data cluster. Centroid cluster $k$ memiliki panjang $p$ yang berisi rata-rata semua variabel untuk pengamatan di cluster $k^{ij}$. kemudian menunjukkan jumlah variabel dengan $p$.\n* Minimalisasi berulang terhadap total dalam jumlah kuadrat. Kemudian melalui minimalisasi berulang dari jumlah total kuadrat, proses akan dihentikan ketika kita mencapai iterasi maksimum. Nilai default adalah 10 yang biasa digunakan dalam perangkat lunak R untuk iterasi maksimum.\n\n\n### Menentukan Cluster Optimal\n\nSaat ingin menentukan jumlah cluster untuk diterapkan pada Algortima K-Means, perlu untuk menentukan jumlah cluster yang akan digunakan. Sebaiknya menggunakan jumlah cluster yang optimal. Ada tiga metode sangat populer dalam menentukan cluster optimal, Yakni: \n\n**Metode siku (Elbow method)** \n\nTujuan utama di balik metode partisi cluster seperti k-means adalah untuk mendefinisikan cluster sehingga metode Elbow menggunakan variasi intra-cluster tetap minimum. \n\n$$minimize \\bigr(sum \\space W(C_k)\\bigl), \\space k=1 \\cdots k$$\n\ndimana $C_k$ mewakili cluster $k$ dan $W(C_k)$ menunjukkan variasi intra-cluster. Dengan pengukuran total variasi intra-kluster, dapat dievaluasi kekompakan batas pengelompokan. \n\n**Metode siluet (Silhouette method)** \n\nDengan bantuan metode siluet rata-rata, dapat diukur kualitas operasi pengelompokan yang dilakukan. Dengan metode ini, dapat ditentukan seberapa baik cluster pada setiap variabel dalam dataset. Jika diperoleh luas rata-rata siluet yang tinggi, itu berarti kita memiliki pengelompokan yang baik. Metode siluet rata-rata dilakukan dengan menghitung rata-rata pengamatan siluet untuk setiap nilai $k$ yang berbeda. Dengan jumlah optimal $k$ cluster, dapat dimaksimalkan siluet rata-rata di atas nilai signifikan untuk $k$ cluster.\n\n**Statistik kesenjangan (Gap statistic)**  \n\nPada tahun 2001, para peneliti di Universitas Stanford-R. Tibshirani, G.Walther dan T. Hastie menerbitkan Metode Statistik Gap. Metode ini dapat digunakan menjadi salah satu metode pengelompokan seperti K-means, pengelompokan hierarkis, dll. Dengan menggunakan statistik gap, dapat dibandingkan variasi total intracluster untuk nilai $k$ yang berbeda bersama dengan nilai yang diharapkan bahkan dibawah distribusi nol dari data. Dengan bantuan simulasi Monte Carlo, seseorang dapat menghasilkan dataset sampel. Untuk setiap variabel dalam dataset, dapat menghitung rentang antara min $(x_i)$ dan maks $(x_j)$ yang dapat menghasilkan nilai secara seragam dari interval batas bawah ke batas atas."},{"metadata":{},"cell_type":"markdown","source":"# <a id='3'>Bab III Metodologi Penelitian</a> \n\n## <a id='31'>Jenis Penelitian</a>\n\nJenis penelitian yang digunakan adalah penelitian kuantitatif dimana data yang dinyatakan dalam angka dan dianalisis dengan teknik statistik. Metode yang digunakan adalah metode asosiatif yaitu bentuk penelitian dengan menggunakan minimal dua variabel yang dihubungkan. Sejatinya, Metode asosiatif merupakan suatu penelitian yang mencari hubungan sebab akibat antara satu variabel independen (variabel bebas) yaitu Gender $(X_1)$, Usia $(X_2)$, Pendapatan_Tahunan_Ribuan_USD $(X_3)$, dan Pengeluaran_USD $(X_4)$ dengan variabel dependen (variabel terikat) yaitu keputusan pembelian $(Y)$. Namun karena keterbatasan data, maka dibahagian awal penelitian melakukan analisis statistik deskriftif untuk melihat sebaran data, frekuensi, densitas, dan korelasi antar-variabel. Kemudian menerapkan metode klasifikasi K-mean (Unsupervised Machine Learning) untuk melihat segementasi pegunjung dalam Mall tersebut.  \n\n## <a id='32'>Metode Pengumpulan Data</a>\n\nPenelitian ini menggunakan data sekunder yang merupakan tipikal penelitian kuantitatif, dataset yang digunakan sudah tersedia di Kaggle.com. Dataset yang digunakan sudah dikumpulkan oleh pihak ke-3 yang memiliki otoritas terpercaya tetapi tidak disebutkan dalam hal ini untuk alasan privasi. Penulis memilih cara ini untuk mempercepat penulisan contoh penelitian, karena tidak dibutuhkan waktu yang lama mengakses dataset, dan juga tidak perlu menyebar kuesioner ke lapangan. \n\n## <a id='33'>Lokasi Pengumpulan Data</a>\n\nDalam hal ini, lokasi pengumpulan data adalah melalui akses internet dan lokasi bisa dimana saja tergantung penulis mengakses datanya darimana. Jika pengumpulan data melakukan survey atau wawan cara dengan cara menyebar kuesioner atau angket sebagai instrumen penelitian, maka uraikan lokasi pengumpulan datanya dimana?, melalui apa?, dan observasinya siapa?.  \n\n## <a id='34'>Objek Penelitian</a>\n\nAdapun yang menjadi objek dalam penelitian kuantitatif ini dibagi berdasarkan metode atau jenis penelitian, termasuk yang berikut ini:\n\n* Objek Penelitian Deskriptif: melakukan analisis deskriptif terhadap data pengunjung Mall. \n* Objek Penelitian Korelasi: dilakukan juga analisis korelasi untuk melihat keterkaitan antar variabel. \n* Objek Penelitian Komparatif: melakukan perbandigan jenis kelamin, usia, Penghasilan dan pengeluaran. Serta melakukan perbandaingan beberapa metode dalam menentukan kluster yang optimal untuk diterapkan dalam Klasifikasi K-means.\n\n\n## <a id='35'>Flow Chart</a>\n\nLebih detail tentang metodologi penelitian ini ditunjukkan pada Gambar. 1\n\n<img src=\"https://github.com/Bakti-Siregar/images/blob/master/kaggle/Flowchart-Penelitian.jpg?raw=true\"></img>"},{"metadata":{},"cell_type":"markdown","source":"# <a id='4'>Bab IV Hasil dan Diskusi</a> \n\n## <a id='41'> Import Data</a> \n\nPada langkah pertama dari projek ini, akan dilakukan eksplorasi data. Mungkin saja anda akan mengimpor beberapa packages yang diperlukan dan kemudian membaca data. Berikut ini dilakukan import data, melihat struktur data, dan mengulas sepintas mengenai ringkasan data statistiknya. Hal ini dilakukan untuk mendapatkan pengetahuan dasar mengenai data dan mungkin diperlukan dalam menemukan atau menentukan assumsi awal."},{"metadata":{"trusted":true},"cell_type":"code","source":"data_pengunjung=read.csv(\"https://raw.githubusercontent.com/Bakti-Siregar/dataset/master/Pengunjung_Mall.csv\")\nnames(data_pengunjung)                            # nama-nama variabelnya\nhead(data_pengunjung)                             # print enam baris pertama dari dataset\nstr(data_pengunjung)                              # melihat struktur data\nsummary(data_pengunjung)                          # ringkasan statistik data pelanggan\nsd(data_pengunjung$Usia)                          # standar diviasi usia pengunjung\nsd(data_pengunjung$Pendapatan_Tahunan_Ribuan_USD) # standar diviasi pendapatan tahunan pengunjung ribuan USD\nsd(data_pengunjung$Pengeluaran_USD)              # standar diviasi kisaran uang belanja (1-100 USD)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Dari hasil yang diperlihatkan diatas, disimpulkan bahwa struktur data gender (jenis kelamin) adalah faktor (kualitatif) sehingga untuk menganalisa variabel ini lebih tepat dengan melihat frekuensi atau persentasi antar faktor (dalam hal ini pria dan wanita) yang akan diperlihatkan degan histogaram atau pie chart setelah bagian ini. Berdasarkan summary statistiknya, diperoleh bahwa pengunjung wanita lebih banyak dibanding pria. Mean (Rata-rata) usia, pendapatan, dan pengeluaran secara berturut-turut adalah 38.85, 60.56, dan 50.20. Olehkarena itu, ditarik kesimpulan bahwa usia, pendapatan, dan pengeluaran pengunjung sangat beragam karena rentan antara nilai min dan max cukup besar. Hal ini, juga diperkuat besarnya nilai standar diviasi untuk setiap variabel. Standar diviasi atau simpangan baku biasa digunakan untuk mengukur sebaran variansi data. Semakin besar nilai standar diviasinya makan semakin beragam (semakin luas variansi sebaran datanya)."},{"metadata":{},"cell_type":"markdown","source":"## <a id='42'> Visualisasi Data </a> \n\n### Jenis Kelamin Pelanggan\n\nSejalan dengan kesimpulan sebelumnya, visualisasi plot histogram dan pie chart dibawah ini juga memperlihatkan perbandingan jumlah pengunjung wanita lebih tinggi dibanding pria (Itu sudah hal yang lumrah, tetapi itu penting untuk dipertimbangkan dalam analisis).\n"},{"metadata":{"trusted":true},"cell_type":"code","source":"a=table(data_pengunjung$Gender)\nbarplot(a,main=\"Perbandingan Jumlah Pengunjung Berdasarkan Gender\",\n        ylab=\"Jumlah\",\n        xlab=\"Gender\",\n        col=rainbow(2))\n\npct=round(a/sum(a)*100)\nlbs=paste(c(\"Pria\",\"Wanita\"),\" \",pct,\"%\",sep=\" \")\nlibrary(plotrix)\npie3D(a,labels=lbs, main=\"Rasio Pengujung Pria dan Wanita\")","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"### Usia Pelanggan\n\nPada bagian ini digunakan plot histogram untuk melihat distribusi sebaran frekuensi usia pelanggan. Pertama-tama dilakukan analisis, mean (rata-rata), Median (Nilai Tengan), Modus (Data yang sering Muncul) untuk melihat kecondongan data. [](http://)"},{"metadata":{"trusted":true},"cell_type":"code","source":"mean(data_pengunjung$Usia)\nmedian(data_pengunjung$Usia)\n# Buat fungsi untuk mencari modus\nmodus <- function(v) { \n  uniqv <- unique(v)\n  uniqv[which.max(tabulate(match(v, uniqv)))]\n}\nmodus(data_pengunjung$Usia)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Menurut jurnal (Hippel,2005), jika mean berada di kanan median, dan median di kanan mode maka maka data berdistribusi Kemiringan condong ke kanan (Positively Skewed  Distribution). Artinya, Usia pengunjung di Mall tersebut lebih didominasi usia muda sekitar umur 32 meskipun rata-rata pengunjungnya berusia 38.85 tahun. Jadi, boleh direkomendasikan juga pruduk-pruduk yang dijual di Mall tersebut harus lebih memperhatikan kebutuhan pengunjung umur 32 tahun (perlu penelitian lanjut). Kemudian, dilanjutkan dengan histogaram dan Boxplot dibawah ini:"},{"metadata":{"trusted":true},"cell_type":"code","source":"library(ggplot2)\nlibrary(plotly)\nggplot(data_pengunjung, aes(x = Usia)) +\n    geom_histogram(aes(y = ..count..), \n        binwidth = 5, colour = \"#1F3552\", fill = \"#4271AE\") +\n    scale_x_continuous(name = \"Usia\", breaks = seq(20, 70, 5)) +\n    scale_y_continuous(name = \"Frekuensi\",breaks = seq(0, 40, 5)) +\n    ggtitle(\"Historgram Frekuensi Pengunjung Berdasarkan Usia\") +\n    geom_vline(xintercept = mean(data_pengunjung$Usia), size = 1, \n                colour = \"#FF3721\",linetype = \"dashed\")\n\nboxplot(data_pengunjung$Usia,col=\"#ff0066\",\n        main=\"Boxplot untuk Analisis Deskriptif Usia\")","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Dari dua visualisasi di atas, disimpulkan bahwa usia pelanggan maksimum adalah antara 30 dan 35. Usia minimum pelanggan adalah 18, sedangkan, usia maksimum adalah 70. \n\n### Pendapatan Tahunan Pelanggan\n\nPada bagian ini, dilakukan analisis pendapatan tahunan pelanggan dengan visualisasi distribusi densitasnya. Pertama-tama digunakan histogram dan kemudian melanjutkannya menggunakan plot densitas. "},{"metadata":{"trusted":true},"cell_type":"code","source":"ggplot(data_pengunjung, aes(x = Pendapatan_Tahunan_Ribuan_USD)) +\n    geom_histogram(aes(y = ..count..), \n                     binwidth = 5, colour = \"#1F3552\", fill = \"#4271AE\") +\n    scale_x_continuous(name = \"Penghasilan Tahunan\", breaks = seq(20, 140, 20)) +\n    scale_y_continuous(name = \"Frekuensi\",breaks = seq(0, 40, 5)) +\n    ggtitle(\"Histogram untuk Penghasilan Tahunan\") +\n    geom_vline(xintercept = mean(data_pengunjung$Pendapatan_Tahunan_Ribuan_USD), \n             size = 1, colour = \"#FF3721\",linetype = \"dashed\")\n\nlibrary(hrbrthemes)\nggplot(data_pengunjung, aes(x=Pendapatan_Tahunan_Ribuan_USD)) +\n      geom_density(fill=\"#69b3a2\", color=\"#e9ecef\", alpha=0.8) +\n      scale_x_continuous(name = \"Penghasilan Tahunan\", breaks = seq(20, 140, 20)) +\n      scale_y_continuous(name = \"Density\",breaks = seq(0,0.02, 0.005)) +\n      ggtitle(\"Distribusi Densitas Penghasilan Tahunan Pelanggan\") +\n      theme_ipsum()","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Dari analisis deskriptif berdasarkan kedua grafik diatas, disimpulkan bahwa pendapatan tahunan minimum pelanggan adalah 15 dan pendapatan maksimum adalah 137. Orang-orang yang mendapatkan penghasilan rata-rata 70 memiliki jumlah frekuensi tertinggi dalam distribusi histogram.\nGaji rata-rata semua pelanggan adalah 60,56. Melalui Plot Kepadatan (Densitas) terlihat bahwa pendapatan tahunan memiliki distribusi normal.\n\n\n### Pengeluaran (Biaya Belanja) Pengunjung Mall \n\n"},{"metadata":{"trusted":true},"cell_type":"code","source":"ggplot(data_pengunjung, aes(x = Pengeluaran_USD)) +\n    geom_histogram(aes(y = ..count..), binwidth = 5, \n                 colour = \"#1F3552\", fill = \"#4271AE\") +\n    scale_x_continuous(name = \"Biaya\", breaks = seq(20, 140, 20)) +\n    scale_y_continuous(name = \"Frekuensi\",breaks = seq(0, 40, 5)) +\n    ggtitle(\"Histogram Biaya Pengeluaran Pengunjung Mall\") +\n    geom_vline(xintercept = mean(data_pengunjung$Pengeluaran_USD), \n             size = 1, colour = \"#FF3721\",linetype = \"dashed\")\n\nboxplot(data_pengunjung$Pengeluaran_USD,\n        horizontal=TRUE,\n        col=\"#ff0066\",\n        main=\"Pengeluaran Pengunjung Mall\")","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Berdasarkan histogram dapat diindikasi bahwa biaya belanja tertinggi ada dikisaran 40 hinga 60. Analisis Deskriptif pada BoxPlot diatas disimpulkan bahwa perbelanjaan pengunjung Mall adalah Min adalah 1, Max adalah 99 dan rata-rata (mean) adalah 50,20. \n\n"},{"metadata":{},"cell_type":"markdown","source":"## <a id='43'> Analisis Korelasi </a> \n\nBerikut ini dilakukan analisis korelasi antar varibel (usia,penghasilan, dan pengeluaran) pengunjung Mall"},{"metadata":{"trusted":true},"cell_type":"code","source":"library(corrplot)                  # muat library untuk menggunakannya\ncorM<-cor(data_pengunjung[3:5])    # menghitung matriks korelasi\ncorM","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"\nBerdasarkan korelasi terindikasi bahwa atribut-atribut ini tidak memiliki korelasi yang baik di antara mereka, sehingga dapat disimpulkan setiap variabel memiliki variase yang berbeda-beda. Untuk membuktikan hal tersebut, maka dalam penelitian ini dilakukan pengelompokan data (Klasifikasi) Machine Learning dengan menggunakan Metode K-Means.  \n\n\n"},{"metadata":{},"cell_type":"markdown","source":"## <a id='44'> Proses Klasifikasi K-means </a> \n\nPenjelasan mengenai teori proses klasifikasi K-means ini sudah tinjau pada Bab II yaitu landasan teori mengenai Machine Learning. Pada bagian  ini akan diperlihatkan bagaimana penulis melakukan klasifikasi menggunakan K-means. Dimulai dari pencarian banyaknya kluster yang optimal dengan tiga metode sebagai berikut:\n\n\n### Metode siku (Elbow method)\n\n> Untuk dapat melanjutkan untuk menentukan cluster optimal dengan Metode siku adalah dengan menghitung algoritma pengelompokan untuk beberapa nilai $k$. Ini dapat dilakukan dengan membuat variasi dalam $k$ dari 1 hingga 10 cluster. kemudian menghitung jumlah total intra-cluster kuadrat dan lanjutkan ke plot berdasarkan jumlah cluster $k$. Plot ini akan  menunjukkan jumlah cluster yang diperlukan dalam model tersebut. Dari plot, terlihat bahwa lokasi tikungan atau siku adalah indikasi jumlah cluster yang optimal. Dengan menggunakan koding R diporelah hasil sebagai berikut:\n"},{"metadata":{"trusted":true},"cell_type":"code","source":"library(purrr)\nset.seed(123)\n# fungsi untuk menghitung jumlah total intra-cluster kuadrat (iss)\niss <- function(k) {\n  kmeans(data_pengunjung[,3:5],k,iter.max=100,nstart=100,algorithm=\"Lloyd\")$tot.withinss\n}\nk.values <- 1:10\niss_values <- map_dbl(k.values, iss)\nplot(k.values, iss_values,\n     type=\"b\", pch = 19, frame = FALSE, \n     xlab=\"Jumlah cluster K\",\n     ylab=\"Jumlah Total Intra-cluster Kuadrat\")","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Dari grafik di atas, disimpulkan bahwa 6 adalah jumlah cluster yang tepat karena tampaknya muncul di tikungan di plot siku. Mungkin tidak terlihat begitu jelas jika dilihat pada notebook ini, silahkan mencobanya di PC anda dengan R atau Rstudio. Berikutnya juga akan dilakukan pencarian jumlah kluster yang optimal dengan metode Metode siluet untuk menyakinkan hasilnya.\n\n### Metode siluet (Silhouette method)\n\nMetode yang kedua adalah dengan menggunakan fungsi siluet dalam paket cluster, dapat dihitung luas siluet rata-rata menggunakan fungsi k-means. Di sini, cluster optimal akan memiliki rata-rata tertinggi."},{"metadata":{"trusted":true},"cell_type":"code","source":"library(cluster) \nlibrary(gridExtra)\nlibrary(grid)\nk2<-kmeans(data_pengunjung[,3:5],2,iter.max=100,nstart=50,algorithm=\"Lloyd\")\ns2<-plot(silhouette(k2$cluster,dist(data_pengunjung[,3:5],\"euclidean\")))\n\nk3<-kmeans(data_pengunjung[,3:5],3,iter.max=100,nstart=50,algorithm=\"Lloyd\")\ns3<-plot(silhouette(k3$cluster,dist(data_pengunjung[,3:5],\"euclidean\")))\n\nk4<-kmeans(data_pengunjung[,3:5],4,iter.max=100,nstart=50,algorithm=\"Lloyd\")\ns4<-plot(silhouette(k4$cluster,dist(data_pengunjung[,3:5],\"euclidean\")))\n\nk5<-kmeans(data_pengunjung[,3:5],5,iter.max=100,nstart=50,algorithm=\"Lloyd\")\ns5<-plot(silhouette(k5$cluster,dist(data_pengunjung[,3:5],\"euclidean\")))\n\nk6<-kmeans(data_pengunjung[,3:5],6,iter.max=100,nstart=50,algorithm=\"Lloyd\")\ns6<-plot(silhouette(k6$cluster,dist(data_pengunjung[,3:5],\"euclidean\")))\n\nk7<-kmeans(data_pengunjung[,3:5],7,iter.max=100,nstart=50,algorithm=\"Lloyd\")\ns7<-plot(silhouette(k7$cluster,dist(data_pengunjung[,3:5],\"euclidean\")))\n\nk8<-kmeans(data_pengunjung[,3:5],8,iter.max=100,nstart=50,algorithm=\"Lloyd\")\ns8<-plot(silhouette(k8$cluster,dist(data_pengunjung[,3:5],\"euclidean\")))\n\nk9<-kmeans(data_pengunjung[,3:5],9,iter.max=100,nstart=50,algorithm=\"Lloyd\")\ns9<-plot(silhouette(k9$cluster,dist(data_pengunjung[,3:5],\"euclidean\")))\n\nk10<-kmeans(data_pengunjung[,3:5],10,iter.max=100,nstart=50,algorithm=\"Lloyd\")\ns10<-plot(silhouette(k10$cluster,dist(data_pengunjung[,3:5],\"euclidean\")))","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Dari semua grafik di atas, disimpulkan bahwa 6 adalah jumlah cluster yang tepat karena memiliki rata-rata tertinggi. Simulasi tersebut mencoba mulai dari 2 kluster hingga 10 kluster, hasil menunjukkan terjadi peningkatan rata-rata luas siluet hingga pada kluster ke-6 setelahnya dimulai dari kluster ke-7 hingga klaster 10 mengalami penurunan luas rata-rata siluetnya. \n\n\n### Statistik kesenjangan (Gap statistic)\n\nUntuk menghitung metode statistik gap,dapat menggunakan fungsi clusGap() untuk menyediakan statistik gap serta kesalahan standar untuk output yang diberikan."},{"metadata":{"trusted":true},"cell_type":"code","source":"library(cluster)\nlibrary(factoextra)\nlibrary(NbClust)\nlibrary(ggplot2)\nset.seed(125)\nstat_gap <- clusGap(data_pengunjung[,3:5], FUN = kmeans, nstart = 25, K.max = 10, B = 50)\nfviz_gap_stat(stat_gap)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Berdasarkan grafik diatas, juga disimpulkan bahwa $k = 6$ sebagai cluster yang paling optimal.\n\n\n## <a id='45'> Perbandingan Model </a> \n\nSaat ini sudah ada package dalam R yang dapat digunakan untuk mempersingkat ketiga metode diatas, hanya dengan menggunakan fungsi fviz_nbclust() untuk menentukan dan memvisualisasikan jumlah cluster optimal sebagai berikut:"},{"metadata":{"trusted":true},"cell_type":"code","source":"library(NbClust)\nrequire(ggplot2)\nlibrary(factoextra)\nfviz_nbclust(data_pengunjung[,3:5], kmeans, method = \"wss\")\nfviz_nbclust(data_pengunjung[,3:5], kmeans, method = \"silhouette\")\nfviz_nbclust(data_pengunjung[,3:5], kmeans, method = \"gap_stat\")\n","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"## <a id='46'> Hasil Klastering </a> \n\nBerdasarkan ketiga metode diatas, sekarang kita bisa menerapkan K-mean Klustering untuk melakukan klasifikasi terhadap data pengunjung Mall kedalam 6 klaster."},{"metadata":{"trusted":true},"cell_type":"code","source":"k6<-kmeans(data_pengunjung[,3:5],6,iter.max=100,nstart=50,algorithm=\"Lloyd\")\nk6","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Dari hasil yang diperlihatkan metode Kalsifikasi K-Means ini, dapat diamati beberapa daftar informasi utama sebagai berikut:\n\n* cluster - Ini adalah vektor beberapa bilangan bulat yang menunjukkan cluster yang memiliki alokasi setiap titik.\n* totss - Ini mewakili jumlah total kuadrat.\n* centers - Matriks yang terdiri dari beberapa pusat cluster\n* withinss - Ini adalah vektor yang mewakili jumlah kuadrat intra-kluster yang memiliki satu komponen per-kluster.\n* tot.withinss - Ini menunjukkan jumlah kuadrat intra-cluster total.\n* betweenss - Ini adalah jumlah dari kuadrat antar-cluster.\n* size - Jumlah total poin yang dimiliki setiap cluster.\n\n\n## <a id='47'> Visualisasi Hasil Klastering </a> "},{"metadata":{"trusted":true},"cell_type":"code","source":"set.seed(1)\nggplot(data_pengunjung, \n       aes(x =Pendapatan_Tahunan_Ribuan_USD, y = Pengeluaran_USD)) + \n  geom_point(stat = \"identity\", aes(color = as.factor(k6$cluster))) +\n  scale_color_discrete(name=\" \",breaks=c(\"1\", \"2\", \"3\", \"4\", \"5\",\"6\"),\n                       labels=c(\"Cluster 1\", \"Cluster 2\", \"Cluster 3\", \n                                \"Cluster 4\", \"Cluster 5\",\"Cluster 6\")) +\n  ggtitle(\"Segmen Pelanggan Mall berdasarkan Penghasilan dan Pengeluaran\",\n          subtitle = \"Menggunakan K-means Clustering\")","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Dari visualisasi di atas, Segmen Pelanggan Mall berdasarkan Pendapatan dan Pengeluaran diperoleh kesimpulan berikut:\n* Cluster 1 dan 4: Cluster ini mewakili pengunjung dengan gaji menengah dan juga gaji tahunan menengah. \n* Cluster 2      : Cluster ini menunjukkan pengunjung dengan pendapatan tahunan yang tinggi dan pengeluaran tahunan yang rendah.\n* Cluster 3      : Cluster ini menunjukkan pengunjung dengan pendapatan tahunan rendah serta pengeluaran tahunan rendah.\n* Cluster 5      : Cluster ini mewakili  pengunjung dengan pendapatan tahunan yang rendah tetapi pengeluaran tahunannya yang tinggi.\n* Cluster 6      : Cluster ini mewakili pengunjung yang memiliki pendapatan tahunan tinggi dan pengeluaran tahunan tinggi."},{"metadata":{"trusted":true},"cell_type":"code","source":"set.seed(1)\nggplot(data_pengunjung, aes(x =Pengeluaran_USD, y =Usia)) + \n  geom_point(stat = \"identity\", aes(color = as.factor(k6$cluster))) +\n  scale_color_discrete(name=\" \", breaks=c(\"1\", \"2\", \"3\", \"4\", \"5\",\"6\"),\n                       labels=c(\"Cluster 1\", \"Cluster 2\", \"Cluster 3\", \n                                \"Cluster 4\", \"Cluster 5\",\"Cluster 6\")) +\n  ggtitle(\"Segmen Pelanggan Mall Berdasarkan Pengeluaran dan Usia\", \n          subtitle = \"Using K-means Clustering\")","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Dari visualisasi di atas, Segmen Pelanggan Mall Pengeluaran dan Usia diperoleh kesimpulan berikut:\n\n* Cluster 1 dan 6: mewakili pengunjung usia muda (25-32) dengan pengeluaran tinggi. \n* Cluster 2 dan 5: menunjukkan pengunjung usia paling dominan (30-60) dengan pengeluaran yang rendah.\n* Cluster 3      : menunjukkan pengunjung usia tua (45 keatas) dengan pengeluaran menengah (USD 50-an).\n* Cluster 4      :  menunjukkan pengunjung usia muda (35 kebawah) dengan pengeluaran menengah (USD 50-an).     "},{"metadata":{"trusted":true},"cell_type":"code","source":"set.seed(1)\nggplot(data_pengunjung, aes(x =Pendapatan_Tahunan_Ribuan_USD, y =Usia)) + \n  geom_point(stat = \"identity\", aes(color = as.factor(k6$cluster))) +\n  scale_color_discrete(name=\" \", breaks=c(\"1\", \"2\", \"3\", \"4\", \"5\",\"6\"),\n                       labels=c(\"Cluster 1\", \"Cluster 2\", \"Cluster 3\", \n                                \"Cluster 4\", \"Cluster 5\",\"Cluster 6\")) +\n  ggtitle(\"Segmen Pelanggan Mall Berdasarkan Pendapatan dan Usia\", \n          subtitle = \"Using K-means Clustering\")","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"Dari visualisasi di atas, Segmen Pelanggan Mall Pendapatan dan Usia diperoleh kesimpulan berikut:\n\n* Cluster 1 dan 2: mewakili pengunjung pendapatan rendah dibawah USD 50 pertahun Usia muda dan tua. \n* Cluster 3 dan 4: menunjukkan pengunjung pendapatan menengah dan usia lebih besar dari 45 dan lebih kecil 40.\n* Cluster 5 dan 6: menunjukkan pengunjung pendapatan tinggi dan usia lebih besar dari 45 dan lebih kecil 40.\n"},{"metadata":{},"cell_type":"markdown","source":"Untuk menarik kesimpulan berdasarkan ketiga parameter diatas, dapta digunakan metode Principal Component Analysis (PCA) sebagai berikut:"},{"metadata":{"trusted":true},"cell_type":"code","source":"set.seed(1)\npcclust=prcomp(data_pengunjung[,3:5],scale=FALSE)         # principal component analysis\nsummary(pcclust)\npcclust$rotation[,1:2]\n\nkCols=function(vec){cols=rainbow (length (unique (vec)))\nreturn (cols[as.numeric(as.factor(vec))])}\ndigCluster<-k6$cluster; dignm<-as.character(digCluster);  # K-means clusters\nplot(pcclust$x[,1:2], col =kCols(digCluster),pch =19,xlab =\"K-means\",ylab=\"classes\")\nlegend(\"bottomleft\",unique(dignm),fill=unique(kCols(digCluster)))","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":"* Cluster 3 dan 4: menyatakan pelanggan berpendapatan dan pengeluran menengah dengan umur berpariatif\n* Cluster 1: menyatakan pelanggan berpengeluaran tinggi, pendapatan rendah dan umur kisaran 25 kebawah (muda).\n* Cluster 6: menyatakan pelanggan berpengeluaran dan pendapatan tinggi dengan umur kisaran 32 (sedang).  \n* Cluster 5: menyatakan pelanggan berpengeluaran rendah, umur tua dan penghasilan tinggi.\n* Cluster 2: menyatakan pelanggan berpengeluaran dan pendapatan stabil tetapi umur tua. "},{"metadata":{},"cell_type":"markdown","source":"# <a id='5'>Bab V Kesimpulan dan Saran</a> \n\nDengan bantuan klasifikasi metode klustering K-means, peneliti dapat memahami variabel jauh lebih baik, mudah untuk mengambil keputusan dengan baik dan benar. Dengan identifikasi pelanggan, perusahaan dapat merilis produk dan layanan yang menargetkan pelanggan berdasarkan beberapa parameter seperti pendapatan, usia, pola pengeluaran, dll. Selain itu, penambahan variabel baru yang lebih kompleks seperti mempertimbangkan ulasan produk dapat memberikan gambaran segmentasi yang lebih baik. \n\nPeneliti berikutnya dapat mengembangkan dan menggunakan konsep mechine learning ini terhadap data unsupervised lainnya (yakni data yang tidak berlabel). Secara khusus, dapat menggunakan algoritma pengelompokan yang disebut K-means clustering. Dalam menganalisis dan memvisualisasikan data dan kemudian melanjutkan untuk mengimplementasikan algoritma ini. \n\nSemoga Anda menikmati penelitian Analisis segementasi pengunjung Mall dengan menggunakan R ini. Semoga juga dapat memberikan wawasan dan inspirasi untuk penelitian lainnya."},{"metadata":{},"cell_type":"markdown","source":"\n"},{"metadata":{},"cell_type":"markdown","source":"## Selamat Belajar & Meneliti\n\nKemudian ngemall online saja dulu :)\n\n<img src=\"https://media.giphy.com/media/l1ugazIulesvi9oI0/giphy.gif\" width=\"500px\">"},{"metadata":{},"cell_type":"markdown","source":"# <a id='6'>Daftar Pustaka</a> \n\n[1] Kotler, Philip dan Gary Armstrong. 2012. “Prinsip-Prinsip Pemasaran. Edisi 13.Jilid 1”. (Jakarta. Erlangga)\n\n[2] Sanusi, Anuar. 2015. “Anuar Sanusi Jurnal Bisnis Darmajaya, Vol. 01 No. 01. Januari 2015 Efektivitas Positioning Jurusan Manajemen Dan Pengaruhnya Terhadap Tingkat Kepuasan (Satisfactions) Jasa Pelayanan (Studi Pada Perguruan Tinggi Swasta Di Bandarlampung)”. Jurnal Bisnis Darmajaya 1 (1): 1–13. Https://Jurnal.Darmajaya.Ac.Id/In dex.Php/Jurnalbisnis/Article/View /190/73. \n\n[3] Serli Wijaya dan Gunawan Adi Chandra “Analisa Segmentasi, Penentuan Target Dan Posisi Pasar Pada Restoran Steak dan Grill Di Surabaya”.Dikuip pada 01 Desember 2016, pukul 19.12 WIB.  Jurnal Manajemen Perhotelan, Vol. 2, No.  \n\n[4] Kotler, Philip. Lane keller, Kevin. 2007. “Manajemen Pemasaran, Edisi 12, Jilid 1”.(Jakarta: Penerbit Erlanga).\n\n[5] Assaruri, Sofjan. 2015. “Manajemen Pemasaran, Edisi 15”. (Jakarta: Rajawali Perseda).  \n\n[6] Hasan, Iqbal, (2001). Pokok-Pokok Materi Statistik 1 (Statistik Deskriptif). Jakarta : PT Bumi Aksara\n\n[7] Suryoatmono, Bambang, (2007). Kursus Statistika Dasar. (online): http://home.unpar.ac.id/~ suryoatm/Kursus%20Statistika%20Dasar.PDF \n\n[8] Paul T. von Hippel, 2005, \"Mean, Median, and Skew: Correcting a Textbook Rule\", Journal of Statistics Education Volume 13, Number 2, The Ohio State University\n\n\n[9] S.R. Nanda, B. Mahanty, M.K. Tiwari , 2010, “Clustering Indian stock market data for portfolio management”, Expert Systems with Applications, vol 37, pp. 8793-8798. \n"},{"metadata":{"trusted":true},"cell_type":"code","source":"","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"display_name":"R","language":"R","name":"ir"},"language_info":{"mimetype":"text/x-r-source","name":"R","pygments_lexer":"r","version":"3.4.2","file_extension":".r","codemirror_mode":"r"}},"nbformat":4,"nbformat_minor":4}