- Pengkelompokan hierarki menyusun data ke dalam struktur seperti pokok yang dipanggil dendrogram, mengelakkan keperluan untuk menetapkan bilangan kluster terlebih dahulu.
- AGNES membina kluster dari bawah ke atas melalui penggabungan berulang, manakala DIANA membahagikan satu kumpulan besar dari atas ke bawah.
- Kualiti kluster dinilai menggunakan metrik dalaman seperti Indeks Davies-Bouldin atau perbandingan luaran melalui Precision and Recall.
Pernahkah anda rasa seperti anda sedang merenung timbunan data dan tidak dapat melihat hutan untuk melihat pokok-pokoknya? Di situlah pengelompokan memainkan peranan. Pada asasnya, ia adalah seni mengumpulkan titik data berdasarkan betapa serupanya , memastikan bahawa perkara-perkara di dalam kumpulan adalah erat manakala kumpulan itu sendiri berada berjauhan. Ia adalah asas pembelajaran mesin tanpa pengawasan, yang bermaksud komputer mencari corak tanpa diberitahu terlebih dahulu apa yang perlu dicari.
Walaupun terdapat banyak cara untuk membahagikan data, pengelompokan hierarki agak istimewa. Daripada hanya memilih bilangan kumpulan secara rawak, ia mewujudkan struktur bersarang yang kelihatan seperti salasilah keluarga . Sama ada anda cuba mempelbagaikan portfolio saham atau menyegmentasikan asas pelanggan anda, pendekatan ini memberi anda peta jalan visual tentang bagaimana data anda berkaitan, membolehkan anda memutuskan di mana hendak memotong pokok untuk mendapatkan bilangan kluster yang sempurna.
Logik Teras Pengkelompokan Hierarki

Pada asasnya, pengelompokan hierarki membina hierarki kumpulan. Ini sering diwakili oleh dendrogram , gambar rajah seperti pokok di mana paksi menegak mewakili jarak atau perbezaan antara kelompok. Semakin rendah cabang, semakin serupa item tersebut. Kaedah ini sangat fleksibel kerana ia tidak memaksa anda untuk menentukan bilangan kelompok (k) terlebih dahulu, tidak seperti algoritma seperti K-Means.
AGNES: Pendekatan Dari Bawah Ke Atas

AGNES, atau Agglomerative Nesting, merupakan perisa pengelompokan hierarki yang paling biasa. Ia bermula dengan mentaliti "setiap orang untuk dirinya sendiri", di mana setiap titik data individu bermula sebagai kelompok kecilnya sendiri . Dari situ, algoritma menggabungkan dua kelompok terdekat secara berulang sehingga semuanya dikumpulkan ke dalam satu kumpulan gergasi.
Proses ini secara amnya mengikuti langkah-langkah berikut: pertama, matriks jarak dikira menggunakan metrik jarak (seperti jarak Euclidean). Kemudian, dua titik yang paling serupa digabungkan. Matriks dikemas kini untuk mencerminkan kumpulan baharu ini, dan proses tersebut berulang. Untuk memastikan ini berfungsi, anda memerlukan kriteria perkaitan untuk menentukan cara mengukur jarak antara kumpulan:
- Hubungan Tunggal: Melihat pada jarak minimum antara mana-mana dua titik dalam kelompok yang berbeza. Ini boleh menyebabkan "rantaian", di mana kelompok tumbuh dalam garisan panjang dan nipis.
- Pautan Lengkap: Memberi tumpuan kepada jarak maksimum antara titik, cenderung untuk mewujudkan kumpulan sfera yang lebih padat.
- Purata Hubungan: Mengira jarak purata antara semua pasangan titik merentasi dua gugusan, memberikan kedudukan tengah yang seimbang.
- Hubungan Sentroid: Mengukur jarak antara pusat geometri (sentroid) daripada kluster, yang selalunya lebih kukuh terhadap outlier.
- Kaedah Ward: Daripada jarak yang jauh, ia bertujuan untuk meminimumkan jumlah varians intra-kluster, dengan berkesan memastikan kluster ketat dan padu.
DIANA: Strategi Atas-Bawah

Sebaliknya, kita ada DIANA (Analisis Perpecahan). Jika AGNES adalah tentang membina menara, DIANA pula adalah tentang mengukir arca . Ia bermula dengan satu gugusan besar yang mengandungi setiap titik data dan secara rekursif membahagikannya kepada gugusan yang lebih kecil.
Algoritma mengenal pasti gugusan dengan diameter terbesar (titik yang paling berbeza) dan mencari pemerhatian yang paling "serpihan"—yang paling berbeza daripada yang lain. Pemerhatian ini memulakan kumpulan baharu dan titik lain ditugaskan semula berdasarkan kumpulan yang lebih dekat dengannya . Ini berterusan sehingga setiap titik diasingkan. Tidak seperti AGNES, anda hanya perlu memilih metrik jarak; tiada kaedah perkaitan diperlukan di sini.
Mengukur Kejayaan dan Kualiti
Oleh kerana tiada jawapan yang "betul" dalam pembelajaran tanpa pengawasan, kami menggunakan metrik tertentu untuk melihat sama ada kluster kami benar-benar masuk akal. Kami biasanya membahagikannya kepada pengesahan dalaman dan luaran.
Pengesahan Dalaman tidak memerlukan label luaran. Contohnya, Indeks Davies-Bouldin melihat nisbah kohesi dalam kluster kepada pemisahan antara kluster; skor yang lebih rendah adalah lebih baik. Potensi Tegasan mengukur jumlah jarak kuasa dua kepada sentroid, walaupun ini secara semula jadi menurun apabila anda menambah lebih banyak kluster. Alat popular lain termasuk Kaedah Siku dan Analisis Siluet untuk mencari "titik ideal" bagi bilangan kumpulan.
Pengesahan Luaran memainkan peranan apabila anda mempunyai standard emas atau label pakar untuk dibandingkan. Metrik seperti Ketepatan, Ingatan Semula dan ukuran-F menganggap hasil pengelompokan sebagai masalah pengelasan. Anda juga boleh menggunakan Teori Maklumat , menggunakan Entropi dan Maklumat Bersama untuk melihat berapa banyak ketidakpastian yang dikurangkan apabila membandingkan output algoritma dengan kategori yang diketahui.
Utiliti Dunia Sebenar: Daripada Kewangan kepada Sains Data
Ini bukan sekadar teori akademik. Dalam kewangan, sebagai contoh, pengelompokan merupakan kuasa besar untuk kepelbagaian portfolio . Dengan menggunakan matriks korelasi pulangan aset sebagai ukuran jarak, pelabur boleh mencipta dendrogram untuk melihat saham mana yang bergerak serentak. Untuk benar-benar mempelbagaikan, seseorang akan memilih aset daripada cabang pokok yang berbeza, memastikan portfolio tidak terlalu terdedah kepada satu faktor risiko sahaja.
Selain kewangan, pengelompokan membantu dalam segmentasi pasaran dengan mengumpulkan pelanggan dengan tabiat pembelian yang serupa, membolehkan syarikat menyesuaikan pemasaran mereka. Kuncinya adalah untuk bereksperimen dengan metrik jarak yang berbeza—seperti Manhattan atau Mahalanobis—dan pelbagai kaedah perkaitan untuk melihat yang mana satu mendedahkan corak yang paling munasabah dalam set data tertentu yang dianalisis.
Menguasai teknik hierarki ini membolehkan pemahaman data yang mendalam dan berstruktur, beralih daripada perincian terperinci titik individu kepada gambaran besar kategori global. Dengan mengimbangi strategi aglomeratif dan memecahbelahkan serta mengesahkan keputusan melalui metrik dalaman dan luaran, seseorang boleh mengubah hingar mentah yang tidak dilabelkan kepada kecerdasan terancang yang boleh diambil tindakan.

