- Hierarhiline klasterdamine korraldab andmed puukujuliseks struktuuriks, mida nimetatakse dendrogrammiks, vältides vajadust klastrite arvu eelnevalt määrata.
- AGNES loob klastreid alt ülespoole iteratiivse liitmise teel, samas kui DIANA jagab ühe suure rühma ülevalt alla.
- Klastri kvaliteeti hinnatakse sisemiste mõõdikute, näiteks Davies-Bouldini indeksi või väliste võrdluste abil Precision and Recall'i abil.
Kas oled kunagi tundnud, et jõllitad andmemäge ja ei näe puude taga metsa? Siin tulebki mängu klasterdamine. See on põhimõtteliselt andmepunktide rühmitamise kunst nende sarnasuse järgi , tagades, et rühma sees olevad asjad on omavahel tihedalt seotud, samas kui rühmad ise jäävad üksteisest kaugele. See on järelevalveta masinõppe nurgakivi, mis tähendab, et arvuti leiab mustreid ilma, et talle eelnevalt öeldaks, mida otsida.
Kuigi andmete tükeldamiseks ja tükeldamiseks on palju võimalusi, on hierarhiline klasterdamine pisut eriline. Selle asemel, et lihtsalt valida juhuslik arv rühmi, loob see pesastatud struktuuri, mis näeb välja nagu sugupuu . Olenemata sellest, kas proovite mitmekesistada aktsiaportfelli või segmenteerida oma kliendibaasi, annab see lähenemisviis teile visuaalse teekaardi andmete seoste kohta, võimaldades teil otsustada, kust puud lõigata , et saada ideaalne arv klastreid.
Hierarhilise klastrite moodustamise põhiloogika

Hierarhiline klasterdamine loob rühmade hierarhia. Seda kujutab sageli dendrogramm – puukujuline diagramm, kus vertikaaltelg tähistab klastrite vahelist kaugust või erinevust. Mida madalam on haru, seda sarnasemad on elemendid. See meetod on uskumatult paindlik, kuna see ei sunni teid klastrite arvu (k) algusest peale eelnevalt määratlema, erinevalt algoritmidest nagu K-Means.
AGNES: Alt-üles lähenemine

AGNES ehk aglomeratiivne pesastamine on hierarhilise klastrite moodustamise kõige levinum vorm. See algab mentaliteediga „igaüks iseenda eest“, kus iga üksik andmepunkt on omaette pisike klaster . Sealt edasi ühendab algoritm iteratiivselt kaks lähimat klastrit, kuni kõik on koondatud ühte hiiglaslikku rühma.
Protsess toimub üldiselt järgmiselt: esiteks arvutatakse lähedusmaatriks, kasutades kauguse meetrikat (näiteks eukleidilist kaugust). Seejärel ühendatakse kaks kõige sarnasemat punkti. Maatriksit värskendatakse, et see kajastaks seda uut rühma, ja protsess kordub. Selle toimimiseks on vaja seosekriteeriumi, et otsustada, kuidas rühmade vahelist kaugust mõõta:
- Üksikühendus: Vaatab minimaalne kaugus mis tahes kahe punkti vahel erinevates klastrites. See võib viia "aheldumiseni", kus klastrid kasvavad pikkade peente joontena.
- Täielik ühendus: Keskendub maksimaalne kaugus punktide vahel, kipudes looma kompaktsemaid, sfäärilisemaid rühmi.
- Keskmine seos: Arvutab välja keskmine kaugus kahe klastri kõigi punktipaaride vahel, pakkudes tasakaalustatud keskteed.
- Tsentroidne seos: Mõõdab kaugust geomeetrilised keskpunktid (tsentroidid) klastritest, mis on sageli erandite suhtes vastupidavam.
- Wardi meetod: Toores distantsi asemel on selle eesmärk minimeerida klastrisisest dispersiooni, hoides klastreid tõhusalt tihedate ja sidusate.
DIANA: Ülalt-alla strateegia

Teisel pool on meil DIANA (lõheanalüüs). Kui AGNES on torni ehitamine, siis DIANA on skulptuuri nikerdamine . See algab ühest massiivsest klastrist, mis sisaldab iga üksikut andmepunkti, ja jagab selle rekursiivselt väiksemateks.
Algoritm tuvastab suurima läbimõõduga klastri (kõige erinevamad punktid) ja leiab kõige „killukesema“ vaatluse – selle, mis erineb ülejäänutest kõige rohkem. See vaatlus alustab uut rühma ja teised punktid määratakse ümber vastavalt sellele, millisele rühmale nad lähemal on . See jätkub, kuni iga punkt on isoleeritud. Erinevalt AGNES-ist peate valima ainult kauguse mõõdiku; siin pole vaja seostamismeetodit .
Edu ja kvaliteedi mõõtmine
Kuna juhendamata õppes pole „õiget“ vastust, kasutame klastrite mõistlikkuse kontrollimiseks spetsiifilisi mõõdikuid. Üldiselt jagame need sisemiseks ja väliseks valideerimiseks.
Sisemine valideerimine ei vaja väliseid silte. Näiteks Davies-Bouldini indeks vaatleb klastrisisese ühtekuuluvuse ja klastritevahelise eraldatuse suhet; madalam tulemus on parem. Stressi potentsiaal mõõdab tsentroidide kauguste ruutude summat, kuigi see loomulikult langeb klastrite lisamisel. Teised populaarsed tööriistad hõlmavad küünarnukimeetodit ja siluetianalüüsi , et leida rühmade arvu jaoks „magus punkt“.
Väline valideerimine tuleb mängu siis, kui teil on võrdluseks kuldstandard või ekspertide sildid. Mõõdikud nagu täpsus (precision), tagasikutsutavus (recall) ja F-mõõt (F-measure) käsitlevad klastrite moodustamise tulemust klassifitseerimisprobleemina. Samuti saate kasutada infoteooriat , kasutades entroopiat ja vastastikust informatsiooni, et näha, kui palju ebakindlust väheneb algoritmi väljundi võrdlemisel teadaolevate kategooriatega.
Reaalse maailma kasulikkus: rahandusest andmeteaduseni
See pole pelgalt akadeemiline teooria. Näiteks rahanduses on klastrite moodustamine portfelli mitmekesistamise jõuallikas . Kasutades varade tootluse korrelatsioonimaatriksit kauguse mõõtmiseks, saavad investorid luua dendrogrammi, et näha, millised aktsiad liiguvad samas tempos. Tõeliseks mitmekesistamiseks tuleks valida varasid portfelli erinevatest okstest , tagades, et portfell ei oleks liiga avatud ühele riskitegurile.
Lisaks rahandusele aitab klastrite moodustamine turusegmenteerida, grupeerides sarnaste ostuharjumustega kliente, võimaldades ettevõtetel oma turundust kohandada. Peamine on katsetada erinevaid kauguse mõõdikuid – näiteks Manhattani või Mahalanobise – ja erinevaid sidumismeetodeid, et näha, milline neist paljastab analüüsitavas andmestikus kõige usutavamad mustrid .
Nende hierarhiliste tehnikate valdamine võimaldab andmetest sügavat ja struktuurset arusaamist, liikudes üksikute punktide detailsetest detailidest globaalsete kategooriate suure pildini. Aglomeratiivsete ja jagavate strateegiate tasakaalustamise ning tulemuste valideerimise abil sisemiste ja väliste mõõdikute abil saab muuta toore, märgistamata müra tegutsemist võimaldavaks ja organiseeritud teabeks.

