- VIF tuvastab multikollineaarsuse, mõõtes, kui palju regressioonikordaja dispersioon ennustajate vaheliste korrelatsioonide tõttu suureneb.
- Levinud tööstusstandardid näitavad, et VIF-väärtused üle 4 vajavad kontrollimist, samas kui väärtused üle 10 viitavad tõsisele multikollineaarsusele.
- Tõhus parandus hõlmab mudeli stabiliseerimiseks üleliigsete muutujate eemaldamist praktilise kasulikkuse ja teadusliku olulisuse põhjal.
Kas olete kunagi tundnud, et teie regressioonimudel toimib pisut vigaselt, koefitsiendid hüplevad kõikjale või p-väärtused lihtsalt ei ole loogilised? Teil võib olla tegemist multikollineaarsusega , mis on salakaval probleem, kus teie ennustavad muutujad on liiga tihedalt seotud, rääkides mudelile sisuliselt sama lugu kaks korda. Kui see juhtub, muutub peaaegu võimatuks isoleerida ühe muutuja individuaalset mõju teie sihttulemusele.
Selle mõistmiseks toetuvad andmeteadlased võimsale diagnostikavahendile nimega dispersiooni inflatsioonitegur (VIF) . Mõelge VIF-ist kui luubist, mis näitab täpselt, kui palju hinnangulise regressioonikordaja dispersiooni teiste ennustajatega korrelatsioonide tõttu "suureneb". Selle mõõdiku valdamine on võtmetähtsusega stabiilsete ja usaldusväärsete ennustusmudelite loomiseks , mis ei varise kokku mõne andmepunkti muutmisel.
Variatsiooni inflatsiooniteguri dekodeerimine

Oma põhiolemuses kvantifitseerib VIF teie koefitsientide hinnangute täpsuse halvenemist. Ideaalses maailmas oleksid teie ennustajad sõltumatud, mis tähendab, et teie koefitsientide dispersioon oleks absoluutselt minimaalne. Kui aga ennustajad on korrelatsioonis , siis dispersioon suureneb, muutes teie hinnangud vähem kindlaks. Konkreetse muutuja VIF arvutatakse, võttes pöördväärtuse 1 miinus R-ruudu väärtus, mis saadakse selle konkreetse ennustaja regressioonanalüüsi teel kõigi teiste mudeli sõltumatute muutujate suhtes.
Matemaatiline esitus on VIF j = 1 / (1 – R j 2 ) . Kui R-ruudu väärtus on madal, tähendab see, et muutuja ei ole redundantne ja VIF püsib 1 lähedal. Kuid kui R-ruut tõuseb – mis näitab, et muutujat saavad teised ennustada –, siis VIF-i väärtus järsult tõuseb , mis annab märku kõrgest redundantsuse tasemest.
Kuidas VIF-skoori tõlgendada

Numbri teadmine on üks asi, aga tõeline maagia sünnib teadmises, mida see teie andmete jaoks tähendab. VIF-väärtus 1 on kuldstandard, mis näitab nullkorrelatsiooni selle ennustaja ja ülejäänud hulga vahel. Kui näete väärtusi, mis ületavad 4 , on see tavaliselt märk sellest, et peaksite sellele muutujale rohkem tähelepanu pöörama.
Kui VIF ületab läve 10 , on tegemist tõsise multikollineaarsusega. Selles etapis on koefitsientide hinnangud tõenäoliselt ebastabiilsed ja standardvead on nii suureks paisutatud, et t-testid võivad näidata muutujaid mitteolulistena, isegi kui mudeli üldine F-test on väga oluline. See vastuolu on klassikaline punane lipp kollineaarsusprobleemide korral.
Multikollineaarsuse märkamine looduses

Kuigi VIF on peamine tööriist, on kasulik ära tunda selle probleemi teisi sümptomeid. Näiteks kui märkate, et teie koefitsientide hinnangud kõiguvad ühe muutuja lisamisel või eemaldamisel järsult, on teil tõenäoliselt kollineaarsuse probleem. Samamoodi võib korrelatsioonimaatriksi kontrollimine anda kiire ülevaate paarikaupa seostest, kuigi see on piiratud, kuna see ei suuda tuvastada keerulisi sõltuvusi, mis hõlmavad kolme või enamat muutujat.
- Paarikaupa korrelatsioonid: Suurepärane lihtsate seoste leidmiseks kahe muutuja (nt kaal ja kehapindala) vahel.
- R-ruudu analüüs: VIF-i alus, mis näitab, kui suurt osa muutuja dispersioonist teised muutujad seletavad.
- Koefitsiendi stabiilsus: Jälgida, kui palju väärtused erinevate mudeli iteratsioonide jooksul muutuvad.
Praktilised strateegiad kõrge VIF-i parandamiseks
Niisiis, olete oma analüüsi läbi viinud ja leidnud mõned muutujad, mille VIF-id on 12 või 15. Mida teha? Kõige lihtsam lahendus on eemaldada sobimatud ennustajad . Kuid te ei saa muutujaid lihtsalt suvaliselt kustutada; peate tegema teadusliku või praktilise valiku. Näiteks kui teil on kaks omavahel tugevalt korreleeritud muutujat, näiteks „Kaal“ ja „Kehapindala“, küsige endalt, kumba neist on lihtsam mõõta või kumba on teie uuringuga loogilisemalt seostatav.
Kõige üleliigsema muutuja eemaldamisel leiad sageli, et ülejäänud ennustajate VIF-id langevad märkimisväärselt . Huvitaval kombel toimub see puhastamine sageli ilma mudeli ennustusvõimet oluliselt kahjustamata. Korrigeeritud R-ruudu väärtuses võib küll väikest langust näha , kuid kompromissiks on palju paremini tõlgendatav ja statistiliselt usaldusväärsem mudel.
VIF-diagnostika rakendamine programmeerimises
Olenemata sellest, kas kasutate R-i või C-d, jääb loogika samaks: kõigepealt peate sobitama lineaarse mudeli ja seejärel arvutama iga tunnuse VIF-i. Keskkondades nagu R, on sellised teegid nagu auto pakkuda otsest vif() funktsioon, mis raske tööga hakkama saab. Tulemuste arusaadavamaks muutmiseks on hea mõte kasutada tulpdiagrammid VIF-väärtuste visualiseerimiseks, mis võimaldab teil koheselt tuvastada muutujad, mis põhjustavad kõige rohkem probleeme, mis on oluline osa Logica de programacion para escribir mejor codigo statistiliste tööriistade loomisel.
Lisaks numbritele on alati tark visualiseerida oma mudeli jääke . Jääkide joonistamine aitab teil kinnitada, kas mudeli vead on juhuslikud või on mõni muster kahe silma vahele jäänud. Korrelatsioonimaatriksite kombineerimine VIF-graafikutega annab teile tervikliku 360-kraadise ülevaate oma andmestiku seisundist, tagades, et teie regressioonitulemused ei ole lihtsalt numbrid, vaid usaldusväärsed teadmised.
Multikollineaarsuse haldamine hõlmab VIF-i abil paisutatud dispersioonide tuvastamise tsüklit, ennustajate vaheliste seoste analüüsimist korrelatsioonimaatriksite abil ja tunnuste komplekti täpsustamist üleliigsete andmete eemaldamise teel. Hoides VIF-väärtusi madalal – tavaliselt alla 5 või 10 – tagate, et iga muutuja annab unikaalset teavet, mis viib täpsemate koefitsientide ja regressioonimudelini, mis peegeldab tõeliselt teie andmete aluseks olevat dünaamikat.
