Koosinuse sarnasuse valdamine: vektormatemaatikast reaalse maailma tehisintellektini

Viimane uuendus: 08/12/2026
  • Koosinuse sarnasus mõõdab kahe vektori suunda, arvutades nendevahelise nurga koosinuse, ignoreerides nende üldist suurust.
  • See mõõdik on tänapäevase tehisintellekti jaoks oluline, võimaldades semantilist otsingut, isikupärastatud soovitussüsteeme ja kõrgmõõtmeliste manustuste töötlemist.
  • Kuigi standardne koosinussarnasus käsitleb tunnuseid sõltumatutena, siis täiustatud versioonid, näiteks pehme koosinus, integreerivad tunnuste seoseid täpsuse parandamiseks.

Representación digital de esferas interconectadas que simbolizan clusters de vectores y datos en una red futurista, ideal para illustratr bases de datos vectoriales.

Kas olete kunagi mõelnud, kuidas Spotify näib teadvat täpselt, milline lugu otsingule sobib, või kuidas Google saab aru, et teie otsingupäring tähendab midagi konkreetset, isegi kui te ei kasuta täpseid sõnu? Suur osa maagiast toimub kulisside taga, kasutades vektoreid . Sõnade või üksuste käsitlemise asemel lihtsa tekstina teisendab tehisintellekt need punktideks massiivses mitmemõõtmelises ruumis ja just siin tulebki mängu koosinussarnasuse kontseptsioon , et kõigele mõtet anda.

Põhimõtteliselt võimaldab see matemaatiline trikk arvutitel välja selgitada, kui "lähedal" kaks asja teineteisele on, vaadates nende vektorite vahelist nurka . See ei hooli sellest, kas üks vektor on teisest palju pikem; see hoolib ainult sellest, kas nad osutavad samas üldises suunas. See muudab täielikult loomuliku keele töötlemise (NLP) ja soovitusmootorite mängu, kuna see keskendub semantilisele tähendusele , mitte ainult märkide sobitamisele.

trampa de dependencias de modelos de lenguaje
Seotud artikkel:
La trampa de dependencia de los LLM: límites, sesgos ja riesgos

Arvutuse mutrid ja poldid

Ilustración abstracta de modelos de lenguaje extensos (LLM) y el Processionto semántico de la IA, representando cómo se organzan los conceptos.

Selle toimimise mõistmiseks peate mõistma, et iga andmeosa – olgu see siis sõna või film – on esitatud vektorina, kus iga mõõde on kindel atribuut. Sarnasuse leidmiseks järgime mõnda kindlat sammu. Esmalt arvutame skalaarkorrutise , mis hõlmab mõlema vektori vastavate väärtuste korrutamist ja summeerimist, et näha, kui joondatud need on. Seejärel selgitame välja iga vektori suuruse (või pikkuse) , võttes ruutjuure selle ruutkomponentide summast.

Viimane samm on tegelik koosinuse sarnasuse valem : võetakse see skalaarkorrutis ja jagatakse kahe suuruse korrutisega. Matemaatiliselt näeb see välja selline: Koosinuse sarnasus = (A · B) / (||A|| × ||B||) . Tulemuseks on skoor, mis tavaliselt kõigub vahemikus -1 kuni 1. Skoor 1 tähendab, et vektorid on ideaalselt joondatud , 0 tähendab, et nad on ortogonaalsed (täiesti mitteseotud) ja -1 tähendab, et nad on diametraalselt vastandlikud.

Perspektiivi asetamine: kuningad, kuningannad ja õunad

Visualización matemática en 3D de dos vectores representados como flechas de neón con un ángulo theta entre ellos, ilustrando el concepto fundamental de la similitud de coseno.

Teeme selle konkreetseks. Kujutage ette õigusteaduse magistrit, kes töötleb sõnu „kuningas“ ja „kuninganna“. Kuna need terminid esinevad sageli selliste sõnade nagu „troon“ või „monarhia“ lähedal, osutavad nende vektorite manustamised peaaegu samas suunas, mille tulemuseks on kõrge koosinussarnasuse skoor . Nüüd lisage segule sõna „õun“. Isegi kui see on samas dokumendis, ripub see koos selliste terminitega nagu „puuvili“ või „viljaaed“, seega osutab selle vektor metsikult erinevas suunas, mille tulemuseks on palju madalam sarnasuse skoor.

Asjade sujuvana hoidmiseks ei arvuta ettevõtted seda iga üksiku elemendi jaoks lihtsalt lennult. Nad kasutavad vektorandmebaase . Need spetsiaalsed tööriistad on loodud kõrgmõõtmeliste vektorite indekseerimiseks, võimaldades ülikiirelt leida kõige sarnasemaid vasteid ilma kogu andmestikku käsitsi skannimata.

Amazon Neptune'i graafikute baas
Seotud artikkel:
Amazon Neptune, la base de datos de grafos de AWS para relaciones a escala

Põhitõdedest kaugemale minek: pehme koosinus ja muud mõõdikud

Standardsel koosinussarnasusel on üks puudus: see eeldab, et iga dimensioon on sõltumatu. Tegelikkuses on aga sellised sõnad nagu „mäng“ ja „mäng“ erinevad dimensioonid, kuid semantiliselt seotud . Siin tulebki mängu pehme koosinussarnasus . See tutvustab sarnasusmaatriksit (sageli kasutades Levenshteini kaugust või WordNeti), et arvestada tunnuste vahelist seost, võimaldades mudelil mõisteid tõhusamalt üldistada, isegi kui formaalsed tunnused erinevad.

Samuti tasub seda võrrelda teiste levinud mõõdikutega. Näiteks eukleidiline kaugus (L2) mõõdab kahe punkti vahelist sirgjoonelist kaugust, mis on suurepärane ruumilise läheduse hindamiseks. Manhattani kaugus (L1) arvutab kauguse mööda ruudustikku. Kuigi need mõõdavad absoluutset kaugust , keskendub koosinussarnasus ainult orientatsioonile . Samuti on olemas skalaarkorrutise sarnasus , mis arvestab nii nurka kui ka suurust. Kui normaliseerida vektorid ühikupikkuseks, muutuvad skalaarkorrutis ja koosinussarnasus sisuliselt samaks asjaks, kuid skalaarkorrutise arvutamine on arvutuslikult odavam .

Praktilised rakendused graafikuandmetes ja otsingus

Graafiandmebaaside, näiteks Amazon Neptune'i ja teiste graafikusüsteemide maailmas kasutatakse koosinussarnasust rühmadevahelise sidususe leidmiseks või sarnaste kasutajate tuvastamiseks. Näiteks kui teil on inimeste ja nende lemmikköökide graafik, saate nende eelistusi esitada skooride vektoritena. Koosinussarnasuse algoritmi rakendades saate järjestada, millistel kasutajatel on kõige sarnasemad maitsed, olenemata sellest, kas üks inimene hindab rohkem restorane kui teine.

Kaasaegsed otsingumootorid liiguvad ka puhtalt leksikaalse otsingu (nagu Ctrl+F) asemel vektorotsingu poole . Kuigi leksikaalne otsing sobib suurepäraselt tokeniseerimiseks, ei taba see teksti mõtet. Vektorotsing tabab aluseks oleva eesmärgi . Süsteemides nagu Elasticsearch rakendatakse seda päringute teisendamisel manustamiseks ja lähimate naabrite leidmisel , kasutades meie poolt käsitletud mõõdikuid, teisendades sageli vahemiku -1 kuni 1 positiivseks hindeks parema reastuse saavutamiseks.

Olenemata sellest, kas lood filmisoovitusprogrammi või keerukat tehisintellekti agenti, sõltub õige sarnasusmõõdiku valimine sellest, kas vektori suurusjärk kannab tähendust. Kui sind huvitab ainult andmete „teema” või „suund”, on koosinussarnasus sinu parim valik. Neile, kes vajavad toorest ruumilist kaugust, on eukleidiline sarnasus õige tee. Kombineerides neid matemaatilisi tööriistu tõhusate indekseerimisalgoritmidega , saame muuta struktureerimata andmed organiseeritud ja otsitavaks inimliku tähenduse kaardiks.

Seonduvad postitused: