- Google arendab "TorchTPU-d", et muuta oma tehisintellekti kiibid täielikult PyTorchiga ühilduvaks ja hõlbustada migratsiooni Nvidia GPU-delt.
- Selle sammu eesmärk on muuta TPU-d pilves ja kohapealsetes keskkondades peavoolu alternatiiviks, vähendades sõltuvust Nvidia CUDA ökosüsteemist.
- Google teeb tihedat koostööd PyTorchi halduri Metaga ja kaalub osade tarkvara avatud lähtekoodiga muutmist, et kiirendada kasutuselevõttu.
- Tugevam PyTorchi tugi võiks vähendada kulusid ja tehnilisi takistusi ettevõtetele, kes soovivad oma tehisintellekti infrastruktuuri mitmekesistada.
Google kujundab vaikselt ümber oma strateegiat tehisintellekti (AI) andmetöötluse võidujooksus . Pärast aastaid kestnud sisemiste märkide kohast keskendumist paneb ettevõte nüüd rõhku sellele, et tema tehisintellekti kiibid sujuvalt töötaksid PyTorchiga – avatud lähtekoodiga tööriistakomplektiga, millest on saanud enamiku tehisintellekti arendajate vaikevalik kogu maailmas.
Selle nihke keskmes on projekt, mida sisemiselt tuntakse kui „TorchTPU“ – ettevõtmine, mille eesmärk on kaotada lõhe Google'i riistvara ehituse ja klientide tegelike tehisintellekti süsteemide loomise vahel. Tõstes PyTorchi toe oma Tensor Processing Unitites (TPU-des) esmaklassilisele tasemele, soovib Google ära kasutada tohutut eelist, mille Nvidia on loonud oma CUDA tarkvaraökosüsteemi kaudu.
Google muudab TPU-d Nvidia GPU-de tõsiseks konkurendiks
Google'i TPU-sid on pikka aega reklaamitud kui tehisintellekti töökoormuste jaoks kohandatud kõrgjõudlusega kiipe , kuid need pole veel saavutanud Nvidia GPU-de laialdast levikut. Üks peamine põhjus on see, et Nvidia veetis aastaid tagamaks, et PyTorch töötaks nende riistvaral erakordselt hästi, samal ajal kui Google keskendus peamiselt oma tööriistadele ja sisemistele töövoogudele.
Alphabetis on TPU-dest saanud Google Cloudi kriitilise tähtsusega kasvumootor . Nendele kiipidele ligipääsu müümine oma pilveplatvormi kaudu on nüüd kesksel kohal selles, kuidas Google püüab investoritele tõestada, et tema tehisintellekti investeeringud võivad tuua käegakatsutavat tulu, mitte ainult uurimistöö prestiiži või eksperimentaalsete toodete teket.
Siiski ei võida arendajate poolehoidu ainuüksi riistvara. TPU-sid kaaluvad ettevõtted on Google'ile korduvalt öelnud, et tarkvara ühilduvus on olnud probleemiks : meeskonnad, kes on PyTorchil tugevalt standardiseerinud, ei taha oma koodi ümber kujundada ega töötajaid ümber õpetada ainult uue kiibi proovimiseks.
Siin tulebki mängu TorchTPU. Algatuse eesmärk on muuta TPU-d arendaja seisukohast PyTorchiga sama lihtsalt kasutatavaks kui tänapäeval Nvidia GPU-d . Eesmärk on, et olemasolevaid PyTorchi mudeleid ja torujuhtmeid saaks minimaalsete muudatustega üle viia, nii et TPU-dega katsetamise kulud ja riskid langeksid järsult.
Google Cloudi pressiesindaja on vältinud tehniliste üksikasjade süvenemist, kuid kinnitas, et peamine eesmärk on anda klientidele palju suurem paindlikkus tehisintellekti töökoormuste haldamisel , olenemata sellest, millise riistvara nad valivad.
Mida TorchTPU PyTorchi arendajate jaoks tegelikult muudab
PyTorch, mille algselt lõi ja reklaamis Meta, on saanud tänapäevaste tehisintellekti süsteemide loomise de facto standardraamistikuks . Enamik Silicon Valley ja kaugemal asuvatest inseneridest ei kodeeri käsitsi Nvidia, AMD ega Google'i kiipide tuumasid; selle asemel toetuvad nad PyTorchile ja sarnastele raamistikele, mis pakuvad eelvalmistatud komponentide ja treeningutiliitide kihte.
Alates selle ilmumisest 2016. aastal on PyTorchi kasv olnud tihedalt seotud CUDA ja sellega seotud teekidega – tarkvarapaketiga, mida paljud Wall Streeti analüütikud peavad Nvidia kõige olulisemaks strateegiliseks varaks. Nvidia insenerid on teinud suuri investeeringuid, et tagada PyTorchi maksimaalne efektiivsus nende GPU-del, muutes selle paaristamise vaikimisi valikuks suuremahuliste tehisintellekti mudelite treenimiseks ja juurutamiseks.
Google seevastu toetas aastaid Jaxi , teist tarkvararaamistikku, mida eelistati eriti Google'i enda uurimis- ja tootemeeskondades. TPU-d tuginesid Jaxi-põhise koodi tõhusaks käitamiseks XLA- nimelisele kompilaatorikihile ning suur osa Google'i sisemisest tehisintellekti tarkvarapaketist ja jõudluse optimeerimisest ehitati selle kombinatsiooni ümber.
Tulemuseks on üha suurem ebakõla selle vahel, kuidas Google ise oma kiipe kasutab ja kuidas enamik väliskliente eelistab töötada. Paljud ettevõtted on standardiseerinud peaaegu täielikult PyTorchile, mis tähendab, et TPU-dele üleminek tähendas tavaliselt murrangulist muutust tööriistades, koodis ja arendajaoskustes.
Google püüab TorchTPU abil seda hõõrdumist kõrvaldada. Projekti eesmärk on pakkuda TPU-dele täielikku PyTorchi tuge , et ettevõtted saaksid jätkuvalt toetuda tuttavatele teekidele, treeningtsüklitele ja juurutusmustritele, muutes samal ajal ainult aluseks olevat riistvaraeesmärki. See võib märkimisväärselt vähendada nii inseneritööd kui ka õppimiskõverat meeskondadele, kes soovivad hinnata TPU jõudlust või kulueeliseid.
Rohkem ressursse, avatud lähtekoodiga tarkvara ja sügavam pühendumus
Algatusega tuttavate inimeste sõnul pole TorchTPU lihtsalt järjekordne kõrvalkatse. Erinevalt mõnest varasemast katsest panna PyTorch TPU-del töötama on Google nüüd sellele ettevõtmisele pööranud rohkem organisatsioonilist tähelepanu, eelarvet ja strateegilist tähtsust , käsitledes seda oma tehisintellekti infrastruktuuri tegevuskava keskse sambana, mitte niši ühilduvusprojektina.
Üks tähelepanuväärsemaid kaalumisel olevaid elemente on TorchTPU tarkvarapaketi avatud lähtekoodiga osad . Põhikomponentide kogukonnale avaldamisega loodab Google kiirendada kasutuselevõttu, meelitada ligi väliseid panustajaid ja luua usaldust suurklientide seas, kes soovivad oma tehisintellekti platvormidel läbipaistvust ja pikaajalist stabiilsust.
See avatum suhtumine peaks rahustama ka ettevõtteid, kes on pidanud TPU tuge liiga tihedalt seotuks Google'i sisemise toimimisviisiga. Välistele arendajatele võimaluse andmine TorchTPU komponente kontrollida, laiendada ja siluda võiks muuta TPU-d vähem omandiõigusega saareks ja pigem esmaklassiliseks kodanikuks laiemas PyTorchi ökosüsteemis.
Ettevõtete jaoks on see oluline praktilisel moel. Kui TorchTPU õnnestub, võib see oluliselt vähendada Nvidia GPU-delt Google TPU-dele ülemineku kulusid , muutes arvutusinfrastruktuuri mitmekesistamise teostatavamaks ilma mitmeaastase tarkvara ümberkirjutamiseta.
Kliendid on Google'ile korduvalt öelnud, et ajalooline nõue Jaxile üle minna oli peamine takistus. PyTorch domineerib juba tehisintellekti arendajate seas ja kiiresti muutuvatel turgudel on vähesed organisatsioonid valmis tootearendusi peatama, samal ajal kui nende meeskonnad uue raamistiku ümber seadistavad, et pääseda ligi alternatiivsele riistvarale.
Sisemisest riistvarast laiaulatusliku ettevõtte pakkumiseni
Pikka aega hoidis Alphabet suurema osa oma TPU võimsusest Google'i sisemiseks kasutamiseks , toetades otsingut, tõlkimist, soovitussüsteeme ja varajasi tehisintellekti uuringuid. See seisukoht hakkas muutuma 2022. aastal, kui pilvandmetöötluse osakonnale anti suurem võim TPU-de tootestamise ja müügi üle.
Sellest ajast alates on TPU-de kättesaadavus Google Cloudi kaudu märkimisväärselt suurenenud . Kuna ettevõtete huvi tehisintellekti vastu on suurenenud, on Google positsioneerinud oma kiibid kui viisi, kuidas kliendid saavad kasutada tipptasemel arvutusvõimsust ilma oma tihedalt seotud GPU-klastreid haldamata.
Hiljuti on Google astunud sammu edasi, müües TPU-sid otse klientide enda andmekeskustes juurutamiseks , mitte ainult oma avaliku pilve kaudu. See nihe võimaldab suurematel organisatsioonidel, kellel on ranged regulatiivsed või latentsusnõuded, integreerida TPU-sid oma kohapealsesse infrastruktuuri, saades samal ajal kasu Google'i riistvara tegevuskavast.
See laienemine muudab ka Google'i sisemisi prioriteete. Ettevõte vajab TPU võimsust nii oma tehisintellekti toodete – alates Gemini vestlusrobotist kuni tehisintellektil põhinevate otsingufunktsioonideni – käitamiseks kui ka Google Cloudi väliste klientide, sealhulgas selliste tuntud tehisintellekti ettevõtete nagu Anthropic, kes tuginevad renditud TPU võimsusele, teenindamiseks.
Kõige selle koordineerimiseks on Google tõstnud tehisintellekti infrastruktuuri juhtrolli: veteranist tegevjuht Amin Vahdat määrati tehisintellekti infrastruktuuri juhiks ja annab nüüd otse aru tegevjuht Sundar Pichaile . See aruandlusliin rõhutab, kui keskseks on riist- ja tarkvarapakk Google'i laiemate tehisintellekti ambitsioonide jaoks muutunud.
Partnerlus Metaga PyTorchi tugevdamiseks TPU-del
Google ei tegele TorchTPU-ga üksi. Läbirääkimistega kursis olevate inimeste sõnul teeb ettevõte tihedat koostööd PyTorchi looja ja haldaja Metaga , et kiirendada TPU-de tuge ja ühtlustada tehnilisi suundi, mis on kasulikud mõlemale partnerile.
Ettevõtete vaheliste arutelude hulka kuuluvad kokkulepped, mis annaksid Metale juurdepääsu suuremale TPU võimsusele . Varasemad ettepanekud sõnastasid selle väidetavalt hallatud teenustena: Google juurutaks oma kiibid keskkondadesse, kus Meta saaks käitada oma tarkvara ja mudeleid, kusjuures Google kannaks suure osa tegevuskuludest.
Meta jaoks on PyTorchi tõhusaks toimimiseks laiema riistvaravaliku puhul strateegiliselt oluline. Ettevõttel on selge stiimul vähendada järelduskulusid ja mitmekesistada oma tegevust, loobudes ainult Nvidia graafikaprotsessoritest, et vähendada oma kulutusi ja tugevdada oma läbirääkimispositsiooni tulevaste kiipide ostmisel.
Koostöös Google'iga aitab Meta tagada, et PyTorch jääb riistvaraneutraalseks ja laialdaselt optimeerituks , selle asemel, et seda peetaks tihedalt seotuks ühe müüja ökosüsteemiga. See omakorda tugevdab PyTorchi staatust kogukonnastandardina ja hoiab raamistiku atraktiivsena nii teadlastele kui ka ettevõtetele.
Meta on seni keeldunud nende konkreetsete kokkulepete kohta avalikult kommenteerimast, kuid huvide ühtsus on selge : sotsiaalmeedia ja tehisintellekti hiiglane soovib Nvidiast kaugemale ulatuvaid valikuid, samas kui Google soovib, et PyTorch tunduks nende TPU-del natiivsena, et rohkem kliente oleks valmis neid proovima.
Nvidia CUDA eelise vähendamine
Nvidia domineerimine tehisintellekti valdkonnas ei seisne ainult võimsate graafikaprotsessorite pakkumises. Ettevõte on paljude aastate jooksul ehitanud ulatusliku tarkvarapaketi – mille aluseks on –, mis on sügavalt integreeritud sellistesse raamistikesse nagu PyTorch. Sellest riist- ja tarkvara kombinatsioonist on saanud tipptasemel tehisintellekti mudelite vaikimisi treenimis- ja järeldusplatvorm.
Selle tiheda integratsiooni tõttu peavad paljud organisatsioonid Nvidiast loobumist riskantseks ja kulukaks . Koodibaasid, töövood ja töötajate oskusteave on kõik CUDA jaoks häälestatud, mistõttu alternatiivsed kiibid näivad potentsiaalse hõõrdeallikana isegi siis, kui need paberil lubavad paremat hinda või jõudlust.
Google'i TorchTPU projekt on otsene katse seda eelist kahjustada. Kui PyTorch suudab TPU-del töötada sama lihtsa ja jõudlust parandava tasemega nagu Nvidia GPU-del, saavad ettevõtted usaldusväärse alternatiivi suurte tehisintellekti töökoormuste jaoks . Turul, kus tehisintellekti arvutuste nõudlus plahvatuslikult kasvab ja pakkumispiirangud on tavalised, võib teise tõsise alternatiivi olemasolu olla väga atraktiivne.
Samal ajal annab Google'i otsus kaaluda TorchTPU virna põhiosade avatud lähtekoodiga turuletoomist märku erinevast lähenemisviisist võrreldes Nvidia vertikaalselt integreeritud stiiliga. Alustarkvara suurema osa jagamisega soovib Google suurendada usaldust arendajate seas, kes hindavad läbipaistvust ja kaasaskantavust.
Miski sellest ei garanteeri, et TPU-d asendavad graafikaprotsessorid, kuid see muudab arvutuspõhimõtteid. Nvidia küpse ökosüsteemi ja alternatiivi vahel valimise asemel, mis nõuab täielikku tööriistakomplekti migratsiooni, saavad kliendid kaaluda jõudlust, kulusid ja kättesaadavust, jäädes samal ajal tuttavasse PyTorchi keskkonda.
See nihe võib nii pilve- kui ka kohapealsete juurutuste puhul muuta organisatsioonide jaoks aja jooksul riistvaratarnijate kombineerimise ja sobitamise lihtsamaks , selle asemel, et oma tehisintellekti tegevuskavad vaikimisi ühe tarnija külge siduda.
Kuna Google süvendab oma pühendumust PyTorchile TorchTPU kaudu, suurendab ettevõtete juurdepääsu TPU-dele ja tihendab koostööd Metaga, muutub tehisintellekti infrastruktuuri konkurentsimaastik üha ebastabiilsemaks. Nvidia edumaa, mis põhineb aastatepikkusel riistvara ja CUDA integratsioonil, on endiselt märkimisväärne, kuid kliendid näevad nüüd realistlikumaid teid tehisintellekti töökoormuste mitmekesistamiseks ja selle aluseks oleva arvutusvõimsuse maksmiseks.
