- LiteRT-LM pakub suure jõudlusega orkestreerimiskihti, mis võimaldab Gemma 4 mudelitel tõhusalt töötada servariistvaral, näiteks Raspberry Pi-l.
- Segatud täpsusega kvantimise kasutamine vähendab oluliselt mälukasutust, võimaldades keerukatel LLM-idel töötada vaid 0.8 GB muutmäluga.
- Riistvaraline kiirendus XNNPACKi ja eksperimentaalse WebGPU toe kaudu koos peatselt ilmuva Hailo AI HAT integratsiooniga optimeerib järelduste kiirust.
- Isetervendava püsivara rakendamine kahe panga värskendustega tagab, et OTA tehisintellekti juurutused jäävad tootmises stabiilseks ja vastupidavaks.

Kas oled kunagi mõelnud, kas suudaksid mahutada tohutu keelemudeli võimsuse pisikesele peopessa mahtuvale tahvlile? Unistus keeruka GenAI viimisest servani on lõpuks teoks saanud tänu Raspberry Pi ja Google'i uusimate tehisintellekti tööriistade sünergiale. Me räägime maailmast, kus teie IoT-seadmed ei järgi lihtsalt lihtsaid skripte, vaid saavad aru ja genereerivad inimlaadset teksti ilma pideva pilveühenduseta.
Selle sujuvaks toimimiseks on vaja kindlat pinu: Raspberry Pi riistvara, LiteRT käitusaja efektiivsust ja Gemma 4 perekonna intelligentsust. Neid kombineerides saavad arendajad luua privaatseid, väikese latentsusega rakendusi , mis töötlevad andmeid lokaalselt, tagades, et tundlik teave ei lahku kunagi seadmest, säilitades samal ajal optimeeritud riistvarakiirenduse abil sujuva kasutuskogemuse.
LiteRT-LM ja Gemma 4 ökosüsteemi lahtipakkimine

Selle operatsiooni keskmes on LiteRT-LM , mis toimib suure jõudlusega orkestreerimiskihina. See pole lihtsalt ümbris; see on loodud platvormideüleseks teostuseks , mis tähendab, et see saab hakkama suurte keelemudelite (LLM) käitamise raske koormusega Androidi, iOS-i, veebi- ja IoT-platvormidel. Neile, kes sukelduvad Gemma 4, täpsemalt E2B variandi juurde , on efektiivsus hämmastav. Google kasutab nutikat segatud täpsusega kvantimisskeemi (2-bitiste, 4-bitiste ja 8-bitiste kaalude segamine), mis võimaldab mudeli kaalujalajälge vähendada kuni 0.8 GB-ni , muutes selle ideaalseks servaseadmete piiratud RAM-i jaoks.
LiteRT-LM läheb lihtsast teksti genereerimisest kaugemale, toetades multimodaalsust , võimaldades visuaalseid ja helisisestusi. See tutvustab ka funktsioonide kutsumist , mis muudab agentide töövoogude loomisel mängu . Lihtsalt vestlemise asemel saab tehisintellekt käivitada konkreetseid tööriistu või API-sid reaalsete ülesannete täitmiseks. Lisaks on mitme märgiga ennustuse (MTP) koostajate kasutuselevõtt suurendanud järelduste kiirust kuni 3 korda , vähendades oluliselt aega, mida kasutajad vastuse ootamisele kulutavad.
Samm-sammult: Gemma 4 juurutamine Raspberry Pi 5-le

Omaenda AI-jõujaama seadistamine on lihtsam, kui see esmapilgul tundub. Esmalt peate oma riistvara ette valmistama. Raspberry Pi Imageri abil on soovitatav installida Raspberry Pi operatsioonisüsteemi 64-bitine versioon Raspberry Pi 5-le. Kui teie operatsioonisüsteem on installitud ja olete oma plaadiga SSH-ühenduse loonud , saate kontrollida, kas teie arhitektuur on aarch64, et tagada ühilduvus AI binaarfailidega.
Tarkvaraline pool hõlmab mõnda olulist tööriista. Keeruliste keskkonnahalduritega maadlemise asemel on tehisintellekti keskkondade haldamiseks parim viis kasutada uv-i . Pärast uv-i installimist saate seadistada Python 3.13 virtuaalse keskkonna ja installida paketi litert-cli-nightly . Mudeli tegelikuks tõmbamiseks vajate Hugging Face'i lugemistokenit . Kui see on olemas, saab lihtsa käsuga, näiteks litert lm run, gemma-4-E2B-it mudeli otse kogukonna hoidlast tõmmata ja sekunditega kohaliku vestluse alustada.
Piiride nihutamine: riistvaraline kiirendus ja MLOps

Kuigi protsessor teeb suurema osa tööst XNNPACK delegaadi kaudu , on olemas eksperimentaalne tugi GPU kiirendusele. Raspberry Pi 5-l saavutatakse see avatud lähtekoodiga V3DV Vulkani draiveri kaudu . Keskkonnamuutuja V3D_WEBGPU_OVERRIDE=1 seadistamisega saate kasutada WebGPU-d. Siiski väärib märkimist, et praegu edestab protsessor nende konkreetsete töökoormuste puhul sageli GPU-d , kuid alus tulevasteks saavutusteks on olemas, eriti seoses Hailo tehisintellekti kiirendite eelseisva integreerimisega AI HAT+ kaudu.
Lisaks esialgsele seadistamisele muutub keeruliseks nende seadmete kohapealne hooldamine. Siin tuleb mängu isetervendava püsivara kontseptsioon. OTA-uuenduste ajal kardetud „lõpmatu käivitustsükli“ vältimiseks kasutavad tänapäevased meeskonnad kahepartitsioonilist mälu (Bank A ja Bank B ). Seade testib uut tehisintellekti kasulikku koormust katsefaasis; kui see käivitab mälulekke või ei suuda RTOS-i tähtaegu täita , naaseb käivituslaadur automaatselt teadaolevalt toimiva püsivara juurde . See hoiab ära kulukad füüsilised hooldusreisid ja tagab teie serva-tehisintellekti vastupidavuse.

LiteRT käitusaja efektiivsuse ja Gemma 4 kompaktse suuruse ühendus muudab Raspberry Pi harrastusarvutist professionaalseks Edge AI serveriks . Kasutades selliseid tööriistu nagu LiteRT CLI, segatud täpsusega kvantiseerimine ja vastupidavad püsivara strateegiad, saavad arendajad nüüd juurutada agentlikku, multimodaalset tehisintellekti , mis töötab täielikult võrguühenduseta, sillutades teed uue põlvkonna nutikatele ja iseseisvatele manussüsteemidele.