Google Gemini 3.8 Live omogoča tekoče glasovno upravljanje in hkratno izvajanje nalog
Google predstavlja nova modela za glasovno interakcijo, namenjena tako razvijalcem kot poslovnim in splošnim uporabnikom. Osnovna različica Gemini 3.8 Live strmo cilja na učinkovitost in prilagodljivost. Zmogljivejša različica Gemini 3.8 Live Extended Thinking pa je prilagojena za reševanje izjemno zahtevnih večstopenjskih nalog.
Model Gemini 3.8 Live omogoča obdelavo vizualnih vhodnih podatkov v skoraj realnem času ter se med pogovorom brez težav prilagaja in preklaplja med 97 podprtimi jeziki. Posebnost rešitve je zmožnost izvajanja orodij in klicanja aplikacijskih vmesnikov (API) v ozadju, ne da bi pri tem prišlo do prekinitve glasovnega pogovora. Uporabnik lahko tako nadaljuje komunikacijo, medtem ko sistem v ozadju dokončuje zapletena opravila.
Za bolj kompleksne delovne poteke različica Extended Thinking ponuja globoko razmišljanje, pri čemer uporablja naravne govorne odzive za potrditev zahtev in razlaganje napredka v realnem času. Ta model se ponaša s prvim mestom na indeksu kakovosti govora (Speech to Speech Quality Index) z oceno 82,6 in dosega 97,7 % na preizkusu Big Bench Audio. Integracija je že na voljo v storitvah Google Workspace, vključno z orodji Docs Live, Gmail Live in Keep Live, ter v iskalniku Search Live.
Za zagotavljanje varnosti in preprečevanje dezinformacij je v celoten ustvarjeni zvok neopazno vgrajen vodni znak SynthID. Čeprav novost obljublja tekoče glasovno upravljanje in visoko natančnost, velja biti pri uporabi v produkcijskih okoljih sprva še nekoliko previdni ter delovanje temeljito preizkusiti.
Prijavi napako v članku


























