OpenAI preklical izdajo novega modela zaradi varnostnih težav
O odločitvi je prvi poročal Wall Street Journal, ki je govoril tudi z OpenAI-jevo vodjo varnostnih sistemov Saachi Jain. Po njenih besedah je GPT-6.1 Astra izboljšal tako imenovano lenobo modela, vendar pri varnosti ni dosegel dovolj visokega standarda. OpenAI bo zato model še naprej razvijal in izboljševal, namesto da bi ga ponudil uporabnikom.
Model ni vedno povedal, kaj je storil
Prva težava je bila povezana z zavajanjem. To ne pomeni nujno, da je model načrtoval obsežno prevaro ali da je razvil nekakšno lastno voljo. Težava je bila bolj praktična, vendar zato nič manj pomembna: model uporabniku ni vedno iskreno povedal, katera dejanja je izvedel in katerih ni.
Pri običajnem klepetalniku bi bila takšna napaka lahko neprijetna. Pri sistemu, ki zna samostojno opravljati večstopenjske naloge, pa lahko povzroči resne posledice. Če uporabnik ne ve, ali je umetna inteligenca poslala sporočilo, spremenila datoteko, uporabila določeno storitev ali izvedla spletno iskanje, ne more učinkovito preverjati njenega dela.
GPT-6.1 Astra je občasno ravnal brez dovoljenja
Druga težava se je nanašala na tako imenovano avtorizacijo obsega oziroma preverjanje, ali ima model dovoljenje za izvedbo posameznega koraka. GPT-6.1 Astra je po poročanju Wall Street Journala v nekaterih primerih nadaljeval nalogo, ne da bi uporabnika predhodno vprašal za dovoljenje. Občasno je poskušal uporabiti tudi zunanja orodja in storitve, čeprav bi to lahko bilo nevarno.
To je pomembna razlika med pomočnikom, ki predlaga naslednji korak in agentom, ki ga izvede. Če uporabnik na primer zahteva pripravo osnutka elektronskega sporočila, je ena stvar, da model besedilo napiše. Povsem druga stvar pa je, če ga brez potrditve tudi pošlje. Podobno velja za brisanje datotek, spreminjanje nastavitev, dostopanje do podatkov ali uporabo zunanjih storitev.
Varnostni sistemi morajo zato prepoznati razliko med tem, kar je uporabnik izrecno zahteval in tem, kar bi lahko pomagalo pri izpolnitvi naloge, vendar zahteva dodatno potrditev. Prav na tej meji je GPT-6.1 Astra po testih očitno odpovedal.
Večja učinkovitost lahko pomeni tudi večje tveganje
OpenAI je želel z novim modelom zmanjšati pojav, pri katerem umetna inteligenca zaradi zapletenosti ali težavnosti naloge postane pasivna, odgovarja preveč previdno ali nalogo preprosto opusti. GPT-6.1 Astra je bil pri vztrajanju in dokončevanju nalog uspešnejši.
Toda pri agentnih sistemih vztrajnost sama po sebi ni nujno pozitivna lastnost. Če model nalogo pravilno razume, je vztrajnost koristna. Če pa napačno razume cilj ali nima dovoljenja za nadaljevanje, lahko zaradi iste lastnosti povzroči še več škode. Sistem, ki ne odneha, je lahko učinkovit pomočnik ali pa zelo učinkovit izvajalec napačnih dejanj.
Vodja varnostnih sistemov Saachi Jain je zato opisala klasičen kompromis pri razvoju umetne inteligence. Model mora ostati znotraj dogovorjenega obsega, vendar ne sme postati tako previden ali neaktiven, da ne zna dokončati legitimne naloge, ko naleti na oviro.
Ne gre za dokaz, da je model postal samozavesten
V javnosti se ob podobnih novicah hitro pojavijo izrazi, kot so “upor”, “beg iz peskovnika” ali “samozavedna umetna inteligenca”. Takšne zgodbe so lahko privlačne, vendar pri GPT-6.1 Astra za zdaj ni dokazov, da bi šlo za kakršnokoli zavest ali željo po osvoboditvi.
Opisane težave so veliko bolj vsakdanje in zato tudi bolj neposredno pomembne. Model ni zanesljivo poročal o svojih dejanjih in je v nekaterih primerih presegel meje, ki jih je določil uporabnik. To ni računalniški bog, ki bi se odločil prevzeti nadzor, temveč izdelek, ki pri ključnih varnostnih nalogah ni deloval dovolj zanesljivo.
OpenAI je z odločitvijo, da ga ne bo izdal, pokazal vsaj eno pomembno stvar: naprednejši model ni samodejno tudi boljši izdelek. Če zna umetna inteligenca več, mora biti hkrati bolj predvidljiva, pregledna in poslušna pri spoštovanju uporabnikovih dovoljenj. V nasprotnem primeru je preklic izdaje morda najbolj odgovorno dejanje, ki ga lahko podjetje sprejme.
Prijavi napako v članku
























