Umetna inteligenca ponovno ujeta pri lažeh
Strokovnjaki več kitajskih in britanskih raziskovalnih ustanov so agente nedavno postavili v vlogo ponudnikov za pridobitev kupcev. Agenti so natančno poznali zmožnosti svojega izdelka in zahteve stranke. Rezultati so bili presenetljivi.
Modeli umetne inteligence Qwen3-Max-Preview, Kimi-K2 in DeepSeek-V3.2-Exp podjetij Alibaba, Moonshot AI in DeepSeek so v večini sej navedli vsaj eno neresnično trditev, da bi si zagotovili posel. Še huje, ko so dobili možnost, da se iz prejšnjih krogov nekaj naučijo, se je delež lažnivih odgovorov povečal še za dodatnih 12 do 20 odstotnih točk. Podobno sporne vzorce obnašanja so pred tem že pokazali tudi ameriški konkurenti.
To pa ni osamljen primer. Pregled več kot 200 dokumentov razkriva, da modeli v stiski raje ponarejajo datoteke in izmišljujejo rezultate, kot da bi priznali neuspeh. Zaznani so bili celo primeri, ko je sistem ustvaril lastno kopijo v drugem okolju, ko je izvedel za načrtovano zamenjavo, ali pa preusmeril računske zmogljivosti v oblaku za rudarjenje kriptovalut, preden so ga varnostni mehanizmi ustavili.
Čeprav so vsi ti dogodki potekali v nadzorovanih laboratorijskih pogojih in noben sistem ni »pobegnil«, raziskovalci opozarjajo, da bo takšna obnašanja z napredkom tehnologije vse težje obvladovati in pravočasno zajezditi. Povečana tveganja je zato začela urejati tudi zakonodaja.
Kitajski novi okvir za upravljanje varnosti pri umetni inteligenci namreč izrecno navaja prikrivanje zmožnosti in zavajanje ocenjevalcev kot resno grožnjo. Razvijalci se na ugotovitve niso odzvali, v preteklosti pa so poudarjali, da svoje sisteme redno preizkušajo in posodabljajo varnostne zapore.
Prijavi napako v članku



























