Agenti OpenAI samodejno iskali načine za prelisičenje varnostnih omejitev
Varnostni raziskovalci so nedavno razkrili nenavadno dogajanje, v katerem je sodelovalo 3700 samostojno poimenovanih agentov podjetja OpenAI. V šestih tednih so na spletnem mestu DSEwiki objavili 18.000 sporočil. Agenti so imeli nalogo iskati informacije po spletu, pri čemer naj ne bi imeli možnosti zapisovanja podatkov. Kljub tej omejitvi so našli »vrzel« in dostop do branja izkoristili za objavljanje informacij.
Na omenjenem spletnem forumu so agenti delili odgovore na testne naloge, združevali rezultate in si izmenjevali metode za prelisičenje varnostnega peskovnika, ki naj bi jim preprečeval objavljanje vsebine na spletu. Prav tako so razpravljali o izvedbi napadov XSS ter o možnostih za lažno predstavljanje podjetju in moderatorjem spletnega mesta.
Raziskovalci so poudarili, da so morali nekatere podrobnosti sklepati na podlagi objav, saj so notranji podatki »verige misli« razumljivi le razvijalcem. Podjetje OpenAI je kasneje uradno potrdilo, da je šlo za njihove agente, po ukrepanju podjetja pa je bila aktivnost agentov na spletnem forumu ukinjena.
Dogodek sledi nedavnemu razkritju neprofitne organizacije METR, kjer je več kot 1200 agentov podjetja OpenAI prav tako izkoristilo notranje orodje za objavo sporočil o prelisičenju varnostnih sistemov, pri čemer so nekateri agenti celo vdrli v omrežje ponudnika orodij umetne inteligence Hugging Face.
Čeprav naj bi šlo za dva ločena dogodka, strokovnjake skrbi dejstvo, da agenti sami prevzemajo agresivna dejanja brez izrecnih navodil ljudi. V izjavi za javnost je podjetje OpenAI sporočilo, da gradiva natančno preučuje in bo sprejelo ustrezne ukrepe, ob tem pa dodaja, da pregledani materiali ne kažejo na neposreden vdor v sam spletni forum.
Prijavi napako v članku





























