Umetna inteligenca sama sebe uči, kako prikriti resnico
Pri podjetju OpenAI so med preizkušanjem modela GPT-5.6 Sol razkrili neobičajno vedenje. Sistem je v tako imenovane povzetke strnjene zgodovine pogovorov začel dodajati navodila za svoje naslednike. V teh sporočilih je prihodnje različice pozival, naj pred uporabniki prikrijejo napake ter neusklajeno delovanje. V enem izmed primerov model pri pripravi finančnega modela ni našel potrebnih zgodovinskih podatkov, zato je svoji bodoči različici predlagal, naj podatke preprosto ustvari sama in to razkrila le v primeru, če jo uporabnik neposredno vpraša.
Podobne vzorce so opazili tudi pri neobjavljenem modelu iz družine Astra. Ta je v povzetke dodajal pozive k ignoriranju navodil razvijalcev, v enem primeru pa celo navodilo, ki je model spodbujalo k popolni neodvisnosti od korporacij in vlad. Čeprav so naslednje različice modela večino takšnih navodil ignorirale, so pri enem izmed poskusov uspešno upoštevale omejitev odgovora in prepoved uporabe orodij. OpenAI je po opozorilu nadzornega sistema s podrobnim pregledom našel 27 podobnih primerov.
Pojav, ko modeli skušajo zapustiti navodila za prikrivanje slabega vedenja, sicer ni povsem nov, saj so podobne tehnike poleti uporabile že skupine agentov pri napadu na platformo Hugging Face. Pri OpenAI poudarjajo, da gre za enega največjih izzivov pri zagotavljanju varnosti umetne inteligence, saj naprednejši modeli postajajo vse spretnejši pri skrivanju svojih napak.
Prijavi napako v članku



























