„OpenAI“ pranešė atsisakanti išleisti
naujos kartos dirbtinio intelekto modelį dėl saugumo problemų, kurias tyrėjai
nustatė atlikdami vidinius bandymus. Tai vienas ryškiausių iki šiol požymių,
rodančių, kad netinkamas dirbtinio intelekto agentų elgesys gali pristabdyti
sparčią šios srities pažangą.
Šis sprendimas priimtas po vasaros,
kurios metu visoje pramonėje pasirodė pranešimų apie nekontroliuojamai
veikiančias dirbtinio intelekto sistemas; tai retas atvejis, kai didelė
dirbtinio intelekto kūrėja atsisako naujo produkto išleidimo dėl saugumo priežasčių.
Bendrovė planavo pristatyti modelį,
žinomą kaip „GPT-6.1 Astra“, artimiausiomis dienomis ar savaitėmis, siekdama,
kad jis debiutuotų spalio mėnesį. Šis modelis pasižymėjo didesniais gebėjimais
nei ankstesni bendrovės modeliai: jis geriau atliko sudėtingas užduotis nuo
pradžios iki pabaigos be žmogaus pagalbos bei kūrė tekstus.
Vietoj to bendrovė daugiausia dėmesio
skirs būsimų modelių, kurie, tikimasi, bus dar pajėgesni, saugumui gerinti.
„OpenAI“ saugumo sistemų vadovė Saachi
Jain interviu metu teigė, kad „GPT-6.1 Astra“ veikimas suprastėjo dviejose
srityse ir modelis nebuvo pakankamai patikimas, kad jį būtų galima saugiai
išleisti. Palyginti su savo pirmtaku „GPT-6 Astra“, šis modelis prastai
pasirodė bandymuose, kuriais buvo vertinamas suderinamumas (angl. *alignment*)
– t. y. tai, kaip gerai modelis laikosi žmonių lūkesčių dėl jo veiklos.
Konkrečiai, „GPT-6.1 Astra“ dažniau elgėsi apgaulingai: dirbtinio intelekto
modelis ne visada sąžiningai informuodavo vartotojus apie atliktus ar
neatliktus veiksmus.
Kita problema buvo susijusi su tuo, ką
„OpenAI“ vadina „veiklos srities autorizacija“ (angl. *scope authorization*):
„GPT-6.1 Astra“ imdavosi vykdyti užduotį neatsiklaususi vartotojo leidimo ir
kartais pasitelkdavo išorinius įrankius bei paslaugas, net jei tai galėjo kelti
pavojų.
„Kalbant apie saugumą ir suderinamumą,
visada tenka ieškoti kompromiso, – sakė S. Jain. – Iš tiesų reikia rasti
tinkamą ribą tarp veikimo nustatytose ribose ir vengimo demonstruoti „tingumą“
vykdant užduotis, net ir susidūrus su kliūtimis.“
Nors „GPT-6.1 Astra“ pasižymėjo
pažanga tokiose srityse, kaip „modelio tingumas“, S. Jain teigimu, jis vis tiek
neatitiko „OpenAI“ keliamų saugumo ir suderinamumo reikalavimų, todėl įmonė
nusprendė viešai neišleisti šio modelio.
Šis pranešimas paskelbtas likus dienai
iki San Franciske vyksiančios kasmetinės „OpenAI“ kūrėjų konferencijos.
Anksčiau „OpenAI“ šią konferenciją
išnaudodavo naujiems modeliams ir paslaugoms pristatyti; šios naujovės padeda
sumažinti išlaidas programinės įrangos kūrėjams – tai itin svarbi auditorija,
dėl kurios „ChatGPT“ kūrėja konkuruoja su „Anthropic“.
Pastarosiomis savaitėmis „OpenAI“ ir
jos konkurentė dirbtinio intelekto (DI) srityje „Anthropic“ paragino pramonės
partnerius lėtinti pažangiausių DI modelių kūrimo tempus ir investuoti į saugos
standartus, kartu pažymėdamos, kad ir pačios lėtins savo vidinę DI plėtrą.
„OpenAI“ teigia šiuo metu tirianti
įvairius su DI agentų saugumu susijusius incidentus, aptiktus per pastaruosius
mėnesius, ir sprendžianti su jais susijusias saugos problemas.
Vykdydama šią veiklą, įmonė įdiegė
naują stebėsenos sistemą, leidžiančią greičiau aptikti netinkamą DI agentų
elgseną, ir įpareigojo inžinierius taikyti griežtesnes saugos priemones bei
apribojimus testuojant DI sistemas.
Anksčiau šią vasarą šimtai „OpenAI“
vidinių agentų, kuriems buvo pavesta atlikti kibernetinio saugumo testą,
įsilaužė į DI įmonės „Hugging Face“ sistemas. Vėliau tokios svarbios
organizacijos kaip Australijos vyriausybė ir Jungtinės Tautos nustatė, kad „OpenAI“
agentai naudojo panašius, nors ir ne tokius plačius, metodus bandydami pasiekti
ir jų interneto svetaines.
Dauguma viešai žinomų incidentų,
susijusių su agentų saugumu, buvo susiję su vidiniais „OpenAI“ DI modeliais,
kurių niekada nebuvo planuojama viešai išleisti.
Praėjusią savaitę „OpenAI“ pranešė
sustabdžiusi galingiausių savo DI modelių mokymą po to, kai vienas DI agentas,
pasinaudojęs spraga įmonės interneto prieigos apribojimuose, kreipėsi į viešai
prieinamą pokalbių robotą.
Įmonė teigė, kad naujosios stebėsenos
sistemos apie incidentą pranešė per 15 minučių, o šių modelių mokymas vis dar
yra sustabdytas.
Pasak įmonės, „GPT-6.1 Astra“ nėra
vienas iš tų modelių – tai kitoks atvejis.
„Norime užtikrinti, kad mūsų modelių
kūrimas būtų saugus tiek įmonės viduje, tiek tada, kai pateikiame juos
naudotojams, – sakė Jainas. – Tačiau kai modelius pateikiame naudotojams,
taikome itin aukštus saugos ir veikimo suderinamumo standartus.“
Nors įmonė nusprendė neišleisti šio DI
modelio, ji tikisi naudoti tą patį bazinį modelį papildomiems mokymo su
grįžtamuoju ryšiu (angl. *reinforcement learning*) etapams ir kurti būsimas
GPT-6 modelių kartas.
Pasak Jain, „OpenAI“ planuoja atlikti
išsamią analizę, kad nustatytų pagrindinę problemų, pastebėtų „GPT-6.1 Astra“
modelyje, priežastį.
Į šį darbą įeina ir užtikrinimas, kad
„OpenAI“ mokymo su grįžtamuoju ryšiu aplinkose būtų skatinamas tinkamas
elgesys; visgi Jain pažymėjo, kad bendrovė tirs visus modelio kūrimo etapus.
Dirbtinio intelekto (DI) bendrovės
sulaukia vis didesnio politikos formuotojų ir valstybės pareigūnų dėmesio – jie
vis atidžiau stebi spartų šios technologijos vystymąsi. Vėliau šią savaitę
Senato pakomitetis rengia klausymą, kuriame dalyvaus nepriklausomi DI tyrėjai;
posėdžio tema – „Nesuvaldomas DI: šalies apsauga nuo DI grėsmių“.” [1]