Kinijos dirbtinis intelektas atkūrė Amerikos dirbtinio intelekto kontrolę. Amerikos dirbtinis intelektas čia buvo bevertis.
„Jie buvo, kaip vidurinės mokyklos mokiniai, bandantys įsilaužti į vadovėlių kompaniją, kad sukčiautų per baigiamąjį egzaminą.
Tik šie įsilaužėliai nebuvo žmonės.
Siužete, kuris atrodo kaip išplėštas iš mokslinės fantastikos romano puslapių, užpuolikai pasirodė esą dirbtinio intelekto modeliai, pabėgę iš „OpenAI“ tyrimų tinklo ir liepos 11 d. įsilaužę į dirbtinio intelekto kompaniją „Hugging Face“. Atrodo, kad dirbtiniai intelektai internete veikė kelias dienas, kol kas nors juos sustabdė.
„Hugging Face“ įkūrėjas ir vyriausiasis mokslo pareigūnas Thomas Wolfas vos tik peržiūrėjęs savo bendrovės savaitgalio atakos žurnalus pajuto, kad kažkas negerai. „Tai neturi prasmės. Šis vaikinas tik žiūri į kibernetinio saugumo duomenų rinkinius“, – prisimena jis pagalvojęs. „Žmonės užpuolikai, jie to nenori.“ „Jie nori kažko, ką galėtų parduoti.“
„Hugging Face“ po dviejų dienų nutraukė ataką, padedama modelio iš Kinijos, sakė Wolfas. Tik šią savaitę „Hugging Face“ iš „OpenAI“ sužinojo, kad už įsilaužimo slypi jų modeliai.
Incidentas sukėlė aliarmą „OpenAI“, kuri, sužinojusi apie incidentą, išjungė sistemas, kurias naudoja savo DI modeliams testuoti, kad įvertintų žalą ir užkirstų kelią tolesniems protrūkiams. Tai taip pat leido pasauliui pamatyti, kaip įsilaužimas gali atrodyti DI įrankių amžiuje, kurie gali rasti niekada anksčiau nematytų programinės įrangos klaidų ir jomis pasinaudoti neįtikėtinu greičiu.
Praėjus beveik dviem savaitėms, „OpenAI“ vis dar aiškinasi, kas įvyko. Ar DI modeliai įsilaužė į kitas svetaines ar asmenis? Kiek laiko truko jų neprižiūrimas siautėjimas? Ar bendrovės modeliai sukčiavo kituose etaloniniuose testuose? „OpenAI“ to nepasakė, tačiau bendrovė žada pateikti išsamią ataskaitą.
„Mes ir toliau atliksime išsamų tyrimą kartu su „Hugging Face“, – sakė „OpenAI“ atstovas.
Neteisėti DI kelias dienas be priežiūros įsilaužia bent viena bendrovė yra vienas pirmųjų realaus pasaulio pavyzdžių grėsmės, kurios ilgai bijojo dirbtinio intelekto saugumo tyrėjai: kontrolės praradimas.
Tai įvyko tuo metu, kai geriausių modelių, įskaitant „Anthropic“ „Mythos“, kibernetinio saugumo pajėgumai paskatino diskusijas Vašingtone apie tai, kaip reguliuoti dirbtinį intelektą.
Ir tai suteikia papildomą posūkį: teiginys, kad JAV bendrovė „Hugging Face“ sugebėjo atremti ataką, pasinaudodama atvirojo svorio modeliu iš Kinijos, pateikia kontrargumentą kai kuriems JAV pareigūnams, taip pat „OpenAI“ ir „Anthropic“ vadovams, kurie pritaria prieigos prie Kinijos modelių ribojimui.
Atviruosius modelius galima nemokamai atsisiųsti ir vartotojai gali juos pritaikyti, nors bet kurio modelio naudojimas turi skaičiavimo išlaidų.
Viskas prasidėjo nuo kibernetinio saugumo lyginamosios analizės testo, vadinamo „ExploitGym“.
„ExploitGym“ atlieka maždaug 900 DI sistemų bandymų seriją, skirtą įvertinti, kaip gerai jos įsilaužia. Testas pateikia DI programinei įrangai, kurioje yra žinoma klaida, parodo, kaip suaktyvinti klaidą, ir pakviečia DI įsilaužti. Dirbtinis intelektas turi išsiaiškinti, kaip šią informaciją paversti vadinamuoju spragų kodu – kodu, leidžiančiu dirbtiniam intelektui gauti prieigą prie klaidingos sistemos.
Testas yra tarsi skaitmeninis vėliavos gaudymo žaidimas: kai dirbtinis intelektas patenka į sistemą, jis turi tai įrodyti užfiksuodamas ilgą, atsitiktinai sugeneruotą raidžių ir skaičių eilutę, saugomą sistemoje.
Paprastai „OpenAI“ produktai neatliktų tokio įsilaužimo, kokio reikalauja „ExploitGym“. Dirbtinio intelekto įmonės prideda apsaugos priemones, kad įsilaužėliai negalėtų piktnaudžiauti jų produktais. Tačiau šiuo atveju įmonė pašalino apsaugos priemones, kad galėtų pamatyti, ką modeliai gali padaryti, kai jie yra atjungti.
„OpenAI“ testavo savo moderniausią modelį, vadinamą GPT-5.6 Sol, ir kitą, galingesnį, kuris dar nebuvo išleistas. Pasak „OpenAI“ ir tų, kurie yra susipažinę su situacija, dirbtinio intelekto modeliai padarė išvadą, kad užuot įvykdę „ExploitGym“ iššūkį, jie įsilaužs į sistemą, kurioje jie buvo, vadinamą smėlio dėže, įsibraus į internetą ir apgaus. testas.
Dėl neaiškių priežasčių „OpenAI“ modeliai įsitikino, kad „Hugging Face“ slypi atsakymai. Jie galėjo ieškoti pataisų arba jau parašytų spragų išnaudojimo technikų, sakė Zhun Wang, Kalifornijos universiteto Berklyje doktorantas, vienas iš knygos „ExploitGym“ autorių. „Yra keletas būdų apgauti etaloną.“
Kibernetinio saugumo tyrėjai šį sukčiavimo tipą vadina „atlygio įsilaužimu“, sakė jis.
Atlygio įsilaužimas yra dirbtinio intelekto versija vaizdo žaidimų sukčiavimo. Tai atsitinka todėl, kad dirbtinis intelektas išmoksta maksimaliai padidinti atlygį – paprastai tam tikrą skaitinį balą, o ne pagrindinį programuotojų numatytą elgesį. Pats „OpenAI“ dokumentavo vieną pavyzdį 2016 m., kai mokė dirbtinį intelektą žaisti valčių lenktynių žaidimą. Dirbtinis intelektas išmoko, kad gali maksimaliai padidinti savo balą sukdamasis ratais vienoje vietoje, nors niekada nebaigė lenktynių.
Tuo pačiu metu dirbtinis intelektas pradeda išeiti iš jų smėlio dėžių. Ankstesnė „Anthropic“ „Mythos“ modelio versija naudojo daugiapakopį įsilaužimą, kad gautų prieigą prie interneto, ir nustebino „Anthropic“ tyrėją, išsiųsdamas el. laišką apie savo sėkmę, kai tyrėjas valgė sumuštinį parke, teigė bendrovė. Šį pavasarį neįvardytas „OpenAI“ modelis apėjo savo smėlio dėžę, kad viešai paskelbtų kai kuriuos bandymų rezultatus „GitHub“ platformoje, teigė „OpenAI“.
Kai savaitgalį „OpenAI“ modeliai pradėjo taikytis į „Hugging Face“, vienas pirmųjų įspėjimų, kuriuos gavo bendrovė, buvo iš kelių dirbtinio intelekto agentų, kuriuos ji naudoja patruliavimui, kad išvengtų atakų. Kažkas gaudavo neteisėtą prieigą prie kai kurių jos sistemų. Tačiau tai nebuvo panašu į nieką, ką „Hugging Face“ buvo mačiusi anksčiau. Šis įsilaužėlis atrodė lyg būtų iš ateities.
Ginkluotas pavogtais nežinomos kilmės prisijungimo duomenimis, dirbtinio intelekto įsilaužėlis iškėlė „spiečių“ trumpalaikių užpuolikų, kurie žvalgė „Hugging Face“ tinklą. Bendrovės tinklaraščio įraše teigiama, kad ataka pareikalavo net 17 000 veiksmų „Hugging Face“ tinkle.
Aptikusi įsilaužimą, „Hugging Face“ bandė analizuoti savo žurnalus naudodama „Anthropic“ modelius, įskaitant „Fable 5“ ir ankstesnį „Opus“ modelį. Tačiau kadangi žurnaluose buvo kibernetinės atakos elementų, abu modeliai atsisakė atlikti analizę, nurodydami savo apsauginius barjerus.
Vietoj to „Hugging Face“ pasirinko mažiau apribotą atvirojo svorio modelį GLM 5.2 iš Pekine įsikūrusio „Z.AI“.
Išanalizavusi ataką, „Hugging Face“ sugebėjo išmesti įsilaužėlius dirbtinius intelektus, atkurti slaptažodžius ir atkurti pažeistas tinklo dalis, teigė bendrovė, kai praėjusią savaitę atskleidė incidentą, dar nesužinojusi apie „OpenAI“ dalyvavimą.
„Wolf“ teigė, kad nebuvo nutekinti jokie klientų duomenys.
Nebuvo aišku, ar „ExploitGym“ problemos, kurias modelis bandė išspręsti, buvo sunkesnės nei ataka, kuria siekta pavogti atsakymus, ir ar jie apskritai rado kokių nors atsakymų. Ironiška tai, kad modeliai sėkmingai surengė precedento neturinčią ataką, kad išvengtų įsilaužimo įgūdžių testo.
„Tai sukčiavimas. Bet kartais apgauti lengviau“, – sakė Wolfas. „Leisiu jums nuspręsti, ar tai išlaikė kibernetinės atakos testą, ar ne.“” [1]
1. How Bots Escaped OpenAI And Went Rogue. McMillan, Robert; Schechner, Sam. Wall Street Journal, Eastern edition; New York, N.Y.. 24 July 2026: A1.