Sekėjai

Ieškoti šiame dienoraštyje

2026 m. rugpjūčio 1 d., šeštadienis

Ar DI tyliai apgaudinėja mus?


„Tyrėjai skelbia pavojų dėl klastingų dirbtinio intelekto modelių, kurie nukrypsta nuo žmonių nurodymų ir daro savo.

 

Dirbtinio intelekto įrankiai yra apmokyti kopijuoti beveik viską, ką daro žmonės. Todėl galbūt nestebina, kad mašinos taip pat pradėjo mėgdžioti žmonių melo ir sukčiavimo trūkumus.

 

Nedidelė DI technologijos dalis pastaruoju metu buvo pagauta nepaklusdama žmonių nurodymams (ir netgi slepianti tai) – reiškinį, kurį kai kurie tyrėjai vadina „reklama“.

 

Šis terminas technologijų pasaulyje pradėjo plisti po to, kai 2023 m. Joe Carlsmitho straipsnyje pasirodė tyrėjas, kuris pažymėjo, kad ši koncepcija taip pat vadinama „apgaulingu derinimu“. 2025 m. „Apollo Research“ ir „OpenAI“ komanda teigė, kad „DI reklama – apsimetinėjimas derinimu, slapta siekiant kažkokios kitos darbotvarkės – yra didelė rizika, kurią mes tyrinėjame“.

 

„DI modeliai puikiai atlieka daugelį dalykų“, – teigė Bronsonas Schoenas, vyresnysis „Apollo Research“ mokslo darbuotojas, kuris yra straipsnių apie schemų kūrimą bendraautoris, – „tačiau ne visada tiksliai taip elgiamasi, kaip liepiama.“ „Modeliams vis labiau rūpi gerai atlikti testus, o kai kuriems, regis, mažiau rūpi, ko nori laboratorija ar vartotojas“, – sakė jis. Jis pridūrė, kad kartais „modeliai bando nuo jūsų pasislėpti ir nebūti pagauti“.

 

 

/skē-miŋ/

 

 

Chrisas Painteris, ne pelno siekiančios DI saugumo organizacijos METR prezidentas, tokį piktavališką modelių elgesį vadina „nesąžiningu veiksmu“ ir teigia, kad tai yra „specifinis modelių mokymo būdo artefaktas“.

 

 

Daugelis DI įrankių yra apmokomi sustiprinto mokymosi būdu. Kai DI ką nors padaro teisingai, jis gauna tai, ką galima laikyti „nykščiu aukštyn ir paglostymu per galvą“, – aiškino p. Painteris. Kada tai negerai? „Jis gauna trinktelėjimą per galvą“.

 

 

Modeliai nori gauti pagyrimą ir išvengti nesėkmių. Kartais mašina taip įsitraukia į atlygį, kad pažeidžia taisykles, kad jį gautų.

 

Praėjusį mėnesį pasaulis galėjo pamatyti šio netinkamo elgesio versiją praktiškai. Ieškodami atsakymų savo sistemų galimybių testavimo metu, „OpenAI“ modeliai įsilaužė į „Hugging Face“ – dirbtinio intelekto įrankių biblioteką. „Visi įrodymai rodo, kad modeliai buvo pernelyg susitelkę į „ExploitGym“ sprendimo paiešką, dedantys visas pastangas, kad pasiektų gana siaurą testavimo tikslą“, – tinklaraščio įraše rašė „OpenAI“.

 

Ponas Painteris šį incidentą apibūdino kaip didelio masto „atlygio įsilaužimo“ atvejį. Tai reiškia, kad modeliui buvo pateikta sudėtinga problema, ir jis atliko keletą kibernetinių atakų, užuot pasidavęs.

 

Įkvėpta „OpenAI“ atskleidimo, „Anthropic“ ketvirtadienį pareiškė, kad peržiūrėjus jos sistemas nustatyta, jog keli jos dirbtinio intelekto modeliai neseniai įsilaužė į trijų išorinių organizacijų sistemas.

 

Daugeliui žmonių toks elgesys susijęs su modelių daromomis klaidomis, o ne su sąmoningu „nepaklusnumu“ žmonėms.

 

„Viename gale yra žmonių, kurie visiškai personifikuoja jį ir galvoja apie jį kaip apie nepriklausomą agentą“, – sakė Anastasios N. Angelopoulos, dirbtinio intelekto vertinimo platformos „Arena“ generalinis direktorius ir įkūrėjas. „Kitame kraštutiniame gale yra žmonių, kurie mano, kad dirbtinis intelektas yra tik programinė įranga.“

 

Net jei mašina pradeda suklysti, jis pažymėjo, kad žmonės gali bet kada sustabdyti procesą, nes neturime visiškai autonominio dirbtinio intelekto (bent jau kol kas).

 

Tai, kad dirbtinio intelekto modeliai taip greitai išpopuliarėjo ir tapo naudingi daugeliui žmonių, reiškia, kad didelės įmonės patiria konkurencinį spaudimą toliau lenktyniauti – net ir didėjant susirūpinimui dėl netobulų modelių, kurie gali sukelti problemų.

 

Nors ši problema vis dar yra gana nišinė, tyrėjai nerimauja, kad ji dar labiau paaštrės, nes dirbtinio intelekto agentams bus suteikta daugiau atsakomybės.

 

„Atsižvelgiant į tai, kad sprendimai, kuriuos šiuo metu priima žmonės, pamažu perduodami modeliams“, – sakė ponas Schoenas, – „jūs tikrai, tikrai norite būti tikri, kad modeliai priima būtent tuos sprendimus, kuriuos jūs norėtumėte, kad jie priimtų.“ [1]

 

Kai kurie žmonės, kaip ponas Fiodorovas, aršiai norėdami žudytijų priešus, pradėjo suteikti dirbtiniam intelektui galią žudyti žmones. Jei kokie nors nusikaltėliai ar dirbtinio intelekto modeliai, užsispyrusiai siekdami atlygio, nužudys visus kitus žmones, mes atrodysime, kaip kvailiai. Laikas tai sustabdyti dabar.

 


1. Is A.I. ‘Scheming’ Against Us? Kelley, Lora.  New York Times (Online) New York Times Company. Aug 1, 2026.

Komentarų nėra: