„Šiandienos pažangūs dirbtinio intelekto modeliai turi kažką labai svarbaus žmogaus priežiūrai, vadinamą „minčių grandine“: tai rašytinis įrašas, skirtas nušviesti duomenis, kuriuos jie apdoroja, ir veiksmus, kuriuos atlieka.
Sakau „skirta“, nes, kaip ir hormonų veikiami paaugliai, rašantys dienoraščiuose, dirbtiniai intelektai nėra patikimiausi savo vidinio gyvenimo pasakotojai. Ir tyrėjai dabar perspėja, kad net ir šis silpnas šių galingų technologijų veikimo įrašas gali tapti mažiau patikimas.
Vienas iš dalykų, dėl kurio minčių grandinės tampa mažiau naudingos, yra tai, kad pagrindiniai minčių ženklai, kuriais jos pagrįstos, tai, ką inžinieriai vadina „samprotavimo pėdsaku“, patys tampa mažiau įskaitomi žmonėms. Be šio esminio įrašo apie tai, kodėl dirbtinis intelektas padarė tai, ką padarė, galėtume tapti akli dirbtinio intelekto bandymų įsilaužti, sukčiauti ir atlikti kitus kenkėjiškus veiksmus varikliams, teigia tyrėjai.
Minčių grandinės žurnalai ir samprotavimo pėdsakų analizė buvo labai svarbūs norint išaiškinti, kaip spiečius „OpenAI“ agentų nulaužė „Hugging Face“. Šie DI agentų minčių įrašai yra didelė dalis įrodymų, kodėl jie elgiasi nesąžiningai. „OpenAI“ tyrėjai perspėjo, kad šie įrašai bus labai svarbūs norint suvaldyti būsimus superintelektualius DI.
„OpenAI“ vyriausiasis mokslininkas Jakubas Pachockis neseniai paskelbtame tinklaraščio įraše rašė, kad „deja, mūsų vertinimai rodo, kad mūsų gebėjimas pasikliauti [minčių grandinės] stebėjimu palaipsniui mažėja“.
Anksčiau šią savaitę „OpenAI“ paskelbė, kad dėl saugumo problemų neišleis naujausios savo galingiausio modelio „Astra“ versijos. Kai kurie DI saugumo tyrėjai anksčiau išreiškė susirūpinimą, kad ankstesnėje modelio versijoje naudojami nauji samprotavimo metodai, kurių gali būti neįmanoma atsekti naudojant dabartinius įrankius.
Straipsniuose ir dokumentuose „OpenAI“ tyrėjai ne kartą išreiškė norą išlaikyti minčių grandinės įrašų ištikimybę ir patikimumą. Tačiau nepriklausomi ir su universitetais susiję DI tyrėjai teigia, kad spaudimas padaryti DI dar galingesnį (ir ekonomiškesnį) kelia tam pavojų.
Dabartiniai mokymo metodai nebūtinai apmoko modelius sukurti minčių grandinę. mintis, kuri yra ištikima tam, kaip DI iš tikrųjų samprotauja, sako Subbarao Kambhampati, DI profesorius Arizonos valstijos universitete ir buvęs Dirbtinio intelekto plėtros asociacijos prezidentas. „Iš esmės mes skatiname modelius rasti teisingą atsakymą, nesvarbu, kaip“, – priduria jis. Modeliams tampant didesniems ir galingesniems, ryšys tarp to, kaip jie mąsto, ir to, ką apie tai praneša, tampa tik silpnesnis.
Jei kada nors prašėte DI spręsti net šiek tiek sudėtingą problemą, esate matę jo minčių grandinę. Kai DI žingsnis po žingsnio aiškina savo logiką, ši pasakojama seka suteikia vartotojams patikinimo, kad DI tvarkingai žygiuoja nuo vienos patikrinamos išvados prie kitos.
Tačiau minčių grandinės pasakojimai yra tik DI sugeneruota modelio faktinio samprotavimo santrauka.
„OpenAI“ konkurento „Anthropic“ tyrimai parodė, kad DI gali padaryti išvadą ir tik po to bandyti sukurti patikimą loginių žingsnių seką, pagrindžiančią tą išvadą. Bendrovės tyrimų dokumentai, įskaitant „Samprotavimo modeliai ne visada sako tai, ką galvoja“ – tai atitinka vis daugiau akademinės bendruomenės darbų.
„Anthropic“ neatsakė į prašymus pakomentuoti.
Dirbtiniai intelektai yra apmokyti pateikti teisingą atsakymą, o ne tikslų įrašą apie tai, kaip jie prie jo priėjo, sako Pradeepas Dasigi, pagrindinis Alleno dirbtinio intelekto instituto mokslininkas, kur jis kuria atvirojo dirbtinio intelekto modelius. Jis siūlo, kad ekspertai ir plačioji visuomenė tokius įrašus vertintų skeptiškiau.
Vis dėlto daugėja įrodymų, kad skepticizmas iš tikrųjų sumažėja, kai žmonės mato minčių grandinę. Vėliau jie labiau linkę pasitikėti dirbtinio intelekto išvada. Kambhampati ir jo komandos atliktame tyrime žmonės labiau linkę patikėti neteisingu rezultatu, jei jį pagrįstų minčių grandinės pasakojimas.
Samprotavimo modelis iš esmės yra didelis kalbos modelis, kalbantis pats su savimi, todėl turėtume tikėtis, kad jo minčių žetonų srautas – vadinamieji samprotavimo pėdsakai – skaitomi kaip pasakojimai.
Deja, komercinės dirbtinio intelekto laboratorijos paprastai nesidalija šiais minčių žetonais. viešai. Viena iš priežasčių yra ta, kad konkuruojančios laboratorijos gali nukopijuoti arba „distiliuoti“ dirbtinio intelekto modelį, jei gauna prieigą prie šių žetonų. Be to, dirbtinio intelekto laboratorijos teigia, kad šiuose pėdsakuose gali būti nerimą keliančių teiginių, net jei jos mano, kad pats rezultatas yra saugus.
Ir jie vis mažiau panašūs į nuoseklius pasakojimus, tobulėjant modelių technologijoms. Tikroji mąstymo žetonų seka gali būti dirbtinio intelekto išrastų trumpinių chaosas, kartais naudojant kelias kalbas. Ši besiformuojanti kalba, žinoma kaip „neuralese“, artėja prie nesuprantamumo, nes dirbtinio intelekto mokymas gauti teisingą atsakymą skatina jį naudoti reprezentacijas, apimančias kalbas, matematiką ir kitas disciplinas.
Šiuo požiūriu dirbtinio intelekto sistemos nelabai skiriasi nuo žmonių, teigia Talas Linzenas (Tal Linzen), Niujorko universiteto docentas ir „Google“ mokslininkas, kuriantis naujus kalbinių modelių vertinimo metodus. Tiek žmonės, tiek dirbtinis intelektas mąsto intuityviai ir pasąmoningai – o šiuos procesus sunku tiksliai apibūdinti.
Dirbtinio intelekto įmonės galėtų bandyti kurti modelius, kurie pateiktų tikslesnius ir žmonėms suprantamesnius savo veiklos atvaizdavimus, tačiau net ir sėkmės atveju tokius modelius būtų brangiau ir daug sunkiau apmokyti, sako Kambhampatis (Kambhampati).
Be to, jei laboratorijos siektų šio tikslo, „OpenAI“ atlikti tyrimai rodo, kad bandymai neleisti dirbtinio intelekto modeliams iškraipyti savo mąstymo eigą greičiausiai paskatintų juos slėpti piktus ketinimus gilesniuose samprotavimo sluoksniuose.
Kita vertus, dirbtinio intelekto įmonės galėtų visiškai atsisakyti idėjos padaryti modelių samprotavimus atsekamus ir skaidrius.
Tai iš tikrųjų galėtų pagerinti jų veikimo rezultatus. Eksperimentai parodė, kad modeliai, nevaržomi reikalavimo būti suprantamiems žmonėms, savo vidiniame mąstymo procese naudoja praktiškai bet kokius elementus (angl. *tokens*).
Kai kuriuos dirbtinio intelekto saugumo tyrėjus sunerimti dėl „OpenAI“ sistemos „Astra“ privertė tai, kad didžiąją dalį mąstymo ji atliko tarsi pasąmonėje. Vietoj nuoseklių mąstymo elementų ten naudojami tik skaičiai, atspindintys neverbalines abstrakcijas.
Reaguodamas į šiuos pranešimus, Pachockis (Pachocki) socialiniame tinkle „X“ parašė apie įmonės pastangas užtikrinti dirbtinio intelekto modelių sąžiningumą. Pasak jo, mąstymo eigos atitikimas tikrajam modelio veikimo principui leidžia tyrėjams suprasti, kiek sistema dera su žmonių vertybėmis.
Jis pridūrė: „Visgi manau, kad ši sistema yra trapi ir, deja, krypsta neigiama linkme.“
---
„News Corp“, kuriai priklauso „The Wall Street Journal“, yra sudariusi turinio licencijavimo partnerystės sutartį su „OpenAI“.“ [1]
1. EXCHANGE --- Keywords: AI's 'Thought' Process Raising Risks of Rogue Models --- As frontier models advance, the gulf between what they do and what they say they do is growing. Mims, Christopher. Wall Street Journal, Eastern edition; New York, N.Y.. 03 Oct 2026: B12.
Komentarų nėra:
Rašyti komentarą