Sekėjai

Ieškoti šiame dienoraštyje

2026 m. rugsėjo 18 d., penktadienis

Kitas didelis DI šuolis – į realų pasaulį – technologijos kaupia „didelių veiksmų modelius“, kad robotikai atliktų tai, ką „ChatGPT“ padarė rašymui ir kodavimui.


„Šiandienos dideli DI kalbos modeliai gali puikiai stumdyti pieštuką, tačiau šalininkai teigia, kad norint atlikti realų fizinį darbą reikia didelių veiksmų modelių, kitaip tariant, pasaulio modelių.“

 

Taikant šį robotams valdyti skirtą metodą, dirbtinio intelekto modeliai mokomi vaizdo žaidimuose ir simuliacijose, o ne literatūroje, kode ir vaizduose. Neseniai jie pasiekė tokį lygį, kad tam tikromis aplinkybėmis gali naršyti trimatėje erdvėje ir netgi autonomiškai manipuliuoti objektais, naudodami tik paprastą instrukcijų rinkinį.

 

Šios technologijos dar tik pradeda vystytis, sako Moritzas Baier-Lentzas, investuotojas į kelias šios srities įmones. „Jei lygintume tai su dideliais kalbos modeliais, tai būtų kaip GPT-2“, – priduria jis. (Tai modelis, kurį „OpenAI“ išleido dar 2019 m.)

 

Nepaisant gana primityvios pasaulio modelių būsenos, technologijų žinovai kaupia savo jėgas. Lažinuosi, kad iš esmės nauja architektūra gali padėti dirbtiniam intelektui pasiekti vietas, kuriose šiandieniniai, kalbos(LLM) pagrindu veikiantys, dirbtiniai intelektai negali žengti. Ir vieną dieną pionieriai tikisi sujungti šias dvi dirbtinio mąstymo mokyklas.

 

Maždaug pusę milijardo metų gyvūnai vystė smegenis, gebančias modeliuoti juos supantį pasaulį ir naudoti tą mentalinį žemėlapį planuodami kitus veiksmus. Kita vertus, kalba atsirado tik maždaug prieš šimtą tūkstantmečių (100 000 metų) – tai sutrumpintas žodis, kurį žmonės sukūrė apdoroti ir perduoti dideles ir mažas sąvokas.

 

„Tekstas yra tik nuostolingas realaus pasaulio atvaizdavimas“, – sako Kentas Rollinsas, „General Intuition“ vyriausiasis produktų vadovas ir buvęs „Epic Games“ „Fortnite“ ekosistemos direktorius. „Pasaulis egzistavo gerokai anksčiau, nei turėjome tekstą, ir jį naudojant pasauliui apibūdinti iš esmės bus praleisti pagrindiniai aspektai.“

 

Robotistai tai jau seniai žinojo. Šiandieninių sudėtingesnių robotų valdymo sistemos remiasi fizikos dėsniais pagrįstomis fizinės srities simuliacijomis. Tai taip pat yra pasaulio modeliai, nors jie yra kruopščiai koduojami ir labai specializuoti. Kas veikia vieno tipo robotams, neveikia antriems. kitą.

 

Šiandienos pasaulinių modelių startuoliai nori sukurti valdymo sistemą, kuri būtų tokia pat universali pilotuojant robotus, kaip ir šiandieniniai kalbos (LLM) studentai kurdami tekstus – nuo ​​sonetų iki programinės įrangos.

 

Niujorke įsikūrusi pasaulinių modelių startuolių įmonė „General Intuition“ šiuo metu baigia investicijų etapą, kurio vertė viršytų 6 milijardus dolerių, todėl ji taptų vertingiausia tokio pobūdžio dirbtinio intelekto laboratorija.

 

Jos mokymų pagrindas yra vaizdo žaidimai: įmonės modelis fiksuoja kiekvieną žaidimo kadrą, taip pat vartotojų veiksmus – kiekvieną mygtuko paspaudimą ar valdymo svirtelės stumtelėjimą. Skirtingai nuo robotų, apmokytų vien tik vaizdo įrašais, tai leidžia jos dirbtiniam intelektui susieti vartotojų veiksmus su jų pasekmėmis virtualiuose pasauliuose, taip sukuriant didelį veiksmų modelį.

 

Truputį pakoregavus, modelis gali pilotuoti robotą realiame pasaulyje taip, lyg jis būtų vaizdo žaidimo veikėjas. Viena išlyga: tai turi būti keturkojis, ratuotas automobilis arba skraidantis dronas, kuris paprastai siųstų tiesioginį vaizdo įrašą vartotojui ir kurį būtų galima valdyti vaizdo žaidimų valdikliu arba pele ir klaviatūra.

 

Tai gana tipiškas kriterijus daugeliui pagrindinių robotų, tačiau jis neapima daugumos dvikojų humanoidinių robotų.

 

„General Intuition“ modelis yra apmokytas milijonais valandų vaizdo žaidimų su tikrais žmonėmis, surinktų iš jos seserinės paslaugos „Medal.tv“ – platformos žaidimų klipams fiksuoti ir bendrinti.

 

Savo biuruose Niujorke ir Ženevoje bei aplink juos „General Intuition“ demonstruoja robotinį šunį. Nors tipiškam dirbtiniam intelektui, valdančiam tokį robotą, gali prireikti milžiniškų mokymų, šiam tereikia kelių minučių tikslumo. Sistema turi žinoti, kur ji yra, kokiame kūne yra ir koks jos tikslas – o tada ji išnyksta, sako Baier-Lentz, kuri yra „General Intuition“ investuotoja.

 

Ankstesnės pasaulio modelių demonstracijos, tokios kaip „Google DeepMind“ pristatyti „Genie“ modeliai, buvo skirtos naujų pasaulių, skirtų robotams apmokyti, kūrimui. Ši kita karta suvokia pasaulį ir nusprendžia, ką daryti toliau. Jackas Parkeris-Holderis, anksčiau vadovavęs šioms pasaulio modelių pastangoms „Google“, buvo vienas iš Londone įsikūrusios „Emulate“ įkūrėjų. Jauna laboratorija derasi dėl daugiau lėšų surinkimo. daugiau nei 500 mln. dolerių iš investuotojų, o tarp jos technologijų specialistų yra pusšimtis kitų buvusių „Google“ darbuotojų, teigiama „The Wall Street Journal“ peržiūrėtuose dokumentuose.

 

Kitos pasaulinio lygio įmonės nenoriai dalijasi informacija apie kuriamus dirbtinius intelektus, tačiau jų įsigijimai ir inžinierių publikacijos suteikia tam tikrų užuominų.

 

„World Labs“, startuolis, kuriam vadovauja Stanfordo profesorius ir „Google“ veteranas – ir „DI krikštamotė“ – Fei-Fei Li, neseniai įsigijo robotikos įmonę „Scenix“. Atrodo, kad „AMI Labs“, kuriai vadovauja buvęs „Meta“ vyriausiasis DI mokslininkas Yann LeCun, dirba ties kažkuo platesniu, tyrinėdama kelias architektūras, nepriklausančias tradiciniams dideliems kalbų modeliams. (Abi įmonės atsisakė komentuoti šį straipsnį.)

 

Nors „General Intuition“ ir kiti startuoliai pabrėžia savo galimybes robotikos srityje potencialūs investuotojai ir verslo partneriai užduoda dar vieną klausimą: kaip pasaulio modeliai gali pagerinti šiandieninių kalba pagrįstų modelių galimybes?

 

Kad kalbos (LLM) specialistai galėtų apdoroti vaizdus ir garsą, jie turi būti apmokyti tiesiogiai toje terpėje, paverčiant įvestis žetonais, kaip jie daro su žodžiais. Bandymas apdoroti trimatę sceną tokiu būdu pasirodė esąs labai neefektyvus, nes daugumoje situacijų gaunami modeliai, kurie yra per lėti, kad galėtų valdyti robotą.

 

Tačiau pasaulio modeliai turi savų problemų: „ChatGPT“ buvo gana lengva vystyti iš vienos kartos į kitą būtent todėl, kad iš pradžių jis žaidė tik su tekstu. LLM specialistams augant ir kaupiant vis daugiau duomenų, jie tampa didesni ir protingesni, tačiau jie ir toliau daro klaidas, sako George'as Konidaris, robotikos profesorius Browno universitete ir „Realtime Robotics“, kuri kuria sistemas pramoniniams robotams, vienas iš įkūrėjų.

 

Su robotais yra daug mažiau scenarijų, kai mes susitaikytume su haliucinacijomis ir kitomis keistenybėmis.

 

„Realusis pasaulis yra labai sudėtingas, jame yra daug specialių atvejų ir aštrių kampų, ir neįmanoma nepastebėti“, – sako Konidaris. „Jei judindami robotą į ką nors atsitrenkiate, viskas pasikeičia.“

 

Nors kai kurie mano, kad padidėjęs kalbos modelių (LLM) efektyvumas gali padėti jiems tapti dirbtiniu intelektu, kuris valdo robotiką ir kitas 3D programas, egzistuoja ir hibridinė koncepcija: kalbos modeliai galėtų kreiptis į pasaulio modelius, kaip jie kreipiasi į kitą programinę įrangą, kad atliktų savo darbą.

 

Tuo tarpu tiek „General Intuition“, tiek „Emulate“ akivaizdžiai nėra įsikūrę San Francisko įlankos regione, kurį sužavėjo kalbos modeliais pagrįstų dirbtinių intelektų potencialas lemti „superintelektą“.

 

Kai paklausiu, ar superintelektas yra jo įmonės tikslas, „General Intuition“ generalinis direktorius Pim de Witte prieštarauja: „Esu Niujorke, nes noriu vengti visokio kulto tipo elgesio ir tiesiog sutelkti dėmesį į mokslinį robotų modelių galimybių vertinimą“, – sako jis. „Mums nereikia to daryti daugiau nei tai, kas yra.“ [1]

 

Labai miela. Žaisk, mažute, žaisk. Ar kas nors Kinijoje kuria dirbtinio intelekto pasaulio modelius?

 

Taip, daugelis organizacijų, startuolių ir akademinių grupių Kinijoje aktyviai kuria dirbtinio intelekto pasaulio modelius – sistemas, skirtas suprasti, imituoti ar sąveikauti su fizine ir erdvine aplinka. Ši sritis tapo svarbiu Kinijos technologijų investicijų ir tyrimų centru.

Pagrindiniai kūrėjai ir startuoliai

• „FaceMind“: Šanchajuje ir Honkonge įsikūrusi tyrėjų įkurta startuolių įmonė, kuri daugiausia dėmesio skiria sistemų, skirtų suprasti virtualią ir erdvinę aplinką, kūrimui.

• „VAST“: Į 3D orientuota dirbtinio intelekto kūrėja, dirbanti su generavimo ir fizinių taisyklių sekimu (pvz., trajektorijos fizika) interaktyvioms aplinkoms.

• „Tencent Holdings“: Išleido atvirojo kodo erdvinius sprendimus, tokius kaip „Hunyuan 3D“, kad kūrėjai galėtų tiesiogiai integruoti fizinius išteklius į standartinius žaidimų variklius. [2]

• Besiformuojantys startuoliai ir universitetai: Daugybė ankstyvosios stadijos projektų, remiamų tiek privačiu rizikos kapitalu, tiek valstybės lėšomis, kyla iš tokių institucijų kaip Tsinghua universitetas ir vietiniai technologijų centrai.

 

Tendencijos varikliai

 

• Pramonės integracija: kūrėjai naudojasi didžiule Kinijos gamybos, robotikos ir realaus pasaulio pramonės duomenų baze, kad apmokytų erdvines ir fizikos dėsniams pritaikytas architektūras.

 

• Rizikos ir valstybės parama: regioniniai ir nacionaliniai finansavimo pokyčiai nukreipti į pasaulio modelius ir įkūnijo dirbtinį intelektą kaip pagrindines sritis, siekiant išsiskirti iš, grynai teksto pagrindu veikiančių, kalbos modelių (LLM) konkurencijos.

 

1. EXCHANGE --- Keywords: AI's Next Big Leap Is Into the Real World --- Tech is piling into 'large action models' to do for robotics what ChatGPT did for writing, coding. Mims, Christopher.  Wall Street Journal, Eastern edition; New York, N.Y.. 22 Aug 2026: B2.  

  

Komentarų nėra: