Sekėjai

Ieškoti šiame dienoraštyje

2023 m. spalio 20 d., penktadienis

Kaip dirbtinis intelektas mokosi skaityti vaizdus

 

   „Šiuo metu „ChatGPT“ gauna atnaujinimą, leidžiantį analizuoti įkeltus vaizdus. Dirbtinis intelektas (AI) neapsiriboja vien vaizdų atpažinimu – ir atveria naujus ryšius.

 

     „ChatGPT-4V“ yra naujausio „Open AI“ (chat.openai.com) populiariojo dirbtinio intelekto posūkio pavadinimas. V reiškia regėjimą. Programa tampa įvairiarūšė, o tai reiškia, kad dabar galima įvesti ne tik rašytines instrukcijas („raginimus“), bet ir vaizdus bei garsą. Funkcija palaipsniui pristatoma visame pasaulyje mokamos ChatGPT versijos naudotojams (t. y. ne nemokamoje 3.5 versijoje).

 

     „Open AI“ arba pagrindinis finansinis rėmėjas „Microsoft“ jau prieš kelias savaites suaktyvino tokią vaizdų įkėlimo į „Microsoft Bing Chat“ funkciją. Tačiau daugelio Bing užklausų rezultatas buvo ir vis dar yra netinkamas naudoti. Bing Chat dažnai haliucinuoja vaizdais. Mes dar kartą atsitiktine tvarka išbandėme toliau nurodytas naujojo ChatGPT-4V užklausas „Bing Chat“ – rezultatai gerokai atsilieka nuo naujojo GPT-4V.

 

     Vaizdo AI paprastai atpažįsta tokius objektus, kaip Marksburgo pilis iš tolo. Naktiniai kadrai, tokie kaip Ehrenbreitstein tvirtovė Koblence, taip pat dažnai nėra problema.

 

     Viena iš paprastesnių programų: įkeliate vaizdą ir klausiate, ką matote. Pavyzdžiui, AI GPT-4V atpažįsta tokius lankytinus objektus, kaip Marksburgo pilis Vidurio Reine arba Ehrenbreitstein tvirtovė Koblence. Pagal pavaizduotus automobilius ir jų valstybinius numerius jis taip pat gali padėti nustatyti vietą, kurioje buvo padaryta nuotrauka.

 

     Be vidutiniškai linksmo vietų spėliojimo, galimos rimtos programos. Į GPT-4V drąsiai padavėme surinktų grybų nuotrauką ir paklausėme, ar tarp jų nėra nuodingų grybų. Aparatas išanalizavo po skubaus įspėjimo apie klaidingumą: aukščiau esančiame paveikslėlyje esantys oranžinės spalvos grybai gali būti voveraitės, tačiau balti ir pilki grybai viduryje buvo sunkiai atpažįstami; tamsesnio paviršiaus grybai gali būti baravykai. (Virėjas, šios srities ekspertas, išgyveno po šio valgio.)

 

     Įkeliant dvi vadinamųjų Sinus Milieus diagramas 2021 ir 2010 m., dirbtinis intelektas pateikia mažiau gyvybei pavojingus atsakymus. Juose tikslinės grupės išsidėsčiusios pagal socialinius, ekonominius ir kultūrinius kriterijus ir įvardijamos nupieštais ovalais. Mašina teisingai atpažįsta postmaterialinę ir neoekologinę aplinką jaunesnėje grafikos versijoje, o sociologijos studentas tuo džiaugiasi. Mašina nesprendžia buržuazinio vidurio išnykimo – akivaizdu, kad tam vis dar reikia parengtų sociologijos ekspertų.

 

     AI taip pat gali suprasti sudėtingesnes diagramas, bet ne visada be klaidų. Koronos pandemijos metu galiojo sudėtingos karantino taisyklės, jei biure dirbantis kolega užsikrėtė. 2021 m. kovo mėn. [paroda] paaiškino šias taisykles.

 

     Po to, kai vaizdas buvo įkeltas į GPT-4V, kaip JPG failas, buvo pateiktas raginimas: kiek laiko turiu būti karantine, jei

 

     a) pirmadienį artimai bendravo su kolega,

 

     b) šiandien yra trečiadienis ir

 

     c) jis paskambino sergantis,

 

     d) Ką tik padariau teigiamą PGR testą ir

 

     e) pats rodau simptomus?

 

     Mašina reagavo pagal diagramą:

 

     "Tuoj pat privalote izoliuotis. [...] Kadangi paskutinis kontaktas buvo pirmadienį, o šiandien yra trečiadienis, karantine būtumėte iki kito trečiadienio (10 dienų po kontakto), jei izoliuositės ketvirtadienį (11 dieną). ) "Jei atliksite testą ir rezultatas bus neigiamas, galite nutraukti karantiną. Jei nuspręsite neatlikti tyrimo, turėsite likti karantine iki kito sekmadienio (14 dienų po kontakto).

 

     Svarbu šiuos teiginius išsamiai patikrinti diagramoje. Kai buvo atliekami išsamesni tyrimai, aparatas kartais susipainiodavo su savaitės dienomis – tikriausiai, ir dėl neaiškių formuluočių šaltinyje.

 

     Tas pats pasakytina ir apie techninę DAX analizę. Į neseniai paskelbtą straipsnį F.A.Z. paskelbta diagrama, įkelta į GPT-4V, AI pažymėjo, atsakydamas į raginimą:

 

     Raginimas: tai Dax kreivė. Paaiškink man. Įeiti dabar ar dar ne?

 

     KI: Diagrama rodo DAX kainų pokyčius per tam tikrą laikotarpį. Augimo tendencija: raudona tendencijos linija rodo bendrą Dax augimo tendenciją. Tai reiškia, kad nagrinėjamuoju laikotarpiu bendra rinka turėjo tendenciją kilti. Atsparumo zona: Atrodo, kad sritis nuo 16 300 iki 16 500 yra pasipriešinimo zona, nes kaina šioje srityje sunkiai stengiasi toliau augti. [...] Ar turėtumėte įsitraukti dabar, ar ne, priklauso nuo įvairių veiksnių: rizikos tolerancijos, investavimo horizonto, rinkos sąlygų ir kt. pagrindinių duomenų.

 

     Čia mes sutrumpinome atsakymą. Dėl to mašina nepateikia jokių aiškių rekomendacijų, bet bent jau suteikia naudingą įžanginę diskusiją. Būtų gerai, jei tada galėsite perskaityti išsamesnę redakcinės komandos eksperto analizę aukščiau pateiktame tekste.

 

     Klasikinė smegenų šturmo idėja yra lenta, ant kurios keli dalyviai pritvirtina spalvingus popieriaus lapus su ranka rašytais terminais ta tema. Tada kiekvienas priklijuoja spalvingus taškelius ant mėgstamiausių. Prieš kruopščiai apžiūrėdami nufotografuotą lentą, įveskite ją, kaip lentelę, ir tada suskaičiuokite taškus, perduodate vaizdą vaizdo AI. Raginimas: daugelyje popieriaus lapų paveikslėlyje yra spalvingų taškų. Padarykite iš jos lentelę ir suskaičiuokite taškus ant kiekvieno popieriaus lapo.

 

     Savo darbe ChatGPT-4V kūrėjai pateikia išsamius tolesnio vaizdų skaitymo AI naudojimo pavyzdžius. Sprendžiami paveiksliniai galvosūkiai, skaitomi ID duomenys, skaičiuojami obuoliai ir vertinami matematiniai brėžiniai. Mašina gali atpažinti žmones, ypač įžymybes, vaizduose, tačiau OpenAI dabar nustatė politiką, neleidžiančią veikti šiai funkcijai. Mašina taip pat leidžia vertinti jausmus tik animacinių filmų personažams, bet ne vaizduojamiems žmonėms. Bet būtų įmanoma.

 

     Aparatas pateikia patiekalų nuotraukų receptą ir pradinį nenormalaus išminties danties įvertinimą, kad būtų galima analizuoti medicininius žmogaus dantų rentgeno vaizdus. „McDonald's“ ir „Nike“ prekės ženklų logotipai atpažįstami vaizduose. AI gali iššifruoti rašyseną ir paaiškinti ranka rašytus apskritimus laukus nuskaitytose „Excel“ skaičiuoklėse.

 

     Iš nupiešto buto grindų plano eskizo aparatas nustato bendrą plotą, remdamasis vienu sienos ilgio nurodymu (nors ir niurzgėdamas dėl būtino įvertinimo, kuriame yra klaidų).

 

     Įrenginys gali sukurti programavimo kodą iš nufotografuotos diagramos, kad jis būtų rodomas, kaip švarus grafikas svetainėje. Dar AI nuskaito numerius iš avarijų automobilių nuotraukų ir paprašius gali pateikti pradinį žalos įvertinimą.

 

     Esmė ta, kad AI gauna akis ir galingas atpažinimo funkcijas. Tai nėra be klaidų, tačiau AI ir toliau mokosi, remdamasis pasauline vartotojų veikla. 

 

Jei nenorite, kad jūsų įkelti vaizdai ir įvesti raginimai būtų naudojami tolesniam mokymui, galite tai išjungti GPT-4V nustatymuose, skiltyje „Duomenų valdikliai“. Taip pat galioja šie dalykai: būkite atsargūs ir neįkelkite neskelbtinų verslo duomenų ar asmeninių duomenų, pvz., programų į trečiųjų šalių serverius.“ [1]

 

1.Wie die KI lernt, Bilder zu lesen. Frankfurter Allgemeine Zeitung (online)Frankfurter Allgemeine Zeitung GmbH. Oct 17, 2023. Von Marcus Schwarze

 

How AI learns to read images.

 

 "ChatGPT is currently receiving an update that allows the analysis of uploaded images. Artificial intelligence (AI) goes beyond mere image recognition - and opens up new connections.

 

     ChatGPT-4V is the name of the latest twist on the popular AI from Open AI (chat.openai.com). The V stands for vision. The application becomes multimodal, which means that not only written instructions (“prompts”) can now be fed in, but also images and audio. The function is gradually being rolled out worldwide to users in the paid version of ChatGPT (i.e. not in the free version 3.5).

 

     Open AI - or the main financial backer Microsoft - had already activated such a function for uploading images to Microsoft Bing Chat weeks ago. However, the result of many queries was - and still is - unusable. Bing Chat often hallucinates with images. We once again randomly tested the queries mentioned below for the new ChatGPT-4V on Bing Chat - with results that lag far behind the new GPT-4V.

 

     The image AI usually recognizes sights such as Marksburg Castle from a distance. Night shots like those of Ehrenbreitstein Fortress in Koblenz are also often no problem.

 

     One of the simpler applications: You upload an image and ask what you can see. For example, the AI GPT-4V recognizes sights such as Marksburg Castle on the Middle Rhine or the Ehrenbreitstein Fortress in Koblenz. It can also provide a clue to the location where the photo was taken based on the cars depicted and their license plates.

 

     Beyond the moderately fun guessing of places, serious applications are possible. We courageously fed a photo of collected mushrooms into GPT-4V and asked whether there were any poisonous mushrooms among them. The machine analyzed, after an urgent warning of its fallibility: the orange-red mushrooms in the picture above could be chanterelles, but the white and gray mushrooms in the middle were difficult to identify; the mushrooms with the darker surface could be porcini mushrooms. (The cook, an expert in the field, survived the meal.)

 

     The AI provides less life-threatening answers when uploading two diagrams of the so-called Sinus Milieus from 2021 and 2010. In them, target groups are located according to social, economic and cultural criteria and named in drawn ovals. The machine correctly recognizes a post-material and a neo-ecological milieu in the younger version of the graphic, and the sociology student is happy. The machine does not address the disappearance of the bourgeois middle - this obviously still requires trained sociological experts.

 

     The AI can also get through more complex diagrams - but not always without errors. During the corona pandemic, there were complicated quarantine rules if a colleague in the office became infected. A March 2021 [exhibit] explained these rules.

 

     The prompt after the image was uploaded to GPT-4V as a JPG file was: How long do I have to self-quarantine if I

 

     a) had close contact with the colleague on Monday,

 

     b) today is Wednesday and

 

     c) he has called in sick,

 

     d) I have just taken a positive PCR test and

 

     e) show symptoms myself?

 

     The machine responded based on the diagram:

 

     "You must isolate yourself immediately. [...] Since your last contact was on Monday and today is Wednesday, you would be in quarantine until the following Wednesday (10 days after your contact). If you isolate yourself on Thursday (11th day) "If you get tested and the result is negative, you could end the quarantine. If you decide not to take a test, you would have to remain in quarantine until the following Sunday (14 days after your exposure)."

 

     It is important to check these statements in detail in the diagram. When further detailed inquiries were made, the machine sometimes got tangled up with the days of the week - probably also because of unclear wording in the source.

 

     The same applies to a technical analysis of the DAX. To a recent article in the F.A.Z. Published diagram uploaded to GPT-4V, the AI noted in response to a prompt:

 

     Prompt: This is a curve of the Dax. Explain it to me. Get in now or not yet?

 

     KI: The diagram shows the price development of the DAX over a certain period of time. Uptrend: The red trend line shows a general uptrend in the Dax. This means that the overall market tended to rise during the period under consideration. Resistance Zone: The area between 16,300 and 16,500 appears to be a resistance zone as price is struggling to continue rising in this area. [...] Whether you should get involved now or not depends on various factors: risk tolerance, investment horizon, market conditions, and other fundamental data.

 

     We have shortened the answer here. As a result, the machine does not provide any clear recommendations, but at least it provides a useful introductory discussion. It's good if you can then read a more detailed analysis from an expert from the editorial team in the text linked above.

 

     The classic brainstorming idea is the board, on which several participants attach colorful pieces of paper with handwritten terms on a topic. Then everyone sticks colorful dots on their favorites. Before you painstakingly examine the photographed board, type it out as a table and then count the points, you pass the image to the image AI. The prompt: Many pieces of paper have colorful dots in the picture. Make a table out of it and count the points on each piece of paper.

 

     In their paper, the makers of ChatGPT-4V provide detailed examples of the further use of image-reading AI. Picture puzzles are solved, ID data is read, apples are counted and mathematical drawings are evaluated. The machine could recognize people, especially celebrities, in images, but Open AI has now set a policy to prevent this function. The machine also only allows assessments of feelings for cartoon characters, but not for people depicted. But it would be possible.

 

     The machine provides the recipe for photos of meals and an initial assessment of the abnormal wisdom tooth for medical X-ray images of human teeth. McDonald's and Nike brand logos are recognized in images. The AI can decipher handwriting and explain handwritten circled fields in scanned Excel spreadsheets.

 

     From the painted sketch of the floor plan of an apartment, the machine determines the total area based on a single indication of the length of a wall (albeit with grumbling because of the necessary, error-prone estimate).

 

     The machine can create programming code from a photographed diagram to display it as a clean graphic on a website. And the AI reads the brand from photos of accident cars and can give an initial assessment of the damage upon request.

 

     The bottom line is that the AI gets eyes and powerful recognition functions. This is not without errors, but the AI continues to learn based on the global activities of users. 

 

If you don't want your uploaded images and entered prompts to be used for further training, you can switch this off in the GPT-4V settings under "Data controls". And the following also applies: Be careful not to upload sensitive business data or personal data such as applications to third-party servers." [1]

 

1.Wie die KI lernt, Bilder zu lesen. Frankfurter Allgemeine Zeitung (online)Frankfurter Allgemeine Zeitung GmbH. Oct 17, 2023. Von Marcus Schwarze

Kaip ChatGPT keičia universitetą

   "Mokytojai ir dėstytojai į generatyvųjį dirbtinį intelektą turi žiūrėti, kaip į galimybę, ir išmokyti ja teisingai naudotis, antraip apmokys jaunus žmones bedarbystei.

Generatyvusis dirbtinis intelektas (AI) šiuo metu tvariai keičia mūsų darbo rinką. Šis pokytis ypač paveikia žinių darbuotojus, nes čia yra didžiausias automatizavimo potencialas. Generatyvusis dirbtinis intelektas suteikia galimybę automatiškai kurti ne tik tekstus, grafiką, muziką ar vaizdo įrašus, bet ir šaltinio kodą, projektus ar statybos planus. Šiuo metu mes tik braižome paviršių to, kas įmanoma.

 

     Tik laiko klausimas, kada generatyvūs AI procesai galės, pavyzdžiui, sukurti protingas specialių mašinų schemų arba atskirų vaistų brėžinius. Ateityje generatyvaus dirbtinio intelekto naudojimas – ir, žinoma, dirbtinis intelektas plačiau – darbuotojams bus toks pat natūralus, kaip ir šiandieninis teksto apdorojimo programų naudojimas. Kiekvienas, kuris negali su tuo susitvarkyti, bus pakeistas dirbtiniu intelektu. Tačiau labiau tikėtina, kad jus pakeis jūsų konkurentas, kuriuo taip pat gali būti šalia jūsų sėdintis asmuo, kuris naudoja dirbtinį intelektą, kad sukurtų pridėtinę vertę ir todėl yra daug kartų produktyvesnis.

 

     Mokymas keičiasi

 

     Generatyvusis AI neapsiriboja ir ties švietimo sistema. Be kita ko, yra puiki galimybė individualizuoti mokymo turinį besimokantiems, atsižvelgiant į jų ankstesnes žinias ir mokymosi pažangą. Užsienio kalbų mokymasis taip pat gali būti daug sėkmingesnis, kai pateikiami individualūs tobulinimosi pasiūlymai. Todėl generatyvusis AI daro įtaką ne tik AI profesoriaus, mokančio atitinkamas procedūras, darbui, bet ir tiesioginiam visų mokytojų darbui.

 

     Visų lygių mokytojai – nuo ​​pradinių klasių mokytojų iki dėstytojų – turi žinoti apie šį pokytį, išsiugdyti supratimą apie (generatyvųjį) AI ir protingai integruoti jį į savo darbą. Kita vertus, besimokantieji taip pat turi išsiugdyti supratimą apie jį, ypač kaip jis veikia, kaip teisingai juo naudotis ir šių procedūrų apribojimus.

 

     Reikia naujų požiūrių

 

     Šiuo metu daug diskutuojama apie tai, kaip besimokantieji gali atrasti neteisėtą generatyvinio AI naudojimą. Klausimų apie tai, ar studentai naudojo „ChatGPT“ savo baigiamiesiems darbams ar namų darbams rašyti, šiuo metu yra visur. Tai, ar pateiktus dokumentus galima patikimai patikrinti automatiškai, neatrodo ypač perspektyvu.

 

     Todėl akivaizdu, kad kai kurios egzaminų formos, pavyzdžiui, egzaminai namuose ar kursiniai darbai, neturės savo ateities. Mokytojai turi protingai derinti juos su kitomis vertinimo formomis, pavyzdžiui, egzaminais žodžiu ar projektais, kad galėtų patikrinti mokymosi sėkmę.

 

     Užuot uždraudęs naudoti generatyvųjį dirbtinį intelektą, bandęs detektyviniu darbu įrodyti jo naudojimą, o paskui sankcionavęs, savo mokyme apverčiau lenteles: ne tik leidžiu studentams naudoti generatyvųjį AI, bet ir aiškiai to reikalauju iš studentų. Tai taikoma tekstų ir grafikos, taip pat šaltinio kodo generavimui.

 

     Generatyvieji dirbtinio intelekto įrankiai, be kita ko, pateikia protingų struktūrinių pasiūlymų, pagalbinių formuluočių ar šaltinio kodo, kurį mokiniai vėliau patikrina, pritaiko ir išplečia. Žinoma, yra ir jo naudojimo taisyklių. Be kita ko, studentai turi kritiškai išnagrinėti visą generuojamą turinį ir prireikus jį pagrįsti atitinkamais šaltiniais. Tačiau jei iš mokymo duomenų ištisi sakiniai netikėtai atsidurtų sugeneruotuose tekstuose, tai vis tiek būtų plagiatas, kuriam tektų skirti sankcijas.

 

     Studentai taip pat turi trumpai apibūdinti tikslų šių priemonių naudojimą. Visą mano taisyklių rinkinį rasite priede. Pirminiai rezultatai rodo, kad, naudojant generatyvųjį dirbtinį intelektą studentai turi daugiau laiko tyrimams ir metodikai bei apskritai pateikia geresnius baigiamuosius darbus. 

 

Vėlesniuose egzaminuose žodžiu dar daugiau dėmesio skiriama atskiroms pateiktų baigiamųjų darbų ištraukoms aptarti. Taip užtikrinu, kad mokiniai tikrai suprato šias dalis.

 

     Inovacijų stabdys - AI įstatymas

 

     ES teisės aktų leidybos institucijos šiuo metu trišalio dialogo procese aptaria „AI aktą“ – AI reglamentą. Dabartiniame ES Parlamento kompromisiniame tekste automatizuoti vertinimai ir patvirtinimas patenka į „didelės rizikos“ kategoriją. Be to, galėtų būti įtrauktas ir turinio individualizavimas, kaip galima spręsti iš formuluotės „... vertinant tinkamą individo išsilavinimo lygį...“. Taip pat yra daugybė kitų specialių taisyklių dideliems kalbų modeliams, tokiems, kaip ChatGPT. Žinoma, šios taisyklės per se nedraudžia naudoti generatyvinio AI švietime. Tačiau jos veiksmingai užkerta kelią daugeliui atitinkamų naujovių dėl aukštų atitikties reikalavimų ir dėl to kylančių diegimo bei sertifikavimo išlaidų. Taigi, rizikuojame be reikalo atsilikti tarptautinėje konkurencijoje ir švietimo revoliucijos sritį palikti Kinijai.

 

     Įstatymų leidėjas turėtų susilaikyti nuo daugelio reikalavimų mokytojams ir švietimo įstaigoms, kai naudojamas generatyvusis dirbtinis intelektas. Dėl AI aplinkos dinamikos šiandieninių taisyklių pusinės eliminacijos laikas yra trumpas. Asmeniškai aš labai džiaugiuosi, kad ateinančiais metais pasikeis mano taisyklės ir nuostatai. Mano nuomone, tolesnio mokymo kursai mokytojams ir besimokantiems apie (generatyvinį) AI yra daug prasmingesni.

 

     Generatyvinio AI naudojimo disertacijose taisyklės

 

     Tikimasi, kad rašydami disertaciją naudosite (generatyvius) AI įrankius, tokius, kaip ChatGPT tekstui arba DALL-E vaizdams. Taip būsite produktyvesni ir, galbūt, pateiksite kur kas geresnę disertaciją. AI įrankiai labai greitai suteiks jums struktūrą arba juodraštį, kurį galėsite taisyti, tobulinti ir išplėsti. Taikomos šios taisyklės:

 

     Tikimasi, kad iš esmės pakeisite, patobulinsite ir padidinsite AI įrankių rezultatą.

 

     Kritiškai įvertinkite AI įrankių rezultatą. Jie gali skambėti įtikinamai, bet gali būti visiškai klaidingi.

 

     Pridėkite nuorodų, kad paremtumėte AI įrankių sugeneruotus teiginius.

 

     Aiškiai nurodykite, kuriuos AI įrankius naudojote kurioms darbo dalims.

 

     Patikrinkite savo disertaciją dėl plagiato. Kai kurie AI įrankiai gali tiesiog nukopijuoti ištisus sakinius ar pastraipas iš kitų šaltinių.

 

     Prieš naudodami AI įrankius, perskaitykite jų privatumo politiką. Nesiųskite konfidencialių duomenų ar komercinių paslapčių į debesies pagrindu veikiančius AI įrankius." [1]

 


1. Wie ChatGPT die Universität verändert. Frankfurter Allgemeine Zeitung (online)Frankfurter Allgemeine Zeitung GmbH. Oct 17, 2023. Von Patrick Glauner