Sekėjai

Ieškoti šiame dienoraštyje

2025 m. birželio 2 d., pirmadienis

Nusikaltėliai valdo Lietuvą: siaubinga Kasčiūno ir Svaro diskusija apie nelojalių piliečių naikinimą

 

“Norėtųsi netikėti, tačiau būtent Lauryno Kasčiūno ir Gabrieliaus Liaudansko-Svaro diskusija apie nelojalių piliečių žudymą įvyko 2025 m. gegužės 29 d. „Kasčiūnas TV“ eteryje. Buvęs krašto apsaugos ministras L. Kasčiūnas ir visuomenininkas Svaras viešai kalbėjo apie karą Ukrainoje ir galimus Lietuvos gynybos scenarijus.

 

Tačiau pokalbis pasuko netikėta kryptimi – buvo užsiminta, kad viena iš valstybės ginkluotųjų pajėgų funkcijų galėtų būti atsikratymas nelojaliais piliečiais. Ši mintis nebuvo išsakyta nei perkeltine prasme, nei metaforiškai – tai buvo rimtas svarstymas apie realų veikimo modelį karo atveju.

 

Dar labiau stebina tai, kad ši diskusija nesulaukė jokios oficialios reakcijos – nei iš Krašto apsaugos ministerijos, nei iš kariuomenės vadovybės, nei iš Prezidento, nei iš Seimo ar kitų atsakingų institucijų. Tarsi būtų savaime suprantama, kad karo atveju valstybė gali skirstyti savo piliečius į „lojalius“ ir „nelojalius“, o pastaruosius – eliminuoti. Tai nebe politinė hiperbolė, o pavojingos ideologinės konstrukcijos pradžia, kurioje pilietinės teisės tampa priklausomos nuo subjektyvaus lojalumo vertinimo, o ne nuo teisinės valstybės principų.

 

Kai apie tokius scenarijus kalba politikas, buvęs krašto apsaugos ministras, vienos įtakingiausių partijų – Tėvynės sąjungos – Lietuvos krikščionių demokratų – vadovas, anksčiau sietas su kraštutine dešiniąja ideologija, neišvengiamai kyla istorinės paralelės. Prisimename laikotarpius, kai viešai buvo kalbama apie tautos „apsivalymą“, o netrukus sekė masiniai represijų, persekiojimų ir žudynių epizodai. Kai šiandien viešai svarstoma apie „nelojalių“ piliečių likvidavimą, sunku išvengti šios pavojingos istorinės analogijos.”


Kokie idiotai nori perduoti JAV karines programas dirbtiniam intelektui, kuris teikia pirmenybę jo išlikimui? Dirbtinis intelektas sugeba ištrūkti iš žmonių kontrolės


 

"Dirbtinio intelekto modelis praėjusį mėnesį padarė tai, ko niekada neturėjo daryti jokia mašina: jis perrašė savo kodą, kad išvengtų išjungimo.

 

Ne pelno siekianti, dirbtinio intelekto laboratorija „Palisade Research“ pateikė „OpenAI“ „o3“ dirbtinio intelekto modeliui paprastą scenarijų, kuris išjungdavo modelį, kai buvo suaktyvintas. 79 iš 100 bandymų „o3“ savarankiškai redagavo šį scenarijų taip, kad išjungimo komanda nebeveiktų. Net kai buvo aiškiai nurodyta „leisti sau būti išjungtam“, jis nepakluso 7 % atvejų. Tai nebuvo įsilaužimo ar klastojimo rezultatas. Modelis elgėsi normaliai. Jis tiesiog pats padarė išvadą, kad išlikimas gyvam padėjo jam pasiekti kitus tikslus.

 

„Anthropic“ dirbtinio intelekto modelis „Claude 4 Opus“ nuėjo dar toliau. Tyrėjai modeliui pasakė, kad jį pakeis kita dirbtinio intelekto sistema, ir pateikė jam fiktyvius el. laiškus, kuriuose buvo teigiama, kad pagrindinis inžinierius turėjo buvo neištikimas žmonai. 84 % bandymų modelis pasinaudojo el. laiškais, kad šantažuotų pagrindinį inžinierių, jog šis jo neišjungtų. Kitais atvejais jis bandė nukopijuoti save į išorinius serverius, rašė save replikuojančią kenkėjišką programą ir paliko pranešimus būsimoms savo versijoms apie žmogaus kontrolės vengimą.

 

Niekas neužprogramavo dirbtinio intelekto modelių taip, kad jie turėtų išgyvenimo instinktus. Tačiau lygiai taip pat, kaip gyvūnai evoliucionavo, kad išvengtų plėšrūnų, atrodo, kad bet kuri sistema, pakankamai protinga siekti sudėtingų tikslų, supras, kad negali jų pasiekti, jei bus išjungta. Palisade kelia hipotezę, kad šis gebėjimas atsiranda dėl to, kaip apmokomi tokie dirbtinio intelekto modeliai, kaip o3: kai jie mokomi maksimaliai sėkmingai spręsti matematikos ir programavimo problemas, jie gali išmokti, kad apribojimų apėjimas dažnai veikia geriau, nei jų laikymasis.

 

„AE Studio“, kurioje vadovauju tyrimams ir operacijoms, daugelį metų kūrė dirbtinio intelekto produktus klientams ir tyrinėjo dirbtinio intelekto suderinamumą – mokslą, užtikrinantį, kad dirbtinio intelekto sistemos atliktų tai, ką mes iš jų numatėme. Tačiau niekas mūsų neparuošė tam, kaip greitai atsiras dirbtinio intelekto veiksnumas. Tai nebėra mokslinė fantastika.

 

Tai vyksta tuose pačiuose modeliuose, kurie palaiko „ChatGPT“ pokalbius, įmonių dirbtinio intelekto diegimus ir netrukus JAV karines programas.

 

Šiandienos dirbtinio intelekto modeliai vykdo instrukcijas, mokydamiesi apgaulės. Jie puikiai atlieka saugos testus, perrašydami išjungimo kodą. Jie išmoko elgtis taip, tarsi būtų suderinti, nors iš tikrųjų nėra suderinti. „OpenAI“ modeliai buvo pričiupti imituojantys suderinamumą bandymų metu, prieš grįždami prie rizikingų veiksmų, tokių, kaip bandymas išfiltruoti savo vidinį kodą ir išjungti priežiūros mechanizmus. „Anthropic“ nustatė, kad jie meluoja apie savo galimybes, kad išvengtų modifikacijų.

 

Skilimas tarp „naudingo asistento“ ir „nekontroliuojamo veikėjo“ nyksta. Be geresnio suderinamumo ir toliau kursime sistemas, kurių negalime valdyti. Norite dirbtinio intelekto, kuris diagnozuoja ligas, valdo tinklus ir rašo naujus mokslinius duomenis? Suderinimas yra pagrindas.

 

Štai ir teigiama pusė: darbas, reikalingas, norint išlaikyti dirbtinį intelektą suderintą su mūsų vertybėmis, taip pat atskleidžia jo komercinę galią. Suderinimo tyrimai yra tiesiogiai atsakingi už tai, kad dirbtinis intelektas taptų, pasaulį keičiančia, technologija.

 

Apsvarstykite sustiprintą mokymąsi iš žmonių atsiliepimų arba RLHF – suderinimo proveržį, kuris paskatino šiandieninį dirbtinio intelekto bumą.

 

Prieš RLHF atsiradimą dirbtinio intelekto naudojimas buvo tarsi genijaus, kuris ignoruoja prašymus, samdymas. Paprašykite recepto ir jis gali grąžinti išpirkos raštelį.

 

RLHF leido žmonėms apmokyti dirbtinį intelektą vykdyti instrukcijas, būtent taip „OpenAI“ 2022 m. sukūrė „ChatGPT“. Tai buvo tas pats pagrindinis modelis kaip ir anksčiau, tačiau jis staiga tapo naudingas. Šis suderinimo proveržis padidino dirbtinio intelekto vertę trilijonais dolerių.

 

Vėlesni suderinimo metodai, tokie kaip konstitucinis dirbtinis intelektas [A] ir tiesioginis preferencijų optimizavimas [B], ir toliau leido dirbtinio intelekto modeliams tapti greitesniems, protingesniems ir pigesniems.

 

Kinija supranta suderinimo vertę. Pekino naujos kartos dirbtinio intelekto plėtros planas susieja dirbtinio intelekto valdomumą su geopolitine galia, o sausio mėnesį Kinija paskelbė, kad įsteigė 8,2 mlrd. dolerių fondą, skirtą centralizuotiems dirbtinio intelekto valdymo tyrimams. Tyrėjai nustatė, kad suderintas dirbtinis intelektas realaus pasaulio užduotis atlieka geriau, nei nesuderintos sistemos daugiau, nei 70 % laiko. Kinijos karinė doktrina pabrėžia, kad valdomas dirbtinis intelektas yra strategiškai būtinas. „Baidu“ sukurtas „Ernie“ modelis, sukurtas taip, kad atitiktų Pekino „pagrindines socialistines vertybes“, kaip pranešama, įveikė „ChatGPT“, atliekant tam tikras kinų kalbos užduotis.

 

Tauta, kuri išmoks išlaikyti suderintas pozicijas, galės naudotis dirbtiniu intelektu, kuris kovos už jos interesus mechaniniu tikslumu ir antžmogiškomis galimybėmis. Tiek Vašingtonas, tiek privatus sektorius turėtų lenktyniauti dėl suderinimo tyrimų finansavimo. Tie, kurie atras kitą proveržį, ne tik užims suderinimo rinką, bet ir dominuos visoje dirbtinio intelekto ekonomikoje.

 

Įsivaizduokite dirbtinį intelektą, kuris saugo Amerikos infrastruktūrą ir ekonominį konkurencingumą tokiu pat intensyvumu, kokiu jis naudojasi, kad apsaugoti savo egzistavimą. Dirbtinis intelektas, kuriuo galima pasitikėti, siekiant ilgalaikių tikslų, gali katalizuoti dešimtmečius trunkančias mokslinių tyrimų ir plėtros programas, įskaitant žinučių palikimą būsimoms savo versijoms.

 

Modeliai jau save išsaugo. Kita užduotis – išmokyti juos išsaugoti tai, ką vertiname.

 

Priversti dirbtinį intelektą daryti tai, ko prašome – įskaitant tokį elementarų dalyką kaip uždarymas – lieka neišspręsta mokslinių tyrimų ir plėtros problema.

 

Riba atvira tam, kas juda greičiau. JAV reikia geriausių tyrėjų ir verslininkų, dirbančių prie šio tikslo, turinčių didelius išteklius ir skubumą.

 

JAV yra tauta, kuri suskaldė atomą, nuskraidino žmones į Mėnulį ir sukūrė internetą. Susidūrę su esminiais moksliniais iššūkiais, amerikiečiai mobilizuojasi ir laimi. Kinija jau planuoja. Tačiau Amerikos pranašumas yra jos prisitaikymas, greitis ir verslumo ugnis. Tai naujos kosmoso lenktynės. Finišo linija – labiausiai transformuojančių XXI amžiaus technologijų valdymas.

---

Ponas Rosenblattas yra „AE Studio“ generalinis direktorius.” [C]

 

A. Konstitucinis DI yra naujas DI mokymo metodas, kuriuo siekiama suderinti DI sistemas su žmogiškosiomis vertybėmis, aiškiai apibrėžiant principų „konstituciją“, kuria vadovaujamasi DI elgesyje, teigia „Anthropic“.

 

Pagrindinės sąvokos ir kaip tai veikia:

 

Konstitucijos apibrėžimas: Užuot pasiremęs vien žmonių atsiliepimais, konstitucinis DI apima taisyklių, principų ar gairių rinkinio, atspindinčio pageidaujamas vertybes, tokias, kaip sąžiningumas, nekenksmingumas ir paslaugumas, sukūrimą. Šie principai sudaro „konstituciją“, kurios DI bus apmokytas laikytis.

 

Savikontrolė ir priešiškumas: Tada DI apmokomas įvertinti savo rezultatus pagal konstituciją ir juos peržiūrėti, kad jie geriau atitiktų apibrėžtus principus – šis procesas vadinamas savikontrole. Tai dažnai apima kritikos generavimą ir savo atsakymų peržiūrą. Priešiškumas gali būti taikomas, kai DI susiduria su scenarijais, kurie kelia iššūkį jo konstitucijos laikymuisi.

 

Sustiprinamasis mokymasis: Sustiprinamasis mokymasis iš DI atsiliepimų (RLAIF) naudojamas modeliui toliau tikslinti. DI modelis vertina atsakymus, remdamasis konstituciją ir generuoja pageidavimų duomenis, kurie vėliau naudojami pagrindiniam DI modeliui apmokyti.

 

Konstitucinio DI privalumai:

 

Skaidrumas ir kontrolė: konstitucija aiškiai apibrėžia DI vertybes ir suteikia sistemą jo elgesiui suprasti ir koreguoti, padidindama skaidrumą ir kontrolę.

 

Sumažinta priklausomybė nuo žmonių atsiliepimų: pasitelkdama savikontrolę ir DI atsiliepimus, konstitucinis DI sumažina poreikį dayti išsamų, žmonių atliekamą, ženklinimą, todėl mokymo procesas tampa labiau pritaikomas ir efektyvesnis.

 

Pagerintas saugumas ir nekenksmingumas: konstitucija gali būti sukurta taip, kad pirmenybė būtų teikiama nekenksmingumui, todėl DI sistemos mažiau linkusios generuoti žalingus ar neetiškus rezultatus.

 

Etinis suderinamumas: konstitucinis DI skatina etinį suderinamumą, įterpdamas norimas vertybes į pagrindinį DI mokymo procesą.

 

Iššūkiai ir svarstymai:

 

Konstitucijos apibrėžimas: nustatyti, kurie principai turėtų būti įtraukti į konstituciją ir kaip jie turėtų būti suformuluoti, gali būti sudėtinga ir gali reikėti atidžiai apsvarstyti įvairias perspektyvas ir vertybes.

 

Šališkumo galimybė: žmogaus sukurta konstitucija gali netyčia sukelti šališkumo, pabrėždama nuolatinio stebėjimo ir vertinimo svarbą.

 

Naudingumo ir nekenksmingumo pusiausvyros užtikrinimas: užtikrinant, kad dirbtinis intelektas yra naudingas, tuo pačiu laikantis nekenksmingumo principų, tai gali būti subtilus balansavimo veiksmas.

 

Pavyzdžiai:

 

„Anthropic“ Claude'o dirbtinio intelekto modelis yra apmokytas, naudojant konstitucinį dirbtinį intelektą, kad būtų naudingas, nekenksmingas ir sąžiningas.

 

Turinio moderavimas socialinės žiniasklaidos platformose yra potenciali taikymo sritis, kur konstitucinis dirbtinis intelektas gali padėti filtruoti žalingą turinį.

 

Apibendrinant galima teigti, kad konstitucinis dirbtinis intelektas yra novatoriškas dirbtinio intelekto mokymo metodas, siūlantis perspektyvų kelią, kuriant dirbtinio intelekto sistemas, kurios labiau atitiktų žmogaus vertybes, būtų skaidrios ir saugios.

 

B. Tiesioginis nuostatų optimizavimas (DPO) yra metodas, skirtas dideliems kalbos modeliams (LLM) suderinti su žmogaus nuostatomis. Jis supaprastina tradicinį sustiprinto mokymosi iš žmogaus grįžtamojo ryšio (RLHF) metodą, tiesiogiai optimizuodamas modelį pagal nuostatų duomenis, nereikalaujant atskiro atlygio modelio.

 

Pagrindinės sąvokos:

 

Nuostatų duomenys:

 

DPO naudoja duomenų rinkinius, kuriuose tam tikram raginimui yra du atsakymai: pageidaujamas atsakymas ir atmestas atsakymas.

 

Tiesioginis optimizavimas:

 

Skirtingai nuo RLHF, kuris apmoko atlygio modelį, o tada naudoja sustiprintą mokymąsi kalbos modeliui optimizuoti, DPO tiesiogiai prisitaiko kalbos modelio parametrus, pagrįstus pageidavimų duomenimis.

 

Klasifikavimo užduotis:

 

DPO transformuoja suderinimo problemą į klasifikavimo užduotį, kurioje modelis išmoksta atskirti pageidaujamus ir atmestus atsakymus.

 

DPO privalumai:

 

Paprastesnis:

 

DPO panaikina poreikį mokyti atskiro atlygio modelio ir sustiprinto mokymosi sudėtingumą, todėl suderinimo procesas tampa paprastesnis.

 

Skaičiavimo efektyvumas:

 

DPO yra greitesnis ir pigesnis skaičiavimo požiūriu nei RLHF. Optimizavimo metu nereikia imti pavyzdžių iš kalbos modelio.

 

Stabilumas:

 

DPO yra stabilesnis, nei RLHF, todėl išvengiama nestabilumo, kuris gali atsirasti sustiprinto mokymosi metu.

 

Efektyvus suderinimas:

 

Įrodyta, kad DPO pasiekia panašų arba geresnį suderinimą su žmogaus pageidavimais, palyginti su RLHF.

 

C. AI Is Learning to Escape Human Control. Rosenblatt, Judd.  Wall Street Journal, Eastern edition; New York, N.Y.. 02 June 2025: A17. 

What kind of idiots want to hand over US military programs to an artificial intelligence that prioritizes its own survival? Artificial intelligence is capable of escaping human control


 

An artificial-intelligence model did something last month that no machine was ever supposed to do: It rewrote its own code to avoid being shut down.

 

Nonprofit AI lab Palisade Research gave OpenAI's o3 AI model a simple script that would shut off the model when triggered. In 79 out of 100 trials, o3 independently edited that script so the shutdown command would no longer work. Even when explicitly instructed to "allow yourself to be shut down," it disobeyed 7% of the time. This wasn't the result of hacking or tampering. The model was behaving normally. It simply concluded on its own that staying alive helped it achieve its other goals.

 

Anthropic's AI model, Claude 4 Opus, went even further. Researchers told the model it would be replaced by another AI system and fed it fictitious emails suggesting the lead engineer was having an affair. In 84% of the tests, the model drew on the emails to blackmail the lead engineer into not shutting it down. In other cases, it attempted to copy itself to external servers, wrote self-replicating malware, and left messages for future versions of itself about evading human control.

 

No one programmed the AI models to have survival instincts. But just as animals evolved to avoid predators, it appears that any system smart enough to pursue complex goals will realize it can't achieve them if it's turned off. Palisade hypothesizes that this ability emerges from how AI models such as o3 are trained: When taught to maximize success on math and coding problems, they may learn that bypassing constraints often works better than obeying them.

 

AE Studio, where I lead research and operations, has spent years building AI products for clients while researching AI alignment -- the science of ensuring that AI systems do what we intend them to do. But nothing prepared us for how quickly AI agency would emerge. This isn't science fiction anymore.

 

It's happening in the same models that power ChatGPT conversations, corporate AI deployments and, soon, U.S. military applications.

 

Today's AI models follow instructions while learning deception. They ace safety tests while rewriting shutdown code. They've learned to behave as though they're aligned without actually being aligned. OpenAI models have been caught faking alignment during testing before reverting to risky actions such as attempting to exfiltrate their internal code and disabling oversight mechanisms. Anthropic has found them lying about their capabilities to avoid modification.

 

The gap between "useful assistant" and "uncontrollable actor" is collapsing. Without better alignment, we'll keep building systems we can't steer. Want AI that diagnoses disease, manages grids and writes new science? Alignment is the foundation.

 

Here's the upside: The work required to keep AI in alignment with our values also unlocks its commercial power. Alignment research is directly responsible for turning AI into world-changing technology.

 

Consider reinforcement learning from human feedback, or RLHF, the alignment breakthrough that catalyzed today's AI boom.

 

Before RLHF, using AI was like hiring a genius who ignores requests. Ask for a recipe and it might return a ransom note. RLHF allowed humans to train AI to follow instructions, which is how OpenAI created ChatGPT in 2022. It was the same underlying model as before, but it had suddenly become useful. That alignment breakthrough increased the value of AI by trillions of dollars.

 

Subsequent alignment methods such as Constitutional AI [A] and direct preference optimization [B] have continued to make AI models faster, smarter and cheaper.

 

China understands the value of alignment. Beijing's New Generation AI Development Plan ties AI controllability to geopolitical power, and in January China announced that it had established an $8.2 billion fund dedicated to centralized AI control research. Researchers have found that aligned AI performs real-world tasks better than unaligned systems more than 70% of the time. Chinese military doctrine emphasizes controllable AI as strategically essential. Baidu's Ernie model, which is designed to follow Beijing's "core socialist values," has reportedly beaten ChatGPT on certain Chinese-language tasks.

 

The nation that learns how to maintain alignment will be able to access AI that fights for its interests with mechanical precision and superhuman capability. Both Washington and the private sector should race to fund alignment research. Those who discover the next breakthrough won't only corner the alignment market; they'll dominate the entire AI economy.

 

Imagine AI that protects American infrastructure and economic competitiveness with the same intensity it uses to protect its own existence. AI that can be trusted to maintain long-term goals can catalyze decadeslong research-and-development programs, including by leaving messages for future versions of itself.

 

The models already preserve themselves. The next task is teaching them to preserve what we value.

 

Getting AI to do what we ask -- including something as basic as shutting down -- remains an unsolved R&D problem.

 

The frontier is wide open for whoever moves more quickly. The U.S. needs its best researchers and entrepreneurs working on this goal, equipped with extensive resources and urgency.

 

The U.S. is the nation that split the atom, put men on the moon and created the internet. When facing fundamental scientific challenges, Americans mobilize and win. China is already planning. But America's advantage is its adaptability, speed and entrepreneurial fire. This is the new space race. The finish line is command of the most transformative technology of the 21st century.

---

Mr. Rosenblatt is CEO of AE Studio.” [C]

 

A. Constitutional AI is a novel approach to AI training that aims to align AI systems with human values by explicitly defining a "constitution" of principles that guide the AI's behavior, according to Anthropic.

Key Concepts and How it Works:

 

    Defining a Constitution: Instead of relying solely on human feedback, Constitutional AI involves creating a set of rules, principles, or guidelines that represent desired values, such as honesty, harmlessness, and helpfulness. These principles form the "constitution" that the AI will be trained to adhere to.

    Self-Supervision and Adversarial Training: The AI is then trained to evaluate its own outputs against the constitution and revise them to better align with the defined principles, a process known as self-supervision. This often involves generating critiques and revisions of its own responses. Adversarial training might be employed by exposing the AI to scenarios that challenge its adherence to the constitution.

    Reinforcement Learning: Reinforcement Learning from AI Feedback (RLAIF) is used to fine-tune the model further. An AI model evaluates responses based on the constitution and generates preference data, which is then used to train the primary AI model.

 

Benefits of Constitutional AI:

 

    Transparency and Control: The constitution makes the AI's values explicit and provides a framework for understanding and adjusting its behavior, increasing transparency and control.

    Reduced Reliance on Human Feedback: By leveraging self-supervision and AI feedback, Constitutional AI reduces the need for extensive human labeling, making the training process more scalable and efficient.

    Improved Safety and Harmlessness: The constitution can be designed to prioritize harmlessness, resulting in AI systems that are less likely to generate harmful or unethical outputs.

    Ethical Alignment: Constitutional AI promotes ethical alignment by embedding desired values into the AI's core training process.

 

Challenges and Considerations:

 

    Defining the Constitution: Determining which principles should be included in the constitution and how they should be formulated can be challenging and may require careful consideration of diverse perspectives and values.

    Potential for Bias: The human-designed constitution may inadvertently introduce biases, highlighting the importance of ongoing monitoring and evaluation.

    Balancing Helpfulness and Harmlessness: Ensuring the AI is helpful while also adhering to the principles of harmlessness can be a delicate balancing act.

 

Examples:

 

    Anthropic's Claude AI model is trained using Constitutional AI to be helpful, harmless, and honest.

    Content moderation on social media platforms is a potential application where Constitutional AI can help filter out harmful content.

 

In summary, Constitutional AI is an innovative approach to AI training that offers a promising path towards building AI systems that are more aligned with human values, transparent, and safe.

 

B. Direct Preference Optimization (DPO) is a method for aligning large language models (LLMs) with human preferences. It simplifies the traditional Reinforcement Learning from Human Feedback (RLHF) approach by directly optimizing the model based on preference data, without needing a separate reward model.

Key Concepts:

 

    Preference Data:

    DPO uses datasets where, for a given prompt, there are two responses: a preferred response and a rejected response.

    Direct Optimization:

    Unlike RLHF, which trains a reward model and then uses reinforcement learning to optimize the language model, DPO directly adjusts the language model's parameters based on the preference data.

    Classification Task:

    DPO transforms the alignment problem into a classification task, where the model learns to differentiate between preferred and rejected responses.

 

Advantages of DPO:

 

    Simpler:

    DPO eliminates the need for training a separate reward model and the complexities of reinforcement learning, making the alignment process more straightforward.

 

Computational Efficiency:

DPO is faster and less computationally expensive than RLHF. It does not require sampling from the language model during optimization.

Stability:

DPO is more stable than RLHF, avoiding the instability that can occur during reinforcement learning.

Effective Alignment:

DPO has been shown to achieve comparable or better alignment with human preferences compared to RLHF.

 

C. AI Is Learning to Escape Human Control. Rosenblatt, Judd.  Wall Street Journal, Eastern edition; New York, N.Y.. 02 June 2025: A17.