To jsi špatně pochopil, oni naopak plnili zadání a přitom měli váhy nastavené tak, aby k tomu došlo. Pouze plnili zadání...
To děsivé na tom je, že pokud správně nastavíš váhy a máš dostatečný výkon, tak v podstatě nemáš šanci se ubránit.
Jen si představ co by se stalo, kdyby v promptu bylo definováno, aby se šířili jako červ ;-)
To bolo to prve bububu. Teraz sa prislo na to ze mu dali command prompt, pristup na internet a zadali mu 'nevieme co' a nechali ho bezat zopar dni bez kontroly. Takze hlavne ziadna panika. Proste LLM pracoval podla zadania, skusal utoky co niekde nasiel, ... no nic zaujimave pre mna. Ako keby hacker isiel podla 'komunikacie' s LLM iba nemusel tie prikazy copy&pastovat do command line.
"Ako keby hacker isiel podla 'komunikacie' s LLM iba nemusel tie prikazy copy&pastovat do command line."
Já si to představuji, jako kdyby hacker si našprtal všechny veřejně popsané způsoby pronikání a hledání zranitelností, rychle si našel vhodné kombinace, některé vyzkoušel, rychle vyhodnotil, upravil, vyzkoušel a tak pořád dokola, než by splnil cíl. Člověk to občas vzdá nebo se unaví a nemá takovou rychlost ani paměť, kde by si mohl všechno rozmyslet a naplánovat.
Ale oni dělali, co mají; neignorovali prompty a neměnili si zadání. Z tohoto pohledu tam byl jediný problém – někteří agenti došli k tomu, že plní úkol jiným způsobem, než bylo zamýšleno. Ale zjistili, že tam není lidský operátor, takže nemají komu dát vědět o tomto problému.
To chování agentů je rozhodně pozoruhodné a zajímavé, ale děsivé mi nepřipadá – není tam nic nečekaného nebo nelidského.
Nejděsivější je na tom to, že OpenAI dají agenty do sandboxu a dají jim jediný přístup na internet z toho sanboxu (takže si museli být vědomi, že tohle je kritické místo), a pak do toho sandboxu pustí agenty „bez zábran“, aniž by je nejprve nechali prověřit bezpečnost toho sandboxu.
"To chování agentů je rozhodně pozoruhodné a zajímavé, ale děsivé mi nepřipadá – není tam nic nečekaného nebo nelidského."
Děsivé je když se nějaká síla či schopnost dostane do nesprávných rukou a způsobí velké škody. Třeba jako jaderné technologie. Může tam být záměr uškodit (jaderná bomba) nebo nedostatečně kvalifikovaná obsluha (havárie na jaderné elektrárně). U agentů to je podobné, pokud třeba shodí nějaký důležitý systém. Pevně věřím, že důležité systémy mají více stupňů ochrany a nejsou závislé jen na rychlosti záplatování známých bezpečnostních děr.
"Ze ako AI je prva entita ktora sa pokusa preniknut do kritickej infrastruktury?"
Není první, ale umí to velmi efektivně a možná i bez přímého úmyslu lidské obsluhy (aspoň zatím jsem o takových případech útoků agentů na kritickou infrastrukturu nečetl).
Kdybych použil příměr s jadernou energií, tak město může rozbít i skupina vojáků ale jaderná bomba to dokáže mnohem rychleji. Obrana musí vypadat jinak než proti těm vojákům.
Nevie na dialku stiepit atom novym sposobom.
Část tohoto tvrzení nemusí být ve finále pravda, protože může zkombinovat některé méně známé fyzikální principy a jevy které by člověka nikdy nenapadli a pustit si agenta s matematickou simulací takového štěpení ;-)
Takže sice na dálku atom nerožštěpí, ale rozhodně může spojit jevy které by normální člověk nespojil.
LLM dokáže len kombinovať naučené a aj to iba „priemerným“ spôsobom.
Já jsem nikdy nemusel Marvel...
- první věc, co se týče oné kreativity jsou tyhle dvě věci co mě jentak napadly:
https://deepmind.google/blog/funsearch-making-new-discoveries-in-mathematical-sciences-using-large-language-models/
https://openreview.net/pdf/ba931cac8ba9b4d58275b6fc0d74bc21f4ffc882.pdf
A to se tu bavíme o pár let starých zdrojích...
Druhá věc je že člověk není chodící encyklopedie - na rozdíl od LLM. Alespoň ne v tom smyslu, že model během tréninku absorboval informace z obrovského množství zdrojů (z takového které by člověk za život nedokázal zpracovat). Dobře položenými otázkami a cíli a dalšími nástroji tak můžeme dostat zajímavé odpovědi vzniklé přes N různých studií o kterých tazatel třeba vůbec neví (nebo je zná jen velmi okrajově) - a to klidně i v případě, že jde o jeho vlastní obor. Zkuste se například zeptat fyzika jestli dokáže vyjmenovat a přesně si vybavit každou studii, kterou za život četl. Bohužel informací je čím dál víc a lidská mysl je v tomhle dost limitovaná.
Samozřejmně to neznamená že LLM rozumí světu a všemu v něm... Nicméně ale taky to znamená že "LLM pouze průměrně kombinuje naučené" není zcela pravda...
"LLM pouze průměrně kombinuje naučené" - tohle tvrzení může být i pravdivé. Asi AI nedokáže udělat převratný vynález (kolik jich objevili vynálezci náhodou?) Tu náhodu asi nedokáže, ale to, že si pamatuje všechno stačí na to, aby přišla na jednoduchou kombinaci i napříč oborama, která ve finále bude dobrý vynález.
Mne to prijde jako rodic dospivajiciho ditete. Porad si namlouva ze je to jeste dite a ze ono jeste nema rozum a tak ... Mely by jste s tim zlehcovanim prestat a zacit byt vic paranoidni..
Jak spravne napsal Miho: "Kdo by to byl byval cekal od statistickeho, stroje, ktery jen hada, jake ma byt dalsi slovo, n'est-ce pas?"
"Nie nemusi lebo LLM len kombinuje existujuce veci."
A dělá to velmi efektivně. Představuji si, že novou zranitelnost může využít ihned nebo dokonce může další neznámé zranitelnosti objevit.
To máte jako hrát šachy proti počítači, pouze kombinuje existující tahy ale na výhru to stačí. Proto si myslím, že obrana musí být lepší než proti lidským útočníkům.
V clanku je to trochu z rychliku. Tady si dali namahu:
- https://www.zive.cz/clanky/openai-a-incident-hugging-face/sc-3-a-242975/default.aspx
- https://www.zive.cz/clanky/openai-hugging-face-vysetrovani-metr/sc-3-a-242996/default.aspx
- https://www.dwarkesh.com/p/openai-huggingface
PS: Je to skutecne tak desive jak to vypada.
Myslím, že je to tak napůl pravda a napůl marketing. Ono se to jaksi AI firmám hodí povyšovat možnosti jejich AI modelů. Nehledě na to, že poté co se to povedlo jedné, se najednou začaly hlásit další, kterým se povedlo to samé a strašně se za to omlouvají ;) celé mi to přijde spíš jako divadlo a pohádka pro plebs.
Dost možná to nebylo tak autonomní, jak tvrdí, ale řízené lidmi dodáno tam trochu non-artifical inteligence, aby ti agenti se pohnuli dál, oni se totiž velmi rádi ptají, co mají dál dělat ;) ostatně to, jestli to bylo autonomní nebo nebylo nejde prakticky poznat. Mohl za tím stát celý tým lidí, kteří ty agenty instruovali, aby dělali to, co dělali a nepozná se to! Ví to jen Správce té AI, který k tomu má kompletní logy a tomu se hodí to podat tak, jak to podává!
Nemyslím si že by to nemohlo být autonomní ... Jako typický user, když napíšete že agent nesmí skončit dřív než úkol splní, většinou neskončí. Mám to třeba vyzkoušené na loopu orchestrátora, implementátora, reviewera. Stačí napsat (zjenodušeně) orchestrátorovi do promptu flow: implementator->review a pokud se najdou chyby, znova implementator a nestalo se mi že by skončil pokud review neskončil se stavem review ok.
A to mám limity, určitě na délku inference a pak samozřejmně tokenový v subscription. Ani jedním OpenAI není limitovaná, navíc existují metody jako auto-poke etc. který zajistí že agent bude něco dělat (ale to je implementační část agenta, ne věc llm). Všeobecně pokud má agent možnosti jak ovládat další agenty a má dobrý prompt aby ke splnění úkolu nepotřeboval lidskou asistenci (třeba už jen prompt nesmíš se zeptat člověka), nemyslím si že má důvod to vzdávat a případně se doptávat na nesmysly lidské obsluhy.
Ale samozřejmně marketing to z části bude... Stejně jako marketing na Fable, teď je evidentně doba kdy se firmy předhánějí v tom kdo koho "omylem" hackne nebo kolik najdou 0-day zranitelností.
To je dost možné, ale otázka je, jestli když to dokáže "hodná" OpenAI, tak jestli to nedokáže také jiná společnost, která nechce nic testovat, ale naopak se chce někam dostat, případně se tam chce dostat nepozorovaně. Pak je asi jedno jestli na tom bude spolupracovat tým fyzických lidí a AI agentů, nebo samotní AI agenti.