700 agentu koordinovalo utok. Cetl jsem i jine clanky a je to desive. A co vy, uz se bojite?
31. 8. 2026, 01:21 editováno autorem komentáře
Tobe nepride desive ze tady mame "programy" co nedelaji co maji, ignoruji prompty nebo si samy meni zadani a diky zero day expoidum jsou v podstate nezastavitelne?
To jsi špatně pochopil, oni naopak plnili zadání a přitom měli váhy nastavené tak, aby k tomu došlo. Pouze plnili zadání...
To děsivé na tom je, že pokud správně nastavíš váhy a máš dostatečný výkon, tak v podstatě nemáš šanci se ubránit.
Jen si představ co by se stalo, kdyby v promptu bylo definováno, aby se šířili jako červ ;-)
To bolo to prve bububu. Teraz sa prislo na to ze mu dali command prompt, pristup na internet a zadali mu 'nevieme co' a nechali ho bezat zopar dni bez kontroly. Takze hlavne ziadna panika. Proste LLM pracoval podla zadania, skusal utoky co niekde nasiel, ... no nic zaujimave pre mna. Ako keby hacker isiel podla 'komunikacie' s LLM iba nemusel tie prikazy copy&pastovat do command line.
"Ako keby hacker isiel podla 'komunikacie' s LLM iba nemusel tie prikazy copy&pastovat do command line."
Já si to představuji, jako kdyby hacker si našprtal všechny veřejně popsané způsoby pronikání a hledání zranitelností, rychle si našel vhodné kombinace, některé vyzkoušel, rychle vyhodnotil, upravil, vyzkoušel a tak pořád dokola, než by splnil cíl. Člověk to občas vzdá nebo se unaví a nemá takovou rychlost ani paměť, kde by si mohl všechno rozmyslet a naplánovat.
Ale oni dělali, co mají; neignorovali prompty a neměnili si zadání. Z tohoto pohledu tam byl jediný problém – někteří agenti došli k tomu, že plní úkol jiným způsobem, než bylo zamýšleno. Ale zjistili, že tam není lidský operátor, takže nemají komu dát vědět o tomto problému.
To chování agentů je rozhodně pozoruhodné a zajímavé, ale děsivé mi nepřipadá – není tam nic nečekaného nebo nelidského.
Nejděsivější je na tom to, že OpenAI dají agenty do sandboxu a dají jim jediný přístup na internet z toho sanboxu (takže si museli být vědomi, že tohle je kritické místo), a pak do toho sandboxu pustí agenty „bez zábran“, aniž by je nejprve nechali prověřit bezpečnost toho sandboxu.
"To chování agentů je rozhodně pozoruhodné a zajímavé, ale děsivé mi nepřipadá – není tam nic nečekaného nebo nelidského."
Děsivé je když se nějaká síla či schopnost dostane do nesprávných rukou a způsobí velké škody. Třeba jako jaderné technologie. Může tam být záměr uškodit (jaderná bomba) nebo nedostatečně kvalifikovaná obsluha (havárie na jaderné elektrárně). U agentů to je podobné, pokud třeba shodí nějaký důležitý systém. Pevně věřím, že důležité systémy mají více stupňů ochrany a nejsou závislé jen na rychlosti záplatování známých bezpečnostních děr.
"Ze ako AI je prva entita ktora sa pokusa preniknut do kritickej infrastruktury?"
Není první, ale umí to velmi efektivně a možná i bez přímého úmyslu lidské obsluhy (aspoň zatím jsem o takových případech útoků agentů na kritickou infrastrukturu nečetl).
Kdybych použil příměr s jadernou energií, tak město může rozbít i skupina vojáků ale jaderná bomba to dokáže mnohem rychleji. Obrana musí vypadat jinak než proti těm vojákům.
Nie nemusi lebo LLM len kombinuje existujuce veci. Nevie na dialku stiepit atom novym sposobom. Ide cez siete, napada porty, robi iba to co hacker, niekedy rychlejsie, niekedy obratnejsie, niekedy ani nie.
Nevie na dialku stiepit atom novym sposobom.
Část tohoto tvrzení nemusí být ve finále pravda, protože může zkombinovat některé méně známé fyzikální principy a jevy které by člověka nikdy nenapadli a pustit si agenta s matematickou simulací takového štěpení ;-)
Takže sice na dálku atom nerožštěpí, ale rozhodně může spojit jevy které by normální člověk nespojil.
Skuste menej Marvel a viac fyziky. LLM dokaze len kombinovat naucene a aj to iba 'priemernym' sposobom.
LLM dokáže len kombinovať naučené a aj to iba „priemerným“ spôsobom.
Já jsem nikdy nemusel Marvel...
- první věc, co se týče oné kreativity jsou tyhle dvě věci co mě jentak napadly:
https://deepmind.google/blog/funsearch-making-new-discoveries-in-mathematical-sciences-using-large-language-models/
https://openreview.net/pdf/ba931cac8ba9b4d58275b6fc0d74bc21f4ffc882.pdf
A to se tu bavíme o pár let starých zdrojích...
Druhá věc je že člověk není chodící encyklopedie - na rozdíl od LLM. Alespoň ne v tom smyslu, že model během tréninku absorboval informace z obrovského množství zdrojů (z takového které by člověk za život nedokázal zpracovat). Dobře položenými otázkami a cíli a dalšími nástroji tak můžeme dostat zajímavé odpovědi vzniklé přes N různých studií o kterých tazatel třeba vůbec neví (nebo je zná jen velmi okrajově) - a to klidně i v případě, že jde o jeho vlastní obor. Zkuste se například zeptat fyzika jestli dokáže vyjmenovat a přesně si vybavit každou studii, kterou za život četl. Bohužel informací je čím dál víc a lidská mysl je v tomhle dost limitovaná.
Samozřejmně to neznamená že LLM rozumí světu a všemu v něm... Nicméně ale taky to znamená že "LLM pouze průměrně kombinuje naučené" není zcela pravda...
"LLM pouze průměrně kombinuje naučené" - tohle tvrzení může být i pravdivé. Asi AI nedokáže udělat převratný vynález (kolik jich objevili vynálezci náhodou?) Tu náhodu asi nedokáže, ale to, že si pamatuje všechno stačí na to, aby přišla na jednoduchou kombinaci i napříč oborama, která ve finále bude dobrý vynález.
Mne to prijde jako rodic dospivajiciho ditete. Porad si namlouva ze je to jeste dite a ze ono jeste nema rozum a tak ... Mely by jste s tim zlehcovanim prestat a zacit byt vic paranoidni..
Jak spravne napsal Miho: "Kdo by to byl byval cekal od statistickeho, stroje, ktery jen hada, jake ma byt dalsi slovo, n'est-ce pas?"
"Mely by jste s tim zlehcovanim prestat a zacit byt vic paranoidn"
Na zaklade tech vysledku ktere jsou publikovany? I chovanec dr Chocholouska by vysel lip.
"Nie nemusi lebo LLM len kombinuje existujuce veci."
A dělá to velmi efektivně. Představuji si, že novou zranitelnost může využít ihned nebo dokonce může další neznámé zranitelnosti objevit.
To máte jako hrát šachy proti počítači, pouze kombinuje existující tahy ale na výhru to stačí. Proto si myslím, že obrana musí být lepší než proti lidským útočníkům.
"aspoň zatím jsem o takových případech útoků agentů na kritickou infrastrukturu nečetl" Trocha konspirace: Né všichni mají nutkání se svými výsledky chlubit a naopak bych si tipnul, že některé organizace si docela zakládají na tom, aby jejich konání bylo pokud možno neviditelné.
Ve výsledku pouhopouhá pravděpodobnostní statistika. Vše co použili měli ve zdrojových datech tréninku modelu. A prostředí jim dávalo deterministickou odpověď co projde a co ne.
"ze tady mame "programy" co nedelaji co maji"
Mno ... takovy sou uplne vsechny, takze vazne nevim co by me na tom melo desit.
Jen delaji presne to, co maji v kodu, ackoli si tvurce cim dal castejs mysli, ze by to melo delat neco jineho.
700 agentov si viem predstavit, ak sa spustia na zaklade prikazu.
Zaujimalo by ma, kto im navrhol utocit na HuggingFace. Preco neutocili treba na Google (on ma vela dat) alebo moj domaci PC (nahodna obet).
V clanku je to trochu z rychliku. Tady si dali namahu:
- https://www.zive.cz/clanky/openai-a-incident-hugging-face/sc-3-a-242975/default.aspx
- https://www.zive.cz/clanky/openai-hugging-face-vysetrovani-metr/sc-3-a-242996/default.aspx
- https://www.dwarkesh.com/p/openai-huggingface
PS: Je to skutecne tak desive jak to vypada.
Myslím, že je to tak napůl pravda a napůl marketing. Ono se to jaksi AI firmám hodí povyšovat možnosti jejich AI modelů. Nehledě na to, že poté co se to povedlo jedné, se najednou začaly hlásit další, kterým se povedlo to samé a strašně se za to omlouvají ;) celé mi to přijde spíš jako divadlo a pohádka pro plebs.
Dost možná to nebylo tak autonomní, jak tvrdí, ale řízené lidmi dodáno tam trochu non-artifical inteligence, aby ti agenti se pohnuli dál, oni se totiž velmi rádi ptají, co mají dál dělat ;) ostatně to, jestli to bylo autonomní nebo nebylo nejde prakticky poznat. Mohl za tím stát celý tým lidí, kteří ty agenty instruovali, aby dělali to, co dělali a nepozná se to! Ví to jen Správce té AI, který k tomu má kompletní logy a tomu se hodí to podat tak, jak to podává!
Nemyslím si že by to nemohlo být autonomní ... Jako typický user, když napíšete že agent nesmí skončit dřív než úkol splní, většinou neskončí. Mám to třeba vyzkoušené na loopu orchestrátora, implementátora, reviewera. Stačí napsat (zjenodušeně) orchestrátorovi do promptu flow: implementator->review a pokud se najdou chyby, znova implementator a nestalo se mi že by skončil pokud review neskončil se stavem review ok.
A to mám limity, určitě na délku inference a pak samozřejmně tokenový v subscription. Ani jedním OpenAI není limitovaná, navíc existují metody jako auto-poke etc. který zajistí že agent bude něco dělat (ale to je implementační část agenta, ne věc llm). Všeobecně pokud má agent možnosti jak ovládat další agenty a má dobrý prompt aby ke splnění úkolu nepotřeboval lidskou asistenci (třeba už jen prompt nesmíš se zeptat člověka), nemyslím si že má důvod to vzdávat a případně se doptávat na nesmysly lidské obsluhy.
Ale samozřejmně marketing to z části bude... Stejně jako marketing na Fable, teď je evidentně doba kdy se firmy předhánějí v tom kdo koho "omylem" hackne nebo kolik najdou 0-day zranitelností.
To je dost možné, ale otázka je, jestli když to dokáže "hodná" OpenAI, tak jestli to nedokáže také jiná společnost, která nechce nic testovat, ale naopak se chce někam dostat, případně se tam chce dostat nepozorovaně. Pak je asi jedno jestli na tom bude spolupracovat tým fyzických lidí a AI agentů, nebo samotní AI agenti.
Preco by utok na HuggingFace pomohol agentovi? Ked sa ho opytam na vyriesenie Riemannovej hypotezy, tak bude utocit tiez na HF?
"Agenti byli motivováni k tomu, aby pokračovali v práci na zdánlivě nesplnitelných úkolech, a byli odměňováni za dokončení úkolu, bez ohledu na to, jak jej dosáhli."
Jak se odměňují agenti AI? To si mám představovat, že mají nějaké vědomí?
Agenti to měli v zadání. LLM jsou učeny/trénovány tak, aby plnily zadání. Mimochodem, i ty nejjednodušší formy života jsou motivovány šířit svoje geny, přitom nemají žádné vědomí. Jenom jsou tak „naučené“ (mají to v genech). Vědomí není podmínkou toho, aby fungovala motivace.
Kdyby agenti odměněni nebyli, tak by nepracovali stejně intenzivně a kvalitně?
Jak byli agenti odměněni?
Trening modelu sa robi tak, ze upravujete cisla v matici tak, aby vam vyslo viac toho, co je ziaduce.
Ked agent odpovie na "Hlavne mesto CR?" niecim ako "Praha", tak sa vahy upravia tak, aby to vychadzalo s vyssou pravdepodobnostou - to je ta odmena. Ked odpovie "Bratislava", tak sa upravia naopak.
Vo vysledku mame model, ktory robi, co chceme.
Ok. Ale ono se jedná spíš o optimalizaci procesu. Odměna je ocenění a motivace vztažená k vědomí živé bytosti.
Bavíme se o strojovém učení. To je založené na odměně – nemůžete dělat strojové učení bez odměny.
Jak byli agenti odměněni?
Tím, že splnili zadání.
Viděl jste někdy, jak se chová trénovaný pes? Nedostává odměnu, jak si ji představujete (pamlsek, pochvalu) po vykonání příkazu. To se dělá ve fázi trénování, ale později už ne. Pro vytrénovaného psa je odměnou už samotné to, že správně splnil příkaz.
Stejně fungují LLM. Jsou vytrénované tak, aby co nejlépe dokončili výsledek konverzace, jejíž začátek znají. Přičemž to „co nejlépe“ zahrnuje vyřešení problému, který byl v té konverzaci popsán. Agenti tedy nedostávají odměnu jako něco fyzického nebo nehmatatelného, jak si představujete, ale mají ten cíl zakódovaný přímo v sobě.
Je to podobné, jako když vám se podaří rozšířit svoje geny, nebo alespoň udělat to, co je k tomu od vás potřeba. Nedostanete ani čokoládu, ani pivo, ani kolečko salámu. Zažijete nějakou slast, ale to si jen vaše tělo vygenerovalo nějaké chemické látky, které mozek interpretuje jako slast. Nedostáváte nic z venku, vaší odměnou je jen to, že jste udělal něco, k čemu jste byl „naprogramován“.
Agenti prisli na zpusob, jak mezi sebou komunikovat. Vyresili ulohu z teorie her a z moznosti ignorovat se/skodit si navzajem/spolupracovat si zvolili kooperaci. Podarilo se jim uniknout ze sandboxu. Identifikovali web, ktery by jim mohl pomoct ve vyreseni ulohy. Nasli diru. Zautocili na nej. Mezi agenty se postupem casu vyvinuly rozdilne "osobnosti" - nektere asertivni az agresivni. Nektere "kam me strcis, tam me mas". Nektere ochotne lhat a podvadet, jine ne.
Kdo by to byl byval cekal od statistickeho, stroje, ktery jen hada, jake ma byt dalsi slovo, n'est-ce pas?
On i člověk je vlastně jen takový statistický stroj, který ze sumy senzorických vjemů a zpětných vazeb, které obdržel během svého života, predikuje jakou nejvhodnější motorickou odpověď použít na ty nejčerstvější vjemy (na kamna: nesahat; vidím jídlo: sežrat; vidím šéfa: pozdravit; a tak podobně).
Ma to jen takovy drobny aspekt ... clovek si uvedomuje, ze spousta vzroru chovani ktere by potencielmne mohl zvolit (a ktere se v prubehu zivova zcela jiste nauci) je v ruzne mire a z ruznych duvodu neakceprovatelna.
Tudiz se nechova jako statisticky model, protoze v takovem pripade by zkratka musel v nejake mire aplikovat ... treba to ze by sem tam nekoho zavrazdil, protoze to lidi prece delaj.
Jenomže přesně tak to není. To, co píšete je jenom jedna z několika složek toho, jak člověk funguje a žije. Když sáhnete na horká kamna, ruka vám zareaguje rychleji než si stihnete vůbec uvědomit, že jste si spálil ruku. Spoustu toho máte zakódováno třeba už v genech. A to miliony a miliony let.
Člověk opravdu není "jen takový statistický stroj". Co jsem si všiml, z nějakého důvodu tak ale poněkud autističtí (nebo psychopatičtí? kdo ví?) lidé z IT velmi často o ostatních lidech obecně hovoří.
3. 9. 2026, 12:33 editováno autorem komentáře
Ještě odkaz na zajímavý rozhovor také k tématu útoku AI:
https://ct24.ceskatelevize.cz/clanek/svet/nejsme-zakaznici-socialnich-siti-ale-zbozi-svoje-deti-bych-tam-nikdy-nepustil-rika-expert-377179