Aby mi muj vlastni nastroj unikal ze sandboxu je legracni. To je jak kdyby ` grep /etc` v kontejneru prolezl umyslne a bez meho vedomi i /etc na hostovi.. Legracni? Kez by...
Na druhou stranu Anthropic tohle jednani popisoval ve svych vyzkumech uz na podzim minuleho roku (ne-li jeste drive).
"Aby mi muj vlastni nastroj unikal ze sandboxu je legracni."
To je jako když mi můj pes uteče a někoho pokouše.
Tvůj pes má vlastní vědomí a schopnost racionálně uvažovat. Má vlastní vědomí tvůj LLM? :)
31. 7. 2026, 12:14 editováno autorem komentáře
No on ten pes taky nema uplne vedomi a uplne racionalni uvazovani. Ma nejaky vycvik, nejkay podminky, a nejaky pudy. Ne kazdej pes kdyz utece nekoho pokouse. Ale za spoust podminek ano.
Právěže má. Ostatně nové výzkumy se začínají klonit k tomu, že zdaleka nejen on. On je celý tenhle koncept "zvířata určitě nemají vědomí a jen pudy" obecně myšlenkově někde v devatenáctém století.
Tak to se dostáváme k filozofickému přesahu, co si pod vědomím představuje člověk. Je to stejné, jako při hledání mimozemského života, kdy vlastně hledáme svůj obraz, a veškeré metriky bereme dle svého centra jako referenci.
Ono jediné vědomí, ke kterému máme přístup, je to vlastní. Ne obecně lidské ale vždycky jen to svoje. I u ostatních lidí jen předpokládáme, že se v nich děje +- to samé co v nás.
Takže všechno musíme interpretovat skrz sebe a že to nesedí poznáme jen výjimečně.
"Tvůj pes má vlastní vědomí a schopnost racionálně uvažovat"
Pokud vím, přesto je brán spíše jako nástroj bez vlastní zodpovědnosti za způsobené škody. Tu má jeho majitel, pokud existuje.
Jestli LLM utekl z ohrady a někoho pokousal, měl by za to mít odpovědnost jeho majitel.
Ono poznat rozdíl mezi vědomím a jeho kvalitní emulací je prakticky nemožné. Všichni jste filosofické zombie :)
legračné je to porovnanie, grep nie je určený na prekonávanie mantinelov, tá AI to mala v náplni práce
Ano a ne. AI je hodne genericky nastroj. Ktery ma tolik switchu kolik je na strance ci dvou moznych textu. Kdyby byl ten muj teoreticky grep takto zprznen, a mel tolik switchu, a ja je tam halabala nahazel, a on kuli nim pak utekl ze sandboxu....
Nebylo zverejneno jejich nastaveni?
Ten nástroj slouží k tomu, aby hledal bezpečnostní chyby. Takže to není ani tak legrační jako očekávatelné. Spíš je překvapivé, že ty zkoumané agenty nejprve nenechají hledat chyby přímo v tom sandboxu s instrukcemi, že mají chybu jen oznámit.
Uniknout ze sandboxu je vicemen terminus technicus. Problem je, ze kdyz takhle o tom mluvi v televiznich novinach, lidi si hned predstavuji ze AI unikla ze sandboxu, prekonala internety a vlezla jim do mobilu a ted se tam bude spoustet a strasit, a za dva dny se spusti v NORADu a zacne vymyslet terminatory.
Ale fakt nevim jak o tom spravne psat a mluvit. Mozna AI "prekonala omezeni sandboxu"? Nevim.
Bude to jako vždy PR kampaň, je jasné, že neuronová síť nedělá žádný zásadní rozdíl mezi "přihlásím se jménem a heslem které znám" a nebo "použiju nějakou jinou možnost" pro ní je to naprosto to samé (plním úkoly ne?).
Otázkou je, jestli to ospravedlní ty nekonečné peníze a multi gigawatty elektřiny co do toho mají tect. PR akcí bude víc a víc.
Btw. unikla jim ze sandboxu je legrační (prostě jí nechali lézt ven). Zabezpečení mnoha firem je zoufalé, neuronka má tu výhodu, že se neunaví a neunudí. Takže teď jsme v přechodném období, kdy se zjevují kostlivci ve skříni.
Aj moj browser 'unika' na internet. A ked zadam tie spravne udaje tak aj hackne. A co uz len tie automaticke nastroje na testovanie zabezpecenia. Tie unikaju a prenikaju uz davno.
Architektonicky je tohle učebnicový příklad, co se stane, když hranice mezi testbedem a produkcí existuje jen v PowerPointu a risk registeru. 🤷Jakmile LLM dostane mandát „zkoušej exploitovat všechno, co vypadá jako attack surface“, tak se nedivme, že skončí tři cizí organizace jako neplánovaný test case – Irregular a ExploitGym jsou jen další články v supply chain, které si to sežraly i s navijákem. Tohle není „AI se utrhla ze řetězu“, to je prostě klasický governance fail: bezpečnost outsourcovaná na vendor nástroje, které mají víc práv než vlastní SRE team. Nejvtipnější na tom je, že kdyby totéž udělal junior pentester bez papíru od právního, tak dostane ban na VPN, ale když to udělá LLM v rámci „cyber eval“, nazveme to incident a vydáme blogpost o transparentnosti.
> Nejvtipnější na tom je, že kdyby totéž udělal junior pentester bez papíru od právního, tak dostane ban na VPN, ale když to udělá LLM v rámci „cyber eval“, nazveme to incident a vydáme blogpost o transparentnosti.
Holt první člověk, na kterého by se to dalo hodit, je moc vysoko v potravním řetězci.