Podle mě to nechápeš. Pokud bude mít každá stránka svoji vlastní ligatury pro různé slova, tak AI nikdy neudělá korelaci mezi různýma stránkama. To je jako mít vlastní abecedu pro každnou stránku.
13. 8. 2026, 16:46 editováno autorem komentáře
A můžeš teda popsat jak se to bude dekódovat, když v textu je "Koník", ze kterého se pomocí GSUB udělá "Fík"? GSUB pracuje s glyfama a né s unicode - CMAP udělá z Koník 5 glyfů, GSUB z toho udělá 3 a ty potom renderer vykreslí. Nikde není původní informace, jedině nad tím udělat OCR, jak bylo v článku zmíněno.
Zrakově postižení a ti, kteří by v textu něco chtěli najít, pěkně poděkují.
(přesně takhle fungují některé exportéry obsahu do pdf, že permutují písmenka, zejména ta česká, která vizuálně vypadají správně, ale ctrlc ctrlv vyleze salát)
Mě napadlo transformovat ten text stránky (do něčeho co pořád vypadá jako text, ale slova by nedávali smysl) a pomalu ho po načtení měnit a přitom spotřebovat nějaký ten výkon. AI by si muselo počkat a spálit cykly navíc.
Na druhou stranu většina modelů se stejně trénuje na datech do r. 2022, tehdy byl ještě internet bez AI obsahu.
Takze vylejeme vanicku i s ditetem? Nebo jak si autori predstavuji ze bude zustane fungovat full-text search ale AI scraping nikoliv?
Pokud je AI placena sluzba, tak je treba proste zpoplatnit pristup ke zdroji - musim rict nejake AI at mi napise takovej billing system :D Prece data a znalosti nerostou na strome zadara.
Nestalo by za to dnes uz tak komplexni svet dale zbytecne pomoci narovnavaku na ohybaky nezeslozitovat, a pripravit se proste na to, ze budouci svet bude jiny, ze lidi uz treba nebudou cist weby nebo casopisy a knihy, ale jen si nechaji delat "rešerše"* a jit tomu naproti ? :). A ti co tohle nechteji tak maji moznosti paywallu apod. a rict otevrene, platte nam za obsah (aha, to by tam musel byt nejaky hodnotny).
A technicky problem prehlcenych serveru jde taky casto resit treba tim, ze se nestavi na frameworku na frameworku na frameworku na interpretovanem jazyku nevim cem dalsim na to, abych vysypal webstranku. + cacheovani. Ano, sam to vidim, jak Claude na muj pozadavek neco udelat nachrli balik dotazu na webserver.
* taky to tak dneska casto delam, hlavne od doby co Google vi nejlepe co jsem "chtel" najit a ostatni vyhledavace o dane veci treba ani nevi. Uplny bizar je kdyz zadam treba identifikator nejake funkce, dam ho do uvozovek, a stejne dostanu uplne nesouvisejici vysledky, protoze dvema presmyckami z toho vznikne nejake slovo "normalnich lidi".
Nejenom že lidé, kteří závisí na čtečkách obrazovky nebudou mít absolutně přístup k textu, ale celý ten projekt je tvořen LLM. Řešenim proti scrapingu není aby každá stránka vyhazovala tyto osoby mimo palubu, ale aby scraping měl jasně dané meze a aby bylo jednoduché říct jestli chci nebo ne podporovat trénování komerčních modelů.
Obavám se, že je to přesně ten případ, kdy to vypadá složitě z lidského pohledu, ale pro stroje to je (nebo brzo bude) jednoduchý úkol k řešení (a la captcha).
Myslím, že jejich ambicí není strojům zabránit v tom se k tomu dostat úplně, ale zesložitit jim ten přístup. A většinou stačí trochu. Při řešení úkolů Anubisu prohlížečem vám taky nezhoří počítač. Když scrapujete miliardy webů, tak stačí jen malé zesložitění, abyste to dost pocítil a nevyplatilo se vám to. Oni se snaží o nejlepší poměr vynaložené prostředky/data a když narazí na byť drobnou překážku, raději ji přeskočí a jdou na weby, který ten poměr mají lepší.