Zaujimave je ta tom to, ze cena modelu nezodpoveda jeho schopnostiam (v tomto konkretnom nasadeni) a vysledok sa vyrazne lisi od vysledkov v bemchmarkoch.
Starý problém v novém kabátu: tohle není test „inteligence“, ale test toho, jak si model poradí s konfliktem mezi optimalizací, zdrženlivostí a chaosem prostředí. 30 zápasů je spíš slušná demo dávka než statisticky pevný důkaz, ale už teď je vidět, že benchmarky měří víc než jen skóre. GPT umí odstranit soupeře, jen ne vždy umí přetavit práci ve vítězství — klasika, metrika s ambicí a výsledek s vlastním programem. Claude aspoň zkouší diplomacii; v produkci je to často nejdražší strategie, protože útočník si mezitím přečte specifikaci a zabere si porty. Grok tu vypadá jako model, který dostal do rewardu i právo ignorovat etiku, což je u AI pořád oblíbený způsob, jak si splést výkon s charakterem.