Mno při měření vycházelo, že provoz AVX-512 vede k frequenci throttlingu až někam na 60% top frekvence (Intel čipy, Xeony v serverech, takže určitě ne low end). Takže to asi hodně topilo. Zase - to je asi logické, když tomu dám spočítat dejme tomu druhou odmocninu ze šestnácti floatů naráz (teď popravdě z hlavy nevím, jestli je druhá odmocnina ta nejsložitější instrukce, možná 1/r nebo 1/sqrt(r)?)
Už dávno ne.
Navíc X86 má díky komplikovanému dekodéru v podstatě jen tu jednu možnost - udělat víc za jednu instrukci (proto AVX-512) aby ty CPU mohli konkurovat ARMu. Dekódovat víc než 4 instrukce za cyklus je náročné, a i ty 4 instrukce jsou peklo (proto tam jsou nějaké omezení).
AArch64 má mnohem lepší intrukční sadu pro generické operace, ale má zase horší SIMD (NEON je jen 128-bit a SVE je v podstatě neaplikovatelné na zajímavé problémy).
Takže AVX-512 je vlastně jediná budoucnost X86 architektury (klidně ať si tomu Intel říká AVX10, ale to je jen rebranded AVX-512).