jestli jsem to pochopil spravne tak to pouziva OpenAI API a to kvuli embeddings (text-embedding-3-small model napriklad) to je model co sezere nekolik set MB RAM a bez problemu bezi na CPU ve velice rozumne rychlosti, takze pokud Vam nekdo neposila v emailu diplomove prace a romany primo v body tak to bude OK. llama.cpp provedlo opravdu hodne optimalizaci pro CPU inference a v podstate i model jako gemma3 4b bezi bez problemu na CPU pri kratsim promptu.