Trening modelu sa robi tak, ze upravujete cisla v matici tak, aby vam vyslo viac toho, co je ziaduce.
Ked agent odpovie na "Hlavne mesto CR?" niecim ako "Praha", tak sa vahy upravia tak, aby to vychadzalo s vyssou pravdepodobnostou - to je ta odmena. Ked odpovie "Bratislava", tak sa upravia naopak.
Vo vysledku mame model, ktory robi, co chceme.
Bavíme se o strojovém učení. To je založené na odměně – nemůžete dělat strojové učení bez odměny.
Jak byli agenti odměněni?
Tím, že splnili zadání.
Viděl jste někdy, jak se chová trénovaný pes? Nedostává odměnu, jak si ji představujete (pamlsek, pochvalu) po vykonání příkazu. To se dělá ve fázi trénování, ale později už ne. Pro vytrénovaného psa je odměnou už samotné to, že správně splnil příkaz.
Stejně fungují LLM. Jsou vytrénované tak, aby co nejlépe dokončili výsledek konverzace, jejíž začátek znají. Přičemž to „co nejlépe“ zahrnuje vyřešení problému, který byl v té konverzaci popsán. Agenti tedy nedostávají odměnu jako něco fyzického nebo nehmatatelného, jak si představujete, ale mají ten cíl zakódovaný přímo v sobě.
Je to podobné, jako když vám se podaří rozšířit svoje geny, nebo alespoň udělat to, co je k tomu od vás potřeba. Nedostanete ani čokoládu, ani pivo, ani kolečko salámu. Zažijete nějakou slast, ale to si jen vaše tělo vygenerovalo nějaké chemické látky, které mozek interpretuje jako slast. Nedostáváte nic z venku, vaší odměnou je jen to, že jste udělal něco, k čemu jste byl „naprogramován“.