Co bylo hlavní motivací projektu Humanity’s Last Exam? V čem se nový benchmark liší od dřívějších testů? A existoval nějaký výsledek, který výzkumníky vyloženě překvapil?
Dozvíte se v rozhovoru na webu o vědě a výzkumu na FSV UK.
- Co je Humanity’s Last Exam?
- Humanity’s Last Exam je nástroj pro hodnocení schopností umělé inteligence, který testuje modely pomocí tisíců úloh napříč vědními obory.
- Jak se liší nový benchmark od dřívějších testů?
- Nový benchmark se zaměřuje na komplexní hodnocení AI, zatímco dřívější testy často posuzovaly pouze specifické úkoly nebo oblasti.
- Kdo se podílel na vývoji tohoto projektu?
- Na projektu se podíleli vědci z celého světa, včetně Víta Stříteckého a Petra Špelda z Katedry bezpečnostních studií FSV UK.
- Jaké překvapivé výsledky byly z výzkumu získány?
- Výzkumníci byli překvapeni některými výsledky, které ukázaly nečekané slabiny v oblastech, kde se modely obvykle považovaly za silné.
