Měření schopností umělé inteligence na FSV UK

Co bylo hlavní motivací projektu Humanity’s Last Exam? V čem se nový benchmark liší od dřívějších testů? A existoval nějaký výsledek, který výzkumníky vyloženě překvapil?

Dozvíte se v rozhovoru na webu o vědě a výzkumu na FSV UK.

https://fsv.cuni.cz/aktuality/veda-na-fsv-uk-jak-merit-schopnosti-umele-inteligence-na-globalnim-vyzkumu-publikovanem-v

Co je Humanity’s Last Exam?
Humanity’s Last Exam je nástroj pro hodnocení schopností umělé inteligence, který testuje modely pomocí tisíců úloh napříč vědními obory.
Jak se liší nový benchmark od dřívějších testů?
Nový benchmark se zaměřuje na komplexní hodnocení AI, zatímco dřívější testy často posuzovaly pouze specifické úkoly nebo oblasti.
Kdo se podílel na vývoji tohoto projektu?
Na projektu se podíleli vědci z celého světa, včetně Víta Stříteckého a Petra Špelda z Katedry bezpečnostních studií FSV UK.
Jaké překvapivé výsledky byly z výzkumu získány?
Výzkumníci byli překvapeni některými výsledky, které ukázaly nečekané slabiny v oblastech, kde se modely obvykle považovaly za silné.