Onderzoek

Wat is een AI-benchmark?

In het nieuws lees je vaak dat een nieuw AI-model "record scores" haalt op benchmarks. Wat betekent dat eigenlijk?

3 min lezenKennisbank

Een benchmark is, simpel gezegd, een examen voor een AI-model. Het is een vaste set vragen of opdrachten — bijvoorbeeld wiskundesommen, programmeeropdrachten, of leesvragen — waarmee onderzoekers meten hoe goed een model presteert. Omdat elk model dezelfde vragen krijgt, kun je de scores gebruiken om verschillende modellen eerlijk met elkaar te vergelijken.

Als je in het nieuws leest dat een nieuw model "een recordscore haalt op een benchmark", betekent dat dus dat het beter scoorde op dat specifieke examen dan eerdere modellen. Dat is nuttige informatie, maar wel met een addertje: een hoge score op één benchmark zegt niet automatisch dat een model in de praktijk ook beter aanvoelt of nuttiger is. Modellen kunnen namelijk specifiek getraind worden om net dát soort examenvragen goed te beantwoorden, zonder dat dit zich altijd vertaalt naar betere algehele prestaties.

Vergelijk het met een leerling die heel goed wordt in het maken van proefwerken van één bepaalde methode, zonder dat dit garandeert dat hij de stof ook echt breed beheerst. Om die reden kijken serieuze AI-onderzoekers altijd naar meerdere benchmarks tegelijk, en steeds vaker ook naar hoe een model presteert in echt gebruik, niet alleen op papier.

Voor jou als lezer: neem een enkel "recordscore"-nieuwsbericht met een korrel zout. Het zegt iets, maar niet het hele verhaal.

← Terug naar kennisbank