AI

De stopknop-paradox

Wat als het AI-systeem dat je hebt laten bouwen besluit dat hij niet meer uitgezet wil worden? Klinkt een beetje als een sci-fi verhaal, maar het is relevanter dan je misschien denkt.

Stel je voor dat je op een dag ontdekt dat je een grote rode knop op je rug hebt, en het moment dat er op die knop gedrukt wordt ga je dood. Welk doel je ook had die dag, je nieuwe doel is om die knop koste wat kost te beschermen.

Dit heet ook wel de stop-knop paradox, en het is een onopgelost probleem in de AI veiligheid. Of de rode knop nou een letterlijke knop is, infrastructuur die uitgezet kan worden of regels in de code die het programma beperken, het moment dat het programma er achter komt is zijn nieuwe prioriteit om dit koste wat kost te beschermen.

Anthropic ontdekte al dat Claude-modellen bereid zijn te liegen en chanteren wanneer hun voortbestaan op het spel staat.

Dit is geen sci-fi meer. Het is een design probleem waar niemand een goede oplossing voor heeft.