← Terug naar Nieuws

Anthropic geeft inkijkje in de toekomst van zelfverbeterende AI

30 augustus 2026

Gebaseerd op berichtgeving van TechCrunch — vereenvoudigd & uitgelegd door VAIIYA.

Anthropic geeft inkijkje in de toekomst van zelfverbeterende AI

Het idee dat kunstmatige intelligentie zichzelf kan trainen en verbeteren krijgt steeds meer vorm. Anthropic heeft een nieuw onderzoeksrapport gepubliceerd waarin een geautomatiseerd systeem zelfstandig de veiligheid en uitlijning (alignment) van een AI-model verbetert.

Het onderzoek, getiteld Automated Researchers Can Reliably Mitigate Alignment Failures, staat onder leiding van Anthropic-fellow Chen Yueh-Han. Het laat zien hoe een zogeheten Automated Alignment Researcher (AAR) de rol van een menselijke AI-wetenschapper overneemt.

Wetenschappelijk proces op de automatische piloot

Het systeem werkt volgens een vaste cyclus die nauw aansluit bij de werkwijze van menselijke onderzoekers. De AAR doorzoekt beschikbare literatuur, formuleert een hypothese en past vervolgens een specifieke trainingsmethode toe op een model gedurende dertig minuten.

Laten de testresultaten progressie zien op een benchmark, dan wordt de methode behouden en verder uitgewerkt. Werkt de aanpak niet, dan wordt deze geschrapt. In experimenten met tien verschillende benchmarks voor ongewenst modelgedrag wist het geautomatiseerde systeem op alle fronten de prestaties te verbeteren, zonder dat de algemene capaciteiten van het model achteruitgingen.

Sneller en aanzienlijk goedkoper

De resultaten tonen aan dat het geautomatiseerd trainen van veiligheidsaspecten op korte termijn praktisch toepasbaar kan worden. Bovendien laat het rapport zien dat de prestaties van het geautomatiseerde systeem die van menselijke onderzoekers evenaren of zelfs voorbijstreven.

Gemiddeld wist de beste AAR-methode binnen zes uur met betere voorstellen te komen dan ervaren menselijke onderzoekers. Ook op financieel vlak is het verschil groot: een AAR kost naar schatting 4 dollar per uur aan API-rekenkracht, terwijl een menselijke onderzoeker bij Anthropic zo'n 150 dollar per uur kost.

De grens van automatisering

Hoewel dit een belangrijke stap is richting recursieve zelfverbetering — waarbij AI-systemen hun eigen opvolgers trainen — zijn menselijke onderzoekers nog niet overbodig. Het rapport benadrukt dat de AAR alleen zo goed werkt als de benchmarks waar het systeem tegen getest wordt.

Het opstellen en onderhouden van die testen, evenals het bijhouden van de literatuur waarvan de geautomatiseerde onderzoeker afhankelijk is, blijft voorlopig mensenwerk. Toch toont de studie aan dat de verhouding tussen mens en machine in AI-onderzoek snel verandert.