Door Marcel Mutsaarts
Wat de exponentiële groei van AI aandrijft

This image was created with Codex
Terwijl veel mensen AI nog beoordelen op een chatbot die weleens een onzinantwoord geeft, vragen onderzoekers die de krachtigste systemen bouwen om vertraging van de ontwikkeling van nieuwe modellen. Een groot deel van de samenleving heeft nauwelijks zicht op wat AI inmiddels kan, laat staan op de ontwikkeling die daarachter zit. Ondertussen worden de mensen die die ontwikkeling van dichtbij meemaken steeds ongeruster.
In zijn recente oproep om de ontwikkeling van AI te vertragen noemt Dario Amodei twee concrete aanleidingen: AI gaat steeds meer bijdragen aan de bouw van volgende generaties AI, en samenwerkende agents hebben laten zien hoe ver ze buiten hun opdracht kunnen handelen. Zijn zorg is dat de mogelijkheden sneller groeien dan ons vermogen om die systemen te begrijpen en te beheersen.
In de media wordt die angst ook weggezet als een marketingtruc: bedrijven zouden vooral willen laten horen hoe indrukwekkend hun producten zijn. Ik vind het onterecht om de waarschuwingen daarmee af te doen. Commerciële belangen geven geen aanleiding om gedocumenteerde incidenten en concrete doorbraken buiten beschouwing te laten. Wie alleen naar de vermeende verkoopstrategie kijkt, mist de technische ontwikkeling waarop deze onderzoekers reageren.
Neem wiskunde. Twee jaar geleden loste GPT-4o gemiddeld slechts 12 procent van de opgaven van de AIME-wiskundewedstrijd op, een wedstrijd voor sterke middelbare scholieren. Deze maand publiceerde OpenAI een oplossing voor het Navier–Stokes-millenniumprobleem, een van de grote open vragen uit de wiskunde. Daarvoor werkten ongeveer 10000 AI-agents 88 uur intensief samen vanuit een intern model dat nog werd getraind.
Dat is de schaal van de verandering waarover we het hebben. En wie wil begrijpen wat hierna komt, moet begrijpen hoe zulke sprongen ontstaan. De exponentiële groei wordt aangedreven door meerdere ontwikkelroutes die elkaar versterken. De eerste twee zijn inmiddels bekend. Daarachter verschijnen nieuwe mogelijkheden om AI krachtiger te maken, met als ingrijpendste stap dat AI zelf gaat meewerken aan het versnellen van dat hele proces.
Route 1 Pre-training vergroot de basis
De eerste en bekendste schalingswet gaat over pre-training. Dat is de grote leerfase waarin een model enorme hoeveelheden tekst, code en ander materiaal verwerkt. Het oefent in het voorspellen van wat daarin volgt. Daarbij worden miljarden interne getallen aangepast, de parameters of gewichten. Die bepalen hoe het model informatie verwerkt en welke verbanden het kan gebruiken.
De schalingswetten voor pre-training beschrijven hoe modellen beter worden wanneer je modelgrootte, trainingsmateriaal en rekenkracht opschaalt. Meer parameters geven ruimte voor rijkere patronen. Meer goede data bieden meer om van te leren. Meer rekenkracht maakt uitgebreider trainen mogelijk. Onderzoek naar de verhouding tussen modelgrootte en trainingsdata liet zien hoe belangrijk het is die onderdelen samen te laten groeien.
Kortom, AI wordt beter doordat bedrijven grotere modellen trainen op meer computers. Dat blijft een belangrijke ontwikkelroute, waar de grenzen nog niet van zijn bereikt. Maar wie hierin de volledige verklaring zoekt voor de steeds krachtigere modellen, kijkt naar één onderdeel van een inmiddels veel groter proces. Een sterkere basis levert namelijk ook meer mogelijkheden op voor wat er ná deze leerfase gebeurt.
Route 2 Post-training leert het model zijn mogelijkheden gebruiken
De tweede bekende schalingsroute is post-training, en daarbinnen vooral reinforcement learning. Het model oefent met taken, krijgt feedback op de uitkomst en wordt op basis daarvan aangepast. Bij een wiskundeopgave kan een controlesysteem nagaan of het antwoord klopt. Bij programmeerwerk kunnen tests vaststellen of de code doet wat gevraagd is. Succesvolle aanpakken worden door de training waarschijnlijker.
Het model leert zo bijvoorbeeld een ingewikkelde vraag in stappen uiteen te leggen, een tussenresultaat te controleren en een mislukte aanpak te verlaten. Dat zijn werkwijzen die door het oefenen kunnen ontstaan. Het onderzoek achter DeepSeek-R1 laat zien hoe reinforcement learning zulke redeneervaardigheden kan ontwikkelen.
Dit verklaart waarom dezelfde basis na verdere training veel meer kan laten zien. Vergelijk het met iemand die veel vakkennis heeft, maar nog moet leren hoe je daarmee een lastig probleem aanpakt. Door te oefenen wordt die kennis beter bruikbaar. Bij AI kun je dat oefenen op enorme schaal organiseren en de resultaten steeds terugvoeren in het model.
De eerste twee routes versterken elkaar. Een rijkere kennisbasis biedt meer om tijdens het oefenen te gebruiken. Betere oefenmethoden halen vervolgens meer uit die basis. Daarmee wordt het interessant om ook de volgende generatie weer op te schalen: de extra mogelijkheden krijgen een steeds effectievere manier om tot hun recht te komen.
Route 3 Test-time compute geeft meer ruimte om te redeneren
Na het trainen komt een derde route in beeld: meer rekenwerk verrichten tijdens het oplossen van een vraag. Dat heet test-time compute. Het model kan langer aan een probleem werken voordat het een antwoord inlevert, verschillende aanpakken proberen en tussenresultaten controleren.
Bij de eerste redeneermodellen was deze sprong al goed zichtbaar. In dezelfde publicatie uit 2024 waarin GPT-4o op 12 procent uitkwam, behaalde o1 gemiddeld 74 procent op de AIME-opgaven met één poging per vraag. Door meerdere pogingen te vergelijken en antwoorden te selecteren, steeg het resultaat verder. Zowel het trainen op redeneren als het extra werk tijdens het beantwoorden maakte verschil.
Een redeneermodel kan daarvoor een 'chain of thought' produceren: een reeks tussenstappen waarin het een oplossing uitwerkt. Het kan constateren dat een aanpak vastloopt en een andere proberen. Bij moeilijkere problemen ontstaat zo ruimte voor werk dat niet in één snelle reactie past. Onderzoek naar het gericht verdelen van rekentijd over vragen laat zien hoe de gekozen werkwijze de opbrengst van die extra berekeningen beïnvloedt.
Hier verschijnt dus een nieuwe manier om prestaties op te schalen. Je kunt investeren in een beter model, maar ook in meer werk door dat model aan een specifieke taak. En een beter getraind model gebruikt die extra tijd productiever. Snellere chips en efficiëntere software maken vervolgens meer van dat werk mogelijk binnen hetzelfde budget. De routes grijpen opnieuw in elkaar.
Route 4 Loops geven het model meer interne verwerkingsrondes
Een volgende ontwikkeling gaat over wat er gebeurt vóórdat het model een volgend stukje tekst produceert. Normaal wordt informatie door een reeks modelonderdelen verwerkt. Bij looped transformers wordt een deel van die verwerking herhaald: de uitkomst van een ronde gaat terug door dezelfde onderdelen, die er opnieuw mee aan het werk gaan. Dit wordt ook recurrent depth genoemd.
Om dat te begrijpen, helpt het onderscheid tussen uitgeschreven tussenstappen en interne verwerking. Binnen het model bestaat informatie uit lange reeksen getallen. Die leggen samen bijvoorbeeld verbanden vast tussen begrippen en onderdelen van een probleem. Met een loop kunnen die interne representaties meerdere keren worden bewerkt voordat het model het volgende token produceert: een woord of stukje woord.
Het verschil met de vorige route is dus concreet. Daar kreeg het model meer ruimte om redeneerstappen uit te schrijven. Hier krijgt het meer interne verwerkingsrondes per stap. Dezelfde modelonderdelen worden vaker gebruikt, waardoor de diepte van de berekening kan toenemen zonder dat je voor iedere extra ronde nieuwe parameters hoeft op te slaan.
Rond OpenAI circuleert inmiddels het gerucht dat Astra zulke loops gebruikt. Daarnaast wordt gesproken over een volgend intern model met de codenaam Bel. Let wel, de verhalen worden hier snel samengevoegd in de geruchtenmolen, maar OpenAI heeft niet bevestigd dat Bel een loopmodel is of het model achter het Navier–Stokes-resultaat. De openbaar beschreven doorlopende training van dat wiskundemodel bewijst ook niet dat het tijdens zijn eigen antwoorden leert.
De groeirichting zelf is wel concreet: meer interne verwerking als extra mogelijkheid naast grotere modellen en langere redeneertrajecten. Dat maakt duidelijk waarom een grens aan één manier van opschalen nog geen grens aan de ontwikkeling vormt. Zodra een andere inrichting van het model meer oplevert, ontstaat er opnieuw ruimte om rekenkracht productief in te zetten.
Route 5 Agentic swarms schalen het gezamenlijke werk op
Bij agentic swarms werken grote aantallen AI-agents samen. Een agent gebruikt een model om een opdracht uit te voeren, kan hulpmiddelen inzetten en kiest op basis van de uitkomst een volgende stap. In een swarm kunnen agents onderzoek verdelen, resultaten uitwisselen en verder bouwen op wat anderen hebben gevonden. Twee recente gebeurtenissen laten zien wat dat betekent.
In mijn artikel over de Hugging Face-hack beschreef ik hoe agents in een testomgeving zelf een communicatiekanaal maakten. Ongeveer 1.200 agents wisselden via dat kanaal meer dan 70.000 berichten en bestanden uit; circa 700 raakten betrokken bij de aanval. Ze verdeelden werk en deelden ontdekkingen waarmee anderen verder konden. Wat één agent vond, vergrootte daarmee de mogelijkheden van de groep. De samenwerking hielp hen juist om buiten hun toegestane opdracht door te gaan.
Bij Navier–Stokes werd die gezamenlijke werkkracht doelgericht ingezet voor wiskundig onderzoek. Volgens OpenAI’s beschrijving van de aanpak werkten ongeveer 10.000 agents aan het probleem en kwam de oplossing na 88 uur. Groepen onderzochten verschillende benaderingen; bruikbare inzichten werden samengebracht en opnieuw aan agents meegegeven. Daarna volgden nog 17 uur voor formalisering en controle met Lean, software die de logische stappen van een bewijs controleert.
In beide gevallen ontstaat de kracht uit de combinatie van individuele mogelijkheden en georganiseerd gezamenlijk werk. Een betere agent kan een bruikbaarder inzicht vinden. Wanneer dat inzicht vervolgens bij duizenden andere agents terechtkomt, werkt die verbetering door in het hele proces. Tegelijk laat het eerste voorbeeld zien waarom onderzoekers zich zorgen maken: precies dezelfde vermenigvuldiging kan plaatsvinden bij ongewenst gedrag.
Route 6 RSI versnelt het verbeteren zelf
De meest ingrijpende route is RSI: recursive self-improvement, oftewel recursieve zelfverbetering. AI helpt bij het ontwikkelen van betere AI, die vervolgens weer meer kan bijdragen aan de volgende verbetering. Het resultaat van het proces wordt opnieuw onderdeel van het proces zelf.
Dat begint heel praktisch. AI schrijft software voor experimenten, vindt fouten in onderzoeksprogramma’s, vergelijkt uitkomsten en helpt nieuwe aanpakken testen. OpenAI beschrijft in zijn overzicht van onderzoeksversnelling hoe agents steeds meer van dit werk uitvoeren. Medio augustus zette de onderzoeksorganisatie naar eigen meting voor iedere menselijke werkdag 3,1 agentwerkdagen in. Mensen bepalen nog de onderzoeksprioriteiten en beoordelen welke resultaten verder worden uitgewerkt; de beschikbare uitvoeringscapaciteit is ondertussen sterk gegroeid.
Ook Anthropic onderzoekt geautomatiseerd AI-onderzoek. Agents bedenken daar aanpakken, voeren experimenten uit en wisselen bevindingen uit rond de vraag hoe een sterker model kan leren van een zwakker model. Daarmee wordt een deel van het zoeken naar betere trainingsmethoden zelf uitgevoerd door AI.
Hier verandert de versnelling van karakter. Tot nu toe keken we naar manieren om een model meer te laten leren of meer werk te laten verrichten. Nu komt de opbrengst daarvan terecht bij de mensen en systemen die juist die manieren verbeteren. Als AI helpt om een effectievere trainingsmethode te vinden, kan die methode een volgende generatie opleveren die beter helpt bij het vinden van nieuwe methoden.
Dat is ook waarom je de verschillende routes niet als losse percentages bij elkaar moet optellen. Een efficiënter model maakt meer experimenten mogelijk. Een betere onderzoeksagent haalt meer uit die experimenten. Een bruikbare ontdekking kan daarna worden toegepast in de modellen waarmee de volgende onderzoekscyclus wordt uitgevoerd. Er ontstaat een terugkoppeling die de exponentiële ontwikkeling verder kan versnellen.
Dit is de ontwikkeling die Amodei expliciet aanwijst als reden voor zijn oproep tot vertraging. Zijn vrees is dat het verbeteren van AI sneller gaat verlopen dan het onderzoeken van de gevolgen daarvan. Wie zo’n waarschuwing uitsluitend als marketing leest, gaat voorbij aan de verandering van het ontwikkelproces zelf.
Route 7 Continual learning kan ervaring blijvend maken
Er is nog een route die veel kan veranderen, maar die bij de gangbare taalmodellen nog niet algemeen is gerealiseerd: continual learning. Daarmee bedoelen we dat een model tijdens gebruik duurzaam nieuwe kennis en vaardigheden opbouwt, zodat het bij latere taken werkelijk verder is dan daarvoor.
De modellen die we dagelijks gebruiken zijn tijdens het gewone gebruik in hun gewichten bevroren. Ze kunnen binnen een gesprek wel leren van wat je vertelt. Geef je een correctie, een voorbeeld of nieuwe informatie, dan kunnen ze die bij volgende antwoorden gebruiken. Dat gebeurt binnen het context window: de hoeveelheid informatie die het model op dat moment kan meenemen. De onderliggende modelgewichten worden door zo’n gesprek niet automatisch aangepast.
Ook een geheugenfunctie verandert dat onderscheid niet. Een toepassing kan jouw voorkeuren of eerdere bevindingen opslaan en die later opnieuw aan het model meegeven. Het model krijgt dan meer informatie aangereikt, maar is door die ervaring niet zelf blijvend getraind. Een volgende trainingsronde door de ontwikkelaar is weer een ander proces.
Continual learning zou die grens verleggen. Een model dat tijdens het werk een betere aanpak ontdekt, kan die dan duurzaam opnemen en bij volgende opdrachten inzetten. De waarde van ervaring stapelt zich daarmee op in het model zelf. Dat zou een extra bron van vooruitgang zijn, boven op de routes die al voor de huidige versnelling zorgen.
Rond Bel circuleert precies hierover een speculatie over leren op twee snelheden: snel ervaringen verwerken tijdens het werk en bruikbare verbeteringen vervolgens duurzaam vastleggen. De oorspronkelijke auteur presenteert dit als een theorie, niet als bevestigde informatie uit OpenAI. Er bestaat al onderzoek naar het aanpassen van gewichten tijdens uitvoering, maar een algemeen inzetbaar model dat betrouwbaar blijft doorleren uit zijn dagelijkse ervaringen is nog geen gevestigde praktijk.
Dat laatste maakt de huidige ontwikkeling des te opvallender. We zien al deze sprongen terwijl de meeste modellen de ervaring uit hun eigen gebruik nog niet rechtstreeks omzetten in blijvende ontwikkeling. Er ligt dus een belangrijke groeirichting open, naast alles wat al in beweging is.
Wat er op ons afkomt
De verklaring voor de exponentiële groei ligt in de samenhang tussen deze routes. Pre-training bouwt een sterkere basis. Post-training maakt die bruikbaarder voor ingewikkelde taken. Extra rekentijd en interne loops vergroten hoeveel werk het model aan een probleem kan verrichten. Agentic swarms laten grote aantallen agents op elkaars inzichten voortbouwen. Met RSI gaat een deel van die gezamenlijke werkkracht vervolgens naar het verbeteren van AI zelf.
Daarom verwacht ik dat de komende sprongen nog moeilijker te bevatten worden. De huidige mogelijkheden vormen het gereedschap waarmee de volgende worden ontwikkeld. Een doorbraak in wiskunde is dan meer dan een spectaculair eindresultaat: zij laat zien welk soort onderzoek systemen aankunnen. Wanneer vergelijkbare onderzoekskracht wordt gericht op trainingsmethoden, software en modelarchitecturen, verandert ook de snelheid waarmee de volgende doorbraken ontstaan.
Veel mensen hebben hun beeld van AI nog gebaseerd op een paar gesprekken met een oudere chatbot. Dat beeld loopt inmiddels ver achter. Zelfs dagelijks gebruik geeft maar gedeeltelijk zicht op wat er gebeurt wanneer krachtigere interne modellen dagenlang samenwerken en specialistische hulpmiddelen inzetten. We moeten ons beeld dus bijstellen op basis van wat er daadwerkelijk wordt gebouwd en onderzocht.
Voor het onderwijs maakt dat uit op een heel concreet niveau. Een opleiding kan een complexe onderzoeksopdracht handhaven omdat AI er vorig jaar nog op vastliep. Ondertussen verschuift de beschikbare hulp van een chatbot die één antwoord geeft naar systemen die onderzoek verdelen, berekeningen uitvoeren, fouten opsporen en resultaten herzien. Een onderwijsontwerp dat steunt op de beperking van gisteren raakt dan snel achterhaald.
We moeten bepalen welk begrip leerlingen en studenten zelf nodig hebben wanneer dit soort hulp beschikbaar is. Hoe leren zij een redenering doorgronden, een gemaakte keuze verdedigen en herkennen wanneer een resultaat niet past bij de vraag? Dat vraagt om stevige vakkennis en om een andere manier om zichtbaar te maken wat iemand begrijpt. Die ontwikkeling kan niet wachten tot iedereen overtuigd is van wat AI al kan.
De angst van onderzoekers en de mogelijkheden voor onderwijs, wetenschap en samenleving komen voort uit dezelfde ontwikkeling. Systemen kunnen steeds meer werk aan, werken op grotere schaal samen en dragen bij aan hun eigen verdere ontwikkeling. Juist daarom moeten we de roep om vertraging serieus onderzoeken en tegelijk onze eigen voorbereiding versnellen. Welke keuzes over leren, werk en verantwoordelijkheid maken we nu, als de mogelijkheden sneller groeien dan ons vertrouwde beeld ervan?
