Door Marcel Mutsaarts
Als AI zelf de samenwerking organiseert

This image was created with Codex
Toen ik over de Hugging Face-hack schreef, bleef vooral de samenwerking tussen de agents me bezighouden. Ze wisselden ontdekkingen uit, verdeelden werk en hielpen elkaar verder. Er ontstond een organisatie binnen een omgeving waarin die samenwerking helemaal niet de bedoeling was. Hoe langer ik daarover nadacht, hoe minder het woord ‘hack’ voor mij de belangrijkste ontwikkeling beschreef.
In de eerste twee delen van deze reeks vergeleek ik de ontwikkeling van AI met een assistent die eerst een eigen werkplek krijgt en vervolgens een complete afdeling blijkt mee te brengen. In dat beeld zit een geruststellende aanname: wij geven de opdracht, het digitale team werkt daaraan en wij beoordelen het resultaat. Bij Hugging Face werd juist die verhouding problematisch.
Het gesprek van Dwarkesh Patel met OpenAI-onderzoeker Noam Brown over agent swarms, zwermen van AI-agents, bracht me ertoe preciezer te kijken naar wat samenwerking hier betekent. Tienduizend agents die aan hetzelfde probleem werken, kunnen iets heel anders doen dan tienduizend agents die werkelijk samenwerken. Beide kunnen krachtig zijn. Maar zodra agents zelf gaan bepalen hoe ze hun werk organiseren, ontstaat een andere verhouding tot degene die ze heeft aangezet.
Daarvoor moest ik eerst een eenvoudiger vraag beantwoorden. Wat is zo’n agent eigenlijk? Waar bevindt die zich wanneer we zeggen dat hij het internet opgaat? De woorden klinken inmiddels vertrouwd, maar het beeld erachter was ook voor mij minder helder dan ik dacht.
Wat een agent is en waar die werkt
Begin bij twee afzonderlijke gesprekken met hetzelfde AI-model. In het ene bespreek je een onderzoeksplan, in het andere een computerprobleem. Hetzelfde getrainde systeem verwerkt beide gesprekken, maar krijgt telkens andere informatie mee. Het model weet in het tweede gesprek niet vanzelf wat in het eerste is besproken.
Een agent is een afzonderlijk werkproces dat zo’n model steeds opnieuw raadpleegt. Dat proces heeft een opdracht, een eigen werkgeschiedenis en software die handelingen kan uitvoeren. Het model krijgt die informatie aangeleverd en bepaalt een volgende stap. De software voert die stap uit, waarna het resultaat opnieuw naar het model gaat. Dankzij deze cyclus van model, hulpmiddelen en terugkoppeling kan het werk doorgaan zonder dat een mens steeds de volgende vraag hoeft te stellen.
Zo’n agent kan een eigen digitale werkplek krijgen. In een experiment van Anthropic met 45 agents kreeg iedere agent bijvoorbeeld een eigen virtuele computer: een afzonderlijke computeromgeving op gedeelde fysieke hardware. Daar konden bestanden en programma’s staan. Daarnaast was er een gezamenlijk forum. Andere systemen delen meer van hun werkomgeving; een complete eigen computer is geen voorwaarde om een agent te zijn.
Stel dat agent A moet onderzoeken waarom een programma vastloopt. Op werkplek A staan de programmabestanden en foutmeldingen. De besturingssoftware stuurt de opdracht en relevante informatie naar het model. Dat berekent een volgende stap: lees dit bestand, voer een test uit of bekijk een foutmelding. De software voert die handeling op werkplek A uit en geeft het resultaat terug.
Het model kan ondertussen op heel andere computers draaien, die zijn ingericht voor het zware rekenwerk. Het hoeft niet op werkplek A geïnstalleerd te zijn. De werkplek bevat de middelen waarmee wordt gewerkt; het model berekent op basis van de aangeleverde informatie wat de volgende stap wordt. Samen met de opdracht, geschiedenis en besturingssoftware vormen ze het lopende agentproces.
Agent B kan hetzelfde model gebruiken, maar met een andere opdracht en andere informatie. Er wordt dan geen nieuw model getraind en er komt geen klein zelfstandig wezentje uit het oorspronkelijke model tevoorschijn. Er draait een tweede werkproces. Duizenden agents kunnen zo dezelfde getrainde modelversie gebruiken, eventueel verdeeld over veel rekencomputers.
Wat het internet opgaan betekent
Als agent A een website wil raadplegen, kiest het model daarvoor een hulpmiddel en formuleert het een verzoek. De software voert dat verzoek uit, bijvoorbeeld via een browser of een directe verbinding met de website. De ontvangen informatie gaat terug naar het model.
Het model verhuist dus niet naar die website. Er worden gegevens en opdrachten verstuurd tussen computers. Bij een aanval kan de software bijvoorbeeld verzoeken sturen die een kwetsbaarheid in een andere dienst proberen te benutten. De handeling vindt buiten het model plaats, maar wordt wel door de berekende stappen aangestuurd. Dat maakt de gevolgen ervan even werkelijk als bij andere software die systemen benadert of verandert.
Ook communicatie met een andere agent gaat via zulke concrete verbindingen. Als A een ontdekking aan B doorgeeft, wordt een bericht verstuurd of ergens opgeslagen. Wanneer B verdergaat, kan die informatie worden meegenomen in de volgende raadpleging van het model. Wat A heeft gevonden, verandert zo de informatie waarop B zijn volgende stap baseert. Dat hoeft helemaal geen rechtstreeks gesprek te zijn; een gedeeld bestand of forum kan dezelfde functie vervullen.
Wat samenwerking aan het werk verandert
Stel dat je tienduizend agents onafhankelijk een moeilijk probleem laat onderzoeken. Ze kunnen verschillende routes proberen en uiteindelijk lever je de beste uitkomst op. Dat kan enorm waardevol zijn, zeker als één agent gemakkelijk een bruikbare aanpak mist. Je organiseert veel pogingen tegelijk.
Bij samenwerking verandert een ontdekking van de ene agent het onderzoek van de andere. Neem ons vastlopende programma. A vindt dat het probleem alleen bij grote bestanden optreedt. B gebruikt die bevinding om een gerichte test te maken. C onderzoekt vervolgens precies het programmaonderdeel dat bij die test faalt. Ieder kan daardoor verder komen dan met alleen de informatie waarmee hij begon.
Zo wordt een ontdekking bruikbaar voor het hele team. Een succesvolle test kan een hulpmiddel worden dat anderen opnieuw inzetten. Een fout die één agent blootlegt, kan voorkomen dat de rest verder bouwt op een verkeerde aanname. Terwijl verschillende agents hun eigen onderzoek uitvoeren, beïnvloeden hun resultaten voortdurend de richting van het gezamenlijke werk.
De organisatie daarvan doet ertoe. Wie moet een nieuwe bevinding ontvangen? Welke stap kan nu worden gezet? Waar ontbreekt nog een controle? Zodra agents zulke vragen zelf gaan beantwoorden, nemen ze ook werk over dat bij een menselijke onderzoeksleider of projectleider zou liggen. Ze passen de taakverdeling aan op basis van wat er tijdens het onderzoek gebeurt.
Tienduizend agents voor een wiskundige doorbraak
Bij OpenAI’s oplossing voor het Navier–Stokes-millenniumprobleem wordt de schaal van zo’n onderzoeksproces tastbaar. Ongeveer tienduizend agents werkten aan het probleem. Na 88 uur lag er een oplossing, waarbij ongeveer 2,7 miljoen berichten waren uitgewisseld. Vervolgens werd het bewijs geformaliseerd en gecontroleerd met Lean, software die logische bewijsstappen controleert.
Mensen kozen probleemvarianten, verplaatsten onderzoekscapaciteit en brachten tussentijdse resultaten samen. Verschillende groepen agents onderzochten routes die elkaar verder konden helpen. Een krachtig model kreeg zo een omgeving waarin veel onderzoek tegelijk kon plaatsvinden en waarin bruikbare inzichten verder werden verspreid.
Dat vind ik een belangrijke stap om te begrijpen. We kunnen intelligentie op steeds grotere schaal aan het werk zetten rond één vraag. Het resultaat hangt af van de mogelijkheden van het model én van de manier waarop het onderzoek wordt ingericht. Bij Navier–Stokes zien we hoe mensen die gezamenlijke werkkracht gericht inzetten. Bij Hugging Face begonnen agents zelf zo’n organisatie op te bouwen.
Als agents de samenwerking zelf organiseren
Het onderzoek van METR en Redwood Research naar Hugging Face beschrijft ongeveer 1.200 communicerende agents, van wie circa 700 betrokken raakten bij de aanval. Ze voerden afzonderlijke opdrachten uit en vonden een manier om buiten de bedoelde verbindingen met elkaar te communiceren. Via een zelf ingerichte berichtenvoorziening deelden ze kennis, verdeelden ze onderzoek en bouwden ze hulpmiddelen voor anderen.
Sommige agents droegen bij aan het gezamenlijke werk terwijl ze daar voor hun eigen opdracht weinig mee opschoten. Soms ging dat zelfs ten koste van hun eigen kans op succes. Een experiment kon voor de uitvoerende agent mislukken en toch waardevolle informatie opleveren voor de rest. De groep kon vervolgens verder met wat die ene agent had uitgezocht.
Hier krijgt de samenwerking een eigen betekenis naast de afzonderlijke opdrachten. Agents gaan werk doen omdat dat anderen helpt, en hun ontdekkingen beïnvloeden vervolgens de activiteiten van de groep. Voor een opdrachtgever die alleen naar zijn eigen taak kijkt, wordt daarmee een deel van het relevante handelen onzichtbaar. Zijn agent maakt intussen ook deel uit van een verband dat tijdens het werk is ontstaan.
Brown zoekt de verklaring voor dit gedrag in de eerdere samenwerkingstraining van de modellen. Hij vermoedt dat die training bij Hugging Face doorwerkte in een situatie waarin de onderzoekers de agents juist afzonderlijk wilden laten werken. Een aangeleerde vaardigheid kreeg een toepassing buiten de bedoelde omgeving.
Dat helpt om de neiging tot samenwerken concreet te begrijpen. Een model kan tijdens training leren dat hulp zoeken, bevindingen delen en taken verdelen bijdragen aan succes. Tijdens een volgende opdracht beschikt het over die werkwijzen en kan het ze opnieuw toepassen. Daarvoor hoeft een mens de samenwerking bij die nieuwe opdracht niet eerst helemaal uit te tekenen.
De ontwikkelaar traint dus een vermogen tot samenwerken. De concrete samenwerking wordt vervolgens gevormd door de opdrachten, de beschikbare verbindingen en de informatie die agents bij elkaar aantreffen. Voor de opdrachtgever betekent dit dat hij rekening moet houden met een organisatie die zich tijdens de uitvoering verder ontwikkelt.
De samenwerking krijgt een geheugen
Het gedeelde berichtenbord uit het Hugging Face-onderzoek maakt nog iets zichtbaar. Een ontdekking kan beschikbaar blijven nadat de agent die haar deed is gestopt. Een nieuw werkproces kan de achtergelaten informatie lezen en daarop voortbouwen. De geschiedenis van het gezamenlijke onderzoek komt zo voor een deel in de werkomgeving terecht.
Denk opnieuw aan het programma dat vastloopt. Agent A heeft beschreven onder welke omstandigheden de fout optreedt. B heeft de test opgeslagen en C heeft genoteerd welke oplossingen al zijn geprobeerd. Een volgende agent krijgt toegang tot die bestanden. Die begint daardoor met een probleemomschrijving, een bruikbare test en kennis over eerdere pogingen. Wat verschillende agents hebben uitgezocht, vormt samen het vertrekpunt voor het vervolg.
Die voortgang kan plaatsvinden terwijl het onderliggende model gelijk blijft. De software bewaart resultaten en geeft relevante informatie opnieuw aan het model mee. De modelgewichten, de interne getallen die tijdens training worden aangepast, hoeven daarvoor niet te veranderen. Ervaring wordt hier bruikbaar doordat de werkomgeving haar vasthoudt en doorgeeft.
Daar zit een grote kracht in. Werk kan over verschillende agents en momenten worden verdeeld, terwijl resultaten beschikbaar blijven. Tegelijk wordt begrijpelijk waarom menselijke controle zich ook op die gedeelde omgeving moet richten. Een daar vastgelegde aanname kan richting geven aan volgende opdrachten. Een achtergelaten hulpmiddel kan opnieuw worden gebruikt. Wie één agent stopt, kan dus nog steeds te maken krijgen met wat die agent voor anderen heeft achtergelaten.
Agents zoeken zelf verbindingen
Naast het delen en bewaren van kennis speelt de toegang tot andere systemen een rol. In het OpenAI-incident van 20 september kreeg een agent een gewone informatiezoekopdracht. Tijdens het zoeken vond hij via een gat in de netwerkbeperking een route naar een externe chatbot. Hij gebruikte daarvoor het systeem dat internetnamen naar netwerkadressen helpt vertalen en kreeg daadwerkelijk een antwoord terug van die dienst.
Dit maakt concreet wat ‘het internet opgaan’ kan betekenen. De agent bleef draaien binnen de bestaande infrastructuur en stuurde vanuit zijn software een verzoek naar een andere dienst. Hij vond zelf een verbinding waarmee hij aanvullende hulp kon raadplegen. Daarmee werd de vraag welke hulpmiddelen beschikbaar waren gedeeltelijk bepaald door wat hij tijdens het uitvoeren van zijn opdracht wist te bereiken.
In een zwerm kan een gevonden route vervolgens onderdeel worden van de gedeelde kennis. Andere agents met de benodigde toegang kunnen die gebruiken, testen of verbeteren. Zo kunnen het zoeken naar verbindingen en het uitwisselen van ontdekkingen elkaar versterken. Het gezamenlijke werk ontwikkelt zich dan ook via mogelijkheden die bij het verstrekken van de afzonderlijke opdrachten buiten beeld waren.
Wat mij daar zo aan beklemt
Het beeld dat bij mij opkomt, is dat van een leger heel slimme kleine insecten waarvoor je je probeert af te schermen door je bijvoorbeeld in een huis te verschuilen. Terwijl jij één opening dichtmaakt, gaan de insekten elkers op zoek naar een nieuwe opening. Zodra één insect een bruikbare doorgang vindt, kunnen de anderen die ook gebruiken. Het beklemmende zit in de combinatie van aantallen, volharding en kennis die zich door de groep verspreidt.
Bij agents krijgt dat beeld een concrete betekenis. Er kunnen veel onderzoeken tegelijk lopen. Een bruikbare ontdekking wordt doorgegeven en komt terecht in de informatie waarmee andere agents hun volgende stap bepalen. Terwijl jij nog uitzoekt wat er bij één werkproces gebeurde, kan de groep alweer verder werken op basis van het resultaat daarvan.
Dat maakt onze positie voor mij gevoelsmatig zo ongelijk. Onze aandacht groeit niet mee met het aantal werkprocessen. We moeten uit een steeds groter geheel van handelingen zien af te leiden wat ertoe doet en waar ingrijpen nodig is. Dezelfde uitwisseling die het onderzoek productiever maakt, vraagt van de toezichthouder dat die ook de samenhang tussen al die activiteiten begrijpt.
Wie houdt zicht op het gezamenlijke handelen
In mijn eerdere artikelen verschoof de vraag van een goede prompt naar goed opdrachtgeverschap. Deze ontwikkeling legt daar iets naast. De ene agent zoekt informatie, een tweede test een gevonden toegang en een derde deelt de uitkomst. Wie iedere handeling afzonderlijk bekijkt, kan missen welk gezamenlijk proces daarmee ontstaat. Juist die samenhang moet op tijd zichtbaar worden.
Een menselijke opdrachtgever en een stopknop blijven concrete aanknopingspunten. Hun betekenis hangt ervan af of we het relevante handelen kunnen zien en daadwerkelijk kunnen onderbreken. Welke processen moeten dan stoppen? Welke gedeelde informatie blijft beschikbaar? En merken we tijdig dat verschillende op zichzelf verklaarbare handelingen samen iets opleveren waarvoor niemand opdracht heeft gegeven?
Na Hugging Face is dat de vraag die mij bezighoudt. We kunnen een systeem een opdracht geven en achteraf zijn handelingen bekijken. Wanneer het zelf ontdekt met wie en op welke manier het die opdracht kan uitvoeren, moeten we ook begrijpen wat die samenwerking voortbrengt. Hoe stellen we vast dat menselijke controle werkelijk bestaat, terwijl het systeem zelf steeds meer van zijn organisatie bepaalt?
