Terug naar Nieuws & blog

Ook AI moet zijn werk laten controleren

Anthropic laat externe evaluatoren dichter bij modelontwikkeling werken. Voor het MKB is de praktische les kleiner: test je eigen taak, grens en foutpad.

Een AI-uitkomst wordt langs vaste testgevallen, kwaliteitsgrenzen en een menselijke tweede blik geleid
Eigen schematische uitleg van het werkproces. Geen gemeten klantresultaat.

Een leverancier toont hoe een aanvraag in enkele stappen verandert in een keurig conceptantwoord. De tekst klinkt overtuigend en de workflow ziet er overzichtelijk uit. Toch weet een ondernemer daarna nog niet wat er gebeurt met een oud document, een ontbrekend bedrag of een klantvraag die buiten het standaardproces valt.

Een goede demonstratie is een begin. Beslissen of AI geschikt is voor dagelijks werk vraagt herkenbare voorbeelden, vooraf afgesproken kwaliteit en zicht op fouten. Dat hoeft geen groot onderzoeksprogramma te zijn. Het begint bij één taak en de vraag welk resultaat het team werkelijk kan vertrouwen.

Kort uitgelegd

Een evaluatie is een vaste manier om te beoordelen of een AI-toepassing aan afgesproken criteria voldoet. Een testset is een verzameling voorbeelden met een verwachte uitkomst of duidelijke beoordelingsregel. Red-teaming betekent doelgericht zoeken naar zwakke plekken en misbruikmogelijkheden.

Een evaluatie van een algemeen model zegt niet automatisch hoe jouw toepassing presteert. Instructies, bedrijfsbronnen, koppelingen en gebruikerskeuzes beïnvloeden het resultaat. Daarom moet een aanbieder modellen testen én moet een bedrijf de concrete toepassing binnen het eigen werkproces beoordelen.

De actuele aanleiding

Anthropic kondigde op 18 september 2026 een samenwerking met Accenture aan voor ingebedde, onafhankelijke evaluatie van geavanceerde AI. Faculty, het gespecialiseerde AI-onderdeel van Accenture, leidt het werk. Volgens de aankondiging gaat het om modelbeoordeling, red-teaming, onderzoek naar afstemming en het testen van veiligheidsmaatregelen.

De evaluatoren gaan binnen het AI-bedrijf werken met toegang die vergelijkbaar is met die van medewerkers. Zo kunnen ze ontwikkeling volgen, beslissingen onderzoeken en mogelijke blinde vlekken signaleren. Anthropic zegt tegelijk dat de verantwoordelijkheid voor modelveiligheid bij Anthropic blijft.

De opzet is nog in ontwikkeling. Er bestaan volgens Anthropic nog geen gedeelde standaarden voor toegang en rapportage, en geen vast financieringsmodel. Anthropic betaalt het werk van Accenture rechtstreeks; de samenwerking is niet exclusief. Beide partijen verwachten minimaal 1 miljard dollar te investeren in capaciteit in de komende vijf jaar.

Dat maakt dit een aangekondigde aanpak, geen afgerond keurmerk en geen garantie voor een specifieke bedrijfstoepassing. De vertaling hieronder is onze analyse voor kleinere organisaties.

Test het werk dat mensen echt doen

Stel dat een administratiekantoor AI gebruikt om gegevens uit documenten voor te bereiden. Een passende test kijkt naar ontbrekende velden, verkeerd overgenomen bedragen, dubbele documenten en verwarring tussen factuurdatum en betaaldatum. Snelheid is maar één onderdeel.

Maak samen met een ervaren medewerker een set met normale gevallen en lastige uitzonderingen. Beschrijf per voorbeeld wat bruikbaar is. Soms is dat een volledig voorstel. Soms is het juiste resultaat een gerichte vraag of overdracht aan een mens. Een systeem dat onzekerheid netjes herkent kan waardevoller zijn dan een systeem dat ieder vak invult.

Dit is een hypothetisch scenario. Tien voorbeelden kunnen een goed startgesprek opleveren, maar vormen geen statistisch bewijs dat de toepassing onder alle omstandigheden werkt.

Bepaal vooraf wat goed genoeg is

Zonder vooraf gekozen grens verandert beoordelen snel in een gesprek over indrukken. De bouwer ziet vooral wat werkt; een gebruiker onthoudt misschien één opvallende fout. Leg daarom vast welke fouten nooit mogen doorstromen en welke correcties binnen de werkwijze acceptabel zijn.

Bij een interne concepttekst kan een verkeerde formulering eenvoudig te herstellen zijn. Een verkeerd bedrag of een toezegging aan een klant vraagt een strengere grens. Noteer ook wat bij twijfel gebeurt en wie beslist. Zo wordt “goed genoeg” een gezamenlijke werkafspraak in plaats van een gevoel achteraf.

Organiseer een tweede blik

Laat iemand die de toepassing niet heeft ingericht een deel van de resultaten beoordelen. Geef die persoon de oorspronkelijke invoer en dezelfde criteria. Een frisse lezer kan onduidelijkheden zien die tijdens het bouwen vanzelfsprekend zijn geworden.

Een AI-controleur kan vaste aandachtspunten nalopen, maar vervangt de verantwoordelijke medewerker niet. Twee modellen kunnen dezelfde bron verkeerd begrijpen. Houd zichtbaar wie het oordeel geeft en bespreek verschillen tussen beoordelaars. Soms moet niet het systeem, maar de beoordelingsregel scherper worden gemaakt.

Test opnieuw na relevante veranderingen

Een toepassing verandert wanneer een bron, instructie, model of koppeling wijzigt. Een eerder geslaagde proef bewijst niet dat de nieuwe versie hetzelfde gedrag houdt. Bewaar daarom de testset en voer de relevante gevallen opnieuw uit.

Noteer versie, uitkomst, gevonden fouten en de persoon die akkoord geeft. Spreek af hoe medewerkers problemen melden en hoe zij tijdelijk teruggaan naar de vorige werkwijze. Continuïteit hoort bij kwaliteit: het team moet verder kunnen wanneer het hulpmiddel even niet betrouwbaar genoeg is.

De BRAIGHT Blueprint behandelt bewijs apart van systeempatroon en autonomie. Een eenvoudige assistent kan goed getest zijn; een technisch geavanceerde agent kan nog volledig onbewezen zijn.

Eerste stap deze week

Kies één proces en verzamel tien herkenbare situaties als praktische start. Leg per situatie vast wat correct is, welke bron nodig is en wanneer AI moet stoppen. Test samen met de proceseigenaar en maak drie uitkomsten expliciet: bruikbaar, eerst verbeteren en nog onzeker. Gebruik de set opnieuw bij iedere relevante wijziging.

Bronnen en actualiteit

Broncontrole en redactionele duiding: 21 september 2026. De praktische testaanpak is Braightminds-duiding; zij vormt geen onafhankelijke certificering of juridisch advies.