communicatie

Onderzoekers en standaardisatieorganisaties zijn begonnen met het verkennen van meer gedetailleerde manieren waarop websites kunnen communiceren hoe AI-systemen hun inhoud mogen gebruiken. Een opkomend concept is de ontwikkeling van gestandaardiseerde AI-voorkeurssignalen die verder gaan dan de binaire ’toestaan ​​of blokkeren’-structuur van robots.txt.

Binnen de Internet Engineering Task Force (IETF) – de organisatie die verantwoordelijk is voor veel belangrijke internetstandaarden – hebben onderzoekers mechanismen voorgesteld waarmee websites specifiekere beleidsregels voor geautomatiseerde systemen kunnen formuleren. Deze beleidsregels kunnen onderscheid maken tussen verschillende vormen van datagebruik, zoals het toestaan ​​van indexering voor zoekopdrachten en het verbieden van training voor AI.

In de praktijk zouden dergelijke signalen kunnen worden overgebracht via machineleesbare metadata, HTTP-headers of configuratiebestanden in de rootmap van een website. Indien breed geaccepteerd, zouden ze geautomatiseerde systemen in staat stellen om sitespecifiek beleid programmatisch te interpreteren en na te leven, waardoor het voor ontwikkelaars gemakkelijker wordt om op grote schaal rekening te houden met de voorkeuren van uitgevers.

Een andere uitdaging bij het beheren van geautomatiseerde toegang is het verifiëren van de identiteit van crawlers. Websitebeheerders gebruiken vaak user-agent strings om bots te identificeren, maar deze identificatoren kunnen gemakkelijk worden vervalst door kwaadwillende actoren.

Om dit probleem aan te pakken, hebben onderzoekers cryptografische botauthenticatiesystemen voorgesteld waarmee geautomatiseerde agenten hun identiteit kunnen verifiëren bij het bezoeken van websites. Eén benadering bouwt voort op HTTP-berichtsignaturen, een zich ontwikkelende standaard waarmee een client verzoeken cryptografisch kan ondertekenen, zodat de ontvangende server de identiteit van de afzender kan bevestigen.

In dit model zou een crawler, beheerd door een onderzoeksinstelling of technologiebedrijf, een verifieerbare handtekening aan elk verzoek kunnen toevoegen. Websites zouden dan kunnen bevestigen dat een bot die beweert bij een bepaalde organisatie te horen, dat ook daadwerkelijk doet. Als een crawler het beleid van een site schendt, biedt de handtekening een duidelijk auditspoor dat de activiteit koppelt aan een specifieke operator.

Het opkomende “onderhandelde web” creëert ook nieuwe mogelijkheden voor commerciële datalicenties. Een mechanisme is gebaseerd op de HTTP 402-statuscode “Payment Required”, die aangeeft dat toegang tot een bron betaling vereist. Hoewel de code historisch gezien beperkt is gebruikt, onderzoeken sommige platforms manieren om deze te gebruiken als onderdeel van geautomatiseerde licentiekaders.

Webinfrastructuurproviders zoals Cloudflare zijn bijvoorbeeld begonnen met experimenteren met systemen waarmee uitgevers aan AI-crawlers kunnen aangeven dat bepaalde content een betaalde licentie vereist. In principe zou een crawler die een dergelijk signaal tegenkomt, automatisch een licentietransactie kunnen initiëren of doorverwijzen naar een betalingsmechanisme. Hoewel deze systemen zich nog in een vroeg ontwikkelingsstadium bevinden, illustreren ze hoe technische standaarden programmatische marktplaatsen voor data-toegang kunnen ondersteunen.

AI-ontwikkelaars implementeren ook technische waarborgen tijdens de data-voorbereidingsfase vóór het trainen van modellen. Veel organisaties gebruiken geautomatiseerde filtertools om gevoelige persoonlijke informatie uit datasets te identificeren en te verwijderen. Een veelgebruikt voorbeeld is Microsoft Presidio, een open-source toolkit die is ontworpen om persoonsgegevens zoals burgerservicenummers, telefoonnummers, adressen en creditcardgegevens in ongestructureerde tekst te detecteren en te anonimiseren. Deze systemen stellen ontwikkelaars in staat om gevoelige gegevens tijdens de data-invoer te maskeren of te verwijderen, waardoor privacyrisico’s worden verminderd zonder dat openbaar beschikbare content volledig uit trainingsdatasets hoeft te worden verwijderd.

Samen illustreren deze tools hoe technische standaarden en marktmechanismen juridische kaders kunnen aanvullen bij het reguleren van AI-datapraktijken. In plaats van uitsluitend te vertrouwen op regelgeving, ondersteunen vrijwillige initiatieven vanuit het internetecosysteem steeds vaker machineleesbare signalen, geauthenticeerde crawlers en geautomatiseerde licentiesystemen. Deze systemen stellen uitgevers en ontwikkelaars in staat om te coördineren hoe AI-systemen toegang krijgen tot online informatie en deze gebruiken.

gegevensbescherming

De Europese Unie benadert openbaar beschikbare gegevens vanuit een breder privacykader dat is gebaseerd op fundamentele rechten. De Algemene Verordening Gegevensbescherming (AVG) regelt hoe organisaties persoonsgegevens verwerken, inclusief informatie die op openbaar toegankelijke websites verschijnt.

Volgens artikel 6 van de AVG moeten organisaties een rechtmatige grondslag voor de verwerking van persoonsgegevens vaststellen. Een van die grondslagen is “gerechtvaardigd belang”, wat vereist dat organisaties aantonen dat hun belangen zwaarder wegen dan de privacybelangen van individuen. De verordening kent individuen ook rechten toe met betrekking tot hun persoonsgegevens, waaronder het recht op verwijdering op grond van artikel 17, dat individuen in staat stelt om onder bepaalde omstandigheden verwijdering van persoonsgegevens te verzoeken. Sommige Europese toezichthouders hebben aangegeven dat deze rechten mogelijk van toepassing zijn op AI-ontwikkelaars die modellen trainen op persoonsgegevens die van het web zijn verzameld, wat vragen oproept over hoe dergelijke verzoeken kunnen worden uitgevoerd zodra informatie in de parameters van een model is opgenomen.

Ook het auteursrecht raakt het gebruik van openbaar beschikbare gegevens voor AI-training. Artikel 4 van de EU-richtlijn inzake auteursrecht in de digitale interne markt staat tekst- en datamining van openbaar toegankelijke inhoud toe, maar staat rechthebbenden toe zich hiervan af te melden door hun rechten via machineleesbare middelen te behouden. Als gevolg hiervan moeten AI-ontwikkelaars die in Europa actief zijn, rekening houden met zowel auteursrechtelijke afmeldingsmogelijkheden als gegevensbeschermingsregels bij het verzamelen van informatie van het open web.

In de praktijk introduceert deze norm juridische onzekerheid voor grootschalige webscraping. Toezichthouders moeten beoordelen of het verzamelen van openbaar beschikbare persoonsgegevens voor het trainen van AI-systemen voldoet aan de toets van het legitiem belang en of de omvang van de gegevensverzameling proportioneel blijft. Europese gegevensbeschermingsautoriteiten hebben deze balans steeds kritischer bekeken naarmate generatieve AI-systemen opschalen.

De EU heeft ook AI-specifieke wetgeving ingevoerd. De Artificial Intelligence Act, die in 2024 werd aangenomen, bevat gerichte beperkingen op bepaalde praktijken voor gegevensverzameling. Artikel 5 verbiedt het creëren of uitbreiden van gezichtsherkenningsdatabases door het ongerichte scrapen van gezichtsafbeeldingen van internet, wat de bezorgdheid over massale biometrische identificatie weerspiegelt.

Deze vereisten staan ​​in wisselwerking met bredere nalevingsverplichtingen onder de AVG, waaronder documentatie, risicobeoordelingen en gegevensbeschermingswaarborgen. Voor start-ups en kleinere ontwikkelaars kunnen deze verplichtingen aanzienlijke administratieve kosten met zich meebrengen. Verschillende studies en brancheonderzoeken hebben gesuggereerd dat de complexiteit van de regelgeving bijdraagt ​​aan de bezorgdheid over de concurrentiepositie van de Europese Unie op het gebied van AI-ontwikkeling en van invloed kan zijn op de locatiekeuze van sommige bedrijven voor onderzoek en infrastructuur.

Naast de debatten over regelgeving is het internetecosysteem begonnen met de ontwikkeling van technische mechanismen waarmee uitgevers en AI-ontwikkelaars kunnen coördineren hoe geautomatiseerde systemen toegang krijgen tot online content en deze gebruiken. In plaats van websites te dwingen te kiezen tussen het volledig blokkeren of volledig toestaan ​​van AI-crawlers, ondersteunen deze tools een meer “onderhandeld web” waarin website-eigenaren gedetailleerde voorkeuren kunnen aangeven en ontwikkelaars hun systemen kunnen programmeren om die signalen automatisch te respecteren.

Veel van deze mechanismen bouwen voort op reeds lang bestaande internetstandaarden en introduceren tegelijkertijd nieuwe protocollen die specifiek zijn ontworpen voor AI-systemen.

debatten over ai

Debatten over AI en publiekelijk beschikbare data beginnen vaak met een fundamentele realiteit: informatie die online publiekelijk beschikbaar is, kan worden hergebruikt en geanalyseerd op schaal of in contexten die de oorspronkelijke uitgever mogelijk niet had voorzien. Het internet bevat enorme hoeveelheden persoonlijke informatie die individuen, organisaties en overheden publiceren voor specifieke doeleinden – professioneel netwerken, maatschappelijke transparantie, onderzoek of communicatie. Naarmate AI-systemen deze informatie op nieuwe manieren analyseren, moeten beleidsmakers overwegen hoe bestaande verwachtingen over openbare informatie van toepassing zijn in het AI-tijdperk, en hoe privacynormen in de loop der tijd kunnen veranderen.

Een groot deel van het openbare internet bevat persoonsgegevens (PII) – gegevens die een specifiek individu kunnen identificeren. Sociale mediaprofielen kunnen iemands leeftijd, werkgever of woonplaats onthullen. Professionele websites vermelden vaak werkervaring en opleidingsachtergrond. Overheidsdocumenten kunnen informatie bevatten over eigendom, campagnedonaties of bedrijfsregistraties. Omdat deze informatie op openbaar toegankelijke webpagina’s verschijnt, hebben zoekmachines deze al lange tijd gecrawld en geïndexeerd om gebruikers te helpen relevante informatie online te vinden.

AI verandert de schaal en de manier waarop systemen deze informatie kunnen verwerken. Traditionele zoekmachines leiden gebruikers naar bestaande webpagina’s, terwijl AI-systemen grote verzamelingen documenten kunnen analyseren en samenvattingen of antwoorden kunnen genereren die informatie uit meerdere bronnen synthetiseren. Deze mogelijkheid kan de productiviteit en het onderzoek verbeteren, maar roept ook vragen op over hoe gemakkelijk persoonlijke informatie kan worden verzameld of aan het licht kan komen via geautomatiseerde systemen.

Sommige waarnemers wijzen ook op de persistentie van digitale informatie. Menselijke interacties omvatten van oudsher veel vluchtige momenten – informele gesprekken, tijdelijke gegevens of vluchtige communicatie – waarvan de meeste in de loop der tijd vervaagden. Het internet heeft deze dynamiek veranderd door duurzame digitale archieven te creëren. Soortgelijke zorgen rezen al toen eerdere technologieën zich wijdverspreidden, zoals fotografie, opgenomen media en online zoekmachines.<sup>3</sup> In elk geval paste de samenleving zich aan technologieën aan die informatie bewaarden of het gemakkelijker maakten om deze terug te vinden.

AI roept verwante vragen op in een nieuwe technische context. Wanneer ontwikkelaars modellen trainen, verwerken ze patronen uit grote datasets in miljarden of triljoenen interne parameters, bekend als modelgewichten. Omdat deze systemen statistische verbanden leren in plaats van documenten direct op te slaan, kan het lastig zijn om de invloed van specifieke informatie na de training te verwijderen. Onderzoekers blijven technische benaderingen zoals datasetfiltering, modelbewerking en verbeterde trainingsmethoden onderzoeken om deze uitdagingen aan te pakken.

Ten slotte omvatten discussies over openbaar beschikbare data en AI vaak bredere maatschappelijke overwegingen. Grootschalige geautomatiseerde analyses kunnen patronen of verbanden aan het licht brengen die handmatig moeilijk te identificeren zouden zijn. In veel contexten levert deze mogelijkheid duidelijke voordelen op – bijvoorbeeld door onderzoekers te helpen bij de analyse van wetenschappelijke literatuur of door journalisten in staat te stellen grote datasets met openbare documenten te onderzoeken. Tegelijkertijd roept het vragen op over hoe innovatie in evenwicht te brengen is met redelijke verwachtingen over hoe persoonlijke informatie die online wordt gepubliceerd, hergebruikt kan worden.

Deze spanningen zijn niet nieuw, maar AI brengt ze scherper in beeld. Bij het evalueren van de rol van openbaar beschikbare data in de ontwikkeling van AI, moeten beleidsmakers eerst bekijken hoe bestaande juridische en regelgevende kaders van toepassing zijn op het verzamelen en gebruiken van openbaar toegankelijke informatie, en hoe zowel individuele belangen als het publieke belang bij technologische vooruitgang worden behartigd.

trainen ai

Kunstmatige intelligentie (AI) systemen leren door enorme hoeveelheden digitale informatie te analyseren. Terwijl overheden debatteren over de regulering van AI, is een centrale vraag naar voren gekomen: Mogen ontwikkelaars modellen trainen op informatie die openbaar beschikbaar is op internet, zelfs als die informatie persoonsgegevens bevat?

Het antwoord zal niet alleen de privacybescherming bepalen, maar ook de toekomstige koers van AI-ontwikkeling. Openbaar toegankelijke websites, open databases, overheidsdocumenten en andere online bronnen vormen een cruciale kennisbron waarop AI-systemen vertrouwen om taal te begrijpen, over de wereld te redeneren en informatie te verifiëren. Tegelijkertijd roept het vermogen van AI-systemen om deze informatie op grote schaal te analyseren legitieme vragen op over hoe AI-systemen persoonsgegevens moeten gebruiken en beschermen.

Verschillende rechtsgebieden zijn deze vragen op verschillende manieren gaan benaderen. De Verenigde Staten beschouwen openbaar toegankelijke webgegevens over het algemeen als beschikbaar voor geautomatiseerde verzameling, tenzij website-eigenaren technische barrières opleggen. De Europese Unie daarentegen legt bredere beperkingen op aan de manier waarop organisaties persoonsgegevens mogen verwerken, zelfs wanneer die informatie op openbare websites verschijnt. Naarmate de mogelijkheden van AI zich ontwikkelen en agentsystemen beginnen te interageren met informatie en diensten via het internet, zullen deze beleidsverschillen steeds meer bepalen waar AI-ontwikkeling plaatsvindt en welke landen de economische voordelen van AI-implementatie zullen plukken.

Beleidsmakers kunnen individuen beschermen en tegelijkertijd het open informatie-ecosysteem behouden dat innovatie ondersteunt. Deze aanpak kan worden gebaseerd op drie kernprincipes:

1. Focus op de output in plaats van op de trainingsinput. Pak schadelijk gebruik van AI-systemen aan, zoals het openbaar maken van gevoelige persoonlijke informatie, in plaats van de verzameling van openbaar beschikbare gegevens voor modeltraining te beperken.

2. Stimuleer transparantienormen voor autonome AI-agenten. Bevorder vrijwillige branchepraktijken voor AI-ontwikkelaars om mensen te helpen begrijpen wanneer ze interageren met geautomatiseerde systemen, terwijl er tegelijkertijd flexibiliteit blijft voor evoluerende toepassingen van agentische AI.

3. Creëer een veilige haven voor verantwoord gebruik van openbaar beschikbare gegevens. Zorg voor rechtszekerheid voor ontwikkelaars die machineleesbare afmeldsignalen van websites respecteren en die geautomatiseerde tools gebruiken om gevoelige persoonlijke informatie te filteren tijdens de dataverwerking.

Het internet is al lange tijd een gedeelde bron van publieke kennis. In het AI-tijdperk is het een fundamentele input geworden voor het bouwen van systemen die kunnen redeneren, informatie kunnen ophalen en effectief met de wereld kunnen interageren. Beleidsmakers in de Verenigde Staten, de Europese Unie en overal elders waar men voorop wil lopen in de ontwikkeling en toepassing van AI, moeten ervoor zorgen dat ontwikkelaars het internet op die manier kunnen blijven gebruiken.

AI-systemen leren door enorme hoeveelheden data te analyseren. Ontwikkelaars trainen AI-modellen door ze bloot te stellen aan grote verzamelingen tekst, afbeeldingen, code en andere informatie, zodat de modellen patronen in taal en andere soorten content kunnen herkennen. Tijdens de training splitsen modellen tekst op in kleine eenheden, tokens genaamd – meestal woorden of delen van woorden – en leren ze statistische verbanden daartussen. Door triljoenen tokens te analyseren, leren deze systemen hoe ze coherente tekst kunnen genereren, vragen kunnen beantwoorden, code kunnen schrijven en vele andere taken kunnen uitvoeren.

Een groot deel van de data die gebruikt wordt om deze systemen te trainen, is afkomstig van het openbare internet. Websites, open databases, overheidspublicaties, wetenschappelijk onderzoek en samenwerkingsbronnen zoals Wikipedia vormen samen een soort digitale gemeenschap – een gedeelde kennispool die de diversiteit van menselijke taal, cultuur en expertise weerspiegelt. Ontwikkelaars combineren deze openbaar beschikbare data met gelicentieerde datasets, eigen materiaal en synthetische data om algemene AI-modellen te trainen. I-modellen.

Openbaar beschikbare data speelt een bijzonder belangrijke rol bij het mogelijk maken van algemene redeneringen. Fundamentele modellen – de grote AI-systemen die moderne chatbots en andere applicaties aandrijven – vereisen enorme hoeveelheden informatie om brede mogelijkheden te ontwikkelen. Recente modellen zijn getraind op triljoenen tokens.<sup>1</sup> Als ontwikkelaars alleen zouden vertrouwen op gelicentieerde datasets zoals nieuwsarchieven of wetenschappelijke tijdschriften, zouden de resulterende modellen een smaller deel van de menselijke kennis weerspiegelen. Ze zouden moeite hebben met het begrijpen van informele taal, regionale dialecten, specialistische technische onderwerpen en alledaagse culturele verwijzingen die wijdverspreid voorkomen op het open web. Met andere woorden, het zouden kwetsbare systemen worden die goed presteren op gespecialiseerde content, maar slecht op de rommelige diversiteit van communicatie in de echte wereld.

Openbaar beschikbare datasets vervullen ook een tweede cruciale functie: verificatie en benchmarking. Betrouwbare AI-systemen baseren hun output op accurate informatie. Open bronnen zoals overheidsstatistieken, openbare registers, open wetenschappelijke databases en gezamenlijk samengestelde kennisbanken bieden breed geaccepteerde referentiepunten – een collectieve ‘grondwaarheid’. Ontwikkelaars gebruiken deze datasets gedurende de hele levenscyclus van AI: tijdens de initiële training, tijdens het finetunen om de nauwkeurigheid te verbeteren en tijdens de evaluatie om te meten of modellen de juiste antwoorden geven.

Deze datasets spelen ook een steeds grotere rol in de ontwikkeling van agentische AI-systemen. In tegenstelling tot traditionele chatbots die reageren op één enkele vraag, kunnen agentische systemen taken plannen, informatie ophalen en acties uitvoeren in meerdere stappen. Om veilig en betrouwbaar te kunnen werken, moeten ze betrouwbare externe informatiebronnen raadplegen. Openbaar beschikbare datasets en open webbronnen fungeren daarom als referentiemateriaal dat agents kunnen raadplegen om beweringen te verifiëren, feitelijke informatie op te halen en de nauwkeurigheid van hun output te controleren.

Om deze redenen is toegang tot openbaar beschikbare internetdata een fundamentele input geworden voor AI-ontwikkeling. Verschillen in data-toegankelijkheid zullen waarschijnlijk de wereldwijde AI-concurrentie beïnvloeden. In 2025 produceerden Amerikaanse organisaties 40 opmerkelijke basismodellen, terwijl organisaties in China er 15 produceerden en organisaties in de Europese Unie slechts 3 – een opkomende ‘modelkloof’ die mogelijk een weerspiegeling is van verschillen in toegang tot trainingsdata, naast andere factoren.²

Tegelijkertijd roept de publieke beschikbaarheid van data legitieme zorgen op over hoe persoonlijke informatie online circuleert en hoe AI-systemen deze zouden kunnen gebruiken. Beleidsmakers moeten daarom een ​​centrale spanning van het AI-tijdperk onder ogen zien: dezelfde publiekelijk beschikbare data die krachtige en breed toepasbare AI-systemen mogelijk maken, kunnen ook nieuwe privacyrisico’s creëren.