Go back

Met het AI-model GPT-NL bewijst Nederland dat je geen data hoeft te stelen om zelf een groot taalmodel te bouwen

62m 50s

Met het AI-model GPT-NL bewijst Nederland dat je geen data hoeft te stelen om zelf een groot taalmodel te bouwen

In deze podcastaflevering wordt Saskia Lensing geïnterviewd over GPTNL, een Nederlands taalmodel ontwikkeld door TNO in samenwerking met SURF. Het model is getraind op specifiek Nederlandse data, waaronder gelicentieerde artikelen van NDP Nieuwsmedia, om een ethisch alternatief te bieden voor internationale Big Tech-modellen. Met een budget van slechts €13,5 miljoen – een fractie van wat bedrijven als OpenAI gebruiken – richt het project zich op zakelijke toepassingen, zoals het ondersteunen van productiviteit in sectoren met personeelstekorten, in plaats van op een algemeen consumentenmodel. GPTNL benadrukt transparantie en eerlijke compensatie voor data-eigenaren, in tegenstelling tot de vaak controversiële datapraktijken van grote techbedrijven. Het model presteert naar verwachting vergelijkbaar met GPT-3.5 voor kernfuncties zoals samenvatten en wordt eerst praktisch getest bij partners zoals het Nederlands Forensisch Instituut, waar ethische en juridische kaders cruciaal zijn. De ontwikkeling maakt deel uit van een bredere Europese ambitie om een autonoom, verantwoord AI-ecosysteem op te bouwen, met aandacht voor lokale kennis, infrastructuur (zoals de supercomputer Snellius) en soevereiniteit, om afhankelijkheid van niet-Europese partijen te verminderen.

Transcription

11496 Words, 64013 Characters

Dutch
In aflevering 12 van de media-innovatie podcast is onze gast Saskia Lensing. Saskia is projectleider van het Nederlandse AI-model GPTNL. Ja, je hoort het goed. Nederland heeft een eigen taalmodel dat is getreend op artikelen van publieke bronnen en verhalen uit Nederlandse nieuwsmedia. Het model wordt gebouwd en getreend onder toezicht van TNO. Techbedrijf OpenAI begon ooit als onderzoekslappen ontwikkelde JetGPT met miljarden aan Durfkapital TNO. Moet het doen met 13,5 miljoen. Een fractie van wat de grote techbedrijf beweren nodig te hebben voor een superslim en rede nierend AI-model. Het model van TNO is bijna af. Hoe goed gaat het zijn? Wat is het doel van dit model? Wie wil dit gebruiken als je ook gewoon toegang hebt tot de topmodellen van Google en Trapik of het Franse mistral? Genoeg vragen voor een urgent gesprek met Saskia Lensing. Misschien wel. De Nederlandse versie van Sam Altman. Bas van OpenAI. Philipp, wat voontje van mijn intro? Over de top. Er is er gewoon kunt. Ik hoop dat je het zelf hebt beschrezen. Ja, ik zou het schemen schemen schemen schemen. Maar er was toch geen woord van gelogen. Dat Sam Altman, dat mag Saskia zelf relativeren. Maar ik ben echt een beetje opgewonner hierover. Omdat ik wekering gewoon binnenkort. In Nederlandse LLM. Die getreent is op specifiek Nederlandse data. Maar dat is toch echt anders als zij dan die andere. En wat ik natuurlijk heel leuk vind in de achterbeschermen. Hij heeft NDP-News-media zich daar mee moeit. Waar ik in bestuur zit. We hebben dus een licensie overheen komt geslooten met alle Nederlandse uitgevers. Van DPEG tot de groen namsten. Om onze bekkatterlok van 20 jaar journalistiek daarin te krijgen. En we zou nog over hebben wat dat betekent voor het model. Maar daar is dus een licensie overheen. Dit is een ethisch LLM. Dat niet op dievstal gebaseerd die afgelopen jaar heeft plaatschannen. Zoals alle big tech modellen die hier gewoon ons zonder vragen gescreepten hebben. En eigenlijk nog steeds zitten te scrapeen. Zonder dat daar heel veel tegen kunnen doen op moment. Dus ik vind dat op twee manieren heel erg interessant ontwikkeling. Een Europees, autonome ontwikkeling. Dus daar moet het over gaan hebben. Gaan we uit of hebben. Maar bij een niet erg zoek mee is skeptisch? Nee, nou ja, nee, want ik. Nou, ik zullen we zo horen. Het gaat er om waar je het model precies allemaal voor gebruikt. En wat het moet kunnen. Nou, we gaan Saske uit bijna. Saske, jij hebt meegeluisterd met de aankommering. Ja? Voet je het goed? Ja, ik ken niet jezelf toch. Ik zou mezelf niet direct dan Sam altijd me noemen, maar ik vond de hoopgeven de booschap dat jullie hebben. En het vertrouwen in GPT NL wel heel mooi. En passend, want wij worden er zelf ook heel antischast van. Ja, en ja, we gaan natuurlijk praten over waar staan jullie nu. Het model is voor een groot de getreend. Je die zijn een bezoep naar Founding Partners, de gebeurt een hele hoop. Maar ik zou toch nog heel even die parallel willen maken met OpenAI en Big Tech. JetGPT van OpenAI had ongeveer 100 miljoen euro nodig om getreend te worden met heel veel data en heel veel rekencapiciteit. JetGPT5, het kenners schatten in dat het ongeveer op een miljard zit om dat model te trainen. General all purpose model. Ja, ja, ja, het van de overheid een kapitalinjectie gegeven van 13,5 miljoen euro. Toch een schijntje, als je dit afzet tegen de duizelingwerk en een getallen van Big Tech. Ja, maar eerst vraagt dat dan zijn, wat deed je besluit om dit project op te pakken en te geloven dat je verschil kan maken? Want dat lijkt me zo moeilijk dat je een relatief klein budget hebt voor iets wat zo groot uitgemeten wordt op dit moment in onze media. Ja, en deze vraag krijg gewoon natuurlijk. Continue, en jij is daar maar gek, daar zit er een half miljoen, wat kun je daar nou mee? Misschien wel goed om het te beginnen met de verduidelijke dat wij niet een nieuwe JetGPT aan het bouwen zijn. JetGPT is een algemeente al model dat zowel voor de consumente marakt als de zaakkelijke marakt als voor heel veel soorten dingen ingezet kan worden. En ook allerlei leuke features heeft, niet alle features zijn even nuttig of noodzakelijk. En wij hebben vanaf het begin af aangezicht. We zien dat er met name een behoefte zit, zaaklijke markt. We vinden het vooral nu belangrijk om onze eeuw te focussen op zaaklijke toepassingen. Want we zien, ik kon het een enorme uitdaging op ons af, die is er al, we hebben personeels te kort. Want onze arbeidsproductiviteit, die moet gewoon omhoog willen we relevant blijven in deze wereld. Eij kan daar een mooie oplossing voor vormen, maar dan zouden we wel heel graag Eij willen gebruiken die relevantes voor ons en die we goed kunnen inzetten, zonder dat we ons daar ongemakkelijk over voelen. Jij kert het eigenlijk eigenlijk een beetje om, heb ik het idee. Want je hebt het over een enorme uitdaging, we hebben een personeels te kort en Eij kan daarbij helpen. Het wel, iedereen die x-prek bang is voor zijn baan, omdat ze denken dat ze weggewerd geconquerenerd. Zo zien we hem niet. We denken juist dat er enorm meer waarde kan zitten in Eij en de mogelijkheden die het biedt. Voor ons ook doen we dit initiatief starten. Voelden ons ongemakkelijk bij de manier waarop ik tegen de producten instekt, maar ook onze afhankelijkheid ervan en onze gebrek aan kennis. Het begrijpt ook wel gewoon noodzakelijk dat je weet hoe je dit soort producten zelf kan maken. Dus heel belangrijk om die kennis zelf te ontwikkelen en ook om niet gelijk op te geven. Het feit dat jij minder een budget hebt, betekent niet dat je geen stap ervooruit kan zetten. En dat is denk ik wel de allerbelangrijkste energie die wij steeds vast houden. Je kan wel de heette uit kijken naar jou, maar de rest heeft meer en het is niet eerlijk en oh laat maar zitten, maar dan kom je geen steek verder met elkaar. Klagen heeft niet zo heel veel zin. En met 13,5 miljoen zijn we heel ver gekomen en dat natuurlijk zijn er wel momenten dat je even twijf voelt met ojeetje kunnen we dit wel moeten we dit wel. Maar op het moment dat je gewoon heel scherp hebt, we hebben dit budget, je gaat terugredeneren, wat heb je? Wat kun je daarvoor doen? En past dat een beetje binnen de ambiissie die we hebben, dan zie je dat er heel veel mogelijk is. Dus we hebben daarvan het begin af aan wel in geloofd dat wij in ieder geval voor de zaaklijke markt voor een aantal kerstaken echt wel een flinkstak vooruit kunnen zetten. En natuurlijk, ze zijn altijd onduidelijk heden en onzekerheden, maar we geloofden er vanavond beginnen van heel sterk in. Ook omdat jullie rekenkapstijds krijgen we gratis in principe bij de snelleers computer, we supercomputer die hier in Amsterdam oost staat. En laatst niet gratis? Oké, nee, nee, nee, zo mooi is het net niet, maar het is wel heel mooi om met serveren en samen te werken. Ja, zij, omdat betreft is dat echt heel mooi dat we daar de kracht kunnen bundelen met hem. Ik denk dat je hier voor de luisteraar moet vertellen, wat zeker? Ja, surf, dat is wat dat nou eigenlijk allemaal is. Zeker, zeker, surf is de ICT-dienst, verlener en leveraar van onderwijs en onderzoek in Nederland. Veel mensen zijn wedstrijden in aanraking gekoven met surfsara of met de snelleers, de supercomputer die in Amsterdam staat. En surf heeft zelf uitgepreiden ervaring ook met het palbe en maken van AI-modellen op basis van publieke waarde. En dat was echt wel een houding en richting die wij heel erg mooi vinden, en ook heel goed vonden passen bij dit onderwerp. En daarnaast hebben ze natuurlijk een flinke expertise op het gebied van High Performance Computing. Dus ja, 1 en 1 was wel heel groot, 2. Ja, dan zijn we toch 88 Nvidia chips, zijn niet het 20.000 van zijn oltmen, maar je kunt er toch wel iets doen op zo'n. Je kan heel veel doen. Ja, bijvoorbeeld een GPTNL-versie 1-trainer. Dat we dus aan het doen zijn, maar we vinden nog heel veel andere onderzoekplaats die met hulp van snelleers getreend worden. Dat is echt fantastisch, heel mooi dat we dat hebben. Wat nog mooi er is is dat zeerf ook samen met TNO en aan het wel andere bedrijven. En vooral ook de regio-nort, samen een AI-factory aan het bouwen zijn. Dus dat gaat ook weer een enorme stoot vooruitbezeken en in de rekenkapaciteit die we hebben in Nederland. Zijn ook initiatieve in Brabant, er zijn initiatieve in Amsterdam, dus er wordt steeds meer gewerkt aan het verhoog van. al die computerkapaciteit en ook de kennis en kunde die we daar hebben in Nederland. Die supercomputer snelleers, voen noemt, naar de natuurkundigen van de breekingswet van snelleers. 88 GPUs, haar 100 Nvidia GPUs zijn, dat is zeg maar de meest geavanceerde chips. De zitter is van 650 in, wel van 400, 30 als ik het hoek te pond houden van die topmodellen. Waarom heb je hier zo'n relatief beperkt deel van die supercomputer tot je beschikking? Waarom niet gewoon de hoshabijn, de hele computer? Nou, dat was budget op en er kon de mensen niet meer betalen. Dat is inderdaad gewoon echt een postenafweging. We hebben een paar budget gekregen, maar dat is natuurlijk ook echt. het is inderdaad een injexie van de overheid, een startkapital. En daarmee moeten we ook gewoon laten zien wat we kunnen. Zo zie ik het ook heel erg. En dan ga je gewoon terugreikende. We denken zo veel. Vindt dat we kunnen verzamelen, zo veel mensen nodig te hebben, zo veel computer gaat wat kosten. En dan probeer je dat allemaal zo te optimalezeren dat je die dert in een half manion uitgeeft en niet daar ver bovenziet, maar ook niet heel veel overhoudt. En hebben jullie nog gekeken, Eiftville? Ook een jaar werkt natuurlijk heel veel met durfkapitaal. Heb je jullie ook nog gekeken? Of jullie ergens nog wat kapitaal wegkonden halen om toch meer slagkacht te krijgen. Dus dat je als overheid zeg van 13,5 miljoen en dan het prije vleer zetten dan ook 13,5 miljoen tegenover. Zeker, daar zijn we nu volop mee bezig. Maar zullen we nu op dit mannen mee bezig? Ja, daar zijn we nu volop mee bezig in deze fase. Waarom niet van af het begin? Nou, van af het begin als eerste ook zijn eerste de skeptis van iedereen, maar nou moeten we dit wel willen en kunnen we dit wel. Dat is natuurlijk een hele grote vraag. Je kan wel de ambitie hebben, je kan wel dat geleden. We hebben er heel veel mee aan het bereiken, maar je moet het wel echt even laten zien. Dat hebben we nu gedaan. Een heel belangrijk stap voor uit was daarin ook de deal die we konden sluiten met NDP News Media. Dus al een data die we nu mogen gebruiken. En dat was voor ons ook echt wel een teken aan de wand dat deze aanpak gaat werken. En dat deze aanpak werkt. Uiteindelijk moet je het laten zien, je moet het bewijzen voor dat je naar de vervolg. En aanpak is dan de samenwerking. Ik denk ik in eerste instantie dat dat werkt. Maar dan heb je nog het vervolgstapt nodig. Vanaf jij, we gaan dit trainen. Komt u dan straks uit waar je op hoopt. Ja, daar de eerste tekenen zijn heel goed. Er zijn twee dingen die je dan moet doen. De eerste plaats heb je natuurlijk je interne metinstrumenten. Dus we kunnen het model langs een aantal medelatten leggen. Die een algemeen beeld geven van zijn performance en hoe goed hij het doet. Maar daarnaast moet je ook gaan uitprobeeren met dat werkelijke klanten. Hoe een model in de praktijk vervoerde. En ik kan jou een standaard wiskunde test geven. Maar dat betekent nog niet dat jij een staat bent om een beruchte ontwerpen. Dus dat zijn twee heel belangrijk stappen. Die interne metinstrumenten zijn we nu langs aan het leggen. Dat laat wel een heel mooi beeld zien. En zeker vol met samenvatten zien we al dat hij in een vroeg stadium van de training net zo goed of zelfs beter doet. En als de Nederlandse teksten dan modellen van vergelijkbare grote. Wij hebben het dan over modellen van vergelijkbare grote. Een kentmodel wordt vaak in gezet is omol, omol 3. Voor de mensen die je het kennen. Dat is een model dat ongeveer eenzelfde hoeveel hij data is getreend. En eenzelfde aantal parameters heeft. Aantal parameters van een model zegt iets over hoe groot het is en hoeveel complexiteit het aankam. Mijn opgeleven? Ja, dat komt het op neer. Dus je wilt geen apples met beelper kunnen. Een beetje zoals je een verbindingenlegd in je hersenen. Kan zeg maar 26 miljard parameters, kan zoveel verbindingen leggen binnen het model. Ja, min of meer. Het is altijd wel een beetje geveilig om de link te maken met hoe het mensel een brein te brein. Ja, niet meer. Ik stap het mei. Ik heb het al zo'n heel bekend neuroscientistoren zeggen dat dat een vergelijking tussen hoe neural en net werken. Ja, iewerker en het brein. Het is slechtste vergelijking, ooit is die je kan maken. Dat heb ik altijd het herhorten genomen. Maar het is wel een paraleel die je kan aanhouden. En de grappes hier inderdaad. We vergelijken het voor de interne evaluaties met modellen van vergelijkbare grote. Maar we kijken natuurlijk ook hoe doet die het dan ten opzichte van die nieuwste generatie modellen. We hebben welvanaf begint afvagen gezegd, het is een succes. Als wij hetzelfde niveau weten te halen deze kern te haken, zoals ChatGPT 3.5. Dus dat was de eerste ChatGPT die uitkomt. Dat zijn in november 22. We hebben deze allemaal onvergeblasen. Die kwaliteit moeten we echt wel minimaal kunnen halen. En daar zitten we op. En nog verder dan die kwaliteit of zit je echt op die kwaliteit? We zitten ongeveer op die kwaliteit. Maar het is wel, dat kan zij. Het is een beetje apples met pieren vergelijken. We willen ook heel graag met klanten in hun praktijk. Context gaan kijken hoe goed functioneert het model voor dat we echt die hele harde conclusie kunnen trekken. Maar het is goed uit. Als ik eruit heb, als ik op vlak gezien zou zeggen, zijn er nog wel veel verder, een paar jaar later, veel modellen meer. Dat haalt het niet bij. Maar jullie zeggen dit model is voor een paar soorten functies gezegikt, dus het is gekomst het reers. En het bevat heel veel Nederlandse onder andere artikelen die ik in Lars hebben geschreven. Veel veel dank. - Veel veel dank. We waren somer van de tokens in de zee. Maar daar zou dat zou dan compenseren dat dan een beetje die extra's die erbij zijn gekomen in de afgelopen jaren bij de grote Big Tech-modellen. De compenseerdeels waren natuurlijk ook heel goed voor. Het is ook het creëren en het eerste stapen zetten in een gezond ecosystem. AI heeft een hele complexe keten. Er moet heel veel data in, computer weet ik wat allemaal. En wij vinden dat dat ecosystem, een ecosystem moet worden waarin onder andere data eigenaren ook mee profiteren van alle ontwikkelingen die er zijn. Er wordt op dit moment heel veel geld verdiend in Silicon Valley met dit soort modellen, met AI, met alle hypes die er omheen hangen. En er lijkt op dit moment nog vrijweinig terug te vloeien naar de eigenaren van de allerbelangrijkste grondstofdere inzitter. Dan bezig ik niets. - Niet bij zei ik wel. Het is inmiddels wat ik wel mooi vind om te zien. Er zijn wel steeds meer bedrijven die de keuze maken om ook licensie die ons af te sluiten en naar tot betaling over te gaan. Het is niet zo, maar dit is wat niemand beteld. - En die beeld boeken uitgevers. Die beeld de barne chips tussen actiespringer bijvoorbeeld. - Exact. Ja precies. En mooi persoonlijk. - Dat gaat wel voor live news. En troop ik het ook iets aan boek oterst geven. - Ja, dat is daar ook een vaste kocht toch? Nee, dat is wel een beetje zo. - Dat is een andere rechtszaak. Ja, exact. Dus je ziet dat er heel veel rechtszaaken lopen, op een mentiel. Het gaat om copyright. Het gaat om dat de data op de machine is gedreerd. En dat is een intellect, mag het eigenlijk niet noemen, maar eigenlijk zijn verspellende graven. Lekker dan zomaar noemen. Dat die zo juist mogelijk is. En met name in het Nederlandstaalgebied. En dat iedereen die daar aan het bijgedragen, dat het dan ergens terugvloeit, die no-how, die kennis. Dus dat is een alwag gelukt. - Ja, het is gelukt. We hebben nu ook met jullie onder andere afgesproken dat er alles wat. en alle betaalde of privaten dat er set ziet in gaan. Die gaan straks de eigenaarde van, die gaan straks meedelen in een deel van de oprenksten die wij geen reeren met dit model. Dus er vindt een compensatiemodel plaats. En dat is twee, dat levert twee mooie voordelen op aan de ene kans. Fijn want dan hebben we een ekosystem opgezet, waarbij we eerlijker met elkaar profiteren van alle potentie die in deze modellen zitten. En tegelijkertijd creëert je ook een incentive, een reden voor andere data eigenaar om ook in te gaan stappen naar de toekomstoep. Ja. - En ze willen natuurlijk door met een groot model en dan heb je toch meer data nodig. En blijft dan het vierkul wat zeg maar dit aanstuur blijft dat TNO? Zou kunnen, want ik kan me voorstellen dat het een zakelijk iets wordt, dat het last gezet omdat daar binnen TNO te houden. Ja, dat zou kunnen. Dat is een heel terrechte vraag die je hier stelt. We zien deze uitdaging ook, want we zullen uiteindelijk ook en we gaan nu ook naar een filmer open rationeede fase. Gappengenoel heeft je eigenlijk dus hetzelfde probleem als dat open AI haalt op geven. Want het is eigenlijk begonnen als onderzoekstinstituut en als als een non-profit instituit. Ja, het is ook niet voor niks dat wij hier dus nu niet direct of nee op antwoorden want we hebben natuurlijk ook heel goed gekeken naar dat voorbeeld. En ook zien wat daar eigenlijk mis is gegaan. Het is vanuit een heel idealistische gedachte gestart en dat is toch best wel afgedreven naar. En wat we nu ook zien, he, is het hele discussie rondom solfinatie, die plaatsvinds. Dus waar die idea daar zijn over gekochtdreigd worden door een Amerikaanse porteim. En daar voelen we ons nu heel erg ongemakkelijk over met ze alle. We willen toch niet dat dat platform in handen komt van een Amerikaanse porteid. We willen al onze gevoelige data daaroverheen laten gaan. Hoe lastig lastig, dus je voelt al de hele stemming en de manier van denken over dit soort ontwikkelingen. Het begin zich toch wel te draaien en dat heeft als consequentie dat wij nu aan het kijken zijn. Natuurlijk die operationeel slagkracht is heel belangrijk. We willen ook groeien. We zien ook heel veel potentie om dit verder op te schalen. Beteer ik het ook dat er een investieringsbehoefte zit. Maar je wilt voorkomen dat er boel uit de straks bij een Amerikaan of een chineester echt komt op het moment dat het een beetje succesvol begin worden. Wat gebruik jullie al het Amerikaanse is? Draai jullie voor wat de servers op AWS van Amazon? Of wat zit er allemaal? Wat geconnecteert is met Amerika? Op dit moment zijn we niks. We hebben nu het model gemaakt. We zijn nu verder aan het Feindjune en we gaan met onze eerste klanten aan de slag. En dan doen we expositie even alleen maar met klanten. Niet het model op hun eigen afgesloten infrastructuur kunnen draaien. Dus daar hoeft geen platform of klaas aan binnen bij te komen kijken. Heb je een voorbeeld van een klant? Is dat het niet? We zijn met een aantal publieke overheid. Of de Nederlandse forensies-instituutbredoelige. Dat is een consortium partner van ons. Ja precies. Ja precies. Ja, ze zijn vanaf het begin of aan betrokken en zoals surf. Er reden dat we met het NFE ook samenwerking zijn aangegaan. Is niet alleen omdat ze heel veel ervaring hebben met taalmodellen en AI-modellen. Maar ook vanwege het hele complexe context waar binnen zij die modellen inzetten. Namelijk forensische opsporing. Daar moet je wel goed nadenken over de etische implicaties en wettelijke kaders. Dus op dat betreft zij een hele strengen partner die op hele strengen wijzen, meekijkt en ook tegen hele concreeten problemen aan. Dat is als zij zomaar AI zouden inzetten. Dus dat geeft ons ook echt een extra reden om dingen heel goed te doen. En dat zijn nog geen. Dat enervie is ook waar jullie het gaan uitproberen of aan het gaan. Ja, we gaan met NFE zeker. Het modell ook verder uitproberen op hun lokale context. Ook om te kijken of dat uiteindelijk misschien in hun praktijk ingezet gaat worden. Dat blijft wel in gewikkels. Dus een in gewikkelde context, dus dat is ook aan het NFE om daar de eigen afwegingen in te gaan maken. Waar de meeste launching customers waar we mee werken zijn partijen in de publieke overheid, publieke sector, alke partijen in het privaten sector. Dat geeft ons een hele mooie kans om verder te kijken waar werkt het en waar werkt het niet. Dat is ook de hoop voor de toekomst van het model en een explatatie dat Nederlandse ministerie en publieke instellingen die zullen misschien de verplichting krijgen of ten duur om niets met de Amerikaanse modellen te werken, maar met eigen modellen. Dat zou door ons wikkels kunnen worden, allemaal in het kader van de Europese autonomie. En er zijn nu ook wel juiskezes waar geen generatieve AI ingezet mag worden omdat het omheden gevoelig in informatie gaat of omdat mensen daar heel ongemakkelijk bijvoelt. En daar wil je al vast met een alternatief kunnen komen. Maar het is leuk als je een alternatief hebt dat het een beetje doet, maar het is wel cruciaal dat het alternatief niet alleen maar goed gaat. Ja, veel meer waarde kan toe. Ja, als licentie afsluiten, mogen wij het model ook gebruiken en er wordt hier een bedrijf overgepraven. Daadelijk als we een GVT in hebben, dat zal jouwst muziek in de oorklink. En dan willen we er ook mee gaan werken, maar dan krijg je natuurlijk ook wel heel kritische blikken. Dus onze vraag is natuurlijk hoe goed is het model en waar is het goed in? Het is goed in samenvatten, in versimple en in rach. Voorzoveel hebben we dat voor de luisteraars hier zegt rach-or-retrieval-adlementedgeneration. Zin feit een zoekmachine, zoals we die kennen, gekopelt aan een grote model, in dit geval GPTNL en je eigen documenten. Dus dat psychtevoordat je heel makkelijk door je eigen documenten heen kan zoeken, vragen kan stellen en daar informatie uit kan trekken. Daar hebben we GPTNL opgeoptimaliseerd, dus op dat samenvatten we versimple en die rach. En wat is dat versimple dan? Kan je daar daar een voorbeeld van geven? Ja, wat je vaak ziet is dat stel, jij hebt een juristokument en je wilt dat in gewone mensen taal aan mij uitleggen. Dan is dat fijn als je daar een stukje automatisering in hebt voor veel overrijspartijen, is het belangrijk om naar de burger te communiceren op B1 te halen die vol. Ik ga zo maar door, dus daar zijn we mee bezig. Dus dan zullen we er gewoon een knop op de site maken met maakt dit makkelijke leesbaar voor mij en dan klik je erop en ongebeurd dat. Dat zou een hele mooie uitkomst zijn, we dat dus we gaan nu ook kijken met een overrijspartij. Hoe goed werkt dat? Ja, we gaan daar met. Wij hebben bijvoorbeeld op een van ons website, een webgief van het laatste news daar. Kan je al vragen stellen aan het news en dat is uitruidgebasiert op de eerder gepudiseerarticle van die title. Dat zie je ook over er elders in de wereld gebeuren en dat zou die bijvoorbeeld ook vrij goed kunnen. Dat is een typische rachoplosing. Ja, precies. En daar gaan we volop op testen en valideren de komende mennen. Misschien een kleine annulseering bij de laatste news hebben ze voorgepog meerdere vragen. Dus je kunt niet lettelijk zelf praten met het news, maar het zijn vragen zeg maar die de redactie interessant vindt op basis van een iD daar dan antwoord opgeeft. Ja, het is eerst stapen ook omdat er natuurlijk nog helemaal niet zo zeker zijn van de uitkomsten. Dan is het nagekeeg naar gekeken moet worden en moet het er al zo gevoelig doen. Maar dit is wel iets wat in de toekomst van media gebruikt best belangrijk zou kunnen worden. Ja, maar het is ook een hele veilige weg om het eerst iets meer afgeschermte te doen met elkaar. Dat is ook precies de stapen die je wilt zetten. Want het is niet alleen je taalmodel, het is ook een proces waar je daarom heen in de richt. Waarom zou je het GPD taalmodel juist heel goed zijn in dat rack? Ik zou niet willen zeggen dat het juist heel goed is in rack ten opzichte van andere taalmodellen. Kijk, die samenvattingen, die snap ik. Het versimple van taagbruik ook want het gaat heel erg over dat taagbruik, maar dat retrieval, dat is ook iets wat je via de andere modellen kunt doen. Dat we nu al toe op onze eigen artikele het enige is dat we gebruiken een AI dat niet copyright technisch beschermt of wel legitim is. Dat dan zwaar heel veel haken en ogen aan zitten. We weten voor een heel groot deel niet hoe het ding werkt. Bij jullie weten dat het waarschijnlijk nu ook nog niet wel een tabel zag, waarin jullie echt met copyright werken. En dat jullie niet alles gescrapt hebben. En het snap je dus alles is dat in de puntjes geregeld, dus dat is ook prettig om aan onze abonnees en lesen ze uit te leggen van wij. Wij schade hiermee niemand, dat zou een hele verheer zijn. Max Haafler, exact. Ja, ja. Ja, zo zou het kunnen noemen. Misschien zouden jullie moeten toch naar een nieuwe naam begrijp, ik wens we hebben vernomend dat jullie naam gekapt is door een boef. Kijk jullie weten iets over jou? Ik zou het niet zo willen we schrijven. Ja, nou, hij heeft niet fout gedaan. Dat is gewoon onze eigen gebrek aan ervaring. Dat ik het zou zeggen, dus gewoon doen we fout van ons. Maar jullie hebben ze gebeurd dan? Ja, wij hadden heel trots aangekondigd wij krijgen een stuk subsidie om GPTN el te gaan bouwen. Wat een feest. Maar we waren vergeten om een website naam en door mijn naam te registreren. En dat was niet zo handig. Dus een ander partij heeft dat zo'n wel gedaan en dat is GPTN altijd ontkom geworden. En tot spring, dat mag iedereen doen. Dat is. Dat op zich ook een waardloosje weer relastraa is. Op zich optiever aan. Het had slechtig gekomen. Dat is er nu. En als ik op jullie echt de site kom, dan staat er een waarschuwingsdie. Ja, ja. En zij bieden ook abonnementen aan die manie bestaan. Dus ze proberen ook al mensen op te lichten. Nou, ik zou het geen oplichting willen noemen. En we lichten bestaan die die eens te wel. Kijk, het staat iedere partij vrij om dit soort dingen in de markt te zetten. En als wij die naam niet hebben gedraaid markt of hebben geregistreerd, dan mag dat gewoon. Ze kan geen aangevtewelde politie doen, dat is niet. Nee, nee, nee. Als zij onder jouw naam eigenlijk verkoop van niet bestaande diensten, dat gebeurt ook veel met de B-Eners die daarvoor gebruikt worden. Die spannen wel recht zaken aan. Ja, we hebben wel een season de 6 letter gestuurd, zoals dat van het. Dus dan vragen geen partij, je wil kunnen meestoppen. Maar uiteindelijk doen ze helemaal niks verkeerds. En dat is gewoon echt onze eigen fout geweest. Als jij oversteek zonder om je heen te kijken en je wordt aangereden, dan kun je dat niet aan de andere chauffeur gewijden. Ik vind dat eigenlijk onbe. Dat is echt iets wat. Ik begrijp je echt op een niksval. Als ik een initiatiefje begin of een bedrijf in het eerst dan ben ik door zekken, is hij hier wel vrij over dit? Hij is nu ook ja. Dat is weer de wacht geluurd. Maar zoals ja, jullie denken, jullie zijn dus ook op zoek naar een nieuwe naam. Is er iets over bekend? Kan je die onze vergelen? Dat is ons vergelen. Ik ga hem nog niet delen. Om alle redenen hebben we nu wel een beetje. Onze les geleerd. Hij is inmiddels geregistreerd. We hebben het twee marken aangevraagd. Dus dat komt binnenkort. Dus ga dat nog even niet delen. En die is een harkhafelar. Het is geen markthafelar, maar dat is het enigeel dat ik kan keren. Het zou wel een heel goede naam zijn geweest. Ik wil even terug naar het model. Want daar zijn de heel veel luisteren. Ik denk dat ik heel nieuws schierg naar. Hoe kwam je nou tot dit idee? Hoe kwam je aan de mensen? Hoe kwam je aan de data? Hoe kies je welke data je wel gebruikt? En wat je niet gebruikt? Je hebt ook synthetische data gebruikt. Daarvan vragen, hoe kom je daar dan aan? En wanneer voldoet dat aan de mepaalde kwaliteit? Dan hang je nog gewichten aan de data. Van welke data laat je zwaar te tellen in een initigval neem ik aan dat dat de Nederlandstalige data zijn? Dat ik het goed heb, maar hoog werd, 10% van de data is Nederlandstalig. 70% van de data is pakwech Engelsstalig. Dan zit er nog iets van 25 tot 20% germanse talen zitten erin. Koden, met name. Koden, ik dacht germanse talen en dan nog 5% synthetische data. Dus die germanse data, wat we. Hij zit ongeveer zomind elkaar. Dus wat we hebben, is ook data uit bijvoorbeeld duitsen of deensen context. Dat is een context die heel erg lijkt op de Nederlandse context. Die hebben wij vertaald naar Nederland en die hebben wij ook toegevoegd aan de data set. Dat is maar een klein stukje, maar dat is vooral ook om te kijken. Levert dat ook hogewaardige Nederlandstalige data op die het model beter maakt. Deze moet de oveningen uitproberen. Dus daar hebben we in de data ook meegexperimenteerd en daar ook een stukje van toegevoegd. En we hebben er ook softwaardkoden bijzitten. Alle lijn onderzoeken laten ook zien dat je model wat beter functioneert als die ook heel veel programmaën herkoden heeft gezien. En hoe kom je aan die koden? Want de Nederlandstalige artikel die snap ik, die leveren hebben bijvoorbeeld aan. Maar de koden zonder dat je de ene licentie kunt gebruiken. We hebben juist heel goed gekeken naar welke data we wel gebruiken. En onze duurde de Jones gedaan is heel goed gecheckt. Welke licentie informatie zit er op, is die bekend en staat die ons toe om een model te maken dat we vervolgens ook mogen gaan exporteren. Dat zijn allemaal checks die we doorlopen. En voor die koden zijn er heel veel data sets beschikbaar op de internet die expecieert als licentie hebben dit mag gebruikt worden voor dit soort doorleimden. En van die 13,5 miljoen, waar gaat nou het meest geld naar toe? Hoe, wat is de verdeling aan rekenkracht, aan licentie overeenkomsten? Mensen die je betaalt, die in jouw team zitten, ik weet niet hoe groot jouw team is. Ik weet toch niet waar je die mensen vandaan hebt die ei-designers, maar ze zien er allemaal slim uit op de site. Wat, wat kun je daarover vertellen? Ja, we hebben in deze fase alle mensen vanuit Teno, vanuit Surf en NFE bij het project aangehaakt. Ik denk dat we met zo'n stuk of 20 en 25 mensen hier aan werken. Het zijn niet alleen en generaars, maar dat is bijvoorbeeld ook de juridische afdeling. Dat is onze marketing en communicatie, het zielstim, onze business developers. Er zit een hele schil omheen. Dus die mensen die liepen gelukkig. We hebben het geval rond bij onze organisaties. De systein niet op de payroll. In de zin dat ze betaald worden door van die 13,5 miljoen. Daar worden ze door betaald in de daad. Dat wil een gedeelte van de subsidie. Ik denk dat we zo'n 4 tot 5 miljoen hebben uitgegeven aan rekenkracht kosten. Dat is de snelies. Ja, dat zijn er nou te kosten voor de snelies. En dan de rest gaat met name zitten in de persoonhedenkosten. En hierin daar ook wat reiskosten die we hebben. Want we vertellen ons verhaal ook door heel uralpahien. De licensie zijn vooral nog geld. Ja, we gaan pas rekening lopen, ze ook echt serieus geld wordt verdienten. Dat verwacht we ook niet zo snel. Klopt, we hebben geen boter bij de vizpetaald. En dat is de aanpak die een aantal grote partijen wel kunnen doen. Dus die kunnen data sets afkopen. Dat is honderd en miljoenen. Dat geld hebben wij eenvoudig weg niet. Dus we moesten naar een ander model. En dat is inderdaad. Zodra wij inkomsten beginnen te genereren dan vloeiter een stukje terug. En kun je me ook uitleggen? Want jullie vals mij is het raamwerkertframewerk waarop jullie werken. Het werken is van Lama 3 ontwikkeld de meta. En daarboven op hebben jullie een foundation model. Getreend via snelies en alle data die wij hebben geleverde. Hoe werken die twee samen? En als het basiert is op dat Lama model wat eigenlijk open source is. Maar toch ook voor een heel goede deel getreend is op met. Nou, wat is het eigenlijk gescrupte, materiaal, common crawl, data. In hoe ver en bij je dan nog cijfer? Goeie vragen. Het is daar denk ik belangrijk om het verschil duidelijk te maken tussen. jur recepten je taart. En wat je bij veel initiatieve ziet is dat ze continuous pre-training doen. of blijven doortreinen op een bestaandmodel. Dus ze pakken een bestaandmodel. En dan gaan ze daar op verder doortreinen met hun eigen data set. En dan heb je in dat risico dat je alle jurische kwesties overerfiet. Ja, precies. Dat hebben wij niet gedaan. En wij hebben alleen maar het recept genomen. Dat meta heeft gebruikt om zijn modellen mee te treinen. Dat recept mag iedereen gebruiken. Dat je alpelt daart wil bakken. Dan kun je dat gewoon gebruiken. Maar we hebben het helemaal van of scratch. Dus helemaal van of de grond of aan zelf opgepouwd. Dus we hebben dat hele fundament zelf gemaakt. En als fundament is alleen maar gebouwd met data die je mag gebruiken. en inderdaad op basis van code en recepten die we mogen gebruiken. Ja, ja. Het is interessant, hè. Het is zo gevoelig meegekeken. Het is wel een serieus partij. Absoluut. En dat heb je ook nodig. Je bent met iets heel nieuwsbezig. Je hebt ook een flinke ambitie hebben we met elkaar gesteld. En dan ook de ambitie laten we gewoon eens kijken hoeveel we kunnen komen. Als we binnen de wettelijke kaarders blijven. En sommige kaarders zijn vrij nieuw. Of het is allemaal even een beetje spannend. En juist om te kunnen innoveren, moet je wel een beetje. begrenzen durven te verleggen. Dus we gaan zeker niet buiten lijntjes kleuren. Maar we gaan er ook niet heel strak, heel verzichtig, nixt uitprobeeren. En dan heb je wel iemand nodig die daar echt vanuit de autoriteit. en ook vanuit heel veel ervaring met je meekan kijken. En op kan adviseren. Ja. En waarom leid je dit project? Wat maakt jou hier die ideale projectleden van? Wat kan je die zo over je achtergrond? Nou, ik ben taalwetenschapper van achtergrond. Dus zo, ik ben een beetje mijn ding. Voor de taalmodellen, ja, precies. Ja, en eigenlijk niet. Er is ook een bekende quote. Volgens mij kwam die bij IBM vandaan. Want iedere keer als je een taalwetenschapper ontslat, dan wordt je de taalmodell een beetje beter. Dus je moet je vooral niet laten beperken door de taal kundige inzichten. Nee, maar ik heb er zonder goede ingrapen. Het is ook een beetje organisch zo gegaan. Natuurlijk altijd met taalenspraaktechnologie bezig geweest bij T&O. En toen we op het idee kwamen, dan moet ik met name, ik heb de collega's Selmer Smith en Olaf Viscar bedanken. Stonden in een pijn koffie-apparat. Chatgipitie was overal aan het rondzingen. En toen zijn ze al maar ja, we moeten gewoon ook een Nederlands model gaan bouwen. En toen dacht ik eerst, ja, ik ben gek. Praten we iets verder en het dacht hij ja verdoel hij. Dit is eigenlijk wel een heel goed idee. Laat het we kijken of we die subsidie binnen kunnen halen. Ze zijn aan de slaggegaan. En juist omdat je vanaf het begin af aan het rocken bent en ook met die taalenspraaktechnologie als het veel hebt gedaan, weet ik ook gewoon goed waar de pijnpunt er zitten. Ook al jarenlang hadden we het gevoel. Ja, het werkt al maar niet zo lekker voor het Nederlands. Het Engels gaat ook keren, maar het Nederlands, het wil je wel alle mogelijkheden zien en wat die technologie kan gaan betekenen. Maar dan is het ook kun je ons vast ook heel goed uitleggen. Wat het verschil is tussen een groot internationaal model, dat het vrol op Engels daar een tekst is, treint en jullie model, wat de heel speesfiakedie Nederlandse input heeft. En je weer bevoggt mij onze 20 jaar artikelen ook nog wat zwaardig gewogen omdat jij misschien zeggen, maar het scheef van behoorlijke kwaliteit zijn vergelijken met zomaar gescrupte dingen van social media. Zeker, dan zit ook geen social media data in ons model. Dus we scrapeen niet onregmatig. Maar wat de grap is en zo zo ook, we hebben best wel wat kwaliteitsfilters aan het begin gezet. Dus sommige social media, zo, je misschien mogen scrapeen, maar dan moet je afrageven of je dat wel echt in je modellen wil hebben of je een Reddit thread daarin of een 4chan. Wij zeggen van Doem maar niet. En wat we laten hebben gedaan, nu die data heeft het model een aantal keer vaker gezien. Dan de andere data zets juist ook om goed de Nederlandse taal en nuansen en Nederlandse waarde meter krijgen en nieuwsfeiten. Die zijn ook heel belangrijk, maar je wil ook graag dat het model een beetje kennis van de wereld heeft. Het zou heel raar zijn als het model straks niet weten wie de koning van Nederland is. Ja. Dat zou heel vreemd zijn. Dus wij dat wil je daar heel graag in hebben. Dus daar hebben ons hard voor gemaakt. En wat het verschil maakt, zeker toen we begonnen, is ook heel erg het beeld. Ja, ja, ja, ja, ja. Als je het model heel goed Nederland wil laten gebruiken, dan moet je er ook voor zorgen dat je de goede hoogwaardige Nederlandstaal een data instopt. Dus we zijn echt vanuit die overtuiging aan het slag gaan. Maar ik denk dat in de toekomst bij jullie een betere Nederlandse zin ik krijg, dan bij JetGPT of Gemini? Niet per se. Nee, nee, dat is gewoon hoe het is. Die modellen die je net noemt, die zijn ook wel heel hoge kwaliteit. Die doen een aantal dingen heel goed. Dat zijn ook vlekkeloos, Nederlandse aan het produceren. Soms vraag je een beetje af of de tonevoys, de manier waarop ze zich presenteren, wel heel erg passend is in de Nederlandse context. Het voorbeeld dat wij hebben is dat we dus gewoon heel even in dat de nieuwsfeid, maar ook dus wel heel veel saaienamtelijke documenten en zakelijke documenten met mijn meegegeven. Want we willen dat model juist ook in die contexten van waarde laten zijn. Dus het model hoeft niet een flitse, een CV voor jou te kunnen schrijven, maar moet wel in staat zijn om een aantal versnellingen in arbeidsproces te kunnen. Ja. En het feit dat jullie heel veel engels ook tot trainingsdaten, dus eigenlijk nog meer dan Nederlandse, hoe werkt dat dan op elkaar in? Waar heb je dat voor nodig dan? Ja, ze zijn het gewoon heel belangrijk dat je taal model voldoende teksten ziet, omkrachtig te kunnen zijn. Je moet gewoon een zimpel weg, heel veel data aan dat model voeren. En we zagen geen enkel scenario voor ons, waar binnen Nederlandstaanige data een voldoende grote hoeveelheid zou kunnen opleveren, om een model te kunnen te reenen dat het enig sindsbruikbaar is. We moesten daar gewoon ook op zoek naar andere data en bronnen. Daar bovenop ook in gesprek met mogelijke eindgebruikers, zo veel duidelijk gebleken dat we in de Nederlandse zakelijke context niet alleen in het Nederlandse ook wereren, maar ook heel veel in het Engels. Dat is ook heel nuttergetouw om ook te hebben. Dus als GPTNL geen Engels zou kunnen spreken, dan zou die in mijn licht ook een stuk minder bruikbaar en nutterge zijn. Wij dachten dat het specifieke Nederlandse context, dat is wel een extra pluspunt. Dus niet zo zeer. Absoluut. De formulering van het Nederlandse als wel gewoon de inhoud van de antwoorden, misschien iets nou kunnen zijn of iets meer, op Nederlandse context ja toepasselijk. Absoluut. En daar gaan we in de komende tijd ook goed testen met verschillende partijen of we kan niet beloofd kunnen voldoen. Ja. Maar dat is net wel echt het sterker van moeder wat we nu hebben en wat we ook een beetje terug zien. Als we me na een aantal vragen stellen over Nederlandse context, dan komen er heel veel dingen terug die in het dat in Nederland zou aanvoelen. Hij weet wat een kring voor je haar dag is, hypotheker en te aftrekken noem maar op. En gewoon de zakelijke context is het belangrijk dat hij de ins en ouds van Nederlandse normen waarde, maar ook afspragen kaarders goedkend. Ja. Wat ik veel heb gelezen bij die grote modellen van OpenAI en Gemma is dat ze best wel veel soort van human feedback loop nodig hebben. Human feedback, free enforcement, ik weet niet precies wat de term daarvoor is. Is dat bij jullie ook spraken van of is dat bij jullie minder omdat jullie minder meer een hogere kwaliteit data hebben? Nou, twee ledig. Dat is een fase van de training waarin je een soort AB test met een model doet. Dus dan laat je een aantal antwoorden genereren en dan kun je aan een mens, maar ook aan een taalmodel vragen welke van deze antwoorden is beter. Dus mensen doen dat tegenwoordig met hulp van menselijke feedback, ze doen het met hulp van AI-feedback. Gaan wij ook fijn neentageren. En daarbij is wel belangrijk om te vertellen dat wij in de fase die daar net voorzit. Ook met een aantal menselijke annotatoren hebben gewerkt. Dus wij hebben daar met een aantal partijen samen gewerkt om ook data sets voor ons te laten maken. Die in het hele vandaan. zijn voor de taak die wel ik graag willen uitvoeren. Dus we hebben ook een partij gevraagd om ons te helpen. Spinnen ei met het maken van hoogwaardige samenvattingen of met versimple teksten of Q&A's, dus met feitenvragen en daar het juiste antwoord op, zal we dat terug kunnen voeren aan het modelen. We vonden het daar heel belangrijk om teneersten met een Nederlandse partij samen te werken, om ook te bedrijven in Nederland verder te kunnen stimuleren, maar tegelijkertijd ook om het kwitatief hoogwaardige data te maken en dat niet zomaar uit te besteden aan NLM of aan Lage Lonelanden. Maar het eindelijk zoi je daar ook een stukje automatisering met A&E in willen aandringen. En nu wil ik graag een visiewelend weergraven van hoe dat nou eigenlijk werkt. Dus je hebt je data bij elkaar. Ik zie dat voor me dat je een paar mappjes hebt staan op een harde schijf. Die heb je dat, heb je allemaal bij elkaar 300 billion per meter. En eigenlijk het minimum om een soort van 3.5GPT redoneert model te krijgen. Je woont dat ze echt het minimum en daarboven moet je gaan zitten als je echt een heel groot model wil hebben. Je gaat naar Stnellie is, daar hang je je harde schijf aan. Ik stelde me maar zo voor en je drukte te knop en je zegt van nou gaan maar lekker rekenen. Je was er bij, maar hoe gebeurt dat? Hoe gaat dat? Wat zijn de stappen? Ja, even een groot stappen die beginnen al voor dat je op die knoptrukt. En ze hebben heel veel data binnen gekregen. Die data die moet je vervolgens verder gaan cureren, zoals wij het zeggen. Dus je wil daar bijvoorbeeld vloekwoorden uithalen. Je wil dat normaaliseren, zet daar geen gekke tekentjes tussen staan omdat je een encoding error hebt, dat je er op website ziet. Je wil daar ook een bepaalde buckets van maken. Dus wordt je net zij, onze data is heel hoogwaardig, geeft het model vaker gezien. Ze hebben ook in die filters goed gekeken wat is dan kwalitatief hoogwaardige data. En die hebben we dan ook een soort van vinkje meegegeven. En heel belangrijk, alle privacy gevoelige informatie eruit. Dat is cruciaal als je aan de AVG wil houden. Daar hebben we ook al de persoonstgegevens van niet publieke personen eruit gehaald. Ook uit de newsartikelen. Dus alle mensen die daar geintvuurd worden, die halen eruit, alle nemen? Ja, we halen daar vrijwel alles uit, behalve mensen die in eigen Wikipedia pagina hebben. Dus we hebben daar gezegd publieke personen die laten we in de data staan en dan alleen de informatie die over hun publieke rol gaat. Waarom het is wel heel belangrijk dat het model ook een stukje wereldkennis heeft. En als het model geneeidssnapt wat een naam of een adress is, dan wordt het heel lastig. Als ze niet weten wie de koning van Nederland is, dan wij willen we ernstig aan de bruikbaarheid van het model. En dan heb je heel veel CO2-lucht in geschoten voor iets wat totaal nutteloos is. Dus dat vonden we niet meer verantwoord of proportioniel. Oké, en dan? Dat is dan heb je de data. En dan ben je al een paar maanden mee bezig, lijkt mij. Ja, in het allemaal. In het dat staat dan flink te ronken ook op de snennie is over hun's en dan moet je die data omgezetten van taal naar cijfers. Dat zijn de kans om machine alleen maar met cijfers erkenen. Ik kan niet lezen, ik kan niet lezen. Nee, ik ben gezien, je doet een soort vertaal slacht. Dus mijn naam wordt in 1, 3, 4, 5 noem maar wat. En dan gooien je in de machine en dan gaat die rekenen. En waar je hem eigenlijk loud doen, ja, dat dan heel vaak door al die teksten heen lezen die die heeft gezien. Hij kent zelf die getal dat je stoot. Ja, in de data. Dus het is wel weer een zoon. Dat is een heel interessant proces. Er zijn op YouTube heel veel leuke tutorials te zien die ook uitleggen wat daar precies achter zitten. Dat laat ik van hard aan. Waar leuke is, waar model gaat dus langs al die cijfers en die gaat dan leren welke woorden of welke cijfers dus in Koning. Welke volg heel vaak op elkaar. Dus als ik zeg, de dan kan tafel kan daarnaast aan. Daar kan de meisje, dat is niet correct. Dus dat leert die dan af als het ware. Zo leert die gaande weg wat de distribuutioneel de kenmerken van taal zijn om eventjes heel technisch te maken. Dus welke woorden komen vaak na elkaar voor? Wat zijn logische patronen? Wat klinkt lekker Nederlandse? Wat klinkt lekker Engels? Dat heeft hij dan heel goed geleerd. En dat is de eerste fase. Dat duurt een paar maanden. Dus dan gaat hij er heel over al die teksten heen en dan leert hij gewoon heel goed Nederlandse Engels praat. Dat duurt een paar maanden om te rekenen. Dus die computer die 88 GPU's, op basis van die computerkrachten, daar gaat hij de hele doel heen en gaat hij verbanden leggen en dat wordt zes meer. Hij gaat al die nurellen netwerken leggen en daarin ontstaat langzaam aan een soort van een klein modeletje. Het eerste foundation modeletje. Oké, dus jij hebt die knop. Dan gaat hij rekenen. Wat ga je er dan ook naartoe? Ga je dan ook tussen die zoemende serverse rondlopen, omdat je denkt, oh ik wil weten hoe dit gaat. Ja, er ruimte is niet zo hard om te betreden, maar ik heb er in de beeld wel eens een paar keer gestaan en ook die lampjes zien knipperen dat is dan heel gerustelend. Nee, het is natuurlijk al gewoon verbonden met netwerken. Dus onze mensen zitten gewoon van achter de laptop. In de daad de sneljes in de gaten te houden. Dat was leuk. Als je zo aan het trainen bent, dan wil je ook in de gaten houden dat alles goed loopt, de hardware controleren, de status en ook traint het model nog wel de goede kant op. Dus dat was al een heel baby-sitschema. En dat was de avondur weekend, dat was altijd wel iemand die de machine is en de boel in gaten hield. Ja, want dan heb je een soort van dashboardje krijg je van surf om te checken hoe het loopt en dan voor alles grijd. Ja, dus dat is wel een goed en de gaten. En dat ging ook gewoon in de weekend door. En dat is natuurlijk ook tijdens de zomerperiode, vond dit allemaal plaats, dus het was ook even zoeken met elkaar wie je ze meneer op vakantie. Maar hij heeft de team echt heel aan te schast de meest gekke uren. En wanneer is er dan een moment van op iets of iemand of de computer aangeeft, bij we zijn er voor z'n half procent? Want als je scopieeert, dan zie je het balkje loopt tot 100 procent. Maar hier, je kunt hem eindeloos later rekenen. Ja, ja, je hebt een aantal inkatoel om te kijken. Is die nog wel aan het leren? Er hadden we bijvoorbeeld de los. Dat dat zegt iets over hoe verbazt is het model dat hij bepaalde woord combinatie stegen komt. Je laat hem ook wat taak uitvoeren tussen door en dan monitore je gewoon een beetje. Is die nog op de juiste weg? Is die nog dingen aan het leren? Zie we dat een bepaalde kurven nog om laag gaat? Zie je dat hij beter wordt op bepaalde taak. Ja. Nou, dat hebben we de tijd in de gaten gehouden. En aan de andere kans was het ook gewoon heel praktisch. We hadden voor er een x aantal uren aan computers kunnen inkopen. Begeven mensen moeten sneliers ook weer door andere gebruikers ingezet worden. Dus je hebt ook maar een beperks tijdsluit. Dus bereven moet je ook gewoon stoppen. Maar we zeggen wel dat we op dit moment best wel heel veel uit de data hebben kunnen trekken. Hoeveel hij die we nu hebben. Maar hoe zie je dat dan? Dat zien we echt niet los kurven. Dus we zien eigenlijk gewoon een lijnje die laat zien hoe verbazt het model is over een bepaalde woord combinatie. Als je verbazent bent dat als ik zeg du meisje, dan heb je hem lijkt wat iets geleerd over Nederland. Zo is dat voor zo'n model ook. Je kan die mate van verbazing. Dus dat model maakt een soort van inschattingen met hoe waarschijnlijk is dat ik deze woord combinatie aan trev. En als die inschattingen heel erg afwijken van wat je daadwerkelijk in tal ziet, dan gaat er iets mis. Dan heeft hij het gewoon nog niet zo goed geleerd. Dus dat is even hoge over wat er gebeurt. En we laten hem dus ook gewoon samenvattingen maken. En dan meeten we hoe goed die samenvattingen zijn. Ja. En nu heb jij een subsidie geschreven en een aafwaar gedaan bij het ministerie van economische zaken. En Koninkrijsrelaties? Is dat was dat gewoon een open subsidie? Heb je gewoon gezegd van wij willen dit doen? We hebben geld nodig. Hoe werkt dat? Waar schrijf je op in? Ja, er zijn heel veel soort subsidies en financieringsformen. En dit kwam toevallig voorbij. Niet helemaal toevallig, maar bij Teno hebben natuurlijk heel veel ervaring met het samenwerken de Europese verband, Nederlandse verband, nationale verband, onderzoek subsidies aanvragen. Ja. Publiek privates samenwerkingen. Dus er is heel veel kennis in de organisatie over welke financieringsformen er bestaan. En het kwam dit langs en dit leek ons echt een heel opportune moment en een mooie subsidie form. Het is een faciliteit toegepast onderzoek. Dat is een faciliteit dat we dat gaan we maken. Dat moet een taal model voor Nederland gaan worden. Je zei, we rijden ook heel Europa rond om te vertellen hierover. Hoe is het in de rest van Europa? Ik hoor ook een project met buurotheken in een Scandinavisch land. En ik weet niet meer, het dene marker van Norwegen. En ze zijn natuurlijk overal bezig. Gelukkig maar. Gelukkig, maar ja, het neem ik aan. Gelukkig, maar ja, het neem ik even vol op. Van alles en nog wat. Dus je hebt aan de ene kant een aantal grote privates partijen. Denk aan Mistral. Het is een heel bekend succesvol voorbeeld. Er zijn ook veel trajecten, waarbij men ook zijn eigen taalmodel maakt. In Polen zijn ze bezig in Norwegen. Ga zo maar door. En er zijn heel veel samenwerking's verbanden. Het is met naam onderzoeks trajecten. Dus bij voorbeeld een Horizon subsidy van uit Europese Unie. We ren ook heel veel universiteiten, onderzoeksinstituten, soms ook betrijven de krachtenbundelen om aan dit soort zueverijnen AI te werken. En we leren veel van elkaar. Ja, en hoeveer zijn ze daar al? Hebben ze daar al werken het model? Ja, ze wilt kijken naar de Zwitsers. Die hebben het apertersmodel uitgebracht. Die zijn heel ver dat modelt. Je kunt je nu gebruiken. Mistral is natuurlijk ook heel ver. En het apertersmodel kan ik al gebruiken zelf. Ja. Dat is inderdaad al beschikbaar. En daar zie je dat er allerlei verschillende soorten modellen beginnen op te poppen. De ene is wat verder in de ontwikkeling dan de ander. Iedereen heeft wel een beetje in eigen strategie gekozen. Ja, waar zit u hier heel ver? Ja, we zijn nu met onze launching customers bezig. Dus we hebben een beta-versie. Ja, en ik bel me ervan in die range, zeg maar. Zomers hebben het verder, zomaar we het zijn met trainingen, met verzamelen van data, of we zijn een paar onderzoeken aan het doen. Hoe kun je van bestaande modellen? De grondlaag is op die meel mogelijk, betere modellen maken. Ze zijn ook heel veel onderzoeksvragen en dingen waar we nog achter moeten komen, waar we nu volop naar kijken met elkaar. Maar ik begrijp dat we ook veel enthousiasme is voor het GPD en en dan. De gappen is dat heel veel van de initiatieve die lopen zijn vaak geïnisseerd door onderzoeksinstituten of door universiteiten. Die zijn heel sterk in onderzoek doen. Eerst de stap bezetten in een ontwikkel proces. Wij hebben ons vanaf het begin van ook wel heel erg gericht op de vraag. Maar hoe bouw je nou duurzaam naar de toekomst toe iets dat kan blijven bestaan. Daarbij hebben ze ook heel erg gekeken. Naar dat ecosystem, idee van hoe zorg je ervoor dat je bijvoorbeeld datale verantziers erbij betrekt. Niet alleen voor zorg dat je ook een eerlijke compensatiemodel uitkomt, maar ook incentivescreëert om dit verder te kunnen laten groeien. En dat vindt mij heel interessant om te zien. En uiteindelijk blijft het een vrij nieuwe wetenschap met technologie, dus je leert zo heel veel van elkaar. Het is ook heel goed dat er meerdere initiatieve zijn, waar heel veel onderzoekplaatsvindt, want daar leren we ontzettend veel van. En Sascha zie ik nou ook, wij dachten dat we zien die arms race in Amerika en ook met China en zo. En dan gaat allemaal gigantische modellen en zo. Maar kun je eigenlijk dus in wat meer geautomisieerde wereld krijgen waar iedereen zijn eigen modellen heeft en de ene modellen misschien wat beter in het ene en andere modellen wat beter in het andere, dat meer gaat lijken op gewoon heel hoe verschillende soorten auto's. En dan zijn we al een vierwielen rijen, maar ze zijn allemaal voor iets anders geschikt. Gaan ze zo meer? Ja, dat is ook een teken van een gezonde markt, als je een koze hebt. Dat is ook een deel van die souverijnidtijdsvraagstukken. Het gaat er niet alleen om dat je je eigen spullen hebt, maar ook dat je keuze hebt. En ik zie het wel in het aantal gebeuren dat je een meerdere krachtige modellen hebt die inzetbaar zijn voor andere doelende. Dus misschien een bepaalde sector of misschien voor bepaalde tagen. Dat is net wel beter worden. Dus dat zou maar zo de uitkomst kunnen zijn en ik denk dat we sowieso op meerdere modellen moeten blijven inzetten. En daar ook gewoon echt een markt en een stukje concurrentie echt moeten toelaten. En die hebben we niet dat vervelend netwerk effect van de social media waar het heel moeilijk is om iets te konkurenen in te zetten. Om die iedereen al op het bestaande platform zit en dat heb je dat het hier het probleem helemaal niet. Want de model dat zo hoog complejend en zo verijn is er zijn er maar weinig van. En dan we denken dat onze aanpak wat dat betreft er gewooniek is. En over z'n internationale NDP News mee, ik krijg ook heel veel bezoeken en ook de Europese Commission die heeft er uitzegreid hierover geïnformiert. En dat samenwerken met uitgegeven zonder licentie model te maken, dat is wel iets wat voor het eerste Nederland is gebeurd. Ja, voor het eerste in de wereld zelfs. En we worden gehoord, dus de eerste keer dat commissaire News media bedrijven de handen in eneen hebben geslaagd met een AI-initiative. Dus dit heeft echt wel veel effect en we weten ook dat je die veel telefoonjes krijgen. Dan ben je die de NDP ook veel telefoonjes krijgen van de evenknie uit Europa met Jets. Hoe hebben we jullie dit gedaan en het gaan we verder met elkaar. Jullie stonden ergens een keer bij het Coffegetta Parade en jullie hebben dat toen een idee van het moed is dat hij doen, maar het zei ik natuurlijk ook tegen Philie, of iemand anders. Toen wij bij de Coffegetta, waren we bij ourselves een model. Ja, dat zit natuurlijk elkaar aan te kijken. Ja, dat kost natuurlijk wel heel veel milieu. Zouden wij voor 13,5 miljoen een model hebben kunnen trainen? Of zet er bij jullie? Er is ook nog heel veel gun facto in die wij niet als bedrijf hadden kunnen verwezenelijke of verwerven. Ja, dat zit er meer tegen. Dat natuurlijk heel belangrijk is dat je de juiste mensen aan boordapt. Er hebben natuurlijk wel heel veel gelukt dat we heel gemaltiveerd, heel goede wetenschappers en engineers hebben rondlopen bij alle drie de instituten. Wat ook heel erg helpde, dus wel die supercomputer klaar hebt staan. En daar ook gewoon snel met elkaar over kan schakelen. En een ander belangrijk, dat is niet goed, dat is niet van jullie. Die is niet van ons neem, maar we kunnen er wel snel gebruik van maken en de lijntjes zijn heel kort. En met die gun facto is een non-profit, waardoor we makkelijker verschillende konkurereerende bedrijven of instellingen bij elkaar kunnen krijgen om iets weg te geven. Nou, dat helpt enorm dat je daar als neutrale partij in het aantijd aan governance kan gaan opzetten, waarbij iedereen gaat profiteren en ook iedereen op dezelfde lijn kan krijgen. Is dat om mogelijk voor een commercialbedrijf om te doen? Nee, natuurlijk niet, niks is om mogelijk. Maar we denken wel dat dat enorm gelopen heeft. Het opent ook veel duur als je als TNO ergens staat. Dus we denken dat dat echt wel een hele grote doorsdag even een factor is geweest in deze fase. En is het nou zo, jullie verwachten dat overheid het gebruik van jullie modellverklicht gaat stellen? Nou, we zullen ik ingefoeligen zaken. Is dat misschien al zo? Maar we vachten u ook dat dat er zo'n soort vormvacht donder afname, want jullie de ene genelde laatste modell zijn dat op deze manier tot stand is gekomen. We gaan er niet klagen, maar misschien ook wel een beetje. Kouse vrijheid blijft een heel belangrijk iets. Het houdt ons ook scherp. Als er andere modellen op de markt zijn, dwingt je ook om je middel effectief in te zetten en zo goed mogelijk te worden. Het is nu natuurlijk al zo dat voor een aantal eind gebruiken, voor een aantal juice cases, er niet gewerkt mag worden met bestaan generatieve AI-oplosingen. Voor die segmenten wil je al met een oplossing kunnen komen. Ik denk dat het niet houdbaar om in deze fase al alles AI gebruiken van bijvoorbeeld publieke sector door GPTNL te laten uitvoeren. Er moet je ook realistisch in zijn. We zijn nu bij een eerste stap. Het is nu voor een aantal gebruiken. Gaat het waarde toevoegen? Ja. Vit voor purpose. Je hebt niet overal die verarie voor nodig, zeggen we vaak. Maar het eind ik wil je daar ook verder in gaan ontwikkelen en beter worden. Dus je kan niet van een op andere dag in eens sommige modellen er uitgooien en overal GPTNL laatst draai en denken dat alles wel goed komt. Je zou waarschijnlijk sowieso in het toekomst naar een realiteit toegaan waarin meerderen modellen naast elkaar bestaan en voor verschillende gebruiken ingezet gaan worden. En dat verschillt per organisatie of ze dat dan door één modell laten doen door meerderen en dat hankt heel erg af van de doelen en het soort gebruiken en het soort data dat daar doorheen. Ja, het zou dus ook naast elkaar kunnen worden. Dat is nu zelf door. En dat is nu gewoon de realiteiten ook voor de launchingkastemers dat ze modelen naast al andere bestaan en modellen in zetten. Dat begrijp ik. En waarin gaan wij gewoon de burgers gebruiken van kunnen maken of gewoon check of elke verzieje dat nu helemaal niet? Nee, zeker niet op de korte termijn. Langer termijn is altijd moeilijk kijken, maar we hebben heel expliciet ook vanaf begin af aan gezegd. Het is echt voorzakelijk gebruik niet voor de consumentenmarkt. En dat is dus daar een grote opgave en daar zitten ook flink wat risico's aan. En ook de impact van AI op de maatschappij is flink groot. We moeten keuzes maken. We hebben er 13,5 miljoen. We winnen we een paar de focuspakken en we willen vooral AI ontwikkelen. Die waarde kan toevoegen. Waar we echt iets aan hebben. En dat zien we op dit moment met name in die zaaklijke markt. Daar zien we dat die arbeids te korte, de uitdagingen. Daar kan AI echt een verschil maken en daar hebben we graag een passend product voor maken. En wanneer kunnen wij met het model werken? Wanneer kan ik aankloppen en zeggen, we hebben nog wel een linkje nodig, een lijntje. We willen graag rekenen en we willen in passen in onze tools, in onze. om misschien aan de klant te kant. Waarom kunnen wij met jullie modelen aan de slag? Zo snel mogelijk. Wat kan al gewoon? Het kan al gewoon. Het is minst als we hier bij de launching 10 willen horen, bij onze launching customers. Die lijst er bijna voor. Dus we kunnen niet direct heel Nederland gaan bedienen. Maar we wachten even, we kunnen gewoon nog met jou bijlen en zeggen we willen dan nog bij. Ja, dat kan. Oh, Philippe. Ja. We moeten even. We moeten launch in customer worden. Nee, zeker. Ja, dat kan. Maar daar gaan we wel. En jullie ook jullie er kijken? Ja, maar daar gaan we wel heel eerlijk kijken. We hebben de bed aan verzien en we binnen de wel voor zorgen dat we in deze fase voor jullie alwaarde kunnen toevoegen. Dus als jullie een hele complexe juist kees hebben waarin echt een heel in gewikkeld model nodig is, dan gaan we daar wel eerlijk op adviseeren. Dus het is wel belangrijk dat we en ook met jullie kijken, willen jullie ook dit initiatief verder ondersteunen en laten zien dat er commerce in de trackstie voor bestaat. Dus daar zijn we gewoon ingesprek. Maar we hebben ruimte nog. Hoeveel we hebben we nog? Na top morgen. Morgen? Ja, ik heb er snel. Nee, nee, maar er is nog wel even. Eensjes tijd. We hebben wel gezegd, willen eigenlijk voor de cash-procancie alle handtekening rond. Nou, dan dure dingen natuurlijk net wat langer. Maar er is niet heel veel tijd meer. Maar goed, betekent niet als je bij de launch in 10 hoort als je daarna heel lang moet wachten. Maar we hebben op dit moment ook nog beperkte capaciteit. We kunnen niet met 100 organisaties de gelijkertijd aan de slag en overal die honderd dezelfde kwaliteit, gaan bieden en service en ondersteuning. Dat willen we echt gefaseerd aanpakken. Ja. En dan heel heeft er gekomen op dat durfkapitaal of de investeringen, want daar hebben we het al niet over gehad verder. Die wil je nu eigenlijk nieuwe honders gaan creëren. Je wilt ook geld binnenhalen via die launch in customers, verschijkelijk. Al het was een eerste vriendmodel. Hoeveel geld heb je nodig denk je voor het komende jaar? Het is nu eens de komende drie jaar, want ik zie jullie ambitie dat jullie ook graag een image, een generative model zouden willen vorm geven. Nou, we willen voor image verloopt, even niet, maar we willen vooral sprake ook gaan toevoegen, niet mogelijkheid verkennen. Allerebelangrijkst is ook dat we meer talen willen gaan toevoegen en de volgende productlijn, de volgende generatie, modellen ook een stukje groter maken, een stukje krachtiger. Dus dat is niet alleen een aantal basisstijken, goed kan uitvoeren, maar meer dan dat. Maar meer talen, Fris Twens? Ja, maar ook Duits. Maar die gaan we ook. Noors, zweeds, spaans, frans. Ja, we. Frisland, het is een grote vraag naar de huimordem. Checkt-puls. Nee, maar goed daar daarin zitten zeker. En we hebben er nu afgis inzitter. Er zitten er al in. Ja, onderhandelen dankzij. Maar er van Rosem, die dat een keer vroeg van jou, denk, vergeet Frisland niet. En dat ook met de Friskoakthemie en een aantal institute daar hebben we er zeker voor gezorgd dat er Fris in zit. Maar je wilt gewoon veel breder gaan trekken. Veel meer talen, gaan ondersteunen, gaan we ook doen. Dus we zijn nu ook aan het kijken naar mogelijk de financieringsformen. Maar wel op zo manier dat we de sovereiniteit gaan behouden. Ja. En dat dat is een puzzel die we nu aan het leggen zijn. Ja, en kun je even explicitenaar wat je bedoel met die sovereiniteit? Ja, dus voor ons is een exit, richting en amerikan. Dat is geen zovindendie. Nee, zeker niet. En dan is het een laatste vraag welke investeerders passen bij het altbild, zodat ze ze staan een keihard-ijs. Philipp, hoe ik vond echt een superleggesprek. Ja, ik vind het ze fascinerend projecten, omdat ik denk wij zijn zo blind aan het staren op die grote. Ja, die grootste tijd. Daar werd het lopen aan de overkant van de Oceaan. En in tussen is die technologie ook hier gewoon te maken. Ja, wel eens waarop we iets verperkt is gaal, maar dat kan ook heel nuttig zijn voor een paal toepassing. En zo moet AI zich natuurlijk ontwikkelen, waardoor het veel democratischer en meer concurrentie, en we niet die enorme gereep van die amerikanische big tech bedrijven hebben. En dus ik vind het wel echt een heel positief ontwikkeling. Goet, dit was de medianovatie podcast met onze gast Saskia Lansing, co-host Philippe Remark, director Junen Stiek. En ikzelf, Lars Anderson, manager-innovatie bij DPEG-Media. Lijfluisteren, het tot volgende keer. [muziek]

Podcast Summary

Key Points:

  1. GPTNL is een Nederlands taalmodel ontwikkeld door TNO en SURF, getraind op Nederlandse publieke data en nieuwsartikelen.
  2. Het project heeft een beperkt budget van €13,5 miljoen vergeleken met Big Tech, maar richt zich op specifieke zakelijke toepassingen en ethische data-licenties.
  3. Het model presteert vergelijkbaar met GPT-3.5 voor kernfuncties en wordt eerst getest bij partners zoals het Nederlands Forensisch Instituut.
  4. Een belangrijk doel is het creëren van een eerlijk AI-ecosysteem in Europa, waarbij data-eigenaren worden gecompenseerd en afhankelijkheid van buitenlandse tech wordt verminderd.

Summary:

In deze podcastaflevering wordt Saskia Lensing geïnterviewd over GPTNL, een Nederlands taalmodel ontwikkeld door TNO in samenwerking met SURF. Het model is getraind op specifiek Nederlandse data, waaronder gelicentieerde artikelen van NDP Nieuwsmedia, om een ethisch alternatief te bieden voor internationale Big Tech-modellen. Met een budget van slechts €13,5 miljoen – een fractie van wat bedrijven als OpenAI gebruiken – richt het project zich op zakelijke toepassingen, zoals het ondersteunen van productiviteit in sectoren met personeelstekorten, in plaats van op een algemeen consumentenmodel.

GPTNL benadrukt transparantie en eerlijke compensatie voor data-eigenaren, in tegenstelling tot de vaak controversiële datapraktijken van grote techbedrijven. Het model presteert naar verwachting vergelijkbaar met GPT-3.5 voor kernfuncties zoals samenvatten en wordt eerst praktisch getest bij partners zoals het Nederlands Forensisch Instituut, waar ethische en juridische kaders cruciaal zijn. De ontwikkeling maakt deel uit van een bredere Europese ambitie om een autonoom, verantwoord AI-ecosysteem op te bouwen, met aandacht voor lokale kennis, infrastructuur (zoals de supercomputer Snellius) en soevereiniteit, om afhankelijkheid van niet-Europese partijen te verminderen.

FAQs

GPTNL is een Nederlands taalmodel dat wordt ontwikkeld door TNO in samenwerking met SURF. Het is getraind op Nederlandse data, waaronder artikelen van publieke bronnen en nieuwsmedia.

Het doel is om een ethisch AI-model te bieden voor de zakelijke markt, gericht op het verhogen van arbeidsproductiviteit. Het model richt zich op specifieke taken en vermijdt afhankelijkheid van grote techbedrijven.

GPTNL heeft een budget van 13,5 miljoen euro van de overheid, wat een fractie is van de miljarden die grote techbedrijven gebruiken. Het maakt gebruik van de SURF-supercomputer Snellius voor rekenkracht.

GPTNL is specifiek getraind op Nederlandse data en richt zich op zakelijke toepassingen, niet op algemeen consumentengebruik. Het benadrukt ethische aspecten en eerlijke compensatie voor data-eigenaren.

De kwaliteit wordt intern getest met benchmarks en vergeleken met modellen van vergelijkbare grootte, zoals ChatGPT 3.5. Ook wordt het model in praktijk getest met klanten, zoals het Nederlands Forensisch Instituut.

GPTNL gebruikt gelicenseerde data van Nederlandse uitgevers via NDP News Media, met een compensatiemodel zodat data-eigenaren meedelen in de opbrengsten. Dit bevordert een eerlijk ecosysteem.

Chat with AI

Loading...

Pro features

Go deeper with this episode

Unlock creator-grade tools that turn any transcript into show notes and subtitle files.