Hoe draait u een klantspecifiek open LLM op EU-infrastructuur
- 5 uur geleden
- 6 minuten om te lezen
In zes stappen bouwt u een klantspecifiek getraind vertaalmodel op hardware die u zelf beheert, en het geheel staat of valt met beslissingen die u neemt voordat er ook maar een woord wordt vertaald. Kiest u de verkeerde licentie, dan moet de juridische afdeling een productiesysteem weer ontmantelen. Stuurt u een gecontroleerd technisch bestand naar een gedeelde openbare API, dan hebt u mogelijk een niet-vergunde overdracht onder EU-recht gedaan. Zet u het goed op, dan bezit u iets wat de meeste vertaalinkopers missen: een AI-vertaalpijplijn waarbij klantgegevens nooit een omgeving verlaten die u op een kaart kunt aanwijzen.
Zo ziet de workflow eruit die wij bij AD VERBUM als onze standaard-AI+HUMAN-hybride draaien, uiteengezet zodat een intern lokalisatie-engineering- of complianceteam hem kan volgen.
De pijplijn in zes stappen
De volgorde telt. Elke stap levert het auditbewijs waarvan de volgende afhankelijk is.
Kies een open-weight-model met een schone licentie. DeepSeek V4 verschijnt onder MIT, Qwen 3.6 en Mistral Large 3 onder Apache 2.0. Alle drie zijn zelf te hosten en fijn af te stemmen, dus niets dwingt uw inhoud door een leverancier-API.
Zet een geisoleerde, in de EU gehoste omgeving op. Draai op eigen hardware of een single-tenant enterprise-cloudinstantie in de EU, zonder route waarlangs klantgegevens die grens verlaten.
Stem fijn af op het Translation Memory en de termbank van de klant binnen die omgeving. De trainingsdata blijven waar het model draait, en de afgestemde gewichten worden een klantspecifiek bezit in plaats van een gedeelde engine.
Beperk de generatie tijdens inferentie met hetzelfde TM en dezelfde termbank. Het model stelt voor, uw terminologie beslist, zodat goedgekeurde termen en eerdere segmenten een vloeiende maar foute gok overschrijven.
Voeg gecertificeerde menselijke post-editing toe. Een gekwalificeerde vakvertaler beoordeelt de output volgens ISO 17100 en ISO 18587 en neemt de verantwoordelijkheid voor de definitieve tekst.
Log elke stap. Leg de modelversie, trainingsdata, prompts en beoordelaarsacties vast als bewijs voor ISO 42001 en ISO 27001.
Stap 1, 2 en 6 zijn waar de meeste interne bouwsels stilletjes misgaan, dus die krijgen hieronder de details.

Stap 1, lees de licentie en de jurisdictie
Een toegeeflijke licentie en een geruststellende jurisdictie zijn twee aparte controles, en u hebt ze allebei nodig.
MIT en Apache 2.0 laten u commercieel deployen, wijzigen en fijn afstemmen zonder iemand te vragen. Daarom zijn DeepSeek V4, Qwen 3.6 en Mistral Large 3 de schone startpunten. Let op "community"- of "gewijzigde" licenties die gebruiksclausules of drempels voor gebruikersaantallen toevoegen, want die vragen juridische toetsing voor grootschalige inzet.
De jurisdictie is de tweede controle. Het zelf hosten van de gewichten op EU-hardware neutraliseert de vraag van dataresidentie, omdat de inferentie de servers van de modeluitgever nooit raakt. Voor kopers uit defensie en life sciences neemt een in Europa gebouwd model zoals Mistral Large 3 het argument volledig weg. Over de afwegingen in het huidige veld schreven wij in ons overzicht van de beste open LLM-modellen voor gereguleerde vertaling.
Stap 2, isoleer de omgeving
Het doel van een eigen model is dat inhoud nooit een gedeelde openbare API bereikt. Die belofte houdt alleen stand als de deployment echt single-tenant is.
Voor ons betekent dat in de EU gehoste infrastructuur onder ISO 27001 en ISO 42001, zonder afhankelijkheid van publieke-cloudtools voor de kernverwerking. Het TM, de termbank en de bronbestanden van een klant liggen binnen een grens, en het afgestemde model ligt daar bij ze. Het verschil tussen dit en een SaaS-vertaaltool dat toevallig in Frankfurt host, is controle: u bepaalt de bewaring, het toegangslog en de verwijdering. Precies op dit punt vergeleken wij aanbieders in ons stuk over welke vertaalbureaus klantspecifiek getrainde LLMs op in de EU gehoste infrastructuur draaien.
Stappen 3 tot 5, afstemmen, beperken, dan een mens laten aftekenen
Het fijn afstemmen op het eigen TM en de termbank van een klant maakt van een algemeen model een vertaalbezit dat de productnamen, de regulatoire formulering en de huisstijl van de klant spreekt. De afgestemde gewichten dragen die kennis, en de termbank dwingt het af tijdens inferentie zodat een vloeiende gok een goedgekeurde term niet kan overschrijven.
De menselijke stap is bij gereguleerde inhoud niet optioneel. Een algemeen LLM levert zelfverzekerde, leesbare output die toch fout kan zijn op manieren die een niet-specialist niet opmerkt, en daarom hebben zowel klassieke segmentgebaseerde neurale MT als ruwe LLM-output een gecertificeerde beoordelaar nodig voor auditklaar werk. Dat argument zetten wij volledig uiteen in ons stuk over NMT versus LLM-vertaling. Onder ISO 18587 is de post-editor een gekwalificeerde professional die de definitieve vertaling verantwoordt, geen spellingcontrole.

Stap 6, log voor de audit die u uiteindelijk krijgt
Een AI-vertaalpijplijn zonder registratie van wat ze deed, is een risico tijdens een onderzoek door een gegevensbeschermingsautoriteit of een klantaudit. ISO 42001 verwacht een AI-managementsysteem met risicobeoordeling, effectbeoordeling en traceerbare beslissingen, en ISO 27001 verwacht een toegangs- en wijzigingsregistratie. Leg de modelversie en haar licentie vast, de trainingsdata en hun herkomst, de prompts en terminologiebeperkingen en elke beoordelaarsactie. Dat log bewijst ook uw dual-use-positie, waarover het hierna gaat.
Waar het misgaat
De meeste mislukkingen zijn terug te voeren op een kortere weg die genomen werd om een week opzet te besparen. Let op deze.
De licentiecontrole overslaan. Een "gewijzigde" of community-licentie kan juist de deployment beperken die u bouwde, en het in productie ontdekken betekent een draaiend systeem ontmantelen.
Inhoud via een gedeelde openbare API leiden. Op het moment dat het gecontroleerde bestand van een klant een consumenten-AI-endpoint raakt, is uw belofte van data-isolatie weg, en het auditspoor eveneens.
Dual-use-blootstelling negeren. Onder Verordening 2021/821 artikel 2 geldt het overdragen van werkkennis gekoppeld aan gecontroleerde goederen uit bijlage I of bijlage IV als technische bijstand, dus het fijn afstemmen van een model op gecontroleerde technische data of het overhandigen aan een niet-gescreende vertaler kan een niet-vergunde overdracht zijn. Gescreende vertalers en een in de EU gehoste omgeving beantwoorden dit, een geheimhoudingsovereenkomst niet.
Loggen als bijzaak behandelen. Wordt het bewijs niet vastgelegd terwijl het werk gebeurt, dan kunt u het later niet reconstrueren voor BAFA, DGA of een aangemelde instantie.
Los deze vier op en de pijplijn houdt stand bij de toetsing waarvoor ze is gebouwd. AD VERBUM draait dit als onze standaardworkflow in plaats van een speciaal project, en dat is het verschil tussen een demo en een conforme productielijn. Voor een breder beeld van welke governance de EU AI Act nu van AI-vertaling vraagt, zie wat ISO 42001 vereist van een AI-bestuurd vertaalbureau.
Onze AI-vertaaldiensten
Onze vertaaldiensten voor gereguleerde sectoren draaien op ISO 27001- en ISO 42001-gecertificeerde, in de EU gehoste infrastructuur, zonder afhankelijkheid van publieke-cloudtools voor de kernverwerking. Elk project doorloopt onze AI+HUMAN-hybride workflow: wij nemen eerst de Translation Memories en termbanken van de klant in, ons eigen op LLM gebaseerde LangOps-systeem genereert output die door de klantterminologie op klantspecifiek getrainde open-weight-modellen wordt beperkt, en onze gecertificeerde vakspecialisten beoordelen op technische nauwkeurigheid en regulatoire naleving. Onze QA is afgestemd op ISO 17100 en ISO 18587, met sectorspecifieke eisen zoals de EU AI Act (Verordening 2024/1689) en de omgang met gecontroleerde data onder Dual-use-verordening 2021/821 waar relevant. Wij bedienen klanten in life sciences, juridisch, financien, defensie en productie in 150+ talen met 3.500+ vakvertalers. Voor teams die auditgevoelige inhoud beheren: neem contact met ons op om uw beveiligings- en nalevingseisen direct te bespreken.
FAQ
Welke open LLMs hebben een licentie die schoon genoeg is om commercieel zelf te hosten?
DeepSeek V4 (MIT), Qwen 3.6 en Mistral Large 3 (beide Apache 2.0) staan allemaal commercieel gebruik, wijziging en fijn afstemmen toe zonder leveranciersovereenkomst. MIT en Apache 2.0 zijn de twee toegeeflijke licenties zonder drempels voor gebruikersaantallen of gebruiksclausules. Community- of "gewijzigde" licenties vragen juridische toetsing voor grootschalige inzet.
Levert het zelf hosten van een model van Chinese oorsprong een dataresidentieprobleem op?
Het zelf hosten van de open gewichten op EU-hardware betekent dat de inferentie de servers van de uitgever nooit bereikt, dus de vraag van dataresidentie wordt beantwoord door waar u het model draait, niet waar het is gebouwd. De licentievoorwaarden binden u ongeacht de jurisdictie. Voor kopers die het argument volledig willen wegnemen, is een in Europa gebouwd model zoals Mistral Large 3 de duidelijke keuze.
Waarin verschilt fijn afstemmen op een Translation Memory van prompting?
Fijn afstemmen past de gewichten van het model aan op het eigen TM en de termbank van de klant, zodat het model de huisterminologie en formulering internaliseert. Het beperken van de generatie tijdens inferentie met dezelfde termbank dwingt vervolgens goedgekeurde termen segment voor segment af. Samen leveren ze output afgestemd op de regulatoire taal van de klant in plaats van een generiek register.
Is menselijke beoordeling nog nodig als het model op klantdata is afgestemd?
Ja. ISO 18587 vereist een gekwalificeerde menselijke post-editor die de verantwoordelijkheid voor de definitieve vertaling neemt, en bij gereguleerde inhoud vangt die beoordeling fouten op die een vloeiend model blijft maken. Een afgestemd model verlaagt de editinspanning maar verwijdert de verantwoordingsstap niet.
Wat verwacht ISO 42001 van een AI-vertaalpijplijn?
ISO 42001 is de norm voor AI-managementsystemen en verwacht een risicobeoordeling, een effectbeoordeling van het AI-systeem en traceerbare registraties van hoe het systeem is gebouwd en gedraaid. Voor een vertaalpijplijn betekent dat het loggen van modelversie, trainingsdata, prompts, terminologiebeperkingen en beoordelaarsacties. Dat bewijs houdt stand tijdens een onderzoek door een gegevensbeschermingsautoriteit of een klantaudit.
Wanneer activeert het inzetten van een vertaler de EU-dual-use-regels?
Verordening 2021/821 artikel 2 definieert technische bijstand zo dat het het overdragen van werkkennis omvat, en bijlage I en bijlage IV lijsten gecontroleerde goederen. Het delen van gecontroleerde technische data met een niet-gescreende vertaler, of een model daarop fijn afstemmen zonder controles, kan een niet-vergunde overdracht zijn, gehandhaafd door autoriteiten als BAFA, DGA en UAMA. Gescreende vertalers en een in de EU gehoste omgeving geven u een verdedigbare positie die een geheimhoudingsovereenkomst alleen niet biedt.