top of page

Hvordan koerer du et klienttilpasset aabent LLM paa EU-infrastruktur

  • for 1 time siden
  • 6 min læsning

Paa seks trin bygger du en klienttilpasset oversaettelsesmodel paa hardware, du selv styrer, og det hele staar og falder med beslutninger, du traeffer, foer et eneste ord bliver oversat. Vaelger du den forkerte licens, skal juraafdelingen skille et produktionssystem ad igen. Sender du en enkelt kontrolleret teknisk fil til et delt offentligt API, har du muligvis foretaget en ikke-godkendt overfoersel efter EU-retten. Saetter du det rigtigt op, ejer du noget, de fleste oversaettelseskoebere mangler: en AI-oversaettelsespipeline, hvor klientdata aldrig forlader et miljoe, du kan pege paa paa et kort.


Saadan ser den arbejdsgang ud, som vi hos AD VERBUM koerer som vores standard-AI+HUMAN-hybrid, lagt frem saa et internt lokaliserings- eller complianceteam kan foelge den.


Pipelinen i seks trin


Raekkefoelgen taeller. Hvert trin leverer det revisionsbevis, det naeste afhaenger af.


  1. Vaelg en open-weight-model med en ren licens. DeepSeek V4 udkommer under MIT, Qwen 3.6 og Mistral Large 3 under Apache 2.0. Alle tre kan hostes selv og finjusteres, saa intet tvinger dit indhold gennem et leverandoer-API.

  2. Etabler et isoleret, EU-hostet miljoe. Koer paa egen hardware eller en single-tenant enterprise-cloud i EU, uden en vej hvor klientdata forlader den graense.

  3. Finjuster paa klientens Translation Memory og termbase inde i det miljoe. Traeningsdataene bliver, hvor modellen koerer, og de finjusterede vaegte bliver et klientspecifikt aktiv i stedet for en delt motor.

  4. Begraens genereringen ved inferens med samme TM og termbase. Modellen foreslaar, din terminologi bestemmer, saa godkendte termer og tidligere segmenter overskriver et flydende, men forkert gaet.

  5. Tilfoej certificeret menneskelig efterredigering. En kvalificeret fagoversaetter gennemgaar output efter ISO 17100 og ISO 18587 og tager ansvaret for den endelige tekst.

  6. Log hvert trin. Registrer modelversion, traeningsdata, prompts og gennemgangshandlinger som bevis for ISO 42001 og ISO 27001.


Trin 1, 2 og 6 er der, hvor de fleste interne opbygninger stille gaar galt, saa de faar detaljerne nedenfor.



Trin 1, laes licensen og jurisdiktionen


En tilladelig licens og en betryggende jurisdiktion er to separate tjek, og du har brug for dem begge.


MIT og Apache 2.0 lader dig deploye, aendre og finjustere kommercielt uden at spoerge nogen. Derfor er DeepSeek V4, Qwen 3.6 og Mistral Large 3 de rene udgangspunkter. Vaer opmaerksom paa "community"- eller "modificerede" licenser, der tilfoejer brugsklausuler eller taerskler for brugerantal, for de kraever juridisk vurdering foer storstilet brug.


Jurisdiktionen er det andet tjek. At hoste vaegtene selv paa EU-hardware neutraliserer spoergsmaalet om dataophold, da inferensen aldrig roerer modeludgiverens servere. For koebere inden for forsvar og life sciences fjerner en europaeisk bygget model som Mistral Large 3 argumentet helt. Vi skrev om afvejningerne i det aktuelle felt i vores gennemgang af de bedste aabne LLM-modeller til reguleret oversaettelse.


Trin 2, isoler miljoeet


Formaalet med en egen model er, at indhold aldrig naar et delt offentligt API. Det loefte holder kun, hvis deploymentet reelt er single-tenant.


For os betyder det EU-hostet infrastruktur under ISO 27001 og ISO 42001, uden afhaengighed af offentlige cloud-vaerktoejer til kernebehandling. En klients TM, termbase og kildefiler ligger inden for en graense, og den finjusterede model ligger der sammen med dem. Forskellen mellem dette og et SaaS-oversaettelsesvaerktoej, der tilfaeldigvis hoster i Frankfurt, er kontrol: du bestemmer opbevaringen, adgangsloggen og sletningen. Netop paa dette punkt sammenlignede vi udbydere i vores indlaeg om hvilke oversaettelsesbureauer der koerer klienttilpassede LLM'er paa EU-hostet infrastruktur.


Trin 3 til 5, finjuster, begraens, og lad saa et menneske skrive under


At finjustere paa en klients eget TM og termbase goer en generel model til et oversaettelsesaktiv, der taler klientens produktnavne, regulatoriske formulering og husstil. De finjusterede vaegte baerer den viden, og termbasen haandhaever den ved inferens, saa et flydende gaet ikke kan overskrive en godkendt term.


Det menneskelige trin er ikke valgfrit for reguleret indhold. En generel LLM producerer selvsikkert, laesbart output, der stadig kan vaere forkert paa maader, en ikke-specialist ikke opdager, og derfor har baade klassisk segmentbaseret neural MT og raa LLM-output brug for en certificeret gennemgang til revisionsklart arbejde. Vi fremlaegger det argument fuldt ud i vores indlaeg om NMT versus LLM-oversaettelse. Efter ISO 18587 er efterredaktoeren en kvalificeret fagperson, der staar inde for den endelige oversaettelse, ikke en stavekontrol.



Trin 6, log til den revision, du foer eller siden moeder


En AI-oversaettelsespipeline uden registrering af, hvad den gjorde, er en risiko under en gennemgang fra en databeskyttelsesmyndighed eller en klientrevision. ISO 42001 forventer et AI-ledelsessystem med risikovurdering, konsekvensvurdering og sporbare beslutninger, og ISO 27001 forventer en adgangs- og aendringsregistrering. Registrer modelversionen og dens licens, traeningsdataene og deres kilde, prompterne og terminologibegraensningerne samt hver gennemgangshandling. Den log beviser ogsaa din dual-use-position, som det handler om herefter.


Hvor det gaar galt


De fleste fejl kan spores tilbage til en genvej, der blev taget for at spare en uges opsaetning. Vaer opmaerksom paa disse.


  • At springe licenstjekket over. En "modificeret" eller community-licens kan begraense netop det deployment, du byggede, og at opdage det i produktion betyder at skille et koerende system ad.

  • At lede indhold gennem et delt offentligt API. I det oejeblik en klients kontrollerede fil rammer et forbruger-AI-endpoint, er dit loefte om dataisolering vaek, og revisionssporet ligesaa.

  • At ignorere dual-use-eksponering. Efter forordning 2021/821 artikel 2 taeller overfoersel af arbejdsviden knyttet til kontrollerede varer i bilag I eller bilag IV som teknisk bistand, saa at finjustere en model paa kontrollerede tekniske data eller overdrage den til en uverificeret oversaetter kan vaere en ikke-godkendt overfoersel. Verificerede oversaettere og et EU-hostet miljoe besvarer dette, en fortrolighedsaftale goer ikke.

  • At behandle logning som en eftertanke. Hvis beviset ikke registreres, mens arbejdet foregaar, kan du ikke rekonstruere det senere for BAFA, DGA eller et bemyndiget organ.


Ret disse fire, og pipelinen holder til den gennemgang, den blev bygget til. AD VERBUM koerer dette som vores standardarbejdsgang frem for et saerligt projekt, og det er forskellen mellem en demo og en konform produktionslinje. For et bredere billede af, hvilken styring EU's AI-forordning nu kraever af AI-oversaettelse, se hvad ISO 42001 kraever af et AI-styret oversaettelsesbureau.


Vores AI-oversaettelsestjenester


Vores oversaettelsestjenester til regulerede sektorer koerer paa ISO 27001- og ISO 42001-certificeret, EU-hostet infrastruktur, uden afhaengighed af offentlige cloud-vaerktoejer til kernebehandling. Hvert projekt koerer gennem vores AI+HUMAN-hybride arbejdsgang: vi indlaeser foerst klientens Translation Memories og termbaser, vores egetudviklede LLM-baserede LangOps-system genererer output begraenset af klientterminologi paa klienttilpassede open-weight-modeller, og vores certificerede fageksperter gennemgaar for teknisk noejagtighed og regulatorisk overholdelse. Vores QA er tilpasset ISO 17100 og ISO 18587, med sektorspecifikke krav som EU's AI-forordning (forordning 2024/1689) og haandtering af kontrollerede data under dual-use-forordning 2021/821, hvor det er relevant. Vi betjener kunder inden for life sciences, jura, finans, forsvar og produktion paa 150+ sprog med 3.500+ fagoversaettere. For teams, der haandterer revisionsfoelsomt indhold: kontakt os for at droefte jeres sikkerheds- og compliancekrav direkte.


FAQ


Hvilke aabne LLM'er har en licens ren nok til kommerciel selv-hosting?


DeepSeek V4 (MIT), Qwen 3.6 og Mistral Large 3 (begge Apache 2.0) tillader alle kommerciel brug, aendring og finjustering uden en leverandoeraftale. MIT og Apache 2.0 er de to tilladelige licenser uden taerskler for brugerantal eller brugsklausuler. Community- eller "modificerede" licenser kraever juridisk vurdering foer storstilet brug.


Skaber selv-hosting af en model af kinesisk oprindelse et dataopholdsspoergsmaal?


At hoste de aabne vaegte selv paa EU-hardware betyder, at inferensen aldrig naar udgiverens servere, saa spoergsmaalet om dataophold besvares af, hvor du koerer modellen, ikke hvor den blev bygget. Licensvilkaarene binder dig uanset jurisdiktion. For koebere, der vil fjerne argumentet helt, er en europaeisk bygget model som Mistral Large 3 det klare valg.


Hvordan adskiller finjustering paa et Translation Memory sig fra prompting?


Finjustering justerer modellens vaegte paa klientens eget TM og termbase, saa modellen internaliserer husterminologi og formulering. At begraense genereringen ved inferens med samme termbase haandhaever derefter godkendte termer segment for segment. Sammen producerer de output tilpasset klientens regulatoriske sprog frem for et generisk register.


Er menneskelig gennemgang stadig paakraevet, hvis modellen er finjusteret paa klientdata?


Ja. ISO 18587 kraever en kvalificeret menneskelig efterredaktoer, der tager ansvaret for den endelige oversaettelse, og for reguleret indhold fanger den gennemgang fejl, en flydende model stadig laver. En finjusteret model reducerer redigeringsindsatsen, men fjerner ikke ansvarstrinnet.


Hvad forventer ISO 42001 af en AI-oversaettelsespipeline?


ISO 42001 er standarden for AI-ledelsessystemer og forventer en risikovurdering, en konsekvensvurdering af AI-systemet og sporbare registreringer af, hvordan systemet bygges og koeres. For en oversaettelsespipeline betyder det at logge modelversion, traeningsdata, prompts, terminologibegraensninger og gennemgangshandlinger. Det bevis holder under en gennemgang fra en databeskyttelsesmyndighed eller en klientrevision.


Hvornaar udloeser brugen af en oversaetter EU's dual-use-regler?


Forordning 2021/821 artikel 2 definerer teknisk bistand, saa den omfatter overfoersel af arbejdsviden, og bilag I og bilag IV oplister kontrollerede varer. At dele kontrollerede tekniske data med en uverificeret oversaetter eller finjustere en model paa dem uden kontroller kan vaere en ikke-godkendt overfoersel, haandhaevet af myndigheder som BAFA, DGA og UAMA. Verificerede oversaettere og et EU-hostet miljoe giver dig en forsvarlig position, som en fortrolighedsaftale alene ikke goer.


Anbefalet



 
 
bottom of page