International forretningsstrategi i dag kræver, at indhold bevæger sig på tværs af sprog med hastigheder, der ville have overvældet oversættelsesteams i et hvilket som helst tidligere årti.
Maskinoversættelse (MT) er nu centralt for, hvordan virksomhedsindhold skaleres, men den oversættelseskvalitet, den leverer, kan være inkonsekvent.
MT-output varierer afhængigt af sprogpar, indholdstype og arbejdsgang, selv inden for et enkelt projekt. Den varians betyder mere end den gennemsnitlige kvalitetsscore, fordi den tid, der bruges på at rette én inkonsekvent streng på tværs af indhold med høj synlighed, sletter de effektivitetsgevinster, der gjorde MT umagen værd.
Alle virksomhedslokaliseringsprogrammer står over for de samme afvejninger, når de implementerer MT i stor skala: hastighed kontra flydende, omkostninger kontra kvalitet, skalering kontra kontrol.
Platforme bygget til kvalitetsstyring af MT omdanner variabelt output til pålidelige oversættelser gennem terminologikontroller, automatiserede gennemgangsstier og ensartet måling.
Smartling er en sådan platform, og denne artikel gennemgår, hvad MT-kvalitet egentlig er, hvordan man måler den, og hvordan man holder den konsistent i takt med at indholdsmængden vokser.
Hvad er kvaliteten af maskinoversættelse?
Maskinoversættelseskvalitet refererer til, hvor præcist og naturligt oversat indhold afspejler betydningen af den originale tekst. Kvalitetsmål omfatter nøjagtighed, flydende tekst og konsistens.
MT-kvaliteten varierer afhængigt af sprogparret, indholdstypen og hvor godt oversættelsesarbejdsgangen er struktureret omkring begge dele.
For eksempel:
- Markedsføringsindhold , der kræver tonetilpasning, stiller andre kvalitetsforventninger end teknisk dokumentation, der kræver præcision i terminologien.
- Et sprogpar med rigelige træningsdata producerer et andet basisoutput end et med begrænsede data.
Hvad bestemmer kvaliteten af maskinoversættelse
Fem faktorer bestemmer, om en MT-motor producerer brugbar output til et givet job.
Sprogparrets kompleksitet. Nogle par som engelsk-spansk og engelsk-fransk har årtiers træningsdata af høj kvalitet. Andre har meget mindre, og MT-outputkvaliteten afspejler denne forskel.
Indholdstype. Teknisk dokumentation kræver præcision i terminologien. Marketingteksten skal tilpasses i tonen. Juridisk indhold kræver begge dele, plus bogstavelig troskab. Maskinoversættelse, som mangler evnen til at nuancere, fungerer ikke lige godt på tværs af alle tre.
Konteksttilgængelighed. MT-motorer, der kan tilgå omgivende segmenter, dokumentstruktur og visuel kontekst, producerer bedre output end motorer, der oversætter strenge isoleret.
Træningsdata Modeller trænet på domænespecifikke og brandspecifikke data klarer sig bedre end generelle søgemaskiner til specialiseret indhold.
Valg af motor eller model. At udelukkende stole på generel MT for hver indholdstype og hvert sprogpar vil ikke give ensartede resultater af høj kvalitet. LLM'er, finjusterede neurale maskinoversættelsesmotorer (NMT) og RAG-forstærkede modeller håndterer hver især forskellige indholdstyper forskelligt. I stedet for at bruge MT som standard, sikrer valget af den rigtige model til hvert job en overlegen oversættelseskvalitet.
Nøgledimensioner af maskinoversættelseskvalitet
MT-kvalitet kan referere til forskellige faktorer, afhængigt af hvem du spørger, og hvad der gik galt. Disse fire dimensioner dækker det fulde billede, og hvis en af dem ikke håndteres, bliver det problem, der definerer projektet.
Nøjagtighed
Nøjagtighed måler, om oversættelsen bevarer kildens betydning. En flydende, men unøjagtig oversættelse er sværere at opdage i en korrekturlæsning end en klodset, men præcis, hvilket gør disse fejl mere risikable.
Flydende
Det er i maskinskrivningens flydende sprog, at maskinskrivning oftest afslører sine mangler. Grammatik og ordvalg er afgørende. Det sværere problem er register: en motor, der oversætter korrekt, men skriver som en manual, når indholdet kræver noget samtalemæssigt, eller omvendt.
Konsistens
Konsistensen brydes stille og roligt og i stor skala. Det samme udtryk gengivet på tre forskellige måder på tværs af en produktgrænseflade, en hjælpeartikel og en marketingside undergraver brugernes tillid og skaber kompliceret omarbejdelse for teamet.
Kontekstbevidsthed
Kontekstbevidsthed er det, der adskiller en maskine, der oversætter ord, fra en, der oversætter betydning. Kønsbestemte pronominer på tysk, en brugergrænsefladeetiket, der læses forskelligt afhængigt af skærmen, eller en sætning, der er idiomatisk på ét marked og meningsløs på et andet, kræver, at søgemotoren fortolker, ikke bare konverterer.
Hvordan Smartling styrker konsistens
Håndhævelse af ordlister og genbrug af oversættelseshukommelse (TM) holder godkendt terminologi og forudgodkendt formulering låst fast på tværs af alle job. Når en term er godkendt, anvender Smartling den automatisk næste gang, den vises, uanset om oversættelsen sker via MT, AI-oversættelse eller AI Human Translation (AIHT).
Smartlings AI-oversættelsesværktøjssæt tager dette videre. Indsættelse af termer i AI-ordlisten sikrer, at substitutioner passer til strengens kontekst og er grammatisk korrekte, i stedet for blot at erstatte termen.
Grammatiske sikkerhedsforanstaltninger er afgørende for sprog, hvor et ord i en ordliste skal bøjes forskelligt afhængigt af dets placering i en sætning. AI-adaptiv oversættelseshukommelse øger TM-udnyttelsen i MT-arbejdsgange ved at optimere tilgængelige matches, så forudgående godkendte formuleringer fortsætter, selv når det omgivende indhold er ændret.
For indhold, hvor konsistens betyder mere end terminologi (vægt på tone, register eller brandvoice), holder Smartling Transcreation Tool transkreationshukommelsen adskilt fra oversættelseshukommelsen. Som følge heraf blandes kreative tilpasninger ikke ind i standard oversættelsesworkflows eller skaber inkonsekvens, hvor bogstavelig nøjagtighed er påkrævet.
Sådan måles kvaliteten af maskinoversættelse
Måling af MT-kvalitet kombinerer tre tilgange. De fleste virksomhedsprogrammer bruger alle tre på forskellige punkter i arbejdsgangen.
Menneskelig evaluering
Menneskelig evaluering er afhængig af uddannede lingvister, der gennemgår oversat indhold i forhold til objektive fejlkategorier. Rammeværket for multidimensionelle kvalitetsmålinger (MQM) er branchestandarden for dette arbejde.
Kontrollører logger fejl efter type, såsom nøjagtighed, flydende tekst, terminologi, stil og lokale konventioner, og efter alvorlighedsgrad, såsom neutral, mindre, større eller kritisk. Systemet beregner en samlet kvalitetsscore baseret på vægtning af alvorlighedsgrader.
Lingvistisk kvalitetssikring (LQA) strømliner menneskelig gennemgang under MQM-evaluering. LQA er stikprøvebaseret, hvilket betyder, at teams gennemgår et repræsentativt udsnit af oversat indhold for at producere en proxy-måling af den samlede kvalitet i stedet for at inspicere hver streng.
Automatiserede målinger
Automatiserede metrikker som BLEU, COMET og TER sammenligner MT-output med referenceoversættelser algoritmisk. De kører på få sekunder, skalerer på tværs af millioner af strenge og producerer ensartede numeriske scorer.
De korrelerer ufuldkomment med menneskelig dømmekraft, hvilket er grunden til, at automatiserede metrikker fungerer bedst som tidlige advarselssignaler snarere end endelige kvalitetsdomme.
Hybridmåling
Hybridmåling kombinerer menneskelig gennemgang af samplet indhold med automatiseret scoring af det fulde korpus. Hybride tilgange er de mest almindelige i virksomhedsproduktion, fordi de afbalancerer måledybde mod måleomkostninger.
Hvordan Smartling muliggør hybridmåling
Smartlings LQA Suite håndterer struktureret menneskelig evaluering. Lingvister evaluerer oversættelser i forhold til brugerdefinerede MQM-kompatible skemaer. LQA tildeler et alvorlighedsniveau til hver fejl, der indgår i en samlet kvalitetsscore.
Resultaterne vises i LQA-dashboardet efter tidsramme, lokalitet, projekt eller job, hvilket giver lokaliseringschefer et struktureret, datadrevet overblik over, hvor kvaliteten står, og hvor den forringes.
For teams, der kører MT i stor skala, er stikprøver alene ikke nok. LQE-agenten (Law Quality Estimation) evaluerer automatisk hver MT-streng og mærker hver streng som Høj, Mellem eller Lav baseret på den forventede indsats efter redigeringen.
Høje strenge kan omgå menneskelig gennemgang helt i en dynamisk arbejdsgang; mellemstore strenge markeres til let redigering. Gennemgang af arbejdet går derhen, hvor der er brug for det.
De to værktøjer dækker begge ender af måleproblemet: fuldt korpussignal på hver MT-streng og struktureret menneskelig scoring på samplet indhold. Begge dele indgår i Smartling Analytics, hvilket giver teams data til at optimere arbejdsgange, retfærdiggøre beslutninger og holde kvalitetsprogrammer ansvarlige over tid.
Almindelige problemer med kvaliteten af maskinoversættelse
Fem fejltilstande optræder på tværs af virksomhedens MT-programmer. De fleste af disse fejl er arbejdsgangsproblemer, ikke modelproblemer.
Bogstavelige oversættelser. Idiomer, billedsprog og kulturelt specifik frasering gengives ord for ord i stedet for efter betydning. En "home run" bliver en baseballreference i et sprog, hvor baseball ikke har nogen kulturel vægt.
Terminologisk inkonsekvens. Det samme brandudtryk vises i tre forskellige oversættelser på tværs af det samme websted. Et produktnavn bliver oversat på én side og efterladt på engelsk på en anden.
Grammatiske fejl. Kønsoverensstemmelse, verbumtider og ordstilling kommer forkert ud i sprog med rigere morfologi end kilden. Disse fejl opstår, når MT-motorer mangler kontekst omkring subjektet eller objektet i en sætning.
Kontekstfejl. Pronominer løses til den forkerte fortilfælde. Homografier giver den forkerte betydning. Et ord, der betyder én ting i et juridisk dokument, oversættes, som om det betyder noget andet i dagligdags forstand.
Kulturelle uoverensstemmelser. Formalitetsniveauer, hædersbevisninger og kulturelle referencer rammer ikke det niveau, som publikum forventer.
Maskinoversættelse vs. menneskelig oversættelseskvalitet
Maskinoversættelse og menneskelig oversættelse er ikke udskiftelige. De serverer forskelligt indhold med forskellige afvejninger.
| Faktor | Maskinoversættelse | Menneskelig oversættelse |
|---|---|---|
| Hastighed | Høj | Lav |
| Koste | Lav | Høj |
| Kvalitet | Variabel | Høj |
| Skalerbarhed | Høj | Moderat |
Ingen af tilgangene er universelt bedre. Det rigtige spørgsmål for virksomhedsprogrammer er, hvilket indhold hører til på hvilket spor, og hvordan det skal dirigeres automatisk, efterhånden som mængden vokser.
Smartling AutoSelect løser routingproblemet ved at evaluere indhold på oversættelsestidspunktet og sende det til den bedst egnede MT-motor, LLM eller det menneskelige arbejdsgangstrin. Hvis den valgte motor ikke kan producere en kvalitetsoversættelse, forsøger AutoSelect igen med den næstbedste mulighed og vender derefter tilbage til et menneskeligt arbejdsgangstrin, hvis det er nødvendigt.
For teams, der ønsker endnu mere kontrol, understøtter AutoSelect specialtrænede motorer i rotationen sammen med standard MT-udbydere. Det betyder, at domænespecifikt indhold, såsom juridisk, medicinsk eller meget teknisk, kan dirigeres til en maskine, der er bygget til det, mens generelt indhold tager standardstien. Resultatet er et routinglag, der tilpasser sig indholdets kompleksitet i stedet for at anvende en enkelt motor på tværs af alt.
Sådan forbedrer du kvaliteten af maskinoversættelse
MT-kvaliteten forbedres gennem fem taktikker, der hver især adresserer en forskellig del af arbejdsgangen.
Brug ordlister. Godkendt terminologi sikrer konsistens på tværs af strenge og på tværs af job. Uden en ordliste gengives det samme brandudtryk på tre forskellige måder inden for det samme indhold.
Giv kontekst. Metadata på segmentniveau, visuel kontekst og omgivende indhold forbedrer MT-nøjagtigheden. Motorer, der oversætter strenge isoleret, mangler den information, de har brug for til at løse tvetydighed korrekt.
Brug hybride arbejdsgange. Maskinoversættelse efter redigering (MTPE) kombinerer MT-output med menneskelig gennemgang. MTPE bruger menneskelige lingvister til at rydde op i rå MT-output. Før dette gennemgangstrin kontrollerer Smartlings AI Post-Editing Agent automatisk grammatik, tone og semantisk nøjagtighed – så lingvisten korrigerer det, der er tilbage, i stedet for at genopbygge fra bunden.
Standardiser processer. Teams, der sender indhold gennem ensartede arbejdsgange ved hjælp af den samme ordliste, TM og gennemgangstrin, får ensartet kvalitet. Teams, der håndterer hvert projekt forskelligt, får kvalitet, der afspejler inkonsistensen.
Overvåg ydeevne. LQA-prøver, LQE-scoring og rapportering af fejltrends viser, hvor kvaliteten er i tilbagegang, før det bliver et kundeorienteret problem. Uden overvågning dukker kvalitetsproblemer først op, efter at nogen har rapporteret dem eksternt.
Hvordan Smartling forbedrer MT-kvaliteten i praksis
Smartlings AI-efterredigeringsagent kører automatisk på MT-output, før det når en menneskelig korrekturlæser. Den kontrollerer grammatik, tone og semantisk nøjagtighed og beriger oversættelserne med dine sproglige aktiver, så outputtet er tættere på at være publicerbart.
Lingvisten korrigerer det, der er tilbage, i stedet for at genopbygge fra bunden. Kombineret med Language Quality Estimation (LQE) Agent, som mærker hver MT-streng som Høj, Mellem eller Lav baseret på den forventede indsats efter redigering.
Som et resultat kan teams dirigere strenge, der kræver opmærksomhed, direkte til gennemgang og publicering af strenge med høj sikkerhed, uden at behandle hver streng ens uanset den faktiske risiko.
Sådan opretholder du kvalitet i stor skala
Skalering af MT-kvalitet er et andet problem end forbedring af en enkelt oversættelse. I stor skala bliver kvalitet en funktion af, hvor pålideligt arbejdsgangen anvender kvalitetskontroller på tværs af tusinder eller millioner af strenge. Fire principper afgør, om denne pålidelighed holder.
Standardisering af arbejdsgange. Den samme indholdstype dirigeres gennem den samme arbejdsgang hver gang. Marketingindhold bevæger sig gennem marketingworkflowet. Supportindhold bevæger sig gennem supportarbejdsgangen. Kvaliteten stopper afhængigt af, hvem der ejer et givet projekt.
Automatisering Indhold flyttes fra kildesystemer til oversættelsesworkflows uden manuel overdragelse. Godkendelser sendes automatisk. Oversat indhold leveres tilbage til kildesystemet uden eksport-importcyklusser. Når en streng ændres, er det arbejdsgangen, der fanger den, ikke en projektleder, der tjekker et regneark.
Centraliseret kvalitetssporing. LQA-scorer, LQE-fordelinger og fejltendenser findes samlet ét sted. Teams opdager uoverensstemmelser på tværs af sprog og indholdstyper, før de sammensættes på tværs af hundredvis af yderligere strenge.
Kontinuerlig forbedring. Ordlister, TM'er og promptskabeloner opdateres, efterhånden som nye termer og mønstre dukker op. Kvalitetsgrundlinjen stiger over tid i stedet for at forblive flad eller forringes i takt med at indholdsmængden vokser.
Uden at alle fire ovenstående principper arbejder sammen, bliver kvalitet i stor skala et gennemsnitsproblem – god nok samlet set, men mangelfuld i de specifikke tilfælde, der betyder mest.
Personio illustrerer, hvordan dette skift ser ud i praksis. HR-softwarevirksomheden kopierede manuelt kildeindhold fra Zendesk, sendte filer via e-mail til et oversættelsesbureau og indsatte oversættelserne tilbage. Denne proces fungerede ved lav volumen, men kunne ikke skaleres til yderligere sprog uden at tilføje antallet af medarbejdere.
Efter at have centraliseret deres lokaliseringsprogram på Smartling og introduceret maskinoversættelse til supportindhold, forventer Personios indholdsuddannelsesteam at spare 40 % af deres nuværende oversættelsesbudget og reducere den interne gennemgangstid med mindst halvdelen. MT håndterer det store, standardiserede hjælpeindhold, mens menneskelig gennemgang håndterer det, der rent faktisk har brug for det. Personio geninvesterer nu budgettet i sprog, som virksomheden tidligere ikke havde råd til at understøtte.
Risici ved dårlig maskinoversættelseskvalitet
Når teams ikke styrer MT-kvaliteten, viser den efterfølgende påvirkning sig fire forudsigelige steder.
Mærkeinkonsistens. Produktnavne, slogans og kernebrandsprog varierer på tværs af markeder. Kunderne ser forskellige versioner af det samme mærke afhængigt af hvilket websted de lander på.
Kundeforvirring. Produktbeskrivelser, supportartikler og betalingsprocesser producerer uklare instruktioner på målsprogene. Kunder opgiver, misbruger eller eskalerer.
Overholdelsesproblemer. Reguleret indhold inden for juridiske, medicinske og finansielle kategorier indebærer risiko, når oversættelser mangler det nødvendige sprog eller introducerer unøjagtigheder. Nogle brancher behandler oversættelsesfejl som overtrædelser af reglerne.
Øget efterarbejde. Kvalitetsproblemer opstår efter udgivelsen og kræver manuel oprydning. Omkostningerne ved at rette indhold bagefter overstiger omkostningerne ved at oversætte det korrekt første gang.
Hvad sker der uden kvalitetssystemer
Lokaliseringsprogrammer, der opererer uden strukturerede kvalitetssystemer, støder på de samme fire mønstre.
Inkonsistente output. Terminologi, tone og formuleringer varierer på tværs af indhold, fordi der ikke er nogen delte aktiver eller regler, der holder dem stabile.
Manuelle QA-forsinkelser. Kvaliteten afhænger af, at individuelle anmeldere opdager problemerne ét ad gangen. QA bliver den flaskehals , som resten af arbejdsgangen skulle eliminere.
Manglende synlighed. Ingen besvarer grundlæggende spørgsmål om kvalitet, herunder hvor den er stærk, hvor den er på afveje, og hvilke sprog eller indholdstyper indebærer den største risiko.
Dårlig skalerbarhed. Tilføjelse af sprog og indholdsmængder multiplicerer koordineringsomkostningerne i stedet for at udnytte genbrugelige aktiver. Hvert nyt sted føles lige så udfordrende som det første.
Kvaliteten af maskinoversættelser er et systemproblem
MT-kvaliteten er variabel af natur. Valg af søgemaskine, indholdstype, sprogpar og workflowdesign former alle outputtet, og ingen enkelt taktik producerer ensartet kvalitet i sig selv.
Succesfulde teams er afhængige af et system snarere end MT i isolation. Inden for dette system anvender strukturerede arbejdsgange ensartede kvalitetskontroller på tværs af hvert job. Automatisering flytter indhold gennem disse arbejdsgange uden manuelle overdragelser. Og kvalitetsmålinger viser, hvor outputtet er stærkt, og hvor det er afvigende.
De fleste virksomhedsteams har dele af denne infrastruktur, og det er her, kvalitetsproblemerne gemmer sig. Smartling lukker hullet ved at kombinere strukturerede arbejdsgange, automatisering og kvalitetsmåling i én platform, hvilket giver teams en gentagelig vej til MT-kvalitet, der skaleres med indholdsmængden i stedet for antallet af medarbejdere.
Hvis du vil se, hvordan Smartling samler det hele på én platform, så book en demo.
Ofte stillede spørgsmål
Maskinoversættelseskvalitet måler, hvor præcist og naturligt oversat indhold afspejler kildens betydning og tone. Evaluering dækker nøjagtighed, flydendehed, konsistens og kontekstforståelse.
Kvaliteten varierer afhængigt af sprogpar, indholdstype og arbejdsgang, hvilket er grunden til, at virksomhedsprogrammer måler og styrer MT-kvalitet i stedet for at antage den.
De tre almindelige tilgange er menneskelig evaluering ved hjælp af MQM-rammeværket, implementeret gennem LQA; automatiserede metrikker som BLEU og COMET; og hybridmåling, der kombinerer stikprøvebaseret menneskelig gennemgang med automatiseret scoring på hele korpuset.
Smartlings LQA-dashboard og agent til estimering af sprogkvalitet (LQE) understøtter begge sider af hybridmodellen.
Fem faktorer driver kvaliteten af MT-resultater. Sprogparrets kompleksitet, indholdstype, konteksttilgængelighed, dækning af træningsdata og modelvalg former alle outputtet.
Design af arbejdsgange er lige så vigtigt som alle disse faktorer individuelt, fordi kvalitet i stor skala afhænger af, hvor pålideligt kontroller som ordlister og oversættelseshukommelse anvendes.
MT fungerer pålideligt for indhold, der matcher modellens styrker og kører gennem en arbejdsgang, der anvender de rette kvalitetskontroller. Lavrisikoindhold med håndhævelse af ordlister og automatiserede kvalitetskontroller sendes med høj sikkerhed.
Indhold med højere synlighed i marketing-, regulerede og brandkritiske kategorier bør passere gennem hybride arbejdsgange som MTPE eller AI-efterredigering, hvor LLM og menneskelig validering tilføjer et lag af kvalitetsverifikation.