Dit lokaliseringsteam har to muligheder for en batch af AI-oversat indhold: gennemgå hvert segment, før det sendes, eller stol på outputtet og publicer det, som det er. Ingen af tilgangene fungerer godt i stor skala
Den ene er for langsom. Den anden er for risikabel.
AI-kvalitetsestimering tilbyder en tredje mulighed. I stedet for at vente på, at et menneske bedøm kvaliteten efter oversættelsen, forudsiger den kvaliteten under oversættelsen, markerer præcis hvilke segmenter der sandsynligvis skal gennemgås igen, og lader resten gå videre. Anmeldelse holder op med at være alt-eller-intet.
Denne artikel gennemgår, hvad AI-kvalitetsestimering er, hvordan konfidensscoring fungerer, og hvor den passer sammen menneskelig gennemgang i lokaliseringsarbejdsgangen, og hvordan det ændrer kvalitetsøkonomien uden at eliminere menneskelig dømmekraft.
Hvad er AI-kvalitetsestimering
AI-kvalitetsestimering forudsiger kvaliteten af en oversættelse uden at sammenligne den med en menneskelig reference.
Modeller trænet på oversættelsesfejlmønstre producerer et konfidenssignal for hvert oversat segment
Det er forskelligt fra det traditionelle Sproglig kvalitetssikring (LQA). LQA evaluerer oversættelser, efter de er produceret, og bruger menneskelige korrekturlæsere eller referenceoversættelser til at bedømme kvaliteten. Kvalitetsestimering sker før eller under oversættelsen, hvilket giver dit team et signal, der reagerer på sig selv med det samme i stedet for at vente på en gennemgangscyklus.
Resultatet er en score, ikke en dom. Hvad dit team gør med scoren afhænger af, hvordan arbejdsgangen dirigerer markerede segmenter.
Sådan fungerer AI-kvalitetsestimering
Quality estimation models are trained to recognize the patterns that signal likely translation errors. Ambiguous phrasing, terminologiske uoverensstemmelser, strukturelle anomalier og lavkonfidens motorydelse vises alle som funktioner, som modellen kan score.
Hvert oversat segment får en konfidensscore, der afspejler, hvor sandsynligt det er, at outputtet er nøjagtigt. Scoren ligger i arbejdsgangen, klar til at downstream-routingregler kan reagere på.
Segmenter med lav tillid markerer menneskelig opmærksomhed. Segmenter med høj sikkerhed bevæger sig fremad uden manuel kontrol, baseret på den samme routinglogik, der styrer, hvilken oversættelsesmetode et projekt bruger i første omgang.
Hvor AI-kvalitetsestimering passer ind i arbejdsgangen
Kvalitetsestimering findes i oversættelsesarbejdsgangen, ikke som en separat revisionsproces. Når tillidssignalet er tilgængeligt, ændrer fire ting sig ved, hvordan dit team udfører evaluering.
Forudgivelsesscreening
Screening før udgivelse er det første sted, hvor kvalitetsvurdering fortjener sin plads. Hvert segment får en score, før det publiceres, og scorerne styrer downstream-routing i stedet for at blive liggende i et dashboard til senere gennemgang.
Alternativet er, hvad de fleste hold har arvet. Fejl opstår efter offentliggørelse, når en kundeklage, en stikprøvekontrol eller en dårlig anmeldelse gør opmærksom på dem, og rettelse er dyrere på det tidspunkt end forebyggelse ville have været.
Tillidsbaseret routing
Tillidsbaseret routing forvandler hver score til en arbejdsgangsbeslutning. Segmenter under konfidensgrænsen sendes til menneskelig gennemgang; segmenter over den offentliggøres uden manuel kontrol, idet der anvendes de samme regler, der styrer, hvilken oversættelsesmetode et projekt bruger.
Styring af oversættelsesworkflow ruter allerede indhold efter risiko, indholdstype og sprog, og Smartlings dynamiske arbejdsgange Brug kvalitetsestimeringsniveauet som et yderligere beslutningskriterium efter maskinoversættelsestrinnet. Kvalitetsestimering tilføjer endnu et routingsignal til den samme workflow-motor, så beslutningen om at sende en sSegment til menneskelig gennemgang bliver datadrevet i stedet for volumendrevet.
Reduktion af overheadomkostninger for gennemgang
Anmeldere bruger deres tid på segmenter, der rent faktisk har brug for opmærksomhed. Smartlings Estimering af sprogkvalitet (LQE) Agenten scorer hvert maskinoversatte segment og estimerer, hvor meget menneskelig redigering der kræves. Gennemgangen koncentrerer sig om de markerede segmenter med lav tillid, som modellen viser, i stedet for at udtage stikprøver fra en fast procentdel af hvert projekt.
Økonomien ændrer sig i overensstemmelse hermed. Mængde, der tidligere krævede proportionel gennemgang, ryddes nu pipelinen baseret på modeltillid, og menneskelig gennemgang går fra at være en flaskehals til et målrettet trin.
Personio så dette skift i dets supportindhold. HR-teknologivirksomheden forudsagde en 50% reduktion i intern gennemgangstid ved at dirigere indhold igennem Maskinoversættelse med den passende tillidsbaserede gennemgangssti, samtidig med at oversættelsesbudgettet reduceres med 40 %. Frigjort revisionskapacitet blev geninvesteret i at udvide sprogdækningen i stedet for at øge bemandingen.
Beskyttelse mod hallucinationer
Kvalitetsestimering fungerer også som et beskyttelsesrækværk mod LLM-hallucinationer.
Når en AI-oversættelse adskiller sig fra kilden ved at introducere indhold, der ikke er der, udelade indhold, der er der, eller gengive terminologi unøjagtigt, fanger konfidensscoren problemet, før det publiceres.
Smartlings AI Hub tilføjer hallucinationsreduktion og LLM-udbyderkontroller, der fungerer sammen med kvalitetssignalet. Sammen holder lagene AI-outputtet styret i stedet for at være overladt til det, som den rå model producerer på en given anmodning.
Netskope illustrerer den operationelle effekt. Cybersikkerhedsvirksomheden opnåede cirka 95 % hurtigere ekspeditionstid og sparede hundredtusindvis af dollars på et enkelt år ved hjælp af Smartlings AI Hub med styringskontroller, der holdt AI-output klar til produktion i stor skala.
Traditionel gennemgang vs. AI-kvalitetsestimering
Traditionel gennemgang efter oversættelse og estimering af AI-kvalitet løser relaterede problemer på forskellige måder.
|
Faktor |
Traditionel gennemgang efter oversættelse |
AI-kvalitetsestimering |
|---|---|---|
|
Når det sker |
Efter oversættelsen er færdig |
Før eller under oversættelsen |
|
Hvad det kræver |
En menneskelig korrekturlæser eller referenceoversættelse |
Ingen menneskelig reference nødvendig for at få et signal |
|
Dækning |
Typisk en prøve på grund af korrekturlæserens kapacitet |
Hvert segment, scores automatisk |
|
Gennemgå indsatsen |
Fordel jævnt over indholdet |
Koncentreret på markerede segmenter med lav tillid |
|
Hastighed til at udgive |
Beskyttet af anmelderens tilgængelighed |
Indhold med høj tillid flyttes øjeblikkeligt |
Hvad sker der uden kvalitetsvurdering
Uden kvalitetsvurdering befinder anmeldelse sig i en af to yderpunkter. Enten bliver hvert segment gennemgået, hvilket forsinker leveringen og begrænser, hvor meget indhold der kan skaleres, eller også falder anmeldelsesdækningen til en stikprøve, hvilket tillader fejl at trænge igennem.
Selv med en stikprøve bruges ressourcerne til gennemgang jævnt på tværs af indholdet, uanset hvilke segmenter der rent faktisk indebærer en risiko. En senior anmelder inspicerer en rutinemæssig supportartikel i samme tempo som en juridisk ansvarsfraskrivelse.
IBM viser, hvad målrettet gennemgang producerer i stor skala. Teknologivirksomheden forbedrede oversættelseskvaliteten med 40 % og reducerede den gennemsnitlige time-to-market med over 50 % ved at parre AI menneskelig oversættelse med menneskelig validering på de segmenter, hvor det betød mest, i stedet for en generel gennemgang af alt.
Kvalitetsvurdering fjerner ikke menneskelig dømmekraft fra processen. Det fortæller dit team præcis, hvor den vurdering er værd at bruge.
Gør kvalitet til et signal, ikke en dom
Kvalitetsestimering omdanner oversættelseskvalitet fra en efterfølgende vurdering til et signal, som dit team handler på, før indholdet sendes. Tillidsbaseret routing giver dit team mulighed for at gennemgå undtagelsesvis i stedet for at gennemgå alt.
For mere information om, hvordan Smartling kan hjælpe dig med at opretholde oversættelseskvaliteten i stor skala, så book et møde med os i dag.