Hvordan måler man kvaliteten af oversættelser på tværs af GPT, Claude og DeepL?
Hurtigt svar
Benchmarking af oversættelseskvalitet på tværs af søgemaskiner som GPT-4o, Claude 3.5 Sonnet og DeepL kræver tre komponenter: et repræsentativt testsæt trukket fra dine faktiske indholdstyper og sprogpar, standardiseret automatiseret scoring ved hjælp af metrikker som BLEU, MetricX eller COMET, og en ensartet evalueringsramme, der anvendes identisk på tværs af alle søgemaskiner. Ingen enkelt søgemaskine vinder på tværs af alle sprogpar og indholdstyper. Det praktiske mål med benchmarking er at identificere, hvilken motor der klarer sig bedst til dit specifikke indhold i stor skala, og derefter automatisk dirigere produktionsjob til den motor. Smartlings AI Hub evaluerer løbende søgemotorens ydeevne og sender hver streng til den mest effektive søgemaskine for dens sprogpar og indholdstype.
Hvorfor benchmarking af oversættelsesmaskiner ikke er ligetil
Oversættelsesmotorens ydeevne varierer betydeligt afhængigt af sprogpar, indholdstype og domæne. En søgemaskine, der producerer stærk spansk marketingtekst, kan underpræstere på japansk teknisk dokumentation. En benchmark, der udelukkende er bygget på offentlige testsæt, afspejler muligvis ikke din organisations faktiske indhold, hvilket betyder, at vinderen i en standardiseret evaluering muligvis ikke er vinderen i produktion.
De tre mest almindelige fejl i forbindelse med benchmarking af oversættelser er at bruge et for lille testsæt, anvende forskellige evalueringskriterier på forskellige søgemaskiner og behandle en benchmarkkørsel som en engangsbeslutning snarere end en løbende måling. LLM-oversættelseskvaliteten ændrer sig med hver modelopdatering, hvilket betyder, at en søgemaskine, der var nummer tre for seks måneder siden, nu muligvis overgår den tidligere leder.
Hvad automatiserede scoringsmetoder rent faktisk måler
BLEU (Tosproget Evalueringsstuderende)
BLEU-scorer måler overlapningen mellem et maskinoversat output og en menneskelig referenceoversættelse, udtrykt som en værdi mellem 0 og 1. BLEU er hurtig og bruges i vid udstrækning som en baseline, men den belønner overfladiske ordmatch snarere end semantisk nøjagtighed, hvilket betyder, at en flydende hallucination kan score godt, mens en korrekt, men anderledes formuleret oversættelse scorer dårligt. Til benchmarking i virksomheder er BLEU nyttig som et førstepassfilter, men utilstrækkelig som et selvstændigt kvalitetssignal.
MetricX og COMET
MetricX (Google) og COMET (Unbabel) er neurale evalueringsmålinger, der bruger sprogmodeller til at vurdere oversættelseskvaliteten ved at sammenligne kildetekst, maskinoutput og referenceoversættelser på tværs af semantiske dimensioner. Begge korrelerer stærkere med menneskelig dømmekraft end BLEU, især med hensyn til at detektere flydende fejl og betydningsskift. For virksomhedsprogrammer, derevaluerer LLM-oversættelse i stor skala, giver MetricX og COMET et mere pålideligt signal end BLEU alene.
Menneskelig evaluering som valideringslag
Automatiserede målinger måler oversættelseskvaliteten i forhold til en reference. Menneskelige evaluatorer vurderer, om en oversættelse fungerer i kontekst, bevarer brandets stemme og læses naturligt for en modersmålstalende. For indholdstyper med høj indsats indsnævrer automatiseret benchmarking feltet, og menneskelig evaluering validerer vinderen, før der træffes en beslutning om produktionsrute.
Sådan kører du et oversættelsesbenchmark, der producerer handlingsrettede resultater
- Byg et repræsentativt testsæt. Vælg 200 til 500 kildestrenge fra dit faktiske produktionsindhold, der dækker de sprogpar, indholdstyper og domæner, du er mest interesseret i. Et benchmark baseret på generiske offentlige testdata vil ikke forudsige, hvordan en søgemaskine klarer sig på din marketingtekst, dine hjælpecenterartikler eller dine produktgrænsefladestrenge.
- Kør identiske strenge gennem hver motor. Indsend de samme kildestrenge til GPT-4o, Claude 3.5 Sonnet, DeepL og alle andre motorer under evaluering uden forskelle i forbehandlingen mellem dem. Kontrollerede forhold er den eneste måde at isolere motorens ydeevne fra andre variabler.
- Score med MetricX eller COMET som primære målepunkter. Anvend identisk scoring på alle output. Spor scorer efter sprogpar og indholdstype i stedet for at gennemsnitte alle resultater, da aggregerede scorer kan maskere betydelig variation pr. sprog.
- Brug din oversættelseshukommelse og ordliste, før du sammenligner. Kvaliteten af virksomhedsoversættelser afhænger delvist af, hvor godt en oversættelsesmotor integrerer med dine eksisterende sproglige aktiver. Benchmark motorer under forhold, der inkluderer din ordliste og TM, i stedet for at evaluere rå motorydelse isoleret.
- Planlæg løbende måling. LLM-oversættelsesfunktionerne ændres med hver modeludgivelse. En benchmark-kørsel er et øjebliksbillede på et bestemt tidspunkt. Teams, der dirigerer job baseret på kontinuerlige præstationsdata i stedet for en enkelt benchmarkbeslutning, opretholder bedre kvalitet over tid.
Når benchmarking af oversættelser er den rette prioritet
Når en formel benchmark muligvis ikke er nødvendig
⚠️
Programmer tidligt i implementeringen af AI-oversættelse, hvor etablering af grundlæggende arbejdsgange, ordlister og TM er den umiddelbare prioritet, og valg af motor kan udskydes, indtil volumen retfærdiggør benchmarking-investeringen.
⚠️
Teams, der bruger en platform med indbygget motorrouting, der evaluerer og router automatisk, hvor benchmarking håndteres af platformen i stedet for manuelt af lokaliseringsteamet.
Hvordan håndterer Smartling benchmarking og routing af motorer?
Smartlings AI Hub evaluerer oversættelseskvaliteten på tværs af mere end 20 LLM'er og MT-motorer, herunder GPT-4o, Claude 3.5 Sonnet, DeepL, Amazon Bedrock, Google Vertex og andre. Smartlings AI-team udfører regelmæssig benchmarking ved hjælp af MetricX, COMET og BLEU for at evaluere søgemotorens ydeevne på tværs af indholdstyper og sprogpar. Resultaterne informerer Smartlings Auto Select-routing, som tildeler hver streng til den mest effektive motor for dens specifikke sprogpar og indholdstype i stedet for at anvende en enkelt motor universelt.
For virksomhedsteams, der ønsker at køre deres egne sammenligninger, understøtter Smartlings platform konfigurerbare LLM-profiler, der giver teams mulighed for at teste forskellige motorkonfigurationer på produktionsindhold, før de indstiller en standard routingregel.
Hjælpedokument: Smartling Auto Select MT
Hjælpedokument: Smartling Auto Select LLM
Relaterede spørgsmål
Benchmark oversættelseskvalitet på tværs af GPT, Claude og DeepL
Smartlings AI Hub evaluerer oversættelseskvaliteten på tværs af mere end 20 LLM'er og MT-motorer og sender hver streng til den motor, der yder bedst for dens sprogpar og indholdstype. Se, hvordan virksomhedsteams bruger Auto Select til at fjerne gætteriet fra valg af søgemaskine.