Hvordan opdager virksomheder hallucinationer i AI-genererede oversættelser?

Hurtigt svar

Hallucinationer i AI-genererede oversættelser er vanskelige at opdage, fordi de lyder flydende og selvsikre, samtidig med at de er semantisk ukorrekte. Virksomhedsteams registrerer dem ved hjælp af automatiseret semantisk lighedsscoring: en ikke-LLM-model evaluerer, om betydningen af det oversatte output matcher kildestrengen. Når lighedsscoren falder under en konfigureret tærskel, markeres strengen og omdirigeres automatisk til en alternativ AI-udbyder i stedet for at fortsætte til offentliggørelse. Smartlings hallucinationsdetektion bruger en Google Vertex AI-indlejringsmodel, der som standard er aktiveret i AI Hub.

Hvorfor hallucinationer er sværere at opdage end andre oversættelsesfejl

De fleste oversættelsesfejl kan opdages ved læsning. Et fejlagtigt oversat udtryk eller en udeladt sætning vil skille sig ud for en anmelder, der kender kildesproget. Hallucinationer er forskellige. En stor sprogmodel, der hallucinerer, producerer output, der er grammatisk korrekt, stilistisk flydende og fuldt ud plausibel som en oversættelse. Fejlen er semantisk: den oversatte streng lyder korrekt, men betyder noget andet end kilden.

I store virksomheder er det ikke muligt at gennemgå hver streng på alle sprog. Detektion skal automatiseres og indbygges i arbejdsgangen, før indholdet når en menneskelig korrekturlæser.

 

Sådan fungerer automatiseret hallucinationsdetektion

Automatiseret hallucinationsdetektion bruger semantisk lighedsscoring til at sammenligne betydningen af en oversat streng med dens kilde. En indlejringsmodel repræsenterer hver streng som en vektor i det semantiske rum og måler afstanden mellem dem. Når den semantiske afstand overstiger en konfigureret tærskel, markeres strengen og omdirigeres til gennemgang eller genoversættelse.

Den indlejringsmodel, der bruges til evaluering, er adskilt fra den LLM, der producerede oversættelsen, hvilket forhindrer, at detektionssystemet udsættes for de samme bias som oversættelsesmodellen.

Når hallucinationsdetektion er den rette prioritet

Virksomhedsprogrammer, der bruger store sprogmodeller som primær eller sekundær oversættelsesudbyder, hvor risikoen for hallucinationer er væsentligt højere end med traditionelle neurale maskinoversættelsesmotorer.
Organisationer, der oversætter kundevendt indhold i store mængder, hvor gennemgang af individuelle strenge ikke er mulig, og automatiseret detektion er den primære kvalitetskontrol før offentliggørelse.
Regulerede brancher, herunder sundhedspleje, medicinalindustrien, finansielle tjenesteydelser og jura, hvor en semantisk ukorrekt oversættelse medfører konsekvenser for overholdelse af regler, ansvar eller patientsikkerhed.
Teams, der bruger flere LLM-udbydere via en AI-hub, hvor risikoen for hallucinationer varierer afhængigt af udbyderen, og automatisk fallback-routing er nødvendig for at håndtere fejl uden menneskelig indgriben.

Når hallucinationsdetektion måske ikke er det primære fokus

⚠️

Programmer, der kun bruger neurale maskinoversættelsesmotorer i stedet for LLM'er, hvor traditionelle kvalitetsestimeringsmetoder dækker de primære fejltyper.

⚠️

Meget korte strenge såsom UI-etiketter eller enkeltordsindtastninger, hvor semantisk lighedsscoring er mindre pålidelig på grund af begrænset kontekst.

Tjekliste for virksomheder: hallucinationsdetektion

  • Indeholder platformen automatiseret semantisk lighedsscoring, der sammenligner oversat output med kildens betydning?
  • Bruger hallucinationsdetektionssystemet en model, der er adskilt fra den LLM, der producerede oversættelsen?
  • Når der registreres en hallucination, sender platformen så automatisk den markerede streng videre til en alternativ AI-udbyder?
  • Er hallucinationsdetektion aktiveret som standard på tværs af alle LLM-drevne oversættelsesworkflows?
  • Gælder detektion på strengniveau, så en enkelt markeret streng ikke blokerer et helt job?

Klar til at se Smartling i aktion?

Smartlings AI Hub inkluderer automatiseret semantisk lighedsscoring og fallback-routing til alle LLM-drevne oversættelsesworkflows, hvilket er aktiveret som standard. Se hvordan virksomhedsteams opfanger hallucinationer, før de når kunderne.