Zum Hauptinhalt springen
Suchen

Benchmarks für den Einsatz von LLMs in der Übersetzung gibt es viele – und je nach Sprachkombination und Fachgebiet schneidet dabei fast jedes Modell mal als das Beste ab. Die Tests finden oft unter „Laborbedingungen“ statt: kleine, uniforme Datensätze, wenige Vorgaben bzw. Spezifika und die Betrachtung einzelner Sprachkombinationen. Vom Alltagseinsatz eines Sprachdienstleisters sind diese Bedingungen weit entfernt.

Um die für unsere Einsatzbedingungen und -zwecke am besten geeigneten LLMs zu finden, hat das KI-Team von oneword über Monate unterschiedliche LLMs getestet und ausgewertet. Unser Artikel liefert Einblicke in die umfangreichen Tests und ihre Ergebnisse.

Spieglein, Spieglein an der Wand

LLMs gibt es mittlerweile wie Sand am Meer. Für die Auswahl von Test-Kandidaten aus dieser Tool-Landschaft wurden vorab Anforderungen an das LLM selbst und das technische Setting definiert. Die Kernpunkte dabei waren:

  • Datensichere Lösung
  • Übersetzungsqualität der getesteten Sprachen
  • Möglichst reproduzierbare Ergebnisse
  • Größtmögliche Unabhängigkeit von Anbietern

Durch den Fokus auf Datensicherheit und der größtmöglichen Unabhängigkeit von Anbietern kamen nur LLMs in Betracht, die ein lokales Hosting – sogenanntes Modell Signing – erlauben.

Es wurden insgesamt neun Modelle von sieben verschiedenen Anbietern getestet. Eines der Modelle wurde nochmals in drei unterschiedlichen Abstufungen der Quantisierung betrachtet, um sein Verhalten und die Ergebnisqualität bei dieser auf Speicherplatzreduzierung abzielenden Methode zu untersuchen.

Sprachen und Daten

Die ausgewählten LLMs wurden vom oneword KI-Team in insgesamt sieben Sprachen getestet. Dabei waren Englisch und Französisch als meistbeauftragte Übersetzungssprachen gesetzt. Hinzu kamen Spanisch und Italienisch, um Vergleiche innerhalb der romanischen Sprachfamilie zu ermöglichen. Chinesisch wurde als meistgefragte asiatische Sprache ausgewählt. Hinzu kamen zwei „Low-Ressource-Sprachen“ in Form von Griechisch und Kroatisch, für die beim Training der LLMs deutlich weniger Trainingsmaterial zur Verfügung steht als für andere europäische Sprachen.

Als Datensatz wurden drei Texte unterschiedlicher Länge aus unterschiedlichen Sachgebieten ausgewählt, für die verschiedene Vorgaben hinsichtlich Fachterminologie und Übersetzungsspezifika zu beachten war. So gab es für einen Text beispielsweise klar definierte Regeln zur Wortreihenfolge von Produktnamen für alle Sprachen, während es für die anderen Texte unter anderem Vorgaben zur Schreibweise von Zahlen und Einheiten gab.

Diese Übersetzungsspezifika wurden vom KI-Team als Custom Prompts formuliert, um den Output der LLMs zu beeinflussen. Pro Text wurden zwischen sechs und zehn Custom Prompts an die Modelle übermittelt. Die vorgegebene Terminologie wurde dank der Nutzung unserer Language Technology Plattform oneSuite direkt als Datenbank eingebunden, um bei der Vorübersetzung berücksichtigt zu werden.

Output und Bewertung

Die Bewertung erfolgte durch menschliche Überprüfung. Dabei wurden Fehler des maschinellen Outputs in insgesamt 14 MQM-Kriterien (u. a. Auslassung, Grammatik und Terminologie) kategorisiert. Die Kennzahlen aus dem MQM-Tagging waren sowohl im Vergleich der Modelle untereinander als auch zwischen den Sprachen interessant: Während für Englisch mit dem besten Modell nur 28 Fehler und mit dem schlechtesten Modell 106 Fehler im gleichen Text getaggt wurden, lagen die Zahlen für Griechisch meist um das Zwei- bis Zweieinhalbfache höher.

Und auch wenn ein Satz grundsätzlich korrekt übersetzt wurde, zeigt unser Beispiel, wie unterschiedlich der Output der Modelle war:

KI war für die Übersetzungsbranche beim Durchbruch der Large Language Models (LLM) längst nichts Neues mehr.
AI was nothing new to the translation industry when large language models (LLMs) made their breakthrough.AI has been no stranger to the translation industry with the advent of Large Language Models (LLMs).AI was long no longer anything new for the translation industry when Large Language Models (LLM) broke through.

Fehlerquellen der LLMs

Was im Beispiel oben nach Kleinigkeiten aussieht – wie die Groß- und Kleinschreibung von „large language model“ oder die unterschiedliche Verwendung der Abkürzung „LLM“ im Singular und im Plural – kann sich in umfangreichen Projekten trotzdem schnell zu einem hohen Post-Editing-Aufwand aufsummieren.
Aufwändiger und für die Bewertung der

Übersetzungsqualität interessanter waren aber die wirklichen Fehler: Viele Modelle verwendeten nicht-existente Wörter (vor allem auf Griechisch) oder sehr sperrige Formulierungen. Die vorgegebenen Prompts wurden unterschiedlich und teilweise von gleichen Modellen innerhalb eines Projekts inkonsistent umgesetzt.

Auch in der Umsetzung der vorgegebenen Terminologie gab es große Unterschiede: Während einige Modelle alle Vorgaben zuverlässig umsetzten und sogar weitere Komposita „terminologiekonform“ übersetzten, kam es bei anderen zu vielen Fehlern und Inkonsistenzen.

Besonders auffällig waren aber die für KI typischen Halluzinationen: Fast alle Modelle halluzinierten Inhalte, die nicht im Ausgangstext vorkamen. Die Bandbreite reichte dabei von einzelnen Wörtern bis zum Hinzufügen ganzer Sales Pitches zu einem Satz.

Auch die Sprachqualität war sowohl zwischen den sieben getesteten Sprachen als auch zwischen den Modellen sehr unterschiedlich, vor allem für Kroatisch, Griechisch und Chinesisch. „Ein Output klang, als ob das Modell gerade erst Chinesisch lernt.“, fasst es Mingjie Vollmer aus dem oneword KI-Team zusammen.

Ergebnisse und Auswahl der Besten

Trotz aller – teilweise erwartbarer, teilweise überraschender – Fehlerquellen zeigten sich schnell deutliche Favoriten unter den getesteten LLMs. Viele Modelle lieferten flüssig klingende und stilistisch überzeugende Ergebnisse und setzten den Großteil der Vorgaben zuverlässig um. Immer wieder gab es positive Überraschungen, wenn die Umsetzung der Prompts sogar Ungenauigkeiten des Ausgangstexts aufdeckten oder Sätze so gut und treffend formuliert waren, wie man es von durchschnittlicher maschineller Übersetzung bisher nicht gewohnt ist.

Ein Beispiel: Der Satz „KI-Übersetzungen sind kein Selbstläufer“ aus einer oneword Broschüre wurde auf Englisch frei und treffend mit „AI translations are not a set-and-forget solution“ übersetzt. Die besten Ergebnisse wurden durchgängig für Englisch erzielt – ein Resultat, das aufgrund der Tatsache, dass viele LLMs mit bis zu 95 % englischem Material trainiert wurden, nicht verwundert. Drei Modelle schnitten allerdings über alle getesteten Sprachen hinweg überdurchschnittlich gut ab und gingen als klare Gewinner der Tests hervor. Diese Modelle sind seitdem bei oneword in unterschiedlichen Szenarien im Einsatz und beweisen täglich ihre Praxistauglichkeit.

Lokale LLMs für datensichere Übersetzungen

Die LLM-Tests bei oneword waren nicht nur aufschlussreich, sondern lieferten auch das gewünschte Ergebnis: Einen Überblick über die aktuell besten LLMs für Übersetzungen und die Auswahl der Besten unter den Besten. Unsere Entscheidung fiel dabei auf lokal hostbare Modelle, um die größtmögliche Datensicherheit und Unabhängigkeit von den Anbietern sicherzustellen. Davon profitieren unsere Kund:innen unmittelbar:

Wir bieten Ihnen die besten LLMs mit rein lokalem Zugriff. Ihre Daten bleiben zu jeder Zeit sicher und verlassen die in Deutschland gehosteten Server nicht. Per Custom Prompting können alle Modelle so von uns beeinflusst werden, dass bisherige Fehlerquellen adressiert und damit bereits im MT-Output vermieden werden. Neue Vorgaben oder erkannte Fehlermuster lassen sich schnell und unkompliziert in Prompts überführen, um die KI-Ergebnisse kontinuierlich zu optimieren. Die Einbindung Ihrer Terminologievorgaben erfolgt nahtlos über unsere Plattform oneSuite – damit auch Ihre Unternehmensterminologie direkt im MT-Output landet. oneword liefert damit hochwertige KI-Übersetzungen und bietet Ihnen KI, der Sie vertrauen können.

Sie möchten den Einsatz unserer lokalen LLMs für Ihre Projekte testen? Nehmen Sie jetzt Kontakt mit uns auf!

Menü schließen