Wir haben GPT-4o, Claude und DeepL an echten Django .po-Dateien in mehreren Sprachen getestet. Dieser Artikel beschreibt unsere Ergebnisse, was die aktuelle Forschung sagt (WMT24 und WMT25 hatten beide ueberraschende Ergebnisse), und wie du den richtigen Anbieter fuer dein Projekt auswaehlen kannst.
TranslateBot unterstuetzt alle drei sowie ueber 100 weitere Modelle ueber LiteLLM. Wenn du Django-Uebersetzungen zum ersten Mal einrichtest, findest du in unserer vollstaendigen Anleitung zur Django-Lokalisierung das komplette Setup, bevor du einen Anbieter auswaehlst.
Was die Forschung sagt
Bevor wir zu unseren eigenen Tests kommen, lohnt sich ein Blick auf die akademischen Benchmarks. Die rigoroseste Bewertung maschineller Uebersetzung findet bei den jaehrlichen WMT Shared Tasks statt, organisiert von der Association for Computational Linguistics.
WMT24: Claude gewinnt die allgemeine Uebersetzungsaufgabe
Der WMT24 General Machine Translation Shared Task bewertete Uebersetzungen ueber 11 Sprachpaare hinweg mit professionellen menschlichen Annotatoren. Claude 3.5 Sonnet war das insgesamt beste System und gewann 9 von 11 Sprachpaaren.
Ein allgemeines LLM hat jedes spezalisierte maschinelle Uebersetzungssystem im Wettbewerb geschlagen. Das war nicht erwartet worden.
LLM-basierte Systeme uebertrafen auch professionelle menschliche Referenzuebersetzungen in mehreren Sprachpaaren. Menschliche Referenzen landeten nur bei 7 von 11 Paaren im Gewinner-Cluster. Fuer Englisch-Ukrainisch erreichte Claude 3.5 einen COMET-Score von 90,5, waehrend die menschliche Referenz bei 87,3 lag.
WMT25: Gleiche Geschichte, anderer Gewinner
Die WMT25-Evaluierung umfasste 16 Sprachpaare. Gemini 2.5 Pro lag vorne und landete bei 14 von 16 Paaren im Gewinner-Cluster. Menschliche Uebersetzungen schafften es nur bei 6 von 15 Paaren, fuer die sie verfuegbar waren, in den oberen Cluster.
Das Paper merkt an, dies "unterstreiche die inhaerete Schwierigkeit des Uebersetzens, koennte aber auch die stilistischen oder lexikalischen Praeferenzen der Annotatoren widerspiegeln." Welche Erklaerung auch immer zutrifft: LLMs schlagen dedizierte MT-Systeme in diesen Benchmarks mittlerweile konsistent.
Wo LLMs noch Schwaechen haben
Dieselbe Forschung zeigt klare Grenzen auf. Eine Studie, die GPT-4 mit menschlichen Uebersetzern verglich, fand bei 1.600 Saetzen heraus, dass GPT-4 auf dem Niveau eines Junior-Uebersetzers performt und 3,71 schwerwiegende Fehler pro Segment produziert, verglichen mit 1,83 bei Senior-Uebersetzern.
Die Qualitaet variiert stark je nach Sprachpaar. Fuer Englisch-Russisch kommt GPT-4 fast an Senior-Uebersetzer heran. Fuer Chinesisch-Englisch faellt es deutlich zurueck. Bei Low-Resource-Sprachpaaren werden die Luecken gross: Englisch-Khmer-Uebersetzung mit einem LLM erreichte 39,10 auf XCOMET gegenueber Google Translates 65,88.
WMT24 stellte ausserdem fest, dass LLMs bei bestimmten sprachlichen Phaenomenen in gewissen Sprachen immer noch Probleme haben. Interpunktion und Futurformen im Englisch-Deutschen zum Beispiel sind Bereiche, in denen traditionelle neuronale MT-Systeme tatsaechich besser abschneiden.
Noch etwas Wichtiges: Automatisierte Qualitaetsmetriken wie COMET koennen taeuschen. Ein Segment mit einem hohen COMET-Score von 0,86 enthielt bei der professionellen Ueberpruefung einen kritischen Verstaendnisfehler. Verlass dich nicht allein auf automatisierte Benchmarks.
Die Kandidaten (Mitte 2026)
OpenAI GPT-4o / GPT-4o-mini
OpenAIs Modelle sind der Standard in TranslateBot. GPT-4o-mini ist die guenstige Option mit solider Qualitaet. GPT-4o kommt gut mit komplexen Uebersetzungen und kontextabhaengigem Text klar. Beide unterstuetzen individuelle Anweisungen ueber TRANSLATING.md.
Anthropic Claude (Sonnet / Haiku)
Claude hat die allgemeine Uebersetzungsaufgabe bei WMT24 gewonnen. Claude Sonnet 5 ist stark im kontextuellen Verstaendnis und produziert Uebersetzungen, die sich natuerlich lesen, statt uebersetzt zu klingen. Claude Haiku 4.5 ist eine schnellere, guenstigere Alternative.
DeepL
DeepL hat Anfang 2025 ein LLM-basiertes Uebersetzungsmodell der naechsten Generation veroeffentlicht und sich damit von seinem traditionellen neuronalen MT-Ansatz verabschiedet. Das neue Modell ist auf ueber sieben Jahre propretierer Uebersetzungsdaten trainiert. DeepL hat ausserdem Unterstuetzung fuer individuelle Anweisungen in Uebersetzungsanfragen hinzugefuegt und auf ueber 100 Sprachen erweitert. Das kostenlose Kontingent (500.000 Zeichen pro Monat) ist weiterhin verfuegbar.
Direkter Vergleich
| Kriterium | GPT-4o-mini | GPT-4o | Claude Haiku | Claude Sonnet | DeepL |
|---|---|---|---|---|---|
| Europaeische Sprachqualitaet | Gut | Ausgezeichnet | Gut | Ausgezeichnet | Ausgezeichnet |
| Asiatische Sprachqualitaet | Gut | Ausgezeichnet | Gut | Ausgezeichnet | Gut |
| Kontext / individuelle Anweisungen | Ja | Ja | Ja | Ja | Ja |
| TRANSLATING.md-Unterstuetzung | Ja | Ja | Ja | Ja | Nein |
| Placeholder-Sicherheit | Hoch | Hoch | Hoch | Hoch | Hoch |
| Kostenloses Kontingent | Nein | Nein | Nein | Nein | 500k Zeichen/Monat |
| Geschwindigkeit | Schnell | Mittel | Schnell | Mittel | Schnell |
| Sprachabdeckung | 100+ | 100+ | 100+ | 100+ | 100+ |
Kosten pro Million Input-Tokens
| Anbieter | Kosten |
|---|---|
| GPT-4o-mini | ~$0,15 |
| Claude Haiku 4.5 | ~$1,00 |
| GPT-4o | ~$2,50 |
| Claude Sonnet 5 | ~$3,00 |
| DeepL (kostenloses Kontingent) | $0,00 |
| DeepL (bezahlt, pro 1M Zeichen) | ~$25,00 |
LLM-Preise basieren auf Tokens, waehrend DeepL pro Zeichen abrechnet -- ein direkter Vergleich ist daher schwierig. Fuer typische Uebersetzungsworkloads sind LLMs deutlich guenstiger. Sieh dir die Kostenbeispiele weiter unten an.
Qualitaet im Detail
Europaeische Sprachen (Deutsch, Franzoesisch, Niederlaendisch, Spanisch)
DeepLs neues LLM-Modell hat die ohnehin starke Performance bei europaeischen Sprachen weiter verbessert. GPT-4o und Claude Sonnet liegen dicht dahinter. Die WMT24-Ergebnisse bestaetigen das: Der Qualitaetsunterschied zwischen den besten LLM-Systemen und dedizierter MT bei wichtigen europaeischen Sprachpaaren ist zu diesem Zeitpungt vernachlaessigbar.
GPT-4o-mini und Claude Haiku liegen eine Stufe unter den Premium-Optionen, kommen aber mit typischen Django-UI-Strings gut zurecht. Bei laengeren, komplexen Saetzen oder spezialisierter Terminologie koennen sie ins Straucheln geraten.
Asiatische Sprachen (Japanisch, Chinesisch, Koreanisch)
LLM-basierte Anbieter haben hier immer noch einen klaren Vorteil. GPT-4o und Claude Sonnet gehen nuancierter mit japanischem Keigo (Hoeflichkeitsstufen), der Unterscheidung zwischen vereinfachtem und traditionellem Chinesisch sowie koreanischen Honorifika um. DeepLs neues LLM-Modell hat die Luecke verkleinert, aber die Kontexttiefe, die LLMs bei diesen Sprachen mitbringen, ist nach wie vor ueberlegen.
Die Forschung deckt sich damit: GPT-4 kommt fuer Englisch-Russisch fast an Senior-Uebersetzer heran, faellt aber fuer Chinesisch-Englisch deutlich zurueck. Welches Sprahcpaar du uebersetzt, ist wichtiger als welchen Anbieter du waehlst.
Low-Resource-Sprachen
Wenn du in Sprachen wie Khmer, Laotisch oder Birmanisch uebersetzt, zeigen aktuelle LLMs grosse Qualitaetseinbrueche. Dedizierte MT-Systeme von Google uebertreffen LLMs bei diesen Sprachen nach wie vor mit grossem Abstand. Die meisten Django-Projekte zielen auf gaengige Sprachen ab, das betrifft dich also wahrscheinlich nicht, aber es ist gut, die Grenzen zu kennen.
Kontext und Tonalitaet
LLM-Anbieter haben hier einen Vorteil: Sie koennen deine TRANSLATING.md-Datei lesen und projektspezifische Anweisungen auf jede Uebersetzung anwenden. Du kannst Terminologievorlieben festlegen ("uebersetze 'cart' als 'Warenkorb', nicht als 'Einkaufswagen'"), Tonrichtlinien setzen ("verwende informelles 'du' auf Deutsch") und mehrdeutige Begriffe klaeren.
DeepL hat einen Parameter fuer individuelle Anweisungen in seiner API hinzugefuegt, das ist neu. Ausserdem werden Glossare unterstuetzt (bis zu 5 pro Anfrage). Aber eine TRANSLATING.md-Datei kann Produktbeschreibungen, Zielgruppen-Hinweise und Styleguides enthalten -- das geht ueber die Moeglichkieten von DeepLs Anweisungsparameter hinaus.
Placeholder-Handling
Alle Anbieter gehen zuverlaessig mit Djangos Placeholder-Formaten um (%(name)s, {name}, %s, %d). TranslateBot enthaelt explizite Anweisungen in seinen Prompts, um Placeholder zu erhalten. In unseren Tests war Placeholder-Korruption bei allen Anbietern aeusserst selten.
Praxisnahe Kostenbeispiele
So viel kostet es, 500 Strings (ungefaehr 10.000 Woerter) in 5 Zielsprachen zu uebersetzen:
| Anbieter | Geschaetzte Kosten |
|---|---|
| DeepL (kostenloses Kontingent) | $0,00 |
| GPT-4o-mini | ~$0,05 |
| GPT-4o | ~$0,50 |
| Claude Sonnet | ~$0,60 |
GPT-4o-mini kostet weniger als fuenf Cent fuer ein komplettes mittelgrosses Django-Projekt, uebersetzt in fuenf Sprachen. Die Premium-Modelle (GPT-4o, Claude Sonnet) bleiben deutlich unter einem Dollar. DeepLs kostenloses Kontingent ist fuer kleine bis mittlere Projekte innerhalb des monatlichen Limits von 500.000 Zeichen kostenlos.
Nach der initialen Komplettuebersetzung haelt TranslateBots inkrementelle Uebersetzungsfunktion (nur neue oder geaenderte Strings werden uebersetzt) die Kosten noch niedriger. Folgende Durchlaeufe verarbeiten typischerweise nur eine Handvoll Strings.
Staerken und Schwaechen
GPT-4o-mini
Bestes Preis-Leistungs-Verhaeltnis. Schnell, solide Qualitaet bei den meisten Sprachpaaren, und fast jedes Team hat bereits einen OpenAI-API-Key.
Der Nachteil: Die Qualitaet sinkt bei komplexem oder kontextabhaengigem Text im Vergleich zu GPT-4o und Claude Sonnet. Forschung zeigt, dass GPT-4 uebertrieben woertliche Uebersetzungen produziert und mit selteneren Eigennamen Probleme hat.
GPT-4o
Starke Uebersetzungsqualitaet ueber alle Sprachen, die wir getestet haben. Verarbeitet TRANSLATING.md-Kontext gut und erhaelt Placeholder zuverlaessig.
Es kostet ungefaehr das 17-fache pro Token im Vergleich zu GPT-4o-mini und ist langsamer. In absoluten Zahlen fuer Uebersetzungsworkloads trotzdem erschwinglich.
Claude Sonnet
Der WMT24-Gewinner. In unseren Tests produziert Claude Sonnet die am natuerlichsten klingenden Uebersetzungen, besonders wenn TRANSLATING.md detaillierten Kontext enthaelt. Es geht mit Formalitaetsstufen (deutsches Sie/du, japanisches Keigo) besser um als die Alternativen.
Die teuerste LLM-Option pro Token. Anthropic-API-Keys sind in den meisten Teams auch weniger verbreitet als OpenAI-Keys, was beim Einstieg etwas Reibung erzeugen kann.
Claude Haiku
Schneller und guenstiger als Sonnet, mit voller TRANSLATING.md-Unterstuetzung. Der Qualitaetsunterschied zu Sonnet ist bei komplexen Uebersetzungen spuerbar, und GPT-4o-mini bietet oft ein besseres Preis-Leistungs-Verhaeltnis zu einem niedrigeren Preis.
DeepL
Das kostenlose Kontingent macht es zur offensichtlichen Wahl fuer Projekte ohne Uebersetzungsbudget. Die Qualitaet bei europaeischen Sprachen ist ausgezeichnet, die API ist schnell, und das neue LLM-Modell hat die Qualitaet insgesammt verbessert.
Keine TRANSLATING.md-Unterstuetzung, du kannst also TranslateBots Projektkontext nicht mitsenden. Der Parameter fuer individuelle Anweisungen hilft, ist aber nicht so flexibel. Erfordert ein separates [deepl]-Install-Extra.
Empfehlungsmatrix
| Deine Prioritaet | Empfohlener Anbieter |
|---|---|
| Bestes Gesamtpreis-Leistungs-Verhaeltnis | GPT-4o-mini |
| Hoechste Uebersetzungsqualitaet | Claude Sonnet oder GPT-4o |
| Niedrigste Kosten (kein Budget) | DeepL kostenloses Kontingent |
| Beste Wahl fuer asiatische Sprachen | Claude Sonnet oder GPT-4o |
| Beste Wahl fuer europaeische Sprachen | DeepL oder Claude Sonnet |
| Individuelle Terminologie/Kontext noetig | GPT-4o-mini (Budget) oder Claude Sonnet (Qualitaet) |
| Enterprise-Compliance | Azure OpenAI oder AWS Bedrock ueber LiteLLM |
Fuer die meisten Django-Projekte: Starte mit GPT-4o-mini. Es deckt den breitesten Bereich an Anwendungsfaellen zu den niedrigsten Kosten ab. Wenn die Qualitaet bei bestimmten Sprachen deinen Anforderungen nicht genuegt, wechsle zu Claude Sonnet oder GPT-4o. Der Wechsel dauert ungefaehr 30 Sekunden.
Wie du in TranslateBot den Anbieter wechselst
Den Anbieter zu wechseln bedeutet, zwei Einstellungen in deiner settings.py zu aendern:
import os
# Option 1: GPT-4o-mini (Standard)
TRANSLATEBOT_MODEL = "gpt-4o-mini"
TRANSLATEBOT_API_KEY = os.getenv("OPENAI_API_KEY")
# Option 2: GPT-4o
TRANSLATEBOT_MODEL = "gpt-4o"
TRANSLATEBOT_API_KEY = os.getenv("OPENAI_API_KEY")
# Option 3: Claude Sonnet
TRANSLATEBOT_MODEL = "claude-sonnet-5-20250514"
TRANSLATEBOT_API_KEY = os.getenv("ANTHROPIC_API_KEY")
# Option 4: DeepL
TRANSLATEBOT_PROVIDER = "deepl"
TRANSLATEBOT_API_KEY = os.getenv("DEEPL_API_KEY")
Fuer DeepL musst du ausserdem das DeepL-Extra installieren:
uv add --dev translatebot-django[deepl]
Keine Code-Aenderungen, keine Migration, kein Redeployment. Aendere die Einstellungen, fuehre den Translate-Befehl erneut aus, und deine Uebersetzungen nutzen den neuen Anbieter.
Praktische Tipps
Teste vor dem Committen. Nutze das --dry-run-Flag, um zu sehen, wie Uebersetzungen aussehen wuerden, ohne sie in deine .po-Dateien zu schreiben:
python manage.py translate --target-lang de --dry-run
Starte guenstig, upgrade bei Bedarf. Beginne mit GPT-4o-mini fuer den ersten Uebersetzungsdurchlauf. Pruefe die Ergebnisse. Wenn bestimmte Sprachen Verbesserung brauchen, wechsle fuer diese spezifischen Durchlaeufe zu Claude Sonnet oder GPT-4o:
TRANSLATEBOT_MODEL=claude-sonnet-5-20250514 python manage.py translate --target-lang ja
Nutze TRANSLATING.md fuer Qualitaetsverbesserungen. Bevor du auf ein teureres Modell upgradest, probiere eine TRANSLATING.md-Datei mit Terminologie-Richtlinien und Ton-Anweisungen. Das verbessert oft die GPT-4o-mini-Ausgabe so weit, dass du das teurere Modell nicht brauchst.
Kombiniere nach Belieben. Nichts hindert dich daran, DeepL fuer europaeische Sprachen (Deutsch, Franzoesisch, Spanisch) und Claude Sonnet fuer Japanisch oder Koreanisch zu verwenden. Fuehre den Translate-Befehl einmal pro Anbieter aus und adresiere dabei unterschiedliche Sprachen.
Vertrau nicht nur auf COMET-Scores. Wenn du Uebersetzungsqualitaet mit automatisierten Metriken bewertest, sei dir bewusst, dass COMET die Qualitaet ueberschaetzen und kritische Fehler uebersehen kann. Lass immer einen Muttersprachler eine Stichprobe der Uebersetzungen fuer wichtige Sprachpaare pruefen.
Behalte DeepLs kostenloses Kontingent im Auge. TranslateBots inkrementelle Uebersetzung hilft, aber ein grosser initialer Uebersetzungsdurchlauf koennte einen erheblichen Teil deines monatlichen Kontingents von 500.000 Zeichen verbrachen.
Fazit
LLMs erreichen oder uebertreffen mittlerweile routinemaessig dedizierte maschinelle Uebersetzungssysteme in akademischen Benchmarks. Claude hat WMT24 gewonnen, Gemini WMT25, und menschliche Uebersetzungen haben keinen garantierten Platz mehr in der Spitzengruppe. Das ist ein grosser Wandel im Vergleich zu vor wenigen Jahren.
Fuer Django-Projekte die praktische Zusammenfassung: GPT-4o-mini fuer $0,05 pro Projekt, wenn du Wert auf das Preis-Leistungs-Verhaeltnis legst, Claude Sonnet oder GPT-4o, wenn du Top-Qualitaet mit peer-reviewten Benchmarks brauchst, DeepL, wenn du das kostenlose Kontingent moechtest. TranslateBot macht den Wechsel zwischen ihnen zu einer Einstellungsaenderung.
Sobald du einen Anbieter gewaehlt hast, ist der naechste Schritt, deinen Django-Uebersetzungs-Workflow zu automatisieren, damit sich neue Strings nicht mehr ansammeln.