Abbiamo testato GPT-4o, Claude e DeepL su veri file .po Django in diverse lingue. In questo articolo trovi i nostri risultati, cosa dice la ricerca accademica più recente (WMT24 e WMT25 hanno avuto entrambi risultati sorprendenti) e come scegliere il provider giusto per il tuo progetto.
TranslateBot supporta tutti e tre, più oltre 100 modelli aggiuntivi tramite LiteLLM. Se stai configurando le traduzioni Django per la prima volta, la nostra guida completa alla localizzazione Django copre tutta la configurazione prima di scegliere un provider.
Cosa dice la ricerca
Prima di entrare nei nostri test, vale la pena guardare i benchmark accademici. La valutazione più rigorosa della traduzione automatica avviene alle competizioni annuali WMT, organizzate dall'Association for Computational Linguistics.
WMT24: Claude vince il task di traduzione generale
Il WMT24 General Machine Translation shared task ha valutato le traduzioni su 11 coppie di lingue usando annotatori umani professionisti. Claude 3.5 Sonnet è stato il sistema con le migliori prestazioni in assoluto, vincendo 9 coppie di lingue su 11.
Un LLM general-purpose ha superato ogni sistema di traduzione automatica dedicato presentato alla competzione. Non era previsto.
I sistemi basati su LLM hanno anche superato le traduzioni di riferimento umane professionali in diverse coppie di lingue. Le traduzioni umane si sono piazzate nel cluster di qualità vincente solo per 7 coppie su 11. Per inglese-ucraino, Claude 3.5 ha ottenuto 90.5 su COMET mentre la traduzione umana ha ottenuto 87.3.
WMT25: stessa storia, vincitore diverso
La valutazione WMT25 si è espansa a 16 coppie di lingue. Gemini 2.5 Pro è arrivato primo, piazzandosi nel cluster vincente per 14 coppie su 16. Le traduzioni umane sono entrate nel cluster migliore solo per 6 coppie su 15 dove erano disponibli.
Il paper nota che questo "evidenzia la difficoltà intrinseca della traduzione, anche se potrebbe riflettere le preferenze stilistiche o lessicali degli annotatori." Qualunque sia la spiegazione, gli LLM battono costantemente i sistemi MT dedicati su questi benchmark ormai.
Dove gli LLM fanno ancora fatica
La stessa ricerca mostra limitazioni chiare. Uno studio che valuta GPT-4 rispetto ai traduttori umani su 1.600 frasi ha rilevato che GPT-4 si comporta al livello di un traduttore junior, producendo 3,71 errori gravi per segmento contro 1,83 dei traduttori senior.
La qualità varia molto per coppia di lingue. Per inglese-russo, GPT-4 si avvicina quasi ai traduttori senior. Per cinese-inglese, resta ben indietro. Per coppie di lingue a basse risorse, i divari diventano ampi: la traduzione inglese-khmer con un LLM ha ottenuto 39,10 su XCOMET contro il 65,88 di Google Translate.
WMT24 ha anche scoperto che gli LLM hanno ancora difficoltà con fenomeni linguistici specifici in certe lingue. La gestione della punteggiatura e i tempi verbali futuri in inglese-tedesco, ad esempio, sono aree dove i sistemi MT neurali tradizionali effetivamente fanno meglio.
Un'altra cosa da sapere: le metriche di qualità automatizzate come COMET possono essere fuorvianti. Un segmento che ha ricevuto un punteggio COMET alto di 0,86 si è rivelato contenere un errore critico di comprensione quando revisionato da professionisti. Non affidarti solo ai benchmark automatizzati.
I contendenti (metà 2026)
OpenAI GPT-4o / GPT-4o-mini
I modelli di OpenAI sono quelli predefiniti in TranslateBot. GPT-4o-mini è l'opzione economica con una buona qualità. GPT-4o gestisce bene le traduzioni complesse e il testo dipendente dal contesto. Entrambi supportano istruzioni personalizzate tramite TRANSLATING.md.
Anthropic Claude (Sonnet / Haiku)
Claude ha vinto il task di traduzione generale di WMT24. Claude Sonnet 5 è forte nella comprensione contestuale e tende a produrre traduzioni che suonano naturali piuttosto che "tradotte". Claude Haiku 4.5 è un'opzione più veloce ed economica.
DeepL
DeepL ha lanciato un modello di traduzione LLM di nuova generazione a inizio 2025, abbandonando il suo approccio MT neurale tradizionale. Il nuovo modello è addestrato su oltre sette anni di dati di traduzione propiretari. DeepL ha anche aggiunto il supporto per istruzioni personalizzate nelle richieste di traduzione e si è espanso a oltre 100 lingue. Il tier gratuito (500.000 caratteri al mese) è ancora disponibile.
Confronto diretto
| Criterio | GPT-4o-mini | GPT-4o | Claude Haiku | Claude Sonnet | DeepL |
|---|---|---|---|---|---|
| Qualità lingue europee | Buono | Eccellente | Buono | Eccellente | Eccellente |
| Qualità lingue asiatiche | Buono | Eccellente | Buono | Eccellente | Buono |
| Contesto / istruzioni personalizzate | Sì | Sì | Sì | Sì | Sì |
| Supporto TRANSLATING.md | Sì | Sì | Sì | Sì | No |
| Sicurezza placeholder | Alta | Alta | Alta | Alta | Alta |
| Tier gratuito | No | No | No | No | 500k car/mese |
| Velocità | Veloce | Media | Veloce | Media | Veloce |
| Copertura lingue | 100+ | 100+ | 100+ | 100+ | 100+ |
Costo per milione di token in input
| Provider | Costo |
|---|---|
| GPT-4o-mini | ~$0,15 |
| Claude Haiku 4.5 | ~$1,00 |
| GPT-4o | ~$2,50 |
| Claude Sonnet 5 | ~$3,00 |
| DeepL (tier gratuito) | $0,00 |
| DeepL (a pagamento, per 1M car.) | ~$25,00 |
Il pricing degli LLM è per token mentre DeepL addebita per carattere, quindi il confronto diretto è complicato. Per carichi di lavoro di traduzione tipici, gli LLM risultano significativamente più economici. Vedi gli esempi di costo qui sotto.
Analisi della qualità
Lingue europee (tedesco, francese, olandese, spagnolo)
Il nuovo modello LLM di DeepL ha rafforzato le sue prestazioni già ottime per le lingue europee. GPT-4o e Claude Sonnet lo eguagliano da vicino. I risultati di WMT24 lo confermano: il divario di qualità tra i migliori sistemi LLM e i sistemi MT dedicati per le principali coppie europee è irrlevante a questo punto.
GPT-4o-mini e Claude Haiku sono un gradino sotto le opzioni premium, ma gestiscono bene le tipiche stringhe UI di Django. Possono inciampare con frasi più lunghe e complesse o terminologia specializzata.
Lingue asiatiche (giapponese, cinese, coreano)
I provider basati su LLM hanno ancora un vantaggio netto. GPT-4o e Claude Sonnet gestiscono il keigo giapponese (livelli di cortesia), le distinzioni cinese semplificato/tradizionale e gli onorifici coreani con più sfumature. Il nuovo modello LLM di DeepL ha ridotto il divario, ma la profondità di contesto che gli LLM portano a queste lingue è ancora superiore.
La ricerca conferma: GPT-4 si avvicina quasi ai traduttori senior per inglese-russo, ma resta significativamente indietro per cinese-inglese. Quale coppia di linguggio stai traducendo conta più di quale provider scegli.
Lingue a basse risorse
Se stai traducendo in lingue come khmer, lao o birmano, gli LLM attuali mostrano grandi cali di qualità. I sistemi MT dedicati di Google superano ancora gli LLM con ampio margine per queste lingue. La maggior parte dei progetti Django punta a lingue mainstream, quindi probabilmente non ti riguarda, ma vale la pena conoscere i limiti.
Contesto e tono
I provider LLM hanno un vantaggio qui: possono leggere il tuo file TRANSLATING.md e applicare istruzioni specifiche del progetto a ogni traduzione. Puoi impostare preferenze terminologiche ("traduci 'cart' come 'Warenkorb', non 'Einkaufswagen'"), linee guida sul tono ("usa il 'du' informale in tedesco") e chiarire termini ambigiui.
DeepL ha aggiunto un parametro per istruzioni personalizzate nella sua API, il che è una novità. Supporta anche glossari (fino a 5 per richiesta). Ma un file TRANSLATING.md può includere descrizioni del prodotto, note sul pubblico e linee guida sullo stile, il che va oltre quello che il parametro istruzioni di DeepL riesce a gestire.
Gestione dei placeholder
Tutti i provider gestiscono in modo affidabile i formati placeholder di Django (%(name)s, {name}, %s, %d). TranslateBot include istruzioni esplicite nei suoi prompt per preservare i placeholder. Nei nostri test, la corruzione dei placeholder è stata estremamente rara con tutti i provider.
Esempi di costi reali
Ecco quanto costa tradurre 500 stringhe (circa 10.000 parole) in 5 lingue target:
| Provider | Costo stimato |
|---|---|
| DeepL (tier gratuito) | $0,00 |
| GPT-4o-mini | ~$0,05 |
| GPT-4o | ~$0,50 |
| Claude Sonnet | ~$0,60 |
GPT-4o-mini costa meno di cinque centesimi per un intero progetto Django di medie dimensioni tradotto in cinque lingue. I modelli premium (GPT-4o, Claude Sonnet) restano ben sotto il dollaro. Il tier gratuito di DeepL è gratis per progetti piccoli e medi entro il limite mensile di 500.000 caratteri.
Dopo la traduzione iniziale completa, la funzionalità di traduzione incrementale di TranslateBot (che traduce solo le stringhe nuove o modificate) mantiene i costi ancora più bassi. Le esecuzioni successive tipicamente elaborano solo una manciata di stringhe.
Punti di forza e debolezze
GPT-4o-mini
Il miglior rapporto qualità/prezzo. Veloce, qualità solida per la maggior parte delle coppie di lingue, e praticamente ogni team ha già una chiave API OpenAI.
Il compromesso: la qualità cala per testi complessi o dipendenti dal contesto rispetto a GPT-4o e Claude Sonnet. La ricerca mostra che GPT-4 produce traduzioni eccessivamente letterali e ha difficoltà con entità nominate meno comuni.
GPT-4o
Qualità di traduzione elevata in tutte le lingue che abbiamo testato. Gestisce bene il contesto di TRANSLATING.md e preserva i placeholder in modo affidabile.
Costa circa 17 volte di più per token rispetto a GPT-4o-mini ed è più lento. Resta comunque accessibile in termini assoluti per carichi di traduzione.
Claude Sonnet
Il vincitore di WMT24. Nei nostri test, Claude Sonnet produce le traduzioni dal suono più naturale, in particolare quando TRANSLATING.md contiene contesto dettagliato. Gestisce i livelli di formalità (Sie/du in tedesco, keigo giapponese) meglio delle alternative.
L'opzione LLM più costosa per token. Le chiavi API Anthropic sono anche meno comuni delle chiavi OpenAI nella maggior parte dei team, il che può aggiungere un po' di attrito all'inizio.
Claude Haiku
Più veloce e più economico di Sonnet, con pieno supporto TRANSLATING.md. Il divario di qualità rispetto a Sonnet è evidente per le traduzioni complesse, e GPT-4o-mini spesso offre un valore migliore a un prezzo inferiore.
DeepL
Il tier gratuito lo rende la scelta ovvia per progetti senza budget per le traduzioni. La qualità per le lingue europee è eccellente, l'API è veloce e il nuovo modello LLM ha migliorato la qualità attraveso tutta la gamma.
Nessun supporto TRANSLATING.md, quindi non puoi passare il contesto del progetto di TranslateBot. Il parametro istruzioni personalizzate aiuta ma non è altrettanto flessibile. Richiede un extra di installazione [deepl] separato.
Matrice delle raccomandazioni
| La tua priorità | Provider consigliato |
|---|---|
| Miglior valore complessivo | GPT-4o-mini |
| Massima qualità di traduzione | Claude Sonnet o GPT-4o |
| Costo minimo (zero budget) | DeepL tier gratuito |
| Meglio per lingue asiatiche | Claude Sonnet o GPT-4o |
| Meglio per lingue europee | DeepL o Claude Sonnet |
| Serve contesto/terminologia personalizzata | GPT-4o-mini (budget) o Claude Sonnet (qualità) |
| Conformità enterprise | Azure OpenAI o AWS Bedrock tramite LiteLLM |
Per la maggior parte dei progetti Django, parti con GPT-4o-mini. Copre la gamma più ampia di casi d'uso al costo più basso. Se la qualità non soddisfa i tuoi standard per lingue specifiche, passa a Claude Sonnet o GPT-4o. Il cambio richiede circa 30 secondi.
Come cambiare provider in TranslateBot
Cambiare provider significa modificare due impostazioni nel tuo settings.py:
import os
# Opzione 1: GPT-4o-mini (predefinito)
TRANSLATEBOT_MODEL = "gpt-4o-mini"
TRANSLATEBOT_API_KEY = os.getenv("OPENAI_API_KEY")
# Opzione 2: GPT-4o
TRANSLATEBOT_MODEL = "gpt-4o"
TRANSLATEBOT_API_KEY = os.getenv("OPENAI_API_KEY")
# Opzione 3: Claude Sonnet
TRANSLATEBOT_MODEL = "claude-sonnet-5-20250514"
TRANSLATEBOT_API_KEY = os.getenv("ANTHROPIC_API_KEY")
# Opzione 4: DeepL
TRANSLATEBOT_PROVIDER = "deepl"
TRANSLATEBOT_API_KEY = os.getenv("DEEPL_API_KEY")
Per DeepL, devi anche installare l'extra DeepL:
uv add --dev translatebot-django[deepl]
Nessuna modifica al codice, nessuna migrazione, nessun redeploy. Cambia le impostazioni, riesegui il comando di traduzione e le tue traduzioni usano il nuovo provider.
Consigli pratici
Testa prima di fare commit. Usa il flag --dry-run per vedere come sarebbero le traduzioni senza scriverle nei tuoi file .po:
python manage.py translate --target-lang de --dry-run
Parti economico, fai upgrade se serve. Inizia con GPT-4o-mini per il tuo primo passaggio di traduzione. Controlla l'output. Se certe lingue necessitano di miglioramenti, passa a Claude Sonnet o GPT-4o per quelle esecuzioni specifiche:
TRANSLATEBOT_MODEL=claude-sonnet-5-20250514 python manage.py translate --target-lang ja
Usa TRANSLATING.md per migliorare la qualità. Prima di passare a un modello più costoso, prova ad aggiungere un file TRANSLATING.md con linee guida sulla terminologia e istruzioni sul tono. Questo spesso migliora l'output di GPT-4o-mini abbastanza da non aver bisogno del modello più caro.
Mixa e combina. Niente ti impedisce di usare DeepL per le lingue europee (tedesco, francese, spagnolo) e Claude Sonnet per giapponese o coreano. Esegui il comando di traduzione una volta per provider, specifcando lingue diverse ogni volta.
Non fidarti solo dei punteggi COMET. Se stai valutando la qualità della traduzione con metriche automatizzate, sappi che COMET può sovrastimare la qualità e non cogliere errori critici. Fai sempre revisionare un campione di traduzioni da un madrelingua per le coppie di lingue importanti.
Tieni d'occhio l'uso del tier gratuito DeepL. La traduzione incrementale di TranslateBot aiuta, ma una grande esecuzione di traduzione iniziale potrebbe consumare una porzione significativa della tua alocazione mensile di 500.000 caratteri.
Conclusione
Gli LLM ora eguagliano o battono regolarmente i sistemi di traduzione automatica dedicati nei benchmark accademici. Claude ha vinto WMT24, Gemini ha vinto WMT25, e le traduzioni umane non hanno più la garanzia di un posto nel tier più alto. È un grande cambiamento rispetto a pochi anni fa.
Per i progetti Django, il succo pratico: GPT-4o-mini a $0,05 per progetto se vuoi il miglior rapporto qualità/prezzo, Claude Sonnet o GPT-4o se ti serve la massima qualità supportata da benchmark peer-reviewed, DeepL se vuoi il tier gratuito. TranslateBot rende il passaggio da uno all'altro una semplice modifica alle impostazioni.