Retour au blog

GPT-4 vs Claude vs DeepL pour les traductions Django : benchmarks, coûts et qualité (2026)

2026-07-09 11 min de lecture
GPT-4 vs Claude vs DeepL pour les traductions Django : benchmarks, coûts et qualité (2026)

Nous avons testé GPT-4o, Claude et DeepL sur de vrais fichiers Django .po dans plusieurs langues. Cet article couvre nos résultats, ce que dit la recherche académique récente (WMT24 et WMT25 ont tous deux réservé des surprises), et comment choisir le bon fournisseur pour votre projet.

TranslateBot prend en charge ces trois fournisseurs ainsi que plus de 100 modèles supplémentaires via LiteLLM. Si vous configurez les traductions Django pour la première fois, notre guide complet de localisation Django couvre toute la mise en place avant de choisir un fournisseur.

Ce que dit la recherche

Avant d'entrer dans nos propres tests, il vaut la peine de regarder les benchmarks académiques. L'évaluation la plus rigoureuse de la traduction automatique a lieu lors des tâches partagées annuelles WMT, organisées par l'Association for Computational Linguistics.

WMT24 : Claude remporte la tâche de traduction générale

La tâche partagée WMT24 de traduction automatique générale a évalué les traductions sur 11 paires de langues en faisant appel à des annotateurs humains professionnels. Claude 3.5 Sonnet s'est révélé le meilleur système global, remportant 9 des 11 paires de langues.

Un LLM généraliste a surpassé tous les systèmes dédiés de traduction automatique soumis à la compétiton. Ce n'était pas attendu.

Les systèmes basés sur des LLM ont également surpassé les traductions humaines de référence dans plusieurs paires de langues. Les références humaines ne se sont classées dans le cluster de qualité gagnant que pour 7 des 11 paires. Pour l'anglais vers l'ukrainien, Claude 3.5 a obtenu 90,5 sur COMET tandis que la référence humaine a obtenu 87,3.

WMT25 : même histoire, gagnant différent

L'évaluation WMT25 s'est élargie à 16 paires de langues. Gemini 2.5 Pro est arrivé en tête, se classant dans le cluster gagnant pour 14 des 16 paires. Les traductions humaines n'ont atteint le cluster de tête que pour 6 des 15 paires où elles étaient disponibes.

L'article note que cela « met en évidence la difficulté inhérente de la traduction, bien que cela puisse également refléter les préférences stylistiques ou lexicales des annotateurs. » Quelle que soit l'explication, les LLM battent désormais systématiquement les systèmes de traduction automatique dédiés sur ces benchmarks.

Là où les LLM sont encore en retrait

La même recherche montre des limites claires. Une étude évaluant GPT-4 face à des traducteurs humains sur 1 600 phrases a révélé que GPT-4 se situe au niveau d'un traducteur junior, produisant 3,71 erreurs majeures par segment contre 1,83 pour les traducteurs seniors.

La qualité varie considérablement selon la paire de langues. Pour l'anglais vers le russe, GPT-4 égale presque les traducteurs seniors. Pour le chinois vers l'anglais, il est nettement en retrait. Pour les paires de langues à faibles ressources, les écarts se creusent : la traduction anglais-khmer avec un LLM a obtenu 39,10 sur XCOMET contre 65,88 pour Google Translate.

WMT24 a également constaté que les LLM peinent encore avec des phénomènes linguistiques spécifiques dans certaines langues. La gestion de la ponctuation et les temps verbaux futurs en anglais-allemand, par exemple, sont des domaines où les systèmes de traduction neuronale traditionnels font réelement mieux.

Un dernier point à connaître : les métriques de qualité automatisées comme COMET peuvent être trompeuses. Un segment ayant reçu un score COMET élevé de 0,86 s'est avéré contenir une erreur critique de compréhension lors de la relecture par des professionnels. Ne vous fiez pas uniquement aux benchmarks automatisés.

Les concurrents (mi-2026)

OpenAI GPT-4o / GPT-4o-mini

Les modèles d'OpenAI sont le choix par défaut dans TranslateBot. GPT-4o-mini est l'option économique avec une qualité solide. GPT-4o gère bien les traductions complexes et les textes dépendants du contexte. Les deux prennent en charge les instructions personnalisées via TRANSLATING.md.

Anthropic Claude (Sonnet / Haiku)

Claude a remporté la tâche de traduction générale de WMT24. Claude Sonnet 5 excelle dans la compréhension contextuelle et tend à produire des traductions qui sonnent naturellement plutôt que comme du texte traduit. Claude Haiku 4.5 est une option plus rapide et moins coûteuse.

DeepL

DeepL a lancé un modèle de traduction de nouvelle génération basé sur un LLM début 2025, abandonnant son approche traditionnelle de traduction neuronale. Le nouveau modèle est entraîné sur plus de sept ans de données de traduction propriétares. DeepL a également ajouté la prise en charge d'instructions personnalisées dans les requêtes de traduction et s'est étendu à plus de 100 langues. Le tier gratuit (500 000 caractères par mois) est toujours disponible.

Comparaison directe

Critère GPT-4o-mini GPT-4o Claude Haiku Claude Sonnet DeepL
Qualité langues européennes Bonne Excellente Bonne Excellente Excellente
Qualité langues asiatiques Bonne Excellente Bonne Excellente Bonne
Contexte / instructions perso. Oui Oui Oui Oui Oui
Support TRANSLATING.md Oui Oui Oui Oui Non
Sécurité des placeholders Élevée Élevée Élevée Élevée Élevée
Tier gratuit Non Non Non Non 500k car./mois
Vitesse Rapide Moyenne Rapide Moyenne Rapide
Couverture linguistique 100+ 100+ 100+ 100+ 100+

Coût par million de tokens en entrée

Fournisseur Coût
GPT-4o-mini ~0,15 $
Claude Haiku 4.5 ~1,00 $
GPT-4o ~2,50 $
Claude Sonnet 5 ~3,00 $
DeepL (tier gratuit) 0,00 $
DeepL (payant, par 1M car.) ~25,00 $

La tarification des LLM est au token tandis que DeepL facture au caractère, donc la comparaison directe est délicate. Pour les charges de travail de traduction typiques, les LLM reviennent nettement moins cher. Voir les exemples de coûts ci-dessous.

Analyse de la qualité

Langues européennes (allemand, français, néerlandais, espagnol)

Le nouveau modèle LLM de DeepL a renforcé sa performance déjà solide sur les langues européennes. GPT-4o et Claude Sonnet sont au même niveau. Les résultats de WMT24 confirment cela : l'écart de qualité entre les meilleurs systèmes LLM et la traduction automatique dédiée pour les principales paires de langues européennes est négligable à ce stade.

GPT-4o-mini et Claude Haiku sont un cran en dessous des options premium mais gèrent correctement les chaînes d'interface Django typiques. Ils peuvent trébucher sur les phrases longues et complexes ou la terminologie spécialisée.

Langues asiatiques (japonais, chinois, coréen)

Les fournisseurs basés sur des LLM conservent un avantage net. GPT-4o et Claude Sonnet gèrent le keigo japonais (niveaux de politesse), les distinctions simplifié/traditionnel en chinois et les honorifiques coréens avec plus de nuance. Le nouveau modèle LLM de DeepL a réduit l'écart, mais la profondeur de contexte que les LLM apportent à ces langues reste supérieure.

La recherche va dans ce sens : GPT-4 égale presque les traducteurs seniors pour l'anglais-russe mais est significativenent en retrait pour le chinois-anglais. La paire de langues que vous traduisez compte plus que le fournisseur que vous choisissez.

Langues à faibles ressources

Si vous traduisez vers des langues comme le khmer, le lao ou le birman, les LLM actuels montrent d'importantes baisses de qualité. Les systèmes de traduction automatique dédiés de Google surpassent encore largement les LLM pour ces langues. La plupart des projets Django ciblent des langues courantes, donc cela ne vous concerne probablement pas, mais il est bon de connaître les limites.

Contexte et ton

Les fournisseurs LLM ont un avantage ici : ils peuvent lire votre fichier TRANSLATING.md et appliquer des instructions spécifiques au projet à chaque traduction. Vous pouvez définir des préférences de terminlogie (« traduire 'cart' par 'Warenkorb' et non 'Einkaufswagen' »), des consignes de ton (« utiliser le 'du' informel en allemand »), et clarifier les termes ambigus.

DeepL a ajouté un paramètre d'instructions personnalisées dans son API, ce qui est nouveau. Il prend également en charge les glossaires (jusqu'à 5 par requête). Mais un fichier TRANSLATING.md peut inclure des descriptions de produit, des notes sur l'audience et des consignes de style, ce qui va au-delà de ce que le paramètre d'instructions de DeepL peut gérer.

Gestion des placeholders

Tous les fournisseurs gèrent correctement les formats de placeholder Django (%(name)s, {name}, %s, %d). TranslateBot inclut des instructions explicites dans ses prompts pour préserver les placeholders. Lors de nos tests, la corruption de placeholders était extrêmement rare avec tous les fournisseurs.

Exemples de coûts réels

Voici ce que coûte la traduction de 500 chaînes (environ 10 000 mots) dans 5 langues cibles :

Fournisseur Coût estimé
DeepL (tier gratuit) 0,00 $
GPT-4o-mini ~0,05 $
GPT-4o ~0,50 $
Claude Sonnet ~0,60 $

GPT-4o-mini coûte moins de cinq centimes pour un projet Django de taille moyenne traduit dans cinq langues. Les modèles premium (GPT-4o, Claude Sonnet) restent largement sous le dollar. Le tier gratuit de DeepL est gratuit pour les projets de petite et moyenne taille dans la limite des 500 000 caractères mensuels.

Après la traduction complète initiale, la fonctionnalité de traduction incrémentale de TranslateBot (qui ne traduit que les chaînes nouvelles ou modifiées) réduit encore les coûts. Les exécutions suivantes ne traitent généralement qu'une poignée de chaînes.

Forces et faiblesses

GPT-4o-mini

Le meilleur rapport qualité-prix. Rapide, qualité solide sur la plupart des paires de langues, et presque toutes les équipes disposent déjà d'une clé API OpenAI.

Le compromis : la qualité baisse pour les textes complexes ou dépendants du contexte comparé à GPT-4o et Claude Sonnet. La recherche montre que GPT-4 produit des traductions trop littérales et peine avec les entités nommées peu courantes.

GPT-4o

Excellente qualité de traduction sur toutes les langues testées. Gère bien le contexte TRANSLATING.md et préserve les placeholders de manière fiable.

Il coûte environ 17 fois plus par token que GPT-4o-mini et est plus lent. Reste abordable en valeur absolue pour les charges de traduction.

Claude Sonnet

Le gagnant de WMT24. Lors de nos tests, Claude Sonnet produit les traductions les plus naturelles, particulièrement quand TRANSLATING.md contient un contexte détaillé. Il gère les niveaux de formalité (Sie/du en allemand, keigo japonais) mieux que les alternatives.

L'option LLM la plus chère au token. Les clés API Anthropic sont aussi moins répandues que les clés OpenAI dans la plupart des équipes, ce qui peut ajouter une friction au démarrage.

Claude Haiku

Plus rapide et moins cher que Sonnet, avec un support complet de TRANSLATING.md. L'écart de qualité par rapport à Sonnet est notable pour les traductions complexes, et GPT-4o-mini offre souvent un meilleur rapport qualité-prix à un tarif inférieur.

DeepL

Le tier gratuit en fait le choix évident pour les projets sans budget de traduction. La qualité sur les langues européennes est excellente, l'API est rapide, et le nouveau modèle LLM a ammélioré la qualité sur toute la ligne.

Pas de support TRANSLATING.md, donc vous ne pouvez pas transmettre le contexte projet de TranslateBot. Le paramètre d'instructions personnalisées aide mais n'est pas aussi flexible. Nécessite un extra d'installation [deepl] séparé.

Matrice de recommandation

Votre priorité Fournisseur recommandé
Meilleur rapport qualité-prix global GPT-4o-mini
Qualité de traduction maximale Claude Sonnet ou GPT-4o
Coût le plus bas (budget zéro) DeepL tier gratuit
Idéal pour les langues asiatiques Claude Sonnet ou GPT-4o
Idéal pour les langues européennes DeepL ou Claude Sonnet
Besoin de contexte/terminologie personnalisés GPT-4o-mini (budget) ou Claude Sonnet (qualité)
Conformité entreprise Azure OpenAI ou AWS Bedrock via LiteLLM

Pour la plupart des projets Django, commencez par GPT-4o-mini. Il couvre le plus large éventail de cas d'usage au coût le plus bas. Si la qualité ne répond pas à vos exigences pour certaines langues, passez à Claude Sonnet ou GPT-4o. Le changement prend environ 30 secondes.

Comment changer de fournisseur dans TranslateBot

Changer de fournisseur revient à modifier deux paramètres dans votre settings.py :

import os

# Option 1: GPT-4o-mini (default)
TRANSLATEBOT_MODEL = "gpt-4o-mini"
TRANSLATEBOT_API_KEY = os.getenv("OPENAI_API_KEY")

# Option 2: GPT-4o
TRANSLATEBOT_MODEL = "gpt-4o"
TRANSLATEBOT_API_KEY = os.getenv("OPENAI_API_KEY")

# Option 3: Claude Sonnet
TRANSLATEBOT_MODEL = "claude-sonnet-5-20250514"
TRANSLATEBOT_API_KEY = os.getenv("ANTHROPIC_API_KEY")

# Option 4: DeepL
TRANSLATEBOT_PROVIDER = "deepl"
TRANSLATEBOT_API_KEY = os.getenv("DEEPL_API_KEY")

Pour DeepL, vous devez aussi installer l'extra DeepL :

uv add --dev translatebot-django[deepl]

Pas de changement de code, pas de migration, pas de redéploiement. Modifiez les paramètres, relancez la commande de traduction, et vos traductions utilisent le nouveau fournisseur.

Conseils pratiques

Testez avant de valider. Utilisez le flag --dry-run pour voir à quoi ressembleraient les traductions sans les écrire dans vos fichiers .po :

python manage.py translate --target-lang de --dry-run

Commencez petit budget, montez en gamme si nécessaire. Démarrez avec GPT-4o-mini pour votre première passe de traduction. Examinez le résultat. Si certaines langues nécessitent des améliorations, passez à Claude Sonnet ou GPT-4o pour ces exécutions spécifiques :

TRANSLATEBOT_MODEL=claude-sonnet-5-20250514 python manage.py translate --target-lang ja

Utilisez TRANSLATING.md pour gagner en qualité. Avant de passer à un modèle plus cher, essayez d'ajouter un fichier TRANSLATING.md avec des consignes terminologiques et des instructions de ton. Cela améliore souvent suffisamment la sortie de GPT-4o-mini pour éviter le modèle plus coûteux.

Mixez les fournisseurs. Rien ne vous empêche d'utiliser DeepL pour les langues européennes (allemand, français, espagnol) et Claude Sonnet pour le japonais ou le coréen. Lancez la commande de traduction une fois par fournisseur, en ciblant des langues différentes à chaque fios.

Ne faites pas confiance aux scores COMET seuls. Si vous évaluez la qualité des traductions avec des métriques automatisées, sachez que COMET peut surestimer la qualité et passer à côté d'erreurs critiques. Faites toujours relire un échantillon de traductions par un locuteur natif pour les paires de langues importantes.

Surveillez l'utilisation du tier gratuit DeepL. La traduction incrémentale de TranslateBot aide, mais une première exécution de traduction volumineuse pourrait consommer une part significative de votre allocation mensuele de 500 000 caractères.

Conclusion

Les LLM égalent ou dépassent désormais régulièrement les systèmes de traduction automatique dédiés sur les benchmarks académiques. Claude a gagné WMT24, Gemini a gagné WMT25, et les traductions humaines ne sont plus assurées d'une place dans le tier supérieur. C'est un changement majeur par rapport à il y a seulement quelques années.

Pour les projets Django, en pratique : GPT-4o-mini à 0,05 $ par projet si vous voulez le meilleur rapport qualité-prix, Claude Sonnet ou GPT-4o si vous visez la qualité maximale appuyée par des benchmarks évalués par des pairs, DeepL si vous voulez le tier gratuit. TranslateBot rend le passage de l'un à l'autre aussi simple qu'un changement de paramètre.

Une fois votre fournisseur choisi, l'étape suivante consiste à automatiser votre workflow de traduction Django pour que les nouvelles chaînes ne s'accumulent plus.

Arrêtez d'éditer les fichiers .po manuellement

TranslateBot automatise les traductions Django avec l'IA. Une commande, toutes vos langues, des centimes par traduction.