Probamos GPT-4o, Claude y DeepL en archivos .po reales de Django en varios idiomas. Este artículo cubre lo que encontramos, lo que dice la investigación académica más reciente (WMT24 y WMT25 tuvieron resultados sorprendentes), y cómo elegir el proveedor adecuado para tu proyecto.
TranslateBot soporta los tres, además de más de 100 modelos adicionales a través de LiteLLM. Si estás configurando las traducciones de Django por primera vez, nuestra guía completa de localización en Django cubre toda la configuración antes de elegir un proveedor.
Lo que dice la investigación
Antes de entrar en nuestras propias pruebas, vale la pena revisar los benchmarks académicos. La evaluación más rigurosa de traducción automática ocurre en las tareas compartidas anuales de WMT, organizadas por la Association for Computational Linguistics.
WMT24: Claude gana la tarea de traducción general
La tarea compartida de traducción general de WMT24 evaluó traducciones en 11 pares de idiomas utilizando anotadores humanos profesionales. Claude 3.5 Sonnet fue el sistema con mejor rendimiento en general, ganando 9 de 11 pares de idiomas.
Un LLM de propósito general superó a todos los sistemas dedicados de traducción automática enviados a la competicion. Eso no se esperaba.
Los sistemas basados en LLM también superaron las traducciones de referencia humanas profesionales en varios pares de idiomas. Las referencias humanas solo quedaron en el grupo de calidad ganador en 7 de 11 pares. Para inglés a ucraniano, Claude 3.5 obtuvo 90.5 en COMET mientras que la referencia humana obtuvo 87.3.
WMT25: misma historia, diferente ganador
La evaluación de WMT25 se expandió a 16 pares de idiomas. Gemini 2.5 Pro quedó en primer lugar, ubicándose en el grupo ganador en 14 de 16 pares. Las traducciones humanas solo entraron al grupo superior en 6 de 15 pares donde estaban disponibes.
El paper señala que esto "resalta la dificultad inherente de la traducción, aunque también podría reflejar las preferencias estilísticas o léxicas de los anotadores." Sea cual sea la explicación, los LLMs están superando consistentemente a los sistemas dedicados de MT en estos benchmarks.
Donde los LLMs todavía se quedan cortos
La misma investigación muestra limitaciones claras. Un estudio que evaluó GPT-4 contra traductores humanos en 1,600 oraciones encontró que GPT-4 rinde al nivel de un traductor junior, produciendo 3.71 errores mayores por segmento comparado con 1.83 de traductores senior.
La calidad varía mucho según el par de idiomas. Para inglés a ruso, GPT-4 casi iguala a los traductores senior. Para chino a inglés, queda muy atrás. Para pares de idiomas de bajos recursos, las brechas se amplían: la traducción de inglés a jemer con un LLM obtuvo 39.10 en XCOMET versus 65.88 de Google Translate.
WMT24 también encontró que los LLMs todavía tienen problemas con fenómenos lingüísticos específicos en ciertos idiomas. El manejo de puntuación y los tiempos verbales futuros en inglés-alemán, por ejemplo, son áreas donde los sistemas neuronales tradicionales de MT realimente lo hacen mejor.
Una cosa más que vale la pena saber: las métricas automatizadas de calidad como COMET pueden ser engañosas. Un segmento que recibió una puntuación alta de COMET de 0.86 resultó contener un error crítico de comprensión cuando fue revisado por profesionales. No te fíes solo de benchmarks automatizados.
Los contendientes (mediados de 2026)
OpenAI GPT-4o / GPT-4o-mini
Los modelos de OpenAI son los predeterminados en TranslateBot. GPT-4o-mini es la opción económica con buena calidad. GPT-4o maneja bien las traducciones complejas y el texto dependiente del contexto. Ambos soportan instrucciones personalizadas mediante TRANSLATING.md.
Anthropic Claude (Sonnet / Haiku)
Claude ganó la tarea de traducción general de WMT24. Claude Sonnet 5 es fuerte en comprensión contextual y tiende a producir traducciones que se leen de forma natural en lugar de sonar traducidas. Claude Haiku 4.5 es una opción más rápida y económica.
DeepL
DeepL lanzó un modelo de traducción de nueva generación basado en LLM a principios de 2025, alejándose de su enfoque tradicional de MT neuronal. El nuevo modelo está entrenado con más de siete años de datos de traducción propieatrios. DeepL también ha añadido soporte para instrucciones personalizadas en las solicitudes de traducción y se ha expandido a más de 100 idiomas. El nivel gratuito (500,000 caracteres por mes) sigue disponible.
Comparación directa
| Criterio | GPT-4o-mini | GPT-4o | Claude Haiku | Claude Sonnet | DeepL |
|---|---|---|---|---|---|
| Calidad idiomas europeos | Buena | Excelente | Buena | Excelente | Excelente |
| Calidad idiomas asiáticos | Buena | Excelente | Buena | Excelente | Buena |
| Contexto / instrucciones personalizadas | Sí | Sí | Sí | Sí | Sí |
| Soporte TRANSLATING.md | Sí | Sí | Sí | Sí | No |
| Seguridad de placeholders | Alta | Alta | Alta | Alta | Alta |
| Nivel gratuito | No | No | No | No | 500k cars/mes |
| Velocidad | Rápida | Media | Rápida | Media | Rápida |
| Cobertura de idiomas | 100+ | 100+ | 100+ | 100+ | 100+ |
Costo por millón de tokens de entrada
| Proveedor | Costo |
|---|---|
| GPT-4o-mini | ~$0.15 |
| Claude Haiku 4.5 | ~$1.00 |
| GPT-4o | ~$2.50 |
| Claude Sonnet 5 | ~$3.00 |
| DeepL (nivel gratuito) | $0.00 |
| DeepL (pago, por 1M caracteres) | ~$25.00 |
Los precios de LLM son por token mientras que DeepL cobra por carácter, así que la comparación directa es complicada. Para cargas de trabajo de traducción típicas, los LLMs resultan significativamente más baratos. Mira los ejemplos de costos a continuación.
Desglose de calidad
Idiomas europeos (alemán, francés, neerlandés, español)
El nuevo modelo LLM de DeepL ha fortalecido su ya fuerte rendimiento en idiomas europeos. GPT-4o y Claude Sonnet lo igualan de cerca. Los resultados de WMT24 respaldan esto: la brecha de calidad entre los principales sistemas LLM y los MT dedicados para los pares de idiomas europeos principales es desprciable a estas alturas.
GPT-4o-mini y Claude Haiku están un escalón por debajo de las opciones premium pero manejan bien las cadenas típicas de UI de Django. Pueden fallar con oraciones largas y complejas o terminología especializada.
Idiomas asiáticos (japonés, chino, coreano)
Los proveedores basados en LLM todavía tienen una ventaja clara. GPT-4o y Claude Sonnet manejan el keigo japonés (niveles de cortesía), las distinciones entre chino simplificado/tradicional y los honoríficos coreanos con más matiz. El nuevo modelo LLM de DeepL ha reducido la brecha, pero la profundidad de contexto que los LLMs aportan a estos idiomas sigue estando por delante.
La investigación concuerda con esto: GPT-4 casi iguala a los traductores senior para inglés-ruso pero queda significativamente atrás para chino-inglés. Qué par de idimoas estás traduciendo importa más que qué proveedor elijas.
Idiomas de bajos recursos
Si estás traduciendo a idiomas como jemer, lao o birmano, los LLMs actuales muestran caídas grandes de calidad. Los sistemas dedicados de MT de Google todavía superan a los LLMs por un amplio margen para estos idiomas. La mayoría de los proyectos Django apuntan a idiomas principales, así que probablemente esto no te afecte, pero vale la pena conocer los límites.
Contexto y tono
Los proveedores de LLM tienen ventaja aquí: pueden leer tu archivo TRANSLATING.md y aplicar instrucciones específicas del proyecto a cada traducción. Puedes establecer preferencias de terminología ("traduce 'cart' como 'Warenkorb', no 'Einkaufswagen'"), guías de tono ("usa el 'du' informal en alemán"), y aclarar terminos ambiguos.
DeepL ha añadido un parámetro de instrucciones personalizadas en su API, que es nuevo. También soporta glosarios (hasta 5 por solicitud). Pero un archivo TRANSLATING.md puede incluir descripciones de producto, notas de audiencia y guías de estilo, lo cual va más allá de lo que el parámetro de instrucciones de DeepL puede manejar.
Manejo de placeholders
Todos los proveedores manejan los formatos de placeholder de Django (%(name)s, {name}, %s, %d) de manera confiable. TranslateBot incluye instrucciones explícitas en sus prompts para preservar los placeholders. En nuestras pruebas, la corrupción de placeholders fue extremadamente rara en todos los proveedores.
Ejemplos de costos reales
Esto es lo que cuesta traducir 500 cadenas (aproximadamente 10,000 palabras) a 5 idiomas destino:
| Proveedor | Costo estimado |
|---|---|
| DeepL (nivel gratuito) | $0.00 |
| GPT-4o-mini | ~$0.05 |
| GPT-4o | ~$0.50 |
| Claude Sonnet | ~$0.60 |
GPT-4o-mini cuesta menos de cinco centavos para un proyecto Django mediano traducido a cinco idiomas. Los modelos premium (GPT-4o, Claude Sonnet) se mantienen muy por debajo de un dólar. El nivel gratuito de DeepL es gratis para proyectos pequeños a medianos dentro del límite mensual de 500,000 caracteres.
Después de la traducción completa inicial, la función de traducción incremental de TranslateBot (solo traduce cadenas nuevas o modificadas) mantiene los costos aún más bajos. Las ejecuciones posteriores típicamente procesan solo un puñado de cadenas.
Fortalezas y debilidades
GPT-4o-mini
La mejor relación calidad-precio. Rápido, calidad sólida en la mayoría de pares de idiomas, y casi todos los equipos ya tienen una API key de OpenAI.
La contrapartida: la calidad baja para texto complejo o dependiente del contexto comparado con GPT-4o y Claude Sonnet. La investigación muestra que GPT-4 produce traducciones excesivamente literales y tiene problemas con entidades nombradas poco comunes.
GPT-4o
Calidad de traducción fuerte en todos los idiomas que probamos. Maneja bien el contexto de TRANSLATING.md y preserva placeholders de forma confiable.
Cuesta aproximadamente 17 veces más por token que GPT-4o-mini y es más lento. Aún así, es asequible en términos absolutos para cargas de trabajo de traducción.
Claude Sonnet
El ganador de WMT24. En nuestras pruebas, Claude Sonnet produce las traducciones que suenan más naturales, particularmente cuando TRANSLATING.md contiene contexto detallado. Maneja los niveles de formalidad (alemán Sie/du, keigo japonés) mejor que las alternativas.
La opción LLM más cara por token. Las API keys de Anthropic también son menos comunes que las de OpenAI en la mayoría de equipos, lo que puede añadir algo de fricción al empezar.
Claude Haiku
Más rápido y económico que Sonnet, con soporte completo de TRANSLATING.md. La brecha de calidad comparada con Sonnet es notable para traducciones complejas, y GPT-4o-mini a menudo ofrece mejor relación calidad-precio a un precio más bajo.
DeepL
El nivel gratuito lo convierte en la opción obvia para proyectos sin presupuesto de traducción. La calidad en idiomas europeos es excelente, la API es rápida, y el nuevo modelo LLM ha mejorado la calidad en todso los ámbitos.
No tiene soporte para TRANSLATING.md, así que no puedes pasar el contexto de proyecto de TranslateBot. El parámetro de instrucciones personalizadas ayuda pero no es tan flexible. Requiere un extra de instalación [deepl] separado.
Matriz de recomendación
| Tu prioridad | Proveedor recomendado |
|---|---|
| Mejor valor general | GPT-4o-mini |
| Mayor calidad de traducción | Claude Sonnet o GPT-4o |
| Menor costo (presupuesto cero) | Nivel gratuito de DeepL |
| Mejor para idiomas asiáticos | Claude Sonnet o GPT-4o |
| Mejor para idiomas europeos | DeepL o Claude Sonnet |
| Necesitas contexto/terminología personalizada | GPT-4o-mini (económico) o Claude Sonnet (calidad) |
| Cumplimiento empresarial | Azure OpenAI o AWS Bedrock via LiteLLM |
Para la mayoría de proyectos Django, empieza con GPT-4o-mini. Cubre la gama más amplia de casos de uso al menor costo. Si la calidad no cumple tus estándares para idiomas específicos, cambia a Claude Sonnet o GPT-4o. El cambio toma unos 30 segundos.
Cómo cambiar de proveedor en TranslateBot
Cambiar de proveedor significa modificar dos configuraciones en tu settings.py:
import os
# Option 1: GPT-4o-mini (default)
TRANSLATEBOT_MODEL = "gpt-4o-mini"
TRANSLATEBOT_API_KEY = os.getenv("OPENAI_API_KEY")
# Option 2: GPT-4o
TRANSLATEBOT_MODEL = "gpt-4o"
TRANSLATEBOT_API_KEY = os.getenv("OPENAI_API_KEY")
# Option 3: Claude Sonnet
TRANSLATEBOT_MODEL = "claude-sonnet-5-20250514"
TRANSLATEBOT_API_KEY = os.getenv("ANTHROPIC_API_KEY")
# Option 4: DeepL
TRANSLATEBOT_PROVIDER = "deepl"
TRANSLATEBOT_API_KEY = os.getenv("DEEPL_API_KEY")
Para DeepL, también necesitas instalar el extra de DeepL:
uv add --dev translatebot-django[deepl]
Sin cambios de código, sin migración, sin redespliegue. Cambia las configuraciones, vuelve a ejecutar el comando de traducción, y tus traducciones usan el nuevo proveedor.
Consejos prácticos
Prueba antes de confirmar. Usa la bandera --dry-run para ver cómo se verían las traducciones sin escribirlas en tus archivos .po:
python manage.py translate --target-lang de --dry-run
Empieza barato, mejora si es necesario. Comienza con GPT-4o-mini para tu primera pasada de traducción. Revisa el resultado. Si ciertos idiomas necesitan mejoras, cambia a Claude Sonnet o GPT-4o para esas ejecuciones específicas:
TRANSLATEBOT_MODEL=claude-sonnet-5-20250514 python manage.py translate --target-lang ja
Usa TRANSLATING.md para mejorar la calidad. Antes de cambiar a un modelo más caro, prueba añadiendo un archivo TRANSLATING.md con guías de terminología e instrucciones de tono. Esto a menudo mejora el resultado de GPT-4o-mini lo suficiente como para que no necesites el modelo más costoso.
Mezcla y combina. Nada te impide usar DeepL para idiomas europeos (alemán, francés, español) y Claude Sonnet para japonés o coreano. Ejecuta el comando de traducción una vez por proveedor, dirigiendote a diferentes idiomas cada vez.
No confíes solo en las puntuaciones COMET. Si estás evaluando la calidad de traducción con métricas automatizadas, ten en cuenta que COMET puede sobreestimar la calidad y pasar por alto errores críticos. Siempre haz que un hablante nativo revise una muestra de traducciones para los pares de idiomas importantes.
Vigila el uso del nivel gratuito de DeepL. La traducción incremental de TranslateBot ayuda, pero una ejecución inicial grande de traducción podría usar una porción significativa de tu asignacion mensual de 500,000 caracteres.
Conclusión
Los LLMs ahora igualan o superan de manera rutinaria a los sistemas dedicados de traducción automática en benchmarks académicos. Claude ganó WMT24, Gemini ganó WMT25, y las traducciones humanas ya no tienen garantizado un lugar en el nivel superior. Eso es un gran cambio respecto a hace solo unos años.
Para proyectos Django, la conclusión práctica: GPT-4o-mini a $0.05 por proyecto si quieres valor, Claude Sonnet o GPT-4o si necesitas la mejor calidad respaldada por benchmarks revisados por pares, DeepL si quieres el nivel gratuito. TranslateBot hace que cambiar entre ellos sea solo un cambio de configuración.
Una vez elegido el proveedor, el siguiente paso es automatizar tu flujo de trabajo de traducción en Django para que las cadenas nuevas no vuelvan a acumularse.