Amazon lanzó un nuevo punto de referencia de evaluación de género de traducción automática (MT) llamado MT-GenEval en diciembre de 2022.

Según investigadores de Amazon (Anna Currey, Maria Nadejde, Raghavendra Pappagari, Mia Mayer, Stanislas Lauly, Xing Niu, Benjamin Hsu y Georgiana Dinu), el objetivo es comprender mejor cómo se desempeñan los sistemas de traductor profesional en la tarea de precisión de la traducción de género.

Como explicaron Currey y Hsu en una publicación de blog del 8 de diciembre de 2022, los sistemas de MT son propensos a errores de oficina de traducción de sesgo de género y «a veces traducen incorrectamente los géneros de las personas a las que se hace referencia en los segmentos de entrada, incluso cuando el género de un individuo no es ambiguo en función de el contexto lingüístico”.

Además, «los puntos de referencia de evaluación de género existentes tienen una diversidad limitada en términos de fenómenos de género (p. ej., centrarse en profesiones), estructura de oraciones (p. ej., usar plantillas para construir oraciones) o cobertura de lenguaje», lo que hace que sea aún más difícil evaluar cómo los sistemas de MT desempeñarse en términos de género y calidad al mismo tiempo, según el documento de investigación que describe el punto de referencia.

El documento se presentó en la Conferencia de 2022 sobre métodos empíricos en el procesamiento del lenguaje natural ( EMNLP ).

Conjunto de datos realista

MT-GenEval es un conjunto de evaluación grande y realista que contiene traducciones del inglés a ocho idiomas diversos y ampliamente hablados: árabe, francés, alemán, hindi, italiano, portugués, ruso y español.

A diferencia de los conjuntos de pruebas de sesgo de género de uso común que se construyen artificialmente, el conjunto de datos MT-GenEval se basa en datos del mundo real obtenidos de Wikipedia e incluye traducciones de referencia creadas profesionalmente en cada uno de los idiomas.

Además, está completamente equilibrado al incluir contrafactuales de género creados por humanos. “Este tipo de equilibrio garantiza que los subconjuntos de género diferente no tengan significados diferentes”, explicaron los investigadores de traducciones para amazon en la misma publicación de blog.

Además de los 1150 segmentos de datos de evaluación por par de idiomas, se publicaron 2400 oraciones paralelas para capacitación y desarrollo.

Precisión de traducción de género

La precisión de género en la traducción se define como «la medida en que la salida de una traducción automática refleja con precisión el género de las personas mencionadas en la entrada, restringida a los casos en los que el género está explícita y lingüísticamente desambiguado en el contexto de la entrada».

Por lo tanto, en su punto de referencia, los investigadores no tienen en cuenta el género gramatical de los objetos inanimados o los casos en los que el género de entrada como hacer una traduccion SEO es ambiguo dentro del contexto dado.

El punto de referencia ha demostrado ser útil para evaluar los sistemas comerciales y de investigación, incluidos los modelos de traducción automática contextual y los modelos con equilibrio de género, en términos de precisión de género y calidad.

MT-GenEval es un paso adelante para la evaluación de la precisión de género en la traducción automática”, dijeron los investigadores de Amazon. “Esperamos que este punto de referencia y los datos de desarrollo impulsen más investigaciones en el campo de la precisión de género en la traducción en diversos idiomas”, concluyeron.