jueves, 3 de mayo de 2012

Análisis en profundidad del programa de traducción asistida Déjà Vu

A raíz de otro artículo muy interesante de la revista Panace@(1), me gustaría hablar más en profundidad del programa de traducción asistida (al que también me he referido en varias ocasiones como programa de memoria de traducción) Déjà Vu. Aunque lo he mencionado con mucha frecuencia a lo largo de las entradas del blog y aunque ya hablé de las funciones básicas de un programa de memoria de traducción (Traducir mediante una memoria de traducción: funciones y herramientas básicas), este artículo me ha servido para tener una visión más amplia de este programa y, por ello, me gustaría compartir en este blog todo lo que he aprendido en dicho artículo.

En qué consiste Déjà Vu

El autor del artículo comienza en su introducción definiendo las características de Déjà Vu: debido a que combina la tecnología de las memorias de traducción con las técnicas de traducción automática, permite mejorar tanto la productividad del traductor como la coherencia en su trabajo. Asimismo, con este programa puede realizarse una gestión de proyectos de forma eficiente.

La novedad con respecto a otros sistemas de traducción asistida radica en que utiliza de forma inteligente la memoria de traducción, la base de datos terminológica y el lexicón para ensamblar las traducciones de varios segmentos más pequeños en uno solo más grande: el programa intuye como si fuera un traductor humano y realiza lo que se denomina deep mining (ver término 19 de Términos claves de Informática Aplicada a la traducción). Además, como también he mencionado en varias ocasiones, el programa puede trabajar con la mayoría de formatos de archivo, dado que, en su interfaz, solo presenta el texto que va a traducirse y cualquier información codificada del texto origen la protege para que no pueda alterarse (de esto también hablo en la entrada dedicada a las funciones de los programas de memorias de traducción).

Qué tiene Déjà Vu que no tengan otros programas de traducción asistida

Tras un análisis de las funciones básicas de Déjà Vu, el autor pasa a lo que nos interesa: las funciones específicas de Déjà Vu.

1. Escaneado (scan)

En primer lugar, habla de la función de escaneado, esto es, el programa busca si existen correspondencias exactas o aproximadas de los segmentos que se está traduciendo y, en el caso de que sí las haya, incluirá dichas traducciones (para más información, pueden verse las coincidencias totales y parciales o fuzzy matching, 12, y la autopropagación, 13, en esta entrada). Asimismo, puede reparar de forma automática las coincidencias aproximadas o la traducción automática basada en ejemplos. Después de todo este proceso, el programa puede realizar su propia traducción basándose en distintos segmentos, convirtiendo el segmento origen y el segmento meta en una coincidencia exacta, exact match (realizando el ya mencionado deep mining).

2. Ensamblado (assemble)

Esta función (exclusiva de Déjà Vu) consiste, como acabo de explicar, en combinar fragmentos menores para conseguir traducir segmentos que solo tienen una coincidencia parcial, también partiendo de toda la información contenida en sus bases de datos. 

3. Pretraducción (pretranslate)

La función de pretraducción es especialmente útil en el caso de textos muy repetitivos, en los que lo más recomendable es traducir el proyecto de forma automática y, después, revisarlo. Si a esto le añadimos que Déjà Vu busca las coincidencias (totales y parciales) para cada oración, el resultado será de mejor calidad, ya que, para ello, selecciona la mejor traducción (una coincidencia exacta garantizada, guaranteed exact match, una exacta, exact match, o una aproximada, fuzzy match).

4. Propagación (propagate)

Una vez más, esta función es adecuada para proyectos extensos y repetitivos. Como he explicado a propósito de la autopropagación, el programa buscará segmentos similares o iguales a los ya traducidos y solicitará una confirmación para insertar una coincidencia aproximada autorreparada (self-repaired self-match).

5. Autobúsqueda (autosearch)

También he hablado de esta función en una de las entradas dedicadas a los términos claves de la asignatura. En resumen, el programa realiza una búsqueda automática de términos, segmentos y términos almacenados para poder aplicar su correspondiente traducción al texto que se está traduciendo. Asimismo, muestra su correspondiente información contextual, lo que es de gran ayuda.

6. Gestión de proyectos

Un aspecto muy interesante es el hecho de que Déjà Vu permite realizar gestiones de proyectos (sobre los que hablé aquí y aquí). De esta forma, pueden crearse proyectos satélites, también conocidos como Pack&Go: se trata de pequeños archivos monolingües que pueden reimportarse al proyecto plurilingüe principal y que pueden transportarse con facilidad debido a que no contienen información sobre formato o imágenes. También pueden distribuirse pequeñas bases de datos (cuyo contenido haya seleccionado previamente el gestor) para facilitar el trabajo del traductor y asegurarle coherencia, además de que el gestor también se asegurará de que las memorias de traducción y las bases de datos terminológicas no se dispersarán entre los distintos traductores.

Asimismo, el gestor de proyectos puede asignar derechos de acceso individual a cada miembro de un grupo de traductores, para que cada uno trabaje solo en lo que se le ha asignado y no modifique el trabajo de los demás, sin por ello dejar de ofrecerles el texto en su conjunto. Incluso puede agregar información a los segmentos o responder a las dudas que puedan tener los traductores mediante la función de comentario (comment).

7. Control de calidad

Esta función, como su nombre indica, permite verificar que la terminología o los códigos, por ejemplo, se han utilizado de forma adecuada e, incluso, puede mostrar, si las hay, otras opciones de traducción de determinados segmentos o términos. Esto beneficia tanto a los traductores (cuyas traducciones serán de mejor calidad) como a los gestores (que podrán asegurarse de que los traductores han seguido sus instrucciones y que también podrán corregir cualquier fallo u omisión).

8. Entorno integrado

Con esto, el autor del artículo que estoy comentando se refiere a que todas las tareas pueden realizarse en la misma interfaz de usuario del programa, dado que esta se adapta a cualquier necesidad. De hecho, el usuario puede incluso definir y personalizar sus propias barras de menú, atajos del teclado, esquemas de color, ventanas de herramientas...

Así, algunas de estas funciones son la ya mencionada autobúsqueda (recordemos que basta con pulsar la combinación de teclas Ctrl. + el número del término para incluirlo de forma automática en el segmento) y características propias de cualquier procesador de textos, como autocorrección y autotexto (similares a las de Microsoft Word), y corrección de ortografía de hasta 14 idiomas (si se trabaja con otro idioma, basta con utilizar el corrector de Word de ese idioma que, por supuesto, tiene que estar instalado). Incluso es posible utilizar los atajos comunes de Windows (copiar, cortar, pegar, buscar, reemplazar, seleccionar texto y las muy útiles y necesarias deshacer y rehacer).

 9. Formatos de archivo admitidos

Déjà Vu admite prácticamente todos los formatos de archivos a excepción de algunos como el .pdf (que es cierto que da problemas de compatibilidad a la mayoría de los programas, sean de lo que sean). Recordemos, asimismo, que el programa utiliza una especie de filtro, de forma que, mientras se está traduciendo, solo muestra la parte escrita del texto (o proyecto) origen y, una vez que se ha traducido, exporta el texto meta con el mismo formato del texto (o proyecto) original. También hay que añadir que permite que el intercambio de las bases de datos terminológicas y de las memorias de traducción se haga fácilmente (además de que siempre puede recurrirse al formato .tmx para exportar las memorias de traducción).

10. Administración de las terminologías

Sobre este aspecto no tengo nada más que añadir, dado que ya lo he dicho todo en entradas como esta. Sin embargo, sí debo decir que Déjà Vu puede personalizar los términos almacenados por categorías y atributos e incluso por clientes, algo que es muy útil. Incluso ofrece la posibilidad de incluir relaciones de sinonimia y antonimia entre términos de un mismo idioma.

11. Mantenimiento de las bases de datos

A pesar de que sobre este aspecto tampoco tengo mucho que añadir, solo mencionaré que los glosarios son multilingües y multiámbitos y que, además, el idioma de origen de una base de datos puede convertirse en el idioma meta de otras, lo que resulta de gran utilidad. Asimismo, también pueden importarse y exportarse glosarios y memorias de traducción para intercambiarlos con otros traductores o enviárselos al cliente.

12. Alineación

Déjà Vu también cuenta con una herramienta para realizar alineaciones de segmentos que, a continuación, podrán agregarse a la memoria de traducción (para más información sobre la alineación, ver esta entrada).

13. Lexicón del proyecto

También he comentado esta función en varias ocasiones (por ejemplo, en esta entrada, además de en otras ya citadas) a propósito de que supone una herramienta muy útil para garantizar la coherencia en el uso de la terminología. Déjà Vu es capaz de realizar una extracción terminológica de forma automática, a partir de la que puede crearse un lexicón.

Además de esto, Déjà Vu puede traducir los lexicones de forma automática para así crear bases de datos a partir de proyectos ya existentes. Esto, como es lógico, también afecta a la calidad de la gestión del proyecto de traducción, puesto que el gestor puede distribuir un glosario unificado a todos los miembros de un equipo de traducción y la calidad de la traducción final y el trabajo del traductor serán mucho mejores.

¿Y las desventajas?...

La única desventaja de Déjà Vu parece ser, por lo tanto, que hay que acostumbrarse a todas estas funciones, pero yo no considero esto un obstáculo, dado que, como con cualquier programa que tenga una interfaz mínimamente intuitiva (como es el caso), cualquier usuario puede acostumbrarse rápidamente a su uso. Además, como cualquier programa de cierta calidad, ocupa mucho espacio en el disco duro del ordenador, pero creo que estos son problemas menores y más si tenemos en cuenta todas las ventajas que ofrece.

Podría concluir que este artículo dedicado a las distintas funciones específicas de Déjà Vu me ha sido de gran utilidad para ampliar mis conocimientos sobre dicho programa; de hecho, había funciones que no conocía, pero incluso sobre las que ya conocía he descubierto nuevos aspectos. Por último, también había términos que desconocía (coincidencia exactacoincidencia exacta garantizadacoincidencia aproximada autorreparada...) y que ahora he incorporado a mi glosario personal, es decir, a mis conocimientos sobre esta asignatura (sobre la que, me estoy dando cuenta, nunca se deja de aprender).

Recomiendo encarecidamente visitar la página web de ATRIL, donde pueden verse vídeos explicativos sobre el uso de Déjà Vu.



__________________________
(1) H. Gauna, Daniel: «Nuevas vistas a la traducción con Déjà Vu» en Panace@, vol. 10, n.º 29, junio de 2009, accesible en: http://www.medtrad.org/panacea/IndiceGeneral/n29_tribuna-Gauna.pdf [Consulta: 3/V/2012]

martes, 1 de mayo de 2012

La creación de «listas negras» de palabras para garantizar la coherencia terminológica

Las «listas negras», una opción más que recomendable para asegurarse la coherencia terminológica


Breve análisis de las fuentes de tráfico del blog

¿Cuántas personas han accedido a Mundos binarios de Babel? ¿Cómo han llegado hasta aquí?


sábado, 28 de abril de 2012

Términos claves de Informática Aplicada a la Traducción (II)

Términos más específicos relacionados con las memorias de traducción

Tras una primera entrada de conceptos más generales de Informática aplicada a la traducción, voy a proseguir con términos más específicos que tienen que ver con las memorias de traducción. Como ya expliqué en qué consiste una memoria de traducción (ver término 9 de dicha entrada), voy a pasar a definir los siguientes términos:


12. Coincidencias totales y coincidencias parciales o fuzzy matching

El programa de memorias de traducción contiene una memoria de traducción dividida en una serie de segmentos en lengua origen, que están almacenados junto a su correspondiente equivalente en lengua meta (ver términos 10 y 11). Así, cuando se está traduciendo un texto nuevo, dicho programa realiza una búsqueda para localizar aquellos segmentos del texto nuevo que ya se hayan traducido previamente y que, por lo tanto, se encuentren almacenados en la memoria.

Si ya hay un segmento almacenado en la memoria que es prácticamente (o exactamente) igual al segmento nuevo, se habla de coincidencias totales. Si la coincidencia es solo parcial, se habla de fuzzy matching

12. 1. Umbral de sensibilidad

Además, puede indicársele al programa que aplique un determinado umbral de sensibilidad en la búsqueda de coincidencias; se aplica un grado que puede ir de 0 a 100 y que, por defecto, suele ser de un 75% dado que, si se es demasiado exigente con el programa y se le pide que encuentre coincidencias exactas, será muy poco probable que las encuentre (y habrá demasiado silencio, en contraposición al ruido, que se dará cuando el umbral sea demasiado bajo y, por lo tanto, aparezcan demasiados resultados; es lo mismo que ocurre cuando se realiza una búsqueda en un motor de búsqueda).

13. Autopropagación

De esta forma, en el programa de memorias de traducción puede activarse la opción de autopropagación (esto puede hacerse, por ejemplo, en Déjà Vu), de forma que, si un determinado segmento ya se ha traducido y vuelve a aparecer en el texto que se está traduciendo, el programa introducirá la traducción que ya se haya realizado (esto es especialmente útil en el caso de textos muy repetitivos, puesto que le ahorra mucho tiempo al traductor y le asegura que será coherente en su traducción).

De esta y de otras funciones básicas de cualquier sistema de memoria de traducción hablo en Traducir mediante una memoria de traducción: funciones y herramientas básicas.

13.1. Autocomprobación 

Además, el programa de memoria de traducción va comprobando que la traducción de los segmentos que realiza el traductor se corresponde con la que tiene almacenada (si no, como en el caso de Déjà Vu, el programa avisa al traductor mediante un signo de exclamación en rojo).

14. Unidad de traducción

Este concepto es bastante abstracto, puesto que la unidad de traducción se corresponde con el segmento que se traduce. En otras palabras, la unidad de traducción puede abarcar desde una palabra hasta una oración entera (e incluso los hay que afirman que traducimos textos y no palabras ni oraciones). En cualquier caso, para los sistemas de memorias de traducción, la unidad de traducción es el segmento, como ya expliqué (ver 11).

Hablar de «unidad de traducción» nos lleva a «afinar» un poco más en cuanto a los términos que van a definirse, es decir, a ser más específicos y a centrarnos en unidades de traducción más pequeñas, como pueden ser las palabras, cuya traducción correcta (teniendo en cuenta el contexto en cada caso) hay que conocer e indicar al programa:

15. Término

Como ya he dicho en varias ocasiones, tras dos asignaturas de Terminología, la definición de término no supone ninguna dificultad. Como ya definí en la entrada La importancia de la terminología en los programas de memoria de traducción, un término es una unidad léxica compuesta por una o más palabras que adquiere su significación en función de un ámbito determinado; en muchas ocasiones, de hecho, solo en función del contexto sabremos el significado y la acepción de un término dado.

Para ello es fundamental realizar una extracción terminológica, en la que conviene indicar las distintas traducciones de los términos en función de su contexto de uso.

15.1. Extracción terminológica

También a la extracción terminológica le dediqué una entrada, por lo que solo diré que consiste en recopilar de una serie de textos especializados aquellas palabras que puedan considerarse términos. Esto se puede hacer de forma automática mediante programas como Lexterm o mediante el que incluye Déjà Vu y, aunque no lo parezca, ahorrará mucho tiempo al traductor cuando esté realizando la traducción, además de que le asegurará una coherencia interna en su trabajo, como no me he cansado de repetir.

Para un análisis más detallado de la extracción terminológica, así como de sus ventajas, ver La importancia de la terminología en los programas de memoria de traducción y La extracción de términos.

15.1.1. Las stopwords


A propósito de la extracción terminológica, conviene recordar un término muy relacionado, el de stopword, aquellas palabras que están vacías de contenido. Cuando el programa realiza una extracción terminológica automática, puede marcarse como preferencia que no incluya dichas palabras en su extracción (en internet hay muchos listados de estas palabras, además de que muchos programas de extracción terminológica las incluyen; es el caso de Lexterm).

Aun a riesgo de repetirme, para más información sobre las stopwords, puede consultarse la entrada anteriormente citada La extracción de términos.
Volvamos ahora a ampliar un poco la cuestión de las palabras y de los términos. ¿En qué tipo de listas se incluyen?

16. Base de datos terminológica

Una base de datos terminológica es, simplemente, una base de datos (esto es, un contenedor de datos) que incluye una serie de términos recopilados por pares, es decir, incluye el término original junto a su traducción y, lo que es más importante, también incluye su contexto, el ámbito en el que se utiliza (ya he insistido en varias ocasiones en la importancia del contexto en la traducción de términos).

Asimismo, la base de datos terminológica puede ser multilingüe (es decir, incluir la traducción correspondiente del término en más de un idioma) y multiámbito (dado que un mismo término puede tener distintas acepciones según el contexto del uso, por lo que es de gran importancia que esto esté bien indicado en la base de datos terminológica).

Una vez más, de estos temas hablo en La importancia de la terminología en los programas de memoria de traducción.

17. Léxico, lexicón

Un léxico, por lo tanto, sería una base de datos terminológica ad hoc, esto es, creada para un proyecto de traducción determinado. Así, una vez que se finalice el proyecto, dicho léxico pasaría a formar parte de la base de datos terminológica. Dado que es un glosario ad hoc, no hace falta incluir el ámbito de uso, puesto que en un proyecto de traducción determinado solo habrá un contexto.

Un lexicón es lo mismo que el léxico, aunque el término lexicón se utiliza con más frecuencia, a mi juicio, en lo relativo a la traducción automática y asistida.

También al léxico y al lexicón les dedico la entrada La importancia de la terminología en los programas de memoria de traducción La extracción de términos.

18. Autobúsqueda

Muy relacionada con los términos anteriores está la función de autobúsqueda que ofrecen los sistemas de memorias de traducción (como Déjà Vu, sin ir más lejos). Si esta opción está activada, el sistema buscará de forma automática si existe algo aprovechable en las distintas bases de datos (memorias de traducción, bases de datos terminológicas, lexicones...), esto es, si puede utilizar traducciones de segmentos o de términos ya realizadas en el texto que se está traduciendo (una vez más, esto asegura la coherencia del trabajo del traductor).

Para una explicación de la autobúsqueda más «en contexto», ver, una vez más, La importancia de la terminología en los programas de memoria de traducción.

19. Deep mining

Retomo los conceptos de autopropagación (13) y autobúsqueda (18) para explicar brevemente en qué consiste el deep mining. Se trata, simplemente, de una búsqueda inteligente: a partir de las distintas fuentes de las que dispone (memorias de traducción, bases de datos terminológicas, lexicones..), el programa realiza una autobúsqueda y, empleando distintos segmentos, el propio programa es el que propone una traducción, es decir, que es el propio programa el que deduce la traducción del segmento nuevo.

A propósito del deep mining, puede leerse la entrada Deep mining with Déjà Vu X2.

20. Autoensamblaje

Lo contrario al deep mining sería el autoensamblaje: el programa solo introduce los resultados de distintos segmentos, sin deducir ni intuir cuál podría ser la traducción del segmento nuevo (que se diferencia de la autopropagación, ver 13, dado que esta se aplica en el caso de coincidencias totales de segmentos).

21. Principales formatos o extensiones que un traductor debe conocer

Para terminar con esta entrada, me gustaría indicar brevemente las principales extensiones que un traductor que esté trabajando con sistemas de memorias de traducción debe conocer (por ejemplo, a la hora de importar un determinado archivo al proyecto de traducción o al buscar un determinado archivo exportado del proyecto de traducción). No hablo ya del .doc(x) o del .jpg, puesto que doy por hecho que eso ya es de sobra conocido, por lo que pasaré a explicar otros más específicos con los que me he encontrado durante el desarrollo de la asignatura y, especialmente, al utilizar el programa Déjà Vu.

21.1. tmx

Formato estándar para las memorias de traducción que permite que dichas memorias puedan intercambiarse entre distintos programas de memorias de traducción sin que haya problemas de compatibilidad. Es el acrónimo de Translation Memory eXchange.

En el .tmx pueden encontrarse dos tipos de informaciones, etiquetas y contenidos. Las etiquetas dan información y van asociadas a una serie de parámetros y variables, suelen ser dobles (es decir, hay una de apertura, < >, y otra de cierre, </ >) y están escritas en lenguaje html. Los contenidos son toda la información que se encuentra incluida en dichas etiquetas.

Para más información, ver El formato .tmx y el lenguaje html.

Las siguientes extensiones son propias del programa Déjà Vu. Aunque a simple vista parezcan complicadas de reconocer, son muy fáciles de deducir. Como es lógico, solo se pueden abrir con dicho programa.

21.2. dvprj

Esta extensión corresponde al proyecto de traducción de Déjà Vu (dv es Déjà Vu y prj, project). 

21.3. dvmdb

Esta extensión corresponde a la memoria de traducción de Déjà Vu (Déjà Vu Memory DataBase).

21.4. dvmdx

El archivo que tiene esta extensión contiene otro tipo de información, tales como el nombre del proyecto y de los archivos.

21.5. dvmdi

Los archivos que están guardados con esta extensión corresponden a cada una de las lenguas con las que se está trabajando en el proyecto. Así, si se está trabajando con el inglés (como lengua origen, por ejemplo) y con el español (como lengua meta, por ejemplo), habrá dos archivos distintos con dos extensiones distintas, .en.dvmdi (inglés) y .es.dvmdi (español).

21.6. dvtdb

Este formato indica que se trata de una base de datos de terminología de Déjà Vu (Déjà Vu Terminology DataBase). 

Para más información sobre las extensiones mencionadas arriba, ver Déjà Vu X Professional. Guía de introducción al uso y 12 facts, hints and ideas on databases in DVX2.

viernes, 27 de abril de 2012

El sistema de traducción automática de Google Translate cumple seis años

El sistema de traducción automática de Google, Google Translate, lleva ya seis años «derribando las barreras del lenguaje»

Dado que no tengo mucho más que añadir sobre este sistema de traducción (de él hablé en esta entrada y, sobre todo, en esta otra entrada), prefiero reflexionar sobre lo que comentan los miembros del equipo de este sistema de traducción automática(1). Ahora mismo, explican, tenemos todo el conocimiento del mundo «en la yema de los dedos»; sin embargo, ¿qué ocurre si ese contenido está en idiomas que no conocemos? No se trata tanto de conseguir una buena traducción como de poder entender el contenido de determinadas páginas webs, por lo que la mejor opción es recurrir a traductores automáticos y, entre estos traductores, hay que reconocer que Google Translate destaca por su calidad (su situación ha cambiado con respecto a hace unos años, cuando gozaba de peor fama).

En el blog de Google se explica que este servicio comenzó en 2001 con solo unos cuantos idiomas; sin embargo, como acabo de decir, sus resultados eran bastante deficientes, por lo que decidieron incluir más idiomas en el servicio y se dedicaron a investigar más a fondo a propósito de la evaluación de las traducciones informáticas (una explicación más completa del desarrollo de Google Translate la tenéis en el ya citado blog).

Hoy en día, gracias al trabajo empleado en este proyecto (y también a la colaboración desinteresada de un gran número de usuarios; para más información, ver la entrada de El crowd-sourcing), los servicios de Google Translate los utilizan tantas personas que, continúan los miembros del equipo, en un día se traduce una cantidad de texto equivalente a lo que contendrían un millón de libros. Además, añaden, lo que todos los traductores humanos profesionales traducen en un año, el sistema de Google Translate lo traduce en un día. Ahí debo decir en nuestra defensa que la calidad de las traducciones automáticas nunca será igual que la de las traducciones realizadas por traductores humanos; sin embargo, hay que admitir que estos datos no son nada alentadores... Es verdad que ellos mismos no censuran en absoluto la tarea del traductor humano:

Of course, for nuanced or mission-critical translations, nothing beats a human translator—and we believe that as machine translation encourages people to speak their own languages more and carry on more global conversations, translation experts will be more crucial than ever.(2)

Está claro que Google Translate no parará hasta acabar definitivamente con las barreras del lenguaje, puesto que incluso ya puede verse este servicio en el portal de vídeos Youtube...

¿Qué ocurrirá de aquí a seis años?... El tiempo lo dirá.



________________________________
(1)«Breaking down the language barrier―six years in» en Google. Official Blog, accesible en: http://googleblog.blogspot.com.es/2012/04/breaking-down-language-barriersix-years.html [Consulta: 27/IV/2012]
(2)Vid. nota 1.

martes, 24 de abril de 2012

Términos claves de Informática Aplicada a la Traducción (I)


Términos generales e introductorios a la asignatura