Agentes de voz bilingües: por qué priorizar el español es más difícil de lo que cree
Serví siete años en la Fuerza Aérea de los EE. UU. como Lingüista de Español para la Agencia de Inteligencia de Defensa antes de ir a la facultad de derecho. He practicado el derecho de inmigración bilingüe durante más de una década. Y aun así subestimé lo difícil que sería implementar un agente de voz de IA que manejara a las personas que llaman en español tan bien como a las que llaman en inglés. Esta publicación es lo que me hubiera gustado que alguien me dijera antes de empezar: las cosas que parecen obvias en retrospectiva, los modos de fallo que solo aparecen en producción y las decisiones arquitectónicas que resultaron ser realmente importantes.
El estándar que la mayoría de los proveedores ofrecen
Cuando evalúa un producto de voz de IA bilingüe, generalmente obtiene una de dos cosas. Algunos proveedores ofrecen una 'opción en español' que en realidad es una rama de enrutamiento separada: la persona que llama escucha 'presione 2 para español', un agente diferente atiende y no hay un contexto compartido. Otros ejecutan el mismo prompt del agente traducido mediante traducción automática en tiempo de ejecución. La segunda opción es peor: obtiene un agente que suena como Google Translate leído en voz alta, con modismos y un tono que señalan 'esto no es realmente para usted' a los hablantes nativos.
Ninguno de los enfoques maneja la realidad de las bases de personas que llaman bilingües, que es que las personas que llaman cambian de código (code-switch). Comienzan en inglés, pasan al español para una frase que es más fácil de decir en español, y luego vuelven. Dan un nombre en español y una dirección en inglés. Esperan que el agente los siga sin problemas. La mayoría de los productos no lo hacen.
Lo que construimos en su lugar
Hicimos del idioma una propiedad del estado del agente, no una decisión de enrutamiento. El mismo agente responde a cada llamada. Escucha la primera intervención de la persona que llama, detecta el idioma con un modelo y continúa en ese idioma: las personas que llaman solo en español obtienen toda la llamada en español, las que llaman solo en inglés obtienen toda la llamada en inglés, y las que cambian de código (code-switchers) obtienen un agente que sigue su iniciativa. Cuando la persona que llama cambia de idioma a mitad de la llamada, el agente no se reinicia ni se disculpa; simplemente continúa en el nuevo idioma.
Los prompts en español no son traducciones. Fueron escritos en español desde cero, con las preguntas de calificación formuladas de la manera en que yo las formularía en persona a un cliente de habla hispana en nuestra oficina de Charlotte u Orlando. El árbol de decisión de admisión es el mismo; la redacción, el registro y el flujo idiomático son nativos.
- ✓Mismo agente, mismo contexto, ambos idiomas — sin ramas de enrutamiento
- ✓Prompts en español escritos en español, no traducidos del inglés
- ✓La detección de idioma se ejecuta en cada turno, por lo que el cambio de código se maneja con fluidez
- ✓TTS utiliza voces neuronales nativas en español ajustadas por acento regional
- ✓Los modelos de reconocimiento cubren el español caribeño, mexicano, centroamericano y andino
Los problemas difíciles
El reconocimiento de español es más difícil que el reconocimiento de inglés por una razón específica: la variación del acento regional es mucho más amplia en español que en el inglés de EE. UU. Un hablante nativo cubano, un hablante nativo mexicano y un hablante nativo argentino tienen patrones fonéticos notablemente diferentes, y un modelo entrenado principalmente en español mexicano reconocerá erróneamente a las personas que llaman del Caribe de maneras sutiles pero que anulan la conversión. Pasamos 3 semanas ajustando el reconocimiento para nuestra mezcla de mercado específica (Charlotte, Orlando, PR), que es predominantemente mexicana, cubana, puertorriqueña y centroamericana. Los modelos de propósito general eran casi lo suficientemente buenos; la brecha estaba en nombres, direcciones y números de formularios de inmigración.
Los nombres y sustantivos propios son donde la mayoría de los sistemas STT multilingües fallan silenciosamente. 'Joaquín García' no es un nombre difícil para un hispanohablante; es una secuencia de tokens difícil para un reconocedor entrenado principalmente en inglés. Nuestra base de personas que llaman está llena de sustantivos propios en español. El reconocedor transcribiría 'Joaquín' como 'Walk-in' o 'Hawking' en las primeras llamadas. Agregamos una capa de sesgo de vocabulario personalizado con los 5,000 nombres y apellidos hispanos más comunes, además de los términos relevantes para el área de práctica (números de formularios de USCIS, nombres de programas de inmigración, términos legales en español). La precisión del reconocimiento de nombres saltó de aproximadamente el 70% a más del 95% en muestras de llamadas reales.
Contexto cultural relevante en la admisión legal
La admisión bilingüe en bufetes de abogados tiene patrones culturales en los que un ingeniero de IA angloparlante no necesariamente pensaría. Algunos ejemplos que surgieron durante el ajuste: la toma de decisiones en familia extendida es común — la persona que llama a menudo no es la persona que finalmente contratará. El agente debe capturar tanto 'por quién llamo' como 'en nombre de quién llamo' como entidades distintas. Los hogares de estatus mixto — un hijo ciudadano, un cónyuge residente permanente, un hermano indocumentado — son normales en nuestra base de personas que llaman, y el flujo de admisión debe manejar el asunto de manera limpia sin obligar a la persona que llama a revelar el estatus de un miembro de la familia si no es necesario para el asunto específico.
Lo contrario también es cierto. A veces, la persona que llama asume que el agente sabe cosas que un sistema de admisión angloparlante tendría que preguntar. 'Mi residencia se vence' es una descripción lo suficientemente completa para que un abogado de inmigración sepa de qué trata la conversación; el agente no debería perder cinco turnos haciendo preguntas aclaratorias cuando la persona que llama ya le ha dicho el tipo de asunto.
Calidad de voz y confianza
Probamos cuatro voces neuronales en español en producción. Las diferencias en el comportamiento de las personas que llaman no fueron sutiles. Las voces que sonaban nativas y cálidas obtuvieron duraciones de llamada más largas y tasas de conversión de consulta más altas que las voces que sonaban técnicamente en español pero leídas con entonación de patrón inglés. Ahora estamos utilizando una única voz en español ajustada para nuestro mercado que hemos probado con A/B durante 90 días. La voz en inglés es una selección separada, elegida por una calidez similar en inglés. Las dos voces no suenan igual, y eso está bien. Las personas que llaman no esperan que lo hagan.
Lo que haríamos diferente si empezáramos hoy
Dos cosas. Primero: invertir en el sesgo de vocabulario personalizado desde el primer día, no después del primer mes de llamadas en producción. Los nombres y números de formularios eran predecibles; deberíamos haberlos sesgado antes del lanzamiento. Segundo: escribir los prompts en español antes de escribir los prompts en inglés. Lo hicimos al revés y terminamos reescribiendo los prompts en español para que coincidieran con la lógica en inglés, lo que llevó a que se colaran traducciones. Empezar en el idioma primario bilingüe y traducir al inglés es una mejor disciplina.





