Biometría de voz

Identificar a una persona por las características de su voz. Cómo se construye una huella vocal, qué la degrada, qué la ataca y qué controles necesita alrededor.

En síntesis

La biometría de voz es el conjunto de técnicas que identifican o verifican a una persona a partir de las características medibles de su voz. Un modelo procesa un fragmento de audio, extrae rasgos que dependen de la anatomía del tracto vocal y de la forma de hablar de esa persona, y los convierte en una plantilla biométrica.

Lo que se compara no es el contenido de lo que se dijo. Es cómo suena quien lo dijo.

Cómo se construye una huella vocal

El proceso tiene dos momentos separados en el tiempo, y la calidad del primero condiciona todo lo demás.

  • Registro — la persona proporciona una o varias muestras de audio, de las que el sistema deriva la plantilla de referencia. Un registro hecho con ruido, con un canal de mala calidad o con muy poco audio produce una referencia pobre que después arrastra errores.
  • Verificación — en cada intento posterior, el sistema captura una nueva muestra, genera su plantilla y la compara contra la de referencia. El resultado es una medida de similitud contrastada contra un umbral, igual que en biometría facial.

Los rasgos que se miden no son la altura ni el volumen percibidos, sino propiedades del espectro del sonido derivadas de la anatomía de quien habla y de sus hábitos articulatorios. Es lo que hace que dos personas que "suenan parecido" para un oído humano no necesariamente se parezcan para el modelo.

El modo dependiente y el independiente del texto resuelven casos distintos

Es la decisión de diseño que más cambia la experiencia del usuario y el nivel de exigencia del sistema.

  • Dependiente del texto — la persona pronuncia una frase determinada, la misma del registro o una que el sistema le indica. La comparación es más acotada y suele necesitar menos audio, a cambio de un paso explícito.
  • Independiente del texto — el sistema verifica sobre habla natural, sin frase fija. Sirve para validar durante una conversación en curso, y en general requiere más audio para llegar a la misma confianza.

El modo dependiente aparece en accesos y confirmaciones. El independiente aparece en canales telefónicos, donde la verificación ocurre mientras la persona explica lo que necesita.

Qué degrada una voz y qué la ataca

Conviene separar los dos problemas, porque uno es de calidad y el otro es de intención, y no se resuelven con lo mismo.

Lo que la degrada sin que haya nadie atacando: ruido de fondo, compresión del canal, un micrófono distinto al del registro, una llamada de mala calidad. También la propia persona: un resfrío, el cansancio, el paso de los años. Una voz cambia más que un rostro y bastante más que una huella, y por eso los sistemas de voz suelen necesitar políticas de re-registro que otras modalidades no necesitan.

Lo que la ataca, con intención:

  • Reproducción — el atacante graba a la persona y reproduce el audio frente al micrófono. Es el equivalente de mostrarle una fotografía a la cámara.
  • Síntesis y clonación — un modelo genera una voz que imita a la persona a partir de muestras suyas, que hoy se consiguen de una llamada, un video público o una nota de audio. Es la variante de voz del mismo fenómeno que produce un deepfake de rostro.
  • Inyección — el audio no pasa por el micrófono: se introduce en el flujo antes de llegar a la aplicación. Es el mismo problema de capa que un ataque de inyección de video.

Los dos primeros son ataques de presentación y se cubren con PAD sobre la modalidad de voz. El tercero es otra cosa, y necesita verificar el origen del flujo y la integridad del entorno.

Qué controles necesita alrededor

Una comparación de voz sola responde una pregunta parcial, igual que una comparación de rostros sola.

  • Detección de ataques de presentación para voz — distingue una voz emitida por una persona presente de una reproducida o generada. Es el control equivalente a la prueba de vida facial, ensayado sobre otra modalidad.
  • Umbrales explícitos — el error se configura, y sus dos formas son FMR y FNMR. En un canal telefónico con audio variable, un umbral pensado para condiciones de laboratorio rechaza usuarios legítimos todo el día.
  • Un segundo factor cuando la operación lo justifica — la voz sirve bien como uno de los factores de una autenticación, y peor como el único, sobre todo en canales donde el audio llega comprimido.

Una certificación de prueba de vida facial no dice nada sobre un sistema de voz. Cada modalidad se ensaya por separado, y un informe de ensayo declara sobre qué modalidad se hizo.

Preguntas frecuentes

Es el conjunto de técnicas que identifican o verifican a una persona a partir de las características medibles de su voz. Un modelo procesa un fragmento de audio, extrae rasgos derivados de la anatomía del tracto vocal y de la forma de hablar, y los convierte en una plantilla biométrica que se compara contra una de referencia. Lo que se compara es cómo suena quien habla, no lo que dice.

En la dependiente del texto, la persona pronuncia una frase determinada: la comparación es más acotada y suele requerir menos audio, a cambio de un paso explícito para el usuario. En la independiente del texto, el sistema verifica sobre habla natural, sin frase fija, lo que sirve para validar durante una conversación en curso y en general requiere más audio para alcanzar la misma confianza.

Es el ataque que la modalidad tiene que resolver, y por eso una comparación de voz sola no alcanza. Un modelo puede generar una voz que imita a una persona a partir de muestras públicas, y la comparación biométrica responde por el parecido, no por la procedencia. El control que corresponde es la detección de ataques de presentación sobre la modalidad de voz, que distingue una voz emitida por alguien presente de una reproducida o generada. La inyección de audio, donde el sonido nunca pasa por el micrófono, es un problema distinto y se cubre aparte.

Casi siempre por condiciones, no por un ataque. Ruido de fondo, compresión del canal, un micrófono distinto al del registro o una llamada de mala calidad mueven la muestra lo suficiente como para caer por debajo del umbral. También la persona cambia: un resfrío, el cansancio o el paso del tiempo alteran la voz más de lo que alteran un rostro. Es la razón por la que los sistemas de voz necesitan políticas de re-registro que otras modalidades no necesitan.

Una sola identidad, un solo SDK

VU ONE unifica verificación, autenticación y protección contra el fraude sobre un mismo grafo de identidad.

La verificación que hacés en el alta queda disponible para la autenticación y las reglas de fraude, sin repetir procesos ni duplicar datos.

Verifica, Autentica y Protege, consolidado en un solo lugar.

Solicita una demo