Xiaomi lanza un modelo de reconocimiento de voz industrial: Xiaomi-CocktailASR-1

Xiaomi ha lanzado oficialmente y ha hecho open source el modelo de reconocimiento de voz de orador objetivo de grado industrial Xiaomi-CocktailASR-1, el cual fue anunciado el 11 de septiembre. Según la información publicada en la cuenta oficial de Weibo de Xiaomi, este modelo está diseñado específicamente para escenarios de voz compleja donde varias personas hablan al mismo tiempo, enfocándose en resolver el problema del «cocktail party» en el reconocimiento de voz, es decir, identificar y transcribir el contenido de voz del usuario objetivo entre múltiples hablantes en un entorno ruidoso.

Según Xiaomi, el Xiaomi-CocktailASR-1 utiliza una arquitectura LLM de extremo a extremo, aprovechando un segmento de audio de referencia del orador objetivo como una huella de voz. En situaciones de discursos superpuestos, puede extraer y transcribir únicamente el contenido del orador objetivo. La compañía señala que este modelo ha sido entrenado con grandes volúmenes de datos de múltiples hablantes y ha alcanzado el mejor rendimiento en varios conjuntos de pruebas de múltiples hablantes como AliMeeting, AMI y LibriMix.

Xiaomi-CocktailASR-1 cuenta con capacidad de reconocimiento de voz de múltiples hablantes

Al mismo tiempo, su rendimiento de reconocimiento en escenarios de un solo hablante también puede compararse con los modelos ASR de un solo hablante más populares, siendo capaz de manejar tanto escenarios de un solo hablante como de múltiples hablantes sin necesidad de cambiar entre diferentes modelos de reconocimiento de voz. Además, este modelo también tiene la capacidad de rechazar muestras negativas; en situaciones donde no hay un orador objetivo en el audio, el modelo puede generar texto vacío para reducir el riesgo de errores de reconocimiento y activaciones incorrectas causadas por voces no objetivo.

Xiaomi también mencionó que el Xiaomi-CocktailASR-1 soporta un modo de razonamiento de cadena de pensamiento, lo que permite proporcionar un proceso de razonamiento explicable para los resultados de reconocimiento. Actualmente, los pesos del modelo y el código de inferencia de Xiaomi-CocktailASR-1 ya están disponibles como open source.

Contenido original
Este artículo es la versión en español de un contenido original de TechRitual.
Stein Yep
Stein Yep