✨ EN VIVO☁️ 21°C Quito 28°C Guayaquil
EDICIÓN NACIONAL
Ecuador & El Mundo
Quito • Guayaquil • Cuenca

NVIDIA presenta Nemotron 3 Diarization: modelo abierto para separar ocho voces

Esquema funcional de NVIDIA Nemotron 3 Diarization de 100M
4 min de lectura
  • El modelo cuenta con 100 millones de parámetros y licencia abierta OpenMDW 1.1.
  • Soporta la diferenciación de hasta 8 interlocutores en simultáneo sin retrasos perceptibles.
  • Opera tanto en procesamiento de archivos de audio grabados como en flujos en vivo.
  • Funciona sobre la plataforma NVIDIA NeMo en microarquitecturas de GPU modernas.

La corporación tecnológica NVIDIA lanzó públicamente Nemotron 3 Diarization, un modelo neuronal de pesos abiertos con 100 millones de parámetros (100M) desarrollado para resolver la tarea de diarización de hablantes: identificar con exactitud cronológica quién habla y en qué lapso durante una conversación. La solución fue publicada en la plataforma Hugging Face con licencia que permite su uso comercial e integración directa en entornos de producción.

¿Quieres recibir noticias de última hora en tu celular? Sigue nuestro canal de WhatsApp y agréganos en Google para no perderte las primicias.

En el flujo habitual de transcripción, los sistemas automáticos de reconocimiento de voz (ASR) convierten el sonido en palabras, pero no discriminan qué persona emitió cada frase. Esta carencia dificulta la generación de actas fidedignas en juntas directivas, audiencias jurídicas o centros de soporte al usuario. Nemotron 3 Diarization aporta la capa temporal indispensable para asignar cada intervención a su emisor correspondiente de manera precisa.

Publicidad

Procesamiento de audio multicanal y arquitectura Transformer

La nueva entrega amplía la capacidad del modelo precedente Streaming Sortformer 4spk, elevando el umbral de detección de cuatro a 8 participantes simultáneos. Este salto técnico optimiza el rendimiento en ambientes acústicos desordenados donde coexisten interrupciones, risas y solapamiento de voces sin turnos formales de palabra.

El sistema procesa audio monocanal a 16 kHz en formatos como WAV, FLAC, Opus y MP3, transformando la señal en espectrogramas de Mel con pasos de 10 milisegundos. Dichas matrices se agrupan en bloques de 8 para generar cuadros de codificación de 80 milisegundos, los cuales son analizados por un Transformer de 31 capas que proyecta las probabilidades de voz en marcas temporales discretas.

El marco computacional incorpora algoritmos avanzados de supresión de eco acústico y normalización de volumen dinámico, lo que asegura que las voces más distantes o tenues no queden enmascaradas por intervenciones cercanas al micrófono en salas de conferencias amplias.

Licenciamiento flexible y sinergia con centros de cómputo

Publicado bajo la licencia OpenMDW 1.1, el modelo puede ser adaptado a productos comerciales sin regalías. Su ejecución está optimizada para la suite NeMo de NVIDIA Corporation y se descarga directamente desde Hugging Face, requiriendo procesadores gráficos de las familias Ampere, Ada Lovelace, Hopper o Blackwell.

Este avance fortalece el desarrollo de redes y procesamiento de datos en tiempo real, facultando a desarrolladores de software para implementar analítica de llamadas, transcripción automatizada de conferencias y memoria para agentes de conversación. Siguiendo las directrices del Institute of Electrical and Electronics Engineers (IEEE), el proyecto representa una notable optimización en la eficiencia de inferencia acústica para servidores empresariales.

Integración en ecosistemas corporativos y teleconferencias

La diarización robusta en tiempo real constituye uno de los mayores habilitadores de productividad en la oficina moderna. Plataformas de colaboración virtual, salas de juntas y sistemas de soporte telefónico pueden generar automáticamente minutas detalladas donde cada acuerdo, compromiso o desacuerdo queda debidamente atribuido a la persona que tomó la palabra.

Asimismo, los desarrolladores de agentes conversacionales autónomos pueden utilizar Nemotron 3 Diarization para gestionar interacciones grupales complejas sin confundir a los interlocutores. El bajo requerimiento de parámetros y la velocidad de inferencia aseguran que la herramienta se integre fácilmente en infraestructuras existentes sin elevar de forma desmedida los costos de hardware.

Adicionalmente, la capacidad de procesar tanto grabaciones históricas en lote como flujos de audio en directo convierte a Nemotron 3 Diarization en un estándar de referencia para centros de llamadas y plataformas de teleconferencia. Los equipos de ingeniería pueden implementar el modelo en clústeres locales sobre tarjetas gráficas RTX y centros de datos corporativos, manteniendo la confidencialidad de las comunicaciones internas.

ÚLTIMAS NOTICIAS

Compartir
¡Enlace copiado al portapapeles!
Scroll al inicio
Visita nuestra Red de Medios Aliados: Panorama Ecuador  |  Mundo Tuerca