ia

NVIDIA Nemotron 3: el modelo open-weight que identifica 8 voces en tiempo real y lo que cambia para call centers y podcasters en México

ia · 7 min de lectura

NVIDIA Nemotron 3: el modelo open-weight que identifica 8 voces en tiempo real y lo que cambia para call centers y podcasters en México

NVIDIA lanzó Nemotron 3 Diarization en Hugging Face: 100M parámetros, licencia comercial, #1 en benchmarks y latencia de 320ms. Así impacta a la industria de call centers más grande de LATAM.

NVIDIA Nemotron 3: el modelo open-weight que identifica 8 voces en tiempo real y lo que cambia para call centers y podcasters en México

México es uno de los mayores mercados de call centers en LATAM, con aproximadamente 15% de participación de mercado, siendo Brasil el líder con 30%+ de participación. Miles de grabaciones al día, conversaciones entre agentes y clientes, reuniones de seguimiento, llamadas de soporte. Y hasta hoy, saber quién habló cuándo en esas grabaciones requería pagar servicios de nube como AWS Transcribe o conformarse con soluciones que confunden voces, se pierden con superposiciones y no aguantan más de cuatro hablantes a la vez.

El 23 de septiembre, NVIDIA cambió ese panorama con Nemotron 3 Diarization: un modelo de 100 millones de parámetros, open-weight, con licencia comercial, y ya disponible en Hugging Face.

Qué es la diarización y por qué importa

Diarizar audio es resolver el problema de “quién habló y cuándo.” No es transcribir, no es traducir. Es ponerle etiquetas a cada fragmento de audio: “esto lo dijo el Speaker 0, esto el Speaker 1, aquí hubo traslape”. Suena simple, pero es notoriamente difícil cuando hay ruido de fondo, interrupciones, o varios weyes hablando al mismo tiempo.

La mayoría de las soluciones comerciales manejan 2 a 4 hablantes. Nemotron 3 aguanta hasta 8 simultáneos, con una latencia mínima de 320 ms en su modo ultra-low latency. Para una llamada de call center con agente, supervisor y cliente en conferencia, eso ya es producción real.

Los números que lo ponen en primer lugar

NVIDIA anunció el lanzamiento el 23 de septiembre en Hugging Face bajo licencia OpenMDW 1.1, que sí permite uso comercial. El modelo fue desarrollado sobre la arquitectura Streaming Sortformer con un Transformer de 31 capas y embeddings posicionales rotacionales (RoPE), procesando audio a 16 kHz en frames de 10 ms.

El benchmark que importa es VoiceArena Diarization-Bench, y Nemotron 3 llegó al #1 con un DER de 14.72% (Diarization Error Rate, mientras más bajo mejor). Eso representa aproximadamente 24% menos error que el segundo lugar, y una reducción de 41% relativa respecto al baseline anterior de NVIDIA (Streaming Sortformer v2.1) en la configuración de 1.04 segundos de latencia.

En el dataset AISHELL-4 específicamente: Sortformer v2.1 tenía 27.2% DER, Nemotron 3 lo baja a 9.8%. No es una mejora incremental, es un salto.

Los cuatro perfiles de latencia disponibles son:

ConfiguraciónLatencia del buffer
Ultra-low320 ms
Very low640 ms
Low1.04 s
Offline30.4 s

La diferencia de precisión entre ultra-low y offline es de apenas 1-2 puntos porcentuales de DER. Para aplicaciones en tiempo real eso es clave: no tienes que sacrificar calidad para tener velocidad.

El golpe al bolsillo: lo que cuesta vs AWS Transcribe

Aquí está el ángulo que importa para las startups y los equipos de tech en México.

AWS Transcribe cobra $0.024 por minuto de audio ($1.44/hora). Para un call center que procesa 10,000 horas de audio al mes, eso son $14,400 dólares mensuales solo en transcripción con diarización.

Baseten publicó benchmarks de Nemotron 3 corriendo en producción y el costo del modelo en sí está en el rango de $0.01 por hora de audio, es decir, un centavo. Las mismas 10,000 horas costarían $100. La diferencia es de 144x.

La trampa obvia: AWS te da un servicio administrado, Nemotron 3 requiere infraestructura propia. Necesitas una GPU NVIDIA (Ampere, Ada Lovelace, Hopper o Blackwell), correr Linux, y armar el pipeline. No es para cualquiera.

Pero para empresas medianas que ya tienen presupuesto de infraestructura en la nube, los números justifican el esfuerzo.

Cómo instalarlo y hacer tu primera diarización

El modelo corre sobre el NeMo Framework. La instalación básica:

apt-get update && apt-get install -y libsndfile1 ffmpeg
pip install Cython packaging
pip install 'nemo-toolkit[asr]'

Y el código mínimo para diarizar un archivo:

from nemo.collections.asr.models import SortformerEncLabelModel

diar_model = SortformerEncLabelModel.from_pretrained(
    "nvidia/Nemotron-3-Diarization"
)
diar_model.eval()

predicted_segments = diar_model.diarize(
    audio=["/ruta/a/grabacion.wav"],
    batch_size=1,
)

El output es tipo 0.400 2.100 speaker_0, así que ya sabes exactamente qué fragmento de audio corresponde a quién. Soporta .wav, .flac, .opus y .mp3 siempre que estén en 16 kHz mono.

Para casos de uso más avanzados, el modelo se puede combinar con NVIDIA Parakeet TDT v3 para generar transcripción completa con atribución de hablantes.

Casos de uso reales para México y LATAM

Call centers: México alberga la mayor industria de call centers de LATAM, con operaciones que atienden mercados en todo el continente. El análisis de calidad de llamadas, el cumplimiento de scripts, la detección de momentos de conflicto entre agente y cliente, todo eso depende de saber quién dijo qué. Con un pipeline local puedes procesar el archivo de cada llamada minutos después de que termina, sin enviarlo a servicios externos ni pagar por minuto procesado.

Podcasts: México cuenta con aproximadamente 27.5 millones de usuarios mensuales de podcast en 2026 (según eMarketer y fuentes 2026), y la producción local está creciendo. Cualquier show con dos o más conductores necesita edición con etiquetas de hablante. Automatizarlo con Nemotron 3 es perfectamente viable desde un equipo de producción pequeño con acceso a una GPU RTX.

Startups de LegalTech y MedTech: Transcripción de juntas con múltiples participantes, grabaciones de consultas, actas automáticas. Los sectores regulados que necesitan trazabilidad de quién dijo qué en cada reunión tienen un caso de uso directo aquí.

Educación en línea: Análisis de sesiones grabadas para medir participación por alumno, identificar a quién le cuesta involucrarse, o simplemente generar minutas automáticas de clases en vivo.

Lo que hay que considerar antes de montarlo en producción

Hay tres limitaciones reales que no conviene ignorar:

  1. Solo Linux: El modelo no corre en Windows todavía. Para equipos que operan en infraestructura Windows, el camino pasa por WSL2 o máquinas virtuales.

  2. Requiere GPU NVIDIA: Ampere mínimo. Si tu startup corre en instancias de CPU solamente, hay que revisar los costos de agregar una GPU al stack.

  3. Solo diarización, no ASR: Nemotron 3 te dice quién habló cuándo, pero no lo que dijo. Para el texto necesitas conectarlo con un modelo de transcripción aparte (Parakeet, Whisper, etc.). Como mencionamos en nuestro análisis de los modelos de IA de Microsoft que superan a Whisper, el ecosistema de ASR open-source está madurando muy rápido, así que esto es más oportunidad que limitación.

El modelo está entrenado sobre 21 idiomas, lo que incluye español. NVIDIA no especifica si tiene datos suficientes de español mexicano para capturar modismos de velocidad y pronunciación regional, pero los primeros reportes de la comunidad en benchmarks multilingüe son positivos.

Vale la pena mencionar que, con el ecosistema de chips evolucionando, incluso startups que antes no podían costear GPUs propias están reconsiderando ese cálculo. Flex trajo mil millones de dólares a México para fabricar hardware de IA, y el acceso local a infraestructura de cómputo para IA está mejorando.

Veredicto rápido

Si tienes una GPU NVIDIA y un caso de uso que procesa más de 1,000 horas de audio al mes, Nemotron 3 Diarization tiene el potencial de ahorrarte una cantidad obscena de dinero comparado con servicios de pago. Si estás arrancando con un proyecto pequeño o no tienes infraestructura GPU, servicios como AWS Transcribe o AssemblyAI siguen siendo la ruta más rápida para validar el producto.

Lo importante es que ahora existe una alternativa open-weight de primera clase que en benchmarks supera a todo lo que había antes, con licencia comercial y documentación real. En el ecosistema de IA en español, eso es una chimba.

Eso ya es meterlo en la operación de un negocio

Fuentes

Comentarios

No te pierdas ningún post

Recibe lo nuevo de Al Chile Tech directo en tu correo. Sin spam.

También te puede interesar