NVIDIA Nemotron 3: el modelo open-weight que identifica 8 voces en tiempo real y lo que cambia para call centers y podcasters en México
NVIDIA lanzó Nemotron 3 Diarization en Hugging Face: 100M parámetros, licencia comercial, #1 en benchmarks y latencia de 320ms. Así impacta a la industria de call centers más grande de LATAM.
México es uno de los mayores mercados de call centers en LATAM, con aproximadamente 15% de participación de mercado, siendo Brasil el líder con 30%+ de participación. Miles de grabaciones al día, conversaciones entre agentes y clientes, reuniones de seguimiento, llamadas de soporte. Y hasta hoy, saber quién habló cuándo en esas grabaciones requería pagar servicios de nube como AWS Transcribe o conformarse con soluciones que confunden voces, se pierden con superposiciones y no aguantan más de cuatro hablantes a la vez.
El 23 de septiembre, NVIDIA cambió ese panorama con Nemotron 3 Diarization: un modelo de 100 millones de parámetros, open-weight, con licencia comercial, y ya disponible en Hugging Face.
Qué es la diarización y por qué importa
Diarizar audio es resolver el problema de “quién habló y cuándo.” No es transcribir, no es traducir. Es ponerle etiquetas a cada fragmento de audio: “esto lo dijo el Speaker 0, esto el Speaker 1, aquí hubo traslape”. Suena simple, pero es notoriamente difícil cuando hay ruido de fondo, interrupciones, o varios weyes hablando al mismo tiempo.
La mayoría de las soluciones comerciales manejan 2 a 4 hablantes. Nemotron 3 aguanta hasta 8 simultáneos, con una latencia mínima de 320 ms en su modo ultra-low latency. Para una llamada de call center con agente, supervisor y cliente en conferencia, eso ya es producción real.
Los números que lo ponen en primer lugar
NVIDIA anunció el lanzamiento el 23 de septiembre en Hugging Face bajo licencia OpenMDW 1.1, que sí permite uso comercial. El modelo fue desarrollado sobre la arquitectura Streaming Sortformer con un Transformer de 31 capas y embeddings posicionales rotacionales (RoPE), procesando audio a 16 kHz en frames de 10 ms.
El benchmark que importa es VoiceArena Diarization-Bench, y Nemotron 3 llegó al #1 con un DER de 14.72% (Diarization Error Rate, mientras más bajo mejor). Eso representa aproximadamente 24% menos error que el segundo lugar, y una reducción de 41% relativa respecto al baseline anterior de NVIDIA (Streaming Sortformer v2.1) en la configuración de 1.04 segundos de latencia.
En el dataset AISHELL-4 específicamente: Sortformer v2.1 tenía 27.2% DER, Nemotron 3 lo baja a 9.8%. No es una mejora incremental, es un salto.
Los cuatro perfiles de latencia disponibles son:
| Configuración | Latencia del buffer |
|---|---|
| Ultra-low | 320 ms |
| Very low | 640 ms |
| Low | 1.04 s |
| Offline | 30.4 s |
La diferencia de precisión entre ultra-low y offline es de apenas 1-2 puntos porcentuales de DER. Para aplicaciones en tiempo real eso es clave: no tienes que sacrificar calidad para tener velocidad.
El golpe al bolsillo: lo que cuesta vs AWS Transcribe
Aquí está el ángulo que importa para las startups y los equipos de tech en México.
AWS Transcribe cobra $0.024 por minuto de audio ($1.44/hora). Para un call center que procesa 10,000 horas de audio al mes, eso son $14,400 dólares mensuales solo en transcripción con diarización.
Baseten publicó benchmarks de Nemotron 3 corriendo en producción y el costo del modelo en sí está en el rango de $0.01 por hora de audio, es decir, un centavo. Las mismas 10,000 horas costarían $100. La diferencia es de 144x.
La trampa obvia: AWS te da un servicio administrado, Nemotron 3 requiere infraestructura propia. Necesitas una GPU NVIDIA (Ampere, Ada Lovelace, Hopper o Blackwell), correr Linux, y armar el pipeline. No es para cualquiera.
Pero para empresas medianas que ya tienen presupuesto de infraestructura en la nube, los números justifican el esfuerzo.
Cómo instalarlo y hacer tu primera diarización
El modelo corre sobre el NeMo Framework. La instalación básica:
apt-get update && apt-get install -y libsndfile1 ffmpeg
pip install Cython packaging
pip install 'nemo-toolkit[asr]'
Y el código mínimo para diarizar un archivo:
from nemo.collections.asr.models import SortformerEncLabelModel
diar_model = SortformerEncLabelModel.from_pretrained(
"nvidia/Nemotron-3-Diarization"
)
diar_model.eval()
predicted_segments = diar_model.diarize(
audio=["/ruta/a/grabacion.wav"],
batch_size=1,
)
El output es tipo 0.400 2.100 speaker_0, así que ya sabes exactamente qué fragmento de audio corresponde a quién. Soporta .wav, .flac, .opus y .mp3 siempre que estén en 16 kHz mono.
Para casos de uso más avanzados, el modelo se puede combinar con NVIDIA Parakeet TDT v3 para generar transcripción completa con atribución de hablantes.
Casos de uso reales para México y LATAM
Call centers: México alberga la mayor industria de call centers de LATAM, con operaciones que atienden mercados en todo el continente. El análisis de calidad de llamadas, el cumplimiento de scripts, la detección de momentos de conflicto entre agente y cliente, todo eso depende de saber quién dijo qué. Con un pipeline local puedes procesar el archivo de cada llamada minutos después de que termina, sin enviarlo a servicios externos ni pagar por minuto procesado.
Podcasts: México cuenta con aproximadamente 27.5 millones de usuarios mensuales de podcast en 2026 (según eMarketer y fuentes 2026), y la producción local está creciendo. Cualquier show con dos o más conductores necesita edición con etiquetas de hablante. Automatizarlo con Nemotron 3 es perfectamente viable desde un equipo de producción pequeño con acceso a una GPU RTX.
Startups de LegalTech y MedTech: Transcripción de juntas con múltiples participantes, grabaciones de consultas, actas automáticas. Los sectores regulados que necesitan trazabilidad de quién dijo qué en cada reunión tienen un caso de uso directo aquí.
Educación en línea: Análisis de sesiones grabadas para medir participación por alumno, identificar a quién le cuesta involucrarse, o simplemente generar minutas automáticas de clases en vivo.
Lo que hay que considerar antes de montarlo en producción
Hay tres limitaciones reales que no conviene ignorar:
-
Solo Linux: El modelo no corre en Windows todavía. Para equipos que operan en infraestructura Windows, el camino pasa por WSL2 o máquinas virtuales.
-
Requiere GPU NVIDIA: Ampere mínimo. Si tu startup corre en instancias de CPU solamente, hay que revisar los costos de agregar una GPU al stack.
-
Solo diarización, no ASR: Nemotron 3 te dice quién habló cuándo, pero no lo que dijo. Para el texto necesitas conectarlo con un modelo de transcripción aparte (Parakeet, Whisper, etc.). Como mencionamos en nuestro análisis de los modelos de IA de Microsoft que superan a Whisper, el ecosistema de ASR open-source está madurando muy rápido, así que esto es más oportunidad que limitación.
El modelo está entrenado sobre 21 idiomas, lo que incluye español. NVIDIA no especifica si tiene datos suficientes de español mexicano para capturar modismos de velocidad y pronunciación regional, pero los primeros reportes de la comunidad en benchmarks multilingüe son positivos.
Vale la pena mencionar que, con el ecosistema de chips evolucionando, incluso startups que antes no podían costear GPUs propias están reconsiderando ese cálculo. Flex trajo mil millones de dólares a México para fabricar hardware de IA, y el acceso local a infraestructura de cómputo para IA está mejorando.
Veredicto rápido
Si tienes una GPU NVIDIA y un caso de uso que procesa más de 1,000 horas de audio al mes, Nemotron 3 Diarization tiene el potencial de ahorrarte una cantidad obscena de dinero comparado con servicios de pago. Si estás arrancando con un proyecto pequeño o no tienes infraestructura GPU, servicios como AWS Transcribe o AssemblyAI siguen siendo la ruta más rápida para validar el producto.
Lo importante es que ahora existe una alternativa open-weight de primera clase que en benchmarks supera a todo lo que había antes, con licencia comercial y documentación real. En el ecosistema de IA en español, eso es una chimba.
Eso ya es meterlo en la operación de un negocio
Fuentes
- NVIDIA Nemotron 3 Diarization en Hugging Face
- Blog oficial de NVIDIA sobre Nemotron 3 Diarization
- Baseten: NVIDIA Nemotron 3 Diarization, real-time speaker labels at a cent per audio hour
- MarkTechPost: NVIDIA Releases Nemotron 3 Diarization
- Unite.AI: NVIDIA Releases Nemotron 3 Diarization Open-Weight Speaker Model
- Amazon Transcribe Pricing Calculator (Sep 2026)
- Podcasts en México: datos, audiencia y crecimiento 2026
Comentarios
No te pierdas ningún post
Recibe lo nuevo de Al Chile Tech directo en tu correo. Sin spam.
También te puede interesar
Nvidia, Microsoft e IBM forman la alianza de seguridad IA más grande del mundo: y no invitaron a OpenAI, Anthropic ni Google
La Open Secure AI Alliance lanzó el 27 de julio con 40+ empresas para defender sistemas IA con herramientas open source. El catalizador: el hackeo autónomo de GPT-5.6 Sol a Hugging Face.
AMD compra a Fei-Fei Li por $8,200 millones: la 'madre de la IA' ahora trabaja para el rival de Nvidia
AMD adquirió World Labs de Fei-Fei Li en deal todo-acciones de $8,200 millones. La creadora de ImageNet se convierte en Chief Scientist de AMD y cambia qué chips compran los data centers en México y LATAM.
China le declara la guerra a NVIDIA: el Zhenwu V900 de Alibaba es el chip de IA más poderoso del país y esto cambia todo para las empresas en LATAM
T-Head presentó el Zhenwu V900 con 216GB de memoria, 3x más rendimiento que su predecesor y soporte para clusters de 500,000 chips. Con producción masiva en Q1 2027 y un modelo de 10 billones de parámetros en entrenamiento, Alibaba Cloud ya tiene data center en Querétaro.