FLUX 3 ya existe: la IA de Black Forest Labs que genera imagen, video y audio desde un solo prompt y que los creativos en México deben conocer
Black Forest Labs lanzó FLUX 3 el 23 de julio: el primer modelo open-weight que genera video de 20 segundos, imagen y audio nativo desde una sola arquitectura. Precios, acceso y por qué esto cambia el juego para creadores en México.
Si FLUX.1 te rompió la cabeza cuando apareció, prepárate para lo que sigue: el 23 de julio de 2026, Black Forest Labs lanzó FLUX 3 y ya no estamos hablando solo de imágenes. Estamos hablando de video de hasta 20 segundos con audio sincronizado, generado desde un solo prompt, todo dentro de un único modelo. No es una suite de herramientas pegadas con cinta. Es una arquitectura entrenada de forma conjunta en imagen, video y audio al mismo tiempo. Eso tiene más implicaciones de lo que parece a primera vista.
Qué es FLUX 3 y por qué es diferente a todo lo demás
La mayoría de herramientas de IA generativa que conoces trabajan en capas: tienes tu modelo de imagen por un lado, tu modelo de video por otro, el audio lo metes con otra herramienta encima. Son pipelines donde cada pieza hace su parte y luego las ensamblas manualmente.
FLUX 3 no. Black Forest Labs entrenó un solo modelo en los tres dominios al mismo tiempo, usando su método propio llamado Self-Flow. La lógica es simple pero poderosa: las imágenes te dan estructura espacial, el video te da movimiento y física real, el audio revela relaciones causales entre eventos y sonido. Entrenar los tres juntos hace que el modelo entienda el mundo de forma más coherente que cualquiera de ellos por separado.
El resultado concreto: cuando generas un video, el audio no se pega encima en postproceso. Nace junto al video, sincronizado con lo que pasa en pantalla, incluyendo diálogo, efectos de sonido y sonido ambiental. Todo desde el mismo peso del modelo.
Y esto no es tan distinto en filosofía a lo que vimos con Muse Spark de Meta integrándose directo en WhatsApp: la tendencia es clara, los modelos de próxima generación van unificando modalidades en lugar de apilarlas.
Qué puede hacer concretamente
Estas son las capacidades verificadas desde el lanzamiento:
Video:
- Text-to-video e image-to-video hasta 20 segundos en una sola generación
- Video-to-video manteniendo elementos clave de referencia
- Keyframe-to-video para transiciones controladas
- Multi-clip sequencing para contenido más largo encadenando clips
Audio nativo (sin costo extra):
- Diálogo multilingüe sincronizado: sí, en español
- Síntesis de voz y speech generation
- Efectos de sonido
- Sonido ambiental y ambiente contextual
Imagen:
- Síntesis y edición en múltiples estilos y resoluciones
- Texto legible en imágenes con mejor manejo que versiones anteriores
- Comprensión semántica de prompts complejos
Resolución:
- HD: hasta 1 megapíxel por frame
- FHD: hasta 2 megapíxeles por frame
Y hay una cuarta modalidad que no es para creadores pero está una chimba: predicción de acciones robóticas. FLUX-mimic, construido sobre FLUX 3, ya corre en líneas de producción de Audi en menos de 80ms por acción usando una RTX 5090. BFL se metió a robótica industrial. Pero eso es otra historia.
Los benchmarks: números buenos, con un asterisco grande
BFL publicó sus propias evaluaciones de preferencia donde FLUX 3 sale ganando:
| Competidor | Preferencia FLUX 3 |
|---|---|
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Grok Imagine Video | 69% |
| Seedance 2.0 | ~52% (paridad) |
| Gemini Omni Flash | ~52% (paridad) |
La neta: estas métricas las condujo el mismo fabricante, no son benchmarks independientes. Hay que tomarlas con sal. Pero los números en las comparaciones más directas con Luma y Runway son bastante contundentes para ser autoevaluación, y los puntos fuertes que resaltan en pruebas preliminares son expresiones faciales humanas y sincronización entre audio y eventos físicos en pantalla, que históricamente han sido los puntos débiles de todo el sector.
Cuando salgan reviews independientes vamos a saber cuánto es sustancia real y cuánto es marketing.
Cuánto cuesta y cómo acceder
Aquí viene la parte que le interesa a todos. FLUX 3 Video ya está disponible vía API y en el dashboard de BFL en modalidad pay-as-you-go para los que consigan acceso. Los precios confirmados desde la página oficial:
| Modalidad | Draft HD | Standard HD | Standard FHD |
|---|---|---|---|
| Text/imagen a video | $0.06/seg | $0.17/seg | $0.29/seg |
| Video a video | $0.12/seg | $0.41/seg | $0.53/seg |
Un video de 20 segundos en Standard HD te cuesta $3.40 USD. En FHD, $5.80 USD. No es barato si vas a generar volumen, pero está en rango competitivo con Runway Gen-4.5 y Luma Ray. El Draft HD a $0.06/seg es la jugada inteligente para pre-visualizar antes de gastar en calidad full.
FLUX 3 Video alcanzó general availability el 4 de agosto de 2026. Ya no está en acceso gated: cualquiera puede acceder a través de la API de BFL y plataformas asociadas sin necesidad de aplicar para aprobación.
Roadmap confirmado de acceso:
- FLUX 3 Video: en general availability desde el 4 de agosto de 2026
- FLUX 3 Image: “en las próximas semanas” según BFL
- FLUX 3 Dev, el open-weight: a finales de 2026
El open-weight es lo que más importa para México
El FLUX 3 Dev, la versión de pesos abiertos planeada para finales de 2026, es el movimiento que puede tener el mayor impacto para los devs y creadores en LATAM. Según BFL, será el primer modelo open-weight disponible públicamente que genera video, audio e imagen de forma conjunta desde una sola arquitectura.
Eso significa: correr localmente, sin pagar API, sin depender de que una empresa te cambie los precios o cierre el acceso. Para quien no tiene el presupuesto de un estudio en San Francisco, eso vale mucho.
La tendencia que ya vimos con Gemma 4 de Google corriendo offline en celular va llegando ahora a la generación audiovisual. FLUX 3 Dev puede ser el punto de quiebre para que cualquier dev en México monte una pipeline de producción de video sin depender de APIs caras.
Por qué los creativos en México deberían estar atentos ahora
Imagen más video más audio en un solo modelo elimina un paso enorme del flujo de trabajo creativo. Si produces para YouTube, TikTok, publicidad digital o marketing de marca, el tiempo que gastas coordinando herramientas distintas para visual y audio se reduce de forma significativa.
El soporte multilingüe nativo tiene valor real para el mercado de habla española: puedes generar video con voz sincronizada en español sin herramientas de doblaje externas.
Eso sí, hay que ver el cuadro completo. Como ya documentamos cuando salió el reporte de 80,000 empleos tech al basurero en Q1 2026, no hay que romantizar la tecnología sin ver las consecuencias para quienes trabajan en producción audiovisual de forma profesional. Un modelo que genera 20 segundos de video con audio por menos de $4 dólares cambia el mercado para los productores de contenido pequeño, pero también comprime los márgenes de quien hace ese trabajo de forma manual.
Veredicto al chile
FLUX 3 no es hype de laboratorio. El concepto de arquitectura unificada multimodal tiene fundamentos técnicos sólidos en Self-Flow, el pricing está en rango competitivo, y BFL tiene track record real: FLUX.1 y FLUX 2 generaron adopción masiva en la comunidad de diseñadores y devs. El open-weight a finales de año es el movimiento con más potencial para México y LATAM.
Lo malo: acceso gated sin fecha de apertura general. Si necesitas algo disponible hoy mismo, Runway Gen-4.5 o Luma Ray 3.2 son opciones reales. Si puedes esperar unos meses, FLUX 3 Dev open-weight puede ser el modelo que cambie tu flujo de trabajo de producción audiovisual de forma permanente.
Mete tu solicitud en bfl.ai y monitorea. Cuando abran el acceso, no va a quedarse quieto.
Fuentes
Comentarios
No te pierdas ningún post
Recibe lo nuevo de Al Chile Tech directo en tu correo. Sin spam.
También te puede interesar
Google falló su TERCER deadline con Gemini 3.5 Pro y se evaporaron $225,000 millones: la crisis interna de DeepMind explicada al chile
En una semana se fueron cuatro investigadores clave de DeepMind: el co-autor del Transformer a OpenAI y el Nobel de Química a Anthropic. Mientras tanto, Gemini 3.5 Pro lleva tres fechas de lanzamiento incumplidas y Google tuvo que empezar el pre-entrenamiento desde cero.
Sora ya fue: los 10 modelos de video IA que sobrevivieron y cuál te conviene según tu presupuesto en México
OpenAI apagó Sora y el mercado no paró. Aquí está la guía definitiva de los 10 mejores generadores de video IA en 2026, con precios en pesos y recomendación según tu caso de uso.
El reporte de IA más importante de 2026 acaba de salir: 12 datos del Stanford AI Index que todo dev y empresa en México debe leer
Stanford HAI publicó el AI Index 2026 y los números están locos: $581 mil millones de inversión, adopción más rápida que el internet, y una brecha entre EE.UU. y China que casi desaparece. Aquí te lo traducimos al español que importa.