Modelos / SEÑAL VERIFICADA

MiniMax H3 abre sus parámetros: video 2K con audio estéreo nativo

Los pesos de H3, el modelo omni-modal de video de 33B de MiniMax, ya están en Hugging Face bajo licencia comunitaria. Genera hasta 15 segundos a 2K con audio estéreo nativo y entiende contexto multimodal completo.

Silueta de un hombre con abrigo y sombrero sosteniendo un megáfono, junto a un ojo gigante estilizado, en composición noir roja y naranja
SIG/MINVERIFICADO · 2026-08-05

Modelosalta

#modelos#open source#licencias

MiniMax cumplió la promesa que hizo a finales de julio: los parámetros abiertos (open weights, los valores que el modelo aprendió al entrenarse, publicados para que cualquiera los descargue y adapte) de su modelo de video H3 ya están disponibles en Hugging Face. El modelo de 33 mil millones de parámetros genera clips de hasta 15 segundos a resolución 2K con audio estéreo nativo, y entiende un contexto multimodal completo en el que combina texto, imágenes, video y audio.

H3 se presentó el 31 de julio como un modelo de video omni-modal accesible por API, con la promesa de abrir los pesos en los días siguientes. La liberación llegó el 3 de agosto bajo la MiniMax H3 Community License, una licencia propia de la compañía que permite descargar, usar, adaptar y hacer fine-tuning del modelo, aunque no cumple la definición estricta de código abierto (OSI).

Entre sus especificaciones verificadas en la ficha del modelo:

  • 33 mil millones de parámetros (arquitectura H3-Omni-Transformer, densa)
  • Video de 4 a 15 segundos a 24 fotogramas por segundo, hasta 2K con el módulo H3-Regenerate-2K
  • Audio estéreo nativo a 32 kHz, generado junto con el video
  • Hasta 9 imágenes, 3 clips de video y 3 de audio como referencia en un solo prompt
  • Soporte estable de 11 idiomas, entre ellos el español
  • Integración inmediata con ComfyUI, con variantes cuantizadas disponibles (ya hay 21 modelos derivados y 20 cuantizaciones en Hugging Face)

Hay un matiz que conviene anotar. El sistema H3-Context-IR, el que interpreta instrucciones multimodales complejas y las convierte en lo que el modelo entiende, no forma parte de esta versión abierta, queda como servicio hospedado vía API, y MiniMax publicó guías para que cada quien construya su propio preprocesador. La atención dispersa (sparse attention), que la compañía mencionó durante el entrenamiento, tampoco viene en esta entrega inicial y llegará en una actualización futura.

Para quien construye con modelos abiertos, H3 es la opción más completa hasta ahora en video con audio estéreo incorporado, y lo es sin depender de una API para la generación en sí. MiniMax además apuesta por el precio, a 2K el costo por segundo es menos de un tercio del de los modelos mainstream, y a 768p, menos de la mitad de lo que cobran otros por 720p.

Para más detalles: