MiniMax-H3 en Mac Apple Silicon: guía local 2026

En pocas palabras: H3-metal, el port en C de antirez, corre MiniMax-H3 nativo en Apple Silicon sin PyTorch ni CUDA. En una Mac M5 Max con 128GB de RAM genera un clip de video en 74-76 segundos. Los pesos pesan ~115GB, así que necesitás 128GB para full precision.

MiniMax-H3 corre en una Mac con Apple Silicon gracias a H3-metal, el port nativo en C que armó antirez para evitar PyTorch. En una M5 Max con 128GB de RAM genera un clip corto en 74-76 segundos, según los benchmarks publicados. Ejecutar MiniMax-H3 Apple Silicon Mac local es viable hoy, pero te pide memoria en serio.

MiniMax-H3 es un modelo omni-modal de MiniMax lanzado el 31 de julio de 2026 que toma texto, imagen o audio y devuelve video con audio estéreo, hasta 2K de resolución, 15 segundos de duración y 24 fps. H3-metal es la implementación en Metal para Apple Silicon escrita por antirez, en C puro, que corre la inferencia sin depender de PyTorch ni de CUDA.

En 30 segundos

  • Qué es: modelo omni-modal de MiniMax (texto/imagen/audio a video con audio), lanzado el 31 de julio de 2026, hasta 2K y 15 segundos.
  • H3-metal: port en Metal de antirez que corre la inferencia sin PyTorch; el más rápido en Apple Silicon.
  • RAM real: los pesos pesan ~115GB, así que en full precision querés 128GB para no sufrir; las versiones 4-bit en MLX bajan bastante la vara.
  • Velocidad: de ~74 segundos en una M5 Max 128GB a ~18 minutos por 5s de video en una M4 Pro 64GB.
  • Local vs API: la API arranca en USD 0.09/s (768p) y USD 0.13/s (2K). Un video de 15s en 2K te sale casi USD 2.

¿Qué es MiniMax-H3 y en qué se diferencia del otro H3?

MiniMax-H3 es un generador de video omni-modal: le das un prompt de texto, una imagen o una pista de audio, y te devuelve un clip con audio estéreo sincronizado. Según el anuncio oficial de MiniMax, sale con soporte de hasta 2K, 15 segundos y 24 fps. La parte interesante para los que tenemos Mac es que existe un camino nativo en Metal.

Ojo con la confusión de nombres. Hay un H3 que no tiene nada que ver: el índice geoespacial hexagonal de Uber, cuya librería en C es justamente h3.c. Distinto animal. Acá hablamos del modelo de video de MiniMax, y H3-metal es el intento de correrlo sobre Apple Silicon aprovechando el motor gráfico en vez de la GPU de Nvidia.

¿Por qué importa Metal en una Mac? Porque sin un backend nativo dependés de PyTorch con MPS, que arrastra overhead y bugs propios. Un runtime en C compilado contra Metal se saltea toda esa capa. Menos dependencias, menos “funcionaba en mi notebook y en producción explotó”.

¿Qué requisitos de hardware necesito para MiniMax-H3 en Mac?

El requisito que manda es la RAM unificada. Los pesos del modelo pesan cerca de 115GB, y a eso le sumás el overhead de activaciones durante la inferencia, así que en precisión completa el número realista trepa a 150-180GB. Traducido: una Mac de 128GB va apretada pero zafa, una de 64GB solo entra con cuantización o resoluciones bajas. Esto se conecta con lo que analizamos en nuestra guía de seguridad corporativa.

  • Chip: cuanto más ancho de banda de memoria, mejor. Una M5 Max le saca varios cuerpos a una M4 Pro en el mismo trabajo.
  • RAM unificada: 128GB es el punto dulce para full precision. Con 64GB vas a depender de versiones 4-bit.
  • Cuantización: las variantes 4-bit en MLX (hay una publicada en Hugging Face) bajan el requisito de forma brutal, en teoría hasta el orden de los 8GB, pero pagás con calidad y artefactos.
  • Disco: descargá con paciencia. Son ~115GB de pesos que tenés que bajar antes de generar un solo frame.

Un detalle técnico que muerde: INT8 no funciona bien en Apple Silicon. Si vas a cuantizar, el camino sensato es FP8 donde aplique o directamente las builds 4-bit pensadas para MLX. Meter una cuantización pensada para CUDA acá es pedir NaN.

¿H3-metal, MLX o ComfyUI? Tres formas de correr MiniMax-H3 en local

Hay tres caminos para ejecutar MiniMax-H3 en Mac con Apple Silicon local, y cada uno resuelve un problema distinto. Uno prioriza velocidad, otro flexibilidad, y el tercero comodidad. No hay ganador absoluto: depende de cuánto quieras pelearte con la terminal.

H3-metal puro (lo más rápido)

Es el runtime en C de antirez, compilado contra Metal, sin PyTorch en el medio. Es el más rápido de los tres (los ~74-76 segundos en M5 Max salen de acá) y el que menos dependencias arrastra. La contra: es lo más crudo, pensado para quien no le tiene miedo a compilar y leer un README a fondo.

MLX (el flexible)

MLX es la librería de machine learning de Apple para Apple Silicon. Sobre ella hay un port de MiniMax-H3 y versiones cuantizadas ya listas. Es el camino piola si querés jugar con 4-bit, meter mano en el código Python o integrarlo a un pipeline propio. Más lento que el C puro, pero mucho más maleable.

ComfyUI (el accesible)

ComfyUI te da la interfaz gráfica y los workflows oficiales. Es lo más amigable para el que no vive en la terminal. El problema es que en Mac serie M todavía tiene bugs (video negro, mismatches de device), como se ve en los issues abiertos del repo. Accesible, sí, pero preparate para hacer un par de workarounds.

¿Cómo instalo MiniMax-H3 paso a paso en Mac?

Si vas por ComfyUI, la instalación en macOS sigue una secuencia bastante estándar. Necesitás Homebrew, las herramientas de línea de comandos de Xcode y bajar los ~115GB de pesos desde Hugging Face. Contá con que la descarga es el cuello de botella del día. Para más detalles técnicos, mirá nuestra guía completa sobre ChatGPT en la nube.

Servidores Dedicados Gpu — DonWebServidores Dedicados Gpu — DonWebServidores Dedicados Gpu — DonWeb
  1. Base del sistema: instalá xcode-select --install y por Homebrew [email protected], git, ffmpeg y jq.
  2. Cloná ComfyUI: git clone del repo oficial y actualizá a la versión 0.30.0 o superior. Las versiones viejas no traen el soporte de MiniMax-H3.
  3. Bajá los modelos: desde Hugging Face, ~115GB de pesos. Dejalo corriendo y andá a hacer otra cosa.
  4. Configurá offloading: activá el offload de VRAM/CPU si tu RAM está justa, así no te comés un out of memory a mitad de render.
  5. Elegí precisión: nada de INT8 en Apple Silicon. FP8 donde aplique, o las builds 4-bit de MLX si tu Mac tiene poca memoria.

Un consejo de quien ya se comió la frustración: probá primero con un clip mínimo (256×256, pocos frames) antes de tirarle un 2K de 15 segundos. Si algo está mal configurado, lo descubrís en dos minutos y no en veinte.

¿Cuánto tiempo tarda generar un video con MiniMax-H3?

El tiempo cambia muchísimo según el chip, la resolución y si tenés el audio activado. Va desde algo más de un minuto en el mejor caso hasta casi veinte minutos en una Mac más modesta. Estos son los números que circulan en los benchmarks públicos, y conviene tomarlos con pinzas porque dependen del workflow exacto.

ConfiguraciónRAMTiempo aprox.Escenario
M4 Pro64GB~18 min5s @ 480×864
M4 Max128GB~10-12 minclip corto
M5 Pro128GB~9 mindemo 256×480
M5 Max128GB~74-76 s256×256, 56 frames (H3-metal)
minimax-h3 apple silicon diagrama explicativo

¿Qué mueve tanto la aguja? Cuatro cosas: la resolución, los pasos de difusión (20-30 es lo típico), el batch size y si generás audio o no. Y arriba de todo, la cuantización del modelo. Un 4-bit vuela comparado con full precision, pero se nota en el resultado.

¿Cómo soluciono el video negro y los errores NaN en MiniMax-H3?

Los tres dolores de cabeza clásicos en Mac son el video negro, el audio con NaN y el device mismatch en el VAE. Ninguno es fatal, todos tienen workaround conocido. Acá van, con la corrección al lado. Ya lo cubrimos antes en nuestra guía sobre el universo de modelos de lenguaje.

  • Video negro (todo en negro al terminar): el workflow oficial de texto a video (T2V) falla en Apple Silicon. El workaround que anda es usar image-to-video (I2V): partís de una imagen y generás el movimiento desde ahí.
  • Audio con NaN: desactivá el audio en el workflow, o pasate a la versión MLX que maneja distinto la rama de audio. Si te tira NaN apenas empieza, casi siempre es la cuantización equivocada.
  • Device mismatch en el VAE: pasa cuando quedan tensores en CPU mientras el VAE está en GPU. Actualizá ComfyUI a la última y revisá que nada se haya quedado en CPU por un nodo mal configurado.
  • Out of memory (OOM): activá el CPU offload o bajá la resolución. Con 64GB, pretender un 2K largo es pedir peras al olmo.

Local vs API: ¿cuándo vale la pena ejecutar MiniMax-H3 en casa?

La respuesta corta: local conviene si generás poco volumen pero mucho, o si te importa la privacidad; la API conviene si necesitás escala sin comprarte hardware. Según los precios publicados de la API, el 2K sale USD 0.13 por segundo y el 768p USD 0.09 por segundo. Un video de 15 segundos en 2K te clava casi USD 2. Hacé la cuenta de cuántos pensás generar por mes.

Ponele que sos un creador indie que arma tres o cuatro clips por día para redes. En local, después de la inversión inicial en una Mac con 128GB (o dos GPU de escritorio), el costo por video es prácticamente cero y tenés privacidad total: nada sale de tu máquina. Si en cambio sos una agencia que produce cientos de videos, comprás la escala de la API y te olvidás del fierro.

Hay un punto que la gente subestima: la latencia. En local hablás de segundos de latencia efectiva una vez que el modelo está cargado, mientras que el ida y vuelta al cloud te suma tiempo de cola. Si tu flujo es iterar rápido, probar, corregir, volver a probar, esa diferencia se siente. Eso sí, si vas a montar la generación en un servidor propio o en la nube y necesitás hosting o infraestructura en Argentina, mirá opciones locales como donweb.com antes de irte a un proveedor de afuera.

Errores comunes al correr MiniMax-H3 en Apple Silicon

  • Bajar los pesos y recién ahí mirar la RAM: descargás 115GB, arrancás y te salta OOM. Verificá la memoria unificada antes de la descarga, no después.
  • Usar cuantización de CUDA en Metal: un INT8 pensado para Nvidia te tira NaN de entrada. En Apple Silicon, FP8 o 4-bit de MLX, nada más.
  • Insistir con T2V cuando da video negro: el workflow de texto a video está roto en serie M. Cambiá a I2V y dejá de perder horas.
  • Correr una versión vieja de ComfyUI: si no estás en 0.30.0+, el soporte del modelo no está y vas a chocar con bugs ya resueltos.

Preguntas Frecuentes

¿Puedo ejecutar MiniMax-H3 en mi Mac con Apple Silicon?

Sí, con H3-metal (el port en Metal de antirez), MLX o ComfyUI 0.30.0+. En full precision necesitás una Mac con 128GB de RAM unificada, porque los pesos pesan ~115GB. Con 64GB solo entra usando versiones cuantizadas 4-bit y resoluciones bajas.

¿Cuánto tarda generar un video con H3-metal?

Depende del chip y la resolución. Una M5 Max con 128GB genera un clip de 256×256 y 56 frames en 74-76 segundos con H3-metal, mientras que una M4 Pro de 64GB tarda cerca de 18 minutos para 5 segundos a 480×864. La cuantización y los pasos de difusión mueven mucho el número.

¿Vale la pena correrlo localmente o mejor uso la API?

Local conviene con bajo volumen constante y necesidad de privacidad, porque el costo por video tiende a cero tras la inversión inicial. La API conviene para escala: cuesta USD 0.13/s en 2K y USD 0.09/s en 768p, o sea casi USD 2 por un video de 15 segundos en 2K. En las herramientas de Google profundizamos sobre esto.

¿Cómo arreglo el video negro en Apple Silicon?

Usá image-to-video (I2V) en lugar del workflow oficial de texto a video (T2V), que falla en Mac serie M devolviendo todo en negro. Partís de una imagen y generás el movimiento desde ahí. Para el audio con NaN, desactivá el audio o pasate a la versión MLX.

¿MiniMax-H3 es lo mismo que el H3 de Uber?

No. MiniMax-H3 es un modelo de generación de video de la empresa MiniMax, lanzado el 31 de julio de 2026. El H3 de Uber es un sistema de indexación geoespacial hexagonal, cuya librería en C es h3.c. Comparten sigla y nada más.

Conclusión

Correr MiniMax-H3 en tu propia Mac dejó de ser fantasía: con H3-metal, una M5 Max resuelve un clip en poco más de un minuto, y las builds 4-bit en MLX abren la puerta a equipos con menos memoria. El costo real no es la plata sino la RAM y la paciencia para la descarga inicial.

Si generás pocos videos por día y valorás la privacidad, armate el setup local: H3-metal para velocidad, MLX para flexibilidad, ComfyUI si querés interfaz (asumiendo los bugs). Si tu volumen es alto, la API a USD 0.09-0.13 por segundo te evita comprar fierro. Empezá con un clip chico, confirmá que no te salta NaN, y recién ahí escalá a 2K.

Fuentes

Desplazarse hacia arriba