中国発の動画生成AI「MiniMax H3」が、テキストからの映像生成だけでなく、音声付きのMVやカメオ風動画、さらには長尺マイクロドラマまでをもローカルPC上で作り出す・・・。
これまでクラウド専用の超高性能モデルが主役だった動画AIの世界に「手元の環境でどこまで近づいていけるのか?」という挑戦が始まりました。
正直なところ、第一印象としては、MiniMax H3は「また新しい動画生成モデルが出てきた」というくらいの認識で、仕様だけをみると、最大1080p解像度、4〜15秒、24fps、32kHzステレオ音声といった数字は、クラウド側の最先端モデルに追いついたんだというくらいの印象。
しかし実際のところは、MiniMax H3が切り開いているのはスペック競争ではなく、「ローカル環境で完結する映像制作ワークフロー」の方であり、テキスト/画像/動画/音声を1つの文脈で扱う設計になっていて、text-to-video、image-to-video、先頭・末尾フレーム補間、オムニリファレンス、編集、音声生成までを単一モデルにまとめられています。
H3-Base-FL2VAとH3-Base-Ref2VAという2系統のウェイトに分かれてはいるものの、実際の運用では、テキストだけで人物の台詞や環境音を含むショットを組み立て、必要に応じて画像や映像、音声を参照として足していくことができるようで、この統合が、そのままローカル環境での「現場感」に直結しているのはちょっと驚く。
違いは、タイムライン付きプロンプトの扱いに表れるようで、従来、LTX-2.3のようなローカル動画モデルは、Seedance 2.0級の「Shot 1/Shot 2…」と時間指定を含んだプロンプトを理解させるのに工夫が必要だったのですが、MiniMax H3では、ComfyUI標準のWorkflowにTimeline付きプロンプトを流し込むだけで、720p・10秒の映像が自然なカット割りと台詞のタイミングを保ったまま生成されていくのだとか。
RTX 5090を使っても約144秒の生成時間はかかるとはいえ、結果のショット構成は、タイムラインを前提に設計されたクラウド系エンジンに迫るものになっているようですよ。
テキストから映像と声を同時に生み出す力も、ローカルモデルでの常識を変えているようで、MiniMax H3は、PC関連ニュースサイトのラップ映像のようなMVを、text-to-videoだけで生成できるのだとか。
歌詞と情景をプロンプトとして与えれば、人物の口の動きと楽曲のリズムがある程度揃った映像が出てきて、別途用意した音源をリファレンスとして渡しても、声と音楽を分離しなくても実用的なリップシンクが成立する・・・。
これまでは、音楽生成AIで作った曲から声だけを抽出する前処理が必須だったことを考えると、「一手間」削れるというのは作業のスピード化に大きく関わってきます。
さらに踏み込んだ使い方として、顔写真と声、そしてカメラをリファレンスにした仮想撮影風景も実現しているのだそうで、Sora 2のカメオ機能が、アカウント本人の顔と声で動画を生成できることを強みにしていたのに対し、MiniMax H3は、数秒分の音声と数枚の写真を参照として与えれば、スタジオでモデル撮影をしているような一連の映像をローカルPCで再現するのだとか。
もちろん照明の位置やスタジオのスケール感など、細部の破綻は完全には避けられないものの、「同じキャラクターが同じ空間で喋り続けている」と感じられる水準に達しているようです。
こうした「動画のためのモデル」を、画像生成やTTSに転用できるのもMiniMax H3の特徴となっていて、最小フレーム数が5である仕様を利用し、5フレームだけ生成して静止画として取り出すWorkflowを組めば、1080pの画像を一度に5枚得て、その中から1枚を選ぶ運用が可能。
Z-ImageやKrea 2のような専用画像モデルと比べると画質面での差は出てくるようですが、動画と画像で同じリファレンス機能を共有できることから、「特定の人物やスタイルに似せるビジュアル」を一貫して作りたい場合、LoRAを別途用意するよりも手軽とも言えますね。
逆に、映像をほとんど捨てて音だけを取り出す、TTS的な使い方も可能となっているようで、解像度を32×32ピクセルに落としたtext-to-videoとして台詞を生成し、映像は無視して音声だけを保存するWorkflowを組むと、720p・10秒で144秒かかっていた生成が、1秒程度で終わるのだとか。
プロンプト中に「[Japanese]」や「[English]」といった指定を書き分ければ、同じ話者が言語を切り替えるような音声も作れるそうで、動画モデルの中に埋め込まれた音声生成機能を、ローカルな多言語TTSとして引き出しています。
ローカル環境での動画制作という観点で、最もインパクトが大きいのは、尺を延長しながら一貫性を保てる「Motion Context」と「Context Loop」の仕組みで、作成済みの10秒動画の情報をファイルに保存し、延長時にその情報を読み込んでから生成を再開するMotion ContextのWorkflowでは、前半10秒と後半10秒をffmpegでつないでも、継ぎ目が目視では分からないレベルの20秒映像になるようで、背景の動きやBGMの流れが途切れないため、「もう少し続きが欲しい」と感じた時に、後から秒数を足していく作業が現実的に。
Context Loopでは、この考え方がさらに拡張され、10秒前後のクリップを複数書き連ねて、数分規模のマイクロドラマを組み立てることも可能。
シナリオを10秒単位のショットに分割し、それぞれに対応するプロンプトとリファレンス画像を用意すれば、Workflowがクリップごとの生成と連結を自動で進めてくれるようで、完了した映像を見れば、キャラクターの見た目や雰囲気、世界観が大きく崩れないまま、場面転換を繰り返す短編ドラマになっているのだとか。
プロンプト設計やキャラクターデザインを支えるLLM側のハーネスは必要になるとはいえ、「脚本を分割して指示すれば、長尺動画が手元のマシンで組み上がる」というものが、もはやクラウド専用サービスにしかないものではなくなってきたのはデカい。
しあkも、コミュニティが高速化や品質改善を一気に進めているみたいで、オープンウェイト公開から1週間足らずのあいだに、Turbo LoRAによる20ステップ→4ステップ化、高速化ノード、スパースアテンション適用、混合量子化といった取り組みが次々と登場してきていて、公式もH3-Regenerate-2Kによる2Kアップスケールや低ステップ版、画像生成・編集モデルの公開方針を打ち出しています。
ライセンス面では、現時点では利用制限が残るものの、著作権問題が整理され次第Apache License 2.0へ移行する構想もあるようで、「ローカル動画AIのプラットフォーム」としての位置づけを一層強めてきています。
現状、MiniMax H3は「Sora 2を超えた」「Seedance 2.0に迫る」といった表現だけが先行しているようですが、これは単純な性能比較よりも「映像制作のどの部分までをローカルで担えるか」という分担の線引きが大きく変わってきていることにあります。
タイムライン理解、音声同時生成、リファレンスによるキャラクター一貫性、Context Loopによる長尺化までを1モデルでカバーできるようになったことで、クラウド前提だったワークフローの一部が、PC上に移り始め、今後はSeedance 2.0級に迫るクオリティを「ローカルでどこまで持ち込めるか」という話題が、今年後半の動画生成AIを左右していきそう。
動作については、最低でもVRAM 8GB、メインメモリRAM 32GBは必要となっていて、「快適に動作」させるためには、メインメモリ64GB以上、ストレージ(SSD)の空き容量も150GB〜200GB以上あったほうがいいようで、当然ながらHDDではなく「高速なSSD」が必須。
こうなってくると、早速試してみたいのにメモリの供給不足が腹立たしいですね。
私の場合はMacなので、最低ライン32GB、快適に動かすためには64GB 〜 128GBメモリがいるみたいですが、それを揃えたとしても、GPUパワーのいてNVIDIA製のグラフィックボード(RTXシリーズなど)に比べて大幅に遅いようで、5秒動画を作るのに、NVIDIAの最新上位GPUであれば、約30秒〜1分で生成するところ、約3.5分〜7分以上かかるのだとか。
つまり、ローカルで無理に動かすよりも、クラウド環境に頼ったほうがいいみたいです。
残念・・・。


