
要点まとめ
MiniMax H3は、MiniMax自身が2026年7月31日に公開したオムニモーダル動画モデルです。テキスト/画像/動画/音声を統合した文脈、最長15秒の動画、2Kの出力経路、そして同じ生成でのネイティブステレオを備えています(H3公式記事、Reuters)。MiniMax H3 Maxは、H3の重みを追加学習したホスト型のバリアントで、2026年8月26日から公開されています。MiniMaxブランドのH3アップグレード版ではありません。出力は480pまたは768p(2Kではない)、テキストから動画と画像から動画(任意で末尾フレーム)、5〜15秒で、ネイティブ音声付きです。768pのドラフトを素早く作りたいならH3 Maxを、2Kのテキストから動画や画像から動画(任意で末尾フレーム)が必要ならこのサイトのH3を使ってください。MiniMaxのH3の仕様には、今もオムニリファレンス(画像最大9枚、動画3本、音声3本)が含まれていますが、このサイトのジェネレーターでは、現時点でそうした追加の動画や音声ファイルを添付できません(H3の記事、オープンソース化のお知らせ)。
押さえておきたいポイント
- 同じファミリーの、2つの製品です。 H3はMiniMaxの7月のモデルです(H3の記事)。H3 Maxは、その後にH3のオープンな重みを追加学習したホスト型のモデルで、2026年8月26日に第三者のランキングで発表されました(Artificial Analysis、Design Arena)。
- 最初の分かれ目は解像度です。 H3の公開されている説明は2Kです(オープン版のH3-Baseは今も短辺768で描画し、2Kは再生成の段階で得られます)(オープンソース化のお知らせ)。H3 Maxは768pが上限です(480pのドラフト用の段階もあります)。
- 2つ目の分かれ目はリファレンスです。 MiniMaxのH3の仕様では、1回のリクエストで画像最大9枚、動画3本、音声3本を結び付けられます(H3の記事、オープンソース化のお知らせ)。公開時点のH3 Maxは、テキストから動画と画像から動画に任意の終了フレームが加わる程度で、そのフルセットではありません。このサイトのH3ジェネレーターも、テキストから動画と画像から動画のみ(2K、任意で末尾フレーム)です。現時点では、動画や音声を混ぜたリファレンスは受け付けません。
- Maxが存在する理由は速度です。 Design Arenaの8月26日の投稿では、画像から動画が約6.4秒、テキストから動画が約4.7秒と報告され、そのアリーナではMaxがベースのH3よりはるかに速いと説明されていました(Design Arena)。これらはアリーナでの実時間として扱い、サービス水準の約束とは考えないでください。
- ランキング(2026年8月27日時点のスナップショット)。 Artificial Analysisの音声ありの画像から動画では、H3 Maxが1位(Elo 1,204、±10、サンプル5,123件)、オープンな重みのH3が3位(Elo 1,184)です(I2Vボード)。音声ありのテキストから動画では、H3 Maxが3位(Elo 1,235)、H3が4位(Elo 1,225)で、上位3つは数ポイント差に収まっています(T2Vボード)。
- 重み。 H3のチェックポイントは公開されています(Hugging Face MiniMax-H3)。本記事執筆時点で、H3 Maxの重みは公開されていません。第三者の記事では公開する意向があると紹介されていますが、それはダウンロードできることと同じではありません(Artificial Analysis)。
正面比較
| 項目 | MiniMax H3 | MiniMax H3 Max |
|---|---|---|
| それは何か | MiniMaxのオムニモーダル動画モデル(H3の記事) | 速度とプロンプトへの忠実さのために追加学習した、ホスト型のH3バリアント |
| 公開時期 | 2026年7月31日(Reuters) | 2026年8月26日、第三者のボード(AA) |
| 解像度 | 2Kの経路。オープン版ベースのデフォルト短辺は768(オープンソース化のお知らせ) | 480pまたは768p。2Kの段階はなし |
| 長さ | MiniMaxのオープンソース仕様で4〜15秒(オープンソース化のお知らせ) | 5〜15秒 |
| 音声 | 映像と一緒にネイティブステレオ(H3の記事) | 映像と一緒にネイティブ音声 |
| 入力 | テキスト、画像、動画、音声。オムニリファレンス(H3の記事) | テキストから動画と画像から動画。任意で末尾フレーム |
| 速度のシグナル | 同じアリーナでは、より遅いホスト経路 | Design Arena:I2V 約6.4秒、T2V 約4.7秒(投稿) |
| 音声ありI2V(2026年8月27日) | Elo 1,184、オープンな重みのモデルで首位(AA I2V) | Elo 1,204、そのボードで1位 |
| 音声ありT2V(2026年8月27日) | Elo 1,225、4位(AA T2V) | Elo 1,235、3位 |
| 重み | H3-Baseを公開(Hugging Face) | 非公開 |
| まず試すなら | H3動画ジェネレーター — 2Kでテキストまたは静止画から | H3 Max動画ジェネレーター |
表は一度読めば十分です。指示が動きが安定するまで、768pでテキストや静止画から繰り返し作るならH3 Max。2Kのテキストから動画や画像から動画が必要なら、このサイトのH3を使ってください。MiniMaxの画像/動画/音声を混ぜたリファレンスはH3の公式仕様ですが、このジェネレーターではそうした追加ファイルを受け付けません。
ファミリーと時系列
3つの名前を区別しておきましょう。
MiniMax H3(一部のサービスではHailuo 3/Hailuo 03とも表記)は、Hailuo系列の2026年7月の動画モデルです。系譜はHailuo 01 → Hailuo 02/2.3 → H3です(H3の記事)。6月の言語/エージェントモデルであるMiniMax M3とは別物です(M3のページ)。
MiniMax H3 Maxは「公式に2K対応したH3」ではありません。H3の重みを後から追加学習したホスト型のモデルです。MiniMax自身の7月と8月の資料が説明しているのはH3とオープンな重みの公開で、H3 Maxという名前のMiniMax製品は発表していません。Maxという名前を世に出したのは、第三者のボードと8月26日のランキング投稿です(Artificial Analysis、Design Arena)。
H3にとって、オープンな重みの切り分けは今も重要です。MiniMaxはH3-Base(768pクラスの生成+ステレオ)を公開し、H3-Context-IRとH3-Regenerate-2Kはホスト側の段階として残しました(オープンソース化のお知らせ)。公開されたベースだけから追加学習したモデルは、別途2Kの段階を組み合わせない限り、その768pの上限を引き継ぎます。これが、MaxがH3の2Kという位置付けを置き換えない仕組み上の理由です。
H3発表時の全体像は、MiniMax H3発表:ネイティブステレオ音声付きの2K AI動画(2026年7月31日)を参照してください。
H3の動き
この動画は、このサイトのCDNに再ホストしたH3のコミュニティサンプルで、H3の商用動画の密度を示しています。ここには同じプロンプトでのH3とH3 Maxの比較ペアはありません。条件をそろえたA/Bテストではありません。
シナリオ別の向き・不向き
| ボトルネックが… | 選ぶなら | 理由 |
|---|---|---|
| 5〜10秒のドラフトを一度に大量に | H3 Max | 公表されているMaxの存在理由はアリーナでの速度(Design Arena) |
| 動かしても人物や商品の同一性を保つ必要がある静止画 | H3 Maxの画像から動画 | このサイトのH3 Max画像から動画ジェネレーターでフレームから始めて生成 |
| 2Kの出力、ロゴ、細かい文字 | H3 | 2KはH3の経路で、Maxには2Kの段階がない(H3の記事、オープンソース化のお知らせ) |
| 複数のファイルからキャラクター+動き+声 | H3の公式仕様。このジェネレーターではない | MiniMaxはH3のオムニリファレンスをドキュメント化している(H3の記事)。このサイトでは現時点でVideo 1/Audio 1を添付できない |
| 先頭・末尾フレームの固定 | どちらでも。ただし注意あり | 先頭/末尾フレームはH3の中核モード。Maxの画像から動画も任意で終了フレームを指定できるが、完全なオムニリファレンスではない |
| オープンなチェックポイントのセルフホスト/ファインチューニング | H3 | 公開されている重みはH3-Base(Hugging Face) |
実践的な使い分け: カメラの動きと場面のリズムが安定するまではMiniMax H3 Maxで動きのドラフトを作ります。同じテキストや静止画を2Kで仕上げたいときに、採用するテイクをMiniMax H3へ移してください。動画や音声を混ぜたリファレンスはH3の公式機能のままで、このジェネレーターでは扱えません。
わかっていること・わかっていないこと
| わかっていること(出典あり) | わかっていないこと/主張しないこと |
|---|---|
| H3は2026年7月31日に公開:オムニモーダル、15秒以下、2K、ネイティブステレオ、その後オープンな重みを公開(H3の記事、オープンソース化のお知らせ、Reuters) | MiniMax自身がH3 Maxという名前の製品を出したこと |
| H3 MaxはH3を追加学習したホスト型のモデルで、2026年8月26日にランキングボードで公開。5〜15秒、最大768p、T2V+I2V(AA) | Maxが現時点で2K、オムニリファレンス、指示による編集に対応していること |
| このサイトのH3ジェネレーター:2Kのテキストから動画と画像から動画、任意で末尾フレーム | 現時点でこのジェネレーターにリファレンス用の動画や音声をアップロードできること |
| 2026年8月27日時点で、AAの音声ありI2VはMaxが1位(Elo 1,204)、H3が3位(Elo 1,184)(I2Vボード) | そのEloが来週も変わらないこと |
| Design ArenaはMaxについてI2V 約6.4秒/T2V 約4.7秒と投稿(Design Arena) | 混雑した日の待ち時間。「常に再生時間より速い」というSLA |
| 本記事執筆時点で、H3の重みはダウンロード可能、Maxの重みは不可(Hugging Face) | Maxの重みが公開される日付 |
両方を評価する方法
両方のジェネレーターで同じプロンプトAとBを使ってください。途中で新しい指示を作らないでください。プロンプトCは仕様を確認するためだけのものです。
- MiniMax H3 Maxを開き、プロンプトAを5秒/768pで実行します。
- このサイトのMiniMax H3を開き、プロンプトAをもう一度実行します。
- 被写体の固定、カメラの追従、音声の合い方、画面上の文字(あれば)が読める状態を保っているかを判断します。
- 静止画がすでにあるなら、MaxでプロンプトBを画像から動画として実行し、続けて同じ静止画をこのサイトのH3ジェネレーターで実行します。
- プロンプトCは、MiniMaxの公式なH3オムニリファレンスを読んで確認するための仕様例です。このサイトのジェネレーターには貼り付けないでください。 そのUIはVideo 1やAudio 1を受け付けません。
これは条件をそろえたA/Bテストではありません。1つの文、2つのジェネレーター、1つの判断という、いちばん短く正直なテストです。
プロンプトA — 商品のヒーローショット(16:9、両モデル共通)
大理石の上のブラッシュドメタルの腕時計へ、カメラが途切れずに寄っていく5秒の商品映像です。プロンプトは英語のまま貼り付けてください。
5s luxury product film, 16:9, photoreal. One continuous push-in on a brushed metal watch on marble, window light crawling across the crystal, shallow depth of field. Native stereo: quiet room tone and a single tick. No extra logos. Cinematic grade.
プロンプトB — 静止画から動きへ(画像から動画)
アップロードした静止画を先頭フレームとして固定し、被写体の周りを10秒かけて小さく回り込む指示です。
Keep the uploaded still as the first frame. Slow 10s orbit around the subject, small amplitude, no identity drift, no new wardrobe, no extra people. Native stereo: soft room tone only. 16:9 if the still allows it.
プロンプトC — 公式のH3オムニリファレンス(ここでは実行できません)
このプロンプトは、MiniMaxのH3の仕様を読むためのものです。このサイトでの手順ではありません。Image 1から人物、Video 1からカメラワーク、Audio 1から声の勢いを取り込む、という書き方の例です。
Match character identity from Image 1, camera language from Video 1, and vocal energy from Audio 1. 12s fashion lookbook walk through a rain-wet night street, neon reflections, confident pace, native stereo footsteps and city hush.
よくある質問
MiniMax H3 Maxは、単に速いMiniMax H3ですか?
違います。MaxはH3を追加学習したホスト型のモデルで、768pでの速度とプロンプトへの忠実さに合わせて調整され、テキストから動画と画像から動画に対応しています。MiniMaxのH3の仕様は、今も2Kとオムニリファレンスをカバーしています(H3の記事、AA)。このサイトでは、H3は2Kのテキストから動画と画像から動画のみで実行できます。
MiniMaxがH3 Maxをリリースしたのですか?
2026年8月26日の公開ランキング投稿が、H3 Maxを追加学習したH3バリアントとして紹介しました(Artificial Analysis、Design Arena)。MiniMax自身のH3発表とオープンな重みのお知らせが説明しているのはH3で、Maxという名前のMiniMax製品ではありません(H3の記事、オープンソース化のお知らせ)。
MiniMax H3 Maxは2Kに対応していますか?
私たちが責任を持って示せる経路では対応していません。Maxは480p/768pです。2KならMiniMax H3を使ってください(オープンソース化のお知らせ)。
H3 Maxは音声を生成しますか?
はい。公開されているMaxの説明には、映像と一緒に生成されるネイティブ音声が含まれており、H3のネイティブステレオと同じ系統です(AA、H3の記事)。
動画の長さはどこまでですか?
H3のオープンソース仕様は4〜15秒です。私たちが案内しているジェネレーターでのH3 Maxは5〜15秒です。1回の生成につき1つの場面のリズムを想定してください(オープンソース化のお知らせ)。
H3 Maxはすべての項目で1位ですか?
いいえ。2026年8月27日時点で首位なのは、Artificial Analysisの音声ありの画像から動画です。音声ありのテキストから動画では、僅差の上位グループの中で3位です(I2V、T2V)。順位は変動します。
H3 Maxの重みはダウンロードできますか?
本記事執筆時点ではできません。Hugging FaceにあるのはH3-Baseです。「Maxもオープンになる」という話は、ファイルではなく意向として扱ってください。
それぞれどこで試せますか?
H3 Maxのドラフト:このサイトのH3 Max動画ジェネレーター。H3の2K、テキストまたは静止画から(任意で末尾フレーム):このサイトのH3動画ジェネレーター。先に静止画があるなら、このサイトのH3 Max画像から動画ジェネレーターから始めてください。画像+動画+音声を混ぜたリファレンスはMiniMaxのH3仕様にあるもので、現時点のこのジェネレーターにはありません。
両方使うべきですか?
はい、順番に使ってください。Maxで動きを見つけ、このサイトのH3でテキストや静止画から2Kで仕上げる流れです。MiniMaxの複数ファイルによるオムニリファレンスは、このジェネレーターの対象外です。
Hailuo 03はH3 Maxと同じものですか?
違います。Hailuo 03/Hailuo 3.0は、たいていMiniMax H3を指します。H3 Maxは、その後に作られたホスト型の追加学習モデルです(H3の記事)。
Casey Renについて
Casey RenはAI動画モデルのアナリストです。MiniMax/Hailuoの動画リリースを追い、公開された発表内容を、MiniMax H3での分かりやすい試し方に落とし込んでいます。この記事の事実は、リンク先の一次情報に基づいており、非公開のラボへのアクセスによるものではありません。
