概要
書きかけの文章です。
- 少なくともリリース1ヶ月くらい(2026/8/30)まではあまり信用しないでください。
通常そのくらい経過しないと各コミュニティでの評価が安定しないため。
- 2026/7/22 Microsoftよりリリースされたモデル
Mageシリーズのt2i向けバリアントであり、オープンウェイト。 - Microsoftの1次情報
- 性能面では、
以下不確定情報
- Mage-Flow-Editモデル
- リリース直後2026/7/29までは、Krea2, Animaそれぞれと、良い面、悪い面ともに顕著な競合は見られなかったが...
- 2026/7/29頃、学習済みデータの品質が低く、既存のKrea2ユーザーによりredditを中心に失望意見が局所的に多数発生。
- 学習環境が整い、いざ汚名返上...といった矢先の2026/7/29、Hugging FaceのMicrosoft公式ページの削除が発生。Microsoft公式ページでのコミュニティ議論ができなくなり、話題は縮小傾向
基本情報
- 論文
- Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
arXiv:2607.19064
- Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
主なトピックス
- 2026/7/22 Mage-Flowリリース
- 2026/7/26 AI Toolkitに、Mage-FlowとMage-Flow EditのFTサポートが追加
- 2026/7/29 ComfyUI v0.29.0にてMage-Flowの正式対応
- 2026/7/29 Hugging FaceからMicroSoft/Mage-Flowリポジトリが、なぜか削除されて404エラー(参考)
特徴
- 専用VAEであるMage-VAEは、1step拡散方式のEncode/Decode、Anchor-latent KL正則化を採用した独自軽量トークナイザー
- FLUX.2-VAEと同等の再構成品質を、Encodeで約12分の1、Decodeで約22分の1という少ない計算量で実現
基本スペック
- アーキテクチャ基本構造
- 拡散モデル
- DiTは、NR-MMDiT(Native-Resolution Multimodal Diffusion Transformer)構造
- パラメータ数4B(40億)
- TextEncoder
- Qwen3-VL-4B
- パラメータ数4B(40億)
- VAE
- Mage-VAE
- ベースモデルのスタイル系タグ適正
- 得意分野・・・
- 可能・・・不明(要確認)
- 不可・・・不明(要確認)
- テキスト出力・・・可。日本語出力は要確認
- コンテンツフィルタ・・・
- 固有機能・・・Mage-Flow-Edit(指示ベースの画像編集専用モデル)
利用方法
対応UI
モデル
モデルファミリー
- モデル構成は、
- DiT, TextEncoder, VAE。
- Image-Edit用途として、Editモデル(仮名)が配布されている。
- DiTのバリアントは下表の通り
モデルファイルの入手
- ベースモデル
- ComfyUI-Orgサイトにて再パッケージ済モデルが配布されている。
https://huggingface.co/Comfy-Org/Mage-Flow- よくわからないなら、このあたりを選ぶのが無難
分類 ファイル名 DiT mage_flow_bf16.safetensors Text Encoder qwen3vl_4b_bf16.safetensors VAE mage_flow_vae_bf16.safetensors
- よくわからないなら、このあたりを選ぶのが無難
- ComfyUI-Orgサイトにて再パッケージ済モデルが配布されている。
モデルファイルの配置
- ダウンロードしたファイルの保存先
モデル分類 配置先 DiT ComfyUI/models/diffusion_models TextEncoder ComfyUI/models/text_encoders VAE ComfyUI/models/vae - もし、別途準備したモデルを利用する場合には、表記の同じフォルダに配置する。
- ファイルの容量
約10~17GB *あくまでも目安です。データ型やモデルによって異なります- DiT 4.16GB@8bit、8.23GB@bf16
- TextEncoder 5.2~8.9GB
- VAE 0.345GB
生成方法(特殊な操作方法)
- ComfyUI
- モデル読込
- Load CLIPは、type=mageへ設定
- Load Diffusion Model、Load VAE設定は普通(説明省略)
- モデル読込