Mage-Flow

Last-modified: 2026-08-05 (水) 13:16:41

概要

書きかけの文章です。

  • 少なくともリリース1ヶ月くらい(2026/8/30)まではあまり信用しないでください。
    通常そのくらい経過しないと各コミュニティでの評価が安定しないため。
  • 2026/7/22 Microsoftよりリリースされたモデル
    Mageシリーズのt2i向けバリアントであり、オープンウェイト。
  • Microsoftの1次情報
  • 性能面では、
    • DiTのパラメータ数が4Bと、競合相手であるKrea2よりも小さい。
      • Mage-Flowリリース直前で、Krea2はint8, int4モデルの研究がコミュニティで進められてきたが、int4が性能速度と共に頭打ちになってきていた背景があり、
        Krea2のような品質と速度を羨む、低スペックグラボユーザーはMage-Flowの登場を歓迎した。
      • Krea2ほどの品質はないが、Animaほどの低品質でもない絶妙なポジションである。
    • 競合相手であるAnimaKrea2に対し、高速な生成速度を持つ
      特にTurboモデルにおける4stepはAnima, Krea2より高速

以下不確定情報

  • コンテンツフィルタは特に設定されてなさそうで、Krea2のような解除の煩わしさはなさそうだ。
  • 要求スペックに関してはVRAM12GBあれば推論及び学習ともに問題なさそうだ。
  • Mage-Flow-Editモデル
    • 「背景を室内にして」「3DCGにして」といった日本語指示を素直かつ気軽に指示できる、2026年7月唯一のモデルである。
      • この便利さが、ちょっとした背景埋めといった軽い用途に最適。
    • 競合相手であるKrea2Animaに対して、公式のImage-Editを持つということが明確なアドバンテージである
  • リリース直後2026/7/29までは、Krea2, Animaそれぞれと、良い面、悪い面ともに顕著な競合は見られなかったが...
    • 2026/7/29頃、学習済みデータの品質が低く、既存のKrea2ユーザーによりredditを中心に失望意見が局所的に多数発生。
    • 学習環境が整い、いざ汚名返上...といった矢先の2026/7/29、Hugging FaceのMicrosoft公式ページの削除が発生。Microsoft公式ページでのコミュニティ議論ができなくなり、話題は縮小傾向

基本情報

主なトピックス

特徴

  • 専用VAEであるMage-VAEは、1step拡散方式のEncode/Decode、Anchor-latent KL正則化を採用した独自軽量トークナイザー
    • FLUX.2-VAEと同等の再構成品質を、Encodeで約12分の1、Decodeで約22分の1という少ない計算量で実現

基本スペック

  • アーキテクチャ基本構造
  • 拡散モデル
  • TextEncoder
  • VAE
    • Mage-VAE
  • ベースモデルのスタイル系タグ適正
    • 得意分野・・・
    • 可能・・・不明(要確認)
    • 不可・・・不明(要確認)
  • テキスト出力・・・可。日本語出力は要確認
  • コンテンツフィルタ・・・
  • 固有機能・・・Mage-Flow-Edit(指示ベースの画像編集専用モデル)

利用方法

対応UI

モデル

モデルファミリー

  • モデル構成は、
    • DiT, TextEncoder, VAE
    • Image-Edit用途として、Editモデル(仮名)が配布されている。

モデルファイルの入手

  • ベースモデル
    • ComfyUI-Orgサイトにて再パッケージ済モデルが配布されている。
      https://huggingface.co/Comfy-Org/Mage-Flow
      • よくわからないなら、このあたりを選ぶのが無難

        分類ファイル名
        DiTmage_flow_bf16.safetensors
        Text Encoderqwen3vl_4b_bf16.safetensors
        VAEmage_flow_vae_bf16.safetensors

モデルファイルの配置

  • ダウンロードしたファイルの保存先
    モデル分類配置先
    DiTComfyUI/models/diffusion_models
    TextEncoderComfyUI/models/text_encoders
    VAEComfyUI/models/vae
     
  • もし、別途準備したモデルを利用する場合には、表記の同じフォルダに配置する。
  • ファイルの容量
    約10~17GB *あくまでも目安です。データ型やモデルによって異なります
    • DiT 4.16GB@8bit、8.23GB@bf16
    • TextEncoder 5.2~8.9GB
    • VAE 0.345GB

生成方法(特殊な操作方法)

  • ComfyUI
    • モデル読込
      • Load CLIPは、type=mageへ設定
      • Load Diffusion Model、Load VAE設定は普通(説明省略)

ライセンス