概要
Text Encoderとは何か。
簡単に言うと?
- Text Encoderとは、
ざっくり言えば唱えた呪文を数値化してU-Netへ伝えてこういう絵にしてほしいと通訳を行う場所になります。- 例えば「1girl,loli,at computer,」でコンピューターへ向かうロリっ娘を出してもらおうとした時に通訳次第ではその内容が変化します。
特徴
構造
- SD系ではCLIPが採用されています
- 比較的最近の自然言語言語に強い
ファイルサイズがやたらデカいテキストエンコーダは、フル版であれば会話もできる本格的なLLMも使われていることがあります。FLUX.1のT5、Qwen-VLなど。- プロンプトの通りとかが気になる人はちょっとお話してみるといいかも?
Qwen-VLは脱獄文でNSFW通るし - FLUX.1のT5 XXLやQwen-VLのようなLLMはそれ自体のパラメータ数がSDXL系の画像生成モデルより多いので、少なくともしばらくのうちは画像生成モデル本体に埋め込めるサイズではありません。SD1.5はパラメータ数1B、SDXLでも3.5Bだが、T5 XXLは11Bもある。画像生成モデル(U-Net拡散モデル)はAIに都合がいいノイズ拡散過程を扱っているので、この世のすべての言葉を理解するよう強いられているLLMよりコンパクトなのです。
- と思っていましたが、最近のAIO(All in One)モデルでは10GB近いLLM系テキストエンコーダを焼き込んであるものも見受けられます。デカくてもひとまとめにしたほうがお手軽という判断のようです。
- プロンプトの通りとかが気になる人はちょっとお話してみるといいかも?
Stable Diffusion web UIで使われている場所
引用:としあき自作
モデル一覧
世代別一覧
拡散モデルなどに比べるとTextEncoderのバリアントは少ないため、世代毎におおまかに分類しました。
| 世代 | テキストエンコーダー例 | トークン長 | トークン例 | 追加された特徴 |
| SD1.5世代 | CLIP ViT-L/14 | 75トークン単位 | a girl, masterpiece, best quality | 単語の組み合わせによる基本的な概念の画像化 |
| SDXL世代 | CLIP ViT-L OpenCLIP ViT-bigG | 77トークン(複数統合) | 1girl, cinematic lighting, highly detailed | 複数エンコーダー統合による細部の表現力向上 |
| SD3 / FLUX.1世代 | CLIP ViT-L OpenCLIP ViT-bigG T5-XXL | 最大256~512トークン | A photo of a cat sitting on a red stool with text hello | 長文理解、自然言語での位置・空間の指定、文字描画能力 |
| Anima / Krea 2世代 | Qwen2.5-VL / Llama3系などのLLM・VLM統合、独自フロントエンド | 数千~数万トークン(LLMコンテキスト長準拠) | A detailed anime character standing in a futuristic city, high resolution, dynamic pose... | LLMベースの深い自然言語理解、対話的・直感的な文脈解析、プロンプトの完全消化および補正・最適化 |
個別モデル説明
主要なモデルの簡単な説明
CLIP ViT-L/14
OpenAIが開発したテキストと画像の対応関係を学習した軽量エンコーダー。初期から用いられ、基本的な単語単位の概念抽出を担う。
CLIP ViT-L
CLIP ViT-L/14と同系統の軽量エンコーダー。後続モデルにおいても基礎的な概念把握や低次特徴の抽出用として継続して併用される。
OpenCLIP ViT-bigG
LAION等によって学習された巨大なオープンソースCLIPモデル。単語レベルの認識精度やスタイル表現力を補強するために併用される。
T5-XXL
Googleが開発した大規模言語モデル。巨大なパラメータ数を活かし、複雑な自然言語の構文理解、空間配置の指示、文字描画の精度を支える。
Qwen2.5-VL
視覚理解と高度な言語処理能力を備えた大容量の視覚言語モデル(VLM)。複雑な文脈や詳細な空間指示、画像とテキストの緊密な対応関係を解析する。
スペック比較
各テキストエンコーダーの特性や対応能力を整理した表です。
| 名称 | 単語理解 | 複雑長文 | 日本語対応 | 空間指定 | 文字描画 |
| CLIP ViT-L/14 | ✓ | - | - | - | - |
| OpenCLIP ViT-bigG | ✓ | - | - | - | - |
| T5-XXL | ✓ | ✓ | - | ✓ | ✓ |
| Qwen2.5-VL | ✓ | ✓ | ✓ | ✓ | ✓ |
✓:対応
△:対応するが問題有り
ー:非対応
コメント・指摘・助言
(Tips)
