Text Encoder

Last-modified: 2026-07-22 (水) 11:17:41

概要

Text Encoderとは何か。

簡単に言うと?

  • Text Encoderとは、
    ざっくり言えば唱えた呪文を数値化してU-Netへ伝えてこういう絵にしてほしいと通訳を行う場所になります。
    • 例えば「1girl,loli,at computer,」でコンピューターへ向かうロリっ娘を出してもらおうとした時に通訳次第ではその内容が変化します。

特徴

構造

  • SD系ではCLIPが採用されています
  • 比較的最近の自然言語言語に強いファイルサイズがやたらデカいテキストエンコーダは、フル版であれば会話もできる本格的なLLMも使われていることがあります。FLUX.1のT5、Qwen-VLなど。
    • プロンプトの通りとかが気になる人はちょっとお話してみるといいかも? Qwen-VLは脱獄文でNSFW通るし
    • FLUX.1のT5 XXLやQwen-VLのようなLLMはそれ自体のパラメータ数がSDXL系の画像生成モデルより多いので、少なくともしばらくのうちは画像生成モデル本体に埋め込めるサイズではありません。SD1.5はパラメータ数1B、SDXLでも3.5Bだが、T5 XXLは11Bもある。画像生成モデル(U-Net拡散モデル)はAIに都合がいいノイズ拡散過程を扱っているので、この世のすべての言葉を理解するよう強いられているLLMよりコンパクトなのです。
      • と思っていましたが、最近のAIO(All in One)モデルでは10GB近いLLM系テキストエンコーダを焼き込んであるものも見受けられます。デカくてもひとまとめにしたほうがお手軽という判断のようです。

Stable Diffusion web UIで使われている場所

260620_01_モデルの役割_2.png

引用:としあき自作

モデル一覧

世代別一覧

拡散モデルなどに比べるとTextEncoderのバリアントは少ないため、世代毎におおまかに分類しました。

世代テキストエンコーダー例トークントークン追加された特徴
SD1.5世代CLIP ViT-L/1475トークン単位a girl, masterpiece, best quality単語の組み合わせによる基本的な概念の画像化
SDXL世代CLIP ViT-L
OpenCLIP ViT-bigG
77トークン(複数統合)1girl, cinematic lighting, highly detailed複数エンコーダー統合による細部の表現力向上
SD3 / FLUX.1世代CLIP ViT-L
OpenCLIP ViT-bigG
T5-XXL
最大256~512トークンA photo of a cat sitting on a red stool with text hello長文理解、自然言語での位置・空間の指定、文字描画能力
Anima / Krea 2世代Qwen2.5-VL / Llama3系などのLLM・VLM統合、独自フロントエンド数千~数万トークン(LLMコンテキスト長準拠)A detailed anime character standing in a futuristic city, high resolution, dynamic pose...LLMベースの深い自然言語理解、対話的・直感的な文脈解析、プロンプトの完全消化および補正・最適化

個別モデル説明

主要なモデルの簡単な説明

CLIP ViT-L/14

OpenAIが開発したテキストと画像の対応関係を学習した軽量エンコーダー。初期から用いられ、基本的な単語単位の概念抽出を担う。

CLIP ViT-L

CLIP ViT-L/14と同系統の軽量エンコーダー。後続モデルにおいても基礎的な概念把握や低次特徴の抽出用として継続して併用される。

OpenCLIP ViT-bigG

LAION等によって学習された巨大なオープンソースCLIPモデル。単語レベルの認識精度やスタイル表現力を補強するために併用される。

T5-XXL

Googleが開発した大規模言語モデル。巨大なパラメータ数を活かし、複雑な自然言語の構文理解、空間配置の指示、文字描画の精度を支える。

Qwen2.5-VL

視覚理解と高度な言語処理能力を備えた大容量の視覚言語モデル(VLM)。複雑な文脈や詳細な空間指示、画像とテキストの緊密な対応関係を解析する。

スペック比較

テキストエンコーダーの特性や対応能力を整理した表です。

名称単語理解複雑長文日本語対応空間指定文字描画
CLIP ViT-L/14----
OpenCLIP ViT-bigG----
T5-XXL-
Qwen2.5-VL

✓:対応
△:対応するが問題有り
ー:非対応

コメント・指摘・助言

(Tips)

  • 既存コメントの先頭にあるラジオボタンをONにすると、そのコメントの下にぶら下げ返信する形になります(ツリー構造)。
  • コメントの文中で↵ボタン(下の画像参照)を押すと「&br;」の文字列が挿入されます。これは送信後に改行として機能するので、文章の整形に役立ちます。
    br.png