画像生成AIのモデル別
プロンプト記法ガイド【2026年版】

SDXL・Pony・FLUX・Midjourney V8・DALL-E 3 で、同じプロンプトでも結果が違う理由。
タグ系・自然文系・ハイブリッド系の3類型で整理し、書き分け方を実証する。

⚡ ツールへ 💡 解決法を見る

この記事の内容

画像生成AIは2026年現在、Stable Diffusion XL系・Pony Diffusion系・Illustrious / NoobAI・FLUX.1 / FLUX.2・Midjourney V7-V8・DALL-E 3・Adobe Firefly・Nano Banana など、多種多様なモデルが並立しています。同じ日本語の意図を伝えるプロンプトでも、モデルが変われば書き方が完全に変わり、結果も大きく違います。本記事では、これらをタグ系・自然文系・ハイブリッド系の3類型に整理し、同じ意図を各モデル向けに書き分ける手法を、早見表と実例で解説します。

同じプロンプトでもモデルごとに結果が違う理由

「Pony で出ていたプロンプトを FLUX に貼ったら別物になった」──モデルを乗り換えた人なら誰もが経験する現象です。原因はプロンプトでも英語力でもなく、モデル内部の構造そのものにあります。

画像生成モデルが文字を画像に変換する仕組みは、大きく2段階に分かれます。まずテキストエンコーダがプロンプトを数値ベクトルに変換し、次に画像生成エンジン(U-NetやTransformer)がそのベクトルから絵を作ります。テキストエンコーダの種類が、モデルごとの「読み方」を決定します。

2026 年現在、主流のテキストエンコーダは大きく2系統あります。CLIP系はOpenAIが開発した画像-テキスト対応モデルで、SDXL や Pony、Illustrious、NoobAI、NovelAI などのほぼ全 SDXL 派生モデルが採用しています。T5 / LLM 系は Google の T5 や大規模言語モデルで、FLUX.1 / FLUX.2 はこれを CLIP と併用し、Midjourney V7-V8 や DALL-E 3 は LLM 由来の理解力を全面的に活用しています。

CLIP系は短いタグ羅列を効率的に処理するよう設計されており、Danbooru由来のタグ語彙に強く反応します。一方、T5やLLMは長文を文脈ごと理解できるため、自然な英文に強く反応します。同じ「青い髪の少女」でも、CLIP系は「1girl, blue hair」というタグ片を、T5系は「a young woman with blue hair」という文章をそれぞれ得意とします。

さらに、学習画像とそのキャプションの分布もモデルごとに異なります。Pony 系は Danbooru タグ+スコアタグで詳細に学習され、独自のスコア記法(score_9 など)が品質を制御します。FLUX は LAION 系の自然文キャプションで学習され、長い説明文に強く反応します。同じプロンプトをそのまま渡しても、モデルが学んでいる「世界」が違うので、結果も別物になるのです。

記法の3類型 — タグ系・自然文系・ハイブリッド系

主要な画像生成モデルは、記法の特徴で3類型に分類できます。どの類型に属するかが分かれば、書くべき構文・必須トークン・記法ルールが決まります。

01

タグ系:カンマ区切りの単語列+品質トークン+重み括弧

SD 1.5 / SDXL / Pony / Illustrious / NoobAI / Animagine / NovelAI が属します。プロンプトはカンマ区切りの英単語列(タグ)で構成し、文章にはしません。先頭には品質を示すトークン(masterpiece, best quality や score_9, score_8_up)を置くのが慣習で、これがないと品質が大きく下がります。

特定の要素を強調する場合は重み括弧で囲みます。(blue hair:1.3) なら1.3倍、((detailed)) なら二重括弧で約1.21倍の重みになります。Stable Diffusion Web UI 系統に組み込まれた書式で、A1111・ComfyUI・Forge などのフロントエンドで標準的に動きます。

02

自然文系:説明的な英文+パラメータ構文

FLUX.1 / FLUX.2 / Midjourney V7-V8 / DALL-E 3 / GPT-image-1 / Adobe Firefly / Nano Banana / Niji journey が属します。プロンプトは「人に説明するような英文」で書きます。「青い髪の少女がカフェで本を読んでいる」を、そのまま英訳した文章として記述します。

重み括弧は使えません(FLUX は (word:1.5) を文字列としてそのまま解釈してしまう)。代わりに「with emphasis on …」のような自然な強調表現を使います。Midjourney は独自のパラメータ構文(--ar 3:4、--s 250、--no people、--chaos 30)を末尾に付ける形で、品質や構図、除外を制御します。

03

ハイブリッド系:自然文+タグ両対応

FLUX.1 の一部・SD 3 / SD 3.5 / Stable Cascade などが属します。これらは CLIP と T5 を併用しているため、自然文でも Danbooru 系タグでも反応します。ただし、両者を雑に混ぜると効きが弱まるため、どちらかに寄せて書くのが推奨です。

ハイブリッド系の現実的な使い方は、メインの記述を自然文で書き、特定のスタイル指定だけタグで補強する形です。たとえば A young woman with blue hair sits in a cozy cafe. anime style, soft lighting のように、文章の後にカンマ区切りでスタイル指定を加える書き方が機能します。

タグ系の書き方(SDXL / Pony / Illustrious / NovelAI ほか)

タグ系モデルでは、英単語のカンマ区切り+先頭の品質トークンが基本構文です。モデルごとに「必須の先頭トークン」が異なるため、これを知っているかどうかで品質が大きく変わります。

SD 1.5 / SDXL ── masterpiece, best quality が起点

SD 1.5 と SDXL 1.0 は最も基本的なタグ系モデルです。プロンプトの先頭に masterpiece, best quality を置くのが慣習で、これだけで品質が顕著に上がります。SDXL は推奨解像度が 1024×1024 で、SD 1.5(512×512)から大きく変わっています。古い SD 1.5 用プロンプトをそのまま SDXL に渡すと、解像度の前提違いで構図が崩れることがあります。

典型例:masterpiece, best quality, 1girl, blue hair, drinking coffee, cafe interior, detailed background

Pony 系(V6 XL・派生)── score_9 等のスコア記法が必須

Pony Diffusion V6 XL は SDXL 派生ながら、完全に独自の品質記法を持ちます。先頭に score_9, score_8_up, score_7_up, score_6_up, score_5_up, score_4_up を全て並べるのが慣習で、これがないと品質が大きく落ちます。さらに作風指定の source_anime(アニメ)、source_pony(My Little Pony 系)、source_furry(ケモノ)、source_cartoon(カートゥーン)から選び、レーティング指定の rating_safe / rating_questionable / rating_explicit を加えます。

典型例:score_9, score_8_up, score_7_up, score_6_up, source_anime, rating_safe, 1girl, solo, blue_hair, drinking_coffee, cafe_interior, sitting

派生モデル(AutismMix、ebara pony、Pony Realism など)も同じ記法を踏襲します。Clip Skip = 2、SDXL VAE 併用が必須で、これが守れていないと色合いが崩れます。

Illustrious XL / NoobAI-XL ── SD1.5 寄りで品質トークン軽め

Illustrious XL とその派生の NoobAI-XL は 2024 年後半から急速に普及した SDXL 派生モデルです。Pony と違って独自スコア記法を要求せず、SD1.5 系の masterpiece, best quality がそのまま使えます。さらに very aesthetic や aesthetic 11 など独自の美的指定を加えると、画質が向上します。

典型例:masterpiece, best quality, very aesthetic, 1girl, blue hair, drinking coffee, cafe interior, soft lighting

学習データが Pony より広範で、版権キャラクターや細かいシチュエーションを LoRA なしで描ける範囲が広いため、2026 年初頭時点でアニメ系の主流モデルの一つとされています。

Animagine XL ── SD1.5 系の延長で扱いやすい

Animagine XL は Pony と並ぶ初期 SDXL 系アニメモデルで、Danbooru タグがそのまま使えるので SD1.5 ユーザーが移行しやすい設計です。Pony ほどの独自記法はなく、SD1.5 系の素直な書き方が通じます。

NovelAI v3 / v4 ── 独自タグと品質指定

NovelAI v3(2024)と v4(2024-2025)は商用クラウドサービスで、独自の UI と記法を持ちます。タグ系の本流ですが、Pony や SDXL のローカル運用とは別の語彙体系で、サービス内のヘルプとドキュメントを参照しながら書くのが基本です。

自然文系の書き方(FLUX / Midjourney V8 / DALL-E 3 ほか)

自然文系モデルでは、英単語の羅列ではなく「人に説明するような英文」でプロンプトを書きます。タグ系で覚えた「masterpiece, best quality」のような品質トークンは不要、あるいは逆効果になります。

FLUX.1 dev / schnell ── 100 単語以上の説明文が理想

FLUX.1 は Black Forest Labs が 2024 年 8 月にリリースした次世代モデルで、T5 XXL(パラメータ数 11B の大規模言語モデル)と CLIP を併用しています。プロンプトは「キーワードの羅列」ではなく「文章で書く」のが原則です。被写体、動作、環境、光、スタイルを順に説明的に並べると、忠実度の高い画像が出力されます。

典型例:A young woman with long blue hair sits at a small wooden table in a cozy café, holding a white ceramic mug of coffee with both hands. Warm afternoon light streams through the window behind her, creating soft highlights on her hair. Shot with an 85mm lens, shallow depth of field, photorealistic detail.

重み括弧 (word:1.5) は使えません。FLUX はこれを文字列としてそのまま解釈してしまうため、強調したいときは「with emphasis on …」のような自然な英語で表現します。Flux Guidance(CFG 相当)は 3.5 前後が推奨で、長いプロンプトでは 1.0〜1.5 まで下げると安定します。

FLUX.2(2026) ── 改善された自然文系

FLUX.2 は 2026 年早期にリリースされた次世代モデルで、FLUX.1 の自然文系統を踏襲しつつ、プロンプトへの追従度と速度が向上しました。基本記法は FLUX.1 と同じです。本ガイドの内容は鮮度監査対象で、新リビジョン登場時に随時更新します。

Midjourney V7 / V8 ── 簡潔な文章 + パラメータ構文

Midjourney V7(2025)と V8(2026 早期)は、自然文系の中でも最も「美術的解釈」を重視するモデルです。FLUX のような 100 単語超の長文より、簡潔で印象的な短文が好まれます。「what / where / how」の3要素を明確にしつつ、長くしすぎない書き方が推奨されます。

典型例:young woman with blue hair drinking coffee in a cozy cafe, warm afternoon light, intimate atmosphere --ar 3:4 --s 250 --v 8

パラメータは末尾に --ar 3:4(アスペクト比)、--s 250(スタイル強度)、--chaos 30(バリエーション幅)、--no people(除外)、--style raw(プロンプト忠実モード)などを付けます。V8 では --hd でネイティブ 2K 出力が利用可能になりました。

DALL-E 3 / GPT-image-1 ── 会話的な文章

DALL-E 3(2023)と GPT-image-1(2025)は OpenAI のモデルで、ChatGPT 経由で利用されることが多いため、会話的な英文が最適です。FLUX より長い文章でも安定して処理でき、「Please create … with …」のような丁寧な依頼形でも問題なく動きます。タグ式の羅列は意図が伝わりにくく、画質も落ちます。

典型例:Please create a photorealistic portrait of a young woman with vibrant blue hair sitting in a cozy café, holding a coffee mug. Soft window light, intimate atmosphere. Composition: 3:4 vertical.

Adobe Firefly ── 商用安全前提の自然文

Adobe Firefly は Adobe Stock などライセンス済み素材で学習された商用安全モデルです。記法は自然文系ですが、特定のアーティスト名やキャラクター名は通りません。「青い髪の少女」のような汎用記述に強く、版権物には弱い特徴があります。

Nano Banana(Google)── 自然文+画像参照

Nano Banana は Google の画像生成・編集系モデルで、自然文プロンプトと参照画像を組み合わせる使い方が特徴です。「この画像を元に、髪を青く」のような指示が自然に通ります。プロンプトは英文でも日本語でも比較的安定して動作する点が利点です。

Niji journey ── Midjourney 系アニメ特化

Niji journey は Midjourney 派生のアニメ特化モデルで、基本記法は Midjourney と同じです。「anime style」「manga panel」のようなアニメ系の自然文に強く反応します。SDXL 系の Pony や Illustrious とは別系統で、自然文好きなアニメユーザー向けの選択肢として確立しています。

→ 関連トピック:自然文系モデルでは「除外指定(ネガティブ)」の書き方が独特です。FLUX はネガティブそのものが機能しないケースがあり、Midjourney は --no 構文が必須、DALL-E 3 は自然文で「言い回す」必要があります。詳しくは画像生成AIネガティブプロンプト完全ガイドを参照してください。

→ また、モデルを横断して「同じキャラ」を呼び出す課題には画像生成AIでキャラクターの一貫性を保つ方法が、特に VTuber 立ち絵で Live2D 化を見据えた構図選びと表情差分の量産にはVTuber 立ち絵を AI で無料作成(業界相場 5〜15 万円の制作を内製化する手順)が参考になります。

モデル別 必須トークン・パラメータ早見表

主要モデルの必須先頭トークン、推奨ネガティブ、推奨解像度、特記事項を一覧にしました。プロンプトを書き始める前にこの表で確認するだけで、品質が大きく変わります。

モデル 類型 先頭推奨トークン ネガティブ推奨 解像度
SD 1.5タグmasterpiece, best qualitylow quality, worst quality512×512
SDXL 1.0タグmasterpiece, best qualitylow quality1024×1024
SD 3 / 3.5ハイブリッド不要必要に応じて1024×1024
Pony V6 XLタグscore_9, score_8_up, ..., source_anime, rating_safescore_4, score_3, source_furry1024×1024
Animagine XLタグmasterpiece, best quality, very aestheticlow quality1024×1024
Illustrious XLタグmasterpiece, best quality, very aestheticlow quality1024×1024
NoobAI-XLタグmasterpiece, best qualitylow quality1024×1024
NovelAI v4タグ(独自 UI で指定)同上1024×1024
FLUX.1 dev/schnell自然文不要(100単語以上の文章推奨)CFG=1 では機能せず1024×1024
FLUX.2自然文不要限定(要鮮度監査)1024×1024+
Midjourney V7自然文簡潔な文章--no <要素>--ar で指定
Midjourney V8自然文簡潔な文章--no--ar / --hd で 2K
Niji journey自然文自然文(アニメ寄り)--no--ar で指定
DALL-E 3 / GPT-image-1自然文会話的な文章長文で「避ける」と書く自動
Adobe Firefly自然文自然文(商用安全)自然文で言い回す自動
Nano Banana自然文自然文+参照画像—自動
Anima自然文アニメ向け自然文—1024×1024

※ 本表は鮮度監査対象です。FLUX.2 や Anima のような 2026 年新モデルは仕様が更新される可能性があるため、毎月の確認対象としています。本記事公開時点(2026年5月)の情報を基準にしています。

同じ意図を各モデルで書き分ける実例

「青い髪の少女がカフェでコーヒーを飲んでいる」という同じ意図を、各モデル向けに書き分けてみます。同じイメージでも、記法が全く違うことが分かります。

例1:青い髪の少女がカフェでコーヒーを飲む

モデルプロンプト例
SDXL(汎用) masterpiece, best quality, 1girl, blue hair, drinking coffee, cafe interior, indoor, sitting at table, detailed background
Pony V6 XL score_9, score_8_up, score_7_up, score_6_up, source_anime, rating_safe, 1girl, solo, blue_hair, drinking_coffee, cafe_interior, sitting
Illustrious XL masterpiece, best quality, very aesthetic, 1girl, blue hair, drinking coffee, cafe interior, soft lighting
FLUX.1 dev A young woman with long blue hair sits at a small wooden table in a cozy café, holding a white ceramic mug of coffee with both hands. Warm afternoon light streams through the window behind her. Shot with an 85mm lens, shallow depth of field, photorealistic detail.
Midjourney V8 young woman with blue hair drinking coffee in a cozy cafe, warm afternoon light, intimate atmosphere --ar 3:4 --s 250 --v 8
DALL-E 3 Please create a photorealistic portrait of a young woman with vibrant blue hair sitting in a cozy café, holding a coffee mug. Soft window light. Composition: 3:4 vertical.

同じ意図でも、タグ系は短い単語列、自然文系は説明文、Midjourney はパラメータ付き、DALL-E 3 は丁寧な依頼形と、構造が全く違います。意図は同じでも、モデルごとに「適切な書き方」が違うのです。

例2:夕焼けの海辺に立つ後ろ姿

モデルプロンプト例
SDXL masterpiece, best quality, 1girl, from_behind, standing, beach, sunset, ocean, silhouette, long_hair
Pony score_9, score_8_up, score_7_up, source_anime, rating_safe, 1girl, from_behind, beach, sunset, ocean, silhouette, dramatic_lighting
FLUX A solitary figure stands at the edge of a beach, viewed from behind. Golden sunset light reflects on the calm ocean. Long hair blowing gently in the breeze. Wide cinematic composition, soft warm tones, photorealistic.
Midjourney V8 silhouette of a woman standing at sunset beach, looking at ocean, cinematic, golden hour --ar 16:9 --s 300

例3:写実的なポートレート、雨上がりの街角

モデルプロンプト例
SDXL(写実モデル) masterpiece, best quality, photorealistic, 1woman, portrait, wet street, after rain, reflections, soft natural light, detailed skin
FLUX.1 A photorealistic portrait of a woman standing on a wet city street just after rain. Soft reflections on the pavement, gentle natural light, fine skin texture. Shot with an 85mm lens at f/2.0, shallow depth of field, cinematic mood.
Midjourney V8 portrait of a woman on wet city street after rain, soft reflections, natural light, cinematic --ar 3:4 --style raw --v 8
Adobe Firefly A natural portrait of a woman standing on a rain-wet city street, soft reflections, gentle daylight, photorealistic style.

本記事はモデル別の「記法」を扱っていますが、これと別に「語彙」の問題があります。記法を正しく揃えても、語彙が直訳のままだと意図した絵は出ません。

たとえば SDXL 向けに正しいタグ式記法で masterpiece, best quality, 1girl, long legs, sailor uniform と書いても、「長身でスラリとした体型」「セーラー服」を直訳した long legs, sailor uniform は、学習データ語彙では slender legs / tall figure、serafuku / sailor_collar, school_uniform に近い表現の方が強く反応します。これが「直訳の罠」と呼ばれる現象で、記法を完璧に揃えても語彙が直訳のままだと回避できません。

つまり、モデル別の記法を覚えても、その上に乗せる単語が日常英語の直訳のままだと、結果は意図とズレ続けます。記法と語彙は別問題で、両方を解決して初めて意図通りの絵に近づきます。

→ より詳しくは:画像生成プロンプトの「直訳の罠」を解消する方法(日常英語と学習データ英語の構造的なズレ・20の典型例・翻訳AIで解決できない3つの理由を解説)

モデルを選ぶとツールが記法を出し分ける

17 種類前後のモデルそれぞれの記法・必須トークン・パラメータ構文を全部覚えて、自分でモデルごとに書き分けるのは現実的ではありません。モデルが乗り換わるたびに、書き方ごと変わってしまうからです。

手作業の限界 ── 記法を覚え直すコストが累積する

新しいモデルが出るたびに(Illustrious が 2024 年、NoobAI が 2025 年、FLUX.2 と Midjourney V8 が 2026 年に)、必須トークン、ネガティブの効き方、推奨解像度、パラメータ構文が更新されます。すべてのモデルの最新仕様を追いかけるのは、それだけで仕事になる量です。

結果として、多くのユーザーは特定の 1-2 モデルに固定し、新しいモデルの利点を活かせない状態に陥ります。本来はモデルを使い分ければ広がる表現の幅が、記法の壁で閉じてしまうのです。

無料ツールの対処 ── モデル選択で記法を自動切替

AI 日本語ラボの「画像生成プロンプト 日本語化ツール」では、モデル選択(SDXL / Pony / Illustrious / FLUX / Midjourney など)に応じて、構文・必須トークン・推奨タグを自動で切り替えます。ユーザーは日本語の意図カテゴリ(髪型・表情・ポーズ・服装・背景)を選ぶだけで、選んだモデルに最適化された出力が得られます。

モデル別の早見表を毎回引く手間がなくなり、最新モデルへの追従もツール側で行うので、ユーザーは「どのモデルでも同じ手順」で組み立てられます。完全無料・登録不要です。

モデルを選ぶだけで、記法が自動で切り替わる

SDXL / Pony / Illustrious / FLUX / Midjourney に対応。日本語の意図を選ぶだけで、各モデル向けに最適化されたプロンプトを組み立てます。

⚡ プロンプトを生成

それでも残るケース(チェックリスト)

記法を正しく書き分けても、画像生成にはいくつか残る課題があります。本ツールでも完全には解決できない領域を整理します。

01

モデル独自の LoRA・拡張機能依存ケース

特定キャラクター LoRA、特殊スタイル LoRA、ControlNet、Regional Prompter のような拡張機能を組み合わせた構成は、プロンプトだけでは再現できません。本ツールはベースとなるプロンプトの組み立てに特化しており、LoRA や拡張機能の付加はユーザー側で行う必要があります。

02

バージョンアップで記法が変わるケース

FLUX.2 のような新リビジョンや、Midjourney V8 / V9 のような新メジャー版がリリースされると、推奨パラメータや必須トークンが更新されることがあります。本記事は鮮度監査対象(月次)で随時更新しますが、最新リリース直後は実機検証が間に合っていない可能性があります。

03

NSFW 制御・rating トークンの扱い

Pony 系の rating_safe / rating_explicit、NovelAI のセンシティブ設定、商用モデル(Adobe Firefly / DALL-E 3)のコンテンツポリシーなど、年齢制限・コンテンツ制御はモデルごとに大きく異なります。本ツールは安全な範囲のプロンプト生成を前提としており、明示的な制限解除は対応しません。

よくある質問

A
用途で選びます。実写写真は FLUX.1 / FLUX.2 や SDXL 派生、アニメ・イラストは Pony 系 / Illustrious / NoobAI / NovelAI、商用安全が必要なら Adobe Firefly、対話的に作りたいなら DALL-E 3 / GPT-image-1 が向きます。タグを覚えるのが苦手なら自然文系(FLUX / Midjourney V8)の方が学習コストは低めです。
A
部分的にしか使えません。同じ類型内(タグ系どうし、自然文系どうし)であれば調整で対応できますが、類型を跨ぐ場合(タグ系→自然文系など)は記法ごと書き直す必要があります。タグ系の「1girl, blue hair, school_uniform」を FLUX に渡すと意図が薄まり、逆に FLUX の長文記述を Pony に渡すと品質トークン不足で崩れます。
A
短時間で出力したいなら自然文系(FLUX / Midjourney V8 / DALL-E 3)が楽です。細かい制御や特定スタイルの再現を狙うならタグ系(Pony / Illustrious / NovelAI)が向きます。自然文系は「人に説明するように」書けばよく、タグ語彙を覚える必要が比較的少ない反面、細部の意図反映度はタグ系の方が高くなる傾向があります。
A
大枠は類型を踏襲します。FLUX.2 は FLUX.1 の自然文系統を維持しつつ、CFG 範囲やプロンプト追従が改善されています。Midjourney は 2026年7月24日に V8.2 が公開されデフォルトモデルに昇格しました(V8.1 からの主な変更は美的品質・パーソナライズ精度の向上で、記法・パラメータ体系はV8系を踏襲)。Anima はアニメ特化の自然文系として登場しました。本記事は鮮度監査対象で、新モデル登場時に随時更新します。
A
当ツールではモデル選択(SDXL / Pony / Illustrious / FLUX / Midjourney など)に応じて、構文(カンマ区切り / 自然文)・必須先頭トークン(score_9 / masterpiece / 自然文出だし)・推奨ネガティブ・パラメータ構文(--ar など)を自動で切り替えます。ユーザーは日本語で意図を選ぶだけで、選んだモデルに最適化された出力が得られます。

この記事が役に立ったら、リンクをシェアして応援してください。

タイトルとURLをまとめてコピー。ブログ・SNS・チャットにそのまま貼れます
画像生成プロンプトの書き方ガイドへ
AI日本語ラボへ
Back to HOME