「足が長い」を long legs と訳しても効かない理由。
日常英語と学習データ語彙のズレを、20の典型例で解消する。
画像生成AIで「思った絵にならない」と感じたときの最大の原因は、英語力でも翻訳精度でもありません。日本語を直訳した英語そのものが、画像生成モデルの学習データの語彙とズレている──これが「直訳の罠」です。本記事では、なぜ直訳が罠になるのか、20の典型パターンでの「直訳→失敗→学習データ語彙」のマップ、翻訳AIの限界、モデル別の効き方の概観、そして当ツールでの解決法を、事例ベースで解説します。
画像生成AIで「思った絵にならない」と感じたとき、多くの人が最初に疑うのは自分の英語力です。次に疑うのは翻訳精度です。しかし本当の原因は、その手前にあります。
日本語の意図を頭の中で英語に直訳しても、その英訳が画像生成モデルの学習データの語彙とズレていれば、いくら文法的に正しい英語でも望む絵は出ません。「足が長い」を「long legs」と訳すのは正しい翻訳ですが、画像生成モデルが「すらりとした体型」として強く学習しているのは「slender legs」「tall figure」だったりします。
DeepLやChatGPTで丁寧に翻訳しても、この「学習データ語彙とのズレ」は解消されません。むしろ翻訳ツールが返す「丁寧な英語」ほど、画像生成の学習データから遠ざかることすらあります。
これは英語力の問題ではなく、画像生成というドメイン固有の語彙体系の問題です。本記事は、なぜ直訳が罠になるのか、20の典型パターンでの実例、そしてこの罠を回避する方法を、事例ベースで解説します。
画像生成モデルが扱う英語は、私たちが普段使う「日常英語」と、画像生成の世界でだけ通用する「学習データ英語」の2層に分かれています。この区別が、直訳の罠の根本にあります。
画像生成モデルは数億〜数十億枚の画像とそのキャプションで学習されます。キャプションには大きく2層あります。1つはDanbooruなどのタグ式キャプション(1girl, looking_at_viewer, school_uniform)、もう1つはLAION等の自然文キャプション(a young woman in a school uniform looking at the camera)です。
両方とも英語ですが、語彙の選び方・組み合わせ方が全く違います。同じ「制服を着た少女がこちらを見ている」絵に対し、タグ式は短い単語の羅列、自然文式は文章で記述します。
DeepLやChatGPTが返す英語は、Wikipedia・書籍・新聞などの「日常的な英語」を学習元にしています。「制服」を訳せば「uniform」、「上目遣い」なら「looking up」、「肌が綺麗」なら「beautiful skin」と返ってきます。
これらは文法的に完全に正しく、英語ネイティブも納得する翻訳です。学校の英語教育で習った「正しい英訳」がそのまま出てきます。
画像生成のタグ語彙は、Danbooruなどの画像投稿サイトの慣習、日本のオタク文化、写真メタデータの慣例から派生しています。「上目遣い」はlooking_up_at_viewerやthrough eyelashes、「セーラー服」はserafukuまたはsailor_collar, school_uniformのように、日常英語からの直訳とは別の体系を持ちます。
この「方言」は、画像生成モデルの学習画像に大量に付けられたキャプションの結果として、特定のタグが特定のビジュアル要素と強く結びついています。同じ意図でも、日常英語と学習データ英語では選ぶべき単語が違うのです。
翻訳ツールは「日常言語間の対訳」を最適化することを目的に設計されています。タグ語彙のように特定ドメインで強い実効性を持つ表現の「画像生成での効き」は、翻訳精度の評価対象になっていません。
結果として、翻訳ツールは「文法的に正しい」訳を「画像生成で機能する」訳より優先します。これがDeepLやChatGPTで英訳した結果が、画像生成では効かない理由です。
実際にどんなケースで直訳の罠が起きるかを、6つのカテゴリに分けて20例を整理します。同じ意図でも、直訳と学習データ語彙では選ぶ単語が全く違うことが見えてきます。
体型・顔のパーツ・髪型などの身体表現は、日常英語と学習データ語彙のズレが最も顕著なカテゴリです。直訳は「正しい英語」になりますが、画像生成では別の単語が強く効きます。
| 日本語の意図 | 直訳(罠) | 学習データ語彙(成功) |
|---|---|---|
| 足が長い | long legs | slender legs / tall figure |
| 上目遣い | looking up | looking_up_at_viewer / through eyelashes |
| きりっとした目 | sharp eyes | tsurime / sharp-eyed |
| たれ目 | drooping eyes | tareme / soft eyes |
和装や制服など、日本文化由来の服装は特に直訳の罠が深刻です。学習データ語彙には日本由来の単語がそのままタグとして定着しているケースが多くあります。
| 日本語の意図 | 直訳(罠) | 学習データ語彙(成功) |
|---|---|---|
| セーラー服 | sailor uniform | serafuku / school_uniform, sailor_collar |
| 制服 | uniform | school_uniform / seifuku |
| ふりふりの服 | frilly clothes | gothic_lolita / lolita_fashion |
| 私服 | private clothes | casual_clothes / streetwear |
感情表現は、日常英語では抽象的な単語を使う一方、学習データ語彙では具体的な視覚特徴を示すタグが効きます。「しょんぼり」を「sad」と訳すより、視覚的に現れる「teary」「drooping」を選ぶ方が確実です。
| 日本語の意図 | 直訳(罠) | 学習データ語彙(成功) |
|---|---|---|
| しょんぼり | feeling down | sad / teary / drooping ears |
| ほっこり | warm hearted | gentle smile / soft expression |
| ぼーっとする | absent-minded | empty_eyes / spacing_out |
| ドヤ顔 | proud face | smug / smug_face / doyagao |
カメラの位置や構図の指示は、写真用語と画像生成タグで体系が分かれています。「アオリ」を「low angle」と訳しても部分的にしか効かず、from_belowのような決まったタグの方が確実に反応します。
| 日本語の意図 | 直訳(罠) | 学習データ語彙(成功) |
|---|---|---|
| アオリ(下から) | low angle | from_below |
| 引きの画 | far view | full_body / wide_shot |
| 横顔 | side face | profile / from_side |
| パース効いた構図 | perspective | dynamic_angle / foreshortening |
光や質感を表す日本語のオノマトペ的な表現は、英語では複数の写真用語に分散します。「ふんわり」を「fluffy」と訳すと別の意味(毛がもこもこ)になり、本来の「やわらかい雰囲気」を表すには別の語彙が必要です。
| 日本語の意図 | 直訳(罠) | 学習データ語彙(成功) |
|---|---|---|
| やわらかい光 | soft light | soft_lighting / diffused light |
| キラキラ | sparkling | bokeh / lens_flare / glowing |
| ふんわり | fluffy | dreamy / pastel / soft focus |
| 透明感のある肌 | transparency | translucent skin / dewy / luminous skin |
「日本語を翻訳ツールで英訳すれば良いプロンプトになるはず」──多くの解説記事がそう書いています。しかし実際には、翻訳ツールでは直訳の罠は解消しません。理由は3つあります。
DeepLやGoogle翻訳は「対訳コーパス」、つまり日本語と英語のペアが大量に集められたデータを学習しています。これは新聞・書籍・WebページなどのWeb上に対訳が存在するテキストが中心です。Danbooruタグや画像投稿サイトの慣習語彙は、こうした対訳コーパスにはほとんど含まれていません。
結果として、翻訳ツールは「日常的に対訳が存在する」表現を優先します。「セーラー服」が「serafuku」より「sailor uniform」を選ぶのは、後者の方が翻訳コーパスに大量に出現するためです。
翻訳ツールの精度評価は、人間の翻訳者との一致率や、流暢さの自動評価で行われます。「その英語を画像生成モデルに渡したらどんな絵が出るか」は、翻訳精度の評価対象になっていません。
そのため翻訳ツールにとっては「long legs」と「slender legs」はどちらも適切な訳ですが、画像生成モデルにとっては「slender legs」のほうが意図に近い絵を出します。この差を翻訳ツールは認識できません。
「ChatGPTにプロンプトを英訳してもらえば良い」というアドバイスをよく見かけます。しかしChatGPTも汎用翻訳器として動作するため、結果はDeepLと同程度です。日常的な英文を返し、学習データ語彙には変換しません。
むしろChatGPTは「より自然な英語」を志向するため、Danbooruタグ式の短い羅列より、長い文章を返しがちです。SDXLやPony系のタグ系モデルでは、この自然文がさらに効果を下げる結果になります。
直訳の罠の出方は、使うモデルによっても変わります。タグ系のモデルと自然文系のモデルでは、同じ直訳の影響度が違います。
Stable Diffusion XL系統のアニメ・イラストモデルは、Danbooruタグやそれに準じた語彙で学習されています。これらのモデルでは、日常英語からの直訳がほとんど効かず、学習データ語彙でなければ意図した絵が出ません。「serafuku」と書けば一発で出る絵が、「sailor uniform」では曖昧なセーラー服風衣装になります。
FLUX.1やMidjourney V7-V8、DALL-E 3などは、長い自然文キャプションを学習に含んでおり、日常英語の文章をより正確に解釈します。これらのモデルでは、直訳しても比較的意図に近い絵が出やすくなります。ただし、それでもDanbooru由来の特殊語彙(「serafuku」「from_below」など)は、自然文系でも依然として強い効力を持つことが多いです。
「直訳の罠」と「モデル別の記法の違い」は別の問題です。本記事は前者を扱いますが、後者──カンマ区切りタグ・自然文・パラメータ構文の使い分け──については、より詳しく解説した別記事があります。
→ より詳しくは:画像生成AIのモデル別プロンプト記法ガイド(SDXL・Pony・FLUX・Midjourney・DALL-E 3で書き方が違う理由を、3類型分類と早見表で整理)
直訳の罠を回避するには、2つの選択肢があります。手作業で学習データ語彙を覚えるか、日本語のまま入力して自動でマップしてくれるツールを使うかです。
Danbooruのタグ一覧、cciから派生したタグ辞典、「呪文集」と呼ばれる公開タグ集を毎回引いて、自分のイメージに合うタグを選ぶ方法です。これは可能ですが、毎回辞書を引き直す手間がかかり、新しいモデル(Illustrious、NoobAIなど)が出るたびに「効くタグ」も変わっていきます。
呪文集をコピペする方法もありますが、自分の表現したい意図に合うとは限らず、結局「意図 → 学習データ語彙」の変換問題が解けていません。
AI日本語ラボの「画像生成プロンプト 日本語化ツール」は、日本語の意図カテゴリ(髪型・表情・ポーズ・服装・背景)から、画像生成モデルの学習データ語彙へ直接マップする辞書を内蔵しています。直訳を経由しないため、「足が長い」を選ぶと「long legs」ではなく「slender legs, tall figure」が組み立てられます。
モデル選択(SDXL / Pony / Illustrious / FLUX / Midjourney等)に合わせて、タグ式・自然文式・必須トークンまで自動で出し分けます。完全無料・登録不要・ブラウザから即利用可能です。
直訳の罠を回避しても、画像生成にはいくつか残る課題があります。本ツールでも完全解決はできない領域を整理します。
「孤独」「未来への希望」のような抽象概念は、学習データ語彙でも明確なマッピングが難しい領域です。視覚的に表現できる具体要素(夕暮れの海岸・空を見上げる人物 など)に分解する必要があります。
特定のアニメキャラクター名や著名人の名前は、そのモデルがその名前で学習されているかどうかで結果が大きく変わります。Pony系・NovelAI・Illustrious は人気キャラを学習している傾向がありますが、汎用モデルでは反映されません。
「座っている」と「走っている」のような矛盾指定、または除外したいものをどう書くかは、直訳の罠とは別の問題系です。前者は要素を整理する話、後者はネガティブプロンプトの設計の話になります。
→ 関連トピック:画像生成AIネガティブプロンプト完全ガイド(日本語の意図から英語ネガティブを逆引きで選ぶ方法・FLUXのような効かないモデルへの対応)と、モデル別プロンプト記法ガイド(タグ系・自然文系・ハイブリッド系の3類型)も併せて参照してください。
また、「同じキャラを別シーンで描き続けたい」という典型課題には、画像生成AIでキャラクターの一貫性を保つ方法(Seed 値固定・LoRA・--cref の限界とキャラ・状態・背景の独立部品化による根本解決)が直接の解決策になります。