Stable Diffusionのimg2imgで構図を崩さずに画像を変換するなら、Denoising strength(ノイズ除去強度)を0.3〜0.45に抑え、元画像と出力サイズの縦横ピクセル比を一致させ、輪郭保持にControlNetを組み合わせる設定が一択です。
元画像の良い構図を残したいのに、生成ボタンを押すたびにまったく別のポーズや顔へ激変してしまい、頭を抱えていませんか。
画像生成の基礎知識を深めたい方は、t2iとは文章から画像を作るAI|i2iとの違いと無料/月20ドルの選び分けを先に読むと仕組みの違いがすんなり分かります。
img2imgとは何か?text2imgとの決定的な違い

img2imgは、手持ちの画像をベースにして新しいグラフィックへ描き直す画像生成の基本機能です。
ゼロから絵を組み立てるtext2imgと違い、下絵が存在するため、キャラクターの姿勢や全体の配色バランスを保ちやすい特徴があります。
【text2img】
ランダムなノイズ + テキスト指示 ──> 完全新規の画像
【img2img】
元画像 + ノイズ付加 + テキスト指示 ──> 元の骨格を引き継いだ新画像
img2imgとは、手元にある元画像を読み込ませ、AIへの指示文と掛け合わせて新しい画像を生成する技術です。
text2imgが真っ白なキャンバスにプロンプト(AIへの指示文)だけで描くのに対し、img2imgは既存画像の構図や輪郭を手がかりに筆を進めます。
元画像に一定量のノイズをわざと混ぜ、そのノイズを取り除く計算過程でプロンプトの内容を反映させる仕組み。
元のポーズを残したまま服装を変えたり、粗い手描きラフを精緻なイラストに仕上げたりする作業で重宝します。
商用デザインやバナー制作の現場では、構図の一貫性が求められる場面が日常茶飯事です。
AI画像生成の全体像を把握したいときは、AI画像生成カテゴリにまとめたツール群の特性を見比べると見通しが立ちます。
text2imgだけで理想のポーズを狙おうとすると、何十回もガチャを引き続けることになりかねません。
img2imgを味方につければ、構図決めの試行錯誤を大幅にショートカットできます。
構図を崩さず画像を変換する3つの設定項目

img2imgで元画像の骨格をそのまま維持するには、画面の変形を防ぐ3つの数値を正しく押さえる必要があります。
設定を誤ると、どれほど精緻なプロンプトを打ち込んでも下絵のバランスが跡形もなく吹き飛びます。
【構図を固定する3大設定】
1. Denoising strength : 0.30 〜 0.45 (これを超えると構図崩壊)
2. 縦横解像度比率 : 元画像のアスペクト比と1ピクセルも狂わせない
3. ControlNet併用 : LineartやDepthで輪郭線を強制ロック
1つ目の設定項目は「Denoising strength(ノイズ除去強度)」の抑制です。
元画像の情報をどれくらい破壊して描き直すかを決めるスライダーであり、数値を下げるほど元絵の構図が強く残ります。
2つ目の設定項目は「出力解像度と元画像のアスペクト比の完全一致」です。
元画像が横長なのに出力設定を正方形のまま走らせると、被写体が横に押し潰されたり、余白を埋めるために勝手な人物が生えてきたりします。
3つ目の設定項目は「ControlNetによる輪郭線の物理的な固定」です。
Denoising strengthを少し高めに設定して画風を大胆に変えたい場合でも、線画抽出のプリプロセッサを挟めばポーズの破綻をゼロに抑え込めます。
設定の基本思想はいたってシンプル。
「AIの気まぐれな解釈をどこまで制限するか」をパラメーターで統制する作業に尽きます。
Denoising strength(ノイズ除去強度)の最適値はどう選ぶ?
Denoising strengthは、元画像の崩れやすさを決定づける最も影響力の強い設定項目です。
数値を0.05刻みで変えるだけで、出力結果は劇的に変化します。
作業目的に応じたDenoising strengthの推奨設定値を次の表に整理しました。
| 設定値の | 元画像の | 構図の | 主な用途・ |
|---|---|---|---|
| 0.10 〜 0.25 | ほぼそのまま | 極めて高い | ノイズ除去、微細な質感向上、アップスケール時の粗隠し |
| 0.30 〜 0.45 | 構図を完全維持 | 高い | 服装の色変更、画風の微調整、元絵のポーズを崩さない変換 |
| 0.50 〜 0.65 | 輪郭が揺らぐ | 中程度 | 実写からアニメ調への変更、大まかなポーズを残した別キャラ化 |
| 0.70 〜 0.85 | 原形が消失 | 低い | ラフ画からの清書、元画像の配色だけを借りた新規作成 |
| 0.90 〜 1.00 | 元画像の影響なし | 崩壊 | ほぼtext2imgと同義。下絵の要素はほぼ無視される |
つまり、元画像の構図を1ミリも崩したくないときは0.30から0.40の範囲に留めるのが鉄則です。
0.50を超えた瞬間、AIは元画像の被写体を「大まかな配置のヒント」としか見なさなくなります。
ポーズの傾きや指の形、背景のパースが勝手に書き換わる境界線が0.50付近に存在します。
最初は0.35あたりからテスト出力を始め、変化が足りない場合のみ0.05ずつ数値を引き上げる運用が安全。
画風だけをガラリと変えたいのに数値を上げると構図が崩れるジレンマには、後述するControlNetが答えを出してくれます。
リサイズモード4種の特徴とアスペクト比崩れを防ぐ設定
Automatic1111などのStable Diffusion WebUIには、元画像と出力解像度が異なる場合の処理方法として4種類のリサイズモードが用意されています。
選択を間違えると、人物の顔が縦長に伸びたり体型が太くなったりする歪みが発生します。
【リサイズモードの挙動イメージ】
Just resize : 比率を無視して引き伸ばす(顔が伸びる)
Crop and resize : 比率を維持して中央を切り抜く(端が見切れる)
Resize and fill : 余白を生成画像で補完する(端に変な描画が出る)
Just resize (latent): 潜在空間で引き伸ばす(歪みやすい)
各リサイズモードの動作特性と実務での推奨度は以下の通りです。
| モード名 | 処理の | 歪みの | おすすめ用途 |
|---|---|---|---|
| Just resize | 元画像を指定サイズへ無理やり引き伸ばす | 高い(縦横比が変わると変形) | 元画像と出力解像度が完全同寸の場合のみ |
| Crop and resize | 比率を維持したまま、はみ出た余白を切り落とす | なし(変形しないが見切れが発生) | 構図の中央部分だけを切り取って出力したいとき |
| Resize and fill | 比率を維持して配置し、足りない余白をAIが描く | 低い(境界線の不整合リスクあり) | 画角を外側に少し広げたいとき(アウトペイント) |
| Just resize (latent) | 画像処理ではなく潜在変数空間で拡縮する | 高い(モヤや崩れが出やすい) | 実務では非推奨。特別な実験用途向け |
つまり、特別な理由がない限り「Crop and resize」を選ぶか、元画像と全く同じ解像度を指定したうえでの「Just resize」が正解です。
一番の安全策は、あらかじめ元画像の縦横ピクセル数を測り、WebUIの「Width」「Height」に同じ数値を手入力すること。
元画像が800×1200ならば、生成側のスライダーも800×1200に揃えます。
解像度を大きくしたいときは、元画像の比率(この場合は2:3)を電卓で計算し、整数倍または正確な比率を維持した数値を設定してください。
比率のズレを放置したままプロンプトを練り直しても、歪みは一生直りません。
CFGスケールとサンプラーが与える元画像への影響
構図の保持には、プロンプトへの忠実度を司る「CFG Scale」と描画アルゴリズムである「Sampling method」の選定も静かに影響します。
Denoising strengthほど目立たないものの、調整を怠ると画面全体の輪郭がチリチリと乱れ始めます。
CFG Scaleは「AIが指示文にどれだけ厳密に従うか」を示す係数です。
通常は7.0前後で運用されますが、img2imgで元画像のディテールを守りたい場合は5.0〜6.5前後のやや低めが安定します。
指示文を強く効かせようとしてCFGを10以上に引き上げると、元画像の陰影とプロンプトの指示が衝突し、コントラストが極端に焼き切れたような濁った絵になります。
【CFG Scaleの目安】
4.0 〜 6.0 : 元画像の陰影や筆致に馴染みやすい(構図維持向き)
7.0 〜 8.0 : 通常の標準値。バランスが良い
9.0 〜 12.0: 指示文が最優先され、元画像の階調が潰れやすい
サンプラーの選択では「DPM++ 2M Karras」や「Euler a」が広く使われています。
収束が速いDPM++ 2M系は、少ないステップ数(20〜25ステップ)でも破綻の少ない滑らかな線を描き出します。
ステップ数を40以上に増やしすぎると、ノイズ除去の計算が過剰に進み、元画像の筆致が削ぎ落とされるケースが目立ちます。
ステップ数は25〜30前後、CFGは6.0前後に固定しておくのが、下絵を活かす最短ルートです。
プロンプト(AIへの指示文)の書き方で元画像のディテールを残すコツ
img2imgにおけるプロンプトの役割は、ゼロからの情景描写ではなく「元画像に対する差分指示」です。
構図全体を長文で説明し直すと、AIがその説明を優先して新しいレイアウトを組み立て直してしまいます。
【失敗しやすいプロンプト】
a beautiful girl standing in the park, sunny day, blue sky, trees in the background...
(構図や背景を全部書き直すと、元画像の背景が別物に置換される)
【成功しやすい差分プロンプト】
masterpiece, high quality, (wearing red leather jacket:1.2)
(変更したい要素だけを強調括弧で指定する)
元画像にすでに写っている要素(青空、机、立ちポーズなど)は、プロンプトに細かく書かないほうが無難です。
変更したい「服装」「髪色」「質感」といったピンポイントの差分だけを記述します。
残したい特徴がある場合は、変更点以外の描写を極力削ぎ落とし、画質向上系のキーワード(masterpiece, highly detailedなど)を添える程度に抑えるのが賢明。
ネガティブプロンプトにも余計な指示を詰め込みすぎない配慮が欠かせません。
「bad anatomy, blurry, low quality」といった基本的な破綻防止タグに留めておきます。
過剰なネガティブプロンプトは元画像の持つ独特な色合いや光の反射まで打ち消してしまうため、逆効果になる場面が少なくありません。
デザイン制作のワークフロー全体を効率化したい方は、AIデザインカテゴリやAIデザインツールのランキングを確認しておくと制作の幅が広がります。
ポーズと輪郭を完全に固定するControlNetの併用手順
Denoising strengthを0.6以上に引き上げて画風を一変させたいとき、唯一の救世主となるのがControlNetです。
拡張機能として導入できるControlNetを挟むことで、元画像の輪郭線や深度情報を物理的なガイドとして強制適用できます。
【ControlNetの協調動作】
元画像 ──> ControlNet(Lineart抽出で線画化) ──┐
├──> 輪郭完全固定で再描画
元画像 ──> img2img(Denoising 0.65で色と光を変換)┘
ControlNetで活用される代表的なプリプロセッサと、img2img併用時の役割は次の通りです。
| プリプロセッサ | 抽出される | 構図維持の | 最適な |
|---|---|---|---|
| lineart / canny | 物体や人物の外形線・輪郭 | 圧倒的 | イラストの線画を維持したまま着色や絵柄を変えたいとき |
| depth (Midas / Zoe) | 画面の奥行き・立体構造 | 高い | 部屋のパースや背景の立体感を崩さずに質感を変えたいとき |
| openpose | 人物の骨格・関節の位置 | 中程度(ポーズのみ) | 体の向きや手足の位置だけを守り、体型や服をガラリと変えたいとき |
| softedge (hed) | 柔らかい輪郭・明暗の境界 | 高い | 水彩画や油絵など、硬い線画を持たないアートの変換 |
つまり、線画のニュアンスまでミリ単位で固定したいならlineart、人物の姿勢だけをトレースしたいならopenposeを選ぶのが定石です。
具体的な手順はシンプル。
WebUIのControlNetタブを開き、img2imgと同じ画像を放り込んで「Enable(有効化)」にチェックを入れます。
「Preprocessor」にlineartを選び、対応する「Model」を指定するだけ。
Control Weight(制御の重み)を1.0にしておけば、Denoising strengthを0.75まで跳ね上げてもポーズが1ミリも狂いません。
手描きの棒人間やラフスケッチから完成イラストを立ち上げる際にも重宝する設定です。
部分修正したいときのInpaint(インペイント)の使い方
画像全体の構図は気に入っているものの、顔の崩れや指先の歪みだけを直したい場面では、img2img内部の「Inpaint」を使います。
画面全体を再生成する通常のimg2imgとは異なり、塗りつぶしたマスク領域だけをピンポイントで書き換える機能です。
【Inpaintの画面と処理領域】
┌──────────────────┐
│ 元画像(保持) │
│ ┌─────┐ │
│ │MASK │ <── ここだけを再生成(顔や手)
│ └─────┘ │
│ 元画像(保持) │
└──────────────────┘
Inpaintを使う際、最も重要なのが「Inpaint area」の選択です。
設定欄に「Whole picture(全体)」と「Only masked(マスクのみ)」の二者択一が存在します。
顔だけを綺麗に描き直したいときは、「Only masked」を選び、Padding(周囲の参照余白)を32〜64ピクセル程度に設定するのが鉄則。
マスクされた狭い領域だけを一時的に拡大して高解像度で再生成するため、引きの構図でも顔のディテールが潰れません。
Denoising strengthは0.45〜0.60程度に設定します。
プロンプトには画像全体の情景ではなく、マスク部分に描いてほしい要素(例: detailed beautiful eyes, smiling face)だけを入力してください。
周囲の背景や体勢は完全に維持されたまま、違和感のない修正が数秒で完了します。
元画像の解像度を保ったまま高品質化する高解像度化の手順
低解像度で仕上がった画像の構図を保ちつつ、細部の描き込み密度を2倍から4倍へ跳ね上げる処理にもimg2imgが役立ちます。
単なるドット補間による引き伸ばしと異なり、AIが毛髪や服の繊維などの微細なディテールを描き足しながら拡大してくれます。
【img2imgアップスケールの流れ】
768×768の生成画像 ──> SD upscale(タイリング分割処理)
├── 0.25〜0.35の低Denoising
└── 1536×1536の高精細画像へ変換
手順として最も手軽なのは、Scriptsスライダーから「SD upscale」を選択する手法です。
画像を複数のタイル状に分割し、それぞれに低いDenoising strength(0.20〜0.30)を当ててアップスケールを施します。
Denoising strengthを0.35以上に上げてしまうと、分割タイルの継ぎ目ごとに別の顔や模様が生成され、モザイク状の異様な画像に仕上がってしまいます。
拡大アルゴリズム(Upscaler)には「R-ESRGAN 4x+」やイラスト向けの「R-ESRGAN 4x+ Anime6B」を指定するのが標準的。
VRAM容量が8GB程度の一般的なグラフィックボードでも、メモリ不足でクラッシュすることなくポスター印刷レベルの高精細画像を出力できます。
画像の拡大や編集作業を自動化して量産体制を整えたいなら、AI自動化カテゴリやAI自動化ツールのランキングで紹介している連携手法も参考になります。
変換元の画像形式はどう選ぶ?実写・イラスト・線画の向き不向き
手持ちの元画像がどのような性質を持っているかによって、img2imgの成功率は大きく左右されます。
入力する元画像の特性と、変換時に意識すべきポイントを次の表にまとめました。
| 元画像の | 特徴と | Denoising設定の | 最適な |
|---|---|---|---|
| 実写写真 | 情報量が多く陰影が複雑 | 0.35 〜 0.50 | 実写の質感を活かすか、アニメ調モデルで大胆に絵柄を倒す |
| 手描き線画・ラフ | 色情報がなく白黒 | 0.65 〜 0.80 | ControlNet(Lineart)を併用して色付けのプロンプトを流し込む |
| 3Dモデル・ポーズ人形 | 立体感はあるがテクスチャが不自然 | 0.50 〜 0.60 | 骨格をキープしつつ、リアルな肌や服の質感をAIに補完させる |
| AI生成の既存画像 | 構図は完璧だが指先や装飾が甘い | 0.20 〜 0.35 | Inpaintで部分修正するか、低ノイズで全体の解像感を一段引き上げる |
つまり、元画像が持っている情報量が多いほど、Denoising strengthは低めに抑えるのが安定の近道です。
線画のように情報がスカスカな画像から着色済みの絵を生み出す場合は、ノイズを多めに与えないとAIが新しい色を塗れません。
逆に、完成された実写写真から構図を維持したままイラスト化するなら、0.40付近でモデルの作風を反映させるアプローチが綺麗に決まります。
入力画像の解像度が極端に低すぎると、ノイズ除去の初期段階で輪郭がボケてしまうため、最低でも512ピクセル四方以上の画像を用意してください。
img2imgでよくある失敗パターンと対処法
パラメーターを慎重に設定したつもりでも、意図しない描画の乱れに遭遇することは珍しくありません。
制作現場で頻発する典型的なトラブルと、その即効性のある解決策を整理しました。
| 失敗の | 原因 | 即効性の |
|---|---|---|
| 顔や体が二重に描かれる | 出力解像度を無理に高く設定しすぎている | 元画像の解像度と同寸で生成し、後からアップスケールする |
| 色が極端に濃く焼き切れる | CFG Scaleが高すぎるかノイズ過多 | CFGを5.0〜6.5に下げ、Denoisingを0.35前後に戻す |
| 元画像のポーズが跡形もなく消える | Denoising strengthが0.55を超えている | 数値を0.35まで落とすか、ControlNetのOpenPoseを併用する |
| 画面全体が白くモヤがかる | VAEが正しく読み込まれていない | モデルに対応した正しいVAE(例: vae-ft-mse)を再指定する |
つまり、画像が崩れたときはプロンプトを疑う前に、解像度とDenoising strengthの数値を真っ先に見直すのが解決への近道です。
特に人物が2人並んでしまったり頭が2つ生えたりする現象は、モデルが学習した標準サイズ(SD 1.5なら512×512、SDXLなら1024×1024)から大きくかけ離れた横幅や縦幅を指定した際に多発します。
画像サイズを欲張らず、最初は小さめの同寸サイズで出力し、気に入った構図が引けた段階で高解像度化に回す段取りが最も無駄がありません。
他の画像生成ツールとの描画力や操作性の違いを俯瞰したいときは、Midjourney vs ChatGPT Images 2.0(旧DALL·E 3)vs FLUX|AI画像生成を6軸で比較 (2026年版)が役立ちます。
また、中国発の最新オープンソースモデルの動向については、Qwen-Image 2.1とは?2K解像度と文字編集に対応するオープンソースモデルの商用利用と使い方でも詳しく取り上げています。
AI PICKS編集部の判定
公開されている検証情報やユーザーコミュニティの知見を突き合わせると、構図を維持した画像変換においてStable Diffusionのimg2imgとControlNetの組み合わせは今なお一択です。
Midjourneyやクラウド型の画像生成サービスも画像プロンプト機能を次々に強化していますが、輪郭やポーズを1ピクセル単位で制御する用途に関しては、ローカル環境のWebUIが圧倒的な自由度を誇ります。
商用制作の現場で最大のネックとなる「生成ボタンを押すたびに構図が暴れる問題」を論理的に押さえ込める手段は、事実上このスタックしかありません。
正直イマイチな点を挙げるなら、環境構築の手間とVRAM要件のシビアさです。
グラフィックボードの性能が低いPCでは動作が重く、パラメーターの相関関係を理解するまでに一定の学習コストがのしかかります。
それでも、手描きのラフスケッチをミリ単位で整調しながらクライアントワークの水準まで引き上げる道具として、手放せない選択肢であることは明白です。
手軽さ重視のクラウドツールに頼るか、完全な制御権を握るためにWebUIを使い倒すか。
構図の固定を絶対条件とするプロフェッショナル用途なら、迷わずローカルのimg2img環境を整えるのが確実な投資になります。
あわせて見たいツール・カテゴリ
画像生成AIの導入や周辺スキルの習得に役立つカテゴリーと関連ページをピックアップしました。
- AI画像生成ツールの比較と選び方
- 最新AI画像生成ツールのおすすめランキング
- デザイン業務を効率化するAIツール特集
- デザイナー向けAIツールの人気ランキング
- 業務自動化を実現するAIワークフロー
- 文字入り画像はIdeogramかChatGPTか|バナー・サムネ・ロゴ別に比較 (2026年版)
よくある質問(FAQ)
Q. img2imgを使うために必要なPCスペックの目安は?
NVIDIA製のグラフィックボードを搭載し、VRAM(ビデオメモリ)が8GB以上あるパソコンが目安です。
SD 1.5ベースであれば8GBで快適に動きますが、SDXLなどの高解像度モデルやControlNetを複数同時に動かす場合は、12GB以上のVRAMを積んだ環境を用意すると処理落ちを防げます。
Q. Denoising strengthを0にするとどうなりますか?
元画像とまったく同じ画像がそのまま出力されます。
ノイズが1滴も追加されないため、AIが新しい描画を描き足す余地がなくなり、プロンプトにどれほど強力な指示を書いても一切反映されません。
変化を起こすためには、最低でも0.15以上の数値を設定する必要があります。
Q. 生成した画像の顔がどうしても元画像と変わってしまうときの対策は?
ControlNetの「IP-Adapter」を導入して顔の特徴量を抽出するか、生成後に「Inpaint」で顔部分だけを再生成するのが有効です。
通常のimg2imgだけで元画像の顔立ちを100%維持するのは難しいため、キャラクター固定用の追加モジュールを併用するのが実務での定石となっています。
Q. 元画像より解像度を落として生成しても大丈夫ですか?
出力解像度を極端に小さくすると、細部のディテールが潰れて構図が崩れやすくなります。
特に人物の目や指先は、解像度が下がるほど破綻の確率が跳ね上がります。
元画像と同等以上のサイズを指定するか、一度同寸で生成した後に高解像度化の手順を踏んでください。
Q. 商用利用する際の著作権やライセンスの注意点は?
使用しているベースモデルやLoRAのライセンス条項に完全に依存します。
モデル配布サイトに記載されている商用利用の可否フラグを必ず個別に確認してください。
また、第三者が著作権を持つイラストや写真を元画像としてimg2imgに読み込ませて生成した場合、元の著作権を侵害するリスクがあるため、権利関係がクリアな自作素材やフリー素材を下絵に使うのが鉄則です。
Q. スマホで描いた落書きからでも綺麗なイラストを作れますか?
十分可能です。
スマホのお絵描きアプリで描いた簡単なカラーラフを元画像として読み込ませ、Denoising strengthを0.65〜0.75程度に設定してプロンプトで描きたい情景を指定すれば、AIが色や立体感を補完して本格的なイラストへ昇華させてくれます。
次に読むならこれ: 画像生成の基本的な仕組みと、テキストからの指示出しとの違いを体系的に整理したい方は、t2iとは文章から画像を作るAI|i2iとの違いと無料/月20ドルの選び分けをあわせて読むと、ワークフロー全体の使い分けがより明快になります。

