The Useful Question
日本語

AIはノイズからどう絵を作る? 赤いマグカップが現れるまで

拡散モデルは、ノイズを含むデータをどう変えると画像に近づくかを学び、その知識で新しい絵を作ります。 学習では画像にノイズを加えて練習問題を作り、生成ではランダムな出発点から、学習済みのモデルを繰り返し使います。 砂嵐の奥に完成画が隠れているわけではありません。まず、この二つの時間を分けると仕組みが見えてきます。

赤いマグカップは、いつ決まる?

「赤いマグカップ。持ち手は右」と注文したとします。底が丸いか、机は木製か、光はどちらから来るか。その一文では、まだ決まっていません。

画像生成は、その空白を含めて一枚を組み立てる仕事です。以下のマグカップは説明用の創作で、実際にモデルへ入力して得た結果ではありません。ノイズだけを見ても「赤いマグカップ」が読み取れるわけではなく、学習した画像の傾向と文章の条件が、生成の進む方向に関わります。

学習では、わざと見えにくくする

代表的な拡散モデルの学習では、元画像と、そこへ加えるランダムなノイズを用意します。少しざらつく程度から、ほとんど形が見えない状態まで、ノイズの強さを変えます。モデルにはノイズを含む画像と、その段階を示す情報を渡し、たとえば「加えられたノイズ」を予測させます。

こちらが加えたノイズは分かっているので、予測とのずれを測れます。そのずれが小さくなるようにモデルの数値を調整する。多数の画像とノイズ量で繰り返すことで、さまざまな荒れ方に対する修正の仕方を学びます。ノイズを順番に足す説明がよく使われますが、実際の学習では途中の段階を直接作れます。毎回、最初から最後まで動画のように進める必要はありません。DDPM論文、学習と生成の手順

これは「一枚の正解を覚え、その画像だけを磨く」という課題に限定されません。丸い縁、取っ手、陰影などを含む画像の規則性が学習に関わります。ただし、後で述べるように、元の画像を記憶する可能性まで否定できるわけではありません。

学習用の画像にノイズを加える上段と、新しいノイズから別の画像へ更新する下段。二つのマグカップは別の創作図で、生成履歴ではない。
本稿のために制作したオリジナル説明図
図を拡大して読む

図の中を横にスクロールできます(キーボードの左右キーにも対応)

学習用の画像にノイズを加える上段と、新しいノイズから別の画像へ更新する下段。二つのマグカップは別の創作図で、生成履歴ではない。
図を原寸で開く

図は本記事のオリジナル模式図です。色の粒やカップの変化は説明のために描いたもので、実モデルの中間出力、画素の計算、必要なステップ数を再現していません。

生成では、練習済みのモデルを使う

新しい絵を作るときは、通常、完成画を渡さずにランダムなノイズから始めます。モデルの予測を使って状態を更新し、次の段階でもまた予測する。この繰り返しが、よく「ノイズを取り除く」と説明される処理です。厳密な更新式や、途中で新たな乱数を使うかは方式で異なります。

文章を条件にするモデルでは、入力文も数値の表現に変換して利用します。「赤い」「マグカップ」「持ち手は右」が、同じ場所に文字として貼り付くのではなく、画像を変える計算への手掛かりになります。GoogleのImagenも、文章の表現を画像生成に用いる例です。Imagen論文

ここで、学習時の元画像に戻ることが目的なのではありません。注文と学習した傾向に沿う、新しい候補を作ります。文章にない机の色も決める必要があるので、同じ注文から一通りの答えだけが出るとは限らないのです。赤いカップができても、持ち手の向きまで注文どおりかは、完成した絵で確かめます。

画素ではなく「圧縮した表現」を直すこともある

大きな画像の全画素を何度も処理するのは重い仕事です。Latent Diffusionの原論文では、画像をエンコーダーで小さな潜在表現に変換し、その空間で拡散の学習と生成を行います。最後にデコーダーで、人が見られる画像へ戻します。Rombachらの原論文、第3節

潜在表現は、机や持ち手に名前を付けた一覧表ではありません。画像の特徴を扱う、学習された数値の並びです。「小さな画像を拡大するだけ」と考えると、そこで何度も生成の計算をする点が抜け落ちます。上の図で見えるカップは理解のための置き換えで、潜在表現そのものを可視化したものでもありません。

「拡散」だけでは、すべての画像AIを説明できない

ここまでの説明は代表的な仕組みです。名前が似ていても、学習で何を予測させるか、どの経路を通って画像へ近づくかは変わります。

2024年発表のStable Diffusion 3は、Rectified Flowを使う例です。学習時にノイズとデータを結ぶ経路を置き、その上で状態をどう動かすかを学ぶ考え方で、Flow Matchingに関係します。「毎段階で加えたノイズを当てる」という説明を、そのまま全方式へ当てはめることはできません。SD3はここでは技術の例で、最新機種という意味ではありません。Stability AIの技術紹介、SD3論文

また、画像を表す符号を順に予測する自己回帰方式もあります。Taming Transformersの論文はその一例です。潜在表現は「どこで計算するか」、拡散やFlow Matchingは「どう学ぶか・生成するか」に関わる言葉なので、全部を互いに排他的な分類と考える必要もありません。

一枚を見たときに、分かることと分からないこと

この仕組みを「検索した画像の切り貼り」だけで説明するのは不十分です。一方で、「計算して作るから元画像の記憶は絶対にない」とも言えません。特定の拡散モデルから学習画像を取り出せた研究があります。その結果は、すべての出力が複製だという意味ではありません。Carliniらの研究

画像を使うなら、出来栄えと別に、素材の出所や使うサービスの利用条件も確認します。きれいなカップが描けた事実だけでは、学習データの内訳や、その絵の利用上の問題までは分かりません。

覚えておきたいのは、学習の「ノイズを加えて問題を作る」と、生成の「学んだ予測で新しい画像へ近づける」の違いです。AIの文章が流暢でも根拠を確かめる必要がある話は、自信ありげな誤答の仕組みで扱っています。

出典と確認範囲

一次資料を2026年10月11日(日本時間)に確認。これは原理解説で、実モデルの生成試験や最新サービスの比較ではありません。図も生成履歴ではなく創作です。論文の訂正や、採用方式の説明を追加するときに更新します。