技術解剖 · Vol.05

学習させたことのない服なのに、
そのブランドらしく着こなしていました

ブランドのルックブックを学習させると、そのブランドの服の着せ方までまねるようになります。

前の二本はフィットの話でした。言葉で指示してもうまくいかず語彙をさらに細かく分けてもうまくいきません。そこで、ブランドの服でモデルを直接学習させてみました。

この実験を行った理由はフィットではありませんでした。フィットが引き継がれることは、以前のブランドですでに確認していました。今回確かめたかったのは、その服をどう着せるかです。

この実験で検証したかった提案

御社のブランドを学習させておきました。

「これからは新作が出たら、服の写真を一枚だけください。御社の雰囲気でコーディネートして、商品ページに載せるカットまでお作りします。」

ブランドは新作が出るたびにルックブックを撮影します。モデルを呼び、スタジオを押さえ、スタイリストが靴や小物を合わせます。そのブランドがこれまで撮ってきたルックブックには、そのブランドが服をどう着せるかがすでにすべて詰まっています。

結果はこうです。パンツを一枚入れると、トップスが作られ、ひと揃いのコーディネートとして出てきます。トップスは一度も入れていません。

01 · The Setup

何を入れたか

学習は、問題と答えをペアにして入れる方式です。問題はパンツの商品カット一枚、答えはそのパンツを着用したルックブック写真一枚です。

学習に使ったペア4組。列の見出しは「入力・平置き」と「正解・着用カット」。左はパンツの平置きカット、右は同じパンツを着用したカットで、トップス・靴・靴下・バッグも一緒に写っている。
学習に入れたペアのうち4組です。各ペアの左の列(見出し「入力・平置き」)が問題、右の列(見出し「正解・着用カット」)が答えです。このようなペアを114組入れました。

このようなペアを114組作って入れました。服114着分ということになります。

そして、11着はあえて外しておきました。この11着は一度も学習に入れていません。学習が終わったあとでこれらの服の商品カットだけを入れ、ブランドが実際に撮ったルックブックのカットと並べて見比べます。

114学習に入れた服
11外しておいた服(結果の確認に使用)
0両方に含まれる服

外しておく理由は単純です。学習に入れた服で結果を見ると、モデルがその服を覚えたのか、ブランドを学んだのか区別できません。

ただし、隣に並べるルックブックのカットを正解とは呼びません。ブランドがそのパンツで撮ったカットは何枚もあり、同じパンツに別のトップスを合わせたカットもあります。私たちの結果がその一枚と違うからといって、間違いというわけではありません。

02 · What Came Back

ブランドのルック&フィールをまねします
区切り線の上は学習に使ったブランドのルックブック写真12枚。下は学習に含まれていないパンツ11本を入れた結果のすべてで、各マスに小さな商品カットと、生成された大きなコーディネート全身カットが並ぶ。
区切り線の上は、学習に使ったブランドのルックブック写真12枚です。ブランドは服をこう着せます。区切り線の下は、一度も学習に入れていないパンツ11本を入れて出てきた結果のすべてです。各マスの小さいほうが入れた商品カット、大きいほうが出てきた結果です。

入力はパンツ一枚です。トップスを入れたことはないのに、11本すべてでトップスが作られました。適当なトップスが付いたのではなく、そのパンツに合わせて、このブランドならこう着せただろうと思える一着が出てきます。

いくつかは偶然とは考えにくいものです。

上段の見出しは「赤いトラックパンツ:太ももの外側に角張ったパネル」、下段は「ネイビーのトラックパンツ:同じことがもう一度」。列は左から入れた商品カット、私たちの結果、ブランドの実際の写真。どちらも太もも外側の角張ったパネルが、生成されたジャケットの肩と袖の上部に移っている。
上段は赤いトラックパンツ、下段はネイビーのトラックパンツです。列は左から、入れた商品カット、私たちの結果、ブランドの実際の写真です。太ももの外側に配された角張ったパネルが、そのままジャケットの肩と袖の上部に載っています。ブランドが実際に撮った写真も、同じ位置に同じパネルがあります。色を合わせただけでなく、柄をどの部位に置くかが一致しました。赤とネイビーで、それぞれ別々に一度ずつ出てきました。
見出しは「グレーのピンストライプパンツ:パンツを一枚入れただけです」。列は左から入れた商品カット、私たちの結果、ブランドの実際の写真。グレーのピンストライプパンツを一枚入れると、同じ生地のブレザーを前を開けて着て、白いインナーを合わせた結果が出てくる。
グレーのピンストライプパンツで、入れたのはパンツ一枚だけです。列は左から、入れた商品カット、私たちの結果、ブランドの実際の写真です。ここは服が合っているだけではありません。同じ生地のブレザーを作り出し、前を開けて着て、白いインナーの裾がジャケットの下からのぞき、両手をパンツのポケットに入れています。ブランドが実際に撮った写真そのままです。
見出しは「同じパンツ一枚、条件だけ変えて4回:4回とも頭に何かをかぶって出てきました」。入れた商品カットに続き、「小さく・標準」「小さく・強く」「大きく・標準」「大きく・強く」と書かれた結果4枚、最後に「帽子なし」と書かれたブランドの実際の写真が並ぶ。4枚ともビーニーかフードをかぶっている。
同じパンツ一枚を、条件だけ変えて4回生成しました。条件は各パネルの見出しのとおり、画像サイズ(小さく・大きく)と強さ(標準・強く)の組み合わせです。4回ともビーニーかフードをかぶって出てきました。入力にもなく、説明文にもなく、ブランドがこの服で撮った写真(見出し「帽子なし」)にもありません。学習に使った写真には、ニットビーニーが11枚あります。

これはこの服の正解ではありません。ブランドがよくやることというだけです。ただ、条件を変えても出続けるということは、一度きりの偶然ではないという意味です。

ただし、ブランドよりもこのクセを多用します。学習に使った写真で上下を同じ生地でそろえているのは114枚中26枚ですが、結果では11本中7本がそうなっています。

03 · Where It Came From

学習に使ったルックブック写真にそのまま写っています

先ほどの学習ペアを見直すと、答えがわかります。私たちが入れたのはパンツ一枚ですが、答えとして使った写真には、ジャケットも靴も靴下もバッグも一緒に写っています。ところが、その写真に付けた説明文はパンツしか記述していません。

ここでいう説明文とは、学習写真ごとに付ける一行の記述です。どんな服なのかを文章にして、写真と一緒に入れます。

見出しは「学習に入れたペアの一つ」。左は学習写真、右は「この写真に付けた説明文」でパンツだけを記述している。その下の「写真にはあるのに説明文にないもの」には、キャメルのブレザー、プリントシャツ、茶色の革靴、黒いバッグ、サングラス、立ち姿と手の位置、グレーのスタジオ背景が並ぶ。
左が学習に入れた写真、右がそれに付けた説明文です。説明文はパンツしか記述していません。ジャケットも革靴もバッグも背景も、ひと言も出てきません。画像内の「写真にはあるのに説明文にないもの」のリストには、キャメルのブレザー、プリントシャツ、茶色の革靴、黒いバッグ、サングラス、立ち姿と手の位置、グレーのスタジオ背景と書かれています。

説明文に書いていないことを学びます

学習では、写真とその写真を説明する文章をペアにして入れます。モデルは、写真にはあるのに文章が説明していないものを、ブランドの特徴のほうへまとめて押し込みます。

今回の学習セットの説明文は、114本とも後半部分が一字一句同じでした。服の記述だけが違い、残りはすべて同じ文章です。そのため、コーディネートも背景もポーズまで一緒に学習されました。

04 · Alpha

服が浮いて見えました

ブランドらしさは出ていました。ところが、服が浮いて見えました。生地が色を塗ったように平たく出て、遠目にはそれらしく見えても、近くで見ると服に見えませんでした。

最初に考えたのはこれでした。学習したものをもっと強く効かせればいいのではないか。

強く効かせるとはどういうことか

第1回で、この方式を分厚いマニュアルの上に薄いメモを貼ることにたとえました。元のモデルはそのままにして、ブランドのルックブックから作った薄いメモをその上に重ねます。

そこで調整できる値をいくつか紹介しましたが、そのメモをどれだけ強く反映させるかを決める値がそのひとつです。1.0が基本です。上げると元のモデルから離れ、メモのほうへより強く引っ張られます。0にするとメモがまったく効かなくなり、元のモデルのまま出てきます。

1.0から1.3に上げてみました。

うまくいきませんでした。ボリュームは一貫して大きくはならず、一部の服はかえって小さくなりました。方向も一定しませんでした。適用の強さでは調整できません。学習がとらえきれなかったものは、強く効かせても出てきません。

05 · Image Size

解像度を上げたら解決しました

浮いて見える原因は質感でした。学習時に写真を小さく縮めて入れていたため、生地の目のような細かい情報がその段階ですでに失われていました。

写真を大きく入れるように変えて、学習し直しました。消えていたディテールが戻ってきました。ピンストライプがくっきりし、クレープの凹凸がよみがえり、脇線のテープが見えるようになりました。

見出しは「同じ服を拡大したものです」。同じ服4着を拡大し、「元の商品カット」「小さく学習」「大きく学習」「ブランドの実際の写真」の4段で比較している。
同じ服を拡大したものです。段は上から、元の商品カット、小さく学習、大きく学習、ブランドの実際の写真です。2段目が小さく学習した結果で、生地が平たくなっています。3段目は大きく学習したもので、しわや生地の目がよみがえっています。いちばん下が、ブランドが実際に撮った写真です。

強く効かせる値ではなく、画像をどれだけ大きく見せるかが結果を変えました。

06 · Too Much

過学習すると出力が固まります

学習とは、写真を見せてモデルを少し直す作業をひたすら繰り返すことです。その繰り返し1回を「1回回した」と数えます。今回の学習は2,052回回し、その間に途中の状態を21回保存しました。

たくさん回すほど良くなるわけではありません。ある地点を越えると、毎回同じものばかり出てくるようになります。いちばんよくわかるのが靴です。

同じ服5着のふくらはぎから下を2つの地点で比較。左列の見出しは「1,375回回したとき:服ごとに違う靴」、右列は「2,280回回したとき:すべて同じ靴」。左は靴がばらばらで、右はひとつの形に集まっている。
同じ服5着の足もとを切り出したものです。左列の見出しは「1,375回回したとき:服ごとに違う靴」、右列は「2,280回回したとき:すべて同じ靴」です。左は白いスニーカー、モーブのローファー、黒いポインテッドトゥ、クリームのスリッポンに分かれますが、900回ほど多く回した右は、丸いミュールひとつに集まっています。

左は服ごとに違う靴が出てきました。白いスニーカー、ローファー、先のとがった靴、スリッポンが混ざっています。右は服が違っても、すべて同じ形です。多く回すあいだに、靴が一種類に絞られました。

背景でも同じことが起こります。説明文は背景を「無地」としか書いていませんでした。何色かは書いていません。その空欄を、モデルは学習で見たグレーで埋めます。私たちが使っていた白い背景ではなく、ブランドのスタジオのグレーです。

見出しは「同じ服で学習をさらに回したとき:背景だけをご覧ください」。同じ服3着を1,600回(左)と2,052回(右)で並べて比較。右は背景がグレーに沈んでいる。
各画像の下の表示のとおり、左が1,600回、右が2,052回回したときの同じ服です。服はほとんど同じです。背景が違います。右は白ではなくグレーです。
·

背景の明るさ(255 = 純白)

実際の着用カットの背景 255.0 途中の地点 254.8〜254.9 最終地点 248.5 ← 11本中7本が242〜246

2回とも、フィットより付随要素が先に崩れました。フィットは最後まで良くなり続けるので、フィットだけを見ているとこれに気づけません。フィットがいちばん良いときに、結果がいちばん良いとは限りません。

ですから、学習が終わった状態をそのまま使ってはいけません。途中の状態をいくつも残しておき、並べて選ぶ必要があります。これまで回した学習で、最後の状態がいちばん良かったことは一度もありません。そして、結果を見るときの確認項目に背景の明るさを加えました。目で見るだけでは見落としますが、数字なら捉えられます。

07 · What We Take

まとめると
問い答え
ブランドのルックブックを学習すると、ルック&フィールをまねるかまねます。色味・配色・スタイリングまで
教えていないこともまねるかまねます。入れていないトップスや靴を作って付けます
学習になかった新作でもできるかできます。検証した11本はすべて学習外の商品です
適用の強さを上げると濃くなるかなりません。その仮説は捨てました
長く学習するほど良くなるかなりません。ある地点から出力が固まります

ブランドがこれまで撮ってきたルックブックの中に、そのブランドの服の着せ方が入っています。学習によって、それを引き出して使うことができます。

何を調整すべきかもわかりました。画像のサイズと、学習をどこで止めるかです。

次の問題は、その説明文を誰が書くかです。この学習に使った説明文も、人が書いたものではありません。Geminiが写真を見て文章を作り、付けました。

そして私たちは、同じことをサービスでも行っています。セラーが服の写真をアップロードすると、Geminiが商品説明を書きます。そして、セラーがそれを直します。その修正の記録が1万5千件以上たまっています。

Geminiが何を見誤るのか、人が何を直すのかが、そこにすべてあります。最終回ではその話をします。