動きに耐えるディープフェイク動画
クリップと、はっきり写った顔を1枚アップロードするだけ。仕上がりは元の解像度のまま、元の音声もそのまま戻ってきます。インストールするものはありません。
ディープフェイク動画は、写真に対して行う顔の移植を1フレームずつ繰り返し、そのうえで時間方向のつじつまを合わせたものです。難しいのは後半です。静止画は、それ単体で納得できればよい。動く映像は、それ単体で成立したうえに、前後の29フレームとも一致していなければなりません。人の目は、細部の甘さよりも、コマ間で顎の線が1ピクセル動くことのほうにずっと敏感だからです。
あとは算数です。10秒のクリップを毎秒30フレームで撮れば、独立した顔の移植が300回。写真が秒で終わるのにディープフェイク動画が分単位になるのも、処理時間がファイルサイズではなくフレーム数に比例するのも、これが理由です。同じ長さでも毎秒60フレームなら作業量は倍になります。生成を始める前に、本当に意味のある1カットまで素材を切り詰めること。それが最も効きます。
用意するのはMP4かMOVのクリップと、入れたい顔がはっきり写った静止画1枚です。検出、ランドマークの位置合わせ、光の一致、輪郭のなじませ、再エンコードはこちらで処理します。音声トラックはそのまま通るので、ディープフェイク動画で変わるのは顔だけです。音声クローンも口パク合成もありません。インストールするものはなく、自前のGPUも不要で、アップロードした素材が学習データに回ることもありません。
入力が動画になると何が変わるか
1フレームずつ独立して処理
先頭フレームから前方向に補間したトラックは使いません。ディープフェイク動画の各フレームは、検出・位置合わせ・なじませをそれぞれ単独で行います。だからクリップの途中にハードカットが入っても列は崩れず、顔がいったん画面外へ出て戻ってきても、その隙間で溶けることなく拾い直されます。
振り向きでも本人らしさが崩れない
被写体が振り向いた瞬間、モデルは1フレーム前まで見えていた幾何情報を失い、作り直すことになります。出来の悪い合成が壊れるのはまさにここで、顎が泳ぎ、生え際が呼吸し、振り向くたびに顔全体が脈打ちます。回転をまたいで本人らしさを保てるかどうかが、見る人が最初に気づく兆候です。
音声には一切触れない
ここで変わるのは顔だけです。元の音声は音量もそのままに書き戻されるので、撮影したままの演技が手元に残ります。音声クローンも音声合成も口パク合成もありません。口の動きは、実際に収録されたテイクにそのまま従います。
ディープフェイク動画はフル解像度のまま
戻ってくるファイルは、アップロードしたときの画面サイズのままです。小さなプレビューを結果として返し、原寸を有料プランのために取っておくようなことはしません。画質の代償は再エンコード1回分だけで、それも形式が許す範囲で最小に抑えてあります。隅に入る小さなaideepfake.ioの表示だけが別枠で、これは有効なサブスクリプションで外せます。
インストールもGPUも順番待ちも不要
処理は最後まで当方のハードウェアで走ります。設定するデスクトップアプリも、落とすモデルの重みも、壊れるPython環境も、有料ユーザーの後ろで待つ列もありません。ブラウザのタブからアップロードし、同じページで仕上がりを受け取ります。
ディープフェイク動画の作り方
まずクリップを切り詰める
意味を運んでいる数秒を選び、アップロードする前にそこまで切り詰めます。残したフレームはすべてモデルが処理するフレームです。8秒に締めたカットは、それを含む場面全体よりずっと早く仕上がります。
顔を1枚アップロード
ソースはクリップではなく静止画です。正面を向き、両目が見えていて、顎のラインが隠れていないもの。この1枚が、以降のすべてのフレームの本人らしさを決めます。ここでの鮮明さは数百倍に効きます。
生成してから、ゆっくり見返す
多くのクリップはフレーム数に応じて1〜5分で終わります。判断する前に一度スロー再生してください。止めて見れば完璧なディープフェイク動画でも、動かすとまだ揺れていることがあります。
工程はこの3つで、いちばん効くのが最初の1つです。結果が安定しないときの答えは、同じ素材を生成し直すことではなく、ほぼ必ずより安定したソースカットを選び直すことです。
静止画より動画が効く場面
ディープフェイク動画は目的ではなく形式です。以下は、余分な処理時間を払う価値のある仕事で、どれもこのページの下にある同意の規則の内側にあります。
台詞とリアクション
しゃべり、まばたきし、反応する顔は、ポートレートよりはるかに多くの情報を運びます。だからうまくいったときの説得力は静止画より上で、失敗したときの崩れ方も派手です。テイクは短く、カメラは固定で。
キャスティングと企画資料
キャスティング担当は、俳優が動いているところを見なければ判断できません。粗い合成が5分で答えることを、描き起こしたコンセプト画はほのめかすだけです。しかもそれは、誰かが契約書に署名するずっと手前の話です。
ファンの再編集とクロスオーバー
ある場面を別の主演で配役し直す、コスプレのリールを仕上げる、誰も出資しなかった予告編を組み上げる。落ちを運ぶ1カットまで切り詰めてください。コストは同じでも、あなたの午後は同じではありません。
縦型のショート動画
9秒の縦型が必要とするフレーム数は、1場面まるごとのほんの一部です。処理は速く、カメラの揺れもある程度は許容されます。SNS上のディープフェイク動画は、ほとんどがこの長さに収まります。
見破り方を教える
記者、教師、信頼と安全の担当者は、動いている状態の痕跡を見なければ現場で見分けられません。自分で作り、どこで壊れるかを観察するほうが、どんな解説より速い。検出の訓練に生成物を使うのは、そのためです。
映像の性質に逆らわない
フレーム数がコストのすべて
ディープフェイク動画の作業単位はフレームであり、秒でもメガバイトでもありません。12秒のクリップを毎秒24フレームで撮れば独立した顔の移植が288回、同じ12秒を毎秒60フレームで撮れば720回です。ディスク上のサイズは同じかもしれませんが、後者は2.5倍の時間を要します。何をアップロードするか決めるときは、秒ではなくフレームを数えてください。
だからこそ、切り詰めが最も効く判断になります。多くの素材は数秒に意味が集中しており、その周りは誰も必要としない部分です。余分な1フレームは、何も生まない処理時間です。まず切り、それから生成する。目安としては、10秒なら1分ほど、1分の素材なら数分、2分を超えるものはカットごとに分け、本当に使うものだけを通すのが賢明です。
安価なディープフェイク動画がちらつく理由
ちらつきはなじませの問題ではありません。それを融合の問題として扱う道具が多いからこそ、この症状はしぶとく残ります。原因は検出です。数フレームだけ顔がぶれ、向きが深すぎ、あるいは半分が影に落ちる。検出器が十分な確信を持てず、そのフレームは手つかずのまま通過します。30フレームに1枚の未処理は、静止画としては見えませんが、動かすと目立ちます。人の視覚は、1枚の中の細部より時間方向の変化にずっと敏感だからです。
確実な原因は3つ。カメラの移動や速い振り向きによるモーションブラー、片目が鼻筋の陰に消える深い横顔、そして被写体が照明を横切るときに顔をなでる影です。3つとも素材の性質であって、モデルの性質ではありません。だから固定された均一な光のカットは一度で安定し、混合光の手持ちカットは何度回し直してもなかなか安定しません。
編集者の目でディープフェイク動画を見返す
判断を下す前に、まず4分の1速度で通して見ます。画面全体を漫然と眺めるのではなく、決まった順番で確認してください。最初は生え際、それも振り向いている数フレーム。なじませのマスクはそこで終わるので、にじみや硬い線は真っ先にそこへ出ます。次にまばたきの目、発話中の歯、頭が動いている間の首の継ぎ目、最後に耳です。耳は、横顔で持ちこたえない塊に均されがちです。
最後に考えるのは納品です。アップロード先のプラットフォームは、そこでもう一度エンコードし直します。圧縮が最初に削るのは、なじませた輪郭の周りにある高い周波数のディテールです。自分のプレイヤーでは問題なく見えたものが、SNSを通ったあとで顎のあたりにブロックノイズを出すことがあります。書き出しは許される範囲で最高画質にし、削る作業はプラットフォームに任せてください。
ディープフェイク動画に使える素材の選び方
ソースの静止画は、ファイルサイズが示すよりずっと重要です。鮮明な正面のフレームで、両目が見えていて、サングラスも顎を横切るマイクもなく、片側からの硬い光ではなく正面から光が当たっているもの。それが以降のすべてのフレームが受け継ぐ本人らしさを決めます。甘い参照や斜めの参照は、仕上がりを少し悪くするのではなく、すべてのフレームを等しく悪くします。
ターゲットのクリップは、1フレームの見栄えではなく、顔が時間とともにどう振る舞うかで判断します。被写体が遠ざかって顔が小さくなっていないか、手やカップが顔の前を横切らないか、検出器が飛び移れる2人目が写っていないか。顔の大きさがほぼ一定で、遮られず、写っているのが1人だけのカットは、そのどれかを破ったきれいなカットより、使えるディープフェイク動画になる確率がずっと高くなります。
- 生成の前に、意味を運ぶ1カットまで切り詰める
- できれば固定カメラで。手持ちのモーションブラーがちらつきの主因
- クリップ全体で顔が使える大きさを保つ。冒頭のフレームだけでは足りない
- ソース顔は、鮮明な正面の静止画を1枚だけ使う
- 手、マイク、髪が顔を横切るテイクは避ける
- 公開する前に、仕上がりを4分の1速度で通して確認する
すべてのクリップに適用される規則
性的・ポルノ的なディープフェイク動画は禁止です。推奨しないという話でも、上位プランの向こう側にあるという話でもありません。禁止であり、モデルの段階でフィルタされ、試みたアカウントは利用資格を失います。これを変えられる設定もプランも抜け道も存在しません。写っているのが著名人かどうかにかかわらず適用されます。同意のない性的画像こそ、この技術が最も大きな害を出してきた領域だからです。
2つめの規則は見せ方についてです。編集だと分かる形で公開されるディープフェイク動画は、風刺であり、批評であり、ファン作品です。3つとも正当なものです。同じファイルを本物の映像として公開すれば、それは欺きであり、増え続ける法域ではすでに違法です。選挙の健全性に関する法令、同意のない性的画像に関する法律、肖像権のいずれもが及び、訴追する国は毎年増えています。編集したものには編集済みと明記し、商業利用の前に肖像の許諾を取ってください。写っている本人からの削除要請には応じます。
ディープフェイク動画のよくある質問
生成にはどれくらいかかりますか?
多くのクリップで1〜5分です。効いてくるのはファイルサイズでも長さでもなく、フレーム数です。10秒を毎秒30フレームで撮れば300回の処理になり、たいてい1分ほどで戻ります。同じ10秒でも毎秒60フレームなら、その倍かかります。
何をアップロードできますか。長さの上限はありますか?
素材はMP4かMOVで100MBまで、ソース顔は静止画で10MBまでです。その容量に収まる限り長さの上限はありませんが、長いほどフレーム数は増えます。必要な1カットまで切り詰めるほうが、いつでも速く終わります。
声は変わりますか?
変わりません。音声トラックは音量もそのままに書き戻されます。このツールが行うのは顔の移植だけで、音声クローンも音声合成も口パク合成もありません。口の動きは、撮影された演技にそのまま従います。
ディープフェイク動画がちらつくのはなぜですか?
検出器が一部のフレームで顔を見失っているからです。モーションブラー、深い横顔、顔を横切る影の3つが典型で、いずれも素材側の問題であってモデル側の問題ではありません。より安定した、光の均一なカットに替えれば直ります。
ウォーターマークは入りますか。ファイルはどうなりますか?
入ります。仕上がりには小さなaideepfake.ioの表示が付き、外せるのは有効なサブスクリプションだけです。スイッチはツールの中にあり、アップロードの前に見えます。解像度はアップロードしたまま戻ります。顔の参照画像も素材も、その1回の生成にだけ使われます。学習データに加えることも、転売も、公開もしません。作ったものはあなたのものです。
露骨な、あるいはポルノ的なコンテンツは作れますか?
作れません。性的なディープフェイク動画は全面的に禁止で、モデルの段階でフィルタされ、その時点で利用資格を失います。プランも設定もサポートへの依頼も、これを変えることはできません。相手が著名人かどうかも関係ありません。
作ることは合法ですか?
何に使うかで完全に変わります。パロディ、批評、研究、そして編集済みと明記したファン作品は、多くの法域で広く保護されています。ディープフェイク動画を本物の映像として通すことは欺きであり、増え続ける法域ですでに違法です。性的な素材や、肖像の許諾なき商業利用も同じく保護の外にあります。