ディープフェイク生成ツール
ブラウザで動くディープフェイク生成エンジン。13種類のスワップモデル、最大1024pxの出力、写真も動画も同じパイプライン。仕上がりは約1分です。
ディープフェイク生成とは、実際に仕事をしている部分の話です。ターゲットのファイルから顔を見つけ、ソース画像が持つ本人らしさをまとわせてその顔を作り直し、元のフレームへ合成し直す。アップロード欄も進捗バーも、その外側の包装にすぎません。ダウンロードしたファイルが使えるかどうかを決めるのは、下で動いているエンジンのほうです。どのモデルを走らせられるか、どの解像度で合成するか、遮蔽をどう扱うか、そして1件にどれだけ時間がかかるか。
このページのエンジンはFaceFusion 3.6.1を土台にしているので、画質スライダーが1本だけのブラックボックスではありません。同じボタンの後ろに13種類のスワップモデルが並び、それぞれ本人らしさの強さ、肌の忠実さ、輪郭のなじみ方で得意が違います。どのモデルもピクセルブーストで1024×1024まで引き上げてから合成できます。既定値は調整済みなので、詳細パネルを開かずに終わる人がほとんどです。パネルは、それが必要な素材のために置いてあります。
インストールするものはなく、自前のGPUも要りません。ファイルはそのままストレージへ送られ、処理は当方のハードウェアで走り、仕上がりは開いていたタブへ戻ります。画像1件は10クレジット、動画1件は30クレジット。新規アカウントには残高が付くので、プランを考える前に自分の素材でディープフェイク生成を試せます。
このディープフェイク生成が実際に走らせているもの
13種類のスワップモデルを1つのボタンで
Inswapper、SimSwap、Ghost、HyperSwap、BlendSwap、UniFace、HiFiFaceが同じエンジンに載っていて、既定ではあなたの入力サイズで最も本人らしさを保てるモデルへ振り分けられます。モデルの変更はドロップダウン1つで、入れ直しは不要です。ある構造で歯が立たなかったカットは、別のモデルで生成し直せます。
ピクセルブーストは最大1024×1024
スワップモデルの多くは128か256ピクセルで学習されています。安価な出力が、顔がフレームいっぱいになった瞬間に眠くなるのはそのためです。ここでは合成前に該当領域を最大1024×1024で作り直すピクセルブーストが入るので、寄りのカットでも肌の質感が残り、のっぺりしたマスクになりません。
写真と動画が同じパイプライン
最大10 MBの静止画と最大100 MBの動画が同じ経路を通ります。動画はフレームごとに顔を追跡するので、頭が回っても合成がちらついたりずれたりしません。動画ジョブには15分の処理時間が与えられており、短尺素材ならフルフレームレートでほぼ収まります。
顔と全画面の補正を内蔵
合成後の顔のディテール復元はCodeFormer、GFPGAN、GPEN。フレーム全体の拡大はReal-ESRGAN系で2×、4×、8×。どちらも別製品ではなくトグルなので、エンジンは整えて拡大したファイルを1回の処理で返します。3つのツールを行き来する必要はありません。
検出・ランドマーク・遮蔽の制御
検出器はRetinaFace、SCRFD、YOLO-Face、YuNetから選べます。横倒しの素材には回転角度、手やマイクや髪が顔を横切る場面にはXSegの遮蔽マスクがあります。1枚に複数の人物がいるときは選択順と性別フィルタで対象を決められますが、ふつうは既定値のままで問題ありません。
ディープフェイク生成の使い方
ターゲットをアップロード
顔を載せたい写真かクリップを置きます。画像は最大10 MB、動画は最大100 MBです。エンジンはまずフレームを読み、写っている顔をすべて見つけます。
ソース顔を追加
載せたい顔の参照画像をアップロードするか、ソース顔が固定済みの専用ページを開きます。正面から光が当たった、まっすぐこちらを向いた参照が、最も多くの幾何情報を渡せます。
生成してダウンロード
ジョブを開始します。写真なら1分もかからず戻り、クリップは長さに比例します。ファイルはアップロードした解像度のまま返されます。
手順はこの3つで全部です。モデルの選択、ピクセルブースト、補正、遮蔽マスクといったその先は、ディープフェイク生成の詳細パネルに置かれた任意項目です。
どんな用途で使われているか
ディープフェイク生成は形式であって目的ではありません。よく通るのは次のような仕事で、いずれもこのページの下にある同意の規則の内側にあります。
ミームとリアクション編集
インターネットで最も古い冗談は今も有効で、ディープフェイク生成はそのオチを一晩のレタッチから1分の作業に変えます。元ネタが明日まで生きているかどうか、という速さの話です。
縦型動画とサムネイル
縦型フィード向けに編集するクリエイターは、シリーズ全体で同じ視覚的なネタを揃えるために使います。本来なら許諾済みの宣材写真が必要なサムネイルも、ここで作れます。
プレビズとキャスティング
監督は、カメラを押さえるずっと前に、その役をこの顔が演じたらどう見えるかを部屋の全員に見せます。出力は、判断材料として十分な水準です。
吹き替えとローカライズの試作
撮り直しを決める前に、別の演者ならこのシーンがどう読めるかを確かめる。ディープフェイク生成は試作のためであって、納品物のためではありません。
検出の研究と教育
信頼と安全のチーム、記者、学生は、破綻を見たことがなければ見抜けません。出力のどこが壊れているかを読む1時間は、論文を1週間読むより早く効きます。
ディープフェイク生成の内部で起きていること
アップロードからダウンロードまでの実際の流れ
ディープフェイク生成が最初にするのは検出です。RetinaFaceやYOLO-Faceが640×640でフレームを走査し、見つけた顔をすべて矩形で返します。素材が横倒しなら、検出角度を90度か270度にしておかないと顔ごと取りこぼします。次がランドマークの推定で、目、鼻、口、顎に数十個の点を置きます。この点があるからアライナーは顔を正規化された正方形へ変形でき、同時に、厚い前髪や顎にかかった手が品質を削る理由もここにあります。見えないランドマークは、作り出すしかないからです。
スワップ自体は、その正規化された正方形の中で起きます。ソース画像から取り出した本人らしさのベクトルを使い、指定したピクセルブーストの解像度でターゲットの顔を作り直す。結果は元のフレームへ戻され、遮蔽マスクに沿って境界をなじませ、顔を横切るものは顔の手前に残されます。最後に補正へ渡されます。この順番が、画質に関する不満のほとんどを説明します。検出が外れれば下流はすべて崩れ、どの補正でも取り戻せません。出力がおかしいときは、この鎖を逆向きにたどってください。
モデルとピクセルブーストの選び方
Inswapperが既定なのには理由があります。本人らしさをよく保ち、速く、fp16版はメモリ消費を半分にしても見た目が落ちません。SimSwapはなじみが柔らかく寛容で、ターゲットの光がソースから離れているときの逃げ道になります。GhostとHyperSwapはより新しく、まぶたや唇の縁といった細部を忠実に残しますが、速度は落ちます。BlendSwapはターゲット本人の肌の色に寄ります。どの状況でも勝つモデルは存在せず、だからこのディープフェイク生成はすべてを表に出しています。
ピクセルブーストは別の判断です。256ピクセルのモデルに1024ピクセルの顔を埋めさせれば、当然眠くなります。ブーストは合成前にその領域を高い解像度で作り直す処理です。目安は単純で、顔がフレームのどれくらいを占めるかに合わせること。1080pで10分の1しか占めない頭に1024×1024は何も足さず、時間だけ食います。4Kで画面いっぱいの頭には必要です。どちらの設定も開かれています。
生成時間を決めているもの
ディープフェイク生成のスループットは、ファイルサイズではなくフレーム数でほぼ決まります。写真1枚はパイプラインを1回通るだけで、1分もかかりません。10秒・30fpsのクリップは300回で、そこに本人らしさをフレーム間で安定させる追跡の負荷が乗ります。動画ジョブに15分の実時間が与えられているのはそのためです。100 MBの固定カットのほうが、20 MBの速いパンより早く終わることはよくあります。パンは、ほぼ毎フレーム顔を捕捉し直させるからです。
もう1つのレバーは補正です。顔の補正は1フレームあたり検出された顔の数だけ固定の負荷が乗ります。全画面の補正を4×や8×にすると画像全体に適用され、工程の中では群を抜いて重くなります。遅いと感じたら、全画面補正を切って後から拡大するほうが速いのがふつうです。クレジットも同じ理屈で、画像10・動画30という差は、動画側が1件あたり厳密に多くの仕事をしているためです。
より整った出力を得るために
期待外れの出力は、たいていエンジンではなく入力に理由があります。ディープフェイク生成は、そもそも撮られていないディテールを取り戻せません。小さなサムネイルを拡大してからアップロードしても、検出器にぼやけたピクセルを渡すだけです。手元にある最大の原本から始めてください。スクリーンショットしかないなら、出力は柔らかくなる前提で構図を決めるほうが確実です。
次に多いのが、ソースとターゲットのずれです。頭の角度、光の向き、そして表情。顔の感情は口元と目尻に出るので、無表情のソースを大笑いのターゲットへ載せると、モデルは持っていない幾何を引き伸ばすことになります。姿勢の差を30度以内に収め、表情を同じ系統で揃えれば、あとの手直しは大幅に減ります。
- 手元にある最大の原本を使い、保存し直したスクリーンショットは避ける
- 顔をフレームの中で大きく — 遠い被写体は検出器にほとんど情報を渡さない
- ピクセルブーストは常に最大ではなく、顔の大きさに合わせる
- 手や髪やマイクが顔を横切るときは遮蔽マスクを有効にする
- 出力が眠いときは、原因を決めつける前に別のスワップモデルを試す
- 公開前に生え際、目、歯、首の継ぎ目を確認する
同意と責任ある利用
このディープフェイク生成から出るすべての結果は、1つの厳格な規則に縛られます。性的・ポルノ的なコンテンツは、いかなる場合も禁止です。モデルの段階でフィルタされ、アカウントに対して運用され、これを解除するプランも設定も詳細オプションも存在しません。回避を試みたアカウントは、恒久的に利用資格を失います。これはページの末尾に埋める免責文言ではなく、この製品が成り立っている線そのものです。
2つ目の規則は見せ方についてです。編集だと分かる形で共有される結果は、風刺であり、批評であり、ファン作品です。3つとも正当なものです。同じファイルを本物の映像として通せば、それは欺きであり、増え続ける法域では犯罪でもあります。すでにいくつもの国と米国の過半数の州が、同意のない合成映像を訴追しており、政治的・商業的な利用に開示を義務づける法律も急速に広がっています。作ったものには編集済みと明記し、商業利用の前に肖像の許諾を取り、実在の人物がしていないことを本物として公開しないでください。
ディープフェイク生成のよくある質問
このディープフェイク生成は無料ですか?
無料枠があります。新規アカウントにはクレジット残高が付くので、支払いもインストールもなしで生成できます。有料プランで買えるのは処理量、長いクリップ、優先処理、そしてaideepfake.ioの表示の削除で、ツール自体は誰にでも開かれています。
どんなファイルをアップロードできますか?
画像は最大10 MB、動画は最大100 MBで、一般的なウェブ形式に対応します。ターゲットは静止画でもクリップでもよく、ソース顔は静止画です。両者の解像度やアスペクト比が一致している必要はありません。
合成はどの解像度で行われますか?
ピクセルブーストを有効にすると最大1024×1024で、合成後の出力はアップロードした解像度を保ちます。128ピクセルでしか合成しないツールは寄りのカットで必ず眠くなり、ブーストはそれを避けるための工程です。
生成にはどれくらいかかりますか?
写真なら1分もかからず戻ります。動画はファイルサイズではなくフレーム数に比例し、1件あたり15分の処理時間があります。全画面補正の4×や8×は、ディープフェイク生成の中で群を抜いて遅い工程です。
アップロードしたファイルはどうなりますか?
あなたの生成に使われ、それ以外には使われません。学習データに加えることも、転売することも、ギャラリーで公開することもありません。ここに預けたものは、あなたのものです。
露骨な、あるいはポルノ的なコンテンツは作れますか?
作れません。性的なディープフェイクは全面的に禁止で、モデルの段階でフィルタされ、恒久的な利用停止の理由になります。これを解除するプランも設定も詳細オプションも存在せず、通報には対応します。
ディープフェイク生成を使うのは合法ですか?
出力を何に使うかで完全に変わります。パロディ、批評、研究、そして編集済みと明記したファン作品は、多くの法域で広く保護されています。本物の映像として通すこと、許諾なく実在の肖像を商業利用すること、性的な素材を作ることは保護の外にあり、多くの国と米国の州が直接訴追しています。