转头也不塌的deepfake视频
上传一段片子和一张清晰的脸。成片按原分辨率返回,原始音轨完整保留,什么都不用装。
deepfake视频就是你在照片上做过的那次人脸迁移,只不过要逐帧重复一遍,然后还得让这些帧在时间轴上彼此对得上。后半句才是难点。一张静止图只需要自己成立;一条动态成片还得和前后二十九帧达成一致——人眼对细节的宽容度远高于对跳动的宽容度,下颌线在两帧之间挪动一个像素,观众立刻就读得出来。
剩下的都是算术。十秒素材按每秒三十帧算,就是三百次独立的人脸迁移;这就是为什么deepfake视频以分钟计,而照片以秒计,也是为什么渲染时间跟的是帧数而不是文件体积。同样时长换成每秒六十帧,工作量直接翻倍。所以在按下渲染之前,把素材剪到真正承载想法的那一个镜头,是你能做的最有用的一件事。
你要准备的是一段 MP4 或 MOV,以及一张想放进去的人脸清晰正面照。检测、关键点对齐、光线匹配、边缘融合和重编码都在这里完成。音轨原样通过,所以deepfake视频只改变脸,别的什么都不动——没有声音克隆,也没有口型同步。不用装任何东西,不需要你自己的显卡,上传的文件也不会进入训练集。
输入换成动态素材之后,有什么不一样
每一帧都单独算一遍
不存在从首帧向后插值出来的轨迹。deepfake视频的每一帧都独立完成检测、对齐和融合,所以片子中间的硬切不会带偏整段序列,人脸出画之后再回来,也能被干净地重新接上。
转头时身份不散
主体一旦转头,模型上一帧还看得见的几何信息就没了,只能重建。弱的deepfake视频正是在这里崩掉:下颌在游,发际线在呼吸,整张脸每转一次就搏动一下。能否在旋转中守住身份,是观众最先察觉的那个破绽。
音轨完全不碰
这里只换脸,别的都不动。原始声音以原电平写回成片,你拍到的那条表演就是你留下的那条。没有声音克隆,没有语音合成,没有口型同步——嘴型跟的是当时真正拍下来的那一条。
原分辨率,无预览级降档
回到你手上的文件就是你上传时的画幅,不会为了逼你付费而缩水成一张小尺寸预览。整条链路上唯一的画质代价是那次重编码,而它被压到格式允许的最低限度,好让deepfake视频不至于比进来时更难看。
不装软件,不用显卡,不排队
整条 deepfake 流水线跑在我们的硬件上。没有桌面程序要配置,没有模型权重要下载,没有 Python 环境会被弄坏,也不用排队。你在浏览器标签页里上传,几分钟后在同一页取走成片。
怎样做一条deepfake视频
先把片子剪短
挑出承载想法的那几秒,上传之前就剪到那里。你留下的每一帧都是模型必须处理的一帧,所以八秒的紧凑镜头,会比整场戏更快变成一条做完的deepfake视频。
上传一张清晰的脸
源素材是静态图片而不是片段:一张正面照,双眼可见,下颌线不被遮挡。这一张图决定了随后每一帧的身份,所以在这里多花的功夫,会被放大几百倍。
渲染,然后慢速回看
多数片子一到五分钟完成,取决于帧数。先慢速播一遍再下判断——暂停时看着完美无缺的deepfake视频,动起来仍然可能抖。
就这三步,而第一步最重要。如果成片不稳,答案几乎总是换一个更稳的源镜头,而不是把同一段素材再渲染一遍。
什么时候动态素材胜过一张照片
deepfake视频是一种形式,不是一个目的。下面这些场景值得多花那点渲染时间,而它们全都落在本页下方那套同意规则之内。
对白与反应镜头
一张会说话、会眨眼、会有反应的脸,携带的信息远多于一张肖像,所以deepfake视频成立时比静图更有说服力,不成立时也塌得更彻底。镜头要短,机位要锁死。
选角与提案素材
选角团队需要看到演员动起来才能拍板。一版粗糙的成片五分钟就能回答的问题,一张概念图只能勉强比划,而这发生在任何人签字之前。
同人重剪与联动剪辑
给一场戏换主角,把一段 cos 短片做完,或者攒出那支没人出钱的联动预告。剪到承载笑点的那个镜头就够了——deepfake视频的成本一样,但你的下午不一样。
竖屏短视频
九秒竖屏用到的帧数只是完整一场戏的零头,渲染很快。社交平台上的deepfake视频基本都活在这个长度上。
教人认出破绽
记者、教师和信任与安全团队必须先看见动态里的伪影,才认得出它们。亲手做一条deepfake视频,盯着它在哪里崩掉,比任何科普都快——检测训练要用生成素材,正是这个原因。
顺着素材做,而不是跟它较劲
帧数就是全部的成本模型
deepfake视频的工作单位是帧,不是秒,更不是兆字节。十二秒素材按每秒二十四帧算,是二百八十八次独立的人脸迁移;同样十二秒拍成每秒六十帧,就是七百二十次。两个文件在硬盘上可能一样大,后者却要多花两倍半的时间。所以在决定上传什么的时候,数的应该是帧,不是秒。
这也让剪辑成为你手上杠杆最高的那个决定。多数素材的想法只落在几秒里,周围全是没人需要的部分,而每一帧多余的画面都是白白花掉的处理时间。先剪,再渲染。粗略地说:十秒的成片大约一分钟回来,一分钟的素材要好几分钟,超过两分钟的最好按镜头拆开,只留你真正要用的那几个。
廉价的deepfake视频为什么会闪
闪烁不是融合环节的问题——正因为很多工具把它当成融合问题,它才那么难缠。它来自检测。有那么几帧,人脸糊了、转得太过、或者半张脸落在阴影里,检测器没有足够把握认出它,这些帧就原样通过,整条片子于是开始频闪。三十帧里混进一帧没换的,当静图看根本发现不了,动起来却刺眼——人的视觉本来就对时间上的变化,远比对单帧里的细节敏感。
三个可靠的成因:机位移动或快速转头带来的运动模糊;一只眼睛被鼻梁挡住的大侧角;以及主体穿过光区时扫过面部的阴影。三者都是素材的属性,不是模型的属性——这就是为什么一个稳定、布光均匀的镜头第一次就能给出稳定的deepfake视频,而混合光下的手持镜头,无论重跑多少遍都很难。
像剪辑师那样复核deepfake视频
下判断之前,先用四分之一速度把成片看一遍,并且按固定顺序检查,而不是盯着整个画面发呆。先看发际线,尤其是转头的那几帧——融合遮罩在那里收尾,光晕或硬边会最先在那里暴露。然后是眨眼时的眼睛、说话时的牙齿、转头时的颈部接缝,最后是耳朵,模型经常把它抹成一团在侧脸里站不住的形状。
最后要考虑的是交付。你上传到的任何平台都会再压一遍,而压缩最先吃掉的,恰好是融合边缘周围那些高频细节。在你自己播放器里没问题的deepfake视频,被社交平台处理完之后,可能在下颌一带出现明显的块效应。所以导出时用平台允许的最高画质,把降质这件事留给平台去做。
挑一段deepfake视频用得上的素材
那张源图值得的注意力,比它的文件体积暗示的要多。一张锐利的正面帧——双眼可见,不戴墨镜,下巴前没有横着的话筒,正面受光而不是单侧硬光——决定了成片里每一帧继承的身份。参考图偏软或偏侧,不是让结果略微变差,而是让每一帧同等地变差。
目标片段要看的是人脸随时间怎么变化,而不是某一帧好不好看。留意主体走远时人脸变小、一只手或一个杯子从脸前掠过、以及画面里还有第二个人可能被检测器盯上。人脸大小基本不变、不被遮挡、且只有一个人的镜头,比更好看却违反其中任一条的镜头,更可靠地给出一条可用的deepfake视频。
- 渲染之前,先剪到承载想法的那一个镜头
- 优先用锁死的机位——手持带来的运动模糊是闪烁的头号原因
- 让人脸在整段片子里都保持可用的大小,而不只是开头那一帧
- deepfake视频的源人脸只用一张锐利的正面静态图
- 避开有手、话筒或头发横穿面部的镜头
- 发布之前,用四分之一速度把成片完整过一遍
对每一段素材都适用的规则
性相关与色情的deepfake视频内容在这里被禁止。不是不鼓励,也不是放在某个付费档后面——是禁止,在模型层就被过滤,尝试者的账号会失去访问权限。没有任何设置、档位或变通手段能改变这一点。无论被呈现的人是不是名人,禁令一律适用——未经同意的私密影像正是这项技术伤害最大的地方。
第二条规则关于呈现方式。作为明显编辑发布的deepfake视频是戏仿、评论或同人创作,这三者都正当;同一个文件被当作真实影像发布就是欺骗,而在越来越多的司法辖区,这已经违法——选举诚信法规、未经同意私密影像法和肖像权都能管到它,提起诉讼的国家每年都在变多。把编辑过的素材标注清楚;商业用途之前先取得肖像授权;当事人提出下架要求,我们会照办。
deepfake视频常见问题
一条deepfake视频要渲染多久?
多数片子一到五分钟。决定时间的是帧数而不是文件体积:十秒、每秒三十帧就是三百次运算,通常一分钟左右回来;拍成每秒六十帧,时间翻倍。
可以上传什么?片子能多长?
素材是 MP4 或 MOV,不超过 100MB;源人脸是一张不超过 10MB 的静态图片。时长只受这个体积限制,但片子越长帧数越多——把deepfake视频剪到你真正需要的镜头,永远更快。
声音会变吗?
不会。音轨以原电平原样写回。这里的deepfake视频只做人脸迁移:没有声音克隆,没有语音合成,没有口型同步,嘴型跟的是当时拍下来的那条表演。
我的deepfake视频为什么会闪?
因为检测器在某些帧上丢了人脸。运动模糊、大角度侧转、扫过面部的阴影,是三个常见原因,而它们都出自素材而非模型。换一个更稳、布光更均匀的镜头就能解决。
有水印吗?我的文件会怎样?
成片右下角带一个很小的 aideepfake.io 标识,只有生效中的订阅能去掉;开关就在工具里,写着「订阅后可去除」,上传之前你就看得见。分辨率不受影响,deepfake视频按你上传的尺寸返回。你的人脸参考图和素材只用于这一次渲染——不进训练数据,不转卖,不发布。你做的deepfake视频始终属于你。
可以做露骨或色情内容吗?
不可以。性相关的deepfake视频内容被彻底禁止,在模型层就被过滤,并且构成立即失去访问权限的理由。没有任何方案、设置或客服申请能改变这一点,无论那张脸是不是名人。
做deepfake视频合法吗?
完全取决于你拿它做什么。戏仿、评论、研究和明确标注的同人作品,在多数司法辖区受保护。把deepfake视频冒充成真实影像就是欺骗,在越来越多的司法辖区已属违法;性内容与未经肖像授权的商业使用同样如此。