没有绿幕AI也能完美视频抠图发丝毕现毫无违和感

作者:责任编辑。王凤仪0768

2020-04-08 16:01:44  阅读:6300+

鱼羊 发自 凹非寺

量子位 报导 | 大众号 QbitAI

在阳台上给小姐姐拍个视频:

再把她P到喷泉广场:

需求几步?

现在,无需绿幕,AI 就能搞定这件事。

就像这样,随意用手机给小姐姐拍张相片,再在同一地址拍张不带人像的布景图。

深度神经网络就能主动分分出 alpha 遮罩和远景色,把小姐姐的发丝都抠得根根清楚。

视频也是如此。

让憋着笑的搭档在实验室白板前扮演一段广播体操,再给布景板独自来一张,就能够惹是生非把搭档“搬运”到大厅里,引来路人围观了。

这是来自华盛顿大学的一项最新研讨,无需绿幕,无需手动创立 Trimap,一个具有对立性丢失的深度神经网络,就能精确猜测遮罩,给相片和视频抠图。

论文现已中了 CVPR 2020,代码行将开源。

深度抠图网络 + 鉴别器网络

那么,这样的抠图特技是怎么炼成的?

研讨人员表明,是具有对立性丢失的深度网络 + 判别组成质量的鉴别器。

深度抠图网络

研讨人员先在 Adobe Matting 数据会集的非通明目标子集上对深度神经网络 G 进行了监督练习。

输入是带人像的相片 I 和相片中的布景 B’,以及人像软切割 S 和 运动先验 M(仅对视频而言)。

必需要分外留意的是,在实在环境中,B’ 是经过在实在布景的远景区域随机参加噪声而生成的。

根据输入,网络会猜测出 alpha 遮罩 α 和远景图画 F。

研讨人员提出用布景切换块(Context Switching block,CS block)来替代根据残差块的编码器-解码器。

有什么不同?

举个比如,当人的一部分与布景相匹配的时分,网络会将更多精力放在该区域的细分头绪上。

G 网络有四个不同的编码器,别离适用于 I,B’,S 和 M 四种输入。每个编码器别离生成256个通道的特征图。

经过 1×1 卷积,BatchNorm 和 ReLU,I 中的图画特征别离与 B’,S 和 M 结合,每一对组合都会生成 64 通道特征。

最终,将这 3 个 64 通道特征与原始的 256 通道图画特征组合在一起,生成编码后的特征,并传递到由残差块和编码器组成的其他网络。

在未符号实在数据上的对立练习

CS block 和数据增强的结合,能够有用弥合实在图画与 Adobe数据集创立的组成图画之间的距离,但实在图画中依然有存在一些难点:

将手指、手臂、头发周围的布景痕迹复制到遮罩中;

切割失利;

远景色的重要部分与布景色彩挨近;

人像相片和布景相片之间没有对准。

为了应对这样一些问题,研讨人员还提出了一种自监督计划,从未符号的实在数据(实在图画 + 布景)中学习。

用深度抠图网络 G 的独自副本 GReal 组成对立网络,对立网络会生成类似于 GAdobe 输出的遮罩,而鉴别器网络 D 会判别成果的真假。

研讨人员运用实在输入(手机拍照)联合练习 GReal 和 D,并用 GAdobe 来供给监督。

与SOTA方法的比照

研讨人员将新方法与以下几种 SOTA 方法来进行了定性比较:

根据 Trimap 的 Context Aware Matting (CAM)和 Index Matting(IM);

主动遮罩算法 Late Fusion Matting(LFM);

不难看出,作用改善着实显着。

你觉得怎么样?无妨mark一下,坐等开源。

究竟有些斗胆的主意,或许现已在酝酿了,是吧?

— 完 —

“如果发现本网站发布的资讯影响到您的版权,可以联系本站!同时欢迎来本站投稿!