鱼羊 发自 凹非寺
量子位 报导 | 大众号 QbitAI
在阳台上给小姐姐拍个视频:
再把她P到喷泉广场:
需求几步?
现在,无需绿幕,AI 就能搞定这件事。
就像这样,随意用手机给小姐姐拍张相片,再在同一地址拍张不带人像的布景图。
深度神经网络就能主动分分出 alpha 遮罩和远景色,把小姐姐的发丝都抠得根根清楚。
视频也是如此。
让憋着笑的搭档在实验室白板前扮演一段广播体操,再给布景板独自来一张,就能够惹是生非把搭档“搬运”到大厅里,引来路人围观了。
这是来自华盛顿大学的一项最新研讨,无需绿幕,无需手动创立 Trimap,一个具有对立性丢失的深度神经网络,就能精确猜测遮罩,给相片和视频抠图。
论文现已中了 CVPR 2020,代码行将开源。
深度抠图网络 + 鉴别器网络
那么,这样的抠图特技是怎么炼成的?
研讨人员表明,是具有对立性丢失的深度网络 + 判别组成质量的鉴别器。
深度抠图网络
研讨人员先在 Adobe Matting 数据会集的非通明目标子集上对深度神经网络 G 进行了监督练习。
输入是带人像的相片 I 和相片中的布景 B’,以及人像软切割 S 和 运动先验 M(仅对视频而言)。
必需要分外留意的是,在实在环境中,B’ 是经过在实在布景的远景区域随机参加噪声而生成的。
根据输入,网络会猜测出 alpha 遮罩 α 和远景图画 F。
研讨人员提出用布景切换块(Context Switching block,CS block)来替代根据残差块的编码器-解码器。
有什么不同?
举个比如,当人的一部分与布景相匹配的时分,网络会将更多精力放在该区域的细分头绪上。
G 网络有四个不同的编码器,别离适用于 I,B’,S 和 M 四种输入。每个编码器别离生成256个通道的特征图。
经过 1×1 卷积,BatchNorm 和 ReLU,I 中的图画特征别离与 B’,S 和 M 结合,每一对组合都会生成 64 通道特征。
最终,将这 3 个 64 通道特征与原始的 256 通道图画特征组合在一起,生成编码后的特征,并传递到由残差块和编码器组成的其他网络。
在未符号实在数据上的对立练习
CS block 和数据增强的结合,能够有用弥合实在图画与 Adobe数据集创立的组成图画之间的距离,但实在图画中依然有存在一些难点:
将手指、手臂、头发周围的布景痕迹复制到遮罩中;
切割失利;
远景色的重要部分与布景色彩挨近;
人像相片和布景相片之间没有对准。
为了应对这样一些问题,研讨人员还提出了一种自监督计划,从未符号的实在数据(实在图画 + 布景)中学习。
用深度抠图网络 G 的独自副本 GReal 组成对立网络,对立网络会生成类似于 GAdobe 输出的遮罩,而鉴别器网络 D 会判别成果的真假。
研讨人员运用实在输入(手机拍照)联合练习 GReal 和 D,并用 GAdobe 来供给监督。
与SOTA方法的比照
研讨人员将新方法与以下几种 SOTA 方法来进行了定性比较:
根据 Trimap 的 Context Aware Matting (CAM)和 Index Matting(IM);
主动遮罩算法 Late Fusion Matting(LFM);
不难看出,作用改善着实显着。
你觉得怎么样?无妨mark一下,坐等开源。
究竟有些斗胆的主意,或许现已在酝酿了,是吧?
— 完 —








