0

雷鋒網(wǎng) AI 科技評(píng)論按:如何讓GAN生成帶有指定特征的圖像?這是一個(gè)極有潛力、極有應(yīng)用前景的問題,然而目前都沒有理想的方法。韓國(guó)大學(xué)電子工程學(xué)院Minhyeok Lee和Junhee Seok近期發(fā)表論文,就生成對(duì)抗網(wǎng)絡(luò)的控制問題給出了自己的辦法,雷鋒網(wǎng) AI 科技評(píng)論根據(jù)原文進(jìn)行如下編輯,原文鏈接
生成對(duì)抗網(wǎng)絡(luò)(GANs)是最近幾年提出的新方法,在其問世之后的短短時(shí)間內(nèi),生成對(duì)抗網(wǎng)絡(luò)已經(jīng)在生成真實(shí)的樣本上表現(xiàn)出很多有前途的結(jié)果了。然而, 在生成對(duì)抗網(wǎng)絡(luò)的使用上,目前還有未能解決的問題:由于發(fā)生器(Generator)的輸入變量是隨機(jī)的,控制GANs產(chǎn)生的樣本非常困難。業(yè)界了已經(jīng)有了一些解決方案,但是這些方案普遍沒有辦法很好地應(yīng)用在復(fù)雜問題上。除此之外,難以將發(fā)生器集中在產(chǎn)生真實(shí)的圖像和產(chǎn)生有差異的圖像的任務(wù)上,也一直亟待解決。比如,沿用已知的模型,用于臉部圖像生成的發(fā)生器就無法專注于兩個(gè)目標(biāo)中的某一個(gè),即根據(jù)標(biāo)簽產(chǎn)生人臉的真實(shí)圖像,或是產(chǎn)生有差異的人臉圖像。這篇文章則介紹了一種新的方法,即可控生成對(duì)抗網(wǎng)絡(luò)(Controllable GAN, CGAN)。CGAN在控制生成樣本上有很強(qiáng)的表現(xiàn),同時(shí),它還能控制發(fā)生器專注于單個(gè)目標(biāo)(生成真實(shí)的圖像或產(chǎn)生不同的圖像)。文章最后使用CelebA的數(shù)據(jù)庫(kù)對(duì)CGAN進(jìn)行評(píng)估。CGAN實(shí)現(xiàn)了對(duì)GAN的控制,相信可以加速和助益GAN的研究。
生成對(duì)抗網(wǎng)絡(luò)(GAN)是一種神經(jīng)網(wǎng)絡(luò)架構(gòu),被引用來生成真實(shí)的樣本。盡管這個(gè)架構(gòu)是近幾年才提出的,GAN的大量成果不僅表現(xiàn)于生成真實(shí)樣本上,還體現(xiàn)于機(jī)器翻譯和圖像超分別率的應(yīng)用中。
但是,由于樣本發(fā)生器的輸入是隨機(jī)分布的,在生成真實(shí)樣本的時(shí)候,很難控制GAN。比如,生產(chǎn)的vanilla GAN樣本是現(xiàn)實(shí)的,也具備多樣性,但是隨機(jī)輸入和生成樣本的特征之間的關(guān)系卻不明顯。
在過去的幾年中,嘗試控制由GAN產(chǎn)生的樣本的研究從未停止。其中,最為著名的控制方法就是有條件的GAN(Conditional GAN)。有條件的GAN將標(biāo)簽分別輸入發(fā)生器(Generator)和鑒別器(Discriminator),由此他們可在訓(xùn)練時(shí)有條件的工作。但是,這種有條件的GAN不能解決控制發(fā)生器專注于一個(gè)任務(wù)的問題,如生成真實(shí)樣本和根據(jù)輸入標(biāo)簽在樣本之間產(chǎn)生差異的任務(wù)。例如:CelebA數(shù)據(jù)庫(kù)包含202559張名人的臉部圖片,有40中不同的特征標(biāo)記,如戴帽子或者年輕人等。當(dāng)有條件的GAN生成真實(shí)樣本時(shí),預(yù)訓(xùn)練的只有一些簡(jiǎn)單的標(biāo)簽,比如笑、帽子之類的。為了讓發(fā)生器具備處理復(fù)雜標(biāo)簽的能力,如尖尖的鼻子或者拱形的眉毛,需要控制發(fā)生器更注重根據(jù)標(biāo)簽生成不同的樣本。
在這篇論文中,作者介紹了一種新穎的生成對(duì)抗網(wǎng)絡(luò)架構(gòu)來控制生成的樣本,稱為可控生成對(duì)抗網(wǎng)絡(luò)(CGAN)。CGAN由三個(gè)部分構(gòu)成,發(fā)生器/解碼器,鑒別器和分類器/編碼器。在CGAN中,發(fā)生器和鑒別器、分類器同時(shí)工作;發(fā)生器旨在欺騙鑒別器并同時(shí)需要被分類器正確的進(jìn)行分類。
與現(xiàn)有的模型相比,CGAN具有兩個(gè)主要的優(yōu)勢(shì)。首先,CGAN可以通過參數(shù)化損失函數(shù)專注于條件GAN的兩個(gè)主要目標(biāo)中的一個(gè)目標(biāo),即真實(shí)樣本或者表現(xiàn)差異。因此,如果要犧牲真實(shí)實(shí)現(xiàn)差異性,CGAN可以根據(jù)復(fù)雜標(biāo)簽生成面部圖像。其次,當(dāng)鑒別器使用條件GAN時(shí),CGAN使用一個(gè)獨(dú)立的網(wǎng)絡(luò)進(jìn)行相應(yīng)輸入標(biāo)簽的特征映射。因此,鑒別器可以更多的專注進(jìn)行假樣本和原始樣本之間的甄別,從而提高生成樣本的真實(shí)性。 在這篇論文中,使用CelebA進(jìn)行CGAN的實(shí)驗(yàn)。通過實(shí)驗(yàn),證實(shí)了CGAN可以有效地根據(jù)輸入標(biāo)簽生成人臉圖像樣本。
CGAN由三種神經(jīng)網(wǎng)絡(luò)結(jié)構(gòu)組成,發(fā)生器/解碼器,鑒別器和分類器/編碼器。圖1中描述了這種CGAN的架構(gòu)。這三種結(jié)構(gòu)相互協(xié)作,發(fā)生器嘗試欺騙鑒別器,這與vanilla GAN相同,并且旨在正確的被分類器進(jìn)行分類。發(fā)生器和分類器也可以理解為解碼器-編譯器的結(jié)構(gòu),原因是標(biāo)簽是發(fā)生器的輸入同時(shí)是分類器的輸出。

CGAN對(duì)如下的方程進(jìn)行最小化:
l 是樣本x的二進(jìn)制表示,并且是發(fā)生器的輸入數(shù)據(jù),同時(shí)還作為鑒別器和分類器的參數(shù)。
CGAN強(qiáng)制將特征映射到相應(yīng)輸入發(fā)生器的l。這個(gè)參數(shù)決定了發(fā)生器專注于樣本真實(shí)性的程度。這篇論文中應(yīng)用了Boundary Equilbrium GAN(BEGAN)架構(gòu),即目前最新的生成圖像樣本的GAN架構(gòu)。發(fā)生器由四個(gè)反卷積層組成。每層使用5*5的過濾器。鑒別器由四個(gè)卷積層和4個(gè)反卷積層構(gòu)成。分類器由4個(gè)卷積層和一個(gè)全連接層構(gòu)成。為了驗(yàn)證方法的效率,并沒有使用dropout和max-pooling。我們將α設(shè)置為0.5,β設(shè)置為1并將γ設(shè)置為5。
使用CelebA數(shù)據(jù)庫(kù)生成多標(biāo)簽的名人人臉圖片樣本
通過想發(fā)生器輸入多個(gè)標(biāo)簽,CGAN可以生成多標(biāo)簽樣本。CelebA數(shù)據(jù)庫(kù)由多個(gè)標(biāo)簽的圖片構(gòu)成。例如,一個(gè)樣本圖片可以有“Attractive”,“Blond Hair”,“Mouth Slightly Open”和“Smiling”的標(biāo)簽。
首先,使用一個(gè)標(biāo)簽生成圖片。生成的樣本見圖2。

像之前討論的,CGAN可以通過向發(fā)生器輸入多個(gè)標(biāo)簽生成多標(biāo)簽的樣本。圖3是通過CelebA生成的多標(biāo)簽圖片。其中“No Label”的圖片只通過隨機(jī)分布z~N(0,1)生成,并且輸入標(biāo)簽設(shè)置成一個(gè)0矩陣,長(zhǎng)度為40,l=【0,0,...,0】。“+ Attractive”的圖片由同樣的z和“Attractive”標(biāo)簽的二進(jìn)制生成。類似的,最后一組圖片是由z和多個(gè)標(biāo)簽生成的。

CGAN還具有另一優(yōu)勢(shì):相較于條件GAN,CGAN可以生成label-focused樣本。通過選擇γ的低值,可以講發(fā)生器更多的專注于輸入標(biāo)簽。圖4是CGAN,γ=5和條件GAN的對(duì)比。從圖中可以看出CGAN生成的人臉圖片比條件GAN更契合輸入標(biāo)簽。例如,使用“Arched Eyebrow”標(biāo)簽時(shí),CGAN生成的圖片全部符合這個(gè)標(biāo)簽的特征,而條件GAN則有偏差。

這篇論文提出了一種新的生成網(wǎng)絡(luò)模型,即CGAN,這種模型可以控制生成的圖片樣本。CGAN包含三個(gè)模塊,發(fā)生器/解碼器,鑒別器和分類器/編碼器。通過將相應(yīng)的特征映射到輸入標(biāo)簽上,生成的樣本可以被有效地控制。
其實(shí)CGAN是一個(gè)簡(jiǎn)單的架構(gòu),即為vanilla GAN和解碼-編碼結(jié)構(gòu)的組合。通過實(shí)驗(yàn),作者證實(shí)了CGAN可以生成具有多個(gè)標(biāo)簽的人臉圖片。同時(shí),這種控制有效性也可以對(duì)生成對(duì)抗網(wǎng)絡(luò)的研究帶來一些重要的提升。
論文地址:https://arxiv.org/abs/1708.00598
雷鋒網(wǎng) AI 科技評(píng)論編譯