Baada ya mafanikio ya mifano ya transformer katika kutatua kazi za NLP, usanifu sawa au unaofanana umetumika katika kazi za maono ya kompyuta. Kuna shauku inayoongezeka ya kujenga mifano ambayo inaweza kuunganisha uwezo wa maono na lugha ya asili. Mojawapo ya majaribio hayo yalifanywa na OpenAI, na inaitwa CLIP na DALL.E.
Wazo kuu la CLIP ni kuwa na uwezo wa kulinganisha maelezo ya maandishi na picha na kuamua jinsi picha inavyolingana na maelezo hayo.
Picha kutoka blogu hii
Mfano huu umefunzwa kwa kutumia picha zilizopatikana kutoka mtandao na maelezo yao. Kwa kila kundi, tunachukua jozi N za (picha, maandishi), na kuzibadilisha kuwa uwakilishi wa vekta fulani I, ..., I / T, ..., T. Uwiano huu kisha unalinganishwa pamoja. Kazi ya hasara imeundwa ili kuongeza mfanano wa cosine kati ya vekta zinazolingana na jozi moja (mfano I na T), na kupunguza mfanano wa cosine kati ya jozi zote nyingine. Hii ndiyo sababu mbinu hii inaitwa ulinganishi.
Maktaba ya CLIP inapatikana kutoka OpenAI GitHub. Mbinu hii imeelezwa katika blogu hii, na kwa undani zaidi katika karatasi hii.
Mara tu mfano huu unapokuwa umefunzwa, tunaweza kuupa kundi la picha na kundi la maelezo ya maandishi, na utarudisha tensor yenye uwezekano. CLIP inaweza kutumika kwa kazi kadhaa:
Uainishaji wa Picha
Tuseme tunahitaji kuainisha picha kati ya, kwa mfano, paka, mbwa na binadamu. Katika hali hii, tunaweza kuupa mfano picha, na mfululizo wa maelezo ya maandishi: "picha ya paka", "picha ya mbwa", "picha ya binadamu". Katika vekta inayotokana ya uwezekano 3 tunahitaji tu kuchagua faharasa yenye thamani ya juu zaidi.
Picha kutoka blogu hii
Utafutaji wa Picha kwa Kutumia Maandishi
Tunaweza pia kufanya kinyume chake. Ikiwa tuna mkusanyiko wa picha, tunaweza kupitisha mkusanyiko huu kwa mfano, na maelezo ya maandishi - hii itatupa picha inayofanana zaidi na maelezo yaliyotolewa.
Fungua daftari la Clip.ipynb ili kuona CLIP ikifanya kazi.
CLIP inaweza pia kutumika kwa uzalishaji wa picha kutoka maelezo ya maandishi. Ili kufanya hivyo, tunahitaji mfano wa jenereta ambao utaweza kuzalisha picha kulingana na pembejeo ya vekta fulani. Mojawapo ya mifano hiyo inaitwa VQGAN (Vector-Quantized GAN).
Mawazo makuu ya VQGAN yanayoitofautisha na GAN ya kawaida ni yafuatayo:
- Kutumia usanifu wa transformer wa autoregressive kuzalisha mfululizo wa sehemu za kuona zilizo na muktadha ambazo zinaunda picha. Sehemu hizo za kuona zinajifunzwa na CNN
- Kutumia kaguzi za sehemu za picha zinazogundua ikiwa sehemu za picha ni "halisi" au "bandia" (tofauti na mbinu ya "yote-au-hakuna" katika GAN ya jadi).
Jifunze zaidi kuhusu VQGAN kwenye tovuti ya Taming Transformers.
Moja ya tofauti muhimu kati ya VQGAN na GAN ya jadi ni kwamba ya mwisho inaweza kuzalisha picha nzuri kutoka kwa vekta yoyote ya pembejeo, wakati VQGAN ina uwezekano wa kuzalisha picha ambayo haitakuwa thabiti. Kwa hivyo, tunahitaji kuongoza zaidi mchakato wa uundaji wa picha, na hilo linaweza kufanywa kwa kutumia CLIP.
Ili kuzalisha picha inayolingana na maelezo ya maandishi, tunaanza na vekta ya usimbaji wa nasibu ambayo inapitia VQGAN ili kuzalisha picha. Kisha CLIP hutumika kuzalisha kazi ya hasara inayonyesha jinsi picha inavyolingana na maelezo ya maandishi. Lengo basi ni kupunguza hasara hii, kwa kutumia kurudi nyuma ili kurekebisha vigezo vya vekta ya pembejeo.
Maktaba nzuri inayotekeleza VQGAN+CLIP ni Pixray
Picha kutoka mkusanyiko wa Artificial Teachers na Dmitry Soshnikov
DALL-E ni toleo la GPT-3 lililofunzwa kuzalisha picha kutoka maelezo. Limefunzwa na vigezo bilioni 12.
Tofauti na CLIP, DALL-E hupokea maandishi na picha kama mkondo mmoja wa tokeni kwa picha na maandishi. Kwa hivyo, kutoka maelezo mengi, unaweza kuzalisha picha kulingana na maandishi.
Tofauti kuu kati ya DALL.E 1 na 2, ni kwamba inazalisha picha na sanaa za kweli zaidi.
Mifano ya uzalishaji wa picha na DALL-E:
- Karatasi ya VQGAN: Taming Transformers for High-Resolution Image Synthesis
- Karatasi ya CLIP: Learning Transferable Visual Models From Natural Language Supervision
Kanusho:
Hati hii imetafsiriwa kwa kutumia huduma ya kutafsiri ya AI Co-op Translator. Ingawa tunajitahidi kuhakikisha usahihi, tafadhali fahamu kuwa tafsiri za kiotomatiki zinaweza kuwa na makosa au kutokuwa sahihi. Hati ya asili katika lugha yake ya awali inapaswa kuzingatiwa kama chanzo cha mamlaka. Kwa taarifa muhimu, tafsiri ya kitaalamu ya binadamu inapendekezwa. Hatutawajibika kwa kutoelewana au tafsiri zisizo sahihi zinazotokana na matumizi ya tafsiri hii.








