Skip to content

Latest commit

 

History

History
57 lines (32 loc) · 5.65 KB

File metadata and controls

57 lines (32 loc) · 5.65 KB

Eeltreenitud suured keelemudelid

Kõikides meie varasemates ülesannetes treenisime närvivõrku, et see täidaks teatud ülesannet, kasutades märgistatud andmestikku. Suurte transformer-mudelite, nagu BERT, puhul kasutame keelemodelleerimist isejuhitud viisil, et luua keelemudel, mida seejärel spetsialiseeritakse konkreetsele ülesandele täiendava valdkonnapõhise treeninguga. Siiski on näidatud, et suured keelemudelid suudavad lahendada paljusid ülesandeid ka ILMA valdkonnapõhise treeninguta. Mudelite perekonda, mis seda suudavad, nimetatakse GPT: Generatiivne Eeltreenitud Transformer.

Teksti genereerimine ja hämmeldus

Idee, et närvivõrk suudab täita üldisi ülesandeid ilma täiendava treeninguta, on esitatud artiklis Language Models are Unsupervised Multitask Learners. Peamine idee on, et paljusid teisi ülesandeid saab modelleerida teksti genereerimise abil, sest teksti mõistmine tähendab sisuliselt ka selle loomise oskust. Kuna mudel on treenitud tohutul hulgal tekstil, mis hõlmab inimteadmisi, muutub see teadlikuks ka väga erinevatest teemadest.

Teksti mõistmine ja selle loomise oskus tähendab ka midagi teadmist meid ümbritseva maailma kohta. Inimesed õpivad samuti suurel määral lugemise kaudu ning GPT-võrk on selles osas sarnane.

Teksti genereerivad võrgud töötavad järgmise sõna tõenäosuse ennustamise kaudu $$P(w_N)$$. Kuid järgmise sõna tingimusteta tõenäosus võrdub selle sõna sagedusega tekstikorpuses. GPT suudab anda meile järgmise sõna tingimusliku tõenäosuse, arvestades eelnevaid sõnu: $$P(w_N | w_{n-1}, ..., w_0)$$

Lisateavet tõenäosuste kohta leiate meie Andmeteaduse algajatele mõeldud õppekavast.

Keele genereerimise mudeli kvaliteeti saab määratleda hämmelduse abil. See on sisemine mõõdik, mis võimaldab meil hinnata mudeli kvaliteeti ilma ülesandespetsiifilise andmestikuta. See põhineb lause tõenäosuse mõistel - mudel omistab suure tõenäosuse lausele, mis tõenäoliselt on tõeline (st mudel ei ole selle üle hämmeldunud) ja madala tõenäosuse lausele, mis tundub vähem loogiline (nt Kas see saab mida?). Kui anname oma mudelile lauseid reaalsest tekstikorpusest, ootame, et neil oleks kõrge tõenäosus ja madal hämmeldus. Matemaatiliselt on see määratletud testikomplekti normaliseeritud pöördtõenäosusena: $$ \mathrm{Perplexity}(W) = \sqrt[N]{1\over P(W_1,...,W_N)} $$

Saate katsetada teksti genereerimist GPT-põhise Hugging Face'i tekstiredaktoriga. Selles redaktoris alustate oma teksti kirjutamist ja vajutades [TAB] pakutakse teile mitmeid lõpetamisvõimalusi. Kui need on liiga lühikesed või te pole nendega rahul, vajutage [TAB] uuesti ja saate rohkem valikuid, sealhulgas pikemaid tekstiosi.

GPT on perekond

GPT ei ole üksik mudel, vaid pigem OpenAI poolt välja töötatud ja treenitud mudelite kogum.

GPT mudelite hulka kuuluvad:

GPT-2 GPT-3 GPT-4
Keelemudel kuni 1,5 miljardi parameetriga. Keelemudel kuni 175 miljardi parameetriga. 100T parameetrit, mis aktsepteerib nii pildi- kui tekstisisendeid ja väljastab teksti.

GPT-3 ja GPT-4 mudelid on saadaval Microsoft Azure'i kognitiivse teenusena ja OpenAI API-na.

Promptide inseneeria

Kuna GPT on treenitud tohutul hulgal andmetel, et mõista keelt ja koodi, annavad need mudelid väljundeid vastuseks sisenditele (promptidele). Promptid on GPT sisendid või päringud, mille kaudu antakse mudelitele juhiseid ülesannete täitmiseks. Soovitud tulemuse saavutamiseks on vaja kõige tõhusamat prompti, mis hõlmab õigete sõnade, vormingute, fraaside või isegi sümbolite valimist. Seda lähenemist nimetatakse Promptide inseneeriaks.

See dokumentatsioon annab teile rohkem teavet promptide inseneeria kohta.

✍️ Näide märkmikust: Mängimine OpenAI-GPT-ga

Jätkake õppimist järgmistes märkmikes:

Kokkuvõte

Uued üldised eeltreenitud keelemudelid ei modelleeri mitte ainult keele struktuuri, vaid sisaldavad ka tohutul hulgal loomulikku keelt. Seega saab neid tõhusalt kasutada mõnede loomuliku keele töötlemise ülesannete lahendamiseks null- või vähese treeninguga.


Lahtiütlus:
See dokument on tõlgitud AI tõlketeenuse Co-op Translator abil. Kuigi püüame tagada täpsust, palume arvestada, et automaatsed tõlked võivad sisaldada vigu või ebatäpsusi. Algne dokument selle algses keeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitame kasutada professionaalset inimtõlget. Me ei vastuta selle tõlke kasutamisest tulenevate arusaamatuste või valesti tõlgenduste eest.