Transformer-Baserede Generative Modeller
Stryg for at vise menuen
Introduktion til Transformers og Self-Attention
Transformers udgør en grundlæggende arkitektur inden for moderne AI, især inden for Natural Language Processing (NLP) og generativ modellering. Først introduceret i artiklen "Attention is All You Need" (Vaswani et al., 2017), fravælger transformers rekurrens til fordel for en mekanisme kaldet self-attention, som gør det muligt for modeller at tage alle dele af inputsekvensen i betragtning på én gang.
Self-Attention-mekanisme
Self-attention-mekanismen gør det muligt for modellen at vægte betydningen af forskellige tokens i en sekvens i forhold til hinanden. Dette udføres ved hjælp af tre matricer, der er afledt af input-embedding:
- Query (Q);
- Key (K);
- Value (V).
Attention-outputtet beregnes som:
Attention(Q,K,V)=softmax(dkQKT)VHvor:
- Q, K og V er matricer afledt af input.
- dk er dimensionen af key-vektorerne.
- softmax konverterer lighedsscorer til sandsynligheder.
Dette gør det muligt for hvert token at attendere til alle andre tokens og justere sin repræsentation derefter.
Oversigt over Transformer-arkitektur
Transformer-modellen består af stablede encoder- og decoder-lag:
- Encoder omdanner input til en kontekstualiseret latent repræsentation;
- Decoder genererer output-tokens ved hjælp af encoderens output og tidligere tokens.
Hvert lag indeholder:
- Multi-head self-attention;
- Feedforward neurale netværk;
- Lag-normalisering;
- Residuelle forbindelser.
Multi-head self-attention
I stedet for at beregne en enkelt opmærksomhedsfunktion anvender transformeren flere opmærksomhedshoveder. Hvert hoved lærer at fokusere på forskellige dele af sekvensen.
Multi-Head(Q,K,V)=Concat(head1,head2,...,headn)W0Hvor hvert hoved beregnes som:
headi=Attention(QWiQ,KWiK,VWiV)Hvor:
- WiQ,WiK,WiV er projekteringsmatricer for forespørgsler, nøgler og værdier;
- W0 projicerer de sammenkædede hoveder tilbage til den oprindelige dimension.
Fremadrettede neurale netværk
Hver transformerblok indeholder et positionsvist fremadrettet netværk, der anvendes uafhængigt på hver position:
FFN(x)=ReLU(xW1+b1)W2+b2- Består af to lineære lag med en ikke-linearitet (f.eks. ReLU) imellem;
- Anvender den samme transformation på tværs af alle positioner.
Lag-normalisering
Lag-normalisering normaliserer input på tværs af funktionerne (kanaler) i stedet for batch. Dette stabiliserer træningen og forbedrer konvergensen:
LayerNorm(x)=σx−μ⋅γ+βHvor:
- μ er gennemsnittet af funktionerne;
- σ er standardafvigelsen;
- γ og β er lærbare parametre.
Residuale forbindelser
Residuale forbindelser lægger inputtet til hvert underlag til dets output:
Output=Layer(x)+x- Hjælper med gradientflow og muliggør træning af dybere modeller;
- Anvendes omkring både selvopmærksomheds- og feedforward-lagene.
I kun-dekoder modeller (som GPT) bruges kun dekoderen med kausal (maskeret) selvopmærksomhed.
Generative Pre-trained Transformers (GPT)
GPT-modeller er kun-dekoder transformere trænet til at forudsige det næste token på en autoregressiv måde:
P(x1,x2,...,xn)=t=1∏nP(xt∣x<t)Nøglefunktioner:
- Trænet på store tekstdatasæt;
- Kan generere sammenhængende og varieret tekst;
- Udbredt anvendt i applikationer som chatbots og kodegenerering.
BERT og Maskeret Sproglig Modellering
BERT (Bidirectional Encoder Representations from Transformers) anvender kun encoder. Den trænes med maskeret sproglig modellering (MLM):
- Tilfældige tokens erstattes med en [MASK];
- Modellen forudsiger det oprindelige token baseret på fuld kontekst.
Dette gør BERT velegnet til opgaver som klassifikation, spørgsmål og svar samt semantisk lighed.
Transformere og LLM'er
Transformere udgør grundlaget for Large Language Models (LLMs) som GPT-3, GPT-4, PaLM, LLaMA og Claude.
LLM'er anvender store datasæt og hundredvis af milliarder parametre, hvilket gør dem i stand til at:
- Forstå og generere menneskesprog;
- Udføre oversættelse, opsummering, spørgsmål og svar, ræsonnement;
- Drive chatbots, dokumentanalysatorer og kodeassistenter.
Transformeres skalerbarhed og evne til at modellere langtrækkende afhængigheder gør dem ideelle til disse modeller.
1. Hvad er den primære innovation, som transformere har introduceret?
2. Hvad adskiller BERT fra GPT?
3. Hvorfor er transformere ideelle til LLM'er?
Tak for dine kommentarer!
Spørg AI
Spørg AI
Spørg om hvad som helst eller prøv et af de foreslåede spørgsmål for at starte vores chat