Transformatorbaserade Generativa Modeller
Svep för att visa menyn
Introduktion till transformatorer och självuppmärksamhet
Transformatorer är en grundläggande arkitektur inom modern AI, särskilt inom Natural Language Processing (NLP) och generativ modellering. Först introducerad i artikeln "Attention is All You Need" (Vaswani et al., 2017), överger transformatorer rekurrens till förmån för en mekanism kallad självuppmärksamhet, som gör det möjligt för modeller att beakta alla delar av inmatningssekvensen samtidigt.
Självuppmärksamhetsmekanism
Självuppmärksamhetsmekanismen gör det möjligt för modellen att väga vikten av olika token i en sekvens i förhållande till varandra. Detta görs med hjälp av tre matriser härledda från inbäddningarna:
- Query (Q);
- Key (K);
- Value (V).
Uppmärksamhetsutdata beräknas som:
Attention(Q,K,V)=softmax(dkQKT)VDär:
- Q, K och V är matriser härledda från inmatningen.
- dk är dimensionen på nyckelvektorerna.
- softmax omvandlar likhetspoängen till sannolikheter.
Detta gör att varje token kan uppmärksamma varje annan token och justera sin representation därefter.
Översikt av transformatorarkitektur
Transformermodellen består av staplade encoder- och decoderlager:
- Encoder omvandlar indata till en kontextualiserad latent representation;
- Decoder genererar utdata-token med hjälp av encoderns utdata och tidigare token.
Varje lager innehåller:
- Multi-Head Self-Attention;
- Feedforward-neurala nätverk;
- Lagernormalisering;
- Residuala kopplingar.
Multi-Head Self-Attention
Istället för att beräkna en enda uppmärksamhetsfunktion använder transformern flera uppmärksamhetshuvuden. Varje huvud lär sig att fokusera på olika delar av sekvensen.
Multi-Head(Q,K,V)=Concat(head1,head2,...,headn)W0Där varje huvud beräknas som:
headi=Attention(QWiQ,KWiK,VWiV)Där:
- WiQ,WiK,WiV är projektionmatriser för queries, keys och values;
- W0 projicerar de sammansatta huvudena tillbaka till ursprunglig dimension.
Feedforward-neurala nätverk
Varje transformerblock innehåller ett positionsvis feedforward-nätverk som appliceras oberoende på varje position:
FFN(x)=ReLU(xW1+b1)W2+b2- Består av två linjära lager med en icke-linjäritet (t.ex. ReLU) emellan;
- Applicerar samma transformation på alla positioner.
Lagernormalisering
Lagernormalisering normaliserar indata över funktionerna (kanalerna) istället för batchen. Detta stabiliserar träningen och förbättrar konvergensen:
LayerNorm(x)=σx−μ⋅γ+βDär:
- μ är medelvärdet av funktionerna;
- σ är standardavvikelsen;
- γ och β är lärbara parametrar.
Residuala kopplingar
Residuala kopplingar adderar indata för varje sublager till dess utdata:
Output=Layer(x)+x- Detta hjälper gradientflödet och möjliggör träning av djupare modeller;
- Används runt både självuppmärksamhets- och feedforward-lager.
I endast-dekoder-modeller (som GPT) används endast dekodern med kausal (maskerad) självuppmärksamhet.
Generativa förtränade transformatorer (GPT)
GPT-modeller är endast-dekoder-transformatorer som tränas för att förutsäga nästa token på ett autoregressivt sätt:
P(x1,x2,...,xn)=t=1∏nP(xt∣x<t)Viktiga egenskaper:
- Tränade på storskaliga textdatamängder;
- Kan generera sammanhängande och varierad text;
- Används ofta i applikationer som chattbottar och kodgenerering.
BERT och maskerad språkmodellering
BERT (Bidirectional Encoder Representations from Transformers) använder endast encodern. Den tränas med maskerad språkmodellering (MLM):
- Slumpmässiga token ersätts med en [MASK];
- Modellen förutspår den ursprungliga token baserat på full kontext.
Detta gör BERT lämplig för uppgifter som klassificering, frågor och svar samt semantisk likhet.
Transformatorer och LLM:er
Transformatorer är grunden för stora språkmodeller (LLM:er) som GPT-3, GPT-4, PaLM, LLaMA och Claude.
LLM:er använder stora datamängder och hundratals miljarder parametrar, vilket gör det möjligt för dem att:
- Förstå och generera mänskligt språk;
- Utföra översättning, sammanfattning, frågor och svar, resonemang;
- Driva chattbottar, dokumentanalysverktyg och kodningsassistenter.
Transformatorers skalbarhet och förmåga att modellera långdistansberoenden gör dem idealiska för dessa modeller.
1. Vilken är den främsta innovationen som introducerades av transformatorer?
2. Vad skiljer BERT från GPT?
3. Varför är transformatorer idealiska för LLM:er?
Tack för dina kommentarer!
Fråga AI
Fråga AI
Fråga vad du vill eller prova någon av de föreslagna frågorna för att starta vårt samtal