AI-tananyagok
Vissza az AI-tananyagokhoz

3D Transformer: egy token útja

Egy kis, négyrétegű transzformer háromdimenziós modellje. A kamera egyetlen tokent követ az embeddingtől az attentionön és az MLP-n át a következő token kiválasztásáig.

28 mp-es videó és 4 ábra · kb. 15 perc · kezdő. Legjobb az LLM-tananyag 4–5. szintje után, összefoglalóként.

A videó megtekintése →
A transzformer teljes modellje felülről, metszetben: balra a tokenek belépése, középen négy egymás utáni réteg, jobbra a kimenet
A teljes modell metszetben. A szerkezet végig egy irányba halad: balról jobbra, rétegről rétegre.

A videó

Magyar feliratos, hang nélküli, 28 másodperces videó. A lépésekre kattintva a videó az adott részhez ugrik.

Fontos: ez nem egy betanított modell. A súlyok egy rögzített véletlenmagból (42) származnak, és nincsenek betanítva. Minden látható érték valódi számítás eredménye és reprodukálható, de a kiválasztott „A” token és a 90,65% nem nyelvi jóslat: egy betanítatlan szemléltető modell kimenete. A THE, CAT, SAT feliratok egyszerű tokenazonosítók, nem egy valódi tokenizáló eredményei.

Négy ábra közelről

A négyrétegű transzformer teljes modellje ferde felülnézetből
1. ábra. A teljes szerkezet. Az arany gerinc a residual stream: az információ fő útvonala. Minden rétegben két oldalág (attention és MLP) olvas belőle, és a frissítését hozzáadja; a gerinc végig egyenes marad. Kék a Query, borostyán a Key, zöld a Value útja. Kapcsolódó anyag: LLM-tananyag, 4. szint.
Közeli kép a Query- és Key-ágak forgó gyűrűiről egy attention-fejben
2. ábra. RoPE, közelről. Minden fej Query- és Key-ágán három gyűrű forog: ezek a hat koordináta három kétdimenziós síkját jelképezik. A forgatás szöge a token pozíciójától függ (a p = 2 pozícióhoz 2; 0,0928; 0,0043 radián tartozik), így két token skalárszorzata a relatív távolságukat is tükrözi. A Value-ág nem forog.
Közeli kép a pontozásról, a KV-tárról és a súlyozott Value-összegzésről
3. ábra. Attention és KV-tár. A pontozás a forgatott Query és a tárolt Key skalárszorzata. A kiemelkedő elemek magassága a softmax-súllyal arányos, a jövőbeli pozíció lezárva (kauzális maszk). A harmadik token első rétegében például az 1. fej súlyai 0,109 / 0,537 / 0,354, a 4. fejé 0,113 / 0,029 / 0,858: tényleges számítási értékek. A KV-tárban rétegenként megmaradnak a korábbi tokenek Key- és Value-vektorai, így a következő token számításakor nem kell őket újraszámolni.
A modell felülnézeti elrendezése: rétegek balról jobbra, alul az attention, felül az MLP
4. ábra. Felülnézet. A rétegek balról jobbra követik egymást; a gerinc egyik oldalán az attention, a másikon az MLP dolgozik. Az elrendezés csak szemléltetés: a számítás nem térben, hanem mátrixműveletekben történik.

Pontosan milyen modell ez?

Egy pre-norm, csak dekóderes, kauzális transzformer, teljes többfejű attentionnel. A RoPE pozíciókódolás, az RMSNorm normalizálás és a SwiGLU MLP egy következetes felépítést ad. Ezeket az elemeket sok mai, csak dekóderből álló nyílt modell használja, de nem mind, és ez nem egy konkrét modell másolata. [1] [2] [3] [4]

Rétegek
4
Reprezentáció (d_model)
24 koordináta
Attention-fejek
rétegenként 4, fejenként 6 dimenzió
MLP belső mérete
64
Szótár
8 token: THE, CAT, SAT, ON, MAT, A, „.”, <eos>
Bemenet
THE CAT SAT (a kamera a harmadik tokent követi)
Súlyok
rögzített véletlenmag (42), betanítatlan
Kiválasztás
mohó (argmax), T = 1

A kimenet: valószínűségek a következő tokenre

A számítást ellenőrzések kísérik: a kauzális maszk mögötti jövőbeli valószínűség pontosan 0; a KV-tárral és anélkül számolt eredmény eltérése 0; a RoPE normamegőrzési és relatívpozíció-hibája 4,4 · 10⁻¹⁶ (gépi pontosság).

Hogyan kapcsolódik a tananyaghoz? A tokenizálásról az LLM-tananyag 2. szintje, az embeddingről a 3., az attentionről és a residual streamről a 4., az MLP-ről, a normalizálásról és a pozíciókódolásról az 5. szint, a KV-tárról és a mintavételről a 9. szint szól.

Források

  1. [1]

    Vaswani, A. és mtsai. (2017). Attention Is All You Need. NeurIPS. arXiv:1706.03762

  2. [2]

    Touvron, H. és mtsai. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971

  3. [3]

    Su, J. és mtsai. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864

  4. [4]

    Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202

A 3D modell, a videó és az ábrák Blenderben készültek. A számértékek a szemléltető modell numerikus számításából származnak; a futtatókód és a részletes számítási nyomkövetés ezen az oldalon még nem érhető el.