High-tech server room with glowing blue and gold fiber optic

Architektúra LLM

Technická dekonštrukcia mechanizmov spracovania dát vo veľkých jazykových modeloch. Analýza výpočtových cyklov, neurónových váh a procesov inferencie.

175B+

Parametrov (GPT-3)

50k

Veľkosť slovníka tokenov

96

Vrstiev Attention mechanizmu

<10ms

Latencia na jeden token

Data Input Cycle: Príjem a normalizácia

Vstupný cyklus dát začína transformáciou surového textového reťazca do formátu, ktorý je spracovateľný matematickými operáciami. Tento proces nie je interpretáciou významu v ľudskom zmysle, ale sekvenčnou konverziou znakov na numerické vektory. Systém najprv vykoná sanitáciu vstupu, odstráni nežiaduce kontrolné znaky a pripraví text na segmentáciu. Každý znak alebo skupina znakov je následne priradená k unikátnemu identifikátoru v preddefinovanej matici.

Mechanizmus spracovania pracuje v striktných cykloch, kde dĺžka kontextového okna určuje maximálny objem dát, ktoré môžu byť spracované v jednej operácii. Ak vstup presiahne limit (napríklad 32 768 tokenov), staršie dáta sú z operačnej pamäte modelu vytlačené, čo vedie k strate kontinuity. Tento fyzikálny limit architektúry definuje rozsah "krátkodobej pamäte" systému počas generovania odpovede.

⚠ Technické upozornenie:

Preťaženie vstupného buffera nadmerne komplexnými dopytmi zvyšuje riziko výpočtovej degradácie. Systém v takom prípade prioritizuje posledné prijaté segmenty dát na úkor počiatočných inštrukcií.

Po normalizácii nasleduje fáza "Position Encoding", kde je každému prvku priradený vektor určujúci jeho relatívnu a absolútnu pozíciu v sekvencii. Bez tohto kroku by model vnímal text ako neusporiadanú množinu slov, čím by sa eliminovala schopnosť chápať syntaktické vzťahy. Viac o tomto procese nájdete v sekcii Konštrukcia dopytov: Technické špecifikácie.

Tokenization Process

Tokenizácia je proces atomizácie textu na najmenšie významové jednotky, nazývané tokeny. Na rozdiel od jednoduchého delenia na slová, moderné LLM využívajú algoritmy ako Byte Pair Encoding (BPE), ktoré rozkladajú zriedkavé slová na sub-word jednotky. Tento prístup umožňuje modelu efektívne spracovávať neznáme slová a optimalizovať veľkosť slovníka.

  1. 1 Rozklad vstupného reťazca na základné bajty.
  2. 2 Iteratívne spájanie najčastejšie sa vyskytujúcich dvojíc znakov.
  3. 3 Mapovanie výsledných jednotiek na indexy v embedding matici.

Priemerný pomer je približne 0,75 slova na 1 token. V technických textoch alebo kóde sa tento pomer mení v závislosti od frekvencie špeciálnych znakov. Podrobný zoznam termínov nájdete v našom Terminologickom slovníku.

Abstract 3D visualization of floating digital blocks with nu

Matrica neurónových váh

Komponent systému Funkcia váhových koeficientov Vplyv na výstup
Attention Heads Určujú relevanciu medzi tokenmi v kontexte. Zabezpečujú koherentnosť dlhých odpovedí.
Feed-Forward Layers Transformujú aktivácie v rámci vrstiev. Ukladajú faktografické znalosti modelu.
Embedding Weights Definujú polohu tokenu vo vektorovom priestore. Určujú sémantickú podobnosť pojmov.

Poznámka: Váhy sú fixné parametre získané počas tréningu. Počas inferencie (používania) sa tieto hodnoty nemenia, čo zaručuje deterministický priebeh výpočtov pri identických nastaveniach teploty (temperature).

Mechanika inferencie

Proces generovania odpovede prebieha v autoregresnom režime, kde každý predpovedaný token slúži ako vstup pre predpoveď nasledujúceho.

Softmax distribúcia

Posledná vrstva modelu generuje skóre pravdepodobnosti pre každý token v slovníku. Funkcia Softmax tieto skóre normalizuje na hodnoty medzi 0 a 1.

Zobraziť operácie

Sampling stratégie

Metódy ako Top-P (nucleus sampling) alebo Top-K určujú, z ktorej časti pravdepodobnostného rozdelenia bude vybraný nasledujúci token.

Diagnostika chýb
sprite-a

KV Caching

Technika optimalizácie, ktorá ukladá vypočítané kľúče (Keys) a hodnoty (Values) predchádzajúcich tokenov, aby sa predišlo redundantným výpočtom.

Detaily architektúry

Pripravení na implementáciu?

Porozumenie architektúre je prvým krokom k efektívnemu využívaniu LLM v profesionálnom prostredí. Pokračujte k technickým špecifikáciám dopytov.

Prejsť na Prompt Engineering