Słownik pojęć
Terminy, które wracają w artykułach, zebrane w jednym miejscu i wyłożone po ludzku. W treści wpisów każde pojęcie jest podlinkowane do swojej definicji tutaj — a po najechaniu pokazuje skrót w dymku. Jak coś w tekście brzmi jak zaklęcie, zacznij stąd.
- autoregresja
- Autoregresja to generowanie tekstu jeden token naraz, od lewej do prawej: model dostaje dotychczasowy ciąg i przewiduje następny token, dokleja go i pyta znowu. Uwaga jest przyczynowa — każda pozycja widzi tylko to, co przed nią. To paradygmat, na którym stoi cała dzisiejsza scena LLM-ów.
- epoka
- Epoka to jedno pełne przejście przez cały korpus treningowy. Przy dużych zbiorach model często widzi dane raz (jedna epoka), ale przy małym, ustalonym korpusie te same dane powtarza się przez wiele epok — i wtedy zaczyna mieć znaczenie, który typ modelu dłużej wyciąga korzyść z powtórek, zanim zacznie zapamiętywać zamiast uogólniać.
- fine-tuning
- Fine-tuning to dalsze trenowanie już wytrenowanego modelu na węższym, własnym zbiorze — po to, żeby przejął żargon, ton albo umiejętność, której model bazowy nie miał. Tańszy niż trenowanie od zera i często robiony metodami oszczędnymi, jak QLoRA.
- FlashAttention
- FlashAttention to zoptymalizowany sposób liczenia uwagi, który nie materializuje w pamięci pełnej macierzy uwagi, tylko przetwarza ją kawałkami w szybkiej pamięci karty. Efekt: mniejsze zużycie VRAM i wyraźnie szybsze trenowanie oraz inferencja, zwłaszcza przy długim kontekście.
- KV-cache
- KV-cache przechowuje policzone raz klucze (K) i wartości (V) mechanizmu uwagi dla wcześniejszych tokenów, żeby przy generowaniu kolejnego nie liczyć wszystkiego od nowa. Przyspiesza inferencję autoregresyjną, ale rośnie liniowo z długością rozmowy i potrafi zająć sporo VRAM.
- kwantyzacja
- Kwantyzacja zmniejsza precyzję, z jaką zapisane są wagi modelu — zamiast 16 bitów na liczbę bierze się 4 albo 8. Model chudnie kilkukrotnie i mieści się na skromniejszym VRAM, a jakość spada zaskakująco mało. To podstawowa sztuczka, dzięki której duże modele dają się odpalać lokalnie.
- mixture-of-experts (MoE)
- Mixture-of-experts to model złożony z wielu podsieci (ekspertów), z których router wybiera dla każdego tokena tylko kilku. Dzięki temu łączna liczba parametrów bywa ogromna (biliony), ale koszt liczenia na token odpowiada dużo mniejszemu modelowi. Haczyk: wszystkie wagi i tak trzeba gdzieś trzymać, bo nie wiadomo z góry, których ekspertów model zechce.
- model dyfuzyjny
- Dyfuzyjny model językowy uczy się, odgadując tokeny zamaskowane losowo w zdaniu (bez kierunku lewo-prawo, patrząc w obie strony). Przy generowaniu startuje od sekwencji samych masek i odsłania ją stopniowo, w kolejności pewności. Losowa maska działa jak darmowa augmentacja danych, co pomaga zwłaszcza przy małych korpusach mielonych przez wiele epok.
- okno kontekstu
- Okno kontekstu to maksymalna liczba tokenów, które model może uwzględnić jednocześnie — wszystko, co poza nie wypadnie, przestaje być brane pod uwagę. Dłuższy kontekst pozwala podać więcej materiału naraz, ale kosztuje pamięć (rośnie m.in. KV-cache) i czas.
- parametr
- Parametr to jedna z wag modelu — liczba, którą trening stopniowo dostraja tak, żeby model lepiej przewidywał. Ich łączna liczba (7B = siedem miliardów, 106M = sto sześć milionów) to podstawowa miara wielkości modelu, choć przy MoE trzeba odróżnić parametry łączne od aktywnych na token.
- perplexity
- Perplexity mówi, między iloma równie prawdopodobnymi opcjami model średnio się waha, wybierając kolejny token. Perplexity 20 znaczy „jestem tak niepewny, jakbym losował spośród dwudziestu opcji”, a perplexity 2 — „waham się między dwiema”. Im niżej, tym pewniej i lepiej. Model rzucający monetą przy słowniku ośmiu tysięcy tokenów miałby perplexity około 8000; idealny — 1. Matematycznie to e podniesione do straty (cross-entropy).
- token
- Token to jednostka, na jaką tokenizator tnie tekst przed podaniem go modelowi — najczęściej fragment słowa (dla polszczyzny bywa to kilka tokenów na słowo). Modele liczą kontekst, koszt i długość generacji właśnie w tokenach, nie w znakach ani słowach.