Inferownia. // miejsce, gdzie odpalasz modele
Szuflada

Naukowy

Omówienia najświeższych prac o modelach językowych — ze szczególnym naciskiem na to, co da się uruchomić lokalnie. Piszemy po polsku, własnymi słowami, a każde omówienie linkuje do oryginału na arXiv.
RSS działu ↗
Filtr · kategoria 9 wyników
01

Autoregresja kontra dyfuzja: co wygrywa, gdy danych zaczyna brakować

Każdy model, którego odpalasz u siebie, pisze tak samo: jeden token, od lewej do prawej, bez prawa cofnięcia. To autoregresja i rządzi całą sceną. Ale jest drugi sposób — dyfuzja, która tekst nie tyle pisze, co wywołuje z szumu. I okazuje się, że w jednym konkretnym reżimie, akurat tym twoim, bije autoregresję na głowę.

Zobacz →
02

Prawa skalowania: czemu mały model połyka biliony tokenów

Reguła „dwadzieścia tokenów na parametr" rządziła treningiem LLM-ów przez lata. Potem ktoś sprawdził rachunki i okazało się, że przedziały ufności wymagałyby 600 tysięcy eksperymentów. Rozbieramy replikację Chinchilli — i pokazujemy, czemu modele, które odpalasz u siebie, są celowo trenowane wbrew tej regule.

Zobacz →
03

QLoRA: fine-tuning dużego modelu w 4 bitach

Dostroić model 65B na jednej karcie 48 GB, z jakością pełnego 16-bitowego treningu? QLoRA mrozi wagi w 4 bitach i trenuje same adaptery. Rozkładamy na części, jak to w ogóle ma prawo działać.

Zobacz →
04

BitNet b1.58: era 1-bitowych LLM-ów

Miliardy wag modelu ściśnięte do trzech wartości: minus jeden, zero, plus jeden. Bez mnożeń, prawie bez pamięci — i, od pewnego rozmiaru, prawie bez straty jakości. Rozbieramy pracę, która ogłosiła erę 1-bitowych LLM-ów.

Zobacz →
05

FlashAttention: uwaga, która nie zjada pamięci

Wrzucasz jedną flagę, -fa, i model nagle mieści dłuższy kontekst na tej samej karcie. Za tym skrótem stoi praca, która nie przybliża uwagi ani jej nie tnie — tylko przestawia kolejność liczenia tak, żeby wielka macierz N×N nigdy nie musiała wylądować w wolnej pamięci.

Zobacz →
07

Mamba: co potrafią modele przestrzeni stanów

Transformer płaci za każdy token kwadratem, a jego KV-cache puchnie z długością rozmowy jak balon. Mamba mówi: da się liniowo i przy stałym stanie. Rozkładamy na części, co potrafią selektywne modele przestrzeni stanów.

Zobacz →
09

GPTQ kontra AWQ: dwie szkoły kwantyzacji po treningu

GPTQ liczy odwrotność Hessianu i po kolei koryguje błąd warstwa po warstwie. AWQ patrzy na aktywacje i skaluje kanały wag. Rozkładamy obie szkoły na części i mówimy, po co komu która.

Zobacz →