Inferownia. // miejsce, gdzie odpalasz modele
Szuflada

Naukowy

Omówienia najświeższych prac o modelach językowych — ze szczególnym naciskiem na to, co da się uruchomić lokalnie. Piszemy po polsku, własnymi słowami, a każde omówienie linkuje do oryginału na arXiv.
RSS działu ↗
Filtr · kategoria 7 wyników
01

QLoRA: fine-tuning dużego modelu w 4 bitach

Dostroić model 65B na jednej karcie 48 GB, z jakością pełnego 16-bitowego treningu? QLoRA mrozi wagi w 4 bitach i trenuje same adaptery. Rozkładamy na części, jak to w ogóle ma prawo działać.

Zobacz →
02

BitNet b1.58: era 1-bitowych LLM-ów

Miliardy wag modelu ściśnięte do trzech wartości: minus jeden, zero, plus jeden. Bez mnożeń, prawie bez pamięci — i, od pewnego rozmiaru, prawie bez straty jakości. Rozbieramy pracę, która ogłosiła erę 1-bitowych LLM-ów.

Zobacz →
03

FlashAttention: uwaga, która nie zjada pamięci

Wrzucasz jedną flagę, -fa, i model nagle mieści dłuższy kontekst na tej samej karcie. Za tym skrótem stoi praca, która nie przybliża uwagi ani jej nie tnie — tylko przestawia kolejność liczenia tak, żeby wielka macierz N×N nigdy nie musiała wylądować w wolnej pamięci.

Zobacz →
04

Mixture of Experts: czemu aktywne parametry to nie wszystkie

Mixtral 8x7B na token rusza tylko ~13 z 47 miliardów wag, ale do pamięci musisz wcisnąć wszystkie. Rozbieramy, czemu MoE oszczędza obliczenia, a nie ani grama VRAM-u.

Zobacz →
05

Mamba: co potrafią modele przestrzeni stanów

Transformer płaci za każdy token kwadratem, a jego KV-cache puchnie z długością rozmowy jak balon. Mamba mówi: da się liniowo i przy stałym stanie. Rozkładamy na części, co potrafią selektywne modele przestrzeni stanów.

Zobacz →
06

YaRN: jak rozciągnąć kontekst, którego model nie widział

Model uczony na 4 tysiącach tokenów nagle ogarnia 128 tysięcy. Nie magia, nie retrening od zera — tylko sprytne przekręcenie zegara pozycji w RoPE i kilkaset kroków douczenia.

Zobacz →
07

GPTQ kontra AWQ: dwie szkoły kwantyzacji po treningu

GPTQ liczy odwrotność Hessianu i po kolei koryguje błąd warstwa po warstwie. AWQ patrzy na aktywacje i skaluje kanały wag. Rozkładamy obie szkoły na części i mówimy, po co komu która.

Zobacz →