01
małe-modele·arXiv:2507.15857·
22 lipca 2026
Każdy model, którego odpalasz u siebie, pisze tak samo: jeden token, od lewej do prawej, bez prawa cofnięcia. To autoregresja i rządzi całą sceną. Ale jest drugi sposób — dyfuzja, która tekst nie tyle pisze, co wywołuje z szumu. I okazuje się, że w jednym konkretnym reżimie, akurat tym twoim, bije autoregresję na głowę.
Zobacz →
02
małe-modele·arXiv:2404.10102·
20 lipca 2026
Reguła „dwadzieścia tokenów na parametr" rządziła treningiem LLM-ów przez lata. Potem ktoś sprawdził rachunki i okazało się, że przedziały ufności wymagałyby 600 tysięcy eksperymentów. Rozbieramy replikację Chinchilli — i pokazujemy, czemu modele, które odpalasz u siebie, są celowo trenowane wbrew tej regule.
Zobacz →
03
fine-tuning·arXiv:2305.14314·
15 lipca 2026
Dostroić model 65B na jednej karcie 48 GB, z jakością pełnego 16-bitowego treningu? QLoRA mrozi wagi w 4 bitach i trenuje same adaptery. Rozkładamy na części, jak to w ogóle ma prawo działać.
Zobacz →
04
kwantyzacja·arXiv:2402.17764·
13 lipca 2026
Miliardy wag modelu ściśnięte do trzech wartości: minus jeden, zero, plus jeden. Bez mnożeń, prawie bez pamięci — i, od pewnego rozmiaru, prawie bez straty jakości. Rozbieramy pracę, która ogłosiła erę 1-bitowych LLM-ów.
Zobacz →
05
inferencja·arXiv:2205.14135·
11 lipca 2026
Wrzucasz jedną flagę, -fa, i model nagle mieści dłuższy kontekst na tej samej karcie. Za tym skrótem stoi praca, która nie przybliża uwagi ani jej nie tnie — tylko przestawia kolejność liczenia tak, żeby wielka macierz N×N nigdy nie musiała wylądować w wolnej pamięci.
Zobacz →
06
inferencja·arXiv:2401.04088·
9 lipca 2026
Mixtral 8x7B na token rusza tylko ~13 z 47 miliardów wag, ale do pamięci musisz wcisnąć wszystkie. Rozbieramy, czemu MoE oszczędza obliczenia, a nie ani grama VRAM-u.
Zobacz →
07
inferencja·arXiv:2312.00752·
7 lipca 2026
Transformer płaci za każdy token kwadratem, a jego KV-cache puchnie z długością rozmowy jak balon. Mamba mówi: da się liniowo i przy stałym stanie. Rozkładamy na części, co potrafią selektywne modele przestrzeni stanów.
Zobacz →
08
inferencja·arXiv:2309.00071·
5 lipca 2026
Model uczony na 4 tysiącach tokenów nagle ogarnia 128 tysięcy. Nie magia, nie retrening od zera — tylko sprytne przekręcenie zegara pozycji w RoPE i kilkaset kroków douczenia.
Zobacz →
09
kwantyzacja·arXiv:2210.17323·
3 lipca 2026
GPTQ liczy odwrotność Hessianu i po kolei koryguje błąd warstwa po warstwie. AWQ patrzy na aktywacje i skaluje kanały wag. Rozkładamy obie szkoły na części i mówimy, po co komu która.
Zobacz →