Inferownia. // miejsce, gdzie odpalasz modele
Szuflada

Poradniki

Praktyka warsztatu: jak odpalić model na swoim sprzęcie, jak skwantyzować wagi, żeby zmieściły się w pamięci, i jak poskładać z tego coś użytecznego.
RSS działu ↗
Filtr · kategoria 9 wyników
01

bf16, f16, f32 — o co chodzi z tymi bitami

Konwertujesz model do GGUF-a, widzisz --outtype f16 i --outtype bf16, i przez sekundę udajesz przed samym sobą, że wiesz, którego wybrać. Rozbieramy te formaty na bity — znak, wykładnik, mantysa — i tłumaczymy, czemu bf16 wygrał trening ML, choć jest mniej dokładny niż f16.

Zobacz →
02

llama.cpp: flagi, które naprawdę musisz znać

Wpisujesz llama-cli --help i dostajesz ścianą flag prosto w twarz. Rozbieramy te, które realnie decydują, czy model wejdzie na twój sprzęt i jak szybko będzie gadał.

Zobacz →
03

Nazwy kwantyzacji GGUF: co znaczy Q4_K_M i cała reszta

Wchodzisz na kartę modelu na Hugging Face, a tam kolumna pełna szyfrów: Q4_K_M, Q5_K_S, IQ2_XXS. Rozbieramy te nazwy litera po literze — żebyś wiedział, który plik pobrać, a nie zgadywał.

Zobacz →
04

KV-cache: dlaczego długi kontekst zjada VRAM

Wagi się załadowały, model wszedł na kartę z zapasem — a po dłuższej rozmowie znów wyskakuje out of memory. Winny nie jest model. Winny jest bufor, który puchnie z każdym tokenem.

Zobacz →
05

Ile VRAM-u potrzebuje model? Liczymy na palcach

Nowy model, ładna karta modelu, a na dole jedno zdanie: 16 GB VRAM. Ty masz te swoje 8. Zamiast wróżyć z fusów, policzmy na palcach, ile naprawdę zważy — i jak zejść niżej.

Zobacz →
06

RAG lokalnie, bez chmury: jak to się w ogóle spina

Chcesz, żeby lokalny model gadał o twoich notatkach, a nie o Wikipedii sprzed treningu. Rozbieramy RAG na części: chunking, embeddingi, baza wektorowa, retrieval — i tłumaczymy, czego on NIE załatwia.

Zobacz →
07

Speculative decoding: jak mały model przyspiesza duży

Duży model musi robić pełny przebieg dla każdego pojedynczego tokena — stąd ten mielący rytm generacji. Speculative decoding łamie ten rytm: mały model zgaduje kilka tokenów naprzód, duży sprawdza je hurtem. I najlepsze: bez utraty jakości.

Zobacz →
08

Wymuszanie JSON-a w llama.cpp: gramatyki GBNF

Prosisz model o czysty JSON, a dostajesz esej, blok w markdownie i przecinek w złym miejscu. Gramatyki GBNF w llama.cpp odbierają mu wybór: model może wypluć tylko te tokeny, które pasują do reguł. Rozbieramy, jak to działa na poziomie samplera.

Zobacz →
09

Ollama, llama.cpp, LM Studio: co siedzi pod maską

Instalujesz Ollamę, model gada od strzału i myślisz: magia. A pod tym ładnym `ollama run` siedzi ten sam silnik, co pod resztą. Rozbieramy, kto tu jest maszyną, a kto tylko obudową.

Zobacz →