# Inferownia > Inferownia — polski hub wiedzy o lokalnym AI: uruchamianie modeli językowych na własnym sprzęcie, kwantyzacja, inferencja, małe modele, fine-tuning i RAG. Portal po polsku o lokalnym AI: uruchamianie modeli językowych na własnym sprzęcie. Autor: Szymon Kocur. Adres: https://inferownia.pl/ ## Poradniki Praktyczne how-to: uruchamianie modeli lokalnie, kwantyzacja krok po kroku, budowa RAG. - [bf16, f16, f32 — o co chodzi z tymi bitami](https://inferownia.pl/poradniki/bf16-f16-f32/): Konwertujesz model do GGUF-a, widzisz –outtype f16 i –outtype bf16, i przez sekundę udajesz przed samym sobą, że wiesz, którego wybrać. Rozbieramy te formaty na … - [llama.cpp: flagi, które naprawdę musisz znać](https://inferownia.pl/poradniki/flagi-llama-cpp/): Wpisujesz llama-cli –help i dostajesz ścianą flag prosto w twarz. Rozbieramy te, które realnie decydują, czy model wejdzie na twój sprzęt i jak szybko będzie … - [Nazwy kwantyzacji GGUF: co znaczy Q4_K_M i cała reszta](https://inferownia.pl/poradniki/nazwy-kwantyzacji-gguf/): Wchodzisz na kartę modelu na Hugging Face, a tam kolumna pełna szyfrów: Q4_K_M, Q5_K_S, IQ2_XXS. Rozbieramy te nazwy litera po literze — żebyś wiedział, który … - [KV-cache: dlaczego długi kontekst zjada VRAM](https://inferownia.pl/poradniki/kv-cache-vram/): Wagi się załadowały, model wszedł na kartę z zapasem — a po dłuższej rozmowie znów wyskakuje out of memory. Winny nie jest model. Winny jest bufor, który … - [Ile VRAM-u potrzebuje model? Liczymy na palcach](https://inferownia.pl/poradniki/ile-vram-na-model/): Nowy model, ładna karta modelu, a na dole jedno zdanie: 16 GB VRAM. Ty masz te swoje 8. Zamiast wróżyć z fusów, policzmy na palcach, ile naprawdę zważy — i jak … - [RAG lokalnie, bez chmury: jak to się w ogóle spina](https://inferownia.pl/poradniki/rag-lokalnie/): Chcesz, żeby lokalny model gadał o twoich notatkach, a nie o Wikipedii sprzed treningu. Rozbieramy RAG na części: chunking, embeddingi, baza wektorowa, … - [Speculative decoding: jak mały model przyspiesza duży](https://inferownia.pl/poradniki/speculative-decoding/): Duży model musi robić pełny przebieg dla każdego pojedynczego tokena — stąd ten mielący rytm generacji. Speculative decoding łamie ten rytm: mały model zgaduje … - [Wymuszanie JSON-a w llama.cpp: gramatyki GBNF](https://inferownia.pl/poradniki/gbnf-json/): Prosisz model o czysty JSON, a dostajesz esej, blok w markdownie i przecinek w złym miejscu. Gramatyki GBNF w llama.cpp odbierają mu wybór: model może wypluć … - [Ollama, llama.cpp, LM Studio: co siedzi pod maską](https://inferownia.pl/poradniki/ollama-llama-cpp-lm-studio/): Instalujesz Ollamę, model gada od strzału i myślisz: magia. A pod tym ładnym ollama run siedzi ten sam silnik, co pod resztą. Rozbieramy, kto tu jest maszyną, a … ## Aktualności Krótkie notki o tym, co nowego w ekosystemie lokalnego AI: narzędzia, modele, wydania. - [Backendy llama.cpp: świat poza CUDA](https://inferownia.pl/aktualnosci/backendy-llama-cpp/): Nie masz zielonej karty i już myślisz, że lokalne LLM-y nie są dla ciebie? llama.cpp liczy na CPU, Metalu, Vulkanie i całej reszcie sprzętu — CUDA to tylko … - [Nowy model? Na co patrzeć, zanim go ściągniesz](https://inferownia.pl/aktualnosci/nowy-model-na-co-patrzec/): Świeży model wpada na Hugging Face, scena huczy, a ty już masz palec nad przyciskiem pobierania. Zanim klikniesz, przejdź tę krótką listę — oszczędzi ci … - [Ekosystem GGUF: skąd się biorą modele, które odpalasz](https://inferownia.pl/aktualnosci/ekosystem-gguf/): Ściągasz jeden plik z Hugging Face, dwuklik i model gada. Ale kto go w ogóle zrobił, czemu wariantów jest dwadzieścia i co siedzi w środku tego jednego .gguf? … ## Naukowy Omówienia świeżych papierów o LLM i lokalnym AI z arXiv — po polsku, własnymi słowami. - [QLoRA: fine-tuning dużego modelu w 4 bitach](https://inferownia.pl/naukowy/qlora/): Dostroić model 65B na jednej karcie 48 GB, z jakością pełnego 16-bitowego treningu? QLoRA mrozi wagi w 4 bitach i trenuje same adaptery. Rozkładamy na części, … - [BitNet b1.58: era 1-bitowych LLM-ów](https://inferownia.pl/naukowy/bitnet-1bit/): Miliardy wag modelu ściśnięte do trzech wartości: minus jeden, zero, plus jeden. Bez mnożeń, prawie bez pamięci — i, od pewnego rozmiaru, prawie bez straty … - [FlashAttention: uwaga, która nie zjada pamięci](https://inferownia.pl/naukowy/flashattention/): Wrzucasz jedną flagę, -fa, i model nagle mieści dłuższy kontekst na tej samej karcie. Za tym skrótem stoi praca, która nie przybliża uwagi ani jej nie tnie — … - [Mixture of Experts: czemu aktywne parametry to nie wszystkie](https://inferownia.pl/naukowy/mixture-of-experts/): Mixtral 8x7B na token rusza tylko ~13 z 47 miliardów wag, ale do pamięci musisz wcisnąć wszystkie. Rozbieramy, czemu MoE oszczędza obliczenia, a nie ani grama … - [Mamba: co potrafią modele przestrzeni stanów](https://inferownia.pl/naukowy/mamba-ssm/): Transformer płaci za każdy token kwadratem, a jego KV-cache puchnie z długością rozmowy jak balon. Mamba mówi: da się liniowo i przy stałym stanie. Rozkładamy … - [YaRN: jak rozciągnąć kontekst, którego model nie widział](https://inferownia.pl/naukowy/yarn-kontekst/): Model uczony na 4 tysiącach tokenów nagle ogarnia 128 tysięcy. Nie magia, nie retrening od zera — tylko sprytne przekręcenie zegara pozycji w RoPE i kilkaset … - [GPTQ kontra AWQ: dwie szkoły kwantyzacji po treningu](https://inferownia.pl/naukowy/gptq-awq/): GPTQ liczy odwrotność Hessianu i po kolei koryguje błąd warstwa po warstwie. AWQ patrzy na aktywacje i skaluje kanały wag. Rozkładamy obie szkoły na części i … ## Więcej - [O projekcie](https://inferownia.pl/o-projekcie/): czym jest Inferownia i jak powstają wpisy. - [Kanał RSS](https://inferownia.pl/index.xml): wszystkie wpisy.