<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Chinchilla — Inferownia</title><link>https://inferownia.pl/tags/chinchilla/</link><description>Inferownia — polski hub wiedzy o lokalnym AI: uruchamianie modeli językowych na własnym sprzęcie, kwantyzacja, inferencja, małe modele, fine-tuning i RAG.</description><language>pl-PL</language><copyright>&#169; 2026 Inferownia</copyright><lastBuildDate>Mon, 20 Jul 2026 00:00:00 +0200</lastBuildDate><atom:link href="https://inferownia.pl/tags/chinchilla/index.xml" rel="self" type="application/rss+xml"/><item><title>Prawa skalowania: czemu mały model połyka biliony tokenów</title><link>https://inferownia.pl/naukowy/prawa-skalowania/</link><pubDate>Mon, 20 Jul 2026 00:00:00 +0200</pubDate><author>Tamay Besiroglu</author><author>Ege Erdil</author><author>Matthew Barnett</author><author>Josh You</author><category>małe-modele</category><guid>https://inferownia.pl/naukowy/prawa-skalowania/</guid><description>Reguła „dwadzieścia tokenów na parametr" rządziła treningiem LLM-ów przez lata. Potem ktoś sprawdził rachunki i okazało się, że przedziały ufności wymagałyby 600 tysięcy eksperymentów. Rozbieramy replikację Chinchilli — i pokazujemy, czemu modele, które odpalasz u siebie, są celowo trenowane wbrew tej regule.</description><content:encoded><![CDATA[<p>Zjeżdżasz na dół karty modelu na Hugging Face, tam gdzie drobnym drukiem stoją szczegóły
treningu, i widzisz liczbę: <strong>ponad 15 bilionów tokenów</strong>.<sup id="fnref:1"><a href="#fn:1" class="footnote-ref" role="doc-noteref">1</a></sup> Model ma osiem miliardów
parametrów. Osiem miliardów wag nakarmiono piętnastoma bilionami tokenów — to blisko dwa
tysiące tokenów na każdą pojedynczą liczbę w tym pliku, który właśnie ściągasz.</p>
<p>I tu coś nie gra, bo przez ostatnie lata wszędzie powtarzano regułę zupełnie inną:
<strong>dwadzieścia tokenów na parametr</strong>. Nie dwa tysiące. Dwadzieścia. Ktoś się pomylił o dwa
rzędy wielkości — i nie jest to ani autor karty modelu, ani ty.</p>
<h2 id="skąd-wzięła-się-dwudziestka">Skąd wzięła się dwudziestka</h2>
<p>W 2022 roku DeepMind opublikował pracę, która wywróciła stolik. Do tego czasu wyścig
polegał na pompowaniu parametrów: GPT-3 miało 175 miliardów, Megatron-Turing 530 miliardów,
a każdy kolejny model był „większy&quot;, bo większy znaczyło lepszy.</p>
<p>Hoffmann i współpracownicy wytrenowali <strong>ponad 400 modeli</strong> od 70 milionów do kilkunastu
miliardów parametrów i zadali pytanie, którego nikt porządnie nie zadał: <em>przy ustalonym
budżecie obliczeniowym — ile z niego wydać na rozmiar modelu, a ile na dane?</em><sup id="fnref:2"><a href="#fn:2" class="footnote-ref" role="doc-noteref">2</a></sup></p>
<p>Odpowiedź brzmiała: <strong>po równo</strong>. Podwajasz model — podwój liczbę tokenów. Dotychczasowe
modele były drastycznie <strong>niedotrenowane</strong>: ogromne, ale wygłodzone.</p>
<p>Dowodem był Chinchilla — 70 miliardów parametrów, czyli <strong>cztery razy mniej niż Gopher</strong>,
za to nakarmiony czterokrotnie większą porcją danych z tego samego budżetu. I położył
wszystkich: Gophera (280B), GPT-3 (175B), Jurassic-1, Megatron-Turing NLG (530B). Na MMLU
67,5%, siedem punktów nad Gopherem.<sup id="fnref1:2"><a href="#fn:2" class="footnote-ref" role="doc-noteref">2</a></sup> Model cztery razy mniejszy od Gophera
wygrał, bo dostał jeść.</p>
<p>Z tej pracy wyrosła reguła kciuka, która przykleiła się do branży na lata:
<strong>około 20 tokenów na parametr</strong>.</p>
<h2 id="potem-ktoś-sprawdził-rachunki">Potem ktoś sprawdził rachunki</h2>
<p>I tu wchodzi praca, od której zaczęliśmy. Zespół z Epoch AI wziął Chinchillę na warsztat i
spróbował odtworzyć jej wyniki.<sup id="fnref:3"><a href="#fn:3" class="footnote-ref" role="doc-noteref">3</a></sup></p>
<p>Hoffmann szacował optimum trzema niezależnymi metodami. Dwie pierwsze zgadzały się ze sobą.
<strong>Trzecia — nie.</strong> Besiroglu i współpracownicy pokazali, że ta trzecia procedura po prostu
nie pasuje do danych, z których rzekomo wyszła.</p>
<p>Najmocniejszy argument jest cudownie prozaiczny i nie wymaga wiary w żadną matematykę
wyższą: <strong>przedziały ufności były za wąskie</strong>. Tak wąskie, że żeby je uzyskać uczciwie,
trzeba by przeprowadzić <strong>ponad 600 tysięcy eksperymentów</strong>. Przeprowadzono — jak szacują
autorzy replikacji — mniej niż pięćset.<sup id="fnref1:3"><a href="#fn:3" class="footnote-ref" role="doc-noteref">3</a></sup></p>
<p>To nie jest oskarżenie o oszustwo, tylko o błąd w rachunkach. I ma to swój morał dla nas:
liczba, którą wszyscy powtarzali jako prawo natury, przez dwa lata nie została porządnie
przeliczona przez nikogo z zewnątrz.</p>
<p>Ale — i to jest ważne, bo internet lubi z tego robić większą aferę, niż była — <strong>replikacja
Chinchilli nie obala</strong>. Po poprawieniu trzeciej metody wynik <strong>zbiegł się</strong> z dwiema
pozostałymi. Prawo skalowania wychodzi z tego wzmocnione, tylko rozebrane z fałszywej
precyzji. Dwudziestka trzyma się jako przybliżenie. Nie trzymają się miejsca po przecinku.</p>
<h2 id="prawdziwy-problem-z-chinchillą-jest-gdzie-indziej">Prawdziwy problem z Chinchillą jest gdzie indziej</h2>
<p>Bo nawet gdyby rachunki były bez zarzutu, zostaje pytanie, którego Chinchilla <strong>w ogóle nie
zadaje</strong>: co się dzieje z modelem <em>po</em> treningu?</p>
<p>Chinchilla optymalizuje <strong>koszt treningu</strong>. Kropka. Zakłada w domyśle, że model wytrenujesz
i to koniec historii. Tymczasem model trenuje się raz, a potem odpowiada — milion razy,
miliard razy, u ciebie na karcie, o drugiej w nocy, przy każdym prompcie.</p>
<p>Sardana, Portes, Doubov i Frankle policzyli to na nowo, doliczając <strong>koszt inferencji</strong> do
równania.<sup id="fnref:4"><a href="#fn:4" class="footnote-ref" role="doc-noteref">4</a></sup> Wytrenowali 47 modeli i wniosek jest jednoznaczny: kto spodziewa się
realnego ruchu (rzędu miliarda zapytań), powinien trenować modele <strong>mniejsze i dłużej</strong>, niż
każe Chinchilla.</p>
<p>I najciekawsza obserwacja: jakość <strong>rosła dalej</strong>, gdy pchali stosunek tokenów do parametrów
do skrajności — <strong>aż do dziesięciu tysięcy tokenów na parametr</strong>.<sup id="fnref1:4"><a href="#fn:4" class="footnote-ref" role="doc-noteref">4</a></sup> Nie ma ściany,
o którą model uderza po dwudziestce. Jest tylko moment, w którym dokładanie danych przestaje
się opłacać <strong>przy danym budżecie treningu</strong> — a to zupełnie inne zdanie.</p>
<div class="callout">
  <span class="callout__label">Dlaczego to ważne dla lokalnego LLM</span>
<p>Chinchilla nie mówi „taki model jest najlepszy&quot;. Mówi „za takie pieniądze na trening to
najlepszy model&quot;. To jest optimum <strong>obliczeniowe</strong>, nie jakościowe — i cała różnica siedzi
w tym rozróżnieniu. Jeśli budujesz model, który ma komuś służyć, a nie wygrać benchmark za
ustaloną kwotę, <strong>przetrenowanie ponad dwudziestkę jest racjonalne</strong>. Dlatego twój lokalny
model 8B połknął 15 bilionów tokenów: producent świadomie przepłacił za trening, żebyś ty
płacił mniej za każdą odpowiedź. Ta sama logika stoi za <a href="/poradniki/nazwy-kwantyzacji-gguf/">kwantyzacją</a>
i za <a href="/naukowy/bitnet-1bit/">ekstremalną kompresją wag</a> — koszt inferencji rządzi lokalnym AI.</p>
</div>
<h2 id="co-z-tego-ma-człowiek-z-jedną-kartą">Co z tego ma człowiek z jedną kartą</h2>
<p>Trzy rzeczy, całkiem praktyczne.</p>
<p><strong>Po pierwsze — przestań czytać liczbę parametrów jako miarę jakości.</strong> Model 8B z 2026 roku
i model 8B z 2023 to dwa różne zwierzęta, bo ten pierwszy zjadł kilkanaście razy więcej danych.
Rozmiar mówi ci, ile <a href="/poradniki/ile-vram-na-model/">zajmie VRAM-u</a>, a nie ile umie.</p>
<p><strong>Po drugie — to wyjaśnia, czemu małe modele tak wyraźnie zmądrzały.</strong> Nie wydarzył się
żaden cud architektoniczny. Wydarzyła się decyzja ekonomiczna: skoro inferencja kosztuje w
nieskończoność, a trening raz, przesuńmy wysiłek na trening. Cała kategoria modeli, które
w ogóle mieszczą się na domowej karcie, istnieje dzięki temu rachunkowi.</p>
<p><strong>Po trzecie — jeśli sam kiedyś coś trenujesz</strong>, policz to pod własną sytuację.
Ograniczają cię dane? Chinchilla powie, jak duży model ma sens, żeby ich nie zmarnować.
Masz danych w bród, a model ma potem pracować? Trenuj mniejszy i dłużej, wbrew dwudziestce,
bo tak robią ci, którzy za inferencję realnie płacą.</p>
<h2 id="dwa-lata-na-jednej-liczbie">Dwa lata na jednej liczbie</h2>
<p>Jest coś rozbrajająco ludzkiego w tej historii. Wielka firma publikuje pracę, która słusznie
wywraca dziedzinę. Branża destyluje ją do jednej liczby wygodnej do zapamiętania. Liczba
wędruje przez tysiące prezentacji, wątków i wpisów jako prawo natury — aż ktoś siada,
przelicza i odkrywa, że przedziały ufności obiecywały precyzję z sześciuset tysięcy
eksperymentów, których nie było.</p>
<p>A gdy już to sprostowano, okazało się, że reguła i tak jest <strong>nie ta</strong>, o którą powinniśmy
pytać. Bo pytanie „jaki model za dany budżet treningu&quot; jest ciekawe dla tego, kto trenuje.
Ciebie interesuje pytanie, którego Chinchilla nie zadała: <strong>jaki model za dany budżet
odpowiadania</strong>. I na to odpowiedź brzmi: mniejszy, niż myślisz, i głodniejszy, niż ktokolwiek
zakładał w 2022 roku.</p>
<div class="footnotes" role="doc-endnotes">
<hr>
<ol>
<li id="fn:1">
<p>Karta modelu Llama 3 podaje korpus treningowy przekraczający 15 bilionów tokenów dla wariantów 8B i 70B — przy 8 miliardach parametrów daje to blisko 1900 tokenów na parametr, niemal stukrotnie ponad regułę Chinchilli. <a href="https://ai.meta.com/blog/meta-llama-3/">ai.meta.com/blog/meta-llama-3</a>.&#160;<a href="#fnref:1" class="footnote-backref" role="doc-backlink">&#x21a9;&#xfe0e;</a></p>
</li>
<li id="fn:2">
<p>Hoffmann i in., <em>Training Compute-Optimal Large Language Models</em>, arXiv:2203.15556 — ponad 400 modeli od 70M do 16B+ parametrów, wniosek o równym skalowaniu parametrów i tokenów, Chinchilla 70B pokonująca Gophera 280B, GPT-3 175B, Jurassic-1 i Megatron-Turing NLG 530B; MMLU 67,5% (+7 pkt nad Gopherem). <a href="https://arxiv.org/abs/2203.15556">arxiv.org/abs/2203.15556</a>.&#160;<a href="#fnref:2" class="footnote-backref" role="doc-backlink">&#x21a9;&#xfe0e;</a>&#160;<a href="#fnref1:2" class="footnote-backref" role="doc-backlink">&#x21a9;&#xfe0e;</a></p>
</li>
<li id="fn:3">
<p>Besiroglu, Erdil, Barnett, You, <em>Chinchilla Scaling: A replication attempt</em>, arXiv:2404.10102 — trzecia procedura estymacji nie dopasowuje się do odtworzonych danych i przeczy dwóm pozostałym; raportowane przedziały ufności wymagałyby ponad 600 000 eksperymentów wobec mniej niż 500 faktycznie przeprowadzonych; po korekcie wynik zbiega się z metodami pierwszą i drugą. <a href="https://arxiv.org/abs/2404.10102">arxiv.org/abs/2404.10102</a>.&#160;<a href="#fnref:3" class="footnote-backref" role="doc-backlink">&#x21a9;&#xfe0e;</a>&#160;<a href="#fnref1:3" class="footnote-backref" role="doc-backlink">&#x21a9;&#xfe0e;</a></p>
</li>
<li id="fn:4">
<p>Sardana, Portes, Doubov, Frankle, <em>Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws</em>, arXiv:2401.00448 — 47 wytrenowanych modeli, doliczenie kosztu inferencji do prawa skalowania, jakość rosnąca przy stosunku sięgającym 10 000 tokenów na parametr, rekomendacja trenowania modeli mniejszych i dłużej niż optimum Chinchilli przy dużym spodziewanym ruchu. <a href="https://arxiv.org/abs/2401.00448">arxiv.org/abs/2401.00448</a>.&#160;<a href="#fnref:4" class="footnote-backref" role="doc-backlink">&#x21a9;&#xfe0e;</a>&#160;<a href="#fnref1:4" class="footnote-backref" role="doc-backlink">&#x21a9;&#xfe0e;</a></p>
</li>
</ol>
</div>
]]></content:encoded></item></channel></rss>