BitSharp / badania · dowód głębi · arXiv 2603.04162 · v2 · 2026-03-05

Sześć metod kwantyzacji, 22 polskie benchmarki, 285 dolarów.

22 GB3,26 GB

Bielik-11B-v2.3-Instruct · FP16 → QuIP# E8P12 · kompresja 6,7× · Sec. 6.4

Twierdzenia z nicią · najedź albo przewiń

Każda liczba wskazuje swój wiersz.

Bielik-Q2-Sharp porównuje QuIP#, SpinQuant+GPTQ, ButterflyQuant, QTIP, VPTQ i AQLM — kalibracja po polsku (CulturaX-PL), zastrzeżenia zapisane wprost. To nie jest oś działalności studia — to dowód, że umiemy wejść w temat na poziomie badawczym.

Po kwantyzacji model trzyma 71,92% na 22 benchmarkach — baseline: 72,07%.źródło: Table 4

Cały eksperyment: 285 dolarów na GPU z vast.ai — tabela kosztów w publikacji, co do dolara.źródło: abstrakt + Table 3

Zastrzeżenia wprost: metody rotacyjnezawodzą przy generacji, choć trzymają log-likelihood. Wynik 76,50% istnieje w publikacji — z zastrzeżeniem metodologicznym (Sec. 5.5), dlatego nie ma go w nagłówkach.źródło: abstrakt

Pełna precyzjaFP16 · 22 GB

Kwantyzacja odpowiada na pytanie, ile z jedenastu miliardów parametrów polskiego modelu można wyrzucić, zanim przestanie rozumieć polszczyznę — i robi to na 22 benchmarkach, nie na przeczuciu.

Po kwantyzacji~2,4 bpw · 3,26 GB

Kwantyzacja mierzy, ile parametrów można wyrzucić, zanim model przestanie rozumieć polszczyznę. 22 benchmarki, nie przeczucie.

Zobacz publikację na arXiv · zewnętrzne  Modele z tej publikacji → modele · karty HF

Ile waży ta sama wiedza. Sześć odpowiedzi.

dane: Table 1 / Table 13 / Sec. 6.4 · GB po kwantyzacji
FP16 (baza)22,0 GB
VPTQ5,00 GB
AQLM3,62 GB
QTIP3,27 GB
QuIP# E8P123,26 GB
IQ2_XXS (baseline)~2,6 GB

Szerokości słupków = GB / 22 GB (FP16). QuIP# E8P12:71,92% na 22 zadaniach przy ~2,4 bitach na wagę (Table 13) — w zasięgu kart z 4 GB VRAM (Conclusion). SpinQuant+GPTQ i ButterflyQuant bez słupka: publikacja nie podaje ich rozmiaru w GB (Table 1: „--" / model dekompresowany) — brak liczby to też wynik.

Badanie drugie · PolAgentBench · draft 2026-07-24 · przed submisją

Próg załamania jest uniwersalny. Sposoby umierania — nie.

PolAgentBench: 67 deterministycznych zadań agentowych — polski prompt, angielski schemat narzędzi — na dwóch Bielikach różnej skali i architektury (7B Minitron i 11B), łącznie 20 konfiguracji kwantyzacji GGUF.

Oba modele spadają z klifu między 3 a 2 bitami(p < 0,0001 w każdym) — mimo różnej skali, architektury i wszystkiego, co mierzyliśmy poza tym.źródło: PolAgentBench, Table 1 (draft)

Ten sam próg, przeciwna śmierć: 7B zawiesza się w pętli narzędzi, 11B rozpada się po ~2,8 kroku.źródło: PolAgentBench, Finding 2 (draft)

Zastrzeżenia wprost: artefakt zaokrągleń przesunął pozorny próg o cały bit —wynik sprzed korekty by się nie zreplikował.źródło: PolAgentBench, Sec. 3.5 (draft)

0,7160,045

pass rate 11B · Q3_K_M → Q2_K · 67 zadań · p < 0,0001 · Table 1