BitSharp / badania · dowód głębi · arXiv 2603.04162 · v2 · 2026-03-05
Sześć metod kwantyzacji, 22 polskie benchmarki, 285 dolarów.
Bielik-11B-v2.3-Instruct · FP16 → QuIP# E8P12 · kompresja 6,7× · Sec. 6.4
Twierdzenia z nicią · najedź albo przewiń
Każda liczba wskazuje swój wiersz.
Bielik-Q2-Sharp porównuje QuIP#, SpinQuant+GPTQ, ButterflyQuant, QTIP, VPTQ i AQLM — kalibracja po polsku (CulturaX-PL), zastrzeżenia zapisane wprost. To nie jest oś działalności studia — to dowód, że umiemy wejść w temat na poziomie badawczym.
Po kwantyzacji model trzyma 71,92% na 22 benchmarkach — baseline: 72,07%.źródło: Table 4
Cały eksperyment: 285 dolarów na GPU z vast.ai — tabela kosztów w publikacji, co do dolara.źródło: abstrakt + Table 3
Zastrzeżenia wprost: metody rotacyjnezawodzą przy generacji, choć trzymają log-likelihood. Wynik 76,50% istnieje w publikacji — z zastrzeżeniem metodologicznym (Sec. 5.5), dlatego nie ma go w nagłówkach.źródło: abstrakt
Kwantyzacja odpowiada na pytanie, ile z jedenastu miliardów parametrów polskiego modelu można wyrzucić, zanim przestanie rozumieć polszczyznę — i robi to na 22 benchmarkach, nie na przeczuciu.
Kwantyzacja mierzy, ile parametrów można wyrzucić, zanim model przestanie rozumieć polszczyznę. 22 benchmarki, nie przeczucie.
Zobacz publikację na arXiv · zewnętrzne Modele z tej publikacji → modele · karty HF
Ile waży ta sama wiedza. Sześć odpowiedzi.
dane: Table 1 / Table 13 / Sec. 6.4 · GB po kwantyzacjiSzerokości słupków = GB / 22 GB (FP16). QuIP# E8P12:71,92% na 22 zadaniach przy ~2,4 bitach na wagę (Table 13) — w zasięgu kart z 4 GB VRAM (Conclusion). SpinQuant+GPTQ i ButterflyQuant bez słupka: publikacja nie podaje ich rozmiaru w GB (Table 1: „--" / model dekompresowany) — brak liczby to też wynik.
Badanie drugie · PolAgentBench · draft 2026-07-24 · przed submisją
Próg załamania jest uniwersalny. Sposoby umierania — nie.
PolAgentBench: 67 deterministycznych zadań agentowych — polski prompt, angielski schemat narzędzi — na dwóch Bielikach różnej skali i architektury (7B Minitron i 11B), łącznie 20 konfiguracji kwantyzacji GGUF.
Oba modele spadają z klifu między 3 a 2 bitami(p < 0,0001 w każdym) — mimo różnej skali, architektury i wszystkiego, co mierzyliśmy poza tym.źródło: PolAgentBench, Table 1 (draft)
Ten sam próg, przeciwna śmierć: 7B zawiesza się w pętli narzędzi, 11B rozpada się po ~2,8 kroku.źródło: PolAgentBench, Finding 2 (draft)
Zastrzeżenia wprost: artefakt zaokrągleń przesunął pozorny próg o cały bit —wynik sprzed korekty by się nie zreplikował.źródło: PolAgentBench, Sec. 3.5 (draft)
pass rate 11B · Q3_K_M → Q2_K · 67 zadań · p < 0,0001 · Table 1