github.com/jakubprejzner
Kod, który wygląda tak samo, gdy nikt nie patrzy.
Stack: Python, PyTorch, kwantyzacja (QuIP#, AQLM, GPTQ), FastAPI, Docker, Prometheus/Grafana. Repozytoria publiczne, licencje MIT.
Serwowanie modeli w produkcji to nie model.predict() za Flaskiem — to rejestr modeli z leniwą inicjalizacją, A/B testy i pełna obserwowalność.źródło: ml-serve (MIT)
Wysokie partie warsztatu. Sześć technik, sześć dowodów.
wszystko poniżej jest zmierzone i podpisane commitemWagi kodowane wektorowo na kracie E8 zamiast skalarnie — 11 miliardów parametrów Bielika zamknięte w ~2,4 bita na wagę bez utraty polszczyzny.
22 GB → 3,26 GB93,2% retencji jakości FP16arXiv · Table 4Informacja drugiego rzędu liczona raz na polskim korpusie (CulturaX-PL) i współdzielona przez sześć metod kwantyzacji — 200 plików opublikowanych do reużycia przez społeczność.
25,6 GB / 40 minH200 · 18× speedup · 4 USDdataset HF · Sec. 3.267 zadań, zero losowości: greedy decoding zweryfikowany bitowo między cyklami ładowania modelu, wyrocznia odtwarza każdy wynik z zapisanych trajektorii, pułapki kolejności oddzielają czytanie wyników od zgadywania.
20/20 runówodtworzonych co do sztukiPolAgentBench · draftKonstrukcja zadań, w której przesunięcia prognoz znoszą się dokładnie — wynik jest inwariantny na zaokrąglenia pośrednie. Wykryty artefakt przesuwał pozorny próg o cały bit; po korekcie: zero skażonych slotów.
14/96 → 0skażonych slotów arytmetykiPolAgentBench · Sec. 3.5Dostrajanie QTIP po kwantyzacji, z nauczycielem w pełnej precyzji — szczyt zużycia 112 GB VRAM na H200; odzyskuje jakość generacji tam, gdzie sama kwantyzacja ją zabiera.
+2,02 pp GEN112 GB VRAM · 2 h · 8 USDarXiv · Sec. 3.6 / Table 10Rejestr modeli z leniwą inicjalizacją, A/B na wariantach, limity, metryki Prometheus i gotowy dashboard Grafany — jednodocker compose up i wszystko stoi.