BitSharp / warsztat

github.com/jakubprejzner

Kod, który wygląda tak samo, gdy nikt nie patrzy.

Stack: Python, PyTorch, kwantyzacja (QuIP#, AQLM, GPTQ), FastAPI, Docker, Prometheus/Grafana. Repozytoria publiczne, licencje MIT.

Serwowanie modeli w produkcji to nie model.predict() za Flaskiem — to rejestr modeli z leniwą inicjalizacją, A/B testy i pełna obserwowalność.źródło: ml-serve (MIT)

Repozytorium ml-serve → zewnętrzne · MIT

Wysokie partie warsztatu. Sześć technik, sześć dowodów.

wszystko poniżej jest zmierzone i podpisane commitem
01Kwantyzacja wektorowa na kracie E8 (QuIP#, codebook E8P12)

Wagi kodowane wektorowo na kracie E8 zamiast skalarnie — 11 miliardów parametrów Bielika zamknięte w ~2,4 bita na wagę bez utraty polszczyzny.

22 GB → 3,26 GB93,2% retencji jakości FP16arXiv · Table 4
02Współdzielone macierze Hessego do kalibracji

Informacja drugiego rzędu liczona raz na polskim korpusie (CulturaX-PL) i współdzielona przez sześć metod kwantyzacji — 200 plików opublikowanych do reużycia przez społeczność.

25,6 GB / 40 minH200 · 18× speedup · 4 USDdataset HF · Sec. 3.2
03Deterministyczny harness agentowy z wyrocznią

67 zadań, zero losowości: greedy decoding zweryfikowany bitowo między cyklami ładowania modelu, wyrocznia odtwarza każdy wynik z zapisanych trajektorii, pułapki kolejności oddzielają czytanie wyników od zgadywania.

20/20 runówodtworzonych co do sztukiPolAgentBench · draft
04Złote wartości odporne na zaokrąglenia

Konstrukcja zadań, w której przesunięcia prognoz znoszą się dokładnie — wynik jest inwariantny na zaokrąglenia pośrednie. Wykryty artefakt przesuwał pozorny próg o cały bit; po korekcie: zero skażonych slotów.

14/96 → 0skażonych slotów arytmetykiPolAgentBench · Sec. 3.5
05End-to-end finetune skwantyzowanego modelu

Dostrajanie QTIP po kwantyzacji, z nauczycielem w pełnej precyzji — szczyt zużycia 112 GB VRAM na H200; odzyskuje jakość generacji tam, gdzie sama kwantyzacja ją zabiera.

+2,02 pp GEN112 GB VRAM · 2 h · 8 USDarXiv · Sec. 3.6 / Table 10
06Serwowanie z pełną obserwowalnością

Rejestr modeli z leniwą inicjalizacją, A/B na wariantach, limity, metryki Prometheus i gotowy dashboard Grafany — jednodocker compose up i wszystko stoi.

MIT · open sourcePython 3.12 · CI zieloneml-serve · GitHub
BitSharp — studio inżynierii AI, Rzeszówgithub.com/jakubprejzner · MIT