경량화 시리즈 #5, QAT: 학습으로 양자화 오차를 되돌리기

PTQ는 큰 모델엔 통하지만 작은 모델·저비트에서 무너집니다(2비트에서 13.6%로 붕괴). 해법은 학습 자체에 양자화를 넣는 QAT입니다. forward에 fake quantization을 끼우고, round의 gradient가 0인 문제를 STE(Straight-Through Estimator)로 뚫습니다. round는 미분이 0인데 어떻게 학습이 될까? MNIST MLP로 직접 측정한 plot과 함께.

2026년 5월 11일 · 6 분 · rick

경량화 시리즈 #4, 저비트 양자화: 아웃라이어와의 싸움

FP4는 표현값이 15개뿐인데 최신 GPU는 어떻게 4비트로 추론할까요? 저비트 양자화를 무너뜨리는 범인은 아웃라이어입니다. outlier 하나가 층을 통째로 지우는 실험부터, 그룹 양자화(MXFP4)·KL clipping·AdaRound·Hadamard 회전이라는 네 가지 처방까지, 2비트에서 53%로 무너진 정확도가 97%로 돌아오는 실험과 함께 코드로 하나씩 검증합니다.

2026년 5월 4일 · 9 분 · rick

경량화 시리즈 #2: 뉴럴넷 양자화

학습된 32비트 신경망 가중치를 K-Means(비균등)와 Linear(균등, 정수 연산) 두 방식으로 2~8비트까지 줄여봅니다. 아핀 매핑 r=S(q−Z)부터 압축비·정확도 트레이드오프까지, MNIST MLP로 직접 코드를 돌려 측정한 plot과 함께.

2026년 4월 20일 · 6 분 · rick