[Paper Review] Neural Network Quantization for Efficient Inference:A Survey
Paper : https://arxiv.org/pdf/2112.06126 신경망(Neural Networks) 성능이 올라감에 따라 이를 실제 환경에 적용하려는 경우가 많아졌다. 하지만 성능이 좋은 모델들은 크기와 복잡성으로 인해 엣지 디바이스에서 적용하는 것에는 많은 제약이 있다. 이러한 문제를 해결하기 위해 Quantization 기술이 등장했는데 이는 정밀도(Precision)를 낮춤으로써 AI 모델의 크기와 복잡성을 줄인다. 이를 통해 엣지 디바이스에서도 실행될 수 있게된다. 해당 논문은 23년도에 나온 논문으로 지난 10년간 개발된 다양한 Quantization 기법을 조사한 논문이다. Quantization에 대한 전반적인 내용을 한번에 볼 수 있어 정리해본다. 논문에서 IEEE 754 관련으..
2026.03.12
