[Paper Review] Neural Network Quantization for Efficient Inference:A Survey
[Paper Review] Neural Network Quantization for Efficient Inference:A Survey
Paper : https://arxiv.org/pdf/2112.06126 신경망(Neural Networks) 성능이 올라감에 따라 이를 실제 환경에 적용하려는 경우가 많아졌다. 하지만 성능이 좋은 모델들은 크기와 복잡성으로 인해 엣지 디바이스에서 적용하는 것에는 많은 제약이 있다. 이러한 문제를 해결하기 위해 Quantization 기술이 등장했는데 이는 정밀도(Precision)를 낮춤으로써 AI 모델의 크기와 복잡성을 줄인다. 이를 통해 엣지 디바이스에서도 실행될 수 있게된다. 해당 논문은 23년도에 나온 논문으로 지난 10년간 개발된 다양한 Quantization 기법을 조사한 논문이다. Quantization에 대한 전반적인 내용을 한번에 볼 수 있어 정리해본다. 논문에서 IEEE 754 관련으..
2026.03.12
[Paper Review] BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
[Paper Review] BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Paper : https://arxiv.org/pdf/1810.04805Github : https://github.com/google-research/bert BERT는 Google에서 개발한 언어 표현 모델로, 기존 단방향 언어 모델의 한계를 극복하기 위해 모든 레이어에서 좌우 문맥을 동시에 고려하는 양방향 사전학습 방식을 제시했다. Masked Language Model(MLM)과 Next Sentence Prediction(NSP)을 통해 라벨링 되지 않은 텍스트에서 깊은 양방향 표현을 학습하며, 단일 출력 레이어 추가만으로 다양한 NLP Task에 Fine-tuning이 가능하게 한다. 11개의 NLP Task에서 최고 성능을 달성했으며, 특히 GLUE 80.5%, SQuAD v2.0 F1 83...
2025.08.29
[NVIDIA DeepStream] DeepStream을 위한 GStreamer 개념
[NVIDIA DeepStream] DeepStream을 위한 GStreamer 개념
🎯개요DeepStream은 GStreamer를 기반으로 동작하기 때문에, DeepStream을 제대로 이해하고 커스터마이징 하려면 GStreamer의 핵심 개념을 어느 정도 알고 있어야 한다.❓GStreamer란?GStreamer는 오픈 소스 멀티미디어 프레임워크로, 오디오 및 비디오 스트리밍을 위한 플러그인 기반 파이프라인 구조를 제공한다. 다양한 미디어 파일 재생, 인코딩/디코딩, 네트워크 스트리밍, 실시간 처리 등을 모듈화 된 방식으로 처리할 수 있다.▶️ GStreamer 기본 개념ElementsGStreamer의 핵심 구성 단위각 요소는 파일 읽기, 디코딩, 출력 등 특정 기능을 수행여러 Elements를 연결하면 미디어 처리 파이프라인이 구성됨다양한 미디어 애플리케이션을 만들 수 있도록 기본..
2025.08.12
[NVIDIA DeepStream] NVIDIA DeepStream 이란?
[NVIDIA DeepStream] NVIDIA DeepStream 이란?
🎯개요NVIDIA DeepStream은 NVIDIA에서 개발한 AI 기반 다중 센서 처리, 비디오, 오디오 및 이미지 인식을 위한 GStreamer 기반의 스트리밍 분석 툴킷입니다. 이를 통해 비디오 인코딩/디코딩, AI 추론 등의 복잡한 Task들을 스트림 처리 파이프라인을 생성하여 비디오, 이미지 및 센서 데이터를 실시간으로 분석할 수 있습니다. ⚡주요 활용 상황NVIDIA DeepStream은 다음과 같은 상황에서 유용하게 활용될 수 있습니다.GPU 기반 AI 추론 최적화멀티 스트림을 효율적으로 처리하는 고성능 파이프라인 구성엣지 디바이스와 클라우드 간 연계 및 순산 추론 환경 구축특히 산업용, 실시간, 고성능 시스템이 필요한 경우에 적합하며, 여러 대의 카메라 스트림도 안정적으로 처리할 수 있다..
2025.08.05
Stable Diffusion 주요 파라미터 실험
Stable Diffusion 주요 파라미터 실험
batch_size한번에 생성할 이미지의 개수 cfgClass-Free Guidance Scale은 생성 과정에서 모델이 prompt를 얼마나 중요하게 여길지 결정 PromptSide view, A deer standing on a country road, backlighting, looking at the city, on the other side of the river is a large city in the background, starry night sky, colorful, vibrant glow낮은 CFG Scale 값 : 모델이 text prompt를 덜 엄격하게 따른다. 결과 이미지가 더 창의적이거나 예측할 수 없을 수 있으며, prompt와 연관성이 적을 수 있다. 추상적이거나 자유로운 ..
2025.04.18
ComfyUI & ComfyUI Manager 설치
ComfyUI & ComfyUI Manager 설치
Github :https://github.com/comfyanonymous/ComfyUI📱 ComfyUI란?ComfyUI는 Stable Diffusion 기반의 이미지 생성 모델을 사용하는 그래픽 사용자 인터페이스(GUI)입니다. Stable Diffusion은 텍스트 프롬프트를 기반으로 이미지를 생성하는 AI 모델인데, ComfyUI는 이 모델을 사용하여 사용자가 좀 더 직관적이고 편리하게 이미지를 생성할 수 있도록 돕는 도구다.🛠️ InstallGit을 통해 다운로드 받거나, 해당 링크에 들어가 [Code] - [Download zip] 선택하여 다운로드 한 후 해당 폴더로 이동.git clone https://github.com/comfyanonymous/ComfyUI.gitcd ComfyUI ..
2025.04.17
Python 패키지 관리자 uv 소개 및 사용 방법
Python 패키지 관리자 uv 소개 및 사용 방법
UV는 Rust로 작성된 매우 빠른 Python 패키지 및 프로젝트 관리자다.❓ UV를 왜 써야 할까?Python 프로젝트를 할 때 흔히 겪는 문제들이 있다.`pip install` 이 느린 문제가상환경을 만들고 관리해줘야 하는 문제의존성 관리를 위해 `pip freeze > requirements.txt``pipx`, `pyenv`, `venv` 등등 도구가 너무 많음UV는 이 모든 걸 하나로 합쳐서 빠르게 해결해 준다. ✨ UV의 장점🚀 올인원 도구: `pip`, `pip-tools`, `pipx`, `poetry`, `pyenv`, `twine`, `virtualenv` 등 여러 도구를 하나로 통합⚡️최고 속도: 기존 `pip`보다 10~100배 빠름🗂️ 프로젝트 관리: 잠금 파일(lockfil..
2025.04.16
[Paper Review] Learning Transferable Visual Models From Natural Language Supervision
[Paper Review] Learning Transferable Visual Models From Natural Language Supervision
Paper : https://arxiv.org/pdf/2103.00020Github : https://github.com/OpenAI/CLIP CLIP은 OpenAI에서 개발한 모델로, 기존 컴퓨터 비전 시스템의 한계를 극복하기 위해, 고정된 객체 카테고리 대신 원시 텍스트로부터 직접 학습하는 접근법을 제시했다. 4억 개의 (이미지, 텍스트) 쌍으로 구성된 인터넷 데이터셋을 사용해 이미지-텍스트 매칭을 통해 사전 훈련하며 자연어를 통해 학습된 시각적 개념을 참조하고 Zero-shot Transfer가 가능하게 한다. 30개 이상의 다양한 비전 데이터셋에서 성능 벤치마크를 수행했으며 뛰어난 성능을 보였다. CLIP 모델 자체는 매우 간결한 구조를 가지고 있지만, 논문(48페이지로 일반적인 논문보다 2~3배..
2025.03.12
[Paper Review] AN IMAGE IS WORTH 16X16 WORDS:TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE
[Paper Review] AN IMAGE IS WORTH 16X16 WORDS:TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE
Paper : https://arxiv.org/pdf/2010.11929Github : https://github.com/google-research/vision_transformer 2021년에 발표된 논문이지만 ViT는 현재까지도 널리 활용되는 필수적인 논문이기에 다시 한번 읽고 정리해보고자 한다. 이 논문은 자연어 처리 분야에서 우수한 성능을 보인 Transformer 구조를 컴퓨터 비전 분야에 적용하는 방법을 제시했으며, 이미지를 패치 단위로 분할하여 각 패치를 하나의 단어처럼 취급하는 방식을 도입했다. 대규모 데이터셋으로 사전 학습한 뒤 중소형 데이터셋으로 Fine-tuning할 경우, Convolution Network보다 적은 컴퓨팅 자원으로도 최고 수준의 성능을 달성할 수 있었다.ViT는 ..
2025.01.24