{"componentChunkName":"component---src-templates-tags-js","path":"/tags/quantization/","result":{"data":{"site":{"siteMetadata":{"title":"Bottlehs Tech Blog"}},"allMarkdownRemark":{"totalCount":2,"nodes":[{"excerpt":"LLM 추론 최적화 - KV Cache, Quantization, Speculative Decoding LLM 추론은 계산 집약적이고 메모리를 많이 사용한다. 프로덕션 환경에서 LLM…","fields":{"slug":"/ai/LLM-추론-최적화-KV-Cache-Quantization-Speculative-Decoding/"},"frontmatter":{"date":"2025년 11월 28일","title":"LLM 추론 최적화 - KV Cache, Quantization, Speculative Decoding","description":"LLM 추론 성능을 최적화하는 핵심 기술들을 실전 예제와 함께 정리합니다. KV Cache, Quantization, Speculative Decoding, 배치 처리, 모델 병렬화 등 모든 최적화 기법을 다룹니다."}},{"excerpt":"AI 모델 양자화 스마트폰에서도 돌아가는 AI의 비밀 GPT-4는 강력하지만 수백 GB의 메모리와 고성능 GPU가 필요하다. 일반 스마트폰이나 작은 서버에서는 실행하기 어렵다. 양자화(Quantization…","fields":{"slug":"/ai/AI-모델-양자화-스마트폰에서도-돌아가는-AI의-비밀/"},"frontmatter":{"date":"2025년 11월 5일","title":"AI 모델 양자화 스마트폰에서도 돌아가는 AI의 비밀","description":"AI 모델 양자화의 개념과 작동 원리를 설명합니다. QAT, PTQ, GPTQ, AWQ 비교와 실무 적용, 성능 분석까지 알아봅니다."}}]}},"pageContext":{"tag":"Quantization"}},"staticQueryHashes":["213619243","3262363727"]}