반응형 양자화1 32GB 맥에서 큰 로컬 LLM 돌릴 때 메모리 나누는 법: GPU 한도와 서버 캐시 로컬 LLM 32GB 맥에서 큰 로컬 LLM 돌릴 때 메모리 나누는 법: GPU 한도와 서버 캐시 모델은 올라가는데 스왑이 나고 긴 요청이 거부될 때, 메모리를 어디서부터 나눠야 하나 핵심 요약 맥은 CPU와 GPU가 메모리 하나를 나눠 쓴다. 그래도 macOS는 GPU가 쓸 수 있는 몫에 기본 상한을 둔다. 32GB 맥이면 대략 25GB다. 큰 모델이 안 올라가면 이 상한부터 확인한다. 모델 서버는 모델 말고도 메모리를 쓴다. 대화를 빨리 이어 가려고 지난 계산 결과를 보관하는 캐시가 대표적이다. 스왑의 원인은 이 캐시였다. 그래서 순서를 뒤집는다. OS와 다른 앱이 쓰는 몫을 먼저 떼고, 서버에는 그 나머지만 준다. 캐시에는 따로 상한을 건다. 서버의 메모리 .. 2026. 9. 25. 이전 1 다음 반응형