반응형 전체 글66 로컬 LLM 서버가 살아 있는데 틀리게 돌 때: 스트림 오류·빠진 의존성·설정 차이 로컬 LLM 로컬 LLM 서버가 살아 있는데 틀리게 돌 때: 스트림 오류·빠진 의존성·설정 차이 헬스체크는 정상이고 채팅도 되는데 일부 요청만 이상할 때, 서버를 믿기 전에 확인할 것들 핵심 요약 로컬 모델 서버의 실패는 대개 조용하다. 서버는 떠 있고 채팅도 된다. 틀리는 것은 특정 기능, 스트리밍 중 오류, 실행 설정, 모델 버전이다. JSON 형식을 강제하는 기능에 필요한 부가 패키지가 빠져 그 요청만 실패했다. 평범한 채팅은 멀쩡해서 늦게 알았다. 쓰는 기능마다 요청을 하나씩 보내 보는 것이 기동 점검이다. 스트리밍 도중의 실패는 정상 응답(200)이 이미 나간 뒤 본문 안에 온다. 이걸 놓치면 "답이 비었다"로 잘못 읽고 엉뚱한 설정을 고친다. 손으로 띄.. 2026. 9. 26. 추론 모델 에이전트가 느린 이유는 생각 토큰: thinking을 끄기 전에 확인할 것 로컬 LLM 추론 모델 에이전트가 느린 이유는 생각 토큰: thinking을 끄기 전에 확인할 것 여러 역할이 토론하는 에이전트가 한 번에 35분 — 시간이 어디서 새고, 생각을 끄면 무엇을 잃는지 같은 질문으로 비교했다 핵심 요약 느린 에이전트를 줄이려면 먼저 입력을 읽는 시간과 답을 쓰는 시간을 나눠 본다. 이 사례에서는 답을 쓰는 쪽이 86%였다. 프롬프트를 다듬어서 줄일 수 있는 몫은 크지 않았다. 추론형 모델은 답 앞에 생각하는 토큰을 먼저 쓴다. 세어 보니 만든 토큰의 74%가 생각이었다. 짧게 답하는 토론 역할일수록 비율이 높았다. 생각이 길면 느린 것에서 끝나지 않는다. 출력 한도를 생각이 다 써 버려 답이 빈 응답이 온다. 출력 한도와 생각에 쓸 한도를.. 2026. 9. 26. 로컬 LLM이 매번 입력을 처음부터 다시 읽을 때: prefix 캐시 확인하는 법 로컬 LLM 로컬 LLM이 매번 입력을 처음부터 다시 읽을 때: prefix 캐시 확인하는 법 대화가 길어질수록 첫 글자가 늦어진다면, 서버의 캐시가 실제로 쓰이고 있는지부터 본다 핵심 요약 대화나 에이전트 작업은 요청마다 앞부분이 같다. 서버가 그 앞부분의 계산을 기억해 두면(prefix 캐시) 새로 붙은 부분만 읽으면 된다. 이게 안 되면 대화가 길어질수록 첫 글자가 늦어진다. 캐시가 쓰이는지는 입력을 읽는 시간으로 안다. 대화가 길어져도 거의 일정하면 쓰이고 있고, 길이를 따라 늘면 안 쓰이고 있다. 안 쓰이는 흔한 이유는 셋이다. 서버가 같은 대화인지 모른다, 캐시 항목이 너무 커서 버려진다, 끝난 대화의 캐시가 자리를 차지하고 안 비워진다. 디스크에 캐시.. 2026. 9. 25. 32GB 맥에서 큰 로컬 LLM 돌릴 때 메모리 나누는 법: GPU 한도와 서버 캐시 로컬 LLM 32GB 맥에서 큰 로컬 LLM 돌릴 때 메모리 나누는 법: GPU 한도와 서버 캐시 모델은 올라가는데 스왑이 나고 긴 요청이 거부될 때, 메모리를 어디서부터 나눠야 하나 핵심 요약 맥은 CPU와 GPU가 메모리 하나를 나눠 쓴다. 그래도 macOS는 GPU가 쓸 수 있는 몫에 기본 상한을 둔다. 32GB 맥이면 대략 25GB다. 큰 모델이 안 올라가면 이 상한부터 확인한다. 모델 서버는 모델 말고도 메모리를 쓴다. 대화를 빨리 이어 가려고 지난 계산 결과를 보관하는 캐시가 대표적이다. 스왑의 원인은 이 캐시였다. 그래서 순서를 뒤집는다. OS와 다른 앱이 쓰는 몫을 먼저 떼고, 서버에는 그 나머지만 준다. 캐시에는 따로 상한을 건다. 서버의 메모리 .. 2026. 9. 25. 이전 1 2 3 4 ··· 17 다음 반응형