반응형 프롬프트캐싱1 로컬 LLM이 매번 입력을 처음부터 다시 읽을 때: prefix 캐시 확인하는 법 로컬 LLM 로컬 LLM이 매번 입력을 처음부터 다시 읽을 때: prefix 캐시 확인하는 법 대화가 길어질수록 첫 글자가 늦어진다면, 서버의 캐시가 실제로 쓰이고 있는지부터 본다 핵심 요약 대화나 에이전트 작업은 요청마다 앞부분이 같다. 서버가 그 앞부분의 계산을 기억해 두면(prefix 캐시) 새로 붙은 부분만 읽으면 된다. 이게 안 되면 대화가 길어질수록 첫 글자가 늦어진다. 캐시가 쓰이는지는 입력을 읽는 시간으로 안다. 대화가 길어져도 거의 일정하면 쓰이고 있고, 길이를 따라 늘면 안 쓰이고 있다. 안 쓰이는 흔한 이유는 셋이다. 서버가 같은 대화인지 모른다, 캐시 항목이 너무 커서 버려진다, 끝난 대화의 캐시가 자리를 차지하고 안 비워진다. 디스크에 캐시.. 2026. 9. 25. 이전 1 다음 반응형