반응형 qwen2 추론 모델 에이전트가 느린 이유는 생각 토큰: thinking을 끄기 전에 확인할 것 로컬 LLM 추론 모델 에이전트가 느린 이유는 생각 토큰: thinking을 끄기 전에 확인할 것 여러 역할이 토론하는 에이전트가 한 번에 35분 — 시간이 어디서 새고, 생각을 끄면 무엇을 잃는지 같은 질문으로 비교했다 핵심 요약 느린 에이전트를 줄이려면 먼저 입력을 읽는 시간과 답을 쓰는 시간을 나눠 본다. 이 사례에서는 답을 쓰는 쪽이 86%였다. 프롬프트를 다듬어서 줄일 수 있는 몫은 크지 않았다. 추론형 모델은 답 앞에 생각하는 토큰을 먼저 쓴다. 세어 보니 만든 토큰의 74%가 생각이었다. 짧게 답하는 토론 역할일수록 비율이 높았다. 생각이 길면 느린 것에서 끝나지 않는다. 출력 한도를 생각이 다 써 버려 답이 빈 응답이 온다. 출력 한도와 생각에 쓸 한도를.. 2026. 9. 26. 맥에서 로컬 LLM 속도 미리 가늠하기: 메모리 대역폭과 투기적 디코딩 로컬 LLM 맥에서 로컬 LLM 속도 미리 가늠하기: 메모리 대역폭과 투기적 디코딩 27B 모델이 내 맥에서 초당 몇 토큰을 낼지, 사기 전에 어림하고 느릴 때 원인을 가르는 법 핵심 요약 로컬 모델이 답을 만드는 속도는 칩의 연산 성능보다 메모리 대역폭이 정한다. 토큰 하나를 만들 때마다 모델 전체를 메모리에서 한 번 읽기 때문이다. 투기적 디코딩은 여기에 배수를 곱하는 기술이다. 같은 모델에서 대략 2~3배 빨라졌다. 다만 곱해지는 기본 속도가 느리면 결과도 느리다. 남이 올린 벤치마크를 볼 때는 투기적 디코딩을 끈 기본 속도를 찾아 비교한다. 최종 숫자만 보면 칩 차이와 기술 차이가 섞인다. 벤치마크는 대개 짧은 질문으로 잰다. 입력이 수만 토큰이면 첫 글자.. 2026. 9. 25. 이전 1 다음 반응형