본문 바로가기
반응형

멀티에이전트2

추론 모델 에이전트가 느린 이유는 생각 토큰: thinking을 끄기 전에 확인할 것 로컬 LLM 추론 모델 에이전트가 느린 이유는 생각 토큰: thinking을 끄기 전에 확인할 것 여러 역할이 토론하는 에이전트가 한 번에 35분 — 시간이 어디서 새고, 생각을 끄면 무엇을 잃는지 같은 질문으로 비교했다 핵심 요약 느린 에이전트를 줄이려면 먼저 입력을 읽는 시간과 답을 쓰는 시간을 나눠 본다. 이 사례에서는 답을 쓰는 쪽이 86%였다. 프롬프트를 다듬어서 줄일 수 있는 몫은 크지 않았다. 추론형 모델은 답 앞에 생각하는 토큰을 먼저 쓴다. 세어 보니 만든 토큰의 74%가 생각이었다. 짧게 답하는 토론 역할일수록 비율이 높았다. 생각이 길면 느린 것에서 끝나지 않는다. 출력 한도를 생각이 다 써 버려 답이 빈 응답이 온다. 출력 한도와 생각에 쓸 한도를.. 2026. 9. 26.
서브에이전트 위임의 기준 — 조직도가 아니라 작업 경계 AI 페어 프로그래밍 에이전트를 늘리면 개발이 빨라질까 서브에이전트 위임의 기준 — 조직도가 아니라 작업 경계 핵심 요약 멀티에이전트는 분명한 트렌드지만, "많이 띄울수록 좋다"는 입증된 적이 없다. 같은 연구 안에서도 독립적으로 쪼개지는 작업은 최대 +80.8%, 순차 의존이 강한 작업은 39~70% 악화됐다 — 성패를 가르는 건 에이전트 수가 아니라 작업의 구조다. 서브에이전트는 새로운 전문가가 아니다 — 부모의 대화도, 읽은 파일도 모르는 빈 컨텍스트에서 시작하는 임시 워커다. "20년 경력 전문가" 역할극은 전문성을 만들지 않는다. 위임 전 네 가지 게이트: 독립성 · 압축 가능성 · 검증 가능성 .. 2026. 7. 20.
반응형