반응형 구조화출력2 로컬 LLM 서버가 살아 있는데 틀리게 돌 때: 스트림 오류·빠진 의존성·설정 차이 로컬 LLM 로컬 LLM 서버가 살아 있는데 틀리게 돌 때: 스트림 오류·빠진 의존성·설정 차이 헬스체크는 정상이고 채팅도 되는데 일부 요청만 이상할 때, 서버를 믿기 전에 확인할 것들 핵심 요약 로컬 모델 서버의 실패는 대개 조용하다. 서버는 떠 있고 채팅도 된다. 틀리는 것은 특정 기능, 스트리밍 중 오류, 실행 설정, 모델 버전이다. JSON 형식을 강제하는 기능에 필요한 부가 패키지가 빠져 그 요청만 실패했다. 평범한 채팅은 멀쩡해서 늦게 알았다. 쓰는 기능마다 요청을 하나씩 보내 보는 것이 기동 점검이다. 스트리밍 도중의 실패는 정상 응답(200)이 이미 나간 뒤 본문 안에 온다. 이걸 놓치면 "답이 비었다"로 잘못 읽고 엉뚱한 설정을 고친다. 손으로 띄.. 2026. 9. 26. AI가 만든 JSON이 계속 퇴짜맞을 때: LLM 호출을 75% 줄인 세 가지 처방 LLM 프로덕트 엔지니어링 AI가 만든 JSON이 계속 퇴짜맞을 때: LLM 호출을 75% 줄인 세 가지 처방 PydanticAI 구조화 출력 · 검증-재시도 루프 최적화 실측 기록 핵심 요약 자연어를 복잡한 트레이딩 전략 JSON으로 바꿔주는 AI 기능이, 간단한 요청 하나에 131초 · LLM 호출 8회를 쓰고 있었다. 범인은 모델이 아니라 검증 실패 → 전체 재생성(retry) 루프였다. 처방 세 가지: ① 프롬프트에 완전한 동작 예제 JSON(규칙 목록 10줄보다 효과적) ② 흔한 파라미터는 quick reference로 인라인(불필요한 도구 호출 제거) ③ 흔한 실수는 검증 전에 코드로 수리. 결과: LLM 호출 8회 → 2~3회, 토큰 66K → 13~26K.. 2026. 8. 23. 이전 1 다음 반응형