LLM API 비용 줄이는 법: 캐싱·배치·모델 라우팅 실전
LLM API 비용은 호출 횟수만 줄인다고 해결되지 않습니다. 같은 긴 지침을 반복해서 보내는지, 실시간 응답이 필요하지 않은 작업을 동기 호출하는지, 모든 요청을 가장 비싼 모델에 보내는지를 함께 봐야 합니다. 가장 안전한 순서는 사용량 측정, 캐싱, 배치, 모델 라우팅입니다. 반복되는 시스템 프롬프트와 도구 설명은 캐시 적중률을 측정합니다.즉시 응답이 필요 없는 분류·요약은 Batch API 같은 비동기 작업으로 분리합니다.단순 작업과 추론이 필요한 작업을 같은 모델에 보내지 않습니다.절감액보다 정답률·지연 시간·실패율을 함께 비교합니다. 먼저 비용을 호출 단위로 나눈다청구액을 월별 총액만으로 보면 무엇을 고쳐야 할지 알 수 없습니다. 요청별 입력 토큰, 출력 토큰, 캐시된 토큰, 모델, 지연 시..