본문으로 바로가기
반응형

이 글에서 사용하는 주요 용어 정의

용어 정의
입력 토큰 모델에 새로 전달해 일반 입력 요율로 청구되는 토큰입니다.
캐시 읽기 이전에 캐시한 입력 접두사를 재사용하는 토큰입니다.
캐시 쓰기 재사용할 입력을 처음 캐시에 기록하는 토큰입니다.
출력 토큰 모델이 응답으로 생성한 토큰입니다.
MTok 100만 토큰을 뜻하는 가격 단위입니다.
처리 등급 Standard, Batch, Flex, Fast처럼 처리 방식과 배율을 정하는 구분입니다.

기본 가격과 가장 중요한 예외

2026년 9월 15일 기준 GPT-6 Astra 모델 문서의 Standard 단가는 100만 토큰당 입력 $10, 캐시 읽기 $1, 캐시 쓰기 $12.50, 출력 $50입니다.

가장 중요한 예외는 272K를 넘는 입력 프롬프트입니다. 초과분만 할증하지 않고 요청 전체의 입력·캐시 요율을 2배로, 출력 요율을 1.5배로 계산합니다. 공식 문서는 경계를 272K로 표기하므로 정확한 정수 경계에 기대지 말고 근처에 여유를 두는 편이 안전합니다.

이 글은 API 토큰 비용만 계산합니다. ChatGPT·Codex 구독 한도, 도구별 별도 호출료, 세금과 환율은 포함하지 않습니다.

GPT-6 Astra 비용 계산식

토큰 수를 100만으로 나눈 뒤 각 단가를 곱하면 됩니다.

요청 비용 =
  일반 입력 토큰 / 1,000,000 × 입력 단가
+ 캐시 읽기 토큰 / 1,000,000 × 캐시 읽기 단가
+ 캐시 쓰기 토큰 / 1,000,000 × 캐시 쓰기 단가
+ 출력 토큰 / 1,000,000 × 출력 단가

캐시 쓰기는 기본 입력 단가의 1.25배입니다. 따라서 Standard 기본 구간에서는 $12.50/MTok입니다. 캐시 읽기와 쓰기를 한 항목으로 합치면 첫 기록 비용과 재사용 비용의 차이가 사라지므로 따로 계산해야 합니다.

검산된 JavaScript 계산기

다음 계산기는 가격을 자동 조회하지 않습니다. 2026년 9월 15일 공식 단가를 코드에 고정한 예제입니다. Node.js에서 다섯 테스트 벡터를 실행해 예상값과 일치함을 확인했습니다.

// astra-cost.mjs
const STANDARD = {
  input: 10,
  cacheRead: 1,
  cacheWrite: 12.5,
  output: 50,
};

const TIER_MULTIPLIER = {
  standard: 1,
  batch: 0.5,
  flex: 0.5,
  fast: 2,
};

export function estimateAstraCost({
  input = 0,
  cacheRead = 0,
  cacheWrite = 0,
  output = 0,
  longContext = false,
  tier = "standard",
}) {
  const tierMultiplier = TIER_MULTIPLIER[tier];
  if (tierMultiplier === undefined) throw new Error(`Unknown tier: ${tier}`);

  // longContext는 공식 문구의 272K 초과 여부를 호출자가 판정해 전달합니다.
  const inputMultiplier = longContext ? 2 : 1;
  const outputMultiplier = longContext ? 1.5 : 1;

  const dollars = (
    input * STANDARD.input * inputMultiplier
    + cacheRead * STANDARD.cacheRead * inputMultiplier
    + cacheWrite * STANDARD.cacheWrite * inputMultiplier
    + output * STANDARD.output * outputMultiplier
  ) / 1_000_000 * tierMultiplier;

  return Number(dollars.toFixed(6));
}

longContext를 자동 판정하지 않은 이유는 공식 표기가 272K이고 정확한 정수 판정 계약이 확인되지 않았기 때문입니다. 272K 근처에서는 호출자가 보수적으로 true를 적용하는 방식입니다.

272K 전후에서 비용이 어떻게 달라지는가

도구 호출료 등 별도 비용이 없고 모든 수량이 청구 대상 텍스트 토큰이라고 가정한 산술 예시입니다.

시나리오 계산 Standard 비용
입력 100K + 출력 10K 0.1×$10 + 0.01×$50 $1.50
캐시 읽기 100K + 출력 10K 0.1×$1 + 0.01×$50 $0.60
캐시 쓰기 100K + 출력 10K 0.1×$12.50 + 0.01×$50 $1.75
입력 300K + 출력 10K, 장문 0.3×$20 + 0.01×$75 $6.75
캐시 읽기 300K + 출력 10K, 장문 0.3×$2 + 0.01×$75 $1.35

같은 출력 10K를 가정하면 일반 입력 270K는 $2.70 + $0.50 = $3.20입니다. 280K가 장문 요율을 적용받으면 $5.60 + $0.75 = $6.35가 됩니다. 입력 차이는 10K지만 요청 전체의 요율이 달라져 비용 차이가 커집니다. 이 값은 공식 단가의 산술 예시이며 실제 청구서를 재현한 결과는 아닙니다.

프롬프트 캐싱은 몇 번 재사용해야 이득인가

기본 구간에서 100K 접두사를 처음 캐시에 쓰면 $1.25가 듭니다. 캐시 없이 같은 접두사를 한 번 보내는 비용은 $1이고, 캐시 읽기는 $0.10입니다. 첫 쓰기만 보면 캐시가 더 비쌉니다.

한 번 쓴 100K 접두사를 한 번 재사용하면 누적 비용은 $1.25 + $0.10 = $1.35입니다. 캐시 없이 두 번 보내면 $2.00입니다. 이 단순 가정에서는 한 번 이상 재사용할 때 누적 비용이 낮아집니다.

다만 실제 결과는 접두사 일치와 재사용 여부에 달려 있습니다. 시스템 지침이나 공통 문서 앞부분이 바뀌면 예상한 캐시 읽기가 발생하지 않을 수 있습니다. 실제 캐시 적중 토큰은 사용 중인 Responses API 버전의 usage 필드 정의를 확인해 측정해야 하며, 이 원고는 필드명을 추측해 제시하지 않습니다.

장문 캐시 쓰기 단가는 공식 문구의 입력·캐시 2배와 캐시 쓰기 1.25배를 함께 적용하면 $25/MTok으로 해석됩니다. 실제 장문 캐시 쓰기 청구 사례를 확보하기 전까지는 이 값을 계산 가정으로 취급해야 합니다.

Batch·Flex·Fast 배율 적용 순서

공식 모델 문서에 따르면 Batch와 Flex는 Standard 요율의 50%, Fast는 해당 요율의 2배입니다. 먼저 입력 길이에 따른 Standard 비용을 계산하고 마지막에 처리 등급 배율을 곱하면 됩니다.

예를 들어 Standard 비용이 $1.50인 요청은 Batch 또는 Flex에서 산술상 $0.75, Fast에서 $3.00입니다. 지연과 가용성 요구사항은 가격과 별도로 판단해야 합니다. EU 데이터 레지던시에서는 Astra Fast mode를 사용할 수 없으므로 Standard 처리가 필요합니다.

Sol·Terra와 비교할 때 단가만 보면 안 되는 이유

OpenAI 모델 비교 문서의 Standard 기본 단가는 다음과 같습니다.

모델 입력/MTok 캐시 읽기/MTok 출력/MTok
GPT-6 Astra $10 $1 $50
GPT-5.6 Sol $4 $0.40 $20
GPT-5.6 Terra $2 $0.20 $12

Astra와 Sol의 기본 입력·출력·캐시 읽기 단가 비율은 2.5배입니다. 그러나 실제 작업 비용은 재시도 횟수, 출력 길이, 성공률과 장문 요율에 따라 달라집니다. 세 모델 모두 272K 초과 조건을 확인해야 합니다.

월 예산 계산 템플릿

요청 유형을 나눠 계산하면 평균 하나로 뭉갤 때보다 비용 원인을 찾기 쉽습니다.

요청 유형 월 요청 수 요청당 예상 비용 월 비용
짧은 일반 요청 A B A×B
캐시 재사용 요청 C D C×D
272K 초과 요청 E F E×F
합계     세 행의 합

도구별 호출료, 세금, 환율은 별도 행으로 관리하세요. 처리 등급이 섞이면 같은 요청 유형 안에서도 Standard와 Batch 등을 분리해야 합니다.

비용을 낮추는 실무 원칙

  • 272K 근처에 안전 여유를 두고 요청 전체의 입력 토큰을 관찰합니다.
  • 반복되는 지침과 문서는 안정적인 공통 접두사로 구성합니다.
  • 입력 분할은 비용을 줄일 수 있지만 전체 문맥을 잃을 수 있으므로 품질 평가를 함께 합니다.
  • 즉시 응답이 필요 없는 작업은 Batch나 Flex의 조건을 확인합니다.

마무리

Astra 비용은 입력·캐시 읽기·캐시 쓰기·출력을 분리해야 정확히 계산할 수 있습니다. 272K를 넘으면 요청 전체가 다시 가격 책정되므로 장문 요청은 별도 유형으로 관리하세요.

가격은 바뀔 수 있습니다. 발행 직전과 예산 확정 전에 공식 모델 페이지의 단가와 처리 등급 조건을 다시 확인해야 합니다.

참고 자료

반응형