이 글에서 사용하는 주요 용어 정의
| 용어 | 정의 |
|---|---|
| 컨텍스트 창 | 한 요청에서 모델이 처리할 수 있는 입력과 출력의 전체 범위입니다. |
| 272K 경계 | 입력이 272,000토큰을 넘으면 해당 요청 전체에 장문 요율이 적용되는 가격 경계입니다. |
| 프롬프트 캐시 | 동일한 입력 앞부분을 재사용해 반복 입력 비용을 줄이는 기능입니다. |
| 자동 잘림 | 컨텍스트 한도를 넘을 때 이전 항목을 앞에서부터 제거하는 처리입니다. |
| 컴팩션 | 긴 대화 상태를 다음 요청에서 사용할 압축된 항목으로 바꾸는 처리입니다. |
GPT-6 아스트라는 1,050,000토큰 컨텍스트 창과 최대 128,000토큰 출력을 지원합니다. 그러나 큰 창을 끝까지 채우는 운영 방식은 비용과 기억 품질 양쪽에서 불리할 수 있습니다. 특히 입력이 272K를 넘는 순간 초과분만이 아니라 요청 전체의 입력·캐시 입력 요율이 2배, 출력 요율이 1.5배가 됩니다. OpenAI GPT-6 Astra 모델 문서
따라서 컨텍스트 관리는 1.05M 한도 직전이 아니라 272K 전에 시작해야 합니다. 안정된 지침은 캐시하고, 장기 상태는 구조화하며, 대화 이력은 필요할 때 컴팩션하는 방식이 실용적입니다.
이 글의 가격과 API 사양은 2026년 9월 15일 기준입니다. 모델 가격, 캐시 조건, API 필드는 발행 직전에 공식 문서에서 다시 확인해야 합니다.
1.05M은 무료 기억 용량이 아닙니다
컨텍스트 창은 저장소가 아닙니다. 이전 대화, 도구 결과, 문서 원문을 요청마다 다시 입력하면 토큰 비용이 반복해서 발생합니다. 긴 기록을 넣을 수 있다는 사실도 모델이 모든 위치의 세부 정보를 같은 정확도로 회수한다는 보장은 아닙니다.
큰 창은 필요한 원문을 한 요청에 모을 수 있는 상한으로 보는 편이 안전합니다. 확정된 결정, 요구사항 ID, 실패 이유처럼 다음 단계에 꼭 필요한 값은 별도 구조화 상태에 보존하고, 상세 원문은 검색 가능한 위치와 근거 링크를 남겨야 합니다.
272K를 한 토큰 넘으면 요청 전체 요율이 바뀝니다
Standard 텍스트 요율은 100만 토큰당 입력 $10, 캐시 입력 $1, 캐시 쓰기 $12.50, 출력 $50입니다. 입력 프롬프트가 272K를 넘으면 해당 요청 전체의 입력·캐시 입력은 2배, 출력은 1.5배 요율로 계산됩니다. Batch와 Flex는 Standard의 50%, Fast는 별도 2배 요율이며 도구별 호출료가 추가될 수 있습니다. OpenAI GPT-6 Astra 모델 문서
캐시 쓰기가 없는 단순 예시는 경계의 영향을 선명하게 보여 줍니다.
| 요청 | 계산 | 예상 텍스트 비용 |
|---|---|---|
| 비캐시 입력 272,000 + 출력 10,000 | 0.272 × $10 + 0.010 × $50 |
$3.22 |
| 비캐시 입력 272,001 + 출력 10,000 | 0.272001 × $20 + 0.010 × $75 |
약 $6.19002 |
| 캐시 입력 272,000 + 출력 10,000 | 0.272 × $1 + 0.010 × $50 |
$0.772 |
| 캐시 입력 272,001 + 출력 10,000 | 0.272001 × $2 + 0.010 × $75 |
약 $1.294002 |
총액이 정확히 2배가 되지 않는 이유는 출력 할증이 1.5배이기 때문입니다. 캐시 쓰기가 생긴 요청은 별도 캐시 쓰기 단가도 더해야 합니다.
아래 계산기는 Python 표준 라이브러리만 사용합니다. 기사 작성 과정에서 271999, 272000, 272001 경계값의 산식을 별도로 대조했지만, 실제 API 청구 결과와 대조한 코드는 아닙니다.
from dataclasses import dataclass
@dataclass(frozen=True)
class Usage:
uncached_input: int = 0
cached_input: int = 0
cache_write: int = 0
output: int = 0
def astra_standard_cost(usage: Usage) -> float:
"""2026-09-15 공개 Standard 텍스트 요율 기준 예상 비용(USD)."""
total_input = (
usage.uncached_input + usage.cached_input + usage.cache_write
)
long_context = total_input > 272_000
input_rate = 10.0 * (2 if long_context else 1)
cached_rate = 1.0 * (2 if long_context else 1)
cache_write_rate = 12.5 * (2 if long_context else 1)
output_rate = 50.0 * (1.5 if long_context else 1)
return (
usage.uncached_input / 1_000_000 * input_rate
+ usage.cached_input / 1_000_000 * cached_rate
+ usage.cache_write / 1_000_000 * cache_write_rate
+ usage.output / 1_000_000 * output_rate
)
assert astra_standard_cost(Usage(uncached_input=272_000, output=10_000)) == 3.22
assert abs(
astra_standard_cost(Usage(uncached_input=272_001, output=10_000))
- 6.19002
) < 1e-9
이 함수는 Standard 텍스트 비용만 추정합니다. Batch·Flex·Fast, 도구 호출료, 지역별 조건, 세금은 포함하지 않습니다.
프롬프트 캐시는 기억 장치가 아닙니다
프롬프트 캐시는 반복되는 입력 prefix의 비용을 줄이는 기능입니다. 사용자별 사실이나 에이전트의 현재 상태를 자동으로 기억하는 데이터베이스가 아닙니다.
캐시를 활용하려면 안정된 developer 지침, 도구 정의, 공통 자료를 입력 앞부분에 놓고 자주 바뀌는 사용자 요청을 뒤에 둡니다. Responses API는 prompt_cache_key와 prompt_cache_options를 제공하며, 최신 모델 가이드는 폐기 예정인 prompt_cache_retention 대신 prompt_cache_options.ttl: "30m" 사용을 안내합니다. 명시적 캐시 경계는 요청당 최대 4개이며 현재 문서에 나온 TTL 값은 30m 하나입니다. Responses API 생성 참조, GPT-6 Astra 모델 가이드
캐시가 비용을 줄였는지는 응답의 사용량으로 확인해야 합니다. 같은 긴 prefix를 두 번 보낸 뒤 usage.input_tokens_details.cached_tokens, cache_write_tokens, prompt_cache_diagnostics를 기록하고, prefix 앞부분을 바꾼 요청을 대조군으로 둡니다. 캐시 적중은 가정하지 말고 실제 응답을 관측값으로 취급해야 합니다.
자동 잘림과 컴팩션은 역할이 다릅니다
truncation: "auto"는 입력이 컨텍스트 창을 넘으면 대화 앞부분의 항목을 버려 한도에 맞춥니다. 기본값인 disabled에서는 초과 시 400 오류가 납니다. 자동 잘림은 편리하지만 무엇이 사라졌는지 업무 의미를 기준으로 판단하지 않습니다. Responses API 생성 참조
/responses/compact는 긴 상태를 명시적으로 압축한 응답 객체를 돌려줍니다. 결과는 사용자 메시지와 하나의 compaction item으로 구성되며, 사용량에는 캐시·reasoning·전체 토큰 집계가 포함됩니다. compact item은 내부 구조를 해석하거나 수정하지 말고 불투명한 값으로 다음 요청에 전달해야 합니다. OpenAI Compact conversation API 참조
컴팩션도 원문과 완전히 같은 기억을 보장하지 않습니다. OpenAI 가이드는 장기·도구 중심 작업에서 사용량을 감시하고, 맥락 한계 직전이 아닌 주요 이정표 뒤에 컴팩션하라고 권합니다. 요구사항, 실패 이유, 보안 결정처럼 누락 비용이 큰 상태는 별도로 보존하는 편이 안전합니다. OpenAI 컴팩션 가이드
272K 전에 작동하는 컨텍스트 예산을 만드세요
보편적인 ‘안전 비율’은 없습니다. 1.05M의 70%처럼 단일 비율을 쓰면 이미 272K 가격 경계를 크게 지난 뒤입니다. 각 워크로드에서 다음 식으로 경고선과 강제 조치선을 정하는 편이 낫습니다.
예상 다음 입력 = 현재 누적 입력 + 다음 자료 예상량 + 안전 여유
예상 다음 입력이 내부 경고선을 넘으면 새 문서 첨부를 멈추고 검색·요약 대상으로 돌립니다. 강제 조치선에서는 컴팩션하거나 새 세션으로 상태를 넘깁니다. 경고선의 숫자는 문서 크기와 출력 예산을 측정해 정해야 하며, 272K를 넘는 요청이 필요하다면 할증까지 비용 예산에 넣습니다.
보존 위치도 자료 성격에 맞춰 나눕니다.
| 자료 | 권장 보존 방식 |
|---|---|
| 계약서·설계서·코드 원문 | 검색 인덱스 또는 파일 경로와 근거 위치 |
| 요구사항 ID·결정·실패 이유 | 구조화된 상태 필드 |
| 반복 대화와 중간 추론 기록 | 주요 단계 뒤 컴팩션 |
| 공통 정책·도구 정의 | 안정된 prefix와 프롬프트 캐시 |
워크로드에 따라 남길 상태가 다릅니다
대형 문서 1회 분석
문서 전체를 매번 보내지 말고 질문과 관련된 절·페이지를 먼저 고릅니다. 답변에는 원문 위치를 보존해 사람이 다시 확인할 수 있게 합니다. 후속 질문이 다른 범위를 요구할 때만 추가 절을 가져옵니다.
코드 에이전트
도구 로그 원문보다 명령의 결과, 오류 종류, 수정한 파일, 다음 검증 단계를 구조화해 남깁니다. 재현에 필요한 원본 로그는 파일로 보존하고 현재 요청에는 필요한 구간만 넣습니다.
장기 고객 대화
변하지 않는 정책은 캐시 가능한 prefix에 둡니다. 사용자가 확인한 사실과 동의 상태는 구조화하고, 대화 표현은 컴팩션합니다. 실제 고객 데이터에는 별도의 보존·접근 정책도 적용해야 합니다.
운영 대시보드에서 볼 지표
요청별 input, output, cached, cache_write 토큰을 따로 기록해야 원인을 찾을 수 있습니다. 여기에 272K 초과 요청 비율과 캐시 적중률을 더합니다.
컴팩션을 쓰면 전후 입력 토큰만 비교해서는 부족합니다. 합성 대화에 요구사항 ID, 실패한 접근, 파일명, 다음 작업을 심고 같은 질문으로 정확 일치·의미 일치·누락을 평가할 수 있습니다. 실제 고객 대화 없이도 회귀 검사를 만들 수 있습니다.
마지막 지표는 요청당 비용이 아니라 승인된 작업당 비용입니다. 한 요청을 싸게 줄였지만 누락 때문에 재작업이 늘었다면 컨텍스트 정책은 실패한 것입니다.
한계와 발행 직전 확인할 내용
이 글은 공개 사양과 산술 예제를 바탕으로 한 설계 가이드입니다. 실제 Astra API를 호출해 캐시 적중률이나 컴팩션 품질을 측정한 결과는 포함하지 않았습니다. Codex에 공개된 이전 창 검색 기능도 일반 Responses API의 1.05M 창이나 /responses/compact와 같은 기능으로 해석해서는 안 됩니다. OpenAI GPT-6 Astra 발표
발행 전에는 모델 페이지에서 가격, 272K 할증, 캐시 쓰기 단가를 다시 확인해야 합니다. Responses API 참조에서는 TTL, 진단 필드, 컴팩션 요청 형식의 변경 여부를 확인하세요.
마무리
GPT-6 아스트라의 1.05M 컨텍스트는 모든 기록을 계속 쌓으라는 뜻이 아닙니다. 272K를 넘기 전에 비용 경계를 감시하고, 캐시·구조화 상태·검색·컴팩션에 역할을 나눠야 합니다.
첫 단계는 최근 요청 로그에서 입력 토큰 분포와 272K 초과 비율을 확인하는 일입니다. 그 결과를 기준으로 경고선과 컴팩션 시점을 정하면 큰 창을 필요한 작업에만 사용할 수 있습니다.
참고 자료
'AI' 카테고리의 다른 글
| GPT-6 아스트라 vs GPT-5.6: 토큰 가격이 2.5배여도 쓸 만한 작업은? (0) | 2026.09.20 |
|---|---|
| GPT-6 아스트라 가격 계산: 272K 장문 입력 할증과 캐시 비용까지 (1) | 2026.09.19 |
| GPT-6 아스트라 API 사용법: GPT-5.6에서 바뀐 설정과 마이그레이션 예제 (0) | 2026.09.17 |
| Codex에서 GPT-6 아스트라를 써야 할 때: Sol·Terra와 작업별 선택 기준 (0) | 2026.09.16 |
| Codex Astra 비교 ㅡ GPT-6 Astra는 어떤 작업에 좋은가 (0) | 2026.09.15 |