본문으로 바로가기
반응형

이 글에서 사용하는 주요 용어 정의

용어 정의
GPT-6 Astra 이 글에서 비교하는 OpenAI API 모델 gpt-6-astra입니다.
GPT-5.6 Sol gpt-5.6-sol 모델이며, 문서상 gpt-5.6 별칭이 가리키는 모델입니다.
reasoning effort 모델이 응답 전에 사용하는 추론 노력 수준을 조절하는 설정입니다.
토큰 단가 입력·캐시 입력·출력 100만 토큰당 API 가격입니다.
완료 작업당 비용 승인된 결과 하나를 얻는 데 든 API·도구·인프라·사람 비용입니다.

기본 트래픽은 GPT-5.6 Sol로 처리하고, 실패와 재시도 비용이 큰 장기 도구 작업만 GPT-6 Astra로 승격 평가하는 방식이 안전합니다. Astra의 토큰 단가는 현재 Sol의 2.5배지만, 재시도와 출력 토큰, 사람 수정 시간을 줄이면 완료 작업당 총비용은 낮아질 수 있습니다.

다만 이 비교에는 중요한 기한이 있습니다. 이 글의 가격은 2026년 9월 15일 기준이며, Sol의 현재 가격은 공식 문서가 적어도 2026년 11월 21일까지 제공한다고 명시한 프로모션 가격입니다. 이후에는 2.5배 비율이 달라질 수 있으므로 발행과 도입 결정 직전에 다시 확인해야 합니다. OpenAI GPT-5.6 Sol 모델 문서

2026년 9월 가격과 사양 비교

Standard 텍스트 요율에서 Astra는 일반 입력·캐시 입력·출력 모두 Sol의 2.5배입니다. Astra에는 별도의 캐시 쓰기 단가도 공개돼 있습니다.

항목 GPT-6 Astra GPT-5.6 Sol
입력 1MTok $10 $4
캐시 입력 1MTok $1 $0.40
캐시 쓰기 1MTok $12.50 공식 모델 페이지 기준 비교값 없음
출력 1MTok $50 $20
컨텍스트 창 1,050,000토큰 1,050,000토큰
최대 출력 128,000토큰 128,000토큰

출처: OpenAI GPT-6 Astra 모델 문서, OpenAI GPT-5.6 Sol 모델 문서

입력 100K, 출력 10K인 요청을 Standard에서 실행하고 캐시와 도구 호출료를 제외하면 Astra는 $1.50, Sol은 $0.60입니다.

Astra = 0.1 × $10 + 0.01 × $50 = $1.50
Sol   = 0.1 ×  $4 + 0.01 × $20 = $0.60

두 모델 모두 컨텍스트 창과 최대 출력이 같습니다. 따라서 Astra의 추가 비용은 더 큰 컨텍스트를 사는 값이 아닙니다. 두 모델 모두 입력이 272K를 넘으면 해당 요청 전체의 입력 요율이 2배, 출력 요율이 1.5배가 된다는 점도 같습니다.

설정에는 차이가 있습니다. Astra의 reasoning effort는 low, medium, high, xhigh, max를 지원하지만 none은 지원하지 않습니다. Sol은 none도 지원합니다. 최저비용 실험에서 Sol none과 Astra low를 같은 조건이라고 간주하면 안 됩니다. OpenAI GPT-6 Astra 모델 가이드

토큰 단가와 완료 작업당 비용은 다릅니다

모델 비용은 성공한 첫 호출 하나만으로 결정되지 않습니다. 실패 후 재시도, 늘어난 출력, 도구 호출, 실행 대기, 사람 검수와 수정이 함께 비용을 만듭니다.

완료 작업당 API 비용 = 총 API 비용 / 승인된 결과 수

완료 작업당 총비용 =
  (API 비용 + 도구비 + 인프라비 + 사람 검수·수정비)
  / 승인된 결과 수

시도당 평균 비용을 C, 한 번에 승인될 확률을 p라고 단순화하면 완료 작업당 API 비용은 C / p로 비교할 수 있습니다.

C_A / p_A < C_S / p_S

같은 토큰량에서 Astra의 시도 비용이 Sol의 2.5배라면 p_A > 2.5 × p_S가 필요합니다. Sol의 1회 승인율이 40%를 넘으면 성공률만으로는 이 조건을 만족할 수 없습니다. 출력 토큰, 재시도 횟수, 도구비나 사람 수정 시간이 함께 줄어야 합니다.

이 식은 모델 선택을 정리하는 분석 틀입니다. 각 시도의 성공이 독립적이거나 토큰량이 일정하다는 보장은 없으며, 공식 벤치마크 점수를 그대로 p에 넣어서는 안 됩니다.

공식 평가에서 Astra의 격차가 컸던 작업

OpenAI 발표에서 Astra의 우위가 크게 나타난 항목은 긴 도구 사용과 전문 작업이었습니다. Terminal-Bench 4.0은 Astra 57.9%, Sol 37.3%였고, 표시된 평가 설정에서 Astra의 추정 API 작업당 비용이 약 9% 낮았다고 보고했습니다. BenchCAD는 95.9% 대 83.3%였으며 추정 작업당 비용은 약 43% 낮았습니다. OpenAI GPT-6 Astra 발표

같은 발표에서 AutomationBench는 41.4% 대 18.1%, Database Migration Tasks는 63.9% 대 42.7%였습니다. Terminal-Bench Science 0.1의 저비용 설정은 Astra 61.1%, Sol 최고 22.4%였고 Astra의 추정 API 비용이 약 27% 낮은 것으로 제시됐습니다.

이 결과는 다음 작업을 Astra 승격 후보로 볼 근거가 됩니다.

  • 여러 명령과 도구를 거쳐야 하는 터미널 작업
  • 오류 복구와 상태 유지가 중요한 데이터베이스 마이그레이션
  • 정답 판정이 명확한 전문 코드 생성
  • Sol 실패 뒤 긴 재작업이 발생하는 워크플로

여기서 ‘약 9% 또는 43% 저렴하다’는 수치는 표시된 벤치마크 설정의 추정 작업당 API 비용입니다. 일반 코딩 요청의 청구액이나 자체 제품의 성능 보장으로 확대할 수 없습니다.

격차가 작다면 Sol부터 시험합니다

공식 표에서도 작업에 따라 격차가 작았습니다. BrowseComp는 Astra 91.5%, Sol 90.4%, DeepSWE는 74.1% 대 72.7%, GPQA Diamond는 96.0% 대 94.6%였습니다. OpenAI GPT-6 Astra 발표

짧고 반복적이며 자동 검증이 쉬운 작업은 Sol을 먼저 쓰기 좋습니다. 형식 변환, 작은 코드 수정, 정형 데이터 처리처럼 실패를 빨리 발견하고 싸게 재시도할 수 있다면 Astra의 높은 시도 단가를 회수하기 어렵습니다.

GPQA Diamond의 저비용 설정에서는 Astra 94.9%, Sol 최고 94.6%인데도 발표상 Astra의 추정 비용이 약 37% 낮았습니다. 이는 설정과 출력 토큰이 작업비에 영향을 줄 수 있음을 보여 주지만, 다른 작업에도 같은 비용 절감이 생긴다는 뜻은 아닙니다. 공식 가이드도 Astra가 일부 평가에서 더 적은 출력 토큰으로 낮은 추정 작업당 비용을 냈다고 설명합니다. OpenAI GPT-6 Astra 모델 가이드

Astra 승격 후보를 고르는 네 가지 신호

첫째, Sol 실패가 반복되고 실패 한 번의 비용이 큽니다. 긴 실행 뒤에야 오류를 발견하거나 실패가 사람의 재설계로 이어진다면 비싼 모델을 먼저 쓰는 편이 나을 수 있습니다.

둘째, 작업이 여러 도구와 앱을 거칩니다. 터미널 명령, 브라우저, 데이터베이스, 코드 편집을 이어 가며 상태를 유지해야 하는 작업은 자체 평가 대상으로 삼을 가치가 있습니다.

셋째, 사람 수정 시간이 API 차액보다 큽니다. 모델이 낸 결과를 고치는 데 든 분당 비용은 팀이 직접 정해야 합니다. 임의의 급여값을 넣지 말고 실제 내부 원가나 기회비용 범위를 사용합니다.

넷째, 완료 여부를 테스트로 명확히 판정할 수 있습니다. 테스트 통과, 요구사항 충족, 불필요한 변경 부재, 보안 회귀 없음처럼 승인 기준을 고정해야 비용 비교가 가능합니다.

공정한 사내 A/B 평가 방법

평가 작업은 실제 트래픽에서 난이도별로 20~30개를 먼저 고정합니다. 이 숫자는 탐색 평가를 위한 권장 설계일 뿐 통계적 유의성을 보장하지 않습니다. 표본이 적으면 결과를 탐색적이라고 표시해야 합니다.

두 모델에는 같은 Responses API 하네스, developer 프롬프트, 도구 목록, 시간 제한, 최대 도구 호출 수를 적용합니다. reasoning effort는 공통으로 지원하는 low, medium, high, xhigh, max 중 하나로 맞춥니다. Sol의 none은 별도 저비용 기준선으로 측정합니다.

실행 순서는 무작위화하고, 채점자는 모델명을 숨긴 결과를 봅니다. 자동 테스트만으로 승인하지 말고 요구사항 누락, 불필요한 변경, 보안 회귀를 같은 루브릭으로 평가합니다.

다음 필드를 요청별로 기록하면 완료 작업당 총비용을 계산할 수 있습니다.

task_id, model, attempt,
input_tokens, cached_tokens, cache_write_tokens, output_tokens,
tool_cost_usd, elapsed_seconds, human_minutes, accepted

평균만 보면 드문 대형 실패가 가려질 수 있습니다. 모델별 승인율, 중앙값, p90 비용, 재시도 횟수와 사람 수정 시간을 함께 보고합니다. 모델별 반복 횟수도 공개해야 결과의 한계를 판단할 수 있습니다.

운영 라우터는 전면 교체보다 안전합니다

기본 라우터는 Sol로 시작하고 명확한 실패 신호에서 Astra로 한 번 승격할 수 있습니다. 승격 신호에는 테스트 실패, 도구 호출 상한 도달, 사용자 승인 거절처럼 사후 조작하기 어려운 값을 씁니다.

보안 변경이나 복구 비용이 큰 고위험 작업은 처음부터 Astra 후보군에 넣을 수 있습니다. 다만 고위험이라는 이유만으로 자동 채택하지 말고 동일한 승인 루브릭으로 평가해야 합니다.

세 전략을 같은 로그로 비교하면 판단이 쉬워집니다.

전략 비교할 값
전부 Sol 승인율, 총 API 비용, 완료 시간, 사람 수정 시간
전부 Astra 같은 네 지표
Sol 실패 후 Astra 승격률과 중복 비용을 포함한 같은 네 지표

실제 API 로그가 없다면 합성 결과를 실측값처럼 제시하지 마세요. 계산 템플릿만 만든 뒤 운영 로그가 쌓였을 때 채우는 편이 정확합니다.

한계와 발행 직전 확인할 내용

이 글은 API Standard 텍스트 가격과 개발·에이전트 작업을 비교합니다. ChatGPT나 Codex 구독료를 API 토큰 가격으로 환산하지 않았으며, GPT-5.6 Terra와 Luna도 비교 대상이 아닙니다.

공식 벤치마크는 OpenAI가 공개한 결과입니다. 점수 정의와 평가 하네스가 실제 제품의 승인 기준과 다를 수 있습니다. OSWorld 2.0 지연 시뮬레이션에서 발표된 Astra 약 40분, Sol 약 75분도 일반 Responses API의 지연 SLA가 아닙니다. OpenAI GPT-6 Astra 발표

발행 전에는 두 모델 페이지에서 가격과 272K 할증을 다시 확인해야 합니다. 특히 Sol의 프로모션이 적어도 2026년 11월 21일까지라는 문구와 이후 가격을 확인한 뒤 제목과 2.5배 계산을 갱신하세요.

마무리

Astra의 토큰 단가가 2.5배라는 사실만으로 채택하거나 배제할 수는 없습니다. 지금은 Sol을 기본값으로 두고, 반복 실패·긴 도구 실행·사람 수정비가 큰 작업에서 Astra를 같은 하네스로 평가하는 전략이 합리적입니다.

다음 행동은 최근 작업 로그에서 승인 결과 하나당 API 비용, 재시도, 사람 수정 시간을 계산하는 것입니다. 그 수치가 있어야 모델 가격표가 아니라 실제 완료 비용으로 라우팅 규칙을 정할 수 있습니다.

참고 자료

반응형