Codex CLI Terminal-Bench 91.9% 달성, 실제 체감 차이는 뭘까
이 글에서 사용하는 주요 용어 정의Terminal-Bench 2.1터미널 환경에서 에이전트의 자율적 코딩·명령 수행 능력을 측정하는 업계 벤치마크GPT-5.6 Sol UltraGPT-5.6 Sol의 최고 성능 모드, 여러 서브에이전트를 병렬 조율해 작업을 처리협력형 서브에이전트단일 사고 흐름 대신 여러 전문 서브에이전트가 실시간으로 소통·협업하는 구조오라클 솔루션(Oracle Solution)벤치마크 문제마다 준비된, 사람이 직접 작성한 정답 해결 방법아웃컴 기반 채점(Outcome-driven)에이전트가 실행한 명령이 아니라, 최종 결과 상태만으로 성공 여부를 판단하는 방식도입OpenAI가 2026년 6월 26일 GPT-5.6 Sol Ultra를 API와 Codex에 공개하면서, Terminal-Ben..