DevDay 다음 주, 채팅에 가장 많이 올라오는 말은 「Astra가 이겼다」가 아니다. OpenAI Agents API, Anthropic Fable 캐시 단가, Google Flash 프로모 카운트다운——콘솔 스크린샷 세 장이 겹친다. 같은 「관리 화면에 내보내기 추가」 티켓에 누군가는 $10/$50를, 누군가는 $0.75를 붙이고, 재무는 월말이 한 자릿수 차이 나는지 묻는다.
모델 페이지, Agent 페이지, 좌석 페이지는 종종 다른 청구서다. 제품 셸을 어떻게 나눌지는 Claude Code, Codex, Gemini 3.8 Flash 비교;Astra 자체의 벽시계와 토큰은 GPT-6 Astra 코딩 실측. 아래는 API만 다룬다. 가격, 속도, Agent 능력, 그리고 이 셋을 따로 보면 안 되는 이유.
이번 업데이트 이후, API는 몇 장의 청구서를 비교하는가
2026년 9월 공개 면에는 적어도 이만큼이 겹쳤다. gpt-6-astra가 API와 Azure / Bedrock에 올라왔고, 9월 10일 Agents API가 퍼블릭 베타(Codex harness 호스팅, 추가 인터페이스 요금 없음, 토큰과 도구 과금). Anthropic은 Fable 5.1 캐시 읽기를 $0.25로 내렸고, Gemini 3.8 Flash는 소개가를 2026-12-31까지 걸었다. Agent Builder 캔버스는 11월 30일 종료 예정이라 Agents SDK로 옮겨야 한다.
「누가 더 똑똑한가」부터 시작하지 말 것. 먼저 청구서 모양을 맞춘다.
| 장부 | OpenAI | Anthropic | |
|---|---|---|---|
| 모델 API | Astra / Sol / Terra 토큰 과금 | Fable / Opus / Sonnet 토큰 과금 | Flash 토큰 과금(좌석은 별도) |
| 캐시 | 읽기 $1, 쓰기 $12.50; 272K 초과 시 요청 전체 할증 | Fable 5.1 읽기 $0.25 | 캐시 지원, 단가는 여전히 플래그십보다 훨씬 낮음 |
| Agent 런타임 | Agents API: 샌드박스, MCP, 압축, 서브 에이전트 | Claude Code / Messages 도구 루프 | Antigravity, Managed Agents |
| 추가 과금 | Computer use는 도구 호출당; Fast 약 ×2 | Opus Fast(프리뷰, Fable 제외) | 사고 단계와 도구 라운드가 토큰을 올림 |
숫자는 2026년 9월 공개 정가에 맞춘다. 환율, 세금, 프로모는 변한다. 주문 전에 공식 페이지를 다시 확인한다.
단가와 한 작업 비용은 같은가
100만 토큰당(입력 / 출력):
| 모델 | 입력 | 출력 | 캐시 읽기 | 정가를 볼 때 먼저 볼 것 |
|---|---|---|---|---|
| Gemini 3.8 Flash(2026-12-31까지) | $0.75 | $3.75 | 플래그십보다 훨씬 낮음 | 2027-01-01부터 $1.50 / $7.50 |
| GPT-5.6 Terra | $2 | $12 | — | Codex / API 일상 구간 |
| Claude Sonnet 5 | $2 | $10 | 입력의 0.1× | 대부분의 코딩 기본 출발점 |
| GPT-5.6 Sol | $4 | $20 | — | 직전 플래그십 |
| Claude Opus 5 | $5 | $25 | 입력의 0.1× | Anthropic은 「대부분의 일은 먼저 이것」 |
| GPT-6 Astra | $10 | $50 | $1 | 272K 초과: 입력·캐시 약 ×2, 출력 약 ×1.5; Fast ×2 |
| Claude Fable 5.1 | $10 | $50 | $0.25 | 5분 캐시 쓰기 $12.50; 1시간 쓰기 $20 |
중간 턴을 입력 80k + 출력 8k로 대충 보면 Flash 약 $0.09, Sonnet 약 $0.24, Terra 약 $0.26, Sol 약 $0.48, Opus 약 $0.60, Astra / Fable 약 $1.20. Agent는 한 발에 끝나지 않는다. 캐시 히트, 사고 단계, 도구 라운드가 「토큰 단가가 싸다」와 「티켓이 싸다」를 비튼다.
Flash 소개가는 플래그십 스티커의 약 13분의 1이지만 「공짜 Claude」가 아니다. Google은 분명히 적었다. 어려운 일에서 3.8은 추론 스텝과 도구 라운드를 더 쓴다. 싼 뇌 + 빽빽한 도구여도 한 작업 토큰은 중위 모델에 가까워질 수 있다. 구독, API, 머신을 한 달에 어떻게 겹칠지는 AI Coding Agent 한 달에 얼마가 드나.
벽시계 속도는 어느 단계 스위치에 숨어 있는가
세 곳 모두 「더 빠름」을 모델 이름이 아니라 단계에 숨긴다.
- Astra:
reasoning.effort는 low / medium / high / xhigh / max(none없음). 단계가 높을수록 라운드와 브라우저 확인이 늘어난다. API Fast는 벽시계와 정가가 약 2배. 출시 페이지 OSWorld 2.0: Astra 약 72.6% / 40분, Sol 약 65.7% / 75분. - Fable 5.1: 공식 표는 Opus 5, Sonnet 5보다 느리다. 사고는 적응형이고 기본값은
high. 사는 것은 장거리 판단이지 첫 토큰이 아니다. - Flash: Flash급 첫 바이트. 사고 단계는 low / medium / high(
minimal은 오류). 일상은 effort를 low로 두면 시계와 토큰이 같이 내려간다. 어려운 일은 스스로 라운드를 더한다.
첫 토큰이 빠르다고 티켓이 끝난 것은 아니다. Astra는 큐와 CI를 먼저 초록으로 만드는 경우가 많고, 빈 상태는 두 번째 라운드가 필요하다. Fable은 UI와 위험 설명에서 재작업이 적은 편이다. 같은 프로젝트를 어떻게 치는지는 GPT-6 Astra vs Claude Fable 5.1: 같은 프로젝트.
Agent 능력: 모델, 셸, 호스팅 런타임을 나눈다
2026년에 API를 고를 때는 적어도 세 층으로 나눈다.
- 모델: 맞는 파일을 고치는지, 권한을 넘지 않는지, 저장소를 컨텍스트에 터뜨리지 않는지.
- 셸: Codex, Claude Code, Antigravity——권한, 샌드박스, MCP, 서브 에이전트 기본값이 다르다.
- 호스팅 런타임: Agents API는 Codex harness를 HTTP 한 번에 건다. 샌드박스나 자체 머신을 고르면 OpenAI가 오케스트레이션, 압축, 복구를 맡는다. 추가 인터페이스 요금은 없고 Computer use 같은 도구는 따로 계산한다.
OpenAI 쪽에는 마찰이 두 가지 더 있다. 도구 호출은 Responses API가 필요하다(Chat Completions로는 부족). 프로덕션 오정렬 모니터링은 확인창만이 아니라 API 작업을 바로 멈출 수 있다. Astra computer use는 Agents' Last Exam, OSWorld 숫자가 좋아 폼, CRM, 브라우저 QA에 맞다. 사이버 능력은 Critical에 닿아 방어 쪽 리뷰는 되고, 고급 악용형 요청은 거절된다.
Claude 쪽 장점은 여전히 MCP + 캐시 경제 + 장거리 신중함. Gemini 쪽은 싼 처리량 + 매니지드 에이전트지만 Code Assist / Enterprise 좌석과 모델 청구는 두 줄이다. Flash를 Codex 같은 멀티 백엔드 셸에 붙이는 것은 흔한 「싼 뇌 + 성숙한 루프」다.
# 같은 티켓의 흔한 배분(유일한 해는 아님)
Flash / Terra / Sonnet → 탐색, 테스트, 읽기 전용 저장소 스윕
Sol / Opus → 공개 API 변경, diff 마무리
Astra / Fable 5.1 → 모듈 횡단, 야간, 산출물 또는 캐시
Agents API / Claude Code → 샌드박스와 재개가 필요할 때만 호스팅
진영이 아니라 작업으로 맞춘다
| 지금 하는 일 | 먼저 해볼 API 구간 |
|---|---|
| 짧은 배치, 멀티모달, 문서 스윕 | Gemini 3.8 Flash, thinking=low |
| 일상 API 수정, 테스트, PR 마무리 | Sonnet 5 또는 Terra; 필요하면 Sol / Opus |
| 모듈 횡단 리팩터, 야간 Agent | Fable 5.1(캐시) 또는 Astra(computer use / 업무 문서) |
| 브라우저 폼, 데스크톱 조작, 사이트 QA | Astra + Responses / Agents API |
| 예측 가능한 청구 | 싼 기본값 + API 월 한도. 구독은 벽에 닿으면 멈추고, API는 벽에 닿으면 결제한다 |
대조표에 넣기 어렵지만 예산을 뚫기 쉬운 것들:
- 이미 ChatGPT Plus / Claude Pro를 내는 중에 같은 에이전트용 무한 API를 여는 것은 이중 기장이다.
- Astra Fast + 272K 초과는 곱해진다. 창이 크다고 저장소를 붙여도 된다는 뜻이 아니다.
- Agent Builder 워크플로는 11월 30일 전에 Agents SDK로 옮긴다. 캔버스를 장기 아키텍처로 두지 말 것.
- 섞는 편이 진영보다 싼 경우가 많다: 어려운 버그는 한 셸, 처리량은 Flash, 야간은 캐시에 강한 플래그십.
자주 묻는 질문
Astra와 Fable 5.1 정가가 같으니 아무거나 골라도 되나?
정가는 같고 컨텍스트를 두 번째 읽는 방식이 다르다. 긴 세션과 반복 저장소 스윕에서는 캐시 읽기를 먼저 본다. computer use, 업무 산출물, Codex / Agents API 기성 harness가 필요하면 Astra를 본다.
Gemini 3.8 Flash를 프로덕션 기본값으로 쓸 수 있나?
처리량 기본값으로는 가능하다. 특히 2026년 말까지. 어려운 일은 스스로 라운드를 더하므로 한 작업이 항상 가장 싸지는 않다. 터미널 루프, 권한, MCP에는 여전히 셸이 필요하다. 개인 Code Assist 채널은 조여졌다. 2025년 무료 인상으로 예산을 짜지 말 것.
Agents API로 지금 옮겨야 하나?
클라우드 샌드박스, 세션 재개, harness를 직접 키우고 싶지 않다면 파일럿 가치가 있다. 추가 인터페이스 요금은 없지만 토큰, 도구, 작업을 멈추는 모니터링은 비용이다. Claude Code에서 이미 매끄러운 장거리 일을 DevDay에 새 API가 나왔다고 팀 전체가 이사할 필요는 없다.
API가 싸도, 덮개를 닫지 않는 머신이 필요하다
토큰은 클라우드에서 계산되고, 저장소·테스트·MCP·샌드박스는 앞의 머신에서 돈다. 노트북을 닫으면 세션이 끊기고 Prompt Cache가 만료되며 다음 「계속」은 전체 입력으로 청구된다——Astra는 272K를 넘으면 요청 전체에도 할증한다. Mac mini 대기는 약 4W라, Agent가 덮개 재부팅이 아니라 당신의 롤링 윈도우로 일하게 할 수 있다.
Apple Silicon 통합 메모리는 큰 저장소 인덱싱과 병렬 테스트에 더 맞다. macOS는 Unix, Homebrew, Docker, SSH를 갖춰 Codex, Claude Code, 자체 Agents 루프에서 WSL 한 층이 빠진다. 같은 가격대 Windows 기기보다 크래시가 적고 무인 운영이 안정적이며, Gatekeeper와 SIP가 Agent를 오래 올려 두는 위험도 낮춘다.
이미 세 API의 단가와 캐시를 깎고 있다면, 머신을 켜 두는 편이 플래그십을 한 단계 더 올리는 것보다 싼 경우가 많다——요금제 보기. 돈은 다시 워밍업하는 데가 아니라 코드를 바꾸는 데 쓴다.
