9월 초, GPT-6 Astra와 Claude Fable 5.1이 연달아 나왔다. 양쪽 발표 페이지에도, 제3자 표에도 예쁜 숫자가 있다. 읽을수록 결정이 어려워진다. 팀을 진짜로 막는 것은 「어떤 보드에서 2점 높다」가 아니라, 같은 brief로 한 번에 머지해도 될 코드를 누가 내느냐다.
셸도 다르다. Astra는 Codex, Fable 5.1은 Claude Code에 얹히는 경우가 많다. 모델·도구 루프·기본 샌드박스가 얽혀 있다. 제품 쪼개기는 Claude Code, Codex, Gemini 3.8 Flash 비교, 비용 쌓기는 AI Coding Agent 월 비용은 결국 얼마를 보라. 아래는 하나만: 같은 프로젝트를 양쪽에서 돌린다.
같은 brief, 공정한 규칙 쓰기
양쪽에 같은 저장소 스냅샷, 같은 스펙 클라우드 Mac, 같은 인수 목록을 줬다.
기존 Next.js + Postgres 관리 화면에 「비동기 CSV 내보내기」 추가: 인증, 큐, 실패 재시도, 메일 알림, 작업 상태를 볼 최소 관리 페이지. 테스트는 초록, PR은 사람이 읽을 수 있고, 데모 경로는 클릭 가능해야 한다.
제약은 일부러 고정했다.
- 상대 diff를 보지 않는다. 두 머신, 두 개의 깨끗한 작업 트리.
- 인수 항목을 바꾸지 않는다. 질문은 OK. 「메일」을 몰래 「로그만」으로 바꾸는 것은 불가.
- 각자 기본 셸 허용. Astra → Codex, Fable 5.1 → Claude Code. 맨 API 채팅이 아니라 「모델 + 일상 워크플로」를 비교한다.
- 2라운드에서 요구를 바꾼다. 내보내기 필드를 테넌트 화이트리스트로 걸러야 하고, 피크 쿼리를 망가뜨리면 안 된다.
벤치 표는 나중에 봐도 된다. brief가 착지할 때 어디서 멈추는지 먼저 본다.
스캐폴드에서 데모까지: 1라운드 차이는
둘 다 한두 시간 안에 「열 수 있는 것」은 만든다. 경로가 다르다.
| 관점 | GPT-6 Astra(Codex) | Claude Fable 5.1(Claude Code) |
|---|---|---|
| 큐와 재시도 | worker·데드레터·멱등 키를 빨리 깐다 | 끝내지만 계약 확인으로 더 자주 멈춘다 |
| 인증 배선 | 기존 middleware 재사용 경향 | 권한 경계 주석이 촘촘, 가드가 한 겹 더 생기기도 |
| 관리 페이지 | 기능 우선, 「엔지니어 콘솔」 느낌 | 빈/오류/진행 카피가 더 탄탄 |
| 테스트 | 터미널에서 통합 테스트를 먼저 초록 | 핵심 경로 단위 → E2E 한 줄 |
1라운드 체감: Astra는 파이프라인을 뚫으려 서두르는 동료, Fable은 사용자가 보는 상태를 먼저 쓰는 동료. 인수가 「CI 전부 초록 + 데모 스크립트」면 Astra가 손을 더 빨리 든다. 빈 상태와 문구를 리뷰가 파면 Fable이 재작업을 덜 할 확률이 높다.
요구가 바뀐 뒤: 공유 코드를 누가 건드리나
분수령은 2라운드다. 화이트리스트가 들어가면 「내보내기 서비스만」은 성립하지 않는다. 공유 쿼리, 캐시 키, 때로 과금용 읽기 뷰까지 움직인다.
흔한 갈림길:
- Astra: 실행욕이 세고, 터미널 명령이 빽빽하며, 한 번에 많은 파일을 연다. 「먼저 읽기 전용 정찰, 그다음 최소 diff」라고 분명히 말하면 수렴이 빠르다.
- Fable 5.1: 모듈 횡단에 신중하고, PR 설명에 위험면을 자주 적는다. 보안/민감 경로에서 거절하거나 우회하다가, 업무 허용 한 줄을 넣으면 이어간다.
「항상 더 안전」한 쪽은 없다. 저장소가 「움직여야 빠르다」인지 「한 번 건드리면 두 사람 리뷰」인지에 달렸다.
UI 감과 코드 리뷰: 차이는 어디에
같은 리뷰에 두 PR을 넣으면 댓글 분포가 안정적이다.
- 시각·상호작용: Fable 5.1이 여백·비활성·로딩 피드백을 한 번에 통과시키기 쉽다. Astra는 기능은 맞지만 「멈춘 것처럼 보이게」 막는 2패스가 자주 필요하다.
- 가독성: Fable 이름과 구간 주석은 사람용. Astra는 더 촘촘하고 사고 사슬이 길며, 지워도 되는 중간 실험이 diff에 섞이기도 한다.
- 도구와 샌드박스: Codex 기본 오프라인·감사 가능한 태도는 테스트 실행을 맡기기 쉽게 한다. Claude Code Subagent / Skills가 성숙하면 정찰 쓰레기가 메인 세션에 덜 들어온다. 한도 소진은 Claude Code 2026 사용 한도를 보라.
# 같은 인수로 양쪽이 내야 할 산출물
1. 초록 CI(실패 재시도 케이스 포함)
2. 클릭 가능한 관리 경로 설명
3. PR 설명: 위험면 + 롤백
4. 2라운드 화이트리스트 회귀 증거
표시 단가가 같을 때, 돈과 셸이 숨기는 것
API 표시는 대략 $10 / $50(백만 입력/출력), 창은 백만 규모. 긴 Agent가 진짜 민감한 것은 캐시 읽기와 작업당 Token이다.
| 차원 | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| 캐시 읽기(공개 표시 규모) | 더 비쌈 | 더 쌈(종종 약 4×) |
| 긴 컨텍스트 할증 | 어떤 입력 구간 초과 시 가능 | 전체 창을 표준가에 두는 편이 흔함 |
| 작업당 Token | 사고가 빽빽, 「말이 많은」 비용 | 캐시 친화 긴 세션에 강함 |
| 일상 셸 | Codex(샌드박스 친화) | Claude Code(Subagent / Skills) |
짧은 실행 밀집 작업에서는 Astra의 「1회 비용」이 더 좋아 보일 수 있다. 큰 저장소를 같은 맥락으로 반복 읽으면 Fable 캐시가가 이기기 쉽다. 스티커가 같다고 월말이 같다는 뜻은 아니다.
선정 때 볼 일
「누가 코드를 더 잘 쓰나」를 총점판이 아니라 저장소에 대한 네 질문으로 나눈다.
- 1순위가 CI 통과인가, UI 한 번에 통과인가. 전자는 Astra, 후자는 Fable 5.1을 더 시험.
- 2라운드가 공유 모듈을 크게 건드리나. 강한 제약·위험 설명이 필요하면 Fable. 최소 diff를 감시할 수 있으면 Astra가 빠르다.
- 같은 큰 트리를 반복 읽나. $10/$50만 보지 말고 캐시 단가와 긴 컨텍스트 할증을 보라.
- 팀이 이미 어떤 셸에 잠겼나. 샌드박스·Skills·권한 습관이 모델 교체보다 체감을 자주 바꾼다.
벤치는 와일드카드로 여전히 쓸모 있다. 같은 프로젝트, 같은 인수가 「우리 저장소에서 누가 진짜 코드를 더 잘 쓰는지」를 말해 준다.
대조 실험에서는 머신이 먼저 죽지 않게
「같은 brief, 양쪽」에서 최악은 중간에 뚜껑을 닫는 것이다. 세션 단절, 샌드박스 초기화, Prompt Cache 만료로 다음 턴이 전량 입력 과금되면 대조가 공정하지 않다. Mac mini 대기는 약 4W. Codex와 Claude Code가 노트북 절전으로 재시작하지 않고 창에 맞춰 일하게 둔다.
Apple Silicon 통합 메모리는 중간 저장소 인덱싱과 병렬 테스트에 유리하고, macOS는 Unix·Homebrew·Docker·SSH를 기본으로 줘 두 터미널 Agent가 WSL 층을 줄인다. 같은 가격대 Windows보다 크래시가 적고 무인 운용이 안정적이며, Gatekeeper와 SIP도 장시간 Agent에 맞다.
진지한 헤드투헤드라면 먼저 양쪽 머신 스펙을 맞추고 뚜껑을 열어 두라——요금제 알아보기. 차이는 모델에 남기고, 절전과 재워밍에 남기지 마라.
