Kvmzen 블로그
← 기술 실전으로 돌아가기

Claude Code vs Codex vs Gemini 3.8 Flash: 2026 AI 코딩 에이전트 비교, 코드 품질, Context, MCP, Subagents, Terminal, 토큰 비용과 개발 효율

AIDevelopment ·약 19분 읽기

개발자가 다중 모니터 터미널에서 AI Coding Agent를 병렬로 실행하는 모습

같은 터미널에 Coding Agent를 두세 개 열어 두는 팀은 이제 드물지 않습니다. 이름은 익숙합니다. Claude Code, Codex, Gemini 3.8 Flash. 「누가 한 줄을 더 잘 완성하느냐」로 고르면 잘못된 도구를 집기 쉽습니다.

앞의 둘은 스스로 루프를 도는 Agent 제품입니다. Flash는 먼저 모델이고, CLI나 Antigravity 위에 올려야 일을 시킬 수 있습니다. 테스트가 통과하는지, 청구서가 컨텍스트에 뚫리는지, 도구가 진짜 붙는지—첫 문단에서 결론을 낼 문제가 아닙니다. 아래 절에서 하나씩 풉니다.

한도와 요금제 세부는 Claude Code 2026 사용량과 한도 완전 가이드를 함께 보시면 됩니다. IDE 구독과 CLI Agent 사이에서 아직 고민 중이라면 2026년 더 저렴한 Cursor 대안을 참고하세요.

1M
Context 창 규모
$0.75
Flash 프로모 입력가
51.8%
긴 작업 벤치의 한 점수

먼저 맞추기: 비교하는 대상이 같은 종류가 아니다

가장 중요한 점 더 맞는 선택 이유
다중 파일 리팩터, 긴 작업, 재작업 최소화 Claude Code Subagent가 성숙하고, Opus 5가 범용 Agent 벤치에서 뚜렷하게 앞섬
기본이 감사 가능, 기본이 샌드박스, 오픈소스가 필요 Codex CLI Apache-2.0, 기본 네트워크 차단, Subagent를 명시적으로 기동
대량 처리, 멀티모달, 회당 토큰을 최저로 Gemini 3.8 Flash 프로모션가가 Sonnet 5의 약 1/3, 짧은 SWE 작업에서 강함

「전 부문 1위」는 없습니다. DeepMind도 Gemini 3.8 Flash 모델 카드(2026년 9월)에서 스스로 인정합니다. Flash는 소프트웨어 엔지니어링 단거리에서 플래그십에 근접하지만, 더 긴 범용 Agent 작업에서는 여전히 Opus 5에 뒤집니다.

코드 품질: 단기와 장기는 같은 능력인가

「코드 품질」은 두 층으로 나누는 편이 분명합니다. 한 층은 한 번에 파일을 맞게 고치는 능력(패치가 빌드와 테스트를 통과하는지)이고, 다른 한 층은 세션을 넘기며 일을 끝내는 능력(중간에 빗나가거나 무관한 모듈을 건드리는지)입니다.

DeepMind 모델 카드의 공개 대조(2026년 9월):

벤치마크 측정 대상 Gemini 3.8 Flash Claude Opus 5 Claude Sonnet 5 GPT-5.6 Sol GPT-5.6 Terra
DeepSWE v1.1 장기 소프트웨어 엔지니어링 73.7% 74.0% 53.8% 72.7% 69.6%
Terminal-bench 2.1 터미널에서 코드 작성 89.4% 89.1% 80.4% 88.8% 87.4%
Terminal-bench 4.0 더 일반적인 Agent 19.1% 51.8% 12.4% 37.3% 23.6%
OSWorld-2.0 컴퓨터 조작 59.0% 75.4% 42.6% 62.6% 50.2%

읽는 법:

  • 일상 패치, 터미널 스크립트, 중간 규모 저장소: Flash, Opus 5, GPT-5.6 Sol이 거의 같은 수준에 있습니다. Flash는 Terminal-bench 2.1에서 오히려 조금 더 높습니다.
  • 도구를 넘나들고, 세션을 넘기며, 스스로 계획을 세워야 하는 긴 작업: Opus 5가 Terminal-bench 4.0을 51.8%까지 끌어올립니다. Sol은 37.3%, Flash는 19.1%에 그칩니다. 「싼 모델은 함수를 잘 쓰지만, 프로젝트 매니저 역할은 약하다」는 말의 수치 버전입니다.
  • Sonnet 5는 여전히 Claude Code의 기본 실무형입니다. 단가가 낮고 1M 컨텍스트가 네이티브이지만, DeepSWE는 53.8%뿐입니다. 어려운 리팩터는 Opus로 명시적으로 바꾸세요. 기본 모델이 플래그십 일을 버틸 것으로 기대하지 마세요.

체감으로는 Claude Code가 「A 파일을 고치다 B를 깨뜨리는」 경우가 더 적습니다. Codex는 커맨드라인과 다단계 스크립트에서 안정적이고, 기본 샌드박스 덕분에 테스트를 맡기기가 덜 두렵습니다. Gemini 3.8 Flash는 빠르고 저렴하며 멀티모달이 강하지만, 긴 사슬에서는 목표를 잃기 쉽습니다. 작업을 짧게 자르거나 thinking effort를 높이세요.

Context: 창이 커진 뒤, 돈은 어디에 쓰이나

제품 기본 모델 Context 최대 출력 긴 컨텍스트 요금
Claude Code (Sonnet 5 / Opus 5) 1M (API 네이티브) 128k 공식 장문 컨텍스트 할증은 별도 없음
Codex (GPT-5.6) 1.05M 128k 입력 약 272k를 넘으면 일부 구간에서 할증
Gemini 3.8 Flash 1,048,576 64k 프로모션 기간은 동일 단가; 2027년부터 표준가 2배

창 숫자는 이미 판매 포인트가 아닙니다. 진짜로 돈을 태우는 것은 매 요청마다 이력, 도구 출력, 저장소 조각을 다시 보내는 일입니다.

  • Claude Code: 대화가 길수록 비싸집니다. /clear/compact보다 쌉니다. Skills, MCP 결과, 테스트 로그가 모두 메인 세션에 들어갑니다. Subagent의 가치 중 하나는 검색 쓰레기를 자식 창에 남기고 요약만 돌려주는 것입니다.
  • Codex: Subagent를 명시적으로 spawn하므로 메인 세션이 더 깨끗하고 토큰을 예측하기 쉽습니다. 대가는 「몇 개를 열고, 각각 무엇을 할지」를 직접 적어야 한다는 점입니다.
  • Gemini 3.8 Flash: 1M 창에 조절 가능한 effort(low / medium / high). effort가 높을수록 사고 토큰과 지연이 늘어납니다. 지식 컷오프는 약 2026년 3월입니다. 새 라이브러리 API는 검색이나 MCP에 기대야 하며, 모델이 「다 안다」고 가정하면 안 됩니다.

대형 저장소를 창에 통째로 넣지 마세요. Explore / explorer로 읽기 전용 한 바퀴를 돌린 뒤, 메인 Agent에게 핵심 파일만 고치게 하세요. 병렬 코딩의 격리는 사이트 내 병렬 인공지능 코딩 가이드를 보세요.

MCP: 프로토콜은 같아졌고, 함정은 어디에 있나

세 제품 모두 Model Context Protocol을 지원합니다. 2026년의 질문은 더 이상 「MCP를 지원하는가」가 아닙니다. 누구의 생태계가 더 깊은가, 설정을 바꿀 때 함정에 덜 빠지는가, 다음에 제품 라인을 바꿔도 서버를 이어 쓸 수 있는가입니다.

Claude Code Codex CLI Gemini 3.8 Flash가 올라간 스택
접속 방식 claude mcp add (http / stdio; SSE는 폐기) config.toml settings.json / Antigravity 플러그인
생태계 가장 깊음 (프로토콜 발의자) 충분하며 엔지니어링 쪽에 치우침 연결은 되고, 기업 쪽이 더 갖춰짐
추가 확장 Skills, Hooks, Plugins Skills, exec 모드, 교체 가능한 모델 백엔드 Skills / Hooks / Subagents가 Antigravity로 이전

Claude Code는 여전히 GitHub, 데이터베이스, 내부 API를 먼저 붙일 때 저항이 가장 작은 길입니다. Codex의 강점은 설정을 저장소에 넣고 감사할 수 있으며, Chat Completions / Responses와 호환되는 어떤 백엔드든 가리킬 수 있다는 점입니다. 모델이 잘려도 파이프라인 전체가 죽지는 않습니다. Gemini 쪽에서는 개인 개발자가 구분을 분명히 해야 합니다. 모델이 싸다 ≠ Agent 제품이 안정적이다. 2026년 중반 Gemini CLI가 개인 요금제를 축소한 뒤, 커뮤니티는 Antigravity로 유도되었습니다. 확장 범위는 대체로 남아 있지만, 「오픈소스 CLI + 보조금 엔드포인트」 조합은 이미 갈라졌습니다. 로드맵이 아직 Gemini 메이저 버전에 걸려 있다면 Gemini 4 기다릴 만할까를 대조해 보세요.

MCP는 Context를 먹습니다
도구가 돌려주는 패킷은 매번 창에 들어갑니다. 로그, 테이블 전체 dump, 큰 Diff는 모델 자체보다 비쌀 때가 많습니다. MCP에 필터, 페이지 나누기, 읽기 전용 권한을 다는 편이 구독을 한 단계 올리는 것보다 효과적입니다.

Subagents: 도움을 부르는 두 가지 방식

양쪽 모두 「오케스트레이터 + 자식 Agent」를 쓰지만, 철학은 반대입니다.

Claude Code는 Subagent를 일등 시민으로 둡니다. Explore, Plan, 일반 워커 각각에 고유 컨텍스트, 도구 화이트리스트, 권한이 있습니다. 메인 Agent는 description을 보고 자동으로 위임하므로, 「탐색자를 하나 열어라」고 쓰지 않아도 일어납니다. 백그라운드 Subagent는 계속 돌 수 있고, 필요하면 독립 worktree로 들어갑니다. 아끼는 것은 메인 창의 검색 쓰레기이고, 늘어나는 것은 토큰입니다. 공식 규모상 계획 모드의 Agent 팀은 일반 세션의 수배에 이를 수 있습니다. 사용자 정의 역할은 YAML frontmatter로 쓰며, Skills와 같은 배포 사고방식을 따릅니다.

Codex는 기본적으로 자식 프로세스를 자동으로 열지 않습니다. 프롬프트에 「각 체크포인트마다 Agent를 하나 spawn하라」고 분명히 써야 합니다. Explorer는 읽기 전용에 가깝고 sandbox_mode와 맞출 수 있습니다. 장점은 비용을 예측할 수 있고 병렬 범위를 여러분이 그린다는 점입니다. 단점은 한 문장을 빠뜨리면 메인 세션에서만 천천히 검색한다는 점입니다.

Gemini 3.8 Flash 자체는 런타임이 아닙니다. Antigravity / Managed Agents는 Skills, Hooks, Subagents를 갖췄다고 말하지만, 성숙도와 문서 깊이는 아직 Claude Code만 못합니다. Flash를 직접 만든 오케스트레이터(또는 Codex의 다중 백엔드)에 붙이는 편이 더 통제하기 쉬운 경우가 많습니다. 비싼 일은 Opus / Sol에, 저장소 대량 스캔은 Flash에 맡기세요.

# Claude Code: 메인 세션이 암묵적으로 분기
메인 Agent(Opus / Sonnet)
  ├─ Explore(Haiku, 읽기 전용) → 요약만 반환
  ├─ Plan → 방안만, 프로덕션 파일은 직접 수정하지 않음
  └─ 구현 / 검증 → 독립 컨텍스트, 필요 시 백그라운드

# Codex: 지정해야 시작
메인 세션(GPT-5.6 Terra / Sol)
  └─ “spawn explorer + reviewer”를 직접 작성
        └─ 서브 Agent가 작업을 마치고 넘기면, 메인 세션이 계속 결정

Terminal: 명령을 맡겨도 되는가

Agent의 생산성 = pytest, npm test, git을 돌릴 수 있는 횟수입니다. 위험도 여기에 있습니다.

항목 Claude Code Codex CLI Gemini 3.8 Flash 스택
기본 샌드박스 Seatbelt / bubblewrap 기본 켜짐, Linux는 seccomp 호스트 Agent에 따름; 모델 자체는 프로세스를 관리하지 않음
기본 네트워크 새 도메인은 승인 필요 기본 꺼짐 Antigravity / 사용 중인 런타임에 따름
Windows WSL2 경유 네이티브 샌드박스 또는 WSL2 구체 제품에 따름
오픈소스 커널 아니오(배포 저장소 + 플러그인) 예, Apache-2.0, Rust 모델은 클로즈드; 구 Gemini CLI는 오픈소스이나 개인 채널은 이미 축소

Codex의 기본 네트워크 차단은 2026년에서 가장 단단한 보안 기본값입니다. Agent가 외망을 읽지 못하면 .env를 낯선 호스트에 붙이기가 훨씬 어렵습니다. Claude Code는 더 유연합니다. 도메인별로 열어 주므로 문서를 찾고 패키지를 받는 일상 개발에 맞습니다. 다만 공식 문서에도 적혀 있습니다. 프록시는 TLS 종단을 하지 않으며, 도메인 프론팅으로 우회할 여지가 있습니다. 기업은 검사 가능한 프록시를 직접 두세요.

Gemini 3.8 Flash는 Terminal-bench 2.1에서 89.4%입니다. 곧 모델은 터미널을 쓸 줄 안다는 뜻입니다. 여러분 기기에서 함부로 구는지는 겉에 Antigravity가 있는지, 직접 만든 runner인지, 아니면 Codex / Claude의 싼 백엔드로 쓰는지에 달려 있습니다. 「모델 벤치가 높다」를 「샌드박스까지 이미 갖춰 줬다」로 읽지 마세요.

토큰 청구: 세 가지 계산법

가격은 각 공식 페이지를 기준으로 합니다. 이 글의 숫자는 2026년 9월 공개 표시가(DeepMind 모델 카드 + Anthropic / Google 가격 설명)에 맞춥니다. 환율과 프로모션은 바뀌므로 예산을 다시 확인하세요.

API 단가(백만 토큰당)

모델 입력 출력 역할
Gemini 3.8 Flash (~2026-12-31) $0.75 $3.75 대량, 짧은 작업, 멀티모달
Gemini 3.8 Flash (2027-01-01부터) $1.50 $7.50 동일, 프로모션 종료
Claude Sonnet 5 $2 $10 Claude Code 기본
GPT-5.6 Terra $2 $12 Codex 일상 구간
GPT-5.6 Sol $4 $20 Codex 플래그십
Claude Opus 5 $5 $25 어려운 리팩터, 긴 Agent
Claude Fable 5 $10 $50 초장기, 명시적 선택 필요

중간 규모 Agent 라운드를 입력 80k + 출력 8k로 대략 잡으면 Flash는 약 $0.09, Sonnet 5는 약 $0.24, Sol은 약 $0.48, Opus 5는 약 $0.60입니다. 캐시가 맞으면 입력은 한 자릿수 더 내려갈 수 있습니다. Flash의 「싸다」는 말은 high effort, 반복 재시도, 1M 창을 가득 채울 때 금방 사라집니다.

구독 형태

  • Claude Code: Pro는 약 $20 / 월, Max 5x $100, 20x $200. 웹 Claude와 CLI가 한도를 공유합니다. $20 미만 개인 구간은 없습니다. 세부는 한도 가이드를 보세요.
  • Codex: ChatGPT를 따릅니다. Free / Go(약 $8) / Plus $20, 그리고 5x, 20x. 「20달러 아래에서 완전한 터미널 Agent를 쓸 수 있는」 대중 입구는 여기뿐입니다.
  • Gemini 3.8 Flash: 개인 쪽은 주로 API 종량제 + Google AI / Gemini Enterprise Agent Platform입니다. Agent 껍질(Antigravity, Code Assist)은 좌석이 따로입니다. 모델이 싸다고 「개발 좌석 전체」가 싼 것은 아닙니다.
진영을 고르기보다 섞는 편이 더 쌀 때가 많습니다
메인 세션은 Claude Code 또는 Codex로 아키텍처와 어려운 버그를 맡기고, Flash로 테스트 생성, 문서, 대규모 읽기 전용 스캔을 하세요. 비싼 모델은 「판단」에, 싼 모델은 「처리량」에 두세요.

개발 효율: 밟지 않고 고르려면

효율은 벤치 점수가 아니라 매주 병합하는 신뢰할 수 있는 변경입니다.

  1. 혼자이고, 저장소를 깊게 고쳐야 할 때: Claude Code + Sonnet 5, 난관은 Opus로 전환. Skills와 MCP를 맞춰 두는 편이 구독을 하나 더 사는 것보다 왕복을 줄입니다.
  2. 감사가 필요하고, 기본 보안이 필요하며, Windows 네이티브가 필요할 때: Codex CLI. spawn 규칙을 저장소에 적어 두면, 회의 중에 비용이 몰래 두 배가 되지 않습니다.
  3. 파이프라인, 야간 배치, 멀티모달(스크린샷 / 녹화 / PDF): Gemini 3.8 Flash. 64k 출력은 패치 설명을 쓰기엔 충분하고, 큰 파일을 한 번에 뱉기엔 부족합니다. 구간을 나누세요.
  4. : 같은 MCP와 리뷰 게이트를 쓰고, 모델 혼용을 허용하세요. 한 업체에 고정하면 상대가 가격을 올리거나 개인 채널을 줄일 때 끌려가게 됩니다.
  5. 기기: Agent는 24시간 디스크를 읽고, 테스트를 돌리고, MCP를 걸어 둡니다. 노트북 뚜껑을 닫으면 캐시가 무효가 되고 컨텍스트 비용을 다시 냅니다. 안정적이고 저전력인 클라우드 Mac이 「Max를 한 단계 더 사는 일」보다 숨은 병목이 되는 경우가 더 많습니다.
# 같은 작업이라도 저렴한 모델로 먼저 탐색한 뒤, diff를 플래그십에 넘기세요
# Flash / Terra: 재현 스크립트와 테스트 초안 생성
# Sonnet / Opus / Sol: diff 검토, 공개 API 수정, PR 마무리

자주 묻는 질문

Gemini 3.8 Flash를 Claude Code 대신 바로 쓸 수 있나요?
없습니다. 모델입니다. 터미널 루프, 권한, MCP를 쓰려면 Antigravity, Gemini 기업 Agent, 또는 직접 만든 runner가 있어야 합니다. Flash를 Codex처럼 다중 백엔드를 받는 CLI에 붙이는 조합이, 지금은 「싼 두뇌 + 성숙한 껍질」을 가장 흔히 만드는 방법입니다.

2026년에도 무료 Gemini CLI 개인 요금제가 있나요?
2025년에 보던 모습 그대로 예산을 잡지 마세요. 연중부터 개인 채널이 줄었고, 커뮤니티는 Antigravity와 종량제 API로 유도되었습니다. 기업 Code Assist는 별도 경로입니다. 주문 전에 현재 라이선스 페이지를 보고, 옛 블로그를 보지 마세요.

Context가 모두 1M이면 많이 넣을수록 좋나요?
아닙니다. 창은 상한이지 목표가 아닙니다. 불필요한 도구 출력과 폐기된 파일은 품질, 지연, 청구를 함께 칩니다. 먼저 검색하고, 그다음 정독하세요.

Terminal-bench 2.1만 보고 골라도 되나요?
안 됩니다. 2.1에서는 세 플래그십이 거의 비깁니다. 4.0과 OSWorld에서야 장기 차이가 드러납니다. 짧은 스크립트는 Flash가 타당하고, 주를 넘는 리팩터는 Opus / Sol이 더 안정적입니다.

가격이 다음 주에 바뀌나요?
바뀝니다. Flash 프로모션은 2026년 12월 31일까지로 적혀 있고, Sonnet 5의 $2 / $10은 이미 장기 가격으로 바뀌었습니다. Anthropic, OpenAI, Google Cloud의 당일 페이지를 기준으로 하세요.

Agent가 아무리 뛰어나도, 뚜껑을 닫지 않는 기기가 필요합니다

Claude Code, Codex, Gemini 3.8 Flash가 겨루는 것은 클라우드 토큰이지만, 저장소를 읽고 테스트를 돌리고 MCP를 거는 일은 눈앞의 기기에서 일어납니다. 노트북 뚜껑을 한 번 닫으면 세션이 끊기고, 샌드박스가 비워지며, Prompt Cache가 만료되어 다음 라운드가 전체 입력으로 과금됩니다. Mac mini 대기는 약 4W라, 터미널 Agent가 뚜껑이 아니라 여러분의 롤링 창을 따라 일하게 하기에 맞습니다.

Apple Silicon 통합 메모리는 대형 저장소 인덱싱과 병렬 테스트에 더 잘 맞습니다. macOS에는 Unix, Homebrew, Docker, SSH가 바로 있고, Claude Code와 Codex의 computer-use / 터미널 루프도 더 수월합니다. 같은 가격대 Windows 호스트보다 충돌이 적고 무인 운용이 안정적이며, Gatekeeper와 SIP가 오래 Agent를 걸어 둘 위험도 낮춥니다.

이미 토큰과 컨텍스트를 아끼고 있다면, 먼저 기기가 끊기지 않게 하는 편이 구독을 한 단계 올리는 것보다 남는 경우가 많습니다. 요금제를 바로 확인하세요. 돈은 반복 워밍업이 아니라 코드 수정에 쓰세요.

더 읽어보기

한정 특가

단순한 Mac이 아닌, 클라우드의 개발 기지

전용 컴퓨팅 · 글로벌 노드 · 월간 구독 · 하드웨어 불필요

홈으로 돌아가기
한정 특가 플랜 보기