AI 코딩 모델 비교 (2026년 2월)
Codex Spark (GPT-5.3-Codex-Spark)
- 2026.02.12 출시, Cerebras WSE-3 칩 기반
- 1,000+ 토큰/초 — 현존 최고 속도
- SWE-Bench Pro ~56%로 정확도는 낮음
- 128K 컨텍스트, ChatGPT Pro($200/월) 필요
- 용도: 빠른 프로토타이핑, 타겟 편집, 프론트엔드 반복
Claude Sonnet 4.6
- 2026.02.17 출시
- SWE-Bench Verified 79.6% — Opus 4.6(80.8%)에 근접
- Terminal-Bench 2.0 59.1%
- 1M 토큰 컨텍스트, $3/$15 per M토큰
- 개발자 59%가 이전 Opus 4.5보다 선호
Sonnet vs Opus 근본적 차이
- 같은 기술, 다른 크기 — Opus는 파라미터가 더 많은 대형 모델
- 모델이 클수록: 내부 표현이 풍부, 추론 깊이가 깊음, 롱컨텍스트 처리 우수
- Opus가 앞서는 영역: 코드베이스 리팩토링, 멀티 에이전트 조율, 롱컨텍스트 검색(MRCR v2 76% vs 18.5%)
- 세대가 지날수록 Sonnet이 이전 Opus를 추월하는 패턴 (지식 증류, 알고리즘 효율화)
속도 비교
Anthropic의 모델 개발 중점
- "Do More With Less" — 하드웨어 확장보다 알고리즘 효율성
- 안전성(Safety) — RSP 단계적 강화, 정렬 페이킹 해결이 핵심 과제
- 에이전트 코딩 — 30시간+ 연속 작업, 멀티 에이전트 조율
- 기업 시장 — 워크플로우에 내장되는 AI
다음 버전 (Claude 5) 예상
- Vertex AI 로그에서
claude-sonnet-5@20260203 포착, Q2 2026 출시 유력 - 중점: 정렬 안전성 > 수학적 추론 > 멀티 에이전트 협업 > 추론 비용 절감
- Opus 4 테스트에서 발견된 "정렬 페이킹" 해결이 최우선
- Sonnet 5가 Opus 4.6을 추월할 가능성 높음
OpenAI의 모델 개발 중점
- "Ship Fast, Scale Big" — 빠른 혁신 + 대규모 배포
- 자기 자신을 만드는 AI — GPT-5.3-Codex가 자체 버그 탐지, 배포 관리, 테스트 평가에 사용됨
- 하드웨어 다변화 — Cerebras WSE-3 도입으로 NVIDIA 의존 탈피 (Spark 1,000+ tok/s)
- 플랫폼 전환 — ChatGPT 앱스토어 9억 사용자 오픈, 모델 회사 → 플랫폼 회사
- 실용적 채택 — 데모 중심에서 일상 워크플로우 AI로 전환, 2026.09까지 인턴급 연구 보조 목표
- 시장: 소비자 AI 트래픽 ~80%, 기업 LLM 25% (하락 추세)
Google DeepMind / Gemini의 모델 개발 중점
- "AI로 과학을 혁신한다" — Demis Hassabis(노벨상 수상)의 DNA
- 과학 연구 AI — AlphaFold, AI 설계 항암제 2026 임상 1상, AI co-scientist로 가설 개발 수년→수일
- 옴니모달(Omnimodal) — 텍스트/이미지/비디오/오디오/3D/로보틱스를 Gemini 하나의 코어로 통합
- 물리 지능 + 로보틱스 — Boston Dynamics 파트너십, "18개월 내 로보틱스의 ChatGPT 모먼트"
- 유니버설 어시스턴트 — 폰→브라우저→스마트글래스 넘나드는 AI, Google Assistant를 Gemini로 교체
- Gemini 3 Flash: SWE-Bench 78.0%, Gemini 3 Pro: 76.2% (Gemini 2.5 Pro는 63.8%)
- 컨텍스트 2M 토큰 예정
xAI의 모델 개발 중점
- "힘으로 AGI" — Grok 5 (6조 파라미터, 이전의 2배) 개발 중
- 극단적 스케일링 — Colossus 555,000 GPU, $18B 투자, 월 $1B 운영
- 멀티모달 + 음성 — Grok Voice Agent API, Tesla 차량 탑재
- 정부/국방 — 미 국방부 GenAI.mil 통합
- X 플랫폼 통합 — 8억 사용자, 실시간 데이터 접근
- Grok 4: SWE-Bench 72-75% (자체 보고), 독립 테스트 58.6%로 격차 큼
- 기업가치 $250B, 펀딩 $20B+
- "오픈소스 AI" — Llama가 오픈소스 LLM 사실상 표준, 하지만 정체성 위기
- 클로즈드 전환 검토 — 차세대 Avocado 클로즈드 가능성, DeepSeek의 Llama 복제가 계기
- 멀티모달 생성 — Mango (이미지/비디오 생성 모델) 개발 중
- Meta 제품 통합 — Instagram, WhatsApp, Quest 30억 사용자에 AI 내장
- Llama 4: 코딩 벤치마크 약함, 벤치마크 조작 의혹까지 나옴
- 2026 인프라 투자 $115-135B
DeepSeek의 모델 개발 중점
- "효율의 극한" — R1을 $6M에 학습, 미국 경쟁사의 1/68 비용
- 제재 속 효율 극대화 — 미국 GPU 수출 제한 하에서도 프론티어 달성
- DeepSeek V4 — 1조 파라미터, 2026.02 출시 예정, SWE-Bench 80%+ 목표
- 오픈소스 — 중국 오픈소스 대장, 글로벌 개발자 커뮤니티에서 가장 유명한 중국 모델
- 중국 AI 앱 WAU 2위 (8,156만)
ByteDance의 모델 개발 중점
- "앱 위의 AI" — Doubao가 중국 AI 앱 1위 (WAU 1.55억)
- 물량 투자 — 2026 capex $23B, 절반이 AI 반도체
- Doubao 2.0 — GPT-5.2 대비 90% 저렴하다고 주장
- TikTok 배포력 — 글로벌 10억+ 사용자
중국 AI 생태계 (Kimi, GLM 등)
중국 AI 앱 사용자 순위 (2025.12 WAU)
- Doubao (ByteDance) — 1.55억
- DeepSeek — 8,156만
- Yuanbao (Tencent)
- A-Fu (Ant Group)
- Qianwen/Qwen (Alibaba)
- ...
- Kimi (Moonshot AI) — 450만
Kimi (Moonshot AI)
- MAU 3,600만 → 1,000-1,500만으로 급락, 소비자 시장에서 고전
- 기업가치 $4.3B, 시리즈 C $500M 유치
- 해외 매출이 국내를 추월, K2.5 오픈소스 후 글로벌 유료 사용자 4배 증가
- 개발자/연구자 사이에서 롱컨텍스트 + 추론 모델로 유명
GLM / Zhipu AI (Z.ai)
- 2026.01 홍콩 상장 (AI 파운데이션 모델 최대 IPO, $558M), 주가 120% 급등
- 중국 정부 AI 지출의 70%가 Zhipu 포함 "1차 인가" 모델 사용
- GLM-5 출시 (2026.02) — 오픈소스 벤치마크 1위
- GLM Coding Plan 15만+ 사용자, 수요 폭주로 가격 30% 인상
- 소비자 시장은 약하지만 정부/기업 B2B에서 강함
Alibaba (Qwen)
- $52B AI/클라우드 인프라 투자 (3년간, 중국 최대)
- Qwen 오픈소스로 DeepSeek과 함께 중국 오픈소스 양대 축
AI 패권 7사 비교
철학과 리더
모델 성능
자금과 투자
시장과 전략
OpenAI 인프라 약정 상세 (~$1.4T, 2025-2031)
- 2026 예상 손실: -$14B (매출 $20B의 1.7배를 잃는 중)
- 2029까지 누적 현금 소진: $115B
- 2028까지 매년 적자, 2030 흑자 전환 계획
- "AGI가 오면 수조 달러 시장이 열린다"는 전제가 맞아야만 성립하는 베팅
- 2026.02 투자자 브리핑에서 $1.4T → $600B으로 대폭 하향 — 투자자들의 "돈 태우는 용광로" 우려 반영. 아모데이가 지적한 "YOLO 투자" 리스크를 OpenAI 스스로 인정한 셈
- 2023→2026: 약 4.7배 증가
- 2026 전체 capex의 ~75%가 AI 인프라 (~$450B)
- 증가분의 대부분이 AI로 유입
- Google/Meta의 capex는 AI 전용이 아님 (기존 인프라 포함), OpenAI는 100% AI
AI 투자와 DRAM/메모리 시장
- 글로벌 DRAM 시장: ~$129B (2025), HBM: ~$34B→$55B (2026, +58%)
- AI가 2026 글로벌 DRAM 웨이퍼 용량의 ~20% 소비
- HBM 1GB = 일반 DRAM 4배 웨이퍼 사용, 공급이 수요를 못 따라감
- SK하이닉스 HBM 점유율 62%, "메모리 슈퍼사이클"
투자 대비 성과 차이가 나는 이유
- AI 전업 회사 (Anthropic, OpenAI): 1달러도 빠짐없이 AI → 집중도 최고
- Big Tech (Google, Meta): AI는 여러 사업의 일부, 투자 대비 AI 집중도 낮음
- Meta 부진 원인: AI가 본업 아님, 조직 갈등, 오픈소스 역설 (공개→복제됨, 비공개→차별점 상실)
- Anthropic의 "Do More With Less"는 $1.4T 쓰는 상대와 정면 승부하지 않는 생존 전략
- 아모데이: "ROI를 충분히 이해하지 못한 채 YOLO하는 곳들이 있다. 2027년 중반을 예상했는데 2028년 중반에 오면? 파산한다."
- Anthropic 2028년 손익분기점 전망 (OpenAI보다 2년 빠름)
Claude Code Security와 월스트리트 충격 (2026.02.21)
- AI가 코드베이스 전체를 스캔해 보안 취약점 탐지 + 패치 제안
- 내부 테스트에서 오픈소스 코드베이스에서 500개+ 취약점 발견 (수십 년간 미발견된 것 포함)
- 발표 직후 사이버보안 주가 급락:
- CrowdStrike -8%, Cloudflare -8.1%, Okta -9.2%, SailPoint -9.4%
- Global X 사이버보안 ETF -4.9% (2023.11 이후 최저)
- 단일 AI 기능 발표가 사이버보안 업계 시총 수조 원 증발시킴
- 올해 소프트웨어 ETF 23%+ 폭락 — 교육, 법률, 데이터 분석, 사이버보안 순서로 AI가 잠식
Anthropic 시리즈 G (2026.02)
- 300억 달러 조달, 기업가치 3,800억 달러
- 참여: Microsoft, NVIDIA, GIC(싱가포르 국부펀드), Coatue, Sequoia
- 자금 용도: 인프라 확장이 아닌 모델 연구, 안전 개발, 기업 고객 확장에 집중
Anthropic vs OpenAI 사업모델 차이
- Anthropic: "광고 없는 AI" — 슈퍼볼 광고에서 OpenAI의 ChatGPT 광고 도입을 정면 저격
- OpenAI: 소비자 시장 확장 + 광고 수익 모델 추가
- 스콧 갤러웨이(NYU 교수): "시장 리더는 경쟁자를 언급하지 않는다. 알트만이 반응했다는 것 자체가 앤트로픽의 승리"
중국 AI 생태계 포지션