나의 노트

구글/Gemini AI 경쟁력 현황 메모 (2026.02.08)

모델 현황

Gemini 3 라인업

벤치마크 vs 실전

영역1위Gemini 위치
SWE-bench (실제 코딩)Claude 4.5 Sonnet (77.2%)뒤처짐
수학 추론 (AIME 2025)GPT-5.2 (100%)뒤처짐
LMArena Elo (종합)Gemini 3 Pro (1501)1위
ARC-AGI-2GPT-5.2 (52.9%)Deep Think 45.1%

핵심: 벤치마크는 선방하지만, 에이전트용 실전 코딩에서 Claude/GPT에 밀림

코딩 도구 난립

문제: 제품이 너무 많고 각각 미완성. Anthropic(Claude Code)이나 OpenAI(Codex)는 하나에 집중

하사비스의 전략 방향

  1. 멀티모달 → 옴니모델: Gemini + Veo(비디오) + Imagen(이미지) 통합
  2. 월드 모델: 세계를 이해하고 시뮬레이션하는 모델, 하사비스가 가장 시간 투자 중
  3. 에이전트: "신뢰할 수 있는 AI 에이전트"가 2026 핵심이라고 발언

→ 장기 비전은 그럴듯하지만, 지금 시장이 원하는 "코딩 에이전트"에서는 느림

조직 이슈

인력 규모 (모델이 밀릴 이유가 없는 규모)

내부 문제

클라우드 인프라 — 아이러니한 구도

투자 시사점