요약 — 2026년 상반기에 나온 세 오픈 모델은 서로 다른 자리를 노립니다. Gemma 4는 2B부터 31B까지 “한 대의 장비 안에서 끝내는” 온디바이스·온프레미스용, Qwen3.8-27B는 비전과 에이전트 도구 호출이 강한 단일 GPU급 만능형, DeepSeek V4는 1M 컨텍스트와 최상위 코딩 성능을 API 가격으로 주는 대규모 MoE입니다. 정답은 “가장 점수가 높은 모델”이 아니라 데이터가 어디에 있어야 하고, 응답이 몇 초 안에 와야 하며, 누가 운영하는가에서 나옵니다. 이 글은 공개 스펙과 벤치마크를 정리한 뒤 용도별 선택 기준을 표로 도출하고, 감성 대화 AI처럼 음성·실시간·개인정보가 얽힌 현장에서는 왜 “모델보다 구조”가 먼저인지 설명합니다.

1. 세 모델 한눈에 보기

구분 Gemma 4 (Google DeepMind) Qwen3.8 (Alibaba) DeepSeek V4 (DeepSeek)
공개 2026.04.02 27B 2026.08.13 / Max 2026.08.12 프리뷰 2026.04.24 / Pro GA 2026.08.13
크기 E2B(2.3B 유효)·E4B(4.5B)·12B·26B-A4B MoE(활성 3.8B)·31B Dense 27B Dense(비전 인코더 포함) · Max 2.4T MoE(활성 95B, API 전용) Pro 1.6T MoE(활성 49B) · Flash 284B MoE(활성 13B)
컨텍스트 128K(소형) / 256K(12B 이상) 262K 1M (최대 출력 384K)
입력 텍스트+이미지, 오디오(E2B·E4B·12B) 텍스트+이미지 텍스트 전용
라이선스 Apache 2.0 27B Apache 2.0 / Max 별도 라이선스 MIT
특징 네이티브 함수 호출, 사고 모드 조절, 140개 언어, OCR·문서 파싱 추론 강도 3단계(low/medium/xhigh), 컴퓨터 사용·터미널 에이전트 강세 희소 어텐션으로 1M 컨텍스트, 코딩·수학 최상위, 저가 API
대표 점수 31B: MMLU-Pro 85.2 · GPQA 84.3 · LiveCodeBench 80.0 27B: Terminal-Bench 2.1 73.0 · OSWorld-Verified 84.3 Pro: SWE-bench Verified 80.6 · LiveCodeBench 93.5 · GPQA 90.1 · MMLU-Pro 87.5
자체 구축 최소 장비 E4B: 노트북/모바일 · 31B: 24GB급 GPU 1장(양자화) 27B: Q4 약 17GB, 24~32GB GPU 1장 또는 128GB 메모리 워크스테이션 Flash: H200 1장(빠듯) ~ 4장 · Pro: H100/H200 8장
API 가격(백만 토큰) 자체 호스팅 위주 Max는 API 전용 Pro $0.435/$0.87 · Flash $0.14/$0.28 (2026.08.16 이후 피크/오프피크 요금제)

2. Gemma 4 — “한 장비 안에서 끝내야 할 때”

강점

약점

맞는 자리: 온디바이스·엣지, 폐쇄망 온프레미스, 문서 RAG, 음성 입력 프로토타입, 예산이 GPU 1장인 사내 어시스턴트.

3. Qwen3.8-27B — “단일 GPU에서 에이전트를 돌릴 때”

강점

약점

맞는 자리: 사내 RPA·에이전트, 이미지가 섞인 업무 자동화, 코딩 보조, 단일 GPU 서버 운영.

4. DeepSeek V4 — “규모와 가격이 우선일 때”

강점

약점

맞는 자리: 대규모 코드 분석·생성, 초장문 문서 처리, 비용 민감한 대량 배치 처리, 데이터 반출이 허용되는 환경의 API 활용.

5. 용도별 선택 기준

요구사항 1순위 이유 대안
폐쇄망·개인정보, GPU 1장 Gemma 4 31B (또는 Qwen3.8-27B) 24GB급 1장으로 운영, Apache 2.0 DeepSeek V4 Flash (H200 필요)
현장 단말·모바일·오프라인 Gemma 4 E2B/E4B 유일한 2~5B급, 오디오 입력
음성 입력 실험 Gemma 4 E4B/12B 오디오 네이티브 STT + 어떤 모델이든
스캔 문서·도면 RAG Gemma 4 12B/31B OCR·PDF 파싱 명시 Qwen3.8-27B (비전)
화면·터미널 조작 에이전트 Qwen3.8-27B OSWorld·Terminal-Bench 우위 DeepSeek V4 (텍스트 도구만)
이미지 위치 짚기(바운딩 박스) Qwen3.8-27B 검증된 박스 정확도 Gemma 4
대규모 코드베이스 분석·생성 DeepSeek V4 Pro SWE-bench·LiveCodeBench 최상위, 1M 컨텍스트 Qwen3.8-Max(API)
수백만 건 배치 요약·분류 DeepSeek V4 Flash 최저 단가 Gemma 4 26B-A4B 자체 호스팅
법규·안전 근거 답변 Gemma 4 31B + RAG 환각 비용 최소화, 온프레미스 DeepSeek V4 + 인용 강제
최신 지식 의존 DeepSeek V4 / Qwen3.8 Gemma는 컷오프 2025.01 Gemma + 검색 RAG

세 가지 실무 원칙을 덧붙입니다.

  1. 벤치마크 1~3점 차이는 무시하세요. 자기 데이터 100건으로 한 번 돌려 본 결과가 공개 표보다 정확합니다. 특히 한국어는 세 모델 모두 공식 수치가 없습니다.
  2. 추론 모드는 기본값을 믿지 마세요. Qwen의 xhigh, Gemma의 사고 모드, DeepSeek의 reasoning_content 모두 지연 시간과 비용을 몇 배로 바꿉니다. 작업별로 고정하세요.
  3. 바꿀 수 있게 만드세요. 4개월 만에 세 모델이 세대교체됐습니다. 프롬프트·도구 스키마·평가셋을 모델과 분리해 두면 다음 모델로 갈아타는 비용이 하루로 줄어듭니다.

6. 감성 대화 AI의 경우: 왜 모델보다 구조가 먼저인가

콜센터와 돌봄 현장의 음성 대화는 위 표의 여러 칸을 동시에 요구합니다. 음성이 들어오고, 응답은 1~2초 안에 나와야 하며, 통화 내용은 밖으로 나갈 수 없고, 상대의 감정 변화를 통화 내내 추적해야 합니다. 어느 한 모델의 점수로 결정되는 문제가 아닙니다.

클로아이의 LLM 기반 감성 대화 AI는 그래서 모델을 고정하지 않는 구조로 설계했습니다.

시나리오별 적용 사례는 감성 대화 AI, 콜센터와 돌봄 현장에서 무엇을 바꾸나에서, 공공 환경의 클라우드 네이티브 배치는 근로복지공단 전환 사례에서 이어집니다.

7. 정리

어떤 모델이 우리 현장에 맞는지, 보유 장비와 데이터 반출 요건을 알려주시면 클로아이가 후보 모델로 같은 평가셋을 돌려 비교 결과를 드립니다. 도입 상담 신청

참고 자료: Google AI for Developers — Gemma 4 model card · Hugging Face google/gemma-4-31B · Simon Willison, “Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things” (2026-08-16) · DeepSeek V4 model card / OpenRouter·Together AI 가격표 · 각 벤치마크는 2026-08-30 조회 기준.