요약 — 2026년 상반기에 나온 세 오픈 모델은 서로 다른 자리를 노립니다. Gemma 4는 2B부터 31B까지 “한 대의 장비 안에서 끝내는” 온디바이스·온프레미스용, Qwen3.8-27B는 비전과 에이전트 도구 호출이 강한 단일 GPU급 만능형, DeepSeek V4는 1M 컨텍스트와 최상위 코딩 성능을 API 가격으로 주는 대규모 MoE입니다. 정답은 “가장 점수가 높은 모델”이 아니라 데이터가 어디에 있어야 하고, 응답이 몇 초 안에 와야 하며, 누가 운영하는가에서 나옵니다. 이 글은 공개 스펙과 벤치마크를 정리한 뒤 용도별 선택 기준을 표로 도출하고, 감성 대화 AI처럼 음성·실시간·개인정보가 얽힌 현장에서는 왜 “모델보다 구조”가 먼저인지 설명합니다.
1. 세 모델 한눈에 보기
| 구분 | Gemma 4 (Google DeepMind) | Qwen3.8 (Alibaba) | DeepSeek V4 (DeepSeek) |
|---|---|---|---|
| 공개 | 2026.04.02 | 27B 2026.08.13 / Max 2026.08.12 | 프리뷰 2026.04.24 / Pro GA 2026.08.13 |
| 크기 | E2B(2.3B 유효)·E4B(4.5B)·12B·26B-A4B MoE(활성 3.8B)·31B Dense | 27B Dense(비전 인코더 포함) · Max 2.4T MoE(활성 95B, API 전용) | Pro 1.6T MoE(활성 49B) · Flash 284B MoE(활성 13B) |
| 컨텍스트 | 128K(소형) / 256K(12B 이상) | 262K | 1M (최대 출력 384K) |
| 입력 | 텍스트+이미지, 오디오(E2B·E4B·12B) | 텍스트+이미지 | 텍스트 전용 |
| 라이선스 | Apache 2.0 | 27B Apache 2.0 / Max 별도 라이선스 | MIT |
| 특징 | 네이티브 함수 호출, 사고 모드 조절, 140개 언어, OCR·문서 파싱 | 추론 강도 3단계(low/medium/xhigh), 컴퓨터 사용·터미널 에이전트 강세 | 희소 어텐션으로 1M 컨텍스트, 코딩·수학 최상위, 저가 API |
| 대표 점수 | 31B: MMLU-Pro 85.2 · GPQA 84.3 · LiveCodeBench 80.0 | 27B: Terminal-Bench 2.1 73.0 · OSWorld-Verified 84.3 | Pro: SWE-bench Verified 80.6 · LiveCodeBench 93.5 · GPQA 90.1 · MMLU-Pro 87.5 |
| 자체 구축 최소 장비 | E4B: 노트북/모바일 · 31B: 24GB급 GPU 1장(양자화) | 27B: Q4 약 17GB, 24~32GB GPU 1장 또는 128GB 메모리 워크스테이션 | Flash: H200 1장(빠듯) ~ 4장 · Pro: H100/H200 8장 |
| API 가격(백만 토큰) | 자체 호스팅 위주 | Max는 API 전용 | Pro $0.435/$0.87 · Flash $0.14/$0.28 (2026.08.16 이후 피크/오프피크 요금제) |
2. Gemma 4 — “한 장비 안에서 끝내야 할 때”
강점
- 크기 스펙트럼. 2.3B부터 31B까지 같은 계열이라, 노트북에서 프로토타입을 만들고 서버급 31B로 올리는 과정에서 프롬프트·도구 호출 형식을 다시 짤 필요가 적습니다.
- 멀티모달과 오디오. 소형 3종은 오디오 입력을 받습니다. 음성 대화형 기기, 현장 단말, 오프라인 환경에서 STT 없이 바로 이해하는 파이프라인을 실험할 수 있는 몇 안 되는 오픈 모델입니다.
- 문서 이해. OCR·PDF 파싱·차트·UI 화면 이해가 모델 카드에 명시되어 있어, 스캔 문서가 많은 공공·제조 현장의 RAG 전처리에 유리합니다.
- 라이선스와 운영 비용. Apache 2.0, 사용량 제한 없음. 31B 양자화 모델은 24GB급 GPU 1장에서 돌아갑니다.
약점
- 학습 컷오프가 2025년 1월로 세 모델 중 가장 오래됐습니다. 최신 지식은 RAG로 보완해야 합니다.
- 최상위 코딩·수학은 DeepSeek V4 Pro에 뒤집니다(LiveCodeBench 80.0 vs 93.5).
- 26B-A4B MoE는 활성 파라미터가 3.8B라 속도는 빠르지만, 복잡한 다단계 추론에서는 31B Dense와 체감 차이가 있습니다.
맞는 자리: 온디바이스·엣지, 폐쇄망 온프레미스, 문서 RAG, 음성 입력 프로토타입, 예산이 GPU 1장인 사내 어시스턴트.
3. Qwen3.8-27B — “단일 GPU에서 에이전트를 돌릴 때”
강점
- 에이전트·도구 호출. 터미널 조작(Terminal-Bench 2.1 73.0)과 컴퓨터 화면 조작(OSWorld-Verified 84.3)이 이전 세대 대비 크게 올랐습니다. 사내 시스템을 클릭·명령으로 조작하는 자동화에 27B급에서 가장 강한 선택지입니다.
- 비전 포함 단일 모델. 바운딩 박스 생성이 정확해 이미지 안의 위치를 짚어야 하는 작업(도면·현장 사진·화면 캡처)에 별도 비전 모델 없이 대응합니다.
- 추론 강도 조절. low/medium/xhigh 세 단계로, 같은 모델을 빠른 분류기와 느린 분석가로 나눠 쓸 수 있습니다.
- 현실적인 장비. Q4 양자화 약 17GB. 24~32GB GPU 1장, 또는 128GB 통합 메모리 워크스테이션에서 15~30 토큰/초.
약점
- 기본값이 과도한 사고. 출고 기본이 xhigh라 단순 요청에도 몇 분씩 “고민”합니다. 운영 환경에서는 low 또는 사고 비활성으로 시작하고 필요한 작업에만 올리는 것이 정석입니다.
- 1M급 장문은 없습니다(262K).
- 상위 모델 Qwen3.8-Max(2.4T)는 오픈 가중치가 아니고 별도 라이선스의 API 전용이라, “Qwen이면 다 오픈”이라고 가정하면 안 됩니다.
맞는 자리: 사내 RPA·에이전트, 이미지가 섞인 업무 자동화, 코딩 보조, 단일 GPU 서버 운영.
4. DeepSeek V4 — “규모와 가격이 우선일 때”
강점
- 성능 대비 가격. V4 Pro는 SWE-bench Verified 80.6으로 폐쇄형 최상위 모델과 동급이면서 API 가격은 출력 기준 백만 토큰당 $0.87. Flash는 그 3분의 1 이하입니다.
- 1M 컨텍스트. 압축 희소 어텐션(CSA/HCA)으로 이전 세대 대비 추론 연산 27%, KV 캐시 10% 수준으로 백만 토큰을 처리합니다. 수천 페이지 규정집·소스 저장소 전체를 한 번에 넣는 작업은 세 모델 중 유일하게 현실적입니다.
- MIT 라이선스. 가장 제약 없는 라이선스. Flash(활성 13B)는 H200 1~4장이면 자체 호스팅이 가능합니다.
약점
- 텍스트 전용. 이미지·음성은 별도 모델이 필요합니다.
- 사실성·환각. SimpleQA-Verified 57.9로 경쟁 최상위 모델(75 내외)보다 낮고, 환각 지표도 불리합니다. 근거 없는 답을 내는 비용이 큰 업무(법규·안전·의료)에서는 반드시 RAG와 인용 강제가 필요합니다.
- 긴 호흡의 도구 사용. SWE-bench Pro 55.4로 장시간 에이전트 작업은 아직 폐쇄형 최상위에 뒤집니다. 멀티턴 API에서 `reasoning_content`를 되돌려 보내야 하는 구현상 함정도 있습니다.
- 자체 구축 비용. Pro는 H100/H200 8장이 최소입니다. 사실상 API 사용이 전제입니다.
맞는 자리: 대규모 코드 분석·생성, 초장문 문서 처리, 비용 민감한 대량 배치 처리, 데이터 반출이 허용되는 환경의 API 활용.
5. 용도별 선택 기준
| 요구사항 | 1순위 | 이유 | 대안 |
|---|---|---|---|
| 폐쇄망·개인정보, GPU 1장 | Gemma 4 31B (또는 Qwen3.8-27B) | 24GB급 1장으로 운영, Apache 2.0 | DeepSeek V4 Flash (H200 필요) |
| 현장 단말·모바일·오프라인 | Gemma 4 E2B/E4B | 유일한 2~5B급, 오디오 입력 | — |
| 음성 입력 실험 | Gemma 4 E4B/12B | 오디오 네이티브 | STT + 어떤 모델이든 |
| 스캔 문서·도면 RAG | Gemma 4 12B/31B | OCR·PDF 파싱 명시 | Qwen3.8-27B (비전) |
| 화면·터미널 조작 에이전트 | Qwen3.8-27B | OSWorld·Terminal-Bench 우위 | DeepSeek V4 (텍스트 도구만) |
| 이미지 위치 짚기(바운딩 박스) | Qwen3.8-27B | 검증된 박스 정확도 | Gemma 4 |
| 대규모 코드베이스 분석·생성 | DeepSeek V4 Pro | SWE-bench·LiveCodeBench 최상위, 1M 컨텍스트 | Qwen3.8-Max(API) |
| 수백만 건 배치 요약·분류 | DeepSeek V4 Flash | 최저 단가 | Gemma 4 26B-A4B 자체 호스팅 |
| 법규·안전 근거 답변 | Gemma 4 31B + RAG | 환각 비용 최소화, 온프레미스 | DeepSeek V4 + 인용 강제 |
| 최신 지식 의존 | DeepSeek V4 / Qwen3.8 | Gemma는 컷오프 2025.01 | Gemma + 검색 RAG |
세 가지 실무 원칙을 덧붙입니다.
- 벤치마크 1~3점 차이는 무시하세요. 자기 데이터 100건으로 한 번 돌려 본 결과가 공개 표보다 정확합니다. 특히 한국어는 세 모델 모두 공식 수치가 없습니다.
- 추론 모드는 기본값을 믿지 마세요. Qwen의 xhigh, Gemma의 사고 모드, DeepSeek의 reasoning_content 모두 지연 시간과 비용을 몇 배로 바꿉니다. 작업별로 고정하세요.
- 바꿀 수 있게 만드세요. 4개월 만에 세 모델이 세대교체됐습니다. 프롬프트·도구 스키마·평가셋을 모델과 분리해 두면 다음 모델로 갈아타는 비용이 하루로 줄어듭니다.
6. 감성 대화 AI의 경우: 왜 모델보다 구조가 먼저인가
콜센터와 돌봄 현장의 음성 대화는 위 표의 여러 칸을 동시에 요구합니다. 음성이 들어오고, 응답은 1~2초 안에 나와야 하며, 통화 내용은 밖으로 나갈 수 없고, 상대의 감정 변화를 통화 내내 추적해야 합니다. 어느 한 모델의 점수로 결정되는 문제가 아닙니다.
클로아이의 LLM 기반 감성 대화 AI는 그래서 모델을 고정하지 않는 구조로 설계했습니다.
- 감정 추론을 LLM 밖에서 먼저 — STT 텍스트의 감정 단서와, 텍스트로 바꾸지 않은 목소리의 호흡 지표(속도·높낮이·침묵)를 별도 모듈이 읽어 감정 상태와 변화량을 산출합니다.
- 동적 프롬프트로 LLM에 전달 — 산출된 상태가 프롬프트에 실시간 주입되어, 어떤 LLM이든 “지금 이 사람의 상태”에 맞춰 어조·속도·내용을 바꿉니다.
- 현장 요건에 따라 모델 선택 — 폐쇄망 콜센터라면 Gemma 4 31B나 Qwen3.8-27B를 GPU 1장에 올리고, 대량 통화 요약처럼 비용이 우선이면 DeepSeek V4 Flash를 배치에 씁니다. 모델이 바뀌어도 감정 추론과 개입 규칙은 그대로입니다.
- 사람에게 넘기는 기준 — 감정이 임계치를 넘으면 상담사·생활지원사에게 알리는 규칙은 모델 성능과 무관하게 시스템이 보장합니다.
시나리오별 적용 사례는 감성 대화 AI, 콜센터와 돌봄 현장에서 무엇을 바꾸나에서, 공공 환경의 클라우드 네이티브 배치는 근로복지공단 전환 사례에서 이어집니다.
7. 정리
- Gemma 4: 장비 한 대·폐쇄망·문서·음성 입력. 오래된 컷오프는 RAG로.
- Qwen3.8-27B: 단일 GPU 에이전트·비전. 추론 강도는 low부터.
- DeepSeek V4: 규모·가격·코딩·1M 컨텍스트. 텍스트 전용, 환각은 RAG로 묶어서.
어떤 모델이 우리 현장에 맞는지, 보유 장비와 데이터 반출 요건을 알려주시면 클로아이가 후보 모델로 같은 평가셋을 돌려 비교 결과를 드립니다. 도입 상담 신청
참고 자료: Google AI for Developers — Gemma 4 model card · Hugging Face google/gemma-4-31B · Simon Willison, “Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things” (2026-08-16) · DeepSeek V4 model card / OpenRouter·Together AI 가격표 · 각 벤치마크는 2026-08-30 조회 기준.