2026년 4월, Google DeepMind는 오픈 소스 AI 모델 제품군의 최신 세대인 Gemma 4를 출시했습니다. Gemini 모델과 동일한 연구 기반 위에 구축된 Gemma 4는 오픈 소스 AI에 대한 중대한 도약을 나타냅니다. 진정한 멀티모달 이해, 256K 토큰 컨텍스트 윈도우, 내장 추론 역량, 140개 이상의 언어 지원. 모두 Apache 2.0 라이선스로 배포되었습니다.
이 가이드는 Gemma 4에 대해 알아야 할 모든 것을 다룹니다. 그것이 무엇인지, 어떤 모델이 제공되는지, 무엇이 특별한지, 어떻게 시작할 수 있는지.
Gemma 4 모델 제품군
Gemma 4는 단일 모델이 아니라 다섯 가지 모델로 구성된 제품군이며, 각각은 서로 다른 사용 사례와 하드웨어 제약에 맞게 설계되었습니다.
Gemma 4 E2B는 제품군에서 가장 작은 모델로, 총 40억 중 20억 개의 활성 파라미터를 갖춘 Mixture-of-Experts (MoE) 아키텍처를 사용합니다. Q4 양자화로 단 3.2 GB의 컴팩트한 크기에도 불구하고, E2B는 온디바이스 배포에 인상적인 역량을 제공합니다. 스마트폰과 엣지 기기에서 편안하게 실행되어 비공개 오프라인 AI를 모두에게 접근 가능하게 만듭니다.
Gemma 4 E4B는 총 80억 중 40억 개의 활성 파라미터로 MoE 접근 방식을 확장합니다. 오디오 이해를 포함한 완전한 멀티모달 지원을 추가하여, 무거운 인프라 없이 강력한 역량이 필요한 개발자에게 스위트 스팟이 됩니다. E4B는 텍스트, 이미지, 비디오, 오디오를 네이티브로 처리합니다.
Gemma 4 12B는 기존 4월 출시 이후 2026년 6월 3일에 제품군에 합류했습니다. 텍스트 백본에 별도의 인코더를 연결하는 대신 통합 멀티모달 아키텍처를 사용하므로, 수작업으로 구성한 라우팅 레이어 없이 하나의 모델이 여러 입력 유형을 처리해야 할 때 가장 먼저 고려할 변형입니다. 제품군의 나머지 모델보다 늦게 출시되었기 때문에 공개된 파라미터, 컨텍스트 및 메모리 수치는 아직 확정되지 않았습니다. 하드웨어 사양을 정하기 전에 Hugging Face의 공식 모델 카드를 확인하세요.
Gemma 4 26B A4B는 프로덕션의 일꾼입니다. MoE 아키텍처를 통해 총 260억 중 90억 개의 활성 파라미터를 갖추고 있어, 추론 비용을 관리 가능한 수준으로 유지하면서도 훨씬 더 큰 모델과 경쟁하는 성능을 제공합니다. 코드 생성 (LiveCodeBench에서 80%), 에이전트 도구 사용, 복잡한 추론 작업에 뛰어납니다.
Gemma 4 31B Dense는 플래그십 모델입니다. 다른 모델과 달리, 추론 중에 310억 개 파라미터 모두가 활성화되는 전통적인 Dense 아키텍처를 사용합니다. 이는 벤치마크 전반에 걸쳐, 특히 긴 컨텍스트 이해 및 미묘한 다국어 작업에 대해 최고의 원시 품질을 제공합니다. 품질이 최우선 순위일 때 최고의 선택입니다.
주요 기능
멀티모달 이해
Gemma 4 모델은 텍스트, 이미지, 비디오, 오디오를 네이티브로 처리합니다(E2B 및 E4B에서 오디오 지원). 가변 해상도 이미지 입력을 통해 모델은 강제 리사이징 없이 네이티브 해상도로 이미지를 분석할 수 있으며, 차트 읽기, 문서 OCR, 이미지 분석과 같은 시각 작업의 정확도를 향상시킵니다.
256K 토큰 컨텍스트 윈도우
모든 Gemma 4 모델은 256K 토큰 컨텍스트 윈도우를 지원합니다. 전체 코드베이스, 긴 법률 문서, 책 길이의 텍스트 또는 확장된 다중 턴 대화를 처리할 수 있을 만큼 충분합니다. 이는 이전 세대에 비해 상당한 개선이며, 컨텍스트 길이 측면에서 Gemma 4를 가장 큰 독점 모델과 동등한 수준에 놓습니다.
내장 추론
Gemma 4는 복잡한 문제를 단계별로 분해할 수 있는 향상된 씽킹 역량을 포함합니다. 이는 수학적 추론, 코드 디버깅, 다단계 계획 작업에 특히 유용합니다. 추론 모드는 사용 사례에 따라 켜거나 끌 수 있습니다.
네이티브 함수 호출
에이전트와 도구 사용 애플리케이션을 구축하는 개발자를 위해, Gemma 4는 구조화된 JSON 출력과 함께 네이티브 함수 호출을 지원합니다. 이는 모델이 취약한 프롬프트 엔지니어링 없이도 외부 API를 안정적으로 호출하고, 데이터베이스를 쿼리하고, 다단계 워크플로를 오케스트레이션할 수 있음을 의미합니다.
140개 이상의 언어 지원
Gemma 4는 140개 이상의 언어를 지원하며 전반적으로 강력한 성능을 보입니다. Massive Multitask Multilingual Understanding (MMMLU) 벤치마크에서 85.2%를 기록하여, 이용 가능한 가장 뛰어난 다국어 오픈 소스 모델 중 하나입니다. 이는 번역, 콘텐츠 모더레이션, 고객 지원의 진정으로 글로벌한 애플리케이션을 가능하게 합니다.
벤치마크
Gemma 4는 주요 벤치마크 전반에 걸쳐 경쟁력 있거나 선도적인 결과를 제공합니다.
- LiveCodeBench: 80% (26B A4B) — 강력한 코드 생성 및 이해
- MMMLU: 85.2% — 뛰어난 다국어 이해력
- MMMU: 72.4% (31B Dense) — 강력한 멀티모달 이해
- MATH-500: 91.8% (31B Dense) — 거의 전문가 수준의 수학적 추론
- Arena Hard: 85.1% (31B Dense) — 경쟁력 있는 대화 능력
이 수치들은 Gemma 4를 최고의 오픈 소스 모델들 사이에 자리매김시키며, 많은 독점 대안과 경쟁합니다.
시작하기
Gemma 4를 가장 쉽게 시도해 보는 방법은 Ollama를 통하는 것입니다.
ollama pull gemma4:26b
ollama run gemma4:26b브라우저 기반 실험을 위해서는 Google AI Studio를 방문하세요. 여기서 Gemma 4와 채팅하고 무료로 API 키를 받을 수 있습니다.
프로덕션 배포를 위해서는 HuggingFace, Kaggle에서 모델을 이용할 수 있으며, vLLM, TGI, SGLang과 같은 프레임워크로 서빙할 수 있습니다.
자세한 설정 지침은 시작하기 가이드를, 이용 가능한 모든 플랫폼은 다운로드 페이지를 확인하세요.
결론
Gemma 4는 오픈 소스 AI의 전환점을 의미합니다. 개발자들은 처음으로 진정한 멀티모달 이해, 긴 컨텍스트, 내장 추론, 네이티브 도구 사용, 광범위한 다국어 지원을 결합한 모델 제품군을 이용할 수 있게 되었습니다. 모두 사용 제한 없이 Apache 2.0 라이선스로 배포됩니다.
코드 어시스턴트를 구축하든, 스마트폰에 AI를 배포하든, 수천 개의 문서를 처리하든, 다국어 고객 지원 에이전트를 만들든, Gemma 4는 구축할 수 있는 유능하고 효율적이며 진정으로 열린 기반을 제공합니다. 오픈 소스와 독점 AI 사이의 격차는 그 어느 때보다 작아졌습니다.
