구글과 엔비디아, ‘DiffusionGemma’ 오픈소스 공개… 단일 그래픽카드 추론 속도 4배 향상
2026년 6월 10일, 구글은 한 번에 한 단어씩 텍스트를 생성하는 기존의 자기회귀적 패러다임에서 벗어난 실험적인 오픈소스 언어 모델인 ‘DiffusionGemma’를 출시했습니다. 이 모델은 이미지 AI의 확산 메커니즘을 텍스트 생성에 최초로 도입하여, 무작위 노이즈에서 시작해 반복적으로 정교화하며 단계당 256개의 토큰 블록을 병렬로 출력합니다.

하드웨어 성능 측면에서, NVIDIA의 심층 최적화 덕분에 이 모델은 단일 GPU 단일 사용자 모드에서 동급의 기존 모델보다 거의 4배 더 빠르게 실행됩니다. H100 GPU에서는 단일 요청당 초당 최대 1,000 토큰의 출력 속도를 달성하며, RTX 5090과 같은 고급 소비자용 GPU에서도 초당 700 토큰을 초과할 수 있습니다.
DiffusionGemma는 260억 개의 매개 변수를 가지고 있으며, 전문가 혼합(MoE) 아키텍처를 사용하여 단계당 38억 개의 매개 변수만 활성화합니다. 표준 벤치마크에서 텍스트 생성 품질과 정확도는 기존 Gemma4 시리즈 모델보다 약간 뒤처지지만, 고유한 “전체 블록 인식(full-block awareness)” 기능 덕분에 자기회귀 모델의 ‘역방향만 가능’한 한계를 극복합니다. 생성 과정에서 모든 토큰이 서로를 참조할 수 있기 때문에, 텍스트 완성, 코드 채우기, 스도쿠 풀이, 아미노산 서열 처리와 같은 비선형 및 구조화된 데이터가 포함된 작업에서 뛰어난 성능을 발휘합니다.

이 모델의 가중치는 현재 Hugging Face에서 Apache 2.0 라이선스 하에 오픈소스로 공개되었으며, vLLM 및 MLX와 같은 주류 추론 프레임워크와 원활하게 연동됩니다. 이러한 연구는 GPU 연산 능력에 대한 메모리 대역폭 제약을 해소할 뿐만 아니라, 복잡한 논리 및 비선형 텍스트 생성을 다루는 미래 AI 애플리케이션을 위한 새로운 기술적 길을 열어줍니다.
관련 기사
MiniMax, 전 세계 AI 전문가들을 장려하기 위해 10배 팀 프로그램을 공개합니다
MiniMax(시위 테크놀로지)의 범용 인공지능 연구소는 글로벌 인재 협력 프로그램인 '10x 팀'을 공식적으로 출시했습니다. 이 프로그램은 다양한 산업 분야의 최고 전문가들을 모집하여 대형 모델의 전문 수직 분야에 대한 심층적인 응용을 탐구하는 것을 목표로 합니다. 심층적인 산업 지식과 최첨단 AI를 통합함으로써 MiniMax는 대형 모델의 생산성을 일반적인 사용에서 전문적인 시나리오로 확장하여 궁극적으로 산업 효율성의 '10배 증가'를 주도
리눅스 재단에 6대 기술 거대기업이 1250만 달러를 지원해 AI 취약성 소음 문제 해결에 나서다
AI 자동화 도구가 생성한 저품질 보안 보고서의 홍수를 처리하기 위해, 앤트로픽(Anthropic), 아마존(AWS), 깃허브(GitHub), 구글(Google), 마이크로소프트(Microsoft), 오픈AI(OpenAI) 등 6대 주요 기술 기업은 리눅스 재단(Linux Foundation) 이니셔티브에 총 1,250만 달러의 자금을 공동으로 기부했습니다. 이 투자는 오픈 소스 소프트웨어(FOSS) 유지 관리자가 수동 선별의 부담에서 벗어나
관련 특별 주제 추천
의견 (0)
0/500
2026년 6월 10일, 구글은 한 번에 한 단어씩 텍스트를 생성하는 기존의 자기회귀적 패러다임에서 벗어난 실험적인 오픈소스 언어 모델인 ‘DiffusionGemma’를 출시했습니다. 이 모델은 이미지 AI의 확산 메커니즘을 텍스트 생성에 최초로 도입하여, 무작위 노이즈에서 시작해 반복적으로 정교화하며 단계당 256개의 토큰 블록을 병렬로 출력합니다.

하드웨어 성능 측면에서, NVIDIA의 심층 최적화 덕분에 이 모델은 단일 GPU 단일 사용자 모드에서 동급의 기존 모델보다 거의 4배 더 빠르게 실행됩니다. H100 GPU에서는 단일 요청당 초당 최대 1,000 토큰의 출력 속도를 달성하며, RTX 5090과 같은 고급 소비자용 GPU에서도 초당 700 토큰을 초과할 수 있습니다.
DiffusionGemma는 260억 개의 매개 변수를 가지고 있으며, 전문가 혼합(MoE) 아키텍처를 사용하여 단계당 38억 개의 매개 변수만 활성화합니다. 표준 벤치마크에서 텍스트 생성 품질과 정확도는 기존 Gemma4 시리즈 모델보다 약간 뒤처지지만, 고유한 “전체 블록 인식(full-block awareness)” 기능 덕분에 자기회귀 모델의 ‘역방향만 가능’한 한계를 극복합니다. 생성 과정에서 모든 토큰이 서로를 참조할 수 있기 때문에, 텍스트 완성, 코드 채우기, 스도쿠 풀이, 아미노산 서열 처리와 같은 비선형 및 구조화된 데이터가 포함된 작업에서 뛰어난 성능을 발휘합니다.

이 모델의 가중치는 현재 Hugging Face에서 Apache 2.0 라이선스 하에 오픈소스로 공개되었으며, vLLM 및 MLX와 같은 주류 추론 프레임워크와 원활하게 연동됩니다. 이러한 연구는 GPU 연산 능력에 대한 메모리 대역폭 제약을 해소할 뿐만 아니라, 복잡한 논리 및 비선형 텍스트 생성을 다루는 미래 AI 애플리케이션을 위한 새로운 기술적 길을 열어줍니다.
MiniMax, 전 세계 AI 전문가들을 장려하기 위해 10배 팀 프로그램을 공개합니다
MiniMax(시위 테크놀로지)의 범용 인공지능 연구소는 글로벌 인재 협력 프로그램인 '10x 팀'을 공식적으로 출시했습니다. 이 프로그램은 다양한 산업 분야의 최고 전문가들을 모집하여 대형 모델의 전문 수직 분야에 대한 심층적인 응용을 탐구하는 것을 목표로 합니다. 심층적인 산업 지식과 최첨단 AI를 통합함으로써 MiniMax는 대형 모델의 생산성을 일반적인 사용에서 전문적인 시나리오로 확장하여 궁극적으로 산업 효율성의 '10배 증가'를 주도
리눅스 재단에 6대 기술 거대기업이 1250만 달러를 지원해 AI 취약성 소음 문제 해결에 나서다
AI 자동화 도구가 생성한 저품질 보안 보고서의 홍수를 처리하기 위해, 앤트로픽(Anthropic), 아마존(AWS), 깃허브(GitHub), 구글(Google), 마이크로소프트(Microsoft), 오픈AI(OpenAI) 등 6대 주요 기술 기업은 리눅스 재단(Linux Foundation) 이니셔티브에 총 1,250만 달러의 자금을 공동으로 기부했습니다. 이 투자는 오픈 소스 소프트웨어(FOSS) 유지 관리자가 수동 선별의 부담에서 벗어나





집







