구글, ‘제미니 임베딩2’ 공개: 네이티브 다중 모달 모델로 의미 공간 통합
구글은 최근 새로운 네이티브 다중 모달 임베딩 모델인 ‘제미니 임베딩2( Gemini Embedding2)’를 공개했습니다. 이 모델은 텍스트, 이미지, 동영상, 오디오, PDF 문서를 하나의 공유된 의미 벡터 공간으로 매핑할 수 있으며, 복잡한 AI 데이터 워크플로를 간소화하고 다중 모달 검색 및 이해 능력을 향상시키도록 설계되었습니다. 이는 단일 모달 텍스트에서 통합된 다중 모달 의미 모델링으로의 전환을 의미하는, 구글의 임베딩 기술 분야에서 중요한 진전입니다.

앞서 2025년 7월, 구글은 'gemini-embedding-001' 텍스트 임베딩 모델을 선보인 바 있습니다. 이 모델은 100개 이상의 언어를 지원하며 MTEB 다국어 벤치마크에서 최상위 성적을 기록했습니다. 새로운 Gemini Embedding2는 Gemini 아키텍처를 기반으로 하지만 그 범위를 대폭 확장했습니다. 이제 텍스트, 이미지, 비디오, 오디오, PDF 등 5가지 모달리티를 처리하여 단일 벡터 공간으로 투영합니다. 이를 통해 여러 개의 특수 모델이나 추가 처리 단계 없이도 서로 다른 유형의 미디어 간에 직접적인 의미적 비교가 가능합니다. 이러한 기능은 의미 검색, 검색 강화 생성(RAG), 감정 분석, 데이터 클러스터링과 같은 애플리케이션에 특히 유용합니다.
입력 기능과 관련하여, 새로운 모델은 최대 8192개의 텍스트 토큰을 지원하며, 이는 기존 2048개 토큰 제한의 4배에 달합니다. 또한 요청당 최대 6개의 PNG 또는 JPEG 이미지, 최대 120초 길이의 동영상, 최대 6페이지 분량의 PDF 문서를 처리할 수 있습니다. 주목할 만한 특징은 Gemini Embedding2가 오디오 처리를 기본적으로 지원하여 음성-텍스트 변환이 필요 없고, 전사 과정에서 발생할 수 있는 정보 손실을 방지한다는 점입니다. 또한 Google은 "인터리브드 입력(interleaved input)" 기술을 도입하여, 개발자가 하나의 요청에 여러 모달리티(예: 이미지와 설명 텍스트 혼합)를 결합해 이들 간의 의미적 관계를 더 잘 포착할 수 있도록 했습니다.

아키텍처 측면에서 이 모델은 계속해서 Matryoshka Representation Learning(MRL)을 채택하고 있습니다. 이 기법은 계층적 구조를 사용하여 벡터 차원을 동적으로 조정합니다. 기본 임베딩 차원은 3072이며, 1536 및 768의 선택적 구성이 가능해 개발자가 검색 정확도와 저장 효율성 사이의 균형을 유연하게 맞출 수 있습니다.
구글의 벤치마크 결과에 따르면, Gemini Embedding2는 텍스트, 이미지, 동영상, 음성 작업 전반에 걸쳐 선도적인 성능을 보여줍니다. 예를 들어, 텍스트-동영상 검색에서 68.8점을 기록하여 Amazon Nova2Multimodal Embeddings(60.3점)와 Voyage Multimodal3.5(55.2점)를 앞섰습니다. 텍스트-이미지 비교에서는 93.4점을 기록하여, 아마존 모델의 점수인 84.0점을 크게 앞섰습니다.
현재 개발자들은 Gemini API와 Vertex AI를 통해 Gemini Embedding2를 이용할 수 있습니다. 이 모델은 LangChain, LlamaIndex, Haystack, Weaviate, Qdrant, ChromaDB, Vector Search와 같은 인기 있는 프레임워크 및 벡터 데이터베이스와 연동됩니다. 개발자들의 시작을 돕기 위해 Google은 대화형 Colab 노트북과 경량형 멀티모달 시맨틱 검색 데모를 제공합니다.

다중 모달 임베딩 분야의 경쟁이 치열해지고 있습니다. 특히 올해 2월 말, AI 검색 엔진인 퍼플렉시티(Perplexity)는 오픈소스 임베딩 모델인 pplx-embed-v1과 pplx-embed-context-v1을 공개했습니다.
관련 기사
Core Web Vitals를 수정하여 SEO 순위 향상을 위한 방법
AI 도구를 활용한 성적표 코멘트 작성 간소화서론성적표 코멘트 생성을 위한 AI 도구매직 스쿨(Magic School)알마낙 AI(Almanac AI)챗 GPT(Chat GPT)매직 스쿨을 사용하여 성적표 코멘트 생성하기매직 스쿨 로그인성적표 코멘트 도구 선택학생별 코멘트 맞춤 설정알마낙 AI를 사용하여 성적표 코멘트 생성하기과정 및 평가 체계 설정성적표 분량 및 학생 정보 구성알마낙 AI를 통한 코멘트 생성매직 스쿨과
Slackbot이 AI 에이전트가 됩니다
Salesforce의 기업용 메시징 플랫폼인 Slack에 내장된 자동 비서 Slackbot이 AI 에이전트로 진화하고 있습니다. Salesforce의 CTO인 Parker Harris는 이것이 OpenAI의 ChatGPT에 버금가는 바이럴 현상을 달성할 것으로 전망합니다.클라우드 소프트웨어 거대 기업인 Salesforce는 화요일 업데이트된 Slackbot을 출시했습니다. Business+ 및 Enterprise+ 고객에게 제공되는 이 새로운
ByteDance, Doubao 14.6% 급증에 핵심 AI 인센티브 강화
ByteDance는 최근 DouBao 지주 설명회를 소집하여 DouBao 부서에 종사하는 직원들을 위한 새로운 인센티브 정책을 공개했다. DouBao 주식의 행사가액은 2026년 6월의 14.85달러에서 17.02달러로 인상되었으며, 이는 약 14.6%의 증가를 의미한다.이번 개정은 DouBao 주식의 가치를 높일 뿐만 아니라 그 분배 범위를 크게 확대한다. 개인의 역할에 따라 일부 직원은 총 보상액의 약 5%에 해당하는 DouBao 주식을
관련 특별 주제 추천
의견 (0)
0/500
구글은 최근 새로운 네이티브 다중 모달 임베딩 모델인 ‘제미니 임베딩2( Gemini Embedding2)’를 공개했습니다. 이 모델은 텍스트, 이미지, 동영상, 오디오, PDF 문서를 하나의 공유된 의미 벡터 공간으로 매핑할 수 있으며, 복잡한 AI 데이터 워크플로를 간소화하고 다중 모달 검색 및 이해 능력을 향상시키도록 설계되었습니다. 이는 단일 모달 텍스트에서 통합된 다중 모달 의미 모델링으로의 전환을 의미하는, 구글의 임베딩 기술 분야에서 중요한 진전입니다.

앞서 2025년 7월, 구글은 'gemini-embedding-001' 텍스트 임베딩 모델을 선보인 바 있습니다. 이 모델은 100개 이상의 언어를 지원하며 MTEB 다국어 벤치마크에서 최상위 성적을 기록했습니다. 새로운 Gemini Embedding2는 Gemini 아키텍처를 기반으로 하지만 그 범위를 대폭 확장했습니다. 이제 텍스트, 이미지, 비디오, 오디오, PDF 등 5가지 모달리티를 처리하여 단일 벡터 공간으로 투영합니다. 이를 통해 여러 개의 특수 모델이나 추가 처리 단계 없이도 서로 다른 유형의 미디어 간에 직접적인 의미적 비교가 가능합니다. 이러한 기능은 의미 검색, 검색 강화 생성(RAG), 감정 분석, 데이터 클러스터링과 같은 애플리케이션에 특히 유용합니다.
입력 기능과 관련하여, 새로운 모델은 최대 8192개의 텍스트 토큰을 지원하며, 이는 기존 2048개 토큰 제한의 4배에 달합니다. 또한 요청당 최대 6개의 PNG 또는 JPEG 이미지, 최대 120초 길이의 동영상, 최대 6페이지 분량의 PDF 문서를 처리할 수 있습니다. 주목할 만한 특징은 Gemini Embedding2가 오디오 처리를 기본적으로 지원하여 음성-텍스트 변환이 필요 없고, 전사 과정에서 발생할 수 있는 정보 손실을 방지한다는 점입니다. 또한 Google은 "인터리브드 입력(interleaved input)" 기술을 도입하여, 개발자가 하나의 요청에 여러 모달리티(예: 이미지와 설명 텍스트 혼합)를 결합해 이들 간의 의미적 관계를 더 잘 포착할 수 있도록 했습니다.

아키텍처 측면에서 이 모델은 계속해서 Matryoshka Representation Learning(MRL)을 채택하고 있습니다. 이 기법은 계층적 구조를 사용하여 벡터 차원을 동적으로 조정합니다. 기본 임베딩 차원은 3072이며, 1536 및 768의 선택적 구성이 가능해 개발자가 검색 정확도와 저장 효율성 사이의 균형을 유연하게 맞출 수 있습니다.
구글의 벤치마크 결과에 따르면, Gemini Embedding2는 텍스트, 이미지, 동영상, 음성 작업 전반에 걸쳐 선도적인 성능을 보여줍니다. 예를 들어, 텍스트-동영상 검색에서 68.8점을 기록하여 Amazon Nova2Multimodal Embeddings(60.3점)와 Voyage Multimodal3.5(55.2점)를 앞섰습니다. 텍스트-이미지 비교에서는 93.4점을 기록하여, 아마존 모델의 점수인 84.0점을 크게 앞섰습니다.
현재 개발자들은 Gemini API와 Vertex AI를 통해 Gemini Embedding2를 이용할 수 있습니다. 이 모델은 LangChain, LlamaIndex, Haystack, Weaviate, Qdrant, ChromaDB, Vector Search와 같은 인기 있는 프레임워크 및 벡터 데이터베이스와 연동됩니다. 개발자들의 시작을 돕기 위해 Google은 대화형 Colab 노트북과 경량형 멀티모달 시맨틱 검색 데모를 제공합니다.

다중 모달 임베딩 분야의 경쟁이 치열해지고 있습니다. 특히 올해 2월 말, AI 검색 엔진인 퍼플렉시티(Perplexity)는 오픈소스 임베딩 모델인 pplx-embed-v1과 pplx-embed-context-v1을 공개했습니다.
Core Web Vitals를 수정하여 SEO 순위 향상을 위한 방법
AI 도구를 활용한 성적표 코멘트 작성 간소화서론성적표 코멘트 생성을 위한 AI 도구매직 스쿨(Magic School)알마낙 AI(Almanac AI)챗 GPT(Chat GPT)매직 스쿨을 사용하여 성적표 코멘트 생성하기매직 스쿨 로그인성적표 코멘트 도구 선택학생별 코멘트 맞춤 설정알마낙 AI를 사용하여 성적표 코멘트 생성하기과정 및 평가 체계 설정성적표 분량 및 학생 정보 구성알마낙 AI를 통한 코멘트 생성매직 스쿨과
Slackbot이 AI 에이전트가 됩니다
Salesforce의 기업용 메시징 플랫폼인 Slack에 내장된 자동 비서 Slackbot이 AI 에이전트로 진화하고 있습니다. Salesforce의 CTO인 Parker Harris는 이것이 OpenAI의 ChatGPT에 버금가는 바이럴 현상을 달성할 것으로 전망합니다.클라우드 소프트웨어 거대 기업인 Salesforce는 화요일 업데이트된 Slackbot을 출시했습니다. Business+ 및 Enterprise+ 고객에게 제공되는 이 새로운
ByteDance, Doubao 14.6% 급증에 핵심 AI 인센티브 강화
ByteDance는 최근 DouBao 지주 설명회를 소집하여 DouBao 부서에 종사하는 직원들을 위한 새로운 인센티브 정책을 공개했다. DouBao 주식의 행사가액은 2026년 6월의 14.85달러에서 17.02달러로 인상되었으며, 이는 약 14.6%의 증가를 의미한다.이번 개정은 DouBao 주식의 가치를 높일 뿐만 아니라 그 분배 범위를 크게 확대한다. 개인의 역할에 따라 일부 직원은 총 보상액의 약 5%에 해당하는 DouBao 주식을





집






