구글 딥마인드의 TIPSv2: 이미지를 단순히 훑어보는 것이 아니라 진정으로 이해하는 AI
현재 AI 이미지 이해 기술에는 근본적인 한계가 있습니다.
"이 사진에 무엇이 있나요?"라고 물으면 상세한 답변을 제공할 수 있습니다. 하지만 "팬더의 왼쪽 뒷다리는 어디에 있나요?"라고 물으면 모호한 답변이 돌아옵니다. 이는 특정 모델의 결함이 아니라, 시각-언어 대형 모델 분야 전반에 걸쳐 지속되는 문제입니다. 즉, 전체적인 이해력은 뛰어나지만 세부적인 위치 파악 능력은 취약하다는 점입니다.
구글 딥마인드는 이 난제를 해결하기 위해 특별히 설계된 TIPSv2를 최신 논문에서 소개했습니다.

연구팀은 직관과 반대되는 발견을 했습니다. 세밀한 분할 작업에서 더 작은 학생 모델이 더 큰 교사 모델보다 성능이 뛰어난 경우가 빈번하다는 것입니다. 이는 증류(distillation) 과정이 마스킹 메커니즘을 제거함으로써 모델이 전체 이미지의 모든 세부 사항을 학습하도록 유도하여 일종의 "전체 영역 감독(full-area supervision)"을 생성하기 때문입니다. 이러한 통찰에 힘입어 TIPSv2는 세 가지 주요 개선 사항을 도입했습니다.
첫째, iBOT++입니다. 기존의 사전 훈련은 마스크 처리된 영역에 대해서만 손실(loss)을 계산하므로, 가시 영역은 소홀히 다루어져 국소적 의미론이 흐트러지는 결과를 초래합니다. iBOT++는 모델이 모든 가시 영역에 대해 정밀한 감독을 제공하도록 요구함으로써, 이 작업을 "퍼즐 게임"에서 "전체 텍스트를 꼼꼼히 읽는 것"으로 효과적으로 격상시킵니다. 이 단일 개선 사항만으로도 제로샷(zero-shot) 분할 성능이 14.1% 포인트 향상되었습니다.
둘째, 헤드 전용 EMA입니다. 기존의 자기 지도 학습은 메모리에 거의 동일한 두 개의 대형 모델을 유지해야 하므로 자원이 매우 많이 소모됩니다. TIPSv2는 이미지-텍스트 대조 손실만으로도 백본 네트워크를 안정화시키기에 충분하다는 사실을 발견했습니다. 따라서 EMA는 최종 투영 헤드에만 적용하면 되며, 백본을 중복할 필요가 없습니다. 이로 인해 훈련 매개변수 수가 약 42% 감소하여 성능 저하 없이 훈련 속도가 빨라졌습니다.
셋째, 다중 세분화 텍스트 페어링입니다. 훈련 과정에서 Gemini가 생성한 짧은 웹 설명, 중간 수준의 상세 설명, 긴 설명이 무작위로 혼합되어 모델에 입력되며, 쉬운 과제와 어려운 과제가 번갈아 가며 주어집니다. 이를 통해 모델이 단순한 과제에서 안주하는 것을 방지하는 동시에 세부 사항이 누락되지 않도록 보장합니다.
최종 결과는 매우 인상적입니다. TIPSv2는 9가지 과제와 20개의 권위 있는 데이터셋을 대상으로 동결 평가(frozen evaluation)를 거쳤습니다. 제로샷(zero-shot) 의미 분할은 새로운 업계 벤치마크를 달성했으며, 이미지-텍스트 검색 및 분류는 파라미터가 56% 더 많은 비교 모델들을 능가했습니다. 순수 시각 과제에서도 최상위 성적을 기록했습니다.
TIPSv2의 코드와 모델 가중치는 완전히 오픈소스로 공개되었습니다. 의료 영상, 자율 주행, 산업 검사 및 고정밀 이미지 이해가 요구되는 기타 분야에서 활동하는 팀이라면 이 솔루션을 면밀히 살펴볼 가치가 있습니다.
논문: https://www.alphaxiv.org/abs/2604.12012
관련 기사
법적 분쟁 속에서 Suno의 워터마크 삽입
Suno는 사용자가 AI 생성 음악을 생성할 수 있게 하는 플랫폼으로, 플랫폼에서 생성된 트랙에 레이블을 지정하고 다운로드를 제한하며, 무단 복제를 억제하기 위해 커뮤니티 기준을 업데이트하는 새로운 기능을 공개했습니다. 이러한 업데이트는 Suno가 레이블 및 아티스트 조직으로부터 여러 소송에 직면하는 시점에 이루어집니다.공동 창립자이자 CEO인 Mikey Shulman은 블로그 게시물을 통해 핵심 원칙을 제시하며, 플랫폼이 광범위한 청중을 대
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속
Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
관련 특별 주제 추천
의견 (0)
0/500
현재 AI 이미지 이해 기술에는 근본적인 한계가 있습니다.
"이 사진에 무엇이 있나요?"라고 물으면 상세한 답변을 제공할 수 있습니다. 하지만 "팬더의 왼쪽 뒷다리는 어디에 있나요?"라고 물으면 모호한 답변이 돌아옵니다. 이는 특정 모델의 결함이 아니라, 시각-언어 대형 모델 분야 전반에 걸쳐 지속되는 문제입니다. 즉, 전체적인 이해력은 뛰어나지만 세부적인 위치 파악 능력은 취약하다는 점입니다.
구글 딥마인드는 이 난제를 해결하기 위해 특별히 설계된 TIPSv2를 최신 논문에서 소개했습니다.

연구팀은 직관과 반대되는 발견을 했습니다. 세밀한 분할 작업에서 더 작은 학생 모델이 더 큰 교사 모델보다 성능이 뛰어난 경우가 빈번하다는 것입니다. 이는 증류(distillation) 과정이 마스킹 메커니즘을 제거함으로써 모델이 전체 이미지의 모든 세부 사항을 학습하도록 유도하여 일종의 "전체 영역 감독(full-area supervision)"을 생성하기 때문입니다. 이러한 통찰에 힘입어 TIPSv2는 세 가지 주요 개선 사항을 도입했습니다.
첫째, iBOT++입니다. 기존의 사전 훈련은 마스크 처리된 영역에 대해서만 손실(loss)을 계산하므로, 가시 영역은 소홀히 다루어져 국소적 의미론이 흐트러지는 결과를 초래합니다. iBOT++는 모델이 모든 가시 영역에 대해 정밀한 감독을 제공하도록 요구함으로써, 이 작업을 "퍼즐 게임"에서 "전체 텍스트를 꼼꼼히 읽는 것"으로 효과적으로 격상시킵니다. 이 단일 개선 사항만으로도 제로샷(zero-shot) 분할 성능이 14.1% 포인트 향상되었습니다.
둘째, 헤드 전용 EMA입니다. 기존의 자기 지도 학습은 메모리에 거의 동일한 두 개의 대형 모델을 유지해야 하므로 자원이 매우 많이 소모됩니다. TIPSv2는 이미지-텍스트 대조 손실만으로도 백본 네트워크를 안정화시키기에 충분하다는 사실을 발견했습니다. 따라서 EMA는 최종 투영 헤드에만 적용하면 되며, 백본을 중복할 필요가 없습니다. 이로 인해 훈련 매개변수 수가 약 42% 감소하여 성능 저하 없이 훈련 속도가 빨라졌습니다.
셋째, 다중 세분화 텍스트 페어링입니다. 훈련 과정에서 Gemini가 생성한 짧은 웹 설명, 중간 수준의 상세 설명, 긴 설명이 무작위로 혼합되어 모델에 입력되며, 쉬운 과제와 어려운 과제가 번갈아 가며 주어집니다. 이를 통해 모델이 단순한 과제에서 안주하는 것을 방지하는 동시에 세부 사항이 누락되지 않도록 보장합니다.
최종 결과는 매우 인상적입니다. TIPSv2는 9가지 과제와 20개의 권위 있는 데이터셋을 대상으로 동결 평가(frozen evaluation)를 거쳤습니다. 제로샷(zero-shot) 의미 분할은 새로운 업계 벤치마크를 달성했으며, 이미지-텍스트 검색 및 분류는 파라미터가 56% 더 많은 비교 모델들을 능가했습니다. 순수 시각 과제에서도 최상위 성적을 기록했습니다.
TIPSv2의 코드와 모델 가중치는 완전히 오픈소스로 공개되었습니다. 의료 영상, 자율 주행, 산업 검사 및 고정밀 이미지 이해가 요구되는 기타 분야에서 활동하는 팀이라면 이 솔루션을 면밀히 살펴볼 가치가 있습니다.
논문: https://www.alphaxiv.org/abs/2604.12012
법적 분쟁 속에서 Suno의 워터마크 삽입
Suno는 사용자가 AI 생성 음악을 생성할 수 있게 하는 플랫폼으로, 플랫폼에서 생성된 트랙에 레이블을 지정하고 다운로드를 제한하며, 무단 복제를 억제하기 위해 커뮤니티 기준을 업데이트하는 새로운 기능을 공개했습니다. 이러한 업데이트는 Suno가 레이블 및 아티스트 조직으로부터 여러 소송에 직면하는 시점에 이루어집니다.공동 창립자이자 CEO인 Mikey Shulman은 블로그 게시물을 통해 핵심 원칙을 제시하며, 플랫폼이 광범위한 청중을 대
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속
Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금





집






