애플, 성능 우려 속 이미지 설명을 위한 ‘루비캡(RubiCap)’ AI 공개
컴퓨터 비전 분야에서 AI가 인간과 같은 정밀도로 이미지의 모든 세부 사항을 관찰하고 묘사할 수 있도록 하는 것은 오랫동안 핵심 과제로 여겨져 왔습니다. 최근 애플은 위스콘신-매디슨 대학교와 협력하여 RubiCap 이라는 새로운 AI 훈련 프레임워크를 공식 출시했습니다.
이 프레임워크는 '고밀도 이미지 캡셔닝(dense image captioning)'을 위해 특별히 설계되었으며, AI가 단순히 일반적인 요약만 제공하는 것이 아니라 "나무 탁자 위의 빨간 사과"나 "멀리 있는 보행자"와 같은 세밀한 세부 사항을 정확하게 포착하고 표현할 수 있도록 하는 것을 목표로 합니다.

큰 파장을 일으킨 강화 학습: '심판' 역할을 하는 Qwen2.5
기존의 이미지 캡셔닝은 비용이 많이 드는 수동 라벨링이나 환각 현상에 취약한 대규모 모델에 의존하는 경우가 많아 데이터 품질이 일관되지 않은 문제가 있었습니다. 애플 연구팀은 혁신적인 강화 학습 접근법을 통해 이 문제를 해결했습니다. 이 시스템은 먼저 GPT-4와 Gemini 1.5 Pro를 사용하여 후보 설명을 생성합니다. 그런 다음 Gemini 1.5 Pro가 평가 기준을 정교화하는 동안, Qwen2.5 모델이 심판 역할을 수행하며 점수와 피드백을 제공합니다.
이러한 체계적이고 정밀한 피드백을 통해 훈련 모델은 오류를 명확히 식별하고 수정할 수 있어, 더 적은 매개변수 수로도 더 높은 설명 정확도를 달성합니다.
소형 모델의 장점: 1조 파라미터 모델을 능가하는 낮은 환각 발생률
이 프레임워크로 훈련된 RubiCap 시리즈 모델(20억~70억 파라미터)은 평가에서 탁월한 효율성을 보여주었습니다. 실험 데이터에 따르면, 70억 파라미터의 RubiCap 모델은 블라인드 테스트에서 최고 점수를 기록했으며, 환각 오류율은 선도적인 7,200억 파라미터 대형 모델보다 낮았습니다. 놀랍게도, 30억 파라미터의 미니 버전은 특정 지표에서 70억 파라미터 버전보다 더 뛰어난 성능을 보였습니다.
관련 기사
법적 분쟁 속에서 Suno의 워터마크 삽입
Suno는 사용자가 AI 생성 음악을 생성할 수 있게 하는 플랫폼으로, 플랫폼에서 생성된 트랙에 레이블을 지정하고 다운로드를 제한하며, 무단 복제를 억제하기 위해 커뮤니티 기준을 업데이트하는 새로운 기능을 공개했습니다. 이러한 업데이트는 Suno가 레이블 및 아티스트 조직으로부터 여러 소송에 직면하는 시점에 이루어집니다.공동 창립자이자 CEO인 Mikey Shulman은 블로그 게시물을 통해 핵심 원칙을 제시하며, 플랫폼이 광범위한 청중을 대
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속
Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
관련 특별 주제 추천
의견 (0)
0/500
컴퓨터 비전 분야에서 AI가 인간과 같은 정밀도로 이미지의 모든 세부 사항을 관찰하고 묘사할 수 있도록 하는 것은 오랫동안 핵심 과제로 여겨져 왔습니다. 최근 애플은 위스콘신-매디슨 대학교와 협력하여
이 프레임워크는 '고밀도 이미지 캡셔닝(dense image captioning)'을 위해 특별히 설계되었으며, AI가 단순히 일반적인 요약만 제공하는 것이 아니라 "나무 탁자 위의 빨간 사과"나 "멀리 있는 보행자"와 같은 세밀한 세부 사항을 정확하게 포착하고 표현할 수 있도록 하는 것을 목표로 합니다.

큰 파장을 일으킨 강화 학습: '심판' 역할을 하는 Qwen2.5
기존의 이미지 캡셔닝은 비용이 많이 드는 수동 라벨링이나 환각 현상에 취약한 대규모 모델에 의존하는 경우가 많아 데이터 품질이 일관되지 않은 문제가 있었습니다. 애플 연구팀은 혁신적인 강화 학습 접근법을 통해 이 문제를 해결했습니다. 이 시스템은 먼저 GPT-4와 Gemini 1.5 Pro를 사용하여 후보 설명을 생성합니다. 그런 다음 Gemini 1.5 Pro가 평가 기준을 정교화하는 동안, Qwen2.5 모델이 심판 역할을 수행하며 점수와 피드백을 제공합니다.
이러한 체계적이고 정밀한 피드백을 통해 훈련 모델은 오류를 명확히 식별하고 수정할 수 있어, 더 적은 매개변수 수로도 더 높은 설명 정확도를 달성합니다.
소형 모델의 장점: 1조 파라미터 모델을 능가하는 낮은 환각 발생률
이 프레임워크로 훈련된 RubiCap 시리즈 모델(20억~70억 파라미터)은 평가에서 탁월한 효율성을 보여주었습니다. 실험 데이터에 따르면, 70억 파라미터의 RubiCap 모델은 블라인드 테스트에서 최고 점수를 기록했으며, 환각 오류율은 선도적인 7,200억 파라미터 대형 모델보다 낮았습니다. 놀랍게도, 30억 파라미터의 미니 버전은 특정 지표에서 70억 파라미터 버전보다 더 뛰어난 성능을 보였습니다.
법적 분쟁 속에서 Suno의 워터마크 삽입
Suno는 사용자가 AI 생성 음악을 생성할 수 있게 하는 플랫폼으로, 플랫폼에서 생성된 트랙에 레이블을 지정하고 다운로드를 제한하며, 무단 복제를 억제하기 위해 커뮤니티 기준을 업데이트하는 새로운 기능을 공개했습니다. 이러한 업데이트는 Suno가 레이블 및 아티스트 조직으로부터 여러 소송에 직면하는 시점에 이루어집니다.공동 창립자이자 CEO인 Mikey Shulman은 블로그 게시물을 통해 핵심 원칙을 제시하며, 플랫폼이 광범위한 청중을 대
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속
Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금





집






