마이크로소프트, 경량 다중 모달 AI 모델 ‘Phi-4-Vision’을 오픈소스로 공개
마이크로소프트는 최신 다중 모달 추론 모델인 ‘Phi-4-reasoning-vision-15B’를 공식적으로 오픈소스로 공개했습니다. 150억 개의 파라미터를 갖춘 이 모델은 높은 성능과 낮은 비용 사이에서 이상적인 균형을 이룹니다. 가벼운 아키텍처 덕분에 리소스가 제한된 환경에서 복잡한 시각적 작업을 처리하는 데 매력적인 새로운 대안이 될 것입니다.
정제된 데이터로 구동되는 "소형 고성능 모델"
수조 개의 토큰으로 훈련된 일반적인 업계 모델과 달리, Phi-4-reasoning-vision은 단 2,000억 개의 멀티모달 토큰만을 사용하여 개발되었습니다. 연구팀은 오픈소스 데이터의 철저한 정제, 목적에 맞춘 합성 데이터 생성, 그리고 계산적 추론을 강화하기 위해 수학 관련 콘텐츠를 늘리는 등 도메인별 데이터 비율을 신중하게 조정함으로써 데이터 품질을 최우선으로 삼았습니다. 이러한 접근 방식은 과학적 추론 및 화면 내 요소 위치 파악 작업에서 뛰어난 성능을 발휘합니다.

혁신적인 하이브리드 추론 전략
이 모델의 핵심 혁신은 "하이브리드 추론 경로" 설계입니다:
지각 과제: 이미지 캡션 생성이나 OCR과 같은 단순한 과제의 경우, 모델은 기본적으로 직접 답변 모드로 전환되어 속도와 낮은 지연 시간을 최적화합니다.
추론 과제: 수학 공식이나 과학 차트 해석과 같은 복잡한 논리를 처리해야 할 때는, 답변의 정확성을 보장하기 위해 구조화된 사고 연쇄(CoT) 프로세스를 자동으로 가동합니다.
사용자는 특정 트리거 문구를 사용하여 이 두 모드 사이를 수동으로 전환할 수 있어, 다양한 애플리케이션 요구 사항에 맞춰 모델의 동작을 조정할 수 있습니다.
SigLIP-2 동적 해상도 인코더를 통합함으로써, 이 모델은 고해상도 스크린샷 내의 미세한 세부 사항을 인식하는 데 탁월합니다. 이러한 기능 덕분에 이 모델은 디지털 인터페이스의 버튼, 입력란 및 기타 요소를 정확하게 식별하고 상호작용할 수 있는 컴퓨터 사용 에이전트(CUA) 개발을 위한 이상적인 기반이 됩니다.
Phi-4-reasoning-vision-15B는 현재 주요 오픈소스 플랫폼에서 사용할 수 있습니다. 마이크로소프트는 이 소형 모델이 다중 모달 분야에서 "더 작고 빠르다"는 것이 곧 "더 뛰어난 성능"을 의미할 수 있음을 입증함으로써, 공간 지능 및 실시간 상호작용 기술의 보급을 촉진할 것으로 기대하고 있습니다.
관련 기사
리눅스 재단에 6대 기술 거대기업이 1250만 달러를 지원해 AI 취약성 소음 문제 해결에 나서다
AI 자동화 도구가 생성한 저품질 보안 보고서의 홍수를 처리하기 위해, 앤트로픽(Anthropic), 아마존(AWS), 깃허브(GitHub), 구글(Google), 마이크로소프트(Microsoft), 오픈AI(OpenAI) 등 6대 주요 기술 기업은 리눅스 재단(Linux Foundation) 이니셔티브에 총 1,250만 달러의 자금을 공동으로 기부했습니다. 이 투자는 오픈 소스 소프트웨어(FOSS) 유지 관리자가 수동 선별의 부담에서 벗어나
[[IMG_BASE64_PLACEHOLDER]] 머스크, 오픈AI를 자녀들에게 넘길 가능성 고려… 알트만 증언
오늘 아침, 오픈에이아이(OpenAI)의 샘 알트만(Sam Altman) 최고경영자(CEO)는 회사의 기업 구조에 이의를 제기한 전 공동 창업자 일론 머스크(Elon Musk)의 소송에 대응하기 위해 증언대에 섰습니다.머스크가 비영리 자선단체를 사적 이익을 추구하는 자회사로 전환하여 AI 기반 제품을 마케팅한 다른 창업자들이 “자선단체를 훔쳤다”고 주장한 것과 관련해 질문을 받자, 알트만은 뚜렷한 망설임으로 응답했습니다.“그런 프레임으로 받
관련 특별 주제 추천
의견 (1)
0/500
마이크로소프트는 최신 다중 모달 추론 모델인 ‘Phi-4-reasoning-vision-15B’를 공식적으로 오픈소스로 공개했습니다. 150억 개의 파라미터를 갖춘 이 모델은 높은 성능과 낮은 비용 사이에서 이상적인 균형을 이룹니다. 가벼운 아키텍처 덕분에 리소스가 제한된 환경에서 복잡한 시각적 작업을 처리하는 데 매력적인 새로운 대안이 될 것입니다.
정제된 데이터로 구동되는 "소형 고성능 모델"
수조 개의 토큰으로 훈련된 일반적인 업계 모델과 달리, Phi-4-reasoning-vision은 단 2,000억 개의 멀티모달 토큰만을 사용하여 개발되었습니다. 연구팀은 오픈소스 데이터의 철저한 정제, 목적에 맞춘 합성 데이터 생성, 그리고 계산적 추론을 강화하기 위해 수학 관련 콘텐츠를 늘리는 등 도메인별 데이터 비율을 신중하게 조정함으로써 데이터 품질을 최우선으로 삼았습니다. 이러한 접근 방식은 과학적 추론 및 화면 내 요소 위치 파악 작업에서 뛰어난 성능을 발휘합니다.

혁신적인 하이브리드 추론 전략
이 모델의 핵심 혁신은 "하이브리드 추론 경로" 설계입니다:
지각 과제: 이미지 캡션 생성이나 OCR과 같은 단순한 과제의 경우, 모델은 기본적으로 직접 답변 모드로 전환되어 속도와 낮은 지연 시간을 최적화합니다.
추론 과제: 수학 공식이나 과학 차트 해석과 같은 복잡한 논리를 처리해야 할 때는, 답변의 정확성을 보장하기 위해 구조화된 사고 연쇄(CoT) 프로세스를 자동으로 가동합니다.
사용자는 특정 트리거 문구를 사용하여 이 두 모드 사이를 수동으로 전환할 수 있어, 다양한 애플리케이션 요구 사항에 맞춰 모델의 동작을 조정할 수 있습니다.
SigLIP-2 동적 해상도 인코더를 통합함으로써, 이 모델은 고해상도 스크린샷 내의 미세한 세부 사항을 인식하는 데 탁월합니다. 이러한 기능 덕분에 이 모델은 디지털 인터페이스의 버튼, 입력란 및 기타 요소를 정확하게 식별하고 상호작용할 수 있는 컴퓨터 사용 에이전트(CUA) 개발을 위한 이상적인 기반이 됩니다.
Phi-4-reasoning-vision-15B는 현재 주요 오픈소스 플랫폼에서 사용할 수 있습니다. 마이크로소프트는 이 소형 모델이 다중 모달 분야에서 "더 작고 빠르다"는 것이 곧 "더 뛰어난 성능"을 의미할 수 있음을 입증함으로써, 공간 지능 및 실시간 상호작용 기술의 보급을 촉진할 것으로 기대하고 있습니다.
리눅스 재단에 6대 기술 거대기업이 1250만 달러를 지원해 AI 취약성 소음 문제 해결에 나서다
AI 자동화 도구가 생성한 저품질 보안 보고서의 홍수를 처리하기 위해, 앤트로픽(Anthropic), 아마존(AWS), 깃허브(GitHub), 구글(Google), 마이크로소프트(Microsoft), 오픈AI(OpenAI) 등 6대 주요 기술 기업은 리눅스 재단(Linux Foundation) 이니셔티브에 총 1,250만 달러의 자금을 공동으로 기부했습니다. 이 투자는 오픈 소스 소프트웨어(FOSS) 유지 관리자가 수동 선별의 부담에서 벗어나
[[IMG_BASE64_PLACEHOLDER]] 머스크, 오픈AI를 자녀들에게 넘길 가능성 고려… 알트만 증언
오늘 아침, 오픈에이아이(OpenAI)의 샘 알트만(Sam Altman) 최고경영자(CEO)는 회사의 기업 구조에 이의를 제기한 전 공동 창업자 일론 머스크(Elon Musk)의 소송에 대응하기 위해 증언대에 섰습니다.머스크가 비영리 자선단체를 사적 이익을 추구하는 자회사로 전환하여 AI 기반 제품을 마케팅한 다른 창업자들이 “자선단체를 훔쳤다”고 주장한 것과 관련해 질문을 받자, 알트만은 뚜렷한 망설임으로 응답했습니다.“그런 프레임으로 받





집







