MiniCPM-V 4.6의 1.3B 모델 치수 축소 전략, 엣지 멀티모달 기술의 새로운 기준을 제시하다
5월 11일, Mingshi Intelligence는 칭화대학교 및 OpenBMB 오픈소스 커뮤니티와 협력하여 새로운 엣지 측 다중 모달 대규모 모델인 MiniCPM-V4.6을 공개했습니다. 단 13억 개의 파라미터로 구성된 컴팩트한 규모임에도 불구하고, 이 경량 모델은 탁월한 지능 밀도와 크로스 플랫폼 적응성을 통해 대규모 모델의 한계를 뛰어넘으며, 엣지 측 AI의 실제 현장 배포를 가속화합니다.

1. 최고 성능: 13억 개의 파라미터가 탁월한 결과를 선사
MiniCPM-V4.6은 ‘Instruct’와 ‘Thinking’ 두 가지 버전으로 제공되며, 두 버전 모두 유사한 규모의 모델과 비교했을 때 다양한 벤치마크에서 인상적인 추론 및 이해 능력을 보여줍니다.
글로벌 리더십: 인공 분석(AA) 리더보드에서 MiniCPM-V4.6은 13점이라는 인상적인 점수를 기록하며, 비슷한 규모의 경쟁 모델(예: 알리바바의 Qwen3.5-0.8B, 구글의 Gemma4-E2B-it)을 훨씬 능가하는 동시에 Qwen3.5-2B와 같은 더 큰 모델의 성능에 근접했습니다. 이는 1B 매개변수 모델에 대한 새로운 기준을 제시합니다.
고급 기능: 일반적인 이미지-텍스트 이해와 복잡한 STEM 수학 추론부터 까다로운 문서 OCR 및 동영상 시간적 이해에 이르기까지, 이 모델은 뛰어난 지능을 보여줍니다. 특히 ‘Thinking’ 버전은 다중 이미지 추론과 환각 억제에서 탁월한 성능을 발휘합니다.
2. 효율성의 획기적 발전: 엣지 환경에서의 극한의 지능 밀도
엣지 배포 시 발생하는 메모리 제약을 해결하기 위해, MiniCPM-V4.6은 추론 속도와 자원 효율성을 위해 심도 있게 최적화되었습니다.
낮은 메모리 사용량: 메모리 요구량이 6GB로 줄어들어 일반 스마트폰, PC 및 스마트 홈 기기에서 원활하게 작동합니다.
추론 효율성: vLLM을 기반으로 하여 추론 처리량이 경쟁 모델 대비 1.5배 높습니다. 엣지에서 3136² 초고해상도 이미지를 처리할 때 첫 응답 지연 시간은 단 75.7ms로, 경쟁 모델보다 2.2배 빠릅니다.
처리량: 단일 GPU로 초당 7,013 토큰의 텍스트 생성이 가능하며, 초당 54.79장의 속도로 1,344² 크기의 이미지를 처리할 수 있어 뛰어난 효율성을 입증합니다.
3. 핵심 기술: LLaVA-UHD v4, 오버헤드 최소화
이 모델의 경량화된 설계는 Mingshi Intelligence와 칭화대학교가 공동 개발한 LLaVA-UHD v4 덕분에 가능해졌습니다.
인코딩 재설계: 개선된 ViT 이미지 인코딩 및 얕은 압축 모듈을 통해 이미지 인코딩 오버헤드를 50%, 고해상도 부동소수점 연산을 55.8% 줄였습니다 .
하이브리드 압축: 성능 우선 모드와 속도 우선 모드 간 유연한 전환을 가능하게 하는 4×/16× 하이브리드 토큰 압축을 도입했습니다. 이 기술은 방대한 트래픽을 처리하는 Kuaishou의 추천 모델 OneRec에서 그 효과가 검증되었습니다.
4. 생태계 적용: 연구실에서 산업 현장으로
MiniCPM-V4.6의 오픈소스 공개는 기술적 측면과 생태계 측면 모두에서 중요한 이정표가 됩니다.
간편한 개발: ms-swift 및 LLaMA-Factory와 같은 미세 조정 프레임워크와 원활하게 통합되어, 단일 RTX 4090 GPU에서 본격적인 미세 조정이 가능합니다.
크로스 플랫폼 지원: vLLM, Ollama 및 기타 주요 프레임워크와 호환되며, iOS, Android, HarmonyOS용 테스트 버전을 제공하여 더 광범위한 하드웨어에 AI를 적용할 수 있게 합니다.
실생활에 미치는 영향: 이 모델 시리즈는 이미 자동차, PC, 스마트 홈, 산업용 검사 분야에 배포되어 있으며, 레노버, 지리, SAIC 폭스바겐, 샤오미, OPPO 등이 파트너로 참여하고 있습니다.
관련 기사
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
관련 특별 주제 추천
의견 (0)
0/500
5월 11일, Mingshi Intelligence는 칭화대학교 및 OpenBMB 오픈소스 커뮤니티와 협력하여 새로운 엣지 측 다중 모달 대규모 모델인 MiniCPM-V4.6을 공개했습니다. 단 13억 개의 파라미터로 구성된 컴팩트한 규모임에도 불구하고, 이 경량 모델은 탁월한 지능 밀도와 크로스 플랫폼 적응성을 통해 대규모 모델의 한계를 뛰어넘으며, 엣지 측 AI의 실제 현장 배포를 가속화합니다.

1. 최고 성능: 13억 개의 파라미터가 탁월한 결과를 선사
MiniCPM-V4.6은 ‘Instruct’와 ‘Thinking’ 두 가지 버전으로 제공되며, 두 버전 모두 유사한 규모의 모델과 비교했을 때 다양한 벤치마크에서 인상적인 추론 및 이해 능력을 보여줍니다.
글로벌 리더십: 인공 분석(AA) 리더보드에서 MiniCPM-V4.6은 13점이라는 인상적인 점수를 기록하며, 비슷한 규모의 경쟁 모델(예: 알리바바의 Qwen3.5-0.8B, 구글의 Gemma4-E2B-it)을 훨씬 능가하는 동시에 Qwen3.5-2B와 같은 더 큰 모델의 성능에 근접했습니다. 이는 1B 매개변수 모델에 대한 새로운 기준을 제시합니다.
고급 기능: 일반적인 이미지-텍스트 이해와 복잡한 STEM 수학 추론부터 까다로운 문서 OCR 및 동영상 시간적 이해에 이르기까지, 이 모델은 뛰어난 지능을 보여줍니다. 특히 ‘Thinking’ 버전은 다중 이미지 추론과 환각 억제에서 탁월한 성능을 발휘합니다.
2. 효율성의 획기적 발전: 엣지 환경에서의 극한의 지능 밀도
엣지 배포 시 발생하는 메모리 제약을 해결하기 위해, MiniCPM-V4.6은 추론 속도와 자원 효율성을 위해 심도 있게 최적화되었습니다.
낮은 메모리 사용량: 메모리 요구량이 6GB로 줄어들어 일반 스마트폰, PC 및 스마트 홈 기기에서 원활하게 작동합니다.
추론 효율성: vLLM을 기반으로 하여 추론 처리량이 경쟁 모델 대비 1.5배 높습니다. 엣지에서 3136² 초고해상도 이미지를 처리할 때 첫 응답 지연 시간은 단 75.7ms로, 경쟁 모델보다 2.2배 빠릅니다.
처리량: 단일 GPU로 초당 7,013 토큰의 텍스트 생성이 가능하며, 초당 54.79장의 속도로 1,344² 크기의 이미지를 처리할 수 있어 뛰어난 효율성을 입증합니다.
3. 핵심 기술: LLaVA-UHD v4, 오버헤드 최소화
이 모델의 경량화된 설계는 Mingshi Intelligence와 칭화대학교가 공동 개발한 LLaVA-UHD v4 덕분에 가능해졌습니다.
인코딩 재설계: 개선된 ViT 이미지 인코딩 및 얕은 압축 모듈을 통해 이미지 인코딩 오버헤드를 50%, 고해상도 부동소수점 연산을 55.8% 줄였습니다 .
하이브리드 압축: 성능 우선 모드와 속도 우선 모드 간 유연한 전환을 가능하게 하는 4×/16× 하이브리드 토큰 압축을 도입했습니다. 이 기술은 방대한 트래픽을 처리하는 Kuaishou의 추천 모델 OneRec에서 그 효과가 검증되었습니다.
4. 생태계 적용: 연구실에서 산업 현장으로
MiniCPM-V4.6의 오픈소스 공개는 기술적 측면과 생태계 측면 모두에서 중요한 이정표가 됩니다.
간편한 개발: ms-swift 및 LLaMA-Factory와 같은 미세 조정 프레임워크와 원활하게 통합되어, 단일 RTX 4090 GPU에서 본격적인 미세 조정이 가능합니다.
크로스 플랫폼 지원: vLLM, Ollama 및 기타 주요 프레임워크와 호환되며, iOS, Android, HarmonyOS용 테스트 버전을 제공하여 더 광범위한 하드웨어에 AI를 적용할 수 있게 합니다.
실생활에 미치는 영향: 이 모델 시리즈는 이미 자동차, PC, 스마트 홈, 산업용 검사 분야에 배포되어 있으며, 레노버, 지리, SAIC 폭스바겐, 샤오미, OPPO 등이 파트너로 참여하고 있습니다.
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib





집






