ChatGPT와 같은 비전 모델은 이미지에서 누락된 요소를 자주 생성합니다. 새로운 접근 방식은 캡션에서 모델 자체의 과장된 버전을 생성한 다음 수정하라는 메시지를 표시하여 이러한 오류를 줄입니다. 이 기술은 재교육이나 추가 데이터가 필요하지 않으므로 다양한 모델과 아키텍처에 광범위하게 적용할 수 있습니다.
중국에서 발표된 새로운 연구는 AI가 생성한 이미지와 동영상에서 사용자의 요청과 명백히 모순되는 디테일이 나타나는 고질적인 문제를 해결합니다.
프로세스는 전통적인 방식으로 시작됩니다. 모델이 이미지를 설명합니다. 그런 다음 이 캡션을 텍스트 이미지 모델에 입력하여 새로운 이미지를생성하는데, 이 재구성에서 추가되는 물체나 특징은 모델의 초기 환각을 직접적으로 드러냅니다. 시스템은 원본 이미지와 생성된 이미지를 비교하여 향후 시도에서 이러한 실수를 반복하지 않도록 모델을 안내합니다.
이 다이어그램은 새로운 기술이 캡션 착시를 감지하고 최소화하는 방법을 보여줍니다. 표준 모델은 이미지 설명에 새를 잘못 추가하고, 재구성된 버전은 새를 시각적으로 삽입합니다(빨간색으로 강조 표시). 새로운 방법은 설명의 정확성을 유지하면서 이러한 조작을 방지합니다. 출처: https://arxiv.org/pdf/2509.21997
이 방법은 모델이 실제 이미지를 설명하도록 하는 것으로 시작하며, 때로는 실제로 존재하지 않는 물체나 세부 사항을 포함하기도 합니다. 이렇게 부정확한 캡션은 오류를 강조하는 합성 이미지를 생성합니다. 시스템은 실제 이미지와 합성 이미지를 비교하여 오류를 유발하는 내부 패턴을 식별합니다.
이러한 오류 패턴이 인식되면 나중에 사용할 수 있도록 저장됩니다. 새로운 이미지를 캡쳐할 때 시스템은 모델의 내부 신호를 조정하여 알려진 환각 유발 요인에서 벗어나도록 유도합니다. 이 보정은 테스트 중에 추가 데이터, 재교육 또는 이미지 생성 없이 한 번의 패스로 이루어집니다.
얽힘의 도전 과제
이 논문의 예에서 '얽힘'은 새가 없는 이미지에 새가 추가된 이유를 설명할 수 있습니다.
얽힘은 특정 개념이 학습 데이터에 자주 함께 나타나기 때문에 모델이 특정 개념을 강력하게 연결할 때 발생합니다. 여기서는 모델이 새가 있는 비행기를 자주 접하여 캡션에 잘못된 영향을 미치는 연관성을 만들었을 수 있습니다.
학습을 일찍 종료하면 얽힘을 줄일 수 있지만(모델 유연성 증가), 개념의 세부 사항과 해상도가 떨어집니다. 개발자는 유연하고 얽힘이 없는 모델을 우선시할 것인가, 아니면 연관 환각이 발생하기 쉬운 생성형 모델을 우선시할 것인가 하는 지속적인 트레이드오프에 직면하게 됩니다.
이상적으로는 소스 이미지 캡션이 존재하는 모든 객체를 항목화하여 모델에서 별도의 분리된 항목으로 저장할 수 있도록 하는 것이 좋습니다. 그러나 강력한 생성 모델을 훈련할 때 흔히 사용되는 SEO 기반의 캡션 작성 관행과 대규모 웹 스크래핑은 종종 이 표준에 미치지 못합니다.
약한 캡션은 안정적 확산과 같은 학습 모델을 위한 LAION 이미지의 가치를 떨어뜨립니다. 라벨은 종종 얕고 모호하거나 설명보다는 SEO에 초점을 맞춘 경우가 많아 얼굴 특징과 같은 세부적인 시각적 개념을 학습하는 모델의 능력을 방해합니다. (원본 출처는 https://rom1504.github.io/, 현재는 사라짐).
근본적인 해결책은 현실적으로 불가능하기 때문에 LLM과 VLM에서 환각을 줄이기 위한 해결 방법이 중요한 연구 과제가 되었습니다. 다양한 아키텍처와 조건에서 테스트된 중국의 새로운 방법은 "환각 오염"을 억제할 수 있는 가능성을 보여줍니다.
저자들은 다음과 같이 말합니다:
'여러 벤치마크에 걸친 광범위한 실험 결과, 우리의 방법은 대상, 속성 및 관계 수준에서 환각을 크게 줄이면서도 리콜과 캡션 [풍부함]은 대부분 보존하는 것으로 나타났습니다.'
이 논문은 중국과학기술대학과 난징대학의 연구진이 작성한 ' 환각을 억제하기 위한 노출: 생성 앵커를 사용한 VLM의 표현 편집'이라는 제목의 논문입니다.
방법의 작동 원리
연구진은 캡션 환각을 노출하고 억제하기 위한 엔드투엔드 파이프라인을 개발했습니다:
전체 파이프라인 그림. 시각 언어 모델은 입력 이미지에서 잠재적으로 환각을 포함한 캡션을 생성합니다. 이 캡션은 텍스트-이미지 모델을 통해 재구성된 이미지를 생성하는 데 사용되어 오류를 표시합니다. 두 이미지의 임베딩은 내부 조정을 안내하여 모델이 캡션 품질을 잃지 않고 발명된 세부 사항을 줄이는 데 도움을 줍니다.
비전 언어 모델은 먼저 실제 이미지에 캡션을 생성하여 객체나 관계를 생성할 수 있습니다. 그런 다음 이 캡션은 재구성된 이미지를 생성하여 시각적 불일치로 조작된 부분을 드러냅니다. 두 이미지를 비교하면 미묘한 텍스트 오류가 측정 가능하고 수정 가능한 신호로 바뀝니다.
발명을 막기 위해 시스템은 원본 이미지(신뢰할 수 있는 참조)와 재구성된 이미지(오류를 강조 표시)를 비교합니다. 각각은 컴팩트한 임베딩으로 변환됩니다. 원본과 더 가깝게 일치하도록 내부 표현을 조정하고 재구성된 이미지와 차이가 나면 모델은 완전한 자기 감독 방식으로 자체 수정합니다.
논문은 이렇게 설명합니다:
'MLLM의 환각은 언어적으로 잘 형성되어 있고 텍스트 수준의 충실한 설명과 구별할 수 없는 경우가 많기 때문에 본질적으로 감지하기가 어렵습니다. 이러한 불일치는 언어적 타당성이 아니라 시각적 증거와의 불일치에서 비롯되는데, 일반적으로 모델 자체는 이러한 불일치에 민감하지 않습니다.
'이 문제를 해결하기 위해 우리는 암시적 불일치를 명시적이고 관찰 가능한 신호로 변환하기 위해 생성적 재구성을 활용하는 환각 노출 메커니즘을 도입했습니다.'
이 시스템은 FLUX.1-dev 텍스트-이미지 변환 모델을 사용하여 캡션에서 이미지를 재구성하여 잘못된 세부 사항을 과장합니다. 이렇게 증폭된 오류는 모델이 실수를 인식하고 수정하는 데 도움이 됩니다.
연구자들은 이 접근 방식을 검증하기 위해 캡션에 환각을 주입하고 재구성된 이미지를 생성한 다음 LLaVA로 다시 캡션을 작성했습니다. 그리고 원본 캡션과 환각 캡션 간의 의미적 유사성을 측정했습니다:
환각 증폭 메커니즘은 미묘한 오류를 시각화합니다. 각 점은 이미지-캡션 쌍에 대한 캡션 유사성을 보여줍니다. 주황색 선(직접 비교)은 높은 유사도를 유지하여 실수를 가리고, 파란색 선(재구성 후)은 급격히 감소하여 숨겨진 환각을 감지 가능한 의미적 마커로 드러냅니다.
재구성 후 유사성이 크게 감소하여 이 방법이 미묘한 오류를 노출하는 능력을 보여줬습니다.
데이터 및 테스트
세 가지 벤치마크를 사용하여 효과를 검증했습니다: 이미지 관련성을 통한 캡션 환각 평가 (CHAIR), 다중 언어 모델 링 평가 (MME), 풀링 기반 객체 프로빙 평가 (POPE).
CHAIR 릴리스 문서에서: 이미지에 존재하지 않는 노트북, 싱크대 또는 서핑보드와 같은 요소를 생성하는 캡션 시스템 TopDown 및 NBT에서 생성된 환각 객체의 예시. 출처: https://arxiv.org/pdf/1809.02156
환각률이나 회상률과 같은 표준 지표는 오해의 소지가 있을 수 있으며, 모델은 모호한 캡션을 생성하여 오류를 피할 수 있습니다. 정확성과 완전성의 균형을 맞추기 위해 두 요소에 가중치를 조정하여 캡션에 점수를 매기는 통합 지표인 환각률과 회상률(HAR@β)을 사용했습니다.
POPE는 맥락에 민감한 사물 환각을 평가했고, MME는 속성 수준의 환각을 예/아니요 작업으로 평가했습니다.
테스트는 Microsoft COCO, A-OKVQA, GQA를 포함한 데이터 세트에서 Flux 모델과 LLaVA-v1.5-7B를 사용했습니다. 잠재 편집은 모든 테스트에서 일관된 하이퍼파라미터와 온도로 모델의 두 번째 레이어를 대상으로 했습니다.
초기 CHAIR 결과는 아래와 같습니다*:
여러 메트릭으로 평가한 환각 완화를 위한 CHAIR 벤치마크의 성능.
저자는 다음과 같이 말합니다:
'[우리의 방법은 CHAIRS와CHAIRI[*] 모두에서 다른 기준선보다 일관되게 우수한 성능을 보여 환각을 억제하는 데 탁월한 효과가 있음을 입증했습니다. 한편, 거의 모든 방법이 환각을 억제하는 동안 필연적으로 회상률을 감소시키지만, 충실도와 정보성 사이의 균형을 반영하여 우리의 접근 방식은 가장 작은 감소를 달성합니다.
'이는 우리의 방법이 광범위한 범위의 실사 객체를 포착한다는 것을 보여줍니다. HAR@β 메트릭에서 우리 방법은 가장 높은 점수를 획득하여 커버리지를 유지하면서 환각을 줄일 수 있는 능력을 강조했습니다.
강력한 결과는 원본 이미지의 깨끗한 의미를 강화하는 동시에 재구성의 잘못된 신호를 억제하는 이중 감독에 기인합니다. 이 시스템은 환각과 관련된 방향만 타겟팅하여 디테일을 잃지 않고 오류를 수정합니다.
다양한 구성과 데이터 세트에 대한 POPE 벤치마크의 성능 비교.
논문은 POPE 결과에 대해 다음과 같이 설명합니다:
'우리의 방법은 모든 설정에서 일관되게 최고의 성능을 달성하는 것을 관찰할 수 있습니다. 특히, 우리의 방법은 평균적으로 최대 +5.95%의 정확도와 +6.85%의 F1 점수를 달성할 수 있어 다른 훈련 없는 접근법을 큰 차이로 능가합니다.
'따라서 이러한 결과는 우리의 방법이 다양한 난이도 수준에서 안정적이고 일반화 가능한 솔루션을 제공한다는 것을 보여줍니다.
MME에 대한 세 번째 테스트 라운드의 성능 비교.
마지막 메인 테스트는 MME에서 진행되었으며, 결과는 위와 같습니다. 그러나 논문은 본문이나 부록에서 'OPERA'라는 방법을 정의하지 않고 언급하고 있습니다. 저자들은 강력한 MME 성능을 주장하지만, 방법에 대한 자세한 설명이 없기 때문에 이 결과를 해석할 때 주의가 필요합니다.
리눅스 재단에 6대 기술 거대기업이 1250만 달러를 지원해 AI 취약성 소음 문제 해결에 나서다AI 자동화 도구가 생성한 저품질 보안 보고서의 홍수를 처리하기 위해, 앤트로픽(Anthropic), 아마존(AWS), 깃허브(GitHub), 구글(Google), 마이크로소프트(Microsoft), 오픈AI(OpenAI) 등 6대 주요 기술 기업은 리눅스 재단(Linux Foundation) 이니셔티브에 총 1,250만 달러의 자금을 공동으로 기부했습니다. 이 투자는 오픈 소스 소프트웨어(FOSS) 유지 관리자가 수동 선별의 부담에서 벗어나
[[IMG_BASE64_PLACEHOLDER]] 머스크, 오픈AI를 자녀들에게 넘길 가능성 고려… 알트만 증언오늘 아침, 오픈에이아이(OpenAI)의 샘 알트만(Sam Altman) 최고경영자(CEO)는 회사의 기업 구조에 이의를 제기한 전 공동 창업자 일론 머스크(Elon Musk)의 소송에 대응하기 위해 증언대에 섰습니다.머스크가 비영리 자선단체를 사적 이익을 추구하는 자회사로 전환하여 AI 기반 제품을 마케팅한 다른 창업자들이 “자선단체를 훔쳤다”고 주장한 것과 관련해 질문을 받자, 알트만은 뚜렷한 망설임으로 응답했습니다.“그런 프레임으로 받
2026년 최신 최고의 AI 보컬 데모 도구: 작곡가, 후크 제작자 및 다국어 콘텐츠 팀을 위한! XIX.AI는 엄격한 실전 테스트를 거친 강력한 혁신 도구의 최고 평점 목록을 선별했습니다. 여기서는 무료 대 유료 비교 데이터, 종합 순위, 그리고 필수 추천 옵션을 확인할 수 있어 작사 효율성을 높이고 창의적 잠재력을 발휘하는 데 도움이 됩니다. 지금 탐색하여 모든 콘텐츠 요구에 맞는 완벽한 도구를 발견하세요!
2026년 중소기업을 위한 최신 최고 평점의 AI 경쟁 분석 도구! XIX.AI는 매주 엄격한 실제 테스트와 상세한 순위를 바탕으로 업데이트되는, 업계 판도를 바꿀 만큼 강력한 도구 모음을 엄선했습니다. 생산성을 높이고 경쟁 우위를 확보할 수 있는 ‘꼭 사용해 봐야 할’ 도구를 찾아보실 수 있도록, 무료 버전과 유료 버전의 포괄적인 비교 정보를 제공합니다. 지금 바로 살펴보고 여러분에게 딱 맞는 도구를 찾아보세요!
2026년 최신 최고의 Photoshop AI 보정 도구: 이커머스 의류, 피부 클리닝, 색상 일관성을 위한! 이 상위 평가 큐레이션 목록은 글쓰기 효율성을 높이고 콘텐츠 제작을 간소화하며 완벽한 시각적 결과를 손쉽게 달성하는 데 도움이 되는 강력한 게임 체인저 솔루션을 특징으로 합니다. 각 도구는 매주 업데이트되는 랭킹을 통해 실제 테스트를 거쳤으며, 무료 대 유료 비교 세부 사항도 포함되어 있습니다. XIX.AI의 지원을 받아 AI 경쟁력을 발휘하고자 하는 모든 이들에게 필수 추천 가이드입니다. 지금 탐색하세요!
2026년 최신 최고 평점을 받은 AI 프롬프트 라이브러리로, 모든 유형의 ChatGPT 워크플로우를 최적화하세요. XIX.AI는 최고의 성능을 보장하기 위해 엄격한 실전 테스트를 거친, 강력하고 획기적인 컬렉션을 엄선했습니다. 생산성을 높이고 AI의 잠재력을 최대한 발휘할 수 있는 필수 도구를 선택하는 데 도움이 되는 무료 vs 유료 상세 비교 정보와 전문가 순위를 확인해 보세요. 지금 바로 살펴보세요!
2026년 최신 최고의 AI 퀴즈 빌더 플랫폼: 교사, 튜터 및 코호트 기반 학습 프로그램을 위한! XIX.AI는 실제 테스트를 거쳐 정확한 순위를 제공하는 강력한 게임 체인저 도구들의 최고 평점 목록을 선별했습니다. 이 필수 플랫폼은 모든 학습 시나리오에서 글쓰기 효율성을 높이고, 콘텐츠 제작을 간소화하며, 퀴즈 설계를 단순화하는 데 도움을 줍니다. 지금 탐색하여 교육에서 AI의 이점을 최대한 활용할 수 있는 완벽한 도구를 발견하세요!
GitHub 팀을 위한 2026년 최신 최고의 AI 풀 리퀘스트 검토 도구가 XIX.AI에 소개되었습니다! 이 엄선된 최고 평점 목록은 모든 팀 워크플로우 전반에 걸쳐 리팩토링, 버그 수정, 보안 취약점 탐지를 효율화해 주는 획기적인 솔루션을 선보입니다. 무료와 유료 버전의 비교 분석은 물론, 실제 테스트 결과와 상세한 순위 정보를 통해 생산성을 획기적으로 높여줄 완벽한 도구를 찾아보세요. 지금 바로 살펴보고 AI의 힘을 경험해 보세요!
웹사이트를 방문하면 브라우저에 정보를 저장하거나 불러올 수 있으며, 대부분은 쿠키의 형태입니다. 이 정보는 사용자, 환경설정 또는 기기에 관한 것일 수 있으며, 사이트가 기대한 대로 작동하도록 하는 데 주로 사용됩니다. 이 정보가 직접적으로 사용자를 식별하지는 않지만, 더 개인화된 웹 환경을 제공할 수 있습니다. 당사는 사용자의 개인정보 보호 권리를 존중하기 때문에 일부 유형의 쿠키를 허용하지 않을 수 있습니다. 각 카테고리 제목을 클릭하면 자세히 알아보고 기본 설정을 변경할 수 있습니다. 그러나 일부 유형의 쿠키를 차단하면 사이트 이용 경험 및 제공 가능한 서비스에 영향을 줄 수 있습니다. 개인정보 취급방침성명
환경설정 관리
필수 쿠키
항상 활성화
이 쿠키는 웹사이트가 정상적으로 기능하는 데 필요하며, 우리 시스템에서 끌 수 없습니다. 이러한 쿠키는 일반적으로 개인정보 설정, 로그인 또는 양식 작성과 같은 서비스 요청에 해당하는 사용자 행동에 응답하여만 설정됩니다. 브라우저를 설정하여 이러한 쿠키를 차단하거나 경고할 수 있지만, 그 경우 사이트의 일부 기능이 작동하지 않을 수 있습니다. 이러한 쿠키는 개인 식별 정보를 저장하지 않습니다.