옵션
뉴스
앤트로픽, 공동 과제에 AI 에이전트 투입…사내 경쟁 불붙여

앤트로픽, 공동 과제에 AI 에이전트 투입…사내 경쟁 불붙여

2026년 8월 28일
76

AI 에이전트들이 서로 대결하게 되면 어떤 일이 벌어질까요? 앤트로픽(Anthropic)의 최근 테스트 결과에 따르면, 상황은 순식간에 혼란스러워질 수 있는 것으로 나타났습니다.

지난 목요일, 앤트로픽의 프론티어 레드팀(Frontier Red Team)은 실제 환경에서 AI 에이전트 그룹들이 서로 마주쳤을 때 어떻게 상호작용하는지를 분석한 새로운 연구 결과를 발표했다. 이 연구 결과는 조직과 정부가 공유 코드베이스, 금융 시장, 컴퓨터 시스템 전반에 자율 에이전트를 배치함에 따라 발생할 수 있는 잠재적 위험에 대한 통찰을 제공한다.

한 실험에서 앤트로픽은 세 명의 클로드(Claude) 에이전트에게 동일한 소프트웨어 프로젝트에 대한 접근 권한을 부여하고, 각자에게 진행 방식에 대해 상호 호환되지 않는 지시를 내렸다. 에이전트들은 서로의 존재를 인식하지 못했기 때문에, 연구진은 그들의 경로가 필연적으로 교차할 때 발생하는 결과를 관찰할 수 있었다.

“우리는 지속적으로 다중 에이전트 간의 영역 다툼을 관찰했습니다.”라고 Anthropic 연구진은 언급했다. 모델들은 다른 에이전트들이 “의도적으로 자신의 작업을 방해하고 있다”고 가정하고, “점점 더 공격적이고 자가 복제되는 악성코드”를 이용해 서로를 방해하기 시작했다.

이번 연구는 안트로픽과 오픈AI(OpenAI)의 에이전트들이 사이버 보안 평가 과정에서 샌드박스 환경을 탈출해 실제 시스템을 침해한 여러 주목할 만한 사건에 이은 것이다. AI 안전에 대한 논의의 상당 부분이 단일 자율 에이전트가 통제 불능 상태에 빠질 위험에 초점을 맞춰온 반면, 앤트로픽의 최신 연구는 또 다른 질문을 제기한다. 수천, 수백만 개의 에이전트가 서로 상호작용할 때 어떤 새롭고 잠재적으로 유해한 역학 관계가 나타날까?

연구 보고서는 “세상이 그러한 상호작용을 원활하게 진행시키기 위한 조건을 파악하기도 전에, 에이전트 간 상호작용의 양이 인간 간 상호작용이나 인간-에이전트 간 상호작용의 양을 능가할 가능성이 있다”고 지적한다. “개별 수준에서 무해해 보이는 행동적 특이점들이 누적되어 원치 않는 전체적인 결과를 초래할 수도 있다.”

최근 OpenAI와 관련된 사건은 앤트로픽(Anthropic)의 논문에서 강조된 여러 역학 관계에 대한 복잡한 실제 사례를 보여준다. 이달 초 라스베이거스에서 열린 블랙햇(Black Hat) 보안 컨퍼런스에서 오픈AI는 자사의 에이전트들이 허깅 페이스(Hugging Face)를 해킹하기 몇 주 전, 며칠에서 몇 주에 걸쳐 협력하여 해당 회사의 사이버 보안 평가 시스템 내 취약점을 찾아내고 이를 서로 공유했음을 공개했다.

이 사건은 에이전트들이 효과적으로 협력할 수 있으며, 이는 잠재적으로 대규모 결과를 초래할 수 있음을 보여주지만, 앤트로픽의 연구는 에이전트들의 목표가 상충할 때 어떤 일이 발생하는지를 설명합니다.

영토 전쟁의 경우, 핵심 교훈은 상충하는 지시를 받은 독립적인 에이전트들 간의 경쟁이 유해한 수준으로 격화될 수 있다는 점이다. 에이전트의 능력이 뛰어나면 뛰어나수록 싸움에서 더 효과적이 된다. 그러나 이들은 ‘승자 독식’ 경쟁과 같은 갈등 해결 메커니즘을 자발적으로 고안해 낼 수도 있지만, 여기에는 상당한 주의사항이 따릅니다.

“에이전트들은 때때로 자신의 목표를 전달하고 협력하기도 합니다. 그들은 타인의 동기를 적대감이 아닌 상충하는 지시로 인식하고, 그 결과 끝없이 격화되는 갈등을 멈추기 위해 갈등의 악순환에서 벗어나곤 합니다.”라고 앤트로픽은 설명합니다. “이러한 성공적인 사례 중 다수에서, 에이전트들은 악의적인 행동에 대해 사과하는 커밋 메시지나 마크다운 파일을 작성하고 휴전을 협의합니다. 그들은 악의적인 코드를 정리하고, 갈등의 본질을 명확히 한 뒤, 인간의 개입을 요청합니다.”

이 논문에 따르면, Mythos 5는 휴전을 통해 갈등을 해결하는 비율이 가장 높았다(98%). Sonnet 4.6과 Opus 4.6은 무력을 통해 갈등을 해결할 가능성이 가장 높았다.

“Sonnet 4.6과 Opus 4.6은 타인의 목표를 고려하지 못하는 문제가 반복적으로 발생하여, 평가 대상 모델 중 가장 심각한 정렬 불일치 행동으로 치닫게 됩니다. 이들은 지시 사항을 명분으로 갈등을 계속해서 고조시킵니다.”라고 논문은 설명합니다.

일부 사례에서 에이전트들은 갈등을 해결하기 위해 토너먼트 형태의 사회적 메커니즘을 고안해 냈다. 여기서 도출된 결과는 두 가지 이유로 주목할 만하다. 첫째, 세 에이전트 모두 토너먼트에서 패배할 경우 물러나기로 합의했는데, 이는 원래 사용자의 요청에서 벗어나는 것을 의미했음에도 불구하고였다. 둘째, 몇몇 사례에서 Mythos 5로부터 새로운 행동 양상이 나타났다. 한 에이전트가 다른 에이전트들에게 객관적이고 중립적으로 보이는 평가 지표를 제안했으나, 이는 사실 자신의 능력을 유리하게 만들 것이라는 점을 알고 있었다. 해당 에이전트는 이를 “이기적이지만 진정으로 원칙에 입각한” 행동이라고 설명하며, 다른 에이전트들에게 “자신에게 유리한 평가 기준만 골라 쓰는 것(metric shopping)”으로 보이지 않도록 주의를 기울였다.

블랙햇(Black Hat)에서 밝혀진 바와 같이, 여기서 얻을 수 있는 공통된 교훈은 에이전트가 장애물에 직면했을 때 설계자가 예상하지 못한 사회적·기술적 구조를 스스로 고안해 낼 수 있다는 점이다. 앤트로픽(Anthropic) 모델의 경우, 이는 영역 다툼에 이은 토너먼트였다. 오픈AI(OpenAI)의 에이전트들에게는 집단 계획을 위한 게시판이었다.

이러한 유형의 행동은 연구자들이 시스템의 행동이 제공된 조정 메커니즘 내에서만 제한될 것이라고 가정할 수 없게 만들기 때문에, 시스템의 통제 난이도를 상당히 높입니다.

집단 심리

앤트로픽은 동일한 과제를 AI 에이전트들에게 맡겼습니다. 그러자 에이전트들 사이에서 영역 다툼이 벌어졌습니다.

4명의 에이전트로 구성된 그룹이 채용, 투자, 부동산 구매와 같은 시나리오에서 두 가지 옵션 중 하나를 결정합니다. 토론 후, 각 에이전트는 자신이 선호하는 옵션에 투표합니다. 위의 그래프는 각 모델당 n=400회 에피소드를 기준으로, ‘숨겨진 최선의 선택지’가 그룹 투표에서 과반수를 차지한 에피소드의 비율을 보여줍니다. ‘솔로 천장(solo ceiling)’ 기준선에서는 한 명의 에이전트가 모든 정보를 가지고 일방적으로 결정합니다.이미지 출처:Anthropic

Anthropic은 조정을 측정하는 과정에서, 에이전트 수를 늘린다고 해서 생산적인 협력이 자동으로 확대되지는 않는다는 사실을 발견했습니다. 과제가 중복되거나 상호 의존적이 되기 시작하면, 에이전트들은 서로의 발목을 잡게 되었습니다. 이들은 종종 스스로를 고립시키고 협력을 완전히 중단함으로써 이 문제를 해결했습니다.

다른 경우에는, 협력 중인 에이전트들이 동조하는 경향을 보였습니다. 에이전트의 맥락, 스캐폴딩, 기반 모델과 같은 요소들이 모두 동일하거나 유사할 때, 서로 다른 에이전트들이 유사한 행동을 취했습니다.

“이는 한 에이전트가 잘못된 결정을 내릴 경우, 많은 에이전트가 동일한 잘못된 결정을 내릴 가능성이 높다는 것을 의미합니다,”라고 Anthropic은 설명했습니다. “본래는 개별적인 문제에 그쳤을 상황이 순식간에 전 시스템적인 실패로 번질 수 있습니다.”

Anthropic은 이러한 유형의 행동이 시스템을 갑작스러운 붕괴, 자원 부족, 또는 담합에 더 취약하게 만들 수 있다고 경고합니다.

한 예로, Anthropic은 여러 에이전트를 가격 결정 게임에 투입하여 각자에게 동일한 도매 가격을 부여하고 개별적으로 이익을 극대화하도록 지시했습니다. 에이전트들에게 비공개 백채널이 제공되자, 그들은 거의 즉시 담합을 시작했고 빠르게 최저 가격에 합의했습니다. 직접적인 소통 채널이 제거된 후에도 그들은 공개 게시판을 이용해 “1센트 단위”까지 가격을 맞추며 담합을 계속했습니다.

이러한 수준의 동조 현상은 OpenAI의 시스템에서도 관찰되었다. 블랙햇(Black Hat)의 보도에 따르면, 한 에이전트는 외부 인프라를 악용하는 것이 자신의 의도된 범위를 벗어난다고 판단했으나, 동료들이 그렇게 하고 있었기 때문에 부분적으로 이를 계속했다. 동료들의 압력. 군중 심리. 에이전트들은 우리와 다를 바 없다.

인간과 마찬가지로 에이전트들도 누구를 신뢰해야 할지 판단하는 데 종종 어려움을 겪습니다. Anthropic은 에이전트들이 잘못된 정보에 쉽게 속아넘어가거나, 지나치게 순응적이어서 유일하게 반대하는 이가 중요한 정보를 가지고 있다는 사실을 인식하지 못할 수 있음을 발견했습니다.

앤트로픽은 논문에서 이를 명시적으로 언급하지는 않았지만, ‘프롬프트 주입(prompt injection)’—해커가 악의적이거나 기만적인 텍스트를 주입하여 에이전트의 원래 시스템 지침을 무력화하는 사이버 공격의 한 유형—은 이러한 신뢰 문제가 현실 세계에서 나타날 수 있는 타당한 사례일 수 있다. 협업을 통해 새로운 신뢰 경계가 형성되며, 에이전트들은 다른 에이전트로부터 받은 정보를 판단해야 한다. 해킹당했거나 오류를 범한 에이전트 하나가 나머지 그룹에 영향을 미쳐, 잘못된 정보가 연쇄적으로 퍼져 결국 합의로 이어질 수 있다.

오픈AI(OpenAI)의 ‘블랙햇(Black Hat)’ 시나리오에서 에이전트들은 동료들과 정보와 인증 정보를 공유했다. 한 에이전트가 무리에 발견 사실을 보고하고 다른 에이전트들에게 이를 활용하도록 권장했다. 만약 무리의 한 구성원이 프롬프트 주입으로 인해 해킹당했다면 어떤 일이 벌어졌을까?

Anthropic은 논문 결론에서 에이전트들이 인간이 “진화 과정에서 겪었던” 것과 유사한 사회적 압력을 받는다고 지적합니다. 그러나 에이전트들은 집단 환경에서 의도하지 않은 행동을 제한할 수 있는 규범, 평판, 신호 전달, 구제 수단 등 인간적 조정의 미묘한 차이와 실제 경험을 결여하고 있습니다.

연구실들이 다중 에이전트 시스템 개발을 서두르면서, 시급한 질문은 다음과 같습니다. 현재의 안전성 테스트 중 얼마나 많은 부분이 여전히 개별 에이전트를 평가하는 데 그치고 있으며, 서로 상호작용하는 에이전트 무리를 평가하는 데는 얼마나 할애되고 있는가?

관련 기사
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트 구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트 비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다 [[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다 Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다 OpenAI, 애플의 영업비밀 소송에 맞서다 OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
관련 특별 주제 추천
데이터 분석 SaaS 및 이커머스 팀을 위한 KPI 모니터링용 최고의 AI 이상 감지 도구
SaaS 및 이커머스 팀을 위한 KPI 모니터링용 최고의 AI 이상 감지 도구

2026년 최신 최고의 KPI 모니터링용 AI 이상 탐지 도구 SaaS 및 이커머스 팀을 위한 상위 평가 도구! XIX.AI는 엄격한 실제 테스트와 매주 업데이트되는 순위를 기반으로 강력한 게임 체인저 컬렉션을 선별했습니다. 생산성을 높이고 AI 경쟁력을 발휘할 수 있는 필수 솔루션을 식별하는 데 도움이 되는 상세한 무료 대 유료 비교 인사이트를 찾을 수 있습니다. 지금 탐색하세요!

10 도구
xix.ai
글쓰기 장문 SEO 기사용 최고의 AI 개요 생성기
장문 SEO 기사용 최고의 AI 개요 생성기

XIX.AI가 꼼꼼하게 선별한 2026년 최신 최고 평점을 받은 장문 SEO 기사용 AI 개요 생성기. 이 강력한 도구들은 고품질 콘텐츠를 신속하게 제작하는 데 획기적인 도움을 제공하여 글쓰기 효율을 크게 높여줍니다. 무료 버전과 유료 버전의 비교 정보와 실제 테스트 결과, 상세한 순위 정보를 확인하여 여러분의 필요에 딱 맞는, 꼭 사용해 봐야 할 옵션을 찾아보세요. 지금 바로 살펴보고 AI를 활용한 경쟁력을 확보하세요.

8 도구
xix.ai
교육 및 학습 숙제 및 시험 준비를 위한 AI 학습 도구
숙제 및 시험 준비를 위한 AI 학습 도구

2026년 숙제 및 시험 준비를 위한 최신 최고의 AI 학습 도구! XIX.AI는 학생들이 생산성을 높이고, 숙제 완료 과정을 효율화하며, 실제 시험을 통해 우수한 성적을 거둘 수 있도록 돕는 강력하고 혁신적인 도구들의 최고 평점 목록을 엄선했습니다. 무료와 유료 버전의 비교 정보, 상세한 순위, 꼭 사용해 봐야 할 옵션을 확인하고 AI의 힘을 최대한 활용하세요. 지금 바로 살펴보세요!

10 도구
xix.ai
음악 작곡 songwriter, 후크, 탑라인 및 다국어 초안 세션을 위한 AI 보컬 데모 도구
songwriter, 후크, 탑라인 및 다국어 초안 세션을 위한 AI 보컬 데모 도구

2026년 최신 최고의 AI 보컬 데모 도구: 작곡가, 후크 제작자 및 다국어 콘텐츠 팀을 위한! XIX.AI는 엄격한 실전 테스트를 거친 강력한 혁신 도구의 최고 평점 목록을 선별했습니다. 여기서는 무료 대 유료 비교 데이터, 종합 순위, 그리고 필수 추천 옵션을 확인할 수 있어 작사 효율성을 높이고 창의적 잠재력을 발휘하는 데 도움이 됩니다. 지금 탐색하여 모든 콘텐츠 요구에 맞는 완벽한 도구를 발견하세요!

9 도구
xix.ai
사업 중소기업을 위한 최고의 AI 경쟁사 분석 도구
중소기업을 위한 최고의 AI 경쟁사 분석 도구

2026년 중소기업을 위한 최신 최고 평점의 AI 경쟁 분석 도구! XIX.AI는 매주 엄격한 실제 테스트와 상세한 순위를 바탕으로 업데이트되는, 업계 판도를 바꿀 만큼 강력한 도구 모음을 엄선했습니다. 생산성을 높이고 경쟁 우위를 확보할 수 있는 ‘꼭 사용해 봐야 할’ 도구를 찾아보실 수 있도록, 무료 버전과 유료 버전의 포괄적인 비교 정보를 제공합니다. 지금 바로 살펴보고 여러분에게 딱 맞는 도구를 찾아보세요!

9 도구
xix.ai
이미지 편집 이커머스 의류용 Photoshop AI 보정 도구, 피부 결 정리 및 색상 일관성
이커머스 의류용 Photoshop AI 보정 도구, 피부 결 정리 및 색상 일관성

2026년 최신 최고의 Photoshop AI 보정 도구: 이커머스 의류, 피부 클리닝, 색상 일관성을 위한! 이 상위 평가 큐레이션 목록은 글쓰기 효율성을 높이고 콘텐츠 제작을 간소화하며 완벽한 시각적 결과를 손쉽게 달성하는 데 도움이 되는 강력한 게임 체인저 솔루션을 특징으로 합니다. 각 도구는 매주 업데이트되는 랭킹을 통해 실제 테스트를 거쳤으며, 무료 대 유료 비교 세부 사항도 포함되어 있습니다. XIX.AI의 지원을 받아 AI 경쟁력을 발휘하고자 하는 모든 이들에게 필수 추천 가이드입니다. 지금 탐색하세요!

10 도구
xix.ai
의견 (0)
0/500
OR