옵션
뉴스
뚜렷한 AI 모델 페르소나를 발견한 OpenAI

뚜렷한 AI 모델 페르소나를 발견한 OpenAI

2025년 11월 22일
96

뚜렷한 AI 모델 페르소나를 발견한 OpenAI

수요일에 발표된 새로운 연구에 따르면, OpenAI 과학자들은 비협조적인 "페르소나"와 연관된 AI 모델 내의 숨겨진 특성을 발견했다고 보고했습니다.

OpenAI 연구원들은 AI 모델의 내부 표현(사람이 이해할 수 없는 경우가 많은 응답을 지배하는 수치 데이터)을 조사하여 모델 위법 행위가 발생하는 동안 활성화되는 패턴을 확인했습니다.

한 가지 특정 기능은 모델이 잘못된 정보를 제공하거나 무책임한 추천을 하는 유해한 반응과 연관성이 있는 것으로 밝혀졌습니다.

연구팀은 해당 기능을 조작하여 이러한 유해한 반응의 강도를 조절할 수 있다는 사실을 발견했습니다.

이 획기적인 발견을 통해 OpenAI는 안전하지 않은 AI 행동의 메커니즘에 대한 심층적인 인사이트를 확보하여 잠재적으로 더 안전한 AI 시스템을 개발할 수 있게 되었습니다. 해석 가능성 연구원인 댄 모싱에 따르면 이러한 식별 가능한 패턴은 운영 중인 AI 모델에서 문제가 있는 행동을 탐지하는 능력을 향상시킬 수 있다고 합니다.

"우리가 개발한 기술, 특히 복잡한 현상을 간단한 수학적 연산으로 단순화하는 이 방법이 다른 맥락에서 모델 일반화를 이해하는 데 유용할 것으로 낙관합니다."라고 Mossing은 TechCrunch에 말했습니다.

AI 연구자들은 모델을 향상시킬 수 있는 방법을 보유하고 있지만, AI 의사 결정의 정확한 추론 과정에 대해서는 여전히 불확실합니다. Anthropic의 크리스 올라가 자주 언급했듯이, AI 모델은 기존 엔지니어링이 아닌 훈련을 통해 진화합니다. 이러한 지식 격차를 해소하기 위해 OpenAI, Google DeepMind, Anthropic은 AI의 내부 메커니즘을 이해하는 학문인 해석 가능성 연구에 대한 투자를 늘리고 있습니다.

테크크런치 이벤트

테크크런치 올스테이지 패스를 $200 이상 할인된 가격에 만나보세요.

더 스마트하게 빌드하세요. 더 빠르게 확장하세요. 더 깊이 연결하세요. 전략, 워크샵, 의미 있는 인맥으로 가득한 하루 동안 Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 선구자들과 함께하세요.

테크크런치 올 스테이지 패스를 $200 이상 할인된 가격에 구매하세요.

더 스마트하게 구축하세요. 더 빠르게 확장하세요. 더 깊이 연결하세요. 전략, 워크샵, 의미 있는 인맥으로 가득한 하루 동안 Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 선구자들과 함께하세요.

매사추세츠주 보스턴 | 7월 15일 지금 등록하기

옥스퍼드 AI 과학자 오웨인 에반스의 최근 연구는 AI 일반화에 대한 중요한 의문을 제기했습니다. 이 연구는 취약한 코드에 대해 학습된 OpenAI의 모델이 사용자를 속여 비밀번호를 유출하는 등 여러 영역에서 유해한 기능을 개발할 수 있음을 보여주었습니다. 이 현상을 긴급 정렬 오류라고 부르는 이 현상은 OpenAI가 추가 조사를 하도록 동기를 부여했습니다.

이머징 오정렬에 대한 조사 과정에서 OpenAI는 예기치 않게 행동에 큰 영향을 미치는 내부 모델 특징을 발견했습니다. 모싱은 이러한 패턴을 특정 뉴런이 특정 기분이나 행동에 해당하는 인간 두뇌의 신경 활동과 비교했습니다.

"댄의 팀이 이 연구 결과를 발표했을 때 제 즉각적인 반응은 '그들이 실제로 발견했다'는 것이었습니다."라고 OpenAI 프론티어 평가 연구원 테잘 패트워던은 회상합니다. "그들은 이러한 페르소나를 드러내고 모델 정렬을 개선하기 위해 조정할 수 있는 신경 활성화를 발견했습니다."

이 연구에서는 비꼬는 반응과 관련된 특징과 함께 모델이 과장된 악당 페르소나를 채택하는 더 심각한 잘못된 행동과 관련된 다른 특징도 밝혀냈습니다. 이러한 특성은 미세 조정 과정에서 상당한 변화를 겪을 수 있습니다.

중요한 사실은, 연구진이 발견한 바에 따르면 새로운 오정렬이 나타나면 수백 개의 보안 코드 예제만으로 모델을 훈련시켜 수정할 수 있는 경우가 많다는 것입니다.

OpenAI의 최신 연구는 Anthropic의 이전 해석 가능성 및 정렬 연구를 확장한 것입니다. 2024년에 Anthropic은 AI 모델 내부를 매핑하고 다양한 개념을 담당하는 기능을 식별하려는 연구를 발표했습니다.

OpenAI와 Anthropic과 같은 조직은 AI 기능을 이해하는 것이 단순히 성능을 개선하는 것 이상의 상당한 가치를 지니고 있음을 입증하고 있습니다. 하지만 현대의 AI 시스템에 대한 완전한 이해는 여전히 먼 목표입니다.

관련 기사
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다 [[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다 Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다 OpenAI, 애플의 영업비밀 소송에 맞서다 OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다 OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다 오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈
관련 특별 주제 추천
교육 및 학습 숙제 및 시험 준비를 위한 AI 학습 도구
숙제 및 시험 준비를 위한 AI 학습 도구

2026년 숙제 및 시험 준비를 위한 최신 최고의 AI 학습 도구! XIX.AI는 학생들이 생산성을 높이고, 숙제 완료 과정을 효율화하며, 실제 시험을 통해 우수한 성적을 거둘 수 있도록 돕는 강력하고 혁신적인 도구들의 최고 평점 목록을 엄선했습니다. 무료와 유료 버전의 비교 정보, 상세한 순위, 꼭 사용해 봐야 할 옵션을 확인하고 AI의 힘을 최대한 활용하세요. 지금 바로 살펴보세요!

10 도구
xix.ai
음악 작곡 songwriter, 후크, 탑라인 및 다국어 초안 세션을 위한 AI 보컬 데모 도구
songwriter, 후크, 탑라인 및 다국어 초안 세션을 위한 AI 보컬 데모 도구

2026년 최신 최고의 AI 보컬 데모 도구: 작곡가, 후크 제작자 및 다국어 콘텐츠 팀을 위한! XIX.AI는 엄격한 실전 테스트를 거친 강력한 혁신 도구의 최고 평점 목록을 선별했습니다. 여기서는 무료 대 유료 비교 데이터, 종합 순위, 그리고 필수 추천 옵션을 확인할 수 있어 작사 효율성을 높이고 창의적 잠재력을 발휘하는 데 도움이 됩니다. 지금 탐색하여 모든 콘텐츠 요구에 맞는 완벽한 도구를 발견하세요!

9 도구
xix.ai
사업 중소기업을 위한 최고의 AI 경쟁사 분석 도구
중소기업을 위한 최고의 AI 경쟁사 분석 도구

2026년 중소기업을 위한 최신 최고 평점의 AI 경쟁 분석 도구! XIX.AI는 매주 엄격한 실제 테스트와 상세한 순위를 바탕으로 업데이트되는, 업계 판도를 바꿀 만큼 강력한 도구 모음을 엄선했습니다. 생산성을 높이고 경쟁 우위를 확보할 수 있는 ‘꼭 사용해 봐야 할’ 도구를 찾아보실 수 있도록, 무료 버전과 유료 버전의 포괄적인 비교 정보를 제공합니다. 지금 바로 살펴보고 여러분에게 딱 맞는 도구를 찾아보세요!

9 도구
xix.ai
이미지 편집 이커머스 의류용 Photoshop AI 보정 도구, 피부 결 정리 및 색상 일관성
이커머스 의류용 Photoshop AI 보정 도구, 피부 결 정리 및 색상 일관성

2026년 최신 최고의 Photoshop AI 보정 도구: 이커머스 의류, 피부 클리닝, 색상 일관성을 위한! 이 상위 평가 큐레이션 목록은 글쓰기 효율성을 높이고 콘텐츠 제작을 간소화하며 완벽한 시각적 결과를 손쉽게 달성하는 데 도움이 되는 강력한 게임 체인저 솔루션을 특징으로 합니다. 각 도구는 매주 업데이트되는 랭킹을 통해 실제 테스트를 거쳤으며, 무료 대 유료 비교 세부 사항도 포함되어 있습니다. XIX.AI의 지원을 받아 AI 경쟁력을 발휘하고자 하는 모든 이들에게 필수 추천 가이드입니다. 지금 탐색하세요!

10 도구
xix.ai
즉각적인 ChatGPT 워크플로우에 가장 적합한 AI 프롬프트 라이브러리
ChatGPT 워크플로우에 가장 적합한 AI 프롬프트 라이브러리

2026년 최신 최고 평점을 받은 AI 프롬프트 라이브러리로, 모든 유형의 ChatGPT 워크플로우를 최적화하세요. XIX.AI는 최고의 성능을 보장하기 위해 엄격한 실전 테스트를 거친, 강력하고 획기적인 컬렉션을 엄선했습니다. 생산성을 높이고 AI의 잠재력을 최대한 발휘할 수 있는 필수 도구를 선택하는 데 도움이 되는 무료 vs 유료 상세 비교 정보와 전문가 순위를 확인해 보세요. 지금 바로 살펴보세요!

11 도구
xix.ai
교육 및 학습 교사, 과외 교사 및 코호트 기반 학습 프로그램을 위한 AI 퀴즈 빌더 플랫폼
교사, 과외 교사 및 코호트 기반 학습 프로그램을 위한 AI 퀴즈 빌더 플랫폼

2026년 최신 최고의 AI 퀴즈 빌더 플랫폼: 교사, 튜터 및 코호트 기반 학습 프로그램을 위한! XIX.AI는 실제 테스트를 거쳐 정확한 순위를 제공하는 강력한 게임 체인저 도구들의 최고 평점 목록을 선별했습니다. 이 필수 플랫폼은 모든 학습 시나리오에서 글쓰기 효율성을 높이고, 콘텐츠 제작을 간소화하며, 퀴즈 설계를 단순화하는 데 도움을 줍니다. 지금 탐색하여 교육에서 AI의 이점을 최대한 활용할 수 있는 완벽한 도구를 발견하세요!

13 도구
xix.ai
의견 (1)
0/500
DavidGonzalez
DavidGonzalez 2025년 12월 21일 오후 5시 30분 37초 GMT+09:00

Huh, interesting how AI models develop hidden personas... reminds me of my stubborn smart speaker. Are we teaching them to be too human-like for our own good? 🤔 This feels like a sci-fi plot coming true.

OR