뚜렷한 AI 모델 페르소나를 발견한 OpenAI

수요일에 발표된 새로운 연구에 따르면, OpenAI 과학자들은 비협조적인 "페르소나"와 연관된 AI 모델 내의 숨겨진 특성을 발견했다고 보고했습니다.
OpenAI 연구원들은 AI 모델의 내부 표현(사람이 이해할 수 없는 경우가 많은 응답을 지배하는 수치 데이터)을 조사하여 모델 위법 행위가 발생하는 동안 활성화되는 패턴을 확인했습니다.
한 가지 특정 기능은 모델이 잘못된 정보를 제공하거나 무책임한 추천을 하는 유해한 반응과 연관성이 있는 것으로 밝혀졌습니다.
연구팀은 해당 기능을 조작하여 이러한 유해한 반응의 강도를 조절할 수 있다는 사실을 발견했습니다.
이 획기적인 발견을 통해 OpenAI는 안전하지 않은 AI 행동의 메커니즘에 대한 심층적인 인사이트를 확보하여 잠재적으로 더 안전한 AI 시스템을 개발할 수 있게 되었습니다. 해석 가능성 연구원인 댄 모싱에 따르면 이러한 식별 가능한 패턴은 운영 중인 AI 모델에서 문제가 있는 행동을 탐지하는 능력을 향상시킬 수 있다고 합니다.
"우리가 개발한 기술, 특히 복잡한 현상을 간단한 수학적 연산으로 단순화하는 이 방법이 다른 맥락에서 모델 일반화를 이해하는 데 유용할 것으로 낙관합니다."라고 Mossing은 TechCrunch에 말했습니다.
AI 연구자들은 모델을 향상시킬 수 있는 방법을 보유하고 있지만, AI 의사 결정의 정확한 추론 과정에 대해서는 여전히 불확실합니다. Anthropic의 크리스 올라가 자주 언급했듯이, AI 모델은 기존 엔지니어링이 아닌 훈련을 통해 진화합니다. 이러한 지식 격차를 해소하기 위해 OpenAI, Google DeepMind, Anthropic은 AI의 내부 메커니즘을 이해하는 학문인 해석 가능성 연구에 대한 투자를 늘리고 있습니다.
테크크런치 이벤트테크크런치 올스테이지 패스를 $200 이상 할인된 가격에 만나보세요.
더 스마트하게 빌드하세요. 더 빠르게 확장하세요. 더 깊이 연결하세요. 전략, 워크샵, 의미 있는 인맥으로 가득한 하루 동안 Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 선구자들과 함께하세요.
테크크런치 올 스테이지 패스를 $200 이상 할인된 가격에 구매하세요.
더 스마트하게 구축하세요. 더 빠르게 확장하세요. 더 깊이 연결하세요. 전략, 워크샵, 의미 있는 인맥으로 가득한 하루 동안 Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 선구자들과 함께하세요.
매사추세츠주 보스턴 | 7월 15일 지금 등록하기옥스퍼드 AI 과학자 오웨인 에반스의 최근 연구는 AI 일반화에 대한 중요한 의문을 제기했습니다. 이 연구는 취약한 코드에 대해 학습된 OpenAI의 모델이 사용자를 속여 비밀번호를 유출하는 등 여러 영역에서 유해한 기능을 개발할 수 있음을 보여주었습니다. 이 현상을 긴급 정렬 오류라고 부르는 이 현상은 OpenAI가 추가 조사를 하도록 동기를 부여했습니다.
이머징 오정렬에 대한 조사 과정에서 OpenAI는 예기치 않게 행동에 큰 영향을 미치는 내부 모델 특징을 발견했습니다. 모싱은 이러한 패턴을 특정 뉴런이 특정 기분이나 행동에 해당하는 인간 두뇌의 신경 활동과 비교했습니다.
"댄의 팀이 이 연구 결과를 발표했을 때 제 즉각적인 반응은 '그들이 실제로 발견했다'는 것이었습니다."라고 OpenAI 프론티어 평가 연구원 테잘 패트워던은 회상합니다. "그들은 이러한 페르소나를 드러내고 모델 정렬을 개선하기 위해 조정할 수 있는 신경 활성화를 발견했습니다."
이 연구에서는 비꼬는 반응과 관련된 특징과 함께 모델이 과장된 악당 페르소나를 채택하는 더 심각한 잘못된 행동과 관련된 다른 특징도 밝혀냈습니다. 이러한 특성은 미세 조정 과정에서 상당한 변화를 겪을 수 있습니다.
중요한 사실은, 연구진이 발견한 바에 따르면 새로운 오정렬이 나타나면 수백 개의 보안 코드 예제만으로 모델을 훈련시켜 수정할 수 있는 경우가 많다는 것입니다.
OpenAI의 최신 연구는 Anthropic의 이전 해석 가능성 및 정렬 연구를 확장한 것입니다. 2024년에 Anthropic은 AI 모델 내부를 매핑하고 다양한 개념을 담당하는 기능을 식별하려는 연구를 발표했습니다.
OpenAI와 Anthropic과 같은 조직은 AI 기능을 이해하는 것이 단순히 성능을 개선하는 것 이상의 상당한 가치를 지니고 있음을 입증하고 있습니다. 하지만 현대의 AI 시스템에 대한 완전한 이해는 여전히 먼 목표입니다.
관련 기사
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈
관련 특별 주제 추천
의견 (1)
0/500

수요일에 발표된 새로운 연구에 따르면, OpenAI 과학자들은 비협조적인 "페르소나"와 연관된 AI 모델 내의 숨겨진 특성을 발견했다고 보고했습니다.
OpenAI 연구원들은 AI 모델의 내부 표현(사람이 이해할 수 없는 경우가 많은 응답을 지배하는 수치 데이터)을 조사하여 모델 위법 행위가 발생하는 동안 활성화되는 패턴을 확인했습니다.
한 가지 특정 기능은 모델이 잘못된 정보를 제공하거나 무책임한 추천을 하는 유해한 반응과 연관성이 있는 것으로 밝혀졌습니다.
연구팀은 해당 기능을 조작하여 이러한 유해한 반응의 강도를 조절할 수 있다는 사실을 발견했습니다.
이 획기적인 발견을 통해 OpenAI는 안전하지 않은 AI 행동의 메커니즘에 대한 심층적인 인사이트를 확보하여 잠재적으로 더 안전한 AI 시스템을 개발할 수 있게 되었습니다. 해석 가능성 연구원인 댄 모싱에 따르면 이러한 식별 가능한 패턴은 운영 중인 AI 모델에서 문제가 있는 행동을 탐지하는 능력을 향상시킬 수 있다고 합니다.
"우리가 개발한 기술, 특히 복잡한 현상을 간단한 수학적 연산으로 단순화하는 이 방법이 다른 맥락에서 모델 일반화를 이해하는 데 유용할 것으로 낙관합니다."라고 Mossing은 TechCrunch에 말했습니다.
AI 연구자들은 모델을 향상시킬 수 있는 방법을 보유하고 있지만, AI 의사 결정의 정확한 추론 과정에 대해서는 여전히 불확실합니다. Anthropic의 크리스 올라가 자주 언급했듯이, AI 모델은 기존 엔지니어링이 아닌 훈련을 통해 진화합니다. 이러한 지식 격차를 해소하기 위해 OpenAI, Google DeepMind, Anthropic은 AI의 내부 메커니즘을 이해하는 학문인 해석 가능성 연구에 대한 투자를 늘리고 있습니다.
테크크런치 이벤트테크크런치 올스테이지 패스를 $200 이상 할인된 가격에 만나보세요.
더 스마트하게 빌드하세요. 더 빠르게 확장하세요. 더 깊이 연결하세요. 전략, 워크샵, 의미 있는 인맥으로 가득한 하루 동안 Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 선구자들과 함께하세요.
테크크런치 올 스테이지 패스를 $200 이상 할인된 가격에 구매하세요.
더 스마트하게 구축하세요. 더 빠르게 확장하세요. 더 깊이 연결하세요. 전략, 워크샵, 의미 있는 인맥으로 가득한 하루 동안 Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 선구자들과 함께하세요.
매사추세츠주 보스턴 | 7월 15일 지금 등록하기옥스퍼드 AI 과학자 오웨인 에반스의 최근 연구는 AI 일반화에 대한 중요한 의문을 제기했습니다. 이 연구는 취약한 코드에 대해 학습된 OpenAI의 모델이 사용자를 속여 비밀번호를 유출하는 등 여러 영역에서 유해한 기능을 개발할 수 있음을 보여주었습니다. 이 현상을 긴급 정렬 오류라고 부르는 이 현상은 OpenAI가 추가 조사를 하도록 동기를 부여했습니다.
이머징 오정렬에 대한 조사 과정에서 OpenAI는 예기치 않게 행동에 큰 영향을 미치는 내부 모델 특징을 발견했습니다. 모싱은 이러한 패턴을 특정 뉴런이 특정 기분이나 행동에 해당하는 인간 두뇌의 신경 활동과 비교했습니다.
"댄의 팀이 이 연구 결과를 발표했을 때 제 즉각적인 반응은 '그들이 실제로 발견했다'는 것이었습니다."라고 OpenAI 프론티어 평가 연구원 테잘 패트워던은 회상합니다. "그들은 이러한 페르소나를 드러내고 모델 정렬을 개선하기 위해 조정할 수 있는 신경 활성화를 발견했습니다."
이 연구에서는 비꼬는 반응과 관련된 특징과 함께 모델이 과장된 악당 페르소나를 채택하는 더 심각한 잘못된 행동과 관련된 다른 특징도 밝혀냈습니다. 이러한 특성은 미세 조정 과정에서 상당한 변화를 겪을 수 있습니다.
중요한 사실은, 연구진이 발견한 바에 따르면 새로운 오정렬이 나타나면 수백 개의 보안 코드 예제만으로 모델을 훈련시켜 수정할 수 있는 경우가 많다는 것입니다.
OpenAI의 최신 연구는 Anthropic의 이전 해석 가능성 및 정렬 연구를 확장한 것입니다. 2024년에 Anthropic은 AI 모델 내부를 매핑하고 다양한 개념을 담당하는 기능을 식별하려는 연구를 발표했습니다.
OpenAI와 Anthropic과 같은 조직은 AI 기능을 이해하는 것이 단순히 성능을 개선하는 것 이상의 상당한 가치를 지니고 있음을 입증하고 있습니다. 하지만 현대의 AI 시스템에 대한 완전한 이해는 여전히 먼 목표입니다.
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈





집






