Openai의 AI는 월드 벽으로 된 O'Reilly 책을 훈련 시켰다고 연구원들은 주장했다

OpenAi는 AI 모델을 훈련시키는 권한없이 저작권이있는 자료를 사용한 수많은 비난에 직면했습니다. 2024 년 미디어 거물 Tim O'Reilly와 이코노미스트 인 Ilan Strauss가 설립 한 비영리 단체 인 AI Disclosures Project의 최근 연구에 따르면 OpenAi는 O'Reilly Media의 비 공개 서적을 사용하여 고급 모델 인 GPT-4O를 훈련시킬 수 있다고합니다. 본질적으로 정교한 예측 엔진 인 AI 모델은 책, 영화 및 TV 쇼를 포함한 방대한 데이터 세트에 대한 교육을받습니다. 그들은 패턴을 배우고 이러한 패턴을 기반으로 응답을 생성하며, 진정으로 새로운 것을 만들지 않고 광범위한 지식 기반에서 근사한 것을 만들어냅니다. 공개 웹과 같은 실제 데이터 소스가 소진되면서 OpenAI를 포함한 일부 AI 실험실은 교육을 위해 AI 생성 데이터를 사용하기 시작했지만 모델 성능 저하의 위험으로 인해 실제 데이터를 완전히 포기한 사람은 거의 없습니다. AI 공개 프로젝트의 논문은 ChatGpt의 기본값 인 OpenAi의 GPT-4O 모델이 이전 GPT-3.5 터보 모델과 달리 Paywalled O'Reilly 책의 컨텐츠에 대한 강력한 인식을 보여준다고 주장합니다. 이 논문은 O'Reilly Media가 OpenAI와의 라이센스 계약이 없음에도 불구하고 GPT-4O가 이러한 비 공개 책에 대해 훈련되었을 가능성이 있다고 제안합니다. 이 연구는 2024 년에 도입 된 DE-COP라는 방법을 사용하여 AI 교육 데이터의 저작권이있는 콘텐츠를 감지했습니다. 이 "멤버십 컨퍼런스 공격"은 모델이 인간 저술 텍스트와 AI 생성 된 역설을 구별 할 수 있는지 여부를 테스트하여 텍스트가 안정적으로 할 수있는 경우 텍스트에 대한 사전 지식을 나타냅니다. 연구원들은 34 개의 O'Reilly 책에서 13,962 개의 단락 발췌문을 사용하여 GPT-4O, GPT-3.5 Turbo 및 기타 OpenAI 모델을 테스트하여 GPT-4O가 구형 모델보다 훨씬 더 유료 콘텐츠를 인식했다는 것을 발견했습니다. 저자는 자신의 방법이 완벽하지 않으며 Paywalled 컨텐츠가 Chatgpt에 복사 및 붙여 넣기에 의해 소개되었을 수 있음을 인정하지만 OpenAI의 데이터 관행에 대한 질문이 제기됩니다. 이 연구는 GPT-4.5와 같은 OpenAI의 최신 모델 및 O3-MINI 및 O1과 같은 추론 모델을 평가하지 않았으며, 이들은 동일한 데이터에 대해 교육을받지 못했을 가능성이 있습니다. OpenAI는 AI 교육 데이터와 관련하여보다 편안한 저작권법을 추진하고 있으며 고품질 데이터 소스를 찾고 있습니다. 이 회사는 AI 시스템을 향상시키기 위해 다양한 분야의 전문가가 모집되는 AI 업계 전반에 걸쳐있는 모델의 생산량을 개선하기 위해 언론인을 고용했습니다. OpenAI는 다양한 컨텐츠 제공 업체와 라이센스 계약을 맺고 저작권 소유자를위한 옵트 아웃 메커니즘을 제공하는 일부 교육 데이터에 대해 지불합니다. 그러나 회사가 데이터 관행에 대한 법적 문제에 직면함에 따라 O'Reilly 논문의 결과는 운영에 대한 그림자를 시전했습니다. OpenAI는 연구에 대한 의견 요청에 응답하지 않았습니다.
관련 기사
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈
관련 특별 주제 추천
의견 (42)
0/500
This is wild! OpenAI sneaking in paywalled books to train their AI? Sounds like a plot twist from a sci-fi novel. Curious how they'll dodge this one—ethics in AI is getting messier by the day! 😅

[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈
This is wild! OpenAI sneaking in paywalled books to train their AI? Sounds like a plot twist from a sci-fi novel. Curious how they'll dodge this one—ethics in AI is getting messier by the day! 😅





집






