EleutherAI가 AI 훈련을 위한 대규모 라이선스 텍스트 데이터셋 공개

EleutherAI, 선도적인 AI 연구 그룹은 AI 모델 훈련을 위한 가장 큰 라이선스 및 오픈 도메인 텍스트 컬렉션 중 하나를 출시했습니다.
Common Pile v0.1이라는 이름의 이 8테라바이트 데이터셋은 AI 스타트업 Poolside, Hugging Face 및 다양한 학술 기관과 함께 2년 동안 개발되었습니다. 이 데이터셋은 EleutherAI의 두 가지 새로운 모델, Comma v0.1-1T와 Comma v0.1-2T를 훈련시키는 데 사용되었으며, 이 조직은 이 모델들이 라이선스 없이 저작권이 있는 데이터로 훈련된 모델들의 성능과 맞먹는다고 주장합니다.
OpenAI를 포함한 AI 기업들은 웹 스크래핑 데이터를 사용한 모델 훈련, 특히 저작권이 있는 책과 저널을 포함한 데이터 사용으로 인해 법적 도전에 직면해 있습니다. 일부는 콘텐츠 제공자와 라이선스 계약을 맺고 있지만, 많은 기업은 미국의 공정 사용 원칙에 의존하여 허가 없이 저작권이 있는 자료로 훈련을 정당화합니다.
EleutherAI는 이러한 소송들이 AI 산업의 투명성을 크게 감소시켜 모델 기능과 약점에 대한 통찰을 제한하며, 이는 더 넓은 연구 커뮤니티에 해를 끼친다고 주장합니다.
“법적 도전은 모델 훈련을 위한 데이터 소싱 관행을 크게 바꾸지 않았지만, AI 기업의 개방성을 급격히 감소시켰습니다,”라고 EleutherAI의 전무이사인 Stella Biderman이 금요일 Hugging Face 블로그 포스트에서 말했습니다. “우리가 대화한 일부 기업의 연구자들은 소송을 이유로 데이터 중심 연구를 공유할 수 없다고 언급했습니다.”
Hugging Face의 AI 플랫폼과 GitHub에서 제공되는 Common Pile v0.1은 법률 자문을 받아 개발되었으며, 의회 도서관과 인터넷 아카이브가 디지털화한 300,000개의 공공 도메인 책과 같은 소스를 포함합니다. EleutherAI는 또한 OpenAI의 Whisper 모델을 사용하여 오디오 콘텐츠를 전사했습니다.
EleutherAI는 Comma v0.1-1T와 Comma v0.1-2T가 Common Pile v0.1의 품질을 보여주며, 개발자들이 독점 시스템과 경쟁할 수 있는 모델을 만들 수 있게 한다고 주장합니다. 70억 개의 매개변수를 가지며 데이터셋의 일부로 훈련된 두 모델은 Meta의 원래 Llama 모델과 코딩, 이미지 이해, 수학 벤치마크에서 경쟁합니다.
TechCrunch All Stage Pass에서 200달러 이상 절약하세요
더 똑똑하게 혁신하세요. 더 빠르게 성장하세요. 더 깊이 네트워크를 형성하세요. Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 비전가들과 함께 하루 동안의 통찰, 워크숍, 그리고 소중한 연결을 경험하세요.
TechCrunch All Stage Pass에서 200달러 이상 절약하세요
더 똑똑하게 혁신하세요. 더 빠르게 성장하세요. 더 깊이 네트워크를 형성하세요. Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 비전가들과 함께 하루 동안의 통찰, 워크숍, 그리고 소중한 연결을 경험하세요.
Boston, MA | 7월 15일 지금 등록하세요매개변수, 종종 가중치라고 불리는 것은 AI 모델의 행동과 응답을 형성하는 내부 요소입니다.
“라이선스 없는 텍스트가 고성능에 필수적이라는 믿음은 근거가 없습니다,”라고 Biderman이 자신의 포스트에서 말했습니다. “공개적으로 라이선스된 데이터와 공공 도메인 데이터가 더 접근 가능해짐에 따라, 이러한 콘텐츠로 훈련된 모델이 크게 개선될 것으로 기대합니다.”
Common Pile v0.1은 EleutherAI의 과거 논란을 부분적으로 해결합니다. 몇 년 전, 이 그룹은 저작권이 있는 자료를 포함한 오픈 데이터셋인 The Pile을 공개했으며, 이는 AI 훈련에 사용된 것에 대해 비판과 법적 조사를 받았습니다.
EleutherAI는 연구 및 인프라 파트너들과 협력하여 오픈 데이터셋을 더 자주 공개할 것을 약속합니다.
태평양 표준시 오전 9:48 업데이트: Biderman은 X에서 EleutherAI가 데이터셋과 모델 출시에 기여했으며, 토론토 대학교와 같은 파트너들이 연구를 공동으로 이끌며 중요한 역할을 했다고 언급했습니다.
관련 기사
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
Core Web Vitals를 수정하여 SEO 순위 향상을 위한 방법
AI 도구를 활용한 성적표 코멘트 작성 간소화서론성적표 코멘트 생성을 위한 AI 도구매직 스쿨(Magic School)알마낙 AI(Almanac AI)챗 GPT(Chat GPT)매직 스쿨을 사용하여 성적표 코멘트 생성하기매직 스쿨 로그인성적표 코멘트 도구 선택학생별 코멘트 맞춤 설정알마낙 AI를 사용하여 성적표 코멘트 생성하기과정 및 평가 체계 설정성적표 분량 및 학생 정보 구성알마낙 AI를 통한 코멘트 생성매직 스쿨과
관련 특별 주제 추천
의견 (2)
0/500
Наконец-то качественные данные для обучения ИИ! 😄 Но интересно, как это повлияет на конкуренцию между OpenAI и другими компаниями. Может, скоро увидим более умные модели?
Wow, 8 terabytes of legally licensed text is a game-changer! It's fantastic to see more high-quality, transparent data becoming available. This should really help push open-source AI models forward and maybe even challenge some of the big players who rely on murkier data sources. Hopefully, it leads to more reliable and ethically-sound systems. Can't wait to see what gets built on this! 🚀

EleutherAI, 선도적인 AI 연구 그룹은 AI 모델 훈련을 위한 가장 큰 라이선스 및 오픈 도메인 텍스트 컬렉션 중 하나를 출시했습니다.
Common Pile v0.1이라는 이름의 이 8테라바이트 데이터셋은 AI 스타트업 Poolside, Hugging Face 및 다양한 학술 기관과 함께 2년 동안 개발되었습니다. 이 데이터셋은 EleutherAI의 두 가지 새로운 모델, Comma v0.1-1T와 Comma v0.1-2T를 훈련시키는 데 사용되었으며, 이 조직은 이 모델들이 라이선스 없이 저작권이 있는 데이터로 훈련된 모델들의 성능과 맞먹는다고 주장합니다.
OpenAI를 포함한 AI 기업들은 웹 스크래핑 데이터를 사용한 모델 훈련, 특히 저작권이 있는 책과 저널을 포함한 데이터 사용으로 인해 법적 도전에 직면해 있습니다. 일부는 콘텐츠 제공자와 라이선스 계약을 맺고 있지만, 많은 기업은 미국의 공정 사용 원칙에 의존하여 허가 없이 저작권이 있는 자료로 훈련을 정당화합니다.
EleutherAI는 이러한 소송들이 AI 산업의 투명성을 크게 감소시켜 모델 기능과 약점에 대한 통찰을 제한하며, 이는 더 넓은 연구 커뮤니티에 해를 끼친다고 주장합니다.
“법적 도전은 모델 훈련을 위한 데이터 소싱 관행을 크게 바꾸지 않았지만, AI 기업의 개방성을 급격히 감소시켰습니다,”라고 EleutherAI의 전무이사인 Stella Biderman이 금요일 Hugging Face 블로그 포스트에서 말했습니다. “우리가 대화한 일부 기업의 연구자들은 소송을 이유로 데이터 중심 연구를 공유할 수 없다고 언급했습니다.”
Hugging Face의 AI 플랫폼과 GitHub에서 제공되는 Common Pile v0.1은 법률 자문을 받아 개발되었으며, 의회 도서관과 인터넷 아카이브가 디지털화한 300,000개의 공공 도메인 책과 같은 소스를 포함합니다. EleutherAI는 또한 OpenAI의 Whisper 모델을 사용하여 오디오 콘텐츠를 전사했습니다.
EleutherAI는 Comma v0.1-1T와 Comma v0.1-2T가 Common Pile v0.1의 품질을 보여주며, 개발자들이 독점 시스템과 경쟁할 수 있는 모델을 만들 수 있게 한다고 주장합니다. 70억 개의 매개변수를 가지며 데이터셋의 일부로 훈련된 두 모델은 Meta의 원래 Llama 모델과 코딩, 이미지 이해, 수학 벤치마크에서 경쟁합니다.
TechCrunch All Stage Pass에서 200달러 이상 절약하세요
더 똑똑하게 혁신하세요. 더 빠르게 성장하세요. 더 깊이 네트워크를 형성하세요. Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 비전가들과 함께 하루 동안의 통찰, 워크숍, 그리고 소중한 연결을 경험하세요.
TechCrunch All Stage Pass에서 200달러 이상 절약하세요
더 똑똑하게 혁신하세요. 더 빠르게 성장하세요. 더 깊이 네트워크를 형성하세요. Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 비전가들과 함께 하루 동안의 통찰, 워크숍, 그리고 소중한 연결을 경험하세요.
Boston, MA | 7월 15일 지금 등록하세요매개변수, 종종 가중치라고 불리는 것은 AI 모델의 행동과 응답을 형성하는 내부 요소입니다.
“라이선스 없는 텍스트가 고성능에 필수적이라는 믿음은 근거가 없습니다,”라고 Biderman이 자신의 포스트에서 말했습니다. “공개적으로 라이선스된 데이터와 공공 도메인 데이터가 더 접근 가능해짐에 따라, 이러한 콘텐츠로 훈련된 모델이 크게 개선될 것으로 기대합니다.”
Common Pile v0.1은 EleutherAI의 과거 논란을 부분적으로 해결합니다. 몇 년 전, 이 그룹은 저작권이 있는 자료를 포함한 오픈 데이터셋인 The Pile을 공개했으며, 이는 AI 훈련에 사용된 것에 대해 비판과 법적 조사를 받았습니다.
EleutherAI는 연구 및 인프라 파트너들과 협력하여 오픈 데이터셋을 더 자주 공개할 것을 약속합니다.
태평양 표준시 오전 9:48 업데이트: Biderman은 X에서 EleutherAI가 데이터셋과 모델 출시에 기여했으며, 토론토 대학교와 같은 파트너들이 연구를 공동으로 이끌며 중요한 역할을 했다고 언급했습니다.
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
Core Web Vitals를 수정하여 SEO 순위 향상을 위한 방법
AI 도구를 활용한 성적표 코멘트 작성 간소화서론성적표 코멘트 생성을 위한 AI 도구매직 스쿨(Magic School)알마낙 AI(Almanac AI)챗 GPT(Chat GPT)매직 스쿨을 사용하여 성적표 코멘트 생성하기매직 스쿨 로그인성적표 코멘트 도구 선택학생별 코멘트 맞춤 설정알마낙 AI를 사용하여 성적표 코멘트 생성하기과정 및 평가 체계 설정성적표 분량 및 학생 정보 구성알마낙 AI를 통한 코멘트 생성매직 스쿨과
Наконец-то качественные данные для обучения ИИ! 😄 Но интересно, как это повлияет на конкуренцию между OpenAI и другими компаниями. Может, скоро увидим более умные модели?
Wow, 8 terabytes of legally licensed text is a game-changer! It's fantastic to see more high-quality, transparent data becoming available. This should really help push open-source AI models forward and maybe even challenge some of the big players who rely on murkier data sources. Hopefully, it leads to more reliable and ethically-sound systems. Can't wait to see what gets built on this! 🚀





집






