Дом
EleutherAI представляет массивный лицензированный текстовый набор данных для обучения ИИ

EleutherAI, ведущая группа исследований ИИ, запустила одну из крупнейших коллекций лицензированных и общедоступных текстов для обучения моделей ИИ.
Названный Common Pile v0.1, этот набор данных объемом 8 терабайт разрабатывался в течение двух лет совместно с ИИ-стартапами Poolside, Hugging Face и различными академическими институтами. Он использовался для обучения двух новых моделей EleutherAI, Comma v0.1-1T и Comma v0.1-2T, которые, по утверждению организации, соответствуют производительности моделей, обученных на нелицензированных, защищенных авторским правом данных.
Компании ИИ, включая OpenAI, сталкиваются с юридическими проблемами из-за использования данных, собранных с веб-сайтов, включая защищенные авторским правом книги и журналы, для обучения моделей. Хотя некоторые имеют лицензионные соглашения с поставщиками контента, многие полагаются на доктрину добросовестного использования в США, чтобы оправдать обучение на защищенных авторским правом материалах без разрешения.
EleutherAI утверждает, что эти судебные иски значительно снизили прозрачность в индустрии ИИ, ограничивая понимание функциональности и слабых мест моделей, что наносит ущерб более широкому исследовательскому сообществу.
“Юридические проблемы не существенно изменили практики получения данных для обучения моделей, но они резко снизили открытость компаний ИИ,” — сказала Стелла Бидерман, исполнительный директор EleutherAI, в посте на блоге Hugging Face в пятницу. “Исследователи в некоторых компаниях, с которыми мы беседовали, ссылаются на судебные иски как на причину, по которой они не могут делиться своими исследованиями, связанными с данными.”
Common Pile v0.1, доступный на платформе ИИ Hugging Face и GitHub, был разработан с юридической консультацией и включает источники, такие как 300 000 книг общественного достояния, оцифрованных Библиотекой Конгресса и Интернет-архивом. EleutherAI также использовала модель Whisper от OpenAI для транскрипции аудиоконтента.
EleutherAI утверждает, что Comma v0.1-1T и Comma v0.1-2T демонстрируют качество Common Pile v0.1, позволяя разработчикам создавать модели, конкурентоспособные с проприетарными системами. Обе модели, с 7 миллиардами параметров и обученные на части набора данных, соперничают с оригинальной моделью Llama от Meta в тестах по программированию, пониманию изображений и математике.
Сэкономьте более 200 долларов на вашем TechCrunch All Stage Pass
Инновируйте умнее. Растите быстрее. Стройте связи глубже. Общайтесь с визионерами из Precursor Ventures, NEA, Index Ventures, Underscore VC и других для дня полных идей, мастер-классов и ценных связей.
Сэкономьте более 200 долларов на вашем TechCrunch All Stage Pass
Инновируйте умнее. Растите быстрее. Стройте связи глубже. Общайтесь с визионерами из Precursor Ventures, NEA, Index Ventures, Underscore VC и других для дня полных идей, мастер-классов и ценных связей.
Бостон, Массачусетс | 15 июля ЗАРЕГИСТРИРУЙТЕСЬ СЕЙЧАСПараметры, часто называемые весами, являются внутренними элементами модели ИИ, которые формируют ее поведение и ответы.
“Мнение, что нелицензированный текст необходим для высокой производительности, необоснованно,” — заявила Бидерман в своем посте. “По мере того как лицензированные и общедоступные данные становятся более доступными, мы ожидаем значительных улучшений в моделях, обученных на таком контенте.”
Common Pile v0.1 частично решает прошлые противоречия EleutherAI. Несколько лет назад группа выпустила The Pile, открытый набор данных, содержащий защищенные авторским правом материалы, что вызвало критику и юридическое внимание за использование в обучении ИИ.
EleutherAI обязуется регулярно выпускать открытые наборы данных, сотрудничая с исследовательскими и инфраструктурными партнерами.
Обновлено в 9:48 утра по тихоокеанскому времени: Бидерман отметила на X, что EleutherAI внесла вклад в выпуск набора данных и моделей, при значительном участии партнеров, таких как Университет Торонто, который совместно руководил исследованием.
Связанная статья
OpenAI заманивает уоллстритовских банкиров огромными выплатами и долями в компании, чтобы переформатировать финансовую отрасль
OpenAI активно расширяет свое присутствие в сфере инвестиционного банкинга: недавние вакансии показывают, что компания ищет инвестиционных специалистов с опытом работы более двух лет для присоединения к своей команде прикладного искусственного интелл
Пять министерств и ведомств запускают план «Искусственный интеллект в образовании» по разработке курсов MOOC с использованием ИИ на всех этапах академического обучения
10 апреля Министерство образования, Государственный комитет по развитию и реформам, Министерство промышленности и информатизации, Министерство науки и технологий и Национальное управление по данным совместно опубликовали «План действий по внедрению т
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Рекомендации по связанным специальным темам
Комментарии (2)
Наконец-то качественные данные для обучения ИИ! 😄 Но интересно, как это повлияет на конкуренцию между OpenAI и другими компаниями. Может, скоро увидим более умные модели?
Wow, 8 terabytes of legally licensed text is a game-changer! It's fantastic to see more high-quality, transparent data becoming available. This should really help push open-source AI models forward and maybe even challenge some of the big players who rely on murkier data sources. Hopefully, it leads to more reliable and ethically-sound systems. Can't wait to see what gets built on this! 🚀

EleutherAI, ведущая группа исследований ИИ, запустила одну из крупнейших коллекций лицензированных и общедоступных текстов для обучения моделей ИИ.
Названный Common Pile v0.1, этот набор данных объемом 8 терабайт разрабатывался в течение двух лет совместно с ИИ-стартапами Poolside, Hugging Face и различными академическими институтами. Он использовался для обучения двух новых моделей EleutherAI, Comma v0.1-1T и Comma v0.1-2T, которые, по утверждению организации, соответствуют производительности моделей, обученных на нелицензированных, защищенных авторским правом данных.
Компании ИИ, включая OpenAI, сталкиваются с юридическими проблемами из-за использования данных, собранных с веб-сайтов, включая защищенные авторским правом книги и журналы, для обучения моделей. Хотя некоторые имеют лицензионные соглашения с поставщиками контента, многие полагаются на доктрину добросовестного использования в США, чтобы оправдать обучение на защищенных авторским правом материалах без разрешения.
EleutherAI утверждает, что эти судебные иски значительно снизили прозрачность в индустрии ИИ, ограничивая понимание функциональности и слабых мест моделей, что наносит ущерб более широкому исследовательскому сообществу.
“Юридические проблемы не существенно изменили практики получения данных для обучения моделей, но они резко снизили открытость компаний ИИ,” — сказала Стелла Бидерман, исполнительный директор EleutherAI, в посте на блоге Hugging Face в пятницу. “Исследователи в некоторых компаниях, с которыми мы беседовали, ссылаются на судебные иски как на причину, по которой они не могут делиться своими исследованиями, связанными с данными.”
Common Pile v0.1, доступный на платформе ИИ Hugging Face и GitHub, был разработан с юридической консультацией и включает источники, такие как 300 000 книг общественного достояния, оцифрованных Библиотекой Конгресса и Интернет-архивом. EleutherAI также использовала модель Whisper от OpenAI для транскрипции аудиоконтента.
EleutherAI утверждает, что Comma v0.1-1T и Comma v0.1-2T демонстрируют качество Common Pile v0.1, позволяя разработчикам создавать модели, конкурентоспособные с проприетарными системами. Обе модели, с 7 миллиардами параметров и обученные на части набора данных, соперничают с оригинальной моделью Llama от Meta в тестах по программированию, пониманию изображений и математике.
Сэкономьте более 200 долларов на вашем TechCrunch All Stage Pass
Инновируйте умнее. Растите быстрее. Стройте связи глубже. Общайтесь с визионерами из Precursor Ventures, NEA, Index Ventures, Underscore VC и других для дня полных идей, мастер-классов и ценных связей.
Сэкономьте более 200 долларов на вашем TechCrunch All Stage Pass
Инновируйте умнее. Растите быстрее. Стройте связи глубже. Общайтесь с визионерами из Precursor Ventures, NEA, Index Ventures, Underscore VC и других для дня полных идей, мастер-классов и ценных связей.
Бостон, Массачусетс | 15 июля ЗАРЕГИСТРИРУЙТЕСЬ СЕЙЧАСПараметры, часто называемые весами, являются внутренними элементами модели ИИ, которые формируют ее поведение и ответы.
“Мнение, что нелицензированный текст необходим для высокой производительности, необоснованно,” — заявила Бидерман в своем посте. “По мере того как лицензированные и общедоступные данные становятся более доступными, мы ожидаем значительных улучшений в моделях, обученных на таком контенте.”
Common Pile v0.1 частично решает прошлые противоречия EleutherAI. Несколько лет назад группа выпустила The Pile, открытый набор данных, содержащий защищенные авторским правом материалы, что вызвало критику и юридическое внимание за использование в обучении ИИ.
EleutherAI обязуется регулярно выпускать открытые наборы данных, сотрудничая с исследовательскими и инфраструктурными партнерами.
Обновлено в 9:48 утра по тихоокеанскому времени: Бидерман отметила на X, что EleutherAI внесла вклад в выпуск набора данных и моделей, при значительном участии партнеров, таких как Университет Торонто, который совместно руководил исследованием.
OpenAI заманивает уоллстритовских банкиров огромными выплатами и долями в компании, чтобы переформатировать финансовую отрасль
OpenAI активно расширяет свое присутствие в сфере инвестиционного банкинга: недавние вакансии показывают, что компания ищет инвестиционных специалистов с опытом работы более двух лет для присоединения к своей команде прикладного искусственного интелл
Пять министерств и ведомств запускают план «Искусственный интеллект в образовании» по разработке курсов MOOC с использованием ИИ на всех этапах академического обучения
10 апреля Министерство образования, Государственный комитет по развитию и реформам, Министерство промышленности и информатизации, Министерство науки и технологий и Национальное управление по данным совместно опубликовали «План действий по внедрению т
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Наконец-то качественные данные для обучения ИИ! 😄 Но интересно, как это повлияет на конкуренцию между OpenAI и другими компаниями. Может, скоро увидим более умные модели?
Wow, 8 terabytes of legally licensed text is a game-changer! It's fantastic to see more high-quality, transparent data becoming available. This should really help push open-source AI models forward and maybe even challenge some of the big players who rely on murkier data sources. Hopefully, it leads to more reliable and ethically-sound systems. Can't wait to see what gets built on this! 🚀











