Дом
OpenAI выпустила тестовый набор GeneBench-Pro для повышения эффективности биологического анализа с помощью ИИ
В связи с быстрым развитием биотехнологий эффективный и точный анализ сложных биологических данных стал одной из главных задач для исследователей. Чтобы наделить модели искусственного интеллекта более сильными аналитическими навыками в этой области, компания OpenAI недавно представила новый тестовый набор под названием GeneBench-Pro. Этот тестовый набор предназначен для оценки практических исследовательских возможностей ИИ в таких областях, как геномика и протеомика, в частности его способности выносить суждения и принимать решения при работе с неструктурированными и неполными данными.
GeneBench-Pro отличается от традиционных тестов. В то время как обычные тесты часто сосредоточены на объёме памяти модели и её способности следовать фиксированным последовательностям задач, GeneBench-Pro делает акцент на практической полезности в реальных научных исследованиях. Его задачи построены на основе «нечеткой, неполной и зашумленной» среды данных, что позволяет модели проводить исследования и анализ в таких условиях, что более точно отражает ее способности к вынесению суждений.

Этот тестовый набор охватывает широкий спектр биологических областей, включая геномику, количественную биологию и трансляционную медицину, и содержит 129 задач, охватывающих такие подразделы, как статистическая генетика, популяционная генетика, функциональная геномика и протеомика. Каждый вопрос предоставляет набор данных, близкий к реальной исследовательской среде, что требует от модели самостоятельного выбора методов анализа, адаптации стратегий на основе кратких экспериментальных сведений и, в конечном итоге, формулирования выводов.
Чтобы избежать систематических ошибок в оценке, характерных для традиционных тестов с длительным процессом, при разработке GeneBench-Pro компания OpenAI использовала синтетические данные. Такой подход позволяет OpenAI более строго контролировать процесс генерации данных, гарантируя, что производительность модели отражает подлинное понимание, а не правильные ответы, полученные путем угадывания или использования упрощений.
OpenAI опубликовала 10 типичных примеров задач из GeneBench-Pro с открытым исходным кодом на платформе Hugging Face, что позволяет внешним исследователям изучать их через интерактивный интерфейс. В будущем OpenAI планирует передать 50 из этих задач в Artificial Analysis для независимой оценки, чтобы проверить реальную эффективность различных моделей на этом тестовом наборе.
Связанная статья
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Рекомендации по связанным специальным темам
Комментарии (0)
В связи с быстрым развитием биотехнологий эффективный и точный анализ сложных биологических данных стал одной из главных задач для исследователей. Чтобы наделить модели искусственного интеллекта более сильными аналитическими навыками в этой области, компания OpenAI недавно представила новый тестовый набор под названием GeneBench-Pro. Этот тестовый набор предназначен для оценки практических исследовательских возможностей ИИ в таких областях, как геномика и протеомика, в частности его способности выносить суждения и принимать решения при работе с неструктурированными и неполными данными.
GeneBench-Pro отличается от традиционных тестов. В то время как обычные тесты часто сосредоточены на объёме памяти модели и её способности следовать фиксированным последовательностям задач, GeneBench-Pro делает акцент на практической полезности в реальных научных исследованиях. Его задачи построены на основе «нечеткой, неполной и зашумленной» среды данных, что позволяет модели проводить исследования и анализ в таких условиях, что более точно отражает ее способности к вынесению суждений.

Этот тестовый набор охватывает широкий спектр биологических областей, включая геномику, количественную биологию и трансляционную медицину, и содержит 129 задач, охватывающих такие подразделы, как статистическая генетика, популяционная генетика, функциональная геномика и протеомика. Каждый вопрос предоставляет набор данных, близкий к реальной исследовательской среде, что требует от модели самостоятельного выбора методов анализа, адаптации стратегий на основе кратких экспериментальных сведений и, в конечном итоге, формулирования выводов.
Чтобы избежать систематических ошибок в оценке, характерных для традиционных тестов с длительным процессом, при разработке GeneBench-Pro компания OpenAI использовала синтетические данные. Такой подход позволяет OpenAI более строго контролировать процесс генерации данных, гарантируя, что производительность модели отражает подлинное понимание, а не правильные ответы, полученные путем угадывания или использования упрощений.
OpenAI опубликовала 10 типичных примеров задач из GeneBench-Pro с открытым исходным кодом на платформе Hugging Face, что позволяет внешним исследователям изучать их через интерактивный интерфейс. В будущем OpenAI планирует передать 50 из этих задач в Artificial Analysis для независимой оценки, чтобы проверить реальную эффективность различных моделей на этом тестовом наборе.
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три











