OpenAI 發布 GeneBench-Pro 基準測試,以提升 AI 生物分析能力
隨著生物技術的快速發展,如何高效且精確地分析複雜的生物數據,已成為研究人員面臨的一大挑戰。 為了讓人工智慧模型在這個領域具備更強大的分析能力,OpenAI 近期推出了一項名為 GeneBench-Pro 的新基準測試。這項基準測試旨在評估人工智慧在基因組學和蛋白質組學等領域的實際研究能力,特別是面對雜亂且不完整數據時進行判斷與決策的能力。
GeneBench-Pro 與傳統基準測試截然不同。傳統測試往往著重於模型的記憶容量以及遵循固定任務序列的能力,而 GeneBench-Pro 則強調其在真實世界研究中的實用性。 其任務建構於「模糊、不完整且雜訊充斥」的數據環境之上,讓模型能在此類條件下進行探索與分析,從而更準確地反映其判斷能力。

此基準測試涵蓋廣泛的生物學領域,包括基因組學、定量生物學及轉譯醫學,共計 129 道題目橫跨統計遺傳學、群體遺傳學、功能基因組學及蛋白質體學等子領域。 每道題目均提供接近真實研究環境的資料集,要求模型獨立選擇分析方法、根據簡要的實驗背景調整策略,並最終得出結論。
為避免傳統長流程測試中常見的評分偏誤,OpenAI 在設計 GeneBench-Pro 時採用了合成數據。此方法使 OpenAI 能更嚴密地控制數據生成過程,確保模型表現反映的是真正的理解,而非透過猜測或捷徑獲得的正確答案。
OpenAI 已在 Hugging Face 平台上開源了 GeneBench-Pro 的 10 道代表性樣本題目,讓外部研究人員能透過互動式介面進行探索。未來,OpenAI 計畫將其中 50 道題目交由 Artificial Analysis 進行獨立評估,以驗證不同模型在此基準測試中的實際表現。
相關文章
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
相關專題推薦
評論 (0)
0/500
隨著生物技術的快速發展,如何高效且精確地分析複雜的生物數據,已成為研究人員面臨的一大挑戰。 為了讓人工智慧模型在這個領域具備更強大的分析能力,OpenAI 近期推出了一項名為 GeneBench-Pro 的新基準測試。這項基準測試旨在評估人工智慧在基因組學和蛋白質組學等領域的實際研究能力,特別是面對雜亂且不完整數據時進行判斷與決策的能力。
GeneBench-Pro 與傳統基準測試截然不同。傳統測試往往著重於模型的記憶容量以及遵循固定任務序列的能力,而 GeneBench-Pro 則強調其在真實世界研究中的實用性。 其任務建構於「模糊、不完整且雜訊充斥」的數據環境之上,讓模型能在此類條件下進行探索與分析,從而更準確地反映其判斷能力。

此基準測試涵蓋廣泛的生物學領域,包括基因組學、定量生物學及轉譯醫學,共計 129 道題目橫跨統計遺傳學、群體遺傳學、功能基因組學及蛋白質體學等子領域。 每道題目均提供接近真實研究環境的資料集,要求模型獨立選擇分析方法、根據簡要的實驗背景調整策略,並最終得出結論。
為避免傳統長流程測試中常見的評分偏誤,OpenAI 在設計 GeneBench-Pro 時採用了合成數據。此方法使 OpenAI 能更嚴密地控制數據生成過程,確保模型表現反映的是真正的理解,而非透過猜測或捷徑獲得的正確答案。
OpenAI 已在 Hugging Face 平台上開源了 GeneBench-Pro 的 10 道代表性樣本題目,讓外部研究人員能透過互動式介面進行探索。未來,OpenAI 計畫將其中 50 道題目交由 Artificial Analysis 進行獨立評估,以驗證不同模型在此基準測試中的實際表現。
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用





首頁






