該計劃很可能將籌集900萬美元的資金,用於打造更可靠的AI系統。

儘管大語言模型的能力不斷提升,幻覺問題依然是一個長期存在的挑戰。即便是最先進的模型也會產生錯誤,雖然已有檢測方法存在,但整個行業仍在不斷最佳化最佳解決方案。
Recently獲得了Andreessen Horowitz 900萬美元種子輪融資的Probably公司,旨在開發一種更為可靠的錯誤檢測方法。
該公司創始人Peter Elias(見上圖)表示,公司的使命是防止幻覺和事實性錯誤傳遞給使用者,力求達到確定性系統通常所具備的99.99%準確率——這一水平對人工智慧而言極為難以實現。他指出,若要用大語言模型達成這一目標,就必須重新思考人工智慧工程領域的核心假設。
Probably的初始產品是一款資料科學工具,可用於從複雜資料集中快速生成答案。每個結果都會附帶引用資訊以及其推導過程的審計軌跡,這種做法正逐漸成為人工智慧工具的標準配置。
為避免錯誤混入這些總結內容中,該公司構建了一套複雜的約束系統,Elias將其稱為“資料科學機械戰衣”。大語言模型的初始響應會由一個確定性系統進行驗證,任何與資料集不一致的結果都會被剔除。據該公司介紹,該大語言模型已針對這一驗證器進行了訓練,整個系統也在持續最佳化,以提升速度和準確率。
“我們發現,約束系統的設計越完善,模型所需的算力就越低,”Elias說道,“如果能夠充分最佳化上下文,模型就不必費力去生成正確結果。歸根結底,這是為了減少歧義。”
正因如此,Probably的資料科學工具即便使用規模更小的人工智慧模型也能正常執行。Elias指出,當前版本使用的模型“比最先進的模型弱四個層級”,因此可以在本地硬體——即普通桌上型電腦而非資料中心——上執行,從而大幅降低與人工智慧使用相關的Token成本。
在Token成本不斷上升、許多客戶都在重新評估其人工智慧預算的當下,這種方案顯得尤為及時。Elias的願景不僅限於資料科學領域;同樣的技術架構還可以應用於會計或醫療服務等場景——用他的話來說,就是“任何對精度要求較高的應用場景”。
“令人驚訝的是,各大人工智慧實驗室甚至都沒有嘗試過這種方法,”Elias說道,“他們沒有動力去這麼做,因為重複修正的需求正是他們的盈利來源。”
相關文章
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
相關專題推薦
評論 (0)
0/500

儘管大語言模型的能力不斷提升,幻覺問題依然是一個長期存在的挑戰。即便是最先進的模型也會產生錯誤,雖然已有檢測方法存在,但整個行業仍在不斷最佳化最佳解決方案。
Recently獲得了Andreessen Horowitz 900萬美元種子輪融資的Probably公司,旨在開發一種更為可靠的錯誤檢測方法。
該公司創始人Peter Elias(見上圖)表示,公司的使命是防止幻覺和事實性錯誤傳遞給使用者,力求達到確定性系統通常所具備的99.99%準確率——這一水平對人工智慧而言極為難以實現。他指出,若要用大語言模型達成這一目標,就必須重新思考人工智慧工程領域的核心假設。
Probably的初始產品是一款資料科學工具,可用於從複雜資料集中快速生成答案。每個結果都會附帶引用資訊以及其推導過程的審計軌跡,這種做法正逐漸成為人工智慧工具的標準配置。
為避免錯誤混入這些總結內容中,該公司構建了一套複雜的約束系統,Elias將其稱為“資料科學機械戰衣”。大語言模型的初始響應會由一個確定性系統進行驗證,任何與資料集不一致的結果都會被剔除。據該公司介紹,該大語言模型已針對這一驗證器進行了訓練,整個系統也在持續最佳化,以提升速度和準確率。
“我們發現,約束系統的設計越完善,模型所需的算力就越低,”Elias說道,“如果能夠充分最佳化上下文,模型就不必費力去生成正確結果。歸根結底,這是為了減少歧義。”
正因如此,Probably的資料科學工具即便使用規模更小的人工智慧模型也能正常執行。Elias指出,當前版本使用的模型“比最先進的模型弱四個層級”,因此可以在本地硬體——即普通桌上型電腦而非資料中心——上執行,從而大幅降低與人工智慧使用相關的Token成本。
在Token成本不斷上升、許多客戶都在重新評估其人工智慧預算的當下,這種方案顯得尤為及時。Elias的願景不僅限於資料科學領域;同樣的技術架構還可以應用於會計或醫療服務等場景——用他的話來說,就是“任何對精度要求較高的應用場景”。
“令人驚訝的是,各大人工智慧實驗室甚至都沒有嘗試過這種方法,”Elias說道,“他們沒有動力去這麼做,因為重複修正的需求正是他們的盈利來源。”
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用





首頁






