“ Composo:監視企業的AI應用程序性能”

AI和大型語言模型(LLMs)極具潛力,但說實話,它們有時表現得不太穩定。沒人能確定何時能完全解決所有問題,因此不意外地,新創公司正紛紛投入,協助企業確保其LLM驅動的應用程式能如預期運作。
這就是Composo,一家位於倫敦的新創公司,自認在解決這個問題上具有優勢。他們開發了客製化模型,幫助企業檢查其LLM應用程式的準確性和品質是否達標。
Composo並非此領域的唯一玩家;他們的競爭對手包括Agenta、Freeplay、Humanloop和LangSmith,這些公司都在嘗試提供更好的、基於LLM的應用程式測試方式,取代依賴人工、檢查清單或傳統工具。但Composo表示自己與眾不同,因為它提供了無程式碼選項和API。這意味著更多人可以使用它,不僅限於開發者——領域專家和高階主管也能自行檢查不一致性、品質和準確性。
其運作方式如下:Composo將一個根據人們對AI應用程式期望訓練的獎勵模型,與該應用程式的特定標準結合,然後評分該應用程式的輸出與這些標準的符合程度。例如,若你有一個醫療分診聊天機器人,可以設定客製化的指導方針來監控危急症狀,Composo會告訴你該應用程式遵循這些規則的程度。
他們剛剛推出了Composo Align的公開API,這個API能根據你設定的任何標準來評估LLM應用程式。
這似乎正在產生回報——他們的客戶名單上有Accenture、Palantir和McKinsey等大牌公司,且最近獲得了200萬美元的Pre-seed資金。這在AI世界中,資金通常充裕的環境下可能不算多,但Composo的共同創辦人兼CEO Sebastian Fox表示,他們不需要鉅額資金。「至少在未來三年,我們不預見自己需要募資數億,因為許多人在打造基礎模型,並且做得非常有效率,這不是我們的獨特賣點,」曾在McKinsey擔任顧問的Fox說道。「相反地,每天早晨,若我醒來看到OpenAI在他們的模型上取得重大進展的新聞,這對我的生意是好事。」
有了這筆新資金,Composo計劃增強其工程團隊(由共同創辦人兼CTO、前Graphcore機器學習工程師Luke Markham領導),爭取更多客戶,並加速研發。「今年的重點更多在於將我們現在擁有的技術擴展到這些公司,」Fox說。
這輪種子融資由英國AI Pre-seed基金Twin Path Ventures領投,JVH Ventures和EWOR也參與其中。EWOR此前已通過其加速器計畫支持Composo。「Twin Path Ventures」的發言人表示:「Composo正在解決企業AI採用中的關鍵瓶頸。」
據Fox表示,這個瓶頸對整個AI領域、特別是對企業來說至關重要。「人們已經度過了興奮的炒作階段,現在開始思考,『嗯,實際上,這對我目前的業務真的有什麼改變嗎?因為固定,因為它不夠可靠,也不夠一致。即使它夠好,你也無法證明它有多好,』」他解釋道。
這可能使Composo對想使用AI但擔心風險的公司極具價值。因此,他們雖不限於特定產業,但仍專注於合規性、法律、醫療保健和安全領域。
談到他們的獨特之處,Fox表示他們的成果不易複製。「這涉及模型的架構以及我們用來訓練的資料,」他說,並指出Composo Align是在「大量專家評估資料集」上訓練的。
當然,科技巨頭可能會投入資源試圖解決這個問題,但Composo認為自己已領先一步。「另一個優勢是我們隨著時間累積的資料,」Fox談到他們如何建立評估偏好。
由於它能根據靈活的標準集評估應用程式,Composo也認為自己比那些方法較為僵化的競爭對手更能應對agentic AI的興起。「在我看來,我們絕對還沒到代理(agents)能良好運作的階段,而這正是我們試圖幫助解決的問題,」Fox說。
TechCrunch有一份專注於AI的電子報!請在此訂閱,每週三送達您的收件匣。
相關文章
紐約州將對 5,000 萬個 AI 資料中心實施用電上限
紐約州的舉措展現了全球各國政府可能如何管理、課稅及規範人工智慧熱潮所帶來的實體足跡。圖片來源:Luca Bravo/Unsplash紐約州州長凱西·霍丘爾簽署了一項具有歷史意義的行政命令,暫停資料中心的建設,同時州政府官員正起草嚴格的環境影響規範人工智慧對基礎設施的需求,如今已與現有電力網的實體限制產生衝突。紐約州已成為美國首個正式暫停超大規模數據中心開發的州,對耗電量達50兆瓦或以上的新建數據中
史丹佛大學研究人員如何運用人工智慧設計出人工病毒
人工智慧領域的領導者們已指出,具備生物學能力的AI模型可能帶來的潛在風險。圖片來源:CDC/Unsplash美國研究人員利用人工智慧設計出首種針對大腸桿菌的合成病毒,而 Anthropic 執行長達里奧·阿莫迪(Dario Amodei)則對人工智慧引發的生物威脅表示擔憂。美國史丹佛大學的科學家利用人工智慧,設計出自然界中不存在的病毒。該團隊的研究基於「Evo 2」生成的基因組,這是一種旨在透過提
人工智慧如何加速中國的藥物研發進程
Insilico Medicine 執行長 Alex Zhavoronkov 表示,該公司透過在中國將人工智慧與實驗室研究相結合,已將生成藥物開發候選分子的時程縮短至約一年。據扎沃隆科夫表示,這家在香港上市的公司最先進的研發計畫僅用九個月便完成了候選藥物遴選,而通常需時13個月。這與傳統方法形成鮮明對比,後者通常需要約四年半才能達到同一里程碑。這些時程特別指早期發現與候選藥物篩選階段,而非完整的藥
相關專題推薦
評論 (56)
0/500
用AI去监控AI应用,这做法挺有趣的,有点「套娃」的味道。不过这类服务确实有需求,现在模型输出的稳定性确实是个痛点,尤其是对企业级应用来说。我们团队之前试过几个大模型API,偶尔抽风起来真的让人头疼,有个监测工具至少能提前预警吧。😅
This article on Composo is pretty eye-opening! It's wild how AI apps can be so powerful yet so unpredictable. Startups tackling LLM performance issues is a smart move—businesses need that reliability. Curious to see how this tech evolves! 😎
This article on Composo is pretty cool! It's wild how AI apps can be so powerful yet so unpredictable. Nice to see startups tackling the performance monitoring side—hope it makes LLMs more reliable for businesses! 😎
This article on Composo is super insightful! It’s wild how LLMs are so powerful yet so unpredictable. Excited to see startups tackling this to make AI apps more reliable! 😎
This article on Composo is pretty eye-opening! It's wild how AI apps can be so powerful yet so unpredictable. I wonder how startups like this will tackle the chaos of LLMs in real-world use. 🤔 Anyone else curious about the future of AI monitoring?

AI和大型語言模型(LLMs)極具潛力,但說實話,它們有時表現得不太穩定。沒人能確定何時能完全解決所有問題,因此不意外地,新創公司正紛紛投入,協助企業確保其LLM驅動的應用程式能如預期運作。
這就是Composo,一家位於倫敦的新創公司,自認在解決這個問題上具有優勢。他們開發了客製化模型,幫助企業檢查其LLM應用程式的準確性和品質是否達標。
Composo並非此領域的唯一玩家;他們的競爭對手包括Agenta、Freeplay、Humanloop和LangSmith,這些公司都在嘗試提供更好的、基於LLM的應用程式測試方式,取代依賴人工、檢查清單或傳統工具。但Composo表示自己與眾不同,因為它提供了無程式碼選項和API。這意味著更多人可以使用它,不僅限於開發者——領域專家和高階主管也能自行檢查不一致性、品質和準確性。
其運作方式如下:Composo將一個根據人們對AI應用程式期望訓練的獎勵模型,與該應用程式的特定標準結合,然後評分該應用程式的輸出與這些標準的符合程度。例如,若你有一個醫療分診聊天機器人,可以設定客製化的指導方針來監控危急症狀,Composo會告訴你該應用程式遵循這些規則的程度。
他們剛剛推出了Composo Align的公開API,這個API能根據你設定的任何標準來評估LLM應用程式。
這似乎正在產生回報——他們的客戶名單上有Accenture、Palantir和McKinsey等大牌公司,且最近獲得了200萬美元的Pre-seed資金。這在AI世界中,資金通常充裕的環境下可能不算多,但Composo的共同創辦人兼CEO Sebastian Fox表示,他們不需要鉅額資金。「至少在未來三年,我們不預見自己需要募資數億,因為許多人在打造基礎模型,並且做得非常有效率,這不是我們的獨特賣點,」曾在McKinsey擔任顧問的Fox說道。「相反地,每天早晨,若我醒來看到OpenAI在他們的模型上取得重大進展的新聞,這對我的生意是好事。」
有了這筆新資金,Composo計劃增強其工程團隊(由共同創辦人兼CTO、前Graphcore機器學習工程師Luke Markham領導),爭取更多客戶,並加速研發。「今年的重點更多在於將我們現在擁有的技術擴展到這些公司,」Fox說。
這輪種子融資由英國AI Pre-seed基金Twin Path Ventures領投,JVH Ventures和EWOR也參與其中。EWOR此前已通過其加速器計畫支持Composo。「Twin Path Ventures」的發言人表示:「Composo正在解決企業AI採用中的關鍵瓶頸。」
據Fox表示,這個瓶頸對整個AI領域、特別是對企業來說至關重要。「人們已經度過了興奮的炒作階段,現在開始思考,『嗯,實際上,這對我目前的業務真的有什麼改變嗎?因為固定,因為它不夠可靠,也不夠一致。即使它夠好,你也無法證明它有多好,』」他解釋道。
這可能使Composo對想使用AI但擔心風險的公司極具價值。因此,他們雖不限於特定產業,但仍專注於合規性、法律、醫療保健和安全領域。
談到他們的獨特之處,Fox表示他們的成果不易複製。「這涉及模型的架構以及我們用來訓練的資料,」他說,並指出Composo Align是在「大量專家評估資料集」上訓練的。
當然,科技巨頭可能會投入資源試圖解決這個問題,但Composo認為自己已領先一步。「另一個優勢是我們隨著時間累積的資料,」Fox談到他們如何建立評估偏好。
由於它能根據靈活的標準集評估應用程式,Composo也認為自己比那些方法較為僵化的競爭對手更能應對agentic AI的興起。「在我看來,我們絕對還沒到代理(agents)能良好運作的階段,而這正是我們試圖幫助解決的問題,」Fox說。
TechCrunch有一份專注於AI的電子報!請在此訂閱,每週三送達您的收件匣。
紐約州將對 5,000 萬個 AI 資料中心實施用電上限
紐約州的舉措展現了全球各國政府可能如何管理、課稅及規範人工智慧熱潮所帶來的實體足跡。圖片來源:Luca Bravo/Unsplash紐約州州長凱西·霍丘爾簽署了一項具有歷史意義的行政命令,暫停資料中心的建設,同時州政府官員正起草嚴格的環境影響規範人工智慧對基礎設施的需求,如今已與現有電力網的實體限制產生衝突。紐約州已成為美國首個正式暫停超大規模數據中心開發的州,對耗電量達50兆瓦或以上的新建數據中
史丹佛大學研究人員如何運用人工智慧設計出人工病毒
人工智慧領域的領導者們已指出,具備生物學能力的AI模型可能帶來的潛在風險。圖片來源:CDC/Unsplash美國研究人員利用人工智慧設計出首種針對大腸桿菌的合成病毒,而 Anthropic 執行長達里奧·阿莫迪(Dario Amodei)則對人工智慧引發的生物威脅表示擔憂。美國史丹佛大學的科學家利用人工智慧,設計出自然界中不存在的病毒。該團隊的研究基於「Evo 2」生成的基因組,這是一種旨在透過提
人工智慧如何加速中國的藥物研發進程
Insilico Medicine 執行長 Alex Zhavoronkov 表示,該公司透過在中國將人工智慧與實驗室研究相結合,已將生成藥物開發候選分子的時程縮短至約一年。據扎沃隆科夫表示,這家在香港上市的公司最先進的研發計畫僅用九個月便完成了候選藥物遴選,而通常需時13個月。這與傳統方法形成鮮明對比,後者通常需要約四年半才能達到同一里程碑。這些時程特別指早期發現與候選藥物篩選階段,而非完整的藥
用AI去监控AI应用,这做法挺有趣的,有点「套娃」的味道。不过这类服务确实有需求,现在模型输出的稳定性确实是个痛点,尤其是对企业级应用来说。我们团队之前试过几个大模型API,偶尔抽风起来真的让人头疼,有个监测工具至少能提前预警吧。😅
This article on Composo is pretty eye-opening! It's wild how AI apps can be so powerful yet so unpredictable. Startups tackling LLM performance issues is a smart move—businesses need that reliability. Curious to see how this tech evolves! 😎
This article on Composo is pretty cool! It's wild how AI apps can be so powerful yet so unpredictable. Nice to see startups tackling the performance monitoring side—hope it makes LLMs more reliable for businesses! 😎
This article on Composo is super insightful! It’s wild how LLMs are so powerful yet so unpredictable. Excited to see startups tackling this to make AI apps more reliable! 😎
This article on Composo is pretty eye-opening! It's wild how AI apps can be so powerful yet so unpredictable. I wonder how startups like this will tackle the chaos of LLMs in real-world use. 🤔 Anyone else curious about the future of AI monitoring?





首頁






