Gate News 訊息,4 月 27 日——Google DeepMind 的資深產品經理、以及 Google AI Studio 的產品負責人 Logan Kilpatrick 表示,在 X 上,每一家正在打造基於 AI 的產品的公司都應建立自己的自訂基準,用以衡量 AI 模型的效能。他將其描述為一種方法,使模型改進能夠「讓貴公司獲益不成比例」,並敦促創辦人與商業領袖「從明天開始。」
多數公司目前依賴公開排行榜來選擇 AI 模型,但這些排行榜衡量的是通用能力,往往與特定商業情境不匹配。Kilpatrick 以一家合約審閱公司為例,該公司最關注的是條款抽取的準確度——而這項能力在公開基準中並不存在,導致無法評估模型在該任務上的表現。自訂基準提供兩項關鍵優勢:第一,它們讓公司能夠針對各次模型更新,評估其在自身商業任務上的表現,並選擇在其實際使用情境中表現最佳的模型,而非整體排名最高的模型;第二,它們讓公司能夠與模型供應商分享這些測試集,從而在與公司業務息息相關的領域推動持續最佳化。
Kilpatrick 指出,像 Zapier 和 Sierra 這樣的公司已在採用這種做法,他表示:「這裡可以創造出很多 alpha。」
Related News