AI News

總部位於倫敦的 AI 新創公司 Inherent 表示,其新代理 Faraday 在獨立重現已發表科學論文的研究結果方面,表現優於 Anthropic 與 OpenAI 的更大型系統。這項主張標誌著該公司自從以 5,000 萬美元種子輪融資結束低調運作後的首次公開展示,也為其打造能夠促進科學發現的 AI 系統之雄心提供了早期測試。

這項比較之所以引人注目,是因為 Inherent 表示 Faraday 運行在 Qwen 3.6 上,該模型擁有 270 億個參數。這家新創公司拿它與 Anthropic 的 Claude Opus 4.8 以及 OpenAI 的 GPT-5.5 進行比較,Inherent 將後兩者描述為大得多的前沿模型。不過,這些效能結果是公司經由 TechCrunch 報導所提出,現有證據並不包含公開的基準測試方法或獨立驗證。

Faraday 聚焦研究複現

Faraday 的設計目標是在事先未獲知預期答案的情況下,重現科學論文中的結果。Inherent 共同創辦人兼首席科學家 Edward Hughes 告訴 TechCrunch,論文複現是人類科學家(包括博士生)常見的早期標準練習。

該新創公司表示,他們評估的不只是代理是否能得出正確結果,也希望 Faraday 展現 Hughes 所稱的「research taste」:識別值得做的實驗,並對如何執行這些實驗做出合理判斷的能力。

這種區別對研究導向的 AI 很重要。遵循固定流程的系統可以驗證既有結果,但有用的科學協作者必須判斷哪些問題值得花時間、哪些變數值得測試,以及何時證據已足夠支撐結論。Inherent 的長期目標是一個 AI 科學家代理,能跨越不同科學領域運作,而不是只受限於單一基準或學科的工具。

更小的模型與不同的訓練賭注

Inherent 將 Faraday 的報告結果部分歸因於強化學習的使用。公司表示,它不是主要依賴關於科學家如何進行研究的訓練資料,而是對能達成有用結果的代理給予獎勵。這種方法旨在幫助系統建立更廣泛的決策直覺,包括新創公司所稱的 research taste 相關判斷力。

這個選擇也反映出刻意的產品策略。Inherent 並未為 Faraday 開發專用的程式編寫工具。根據公司說法,該代理在程式工作上使用 OpenAI 的 GPT-5.5 Codex,類似人類研究者依賴既有軟體,而不是自行打造每一個工具。

這種架構對於打造科學與技術代理的團隊可能很重要。最強大的系統未必是一個單一龐大的單體模型;它也可能是一個較小的推理模型,連接專門工具、程式系統、實驗環境與評估迴圈。Faraday 的報告比較並不能證明這種方法在整體上更優,但它提供了 Inherent 正在探索的權衡之具體例子。

證據令人鼓舞,但仍然有限

核心效能主張來自 Inherent,並由 TechCrunch 報導。可取得的資料並未說明測試了多少篇論文、涵蓋哪些科學領域、評分標準為何、人類監督程度,以及 Anthropic 與 OpenAI 系統是否在相同的工具與運算條件下執行。

在比較研究代理時,這些細節至關重要。論文複現的難度可能因是否有原始碼、資料集、實驗流程與運算資源而大不相同。結果也可能取決於如何提示代理、如何處理失敗的實驗,以及評審只看最終答案,還是也評估實驗過程的品質。

不過,使用 270 億參數模型仍然是一個重要的供應商報告信號。若能被獨立複現,這個結果將顯示,模型大小本身並不是長時間科學工作流程表現的可靠代理指標。它也可能意味著,在這項特定任務中,強化學習與工具編排的貢獻與基礎模型規模同樣重要。

Inherent 的說法刻意比排行榜結果更宏觀。Hughes 告訴 TechCrunch,對公司而言,比起擊敗前沿系統,Faraday 是如何被打造出來的更重要。他將這個預期中的代理描述為一位協作者,能帶回意料之外的實驗與結果,而不是只產出為了取悅使用者而設計的答案。

這項主張對 AI 建構者與企業意味著什麼

對 AI 開發者而言,Faraday 突顯了一個日益重要的設計問題:代理應該優化對話品質、基準準確度,還是多步驟決策與學習能力?科學研究會揭露在較短工作流程中較容易被掩蓋的弱點,包括實驗選擇不佳、規劃脆弱、未經驗證的假設,以及傾向報告自信但缺乏支撐的結論。

更小的模型或許能降低研究代理的部署成本,尤其當工作流程需要大量實驗或反覆呼叫模型時。但模型較小並不必然代表總成本較低。工具使用、程式執行、失敗執行、資料存取、人工審查與基礎設施,可能主導一個運作數小時或數天的代理的經濟性。

因此,企業買家應將 Faraday 視為早期訊號,而不是研究人員的現成替代品。實際問題將是系統是否能產出可重現的工作、揭露其假設、保留稽核軌跡,以及在證據不足時知道自己不足。這些要求適用於藥物研發、材料研究、工程與內部研發團隊,因為可驗證的結果比吸引人的結果更有價值。

Inherent 的招募計畫也讓這項產品置身於競爭激烈的高階 AI 人才市場。根據 TechCrunch 報導,該公司在倫敦有約十多名員工到場工作,並計畫在年底前擴編至約 20 到 25 人。Hughes 也批評了英國的 garden leave 限制,稱這些規定影響了他從前一份職位轉換的能力。

接下來要觀察什麼

最重要的後續發展,將是 Faraday 與 Claude Opus 4.8 及 GPT-5.5 之間可獨立重現的評估。若 Inherent 公布論文清單、提示詞、工具設定、算力預算、失敗率與評分流程,將有助於強化其主張。

研究人員與產品團隊也應關注超越複現的證據。Inherent 表示其北極星是一個 AI 科學家代理,但目前的公開展示只涉及重現既有研究。下一個有意義的測試,應是 Faraday 是否能提出新假說、設計出專家認為有價值的實驗,並產出能通過外部審查的發現。

其他值得注意的訊號包括系統的錯誤處理行為、它對 GPT-5.5 Codex 的依賴程度,以及 Inherent 是否會向外部使用者或評估者開放存取。倫敦的招募成長可能代表信心與動能,但人數並不能證明代理的科學能力可以泛化。

Creati.ai 觀點

Inherent 的公告之所以有趣,是因為它把焦點從原始模型規模轉向建立長時間運作的研究工作流程。較小的基礎模型結合強化學習、程式工具與實驗回饋,可能比等待所有能力都出現在單一前沿模型中,更像是一條通往專門化 AI 代理的務實道路。

不過,這項主張仍應被視為開端結果,而非對 Anthropic 或 OpenAI 已經確立的領先優勢。對建構者而言,真正的問題是 Faraday 報告中的優勢能否通過透明評估,並從論文複現轉移到可靠的科學工作。這些證據將決定 Inherent 是展示了可持續的方法,還是在狹窄任務上取得了一個強勁結果。

精選

Inherent 表示其 Faraday AI 代理在研究複現上擊敗 Anthropic 與 OpenAI

Inherent 表示其 Faraday AI 代理在論文複現上擊敗了更大型的 Anthropic 與 OpenAI 系統,突顯較小模型與研究導向代理的潛力。