
Smallest.ai 是一家成立於 2024 年底的新創公司,已完成 1,300 萬美元的 A 輪融資,目標是打造語音 AI 系統,讓自動化電話對話不再像機器人互動,而更像真人交流。TechCrunch 報導指出,此輪融資由 Seligman Ventures 領投,Sierra Ventures 與 3one4 Capital 參與,使公司總募資額超過 2,100 萬美元。
這個提案之所以值得注意,是因為它與生成式 AI 的一個主流假設背道而馳:更好的對話系統主要來自於把大型語言模型做大。根據 TechCrunch,Smallest.ai 反而是在打造更小、專門化的即時對話語音模型,主張電話型 AI 必須同時聆聽、思考並說話,而不是等完整提示詞輸入完才生成回應。若這種做法能在實際產品中成立,對快速成長的企業 AI領域可能很重要:面向客戶的語音系統中,即使只有短暫延遲,也會讓互動顯得機械化。
根據 TechCrunch,Smallest.ai 的核心論點是:傳統 LLM 的行為會為即時對話帶來過多延遲。在文字聊天中,使用者會容忍模型處理提示詞並回覆時的一段停頓;但在電話通話中,同樣的停頓會立刻打斷對話節奏。
執行長 Sudarshan Kamath 告訴 TechCrunch,公司正在設計模型,使其更像人類在對話中的表現:持續處理語音,並在對方仍在說話時就準備回應。公司將此描述為一層即時智慧,專門處理狹義的對話任務,尤其是類似客服的交流。
SiliconANGLE 的報導將這種設計描述為「非同步語音 AI 架構」,大致上與 TechCrunch 的說法一致,不過原始提供文本中並沒有更完整的技術細節。根據 TechCrunch 的報導,實際概念是由較小模型負責快速來回對話,而較大型系統只在談話超出小模型範圍時才介入。
這種接力模式是新創策略的核心。TechCrunch 報導指出,如果 Smallest.ai 的語音系統遇到超出其有限知識庫的問題,它會把查詢轉交給更大型的基礎模型,並短暫讓來電者進入保留狀態以取得答案。Kamath 將此比喻為人類客服在回答前先查資料,而不是即興亂答。
這筆募資發生在投資人仍在尋找應用層 AI 公司、且其變現路徑比廣泛的基礎模型建構者更清楚的時點。語音 AI 已成為特別活躍的類別,因為它涉及客服中心、銷售、預約、催收與其他明顯有自動化預算的商業功能。
Smallest.ai 以比一些最知名語音新創更窄的焦點進入這個市場。TechCrunch 報導指出,公司專注於供企業使用的即時對話代理,而不是像配音或 Podcast 製作這類相鄰的語音媒體用途。
這個區別很重要。合成旁白工具與來電客服的性能需求截然不同。在企業電話系統中,低延遲、處理插話的能力、對口音的穩健性,以及在雜訊環境中的表現,往往比純粹自然的聲音品質更關鍵。TechCrunch 表示,Smallest.ai 正聚焦於這些語音特有問題,包括多樣口音、數十種語言支援,以及在吵雜環境中的運作。
對投資人而言,這種聚焦具有吸引力,因為它鎖定了能量化商業成果的使用情境。購買語音自動化的企業通常不太在乎新奇與否,更在乎系統能否縮短處理時間、避免轉接、提高結案率並維持客戶滿意度。Smallest.ai 在所提供的報導中尚未公開這類生產指標,但市場邏輯很清楚:如果它的低延遲優勢屬實,那就可能成為對抗更大通用系統的有效突破口。
TechCrunch 報導指出,Smallest.ai 的客戶已包括 RingCentral 與 Truecaller,兩者都是通訊與語音相關產品中的知名品牌。該報導並未說明這些合作的範圍、部署規模,或這些公司是在正式生產、試點,還是作為基礎設施元件使用 Smallest.ai。這限制了僅憑客戶名單能得出的推論,但這些名字至少顯示,新創公司已獲得理解語音工作流程的企業早期驗證。
Kamath 也對 TechCrunch 表示,潛在客戶包括 Sierra 與 Decagon 這類客服軟體公司。報導中轉述他的觀點是:如果客戶服務平台會因此分心於主產品,它們可能不想自行打造專用語音堆疊。
這種定位使 Smallest.ai 與堆疊中的多個層次競爭。TechCrunch 將 ElevenLabs 視為語音 AI 領導者,並將 Cartesia 與 Sarvam 列為競爭者或相鄰玩家。這些公司各有不同優勢:ElevenLabs 與合成語音品質以及廣大的開發者心智占有率高度相關;Cartesia 推動低延遲語音基礎設施;Sarvam 則與區域語言能力相關。Smallest.ai 看起來不是要做最廣泛的語音平台,而是要成為即時企業通話的最佳選擇。
公司也實際上在與大型平台的內部自研方案競爭。使用 RingCentral 風格通訊軟體的企業,或在自家堆疊上建立 AI 通話流程的企業,最終都得決定是購買專用語音層、由多家供應商拼裝,還是依賴越來越多模態化的通用模型。
來源材料中最確定的事實,是這筆融資本身、參與投資人、公司創立時間,以及被提及的客戶名稱。這些細節來自 TechCrunch 對本輪融資的報導,而 SiliconANGLE 則另外報導了募資,並以類似措辭描述公司的架構。
幾項更大膽的主張,仍屬於新創公司的自我敘事,而非獨立驗證的結果。最值得注意的是,Kamath 告訴 TechCrunch,公司希望模型在電話通話中能「打破圖靈測試」,讓使用者分不出對方是 AI 還是人類。這是一種願景,而不是已被證實的指標。
同樣地,TechCrunch 所描述的「幾乎零回應延遲」應被視為產品宣稱,而非公開量測結果。提供的來源並未包含延遲數據、字詞錯誤率、插話恢復數值、多語言基準結果,或與 ElevenLabs、Cartesia 及其他語音 AI 系統的逐項比較。
客戶引用也需要謹慎看待。雖然 RingCentral 與 Truecaller 被列為客戶,但來源沒有提供合約金額、使用量、續約資料或直接客戶證言。對企業買家與開發者而言,真正的考驗還在後頭:Smallest.ai 能否從有前景的 demo 與早期整合,走向可長期維運的大規模部署。
對開發者而言,Smallest.ai 的策略強化了 AI 代理設計的更大趨勢:不是每次互動都應該從頭到尾由大型通用模型處理。在延遲敏感的應用中,多層式系統可能更實用,由小而快的模型負責互動管理,較大型模型則保留給複雜推理。
這個想法可能影響團隊如何為電話客服、互動式語音應答替代方案、外撥銷售電話,以及產業專用助理設計 AI 代理。關鍵取捨在於速度與廣度。狹窄模型在特定領域中可能更自然,但在該領域外更容易失敗,並需要優雅的升級處理。Smallest.ai 那種「讓來電者暫停並查詢更大型模型」的模式,是一種可能解法,但也帶來協調、可靠性與客戶體驗上的複雜度。
對企業 AI 買家而言,這個故事與其說是新奇,不如說是採購標準。承諾人聲通話的供應商仍必須回答標準營運問題:它多常錯誤插話、對口音的表現如何、在嘈雜環境下如何運作、失敗時的備援規則是什麼,以及自動撥打時在揭露與同意方面的治理機制為何。所提供的報導顯示 Smallest.ai 強調了其中幾項技術痛點,但尚未給出公開證據。
對像 Sierra 與 Decagon 這類客服平台而言,也有策略面意義。如果專門化的語音層發展迅速,一些軟體供應商可能寧願整合外部語音基礎設施,而不是自建專有語音系統。但如果多模態基礎模型縮小了延遲差距,獨立語音專家的生存空間可能就會縮小。
圍繞 Smallest.ai 的下一批訊號,很可能是營運面而非融資面。其一是 RingCentral 或 Truecaller,或其他被點名的合作夥伴,是否會公開描述具體使用情境或可衡量成果。
其二是技術揭露。如果 Smallest.ai 想與 ElevenLabs、Cartesia 和 Sarvam 拉開差異,未來可能需要更清楚地公布延遲、插話處理、多語言品質,以及真實客服環境下的表現證據。
第三個議題是產品範疇。若企業仍然重視專用語音系統勝過端到端 LLM 堆疊,則該公司的現有案例最有力。任何大型模型供應商朝更低延遲、可直接用於通話的語音互動前進的動作,都可能加劇這種壓力。
最後,值得觀察市場對「像人」的 AI 通話有多大容忍度。隨著系統變得越來越難與真人區分,法律、合規與信任問題將在企業 AI 部署中變得更重要,特別是在受監管的客服與外撥通話情境中。
Smallest.ai 正在對當前 AI 堆疊中的一個真實弱點下賭注:語音對話對延遲的懲罰遠比聊天更嚴苛。新創公司強調小型專用模型,以及選擇性地交棒給大型系統,符合 AI 產品設計中日益普遍的現實:協調編排往往與原始模型能力同樣重要。
但這個類別也非常嚴苛。企業語音買家不只需要一個令人信服的 demo,還需要在口音、插話、領域邊界與合規邊緣案例下都可靠運作。Smallest.ai 的募資顯示投資人相信,這個問題值得用專用基礎設施來解決。更難的問題是:在大型平台與既有語音廠商吸收同樣教訓之前,這家公司能否把自己的架構主張轉化成可重現的生產級表現。
Smallest.ai 已募得 1,300 萬美元,打造用於企業通話的低延遲語音 AI,押注小型專用模型能讓代理聽起來更像人。