NVIDIA據報發布NemotronLabs VoiceChat 11B,用於即時全雙工語音
NVIDIA據報的NemotronLabs VoiceChat 11B鎖定開放、即時的語音代理,但有限的來源證據使基準與部署細節仍未獲確認。
NVIDIA據報的NemotronLabs VoiceChat 11B鎖定開放、即時的語音代理,但有限的來源證據使基準與部署細節仍未獲確認。
OpenAI 已說明 GPT-Live——一套為連續對話設計的低延遲語音系統,為開發者提供即時 AI 互動的新方法。
Smallest.ai 已募得 1,300 萬美元,打造用於企業通話的低延遲語音 AI,押注小型專用模型能讓代理聽起來更像人。
Encore AI 已完成 3,000 萬美元 A 輪募資,打造以客戶通話訓練的語音與文字代理,押注於特定工作流程的企業 AI。
Cars24指出,搭載OpenAI的語音與聊天代理現在每月處理超過100萬分鐘,顯示企業AI正進入核心客戶工作流程。
一則 Trend Hunter 內容聚焦 AI 語音代理平台,突顯了對自動化來電工具的需求,即使產品細節仍不明朗。
Gradium 在 Nvidia 支持下將種子輪擴大至 1 億美元,為進軍灣區提供資金;隨著語音 AI 競爭升溫,這一步備受關注。
OpenAI 為 ChatGPT 推出 GPT-Live 語音模型,押注全雙工語音能讓 AI 助理在即時工作中更實用。
各家公司正競相利用 AI 自動化催收電話,這也引發了消費者、金融公司和監管機構的新問題。
TechCrunch 報導,AI 根據頻譜圖資料重建了駕駛艙音訊,促使 NTSB 重新檢視公開的調查檔案。
AI 語音新創公司 Vapi 在 Amazon 選擇其平台來處理 Ring 客戶來電後,成功募得 5,000 萬美元的 B 輪融資。
TechCrunch 報導稱,像 Wispr 這樣的 AI 聽寫和語音運算工具,可能會改變辦公室禮儀與工作安排。
OpenAI 為即時語音應用推出了 GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper。
Microsoft推出三個專有AI模型,分別針對轉錄、語音合成與影像生成,直接挑戰OpenAI和Google。
Google 已發布 Gemini 3.1 Flash Live,這是迄今品質最高的即時音訊與語音模型,具有延遲降低、情感語氣辨識改進,以及對所有 AI 生成音訊強制加入 SynthID 水印的要求。Search Live 同步擴展至 200 多個國家。
ElevenLabs 與 IBM 宣布合作,將 ElevenLabs 的文字轉語音與語音轉文字技術整合到 IBM watsonx Orchestrate,使企業能夠部署支援 70 種語言、自然且多語言的語音 AI 代理人。
語音 AI 新創公司 ElevenLabs 在 Sequoia 領投的 D 輪中將估值推升三倍至 110 億美元,並在為上市做準備時,達到每年經常性收入(ARR)3.3 億美元。
語音 AI 領導者 ElevenLabs 獲得由 Sequoia Capital 領投的 $500M D 輪融資,估值達 $11B,並因企業採用達成 $330M 的 ARR。
語音 AI 新創 ElevenLabs 在企業採用激增下完成 5 億美元的 D 輪融資,估值達 110 億美元,市值在一年內增至三倍。
語音 AI 基礎設施提供商 LiveKit 獲得了 1 億美元的新資金,估值達到 10 億美元。該公司為 OpenAI 的 ChatGPT 語音功能提供支持,並正在擴展其即時語音和視訊解決方案。
語音AI 的最新新聞與分析