NVIDIAがリアルタイムのフルデュプレックス音声向けにNemotronLabs VoiceChat 11Bを公開したと報じられる
NVIDIAのNemotronLabs VoiceChat 11Bは、オープンでリアルタイムの音声エージェントを狙っていると報じられているが、ソースの証拠が限られているため、ベンチマークや導入の詳細は未確認のままだ。
NVIDIAのNemotronLabs VoiceChat 11Bは、オープンでリアルタイムの音声エージェントを狙っていると報じられているが、ソースの証拠が限られているため、ベンチマークや導入の詳細は未確認のままだ。
OpenAIは、継続的な会話向けに設計された低遅延の音声システムGPT-Liveを公表し、開発者にリアルタイムAI対話への新しいアプローチを提示した。
Smallest.aiは、企業向け通話の低遅延音声AIを構築するため1,300万ドルを調達し、小型の特化モデルならエージェントを人間らしく聞かせられると賭けている。
Encore AIは、顧客通話を学習した音声・テキストエージェントを構築するために3,000万ドルのシリーズAを調達した。ワークフロー特化型の企業向けAIへの賭けだ。
Cars24は、OpenAI搭載の音声・チャットエージェントが月間100万分超を処理していると述べ、エンタープライズAIが中核的な顧客業務に入りつつあることを示している。
Trend Hunter の記事が AI 音声エージェント・プラットフォームにスポットライトを当て、製品詳細が不明瞭なままでも自動通話ツールへの需要を浮き彫りにしている。
GradiumはNvidiaの支援を受けてシード調達を1億ドルに拡大し、音声AI競争が激化する中でベイエリアへの進出資金を確保した。
OpenAIはChatGPT向けにGPT-Live音声モデルを導入し、フルデュプレックス音声がAIアシスタントをライブ業務でより有用にすると賭けている。
企業はAIを使って債務回収の電話を自動化しようと競い合っており、消費者、金融会社、規制当局に新たな疑問を投げかけている。
TechCrunchは、AIがスペクトログラムデータからコックピットの音声を再構成し、NTSBが公開されている調査ファイルを見直すきっかけになったと報じた。
AI音声スタートアップのVapiは、AmazonがRingの顧客対応通話を処理するために同社のプラットフォームを採用した後、5,000万ドルのシリーズB調達を実施した。
TechCrunchは、WisprのようなAIの音声入力および音声コンピューティングツールが、オフィスの作法や働き方を変える可能性があると報じている。
OpenAIは、ライブ音声アプリ向けにGPT-Realtime-2、GPT-Realtime-Translate、GPT-Realtime-Whisperを導入しました。
Microsoftは、文字起こし、音声合成、画像生成を対象とした3つの独自AIモデルを公開し、OpenAIとGoogleに直接挑戦する。
GoogleはGemini 3.1 Flash Liveを公開しました。これはこれまでで最も高品質なリアルタイム音声・音響モデルであり、レイテンシーの低減、感情トーン認識の向上、そして生成されたすべてのAI音声に対するSynthID透かしの必須化を特徴とします。Search Liveは同時に200か国以上に拡大します。
ElevenLabsとIBMは、ElevenLabsのテキスト読み上げ(Text-to-Speech)および音声認識(Speech-to-Text)技術をIBM watsonx Orchestrateに統合する協業を発表しました。これにより、企業は70言語で自然な多言語対応の音声AIエージェントを展開できるようになります。
音声AIスタートアップのElevenLabsは、Sequoia主導のシリーズDで評価額を3倍の110億ドルに引き上げ、IPO準備の中で年間ARRが3.3億ドルに達した。
音声AIのリーダーであるElevenLabsは、Sequoia Capitalが主導する$500MのシリーズD資金を確保し、企業導入により$330MのARRを達成して$11Bの評価に到達しました。
音声AIスタートアップのElevenLabsは、企業導入が急増する中、110億ドルの評価額でシリーズDとして5億ドルの資金を確保し、1年で評価額を3倍にしました。
音声AIインフラプロバイダーのLiveKitは1億ドルの新規資金調達を確保し、評価額が10億ドルに達しました。 同社はOpenAIのChatGPTの音声機能を支え、リアルタイムの音声およびビデオソリューションを拡大しています。
音声AIに関する最新ニュースと分析