NVIDIAがリアルタイムのフルデュプレックス音声向けにNemotronLabs VoiceChat 11Bを公開したと報じられる
NVIDIAのNemotronLabs VoiceChat 11Bは、オープンでリアルタイムの音声エージェントを狙っていると報じられているが、ソースの証拠が限られているため、ベンチマークや導入の詳細は未確認のままだ。
NVIDIAのNemotronLabs VoiceChat 11Bは、オープンでリアルタイムの音声エージェントを狙っていると報じられているが、ソースの証拠が限られているため、ベンチマークや導入の詳細は未確認のままだ。
OpenAIは、継続的な会話向けに設計された低遅延の音声システムGPT-Liveを公表し、開発者にリアルタイムAI対話への新しいアプローチを提示した。
Smallest.aiは、企業向け通話の低遅延音声AIを構築するため1,300万ドルを調達し、小型の特化モデルならエージェントを人間らしく聞かせられると賭けている。
OpenAIは、信頼性が高くポリシー管理された導入を目的とした、企業向け音声・チャットエージェントのためのマネージドプラットフォーム「Presence」を発表した。
Current AIは、支援が行き届いていないコミュニティ向けに、オフライン言語ツール、助成金、オープンソースのチャットボットを備えた公共利益向けAIスタックを拡大している。
OpenAIはChatGPT向けにGPT-Live音声モデルを導入し、フルデュプレックス音声がAIアシスタントをライブ業務でより有用にすると賭けている。
Interfaze は、音声AIの新たな道として拡散デコードを試す、6言語対応のオープンソース ASR モデル diffusion-gemma-asr-small を公開した。
Google は、70以上の言語に対応する、ほぼリアルタイムの音声間翻訳を行うAIモデル Gemini 3.5 Live Translate を公開した。
音声AIに関する最新ニュースと分析