文字起こしと音声入力の境界
このカテゴリの中心は、人が話した内容を認識してテキストまたは操作意図に変えることです。音声の内容を記録する文字起こし、入力欄への dictation、字幕作成、キーワード検出、音声コマンドは対象になります。一方、文章を声にする音声合成、声を作る voice cloning、会話だけを行うチャットボットは別物です。掲載中のPearlは知的な言語処理、nunu AIは日常作業を助ける仮想アシスタント、Shobanaは生産性とデータ分析を扱うAIエージェントと説明されていますが、音声認識の記載はありません。
話者分離・字幕・タイムスタンプ
録音を議事録にしたいのか、動画用字幕にしたいのか、検索可能な発言記録を作りたいのかで、必要な出力は変わります。話者ごとのラベル、発話時刻、単語単位のタイムスタンプ、句読点、キーワードの拾い方を確認しましょう。ライブ配信や通話では遅延と途中修正、バッチ処理では長時間音声の扱いが判断材料になります。掲載製品の説明には、話者分離、字幕、タイムスタンプ、録音の文字起こしを明記したものはないため、これらを当然に備えると考えず、デモや仕様書で確かめる必要があります。
音声形式と出力ファイル
選定時は、マイクからのストリームに対応するのか、保存済み音声をアップロードするのかを分けて見ます。入力側では音声形式、チャンネル数、録音時間、音質、言語や方言の範囲を確認し、出力側ではテキスト、字幕ファイル、タイムスタンプ付きデータ、話者情報をどの形式で取り出せるかを確認します。長さ、解像度、同時接続数、月間クォータに制約がある場合もありますが、掲載製品の説明には具体的な対応形式や上限は示されていません。実務では、保管先や編集ソフトへ渡せるかまで試すと判断しやすくなります。
API連携と料金・利用枠
開発者がアプリへ組み込むなら、音声認識APIの有無、ストリーミングか一括処理か、認証方法、結果を受け取る形式、エラー時の再送方法を確認します。業務利用では、分単位・文字量・リクエスト数の課金、無料枠、保存期間、同時利用の制限も比較対象です。完成した画面を使うサービスなら、書き出し、共有、既存の会議・営業・字幕ワークフローとの接続を見ます。Agora Conversational AI EngineはAIを使う音声・ビデオ通信を説明していますが、ASR APIや料金は記載されていません。
営業ボットと音声命令の適合性
営業窓口で話しかけた内容を意図として受け取りたい人、通話後に記録を残したいチーム、字幕や検索用テキストを作る担当者では、必要な製品の形が異なります。CloseBot.aiは営業問い合わせと顧客対応の自動化、GrowthBotは会話して見込み客を選別するチャットボットと説明されていますが、音声入力や文字起こしが中核とは示されていません。Lettaはメール返信、ShowAndTell AIはプレゼンテーション作成、DentalGeniusは歯科の診断・治療計画支援、Aurora InnovationとSelf-Parking Car Evolutionは自動運転・駐車に関する説明です。用途が音声認識なら、声を受け取って何を返すか、文字列をどの業務へ渡せるかを個別に確認してください。