Dictation API by AssemblyAI
ストックにはログインが必要です
1行のAPI呼び出しで、高速かつ正確な音声入力を追加
Artificial Intelligence
Developer Tools
API
概要
- 音声を単なる逐語録ではなく、フィラーや言いよどみを除いた、送信・利用可能な完成テキストへ変換するAPIです。
- メモ、コードのコミットメッセージ、顧客返信など、プロンプトで指定した用途や形式に合わせて出力を整えられます。
主な特徴
- Universal-3.5 Proを採用し、19言語に対応。短い音声クリップは高速に処理され、ベンチマークではp50が134ミリ秒、1秒未満を実現しています。
- 1回のAPI呼び出しで、文字起こし、訂正、どもりや「えー」「あのー」などの不要語の除去まで完了します。
- 従来の逐語文字起こしと完成テキストを比較できるライブデモを用意し、応答時間もAPIレスポンスに含めて確認できます。
活用に向いているプロダクト
- メモアプリ、臨床ツール、コーディングエージェント、予約フローなど、音声入力を組み込みたいプロダクトチームに適しています。
- 話した内容をそのまま表示するのではなく、自然で簡潔な文章として即座に利用したい業務システムやワークフローに向いています。
- 実際に使いながら試したい場合は、キーを押して話すだけでカーソル位置に完成テキストを入力できる、無料のオープンソースmacOSアプリ「Blurt」も利用できます。
投票数: 57